当前位置:首页 > SEO网站 > 正文内容

网站禁止垃圾蜘蛛访问抓取教程说明

admin4年前 (2023-02-21)SEO网站394

很多国外商业蜘蛛实际对网站没有什么价值,尤其国内网站的SEO优化运营更是用不上,但是如果不屏蔽就会对网站造成很大的性能宽带消耗,引起SEO优化负面影响,所以可以根据自己的需要去处理。

nginx服务端禁止Scrapy等工具的抓取

if ($http_user_agent ~* (Scrapy|Curl|HttpClient)) {

return 403;

}

nginx服务端禁止非GET|HEAD|POST方式的抓取

if ($request_method !~ ^(GET|HEAD|POST)$) {

return 403;

}

nginx服务端禁止指定蜘蛛抓取

if ($http_user_agent ~ "MegaIndex|MegaIndex.ru|BLEXBot|Qwantify|qwantify|semrush|Semrush|serpstatbot|hubspot|python|Bytespider|Go-http-client|Java|PhantomJS|SemrushBot|Scrapy|Webdup|AcoonBot|AhrefsBot|Ezooms|EdisterBot|EC2LinkFinder|jikespider|Purebot|MJ12bot|WangIDSpider|WBSearchBot|Wotbox|xbfMozilla|Yottaa|YandexBot|Jorgee|SWEBot|spbot|TurnitinBot-Agent|mail.RU|perl|Python|Wget|Xenu|ZmEu|^$" )

{

return 444;

}

IIS服务端

ignoreCase="true" />

IIS6请在isapi重写组件中添加规则

#Block spider

RewriteCond %{HTTP_USER_AGENT} (MegaIndex|MegaIndex.ru|BLEXBot|Qwantify|qwantify|semrush|Semrush|serpstatbot|hubspot|python|Bytespider|Go-http-client|Java|PhantomJS|SemrushBot|Scrapy|Webdup|AcoonBot|AhrefsBot|Ezooms|EdisterBot|EC2LinkFinder|jikespider|Purebot|MJ12bot|WangIDSpider|WBSearchBot|Wotbox|xbfMozilla|Yottaa|YandexBot|Jorgee|SWEBot|spbot|TurnitinBot-Agent|mail.RU|perl|Python|Wget|Xenu|ZmEu|^$) [NC]

RewriteRule !(^/robots.txt$) - [F]

apache服务端

RewriteEngine On

#Block spider

RewriteCond %{HTTP_USER_AGENT} "MegaIndex|MegaIndex.ru|BLEXBot|Qwantify|qwantify|semrush|Semrush|serpstatbot|hubspot|python|Bytespider|Go-http-client|Java|PhantomJS|SemrushBot|Scrapy|Webdup|AcoonBot|AhrefsBot|Ezooms|EdisterBot|EC2LinkFinder|jikespider|Purebot|MJ12bot|WangIDSpider|WBSearchBot|Wotbox|xbfMozilla|Yottaa|YandexBot|Jorgee|SWEBot|spbot|TurnitinBot-Agent|mail.RU|perl|Python|Wget|Xenu|ZmEu|^$" [NC]

RewriteRule !(^robots\.txt$) - [F]

通过robots.txt禁止

对于遵循robots协议的蜘蛛,可以直接在robots禁止。上面常见的无用蜘蛛禁止方法如下,将下面的内容加入到网站根目录下面的robots.txt就可以了。常见的一些屏蔽恶意蜘蛛代码如下,也可以根据自己需要进行增减。

User-agent: SemrushBot

Disallow: /

User-agent: DotBot

Disallow: /

User-agent: MegaIndex.ru

Disallow: /

User-agent: MauiBot

Disallow: /

User-agent: AhrefsBot

Disallow: /

User-agent: MJ12bot

Disallow: /

User-agent: BLEXBot

Disallow: /

常见的网络恶意垃圾爬虫蜘蛛

上面说的搜索引擎爬虫能给网站带来流量,也有许多爬虫除了增加服务器负担,对网站没任何好处,应该屏蔽掉。

1、MJ12Bot

MJ12Bot 是英国著名SEO公司Majestic的网络爬虫,其抓取网页给需要做SEO的人用,不会给网站带来流量。

2、AhrefsBot

AhrefsBot 是知名SEO公司Ahrefs的网页爬虫。其同样抓取网页给SEO专业人士用,不会给网站带来流量。

3、SEMrushBot

SEMrushBot 也是SEO、营销公司的网络爬虫。

4、DotBot

DotBot 是 Moz.com 的网页爬虫,抓取数据用来支持 Moz tools 等工具。

5、MauiBot

MauiBot 不同于其他爬虫,这个爬虫连网站都没有,UA只显示一个邮箱:”MauiBot (crawler.feedback+wc@gm ail.com)“。神奇的是这个看起来是个人爬虫,竟然遵循robots协议,算得上垃圾爬虫的一股清流。

6、MegaIndex.ru

这是一个提供反向链接查询的网站的蜘蛛,因此它爬网站主要是分析链接,并没有什么作用。遵循robots协议。

7、BLEXBot

这个是webmeup下面的蜘蛛,作用是收集网站上面的链接,对我们来说并没有用处。遵循robots协议。

SEO结束语:以上来源收集汇总,请根据自己实际需要进行准确设置。

警惕垃圾蜘蛛影响网站SEO收录排名

扫描二维码推送至手机访问。

版权声明:本文由老苏SEO转载并发布,如侵权可联系删除。

本文链接:https://www.laosuseo.com/?id=7339

分享给朋友:

“网站禁止垃圾蜘蛛访问抓取教程说明” 的相关文章

网站SEO优化中常见标签有哪些?

网站SEO优化中常见标签有哪些?

每个SEO从业者都需要掌握一定的WEB前端代码,为之后的网页设计、UI合作等打好基础。下面是SEO常用标签●TDK标签TDK对每个seoer来说都是熟悉的不能再熟悉的html标签了.TDK分别表示Title、Keywords和Description三大最常见的优化标签。Title页面标题,keywo...

seo网站优化中有哪些html标签需要优化?

seo网站优化中有哪些html标签需要优化?

作为一个网站搜索引擎优化者,你必须了解一些网站代码,这是网站优化的基本要素之一。那seo网站优化中有哪些html标签需要优化?seo网站优化中有哪些html标签需要优化?一、h标签h标签和搜索引擎的关系很友好,能告诉我搜索引擎这个页面的主题。 适当地在页面上添加h标签有助于优化SEO。但是,需要注意...

谷歌SEO:想提升排名,H标签你用对了吗?

谷歌SEO:想提升排名,H标签你用对了吗?

在我们写word文档的时候,通常会给文章设置一级标题、二级标题、三级标题......其实就和我们这篇文章的主角——H标签类似。H标签,全称heading标签,就是标题标签,在H标签有六位成员:、、、、、标题文字从大到小,搜索引擎赋予的权重也依次降低,所以在设置标签时一定要把最核心最重要的放在前面。全...

SEO具体是怎么操作的

SEO具体是怎么操作的

原标题:SEO具体是怎么操作的SEO具体怎么优化,提高网站排名 (SEO) 的五种方法遵循这些建议来改进您的搜索引擎优化 (SEO),并观察您的网站排名上升到搜索引擎结果的顶部。1.发布相关的权威内容优质、权威的内容是您搜索引擎排名的第一驱动力,没有什么可以替代优质内容——在进行SEO 营销时尤其如...

html代码怎样优化更利于SEO排名

html代码怎样优化更利于SEO排名

做优化不仅仅需要懂一些SEO知识,还要懂得一些基本的html代码知识,而且代码也是需要优化的,那么怎么操作才能更利于网站排名呢?一、title标题标签代码:通常以的形式出现,是对网站的综合性介绍展示,对网站品牌和内容的诠释。如下:这里是网站的标题二、keywordskeywords是关键词标签,主要...

标题设计,如何优化网页标题?

标题设计,如何优化网页标题?

标题是一个页面的灵魂,它告知搜索引擎,这个页面的主题是什么,同时,目前搜索引擎也在严格的审查网站每一个标题,如果你的页面标题出现堆积关键词的情况,系统可能就会给出相应的策略,甚至导致整站降权。因此,我们认为对于一个网站,标题设计很重要。那么,标题设计,如何优化网页标题?在这里我们将通过如下内容,进一...