当前位置:首页 > SEO网站 > 正文内容

网站禁止垃圾蜘蛛访问抓取教程说明

admin4年前 (2023-02-21)SEO网站409

很多国外商业蜘蛛实际对网站没有什么价值,尤其国内网站的SEO优化运营更是用不上,但是如果不屏蔽就会对网站造成很大的性能宽带消耗,引起SEO优化负面影响,所以可以根据自己的需要去处理。

nginx服务端禁止Scrapy等工具的抓取

if ($http_user_agent ~* (Scrapy|Curl|HttpClient)) {

return 403;

}

nginx服务端禁止非GET|HEAD|POST方式的抓取

if ($request_method !~ ^(GET|HEAD|POST)$) {

return 403;

}

nginx服务端禁止指定蜘蛛抓取

if ($http_user_agent ~ "MegaIndex|MegaIndex.ru|BLEXBot|Qwantify|qwantify|semrush|Semrush|serpstatbot|hubspot|python|Bytespider|Go-http-client|Java|PhantomJS|SemrushBot|Scrapy|Webdup|AcoonBot|AhrefsBot|Ezooms|EdisterBot|EC2LinkFinder|jikespider|Purebot|MJ12bot|WangIDSpider|WBSearchBot|Wotbox|xbfMozilla|Yottaa|YandexBot|Jorgee|SWEBot|spbot|TurnitinBot-Agent|mail.RU|perl|Python|Wget|Xenu|ZmEu|^$" )

{

return 444;

}

IIS服务端

ignoreCase="true" />

IIS6请在isapi重写组件中添加规则

#Block spider

RewriteCond %{HTTP_USER_AGENT} (MegaIndex|MegaIndex.ru|BLEXBot|Qwantify|qwantify|semrush|Semrush|serpstatbot|hubspot|python|Bytespider|Go-http-client|Java|PhantomJS|SemrushBot|Scrapy|Webdup|AcoonBot|AhrefsBot|Ezooms|EdisterBot|EC2LinkFinder|jikespider|Purebot|MJ12bot|WangIDSpider|WBSearchBot|Wotbox|xbfMozilla|Yottaa|YandexBot|Jorgee|SWEBot|spbot|TurnitinBot-Agent|mail.RU|perl|Python|Wget|Xenu|ZmEu|^$) [NC]

RewriteRule !(^/robots.txt$) - [F]

apache服务端

RewriteEngine On

#Block spider

RewriteCond %{HTTP_USER_AGENT} "MegaIndex|MegaIndex.ru|BLEXBot|Qwantify|qwantify|semrush|Semrush|serpstatbot|hubspot|python|Bytespider|Go-http-client|Java|PhantomJS|SemrushBot|Scrapy|Webdup|AcoonBot|AhrefsBot|Ezooms|EdisterBot|EC2LinkFinder|jikespider|Purebot|MJ12bot|WangIDSpider|WBSearchBot|Wotbox|xbfMozilla|Yottaa|YandexBot|Jorgee|SWEBot|spbot|TurnitinBot-Agent|mail.RU|perl|Python|Wget|Xenu|ZmEu|^$" [NC]

RewriteRule !(^robots\.txt$) - [F]

通过robots.txt禁止

对于遵循robots协议的蜘蛛,可以直接在robots禁止。上面常见的无用蜘蛛禁止方法如下,将下面的内容加入到网站根目录下面的robots.txt就可以了。常见的一些屏蔽恶意蜘蛛代码如下,也可以根据自己需要进行增减。

User-agent: SemrushBot

Disallow: /

User-agent: DotBot

Disallow: /

User-agent: MegaIndex.ru

Disallow: /

User-agent: MauiBot

Disallow: /

User-agent: AhrefsBot

Disallow: /

User-agent: MJ12bot

Disallow: /

User-agent: BLEXBot

Disallow: /

常见的网络恶意垃圾爬虫蜘蛛

上面说的搜索引擎爬虫能给网站带来流量,也有许多爬虫除了增加服务器负担,对网站没任何好处,应该屏蔽掉。

1、MJ12Bot

MJ12Bot 是英国著名SEO公司Majestic的网络爬虫,其抓取网页给需要做SEO的人用,不会给网站带来流量。

2、AhrefsBot

AhrefsBot 是知名SEO公司Ahrefs的网页爬虫。其同样抓取网页给SEO专业人士用,不会给网站带来流量。

3、SEMrushBot

SEMrushBot 也是SEO、营销公司的网络爬虫。

4、DotBot

DotBot 是 Moz.com 的网页爬虫,抓取数据用来支持 Moz tools 等工具。

5、MauiBot

MauiBot 不同于其他爬虫,这个爬虫连网站都没有,UA只显示一个邮箱:”MauiBot (crawler.feedback+wc@gm ail.com)“。神奇的是这个看起来是个人爬虫,竟然遵循robots协议,算得上垃圾爬虫的一股清流。

6、MegaIndex.ru

这是一个提供反向链接查询的网站的蜘蛛,因此它爬网站主要是分析链接,并没有什么作用。遵循robots协议。

7、BLEXBot

这个是webmeup下面的蜘蛛,作用是收集网站上面的链接,对我们来说并没有用处。遵循robots协议。

SEO结束语:以上来源收集汇总,请根据自己实际需要进行准确设置。

警惕垃圾蜘蛛影响网站SEO收录排名

扫描二维码推送至手机访问。

版权声明:本文由老苏SEO转载并发布,如侵权可联系删除。

本文链接:https://www.laosuseo.com/?id=7339

分享给朋友:

“网站禁止垃圾蜘蛛访问抓取教程说明” 的相关文章

造成网站跳出率过高的因素有哪些

造成网站跳出率过高的因素有哪些

相信大家在做网站的时候都不喜欢自己的网站跳出率比较高,跳出率是对衡量用户对网站内容的认可程度或者说是网站是否对用户有吸引力的可靠评价标准。也就是说,跳出率也可以直接反映网站内容的价值程度。今天笔者就跟大家分享一下造成网站跳出率过高的因素有哪些?希望对大家有所帮助。第一、网站服务器不稳定,网站打开速度...

网站SEO优化中常见标签有哪些?

网站SEO优化中常见标签有哪些?

每个SEO从业者都需要掌握一定的WEB前端代码,为之后的网页设计、UI合作等打好基础。下面是SEO常用标签●TDK标签TDK对每个seoer来说都是熟悉的不能再熟悉的html标签了.TDK分别表示Title、Keywords和Description三大最常见的优化标签。Title页面标题,keywo...

网站标签如何进行seo优化

网站标签如何进行seo优化

在网站标签优化过程中,主要分为现场优化和非现场优化两部分。 具体的优化内容可以分为网站TDK选择与部署,关键词密度控制,网站结构是否简单合理,目录层次是否过于复杂等诸多方面,这些因素不容忽视,任何一个方面的问题都可能导致网站的整体不稳定,那么网站优化更重要的是代码中的标签优化,关于网站标签优化,你知...

如何实现新网站百度快照天天更新

如何实现新网站百度快照天天更新

我们在做完网站后需要发布网站,对于每个站长来说,每一个新站都要经历一段艰苦难熬的日子,比如说百度不收录,PR值一直没有更新,关键词的排名也一直上不去,百度快照一直不更新等。今天笔者就主要说说新站百度快照更新的问题,随着搜索引擎的不断升级调整,新网站的快照更新的频度不高,新站长更是心急不知所措。今天就...

seo排名优化公司价格

seo排名优化公司价格

想了解更多详情点击头像咨询企业网站搜索引擎优化优化究竟该怎样做?首先咱们先考虑SEO究竟从哪几个方面下手。其实在做网站的时分,已经做过最根底的SEO作业,比方META标签的编辑,这是一项最根底也是非常重要的SEO作业。在上传产品、上传文档的时分,就会把这些关键词SEO布局做到位。★ 网站SEO的布局...

如何让我们更新的网站文章快速收录

如何让我们更新的网站文章快速收录

我们在做网站运营的时候经常会遇到文章写了质量也不错,就是久久不收录,这个问题一直让各位站长们头痛。今天笔者就跟大家分享一下如何让我们更新的网站文章快速收录,希望对大家有用。第一:我们要知道发布的文章为什么不被收录?我们发布的网站文章不被收录的大致原因有以下几种:1、关键词堆积,一篇文章为了提高关键词...