WordPress网站日志出现大量爬虫会造成什么影响?

由于小站最近收录及流量没有上升反而下降了,于是找时间研究一下。然后通过日志分析发现多了很多爬虫在爬取网内容,但是这是爬虫却没有带来任何流量,仅获取网站的数据信息,然后能过分析转换成AI信息返回给用户,就是白漂了。

Nginx日志大量爬虫记录分析

个人认为:AI 爬虫不会正向提升百度 SEO、几乎不给真实流量、反而有多重负面伤害

1. 不会给网站增加有效流量、知名度

  • 和百度 / 谷歌正规爬虫有本质区别
    • 百度蜘蛛抓取你的文章,会在搜索页展示链接,用户点击直接进你网站,产生浏览、广告曝光、访客数据,是等价交换
  • 而日志里的 ClaudeBot、Amazonbot、PerplexityBot、DotBot 这类 AI 训练爬虫:
    • 抓取网站的原文拿去训练大模型,AI 回答用户问题时极少附带的网站链接
    • 行业实测数据:ClaudeBot 每爬 7 万页,才会给网站带回 1 个访客;GPTBot 抓取 1200 页才产生 1 次跳转,回流流量几乎可以忽略不计;
    • 不会带来真实用户、不会增加广告点击、不会提升网站曝光知名度。

2. 所谓 “AI 曝光” 对我的技术博客几乎无价值

国内用户主流使用百度、微信搜索,很少用 Claude、Perplexity、亚马逊 AI;就算内容被 AI 收录,国内用户也看不到,完全起不到宣传、引流作用。


所以直接屏蔽,不让它们爬取,难怪最近感觉有点卡,反应慢了。

1、robots.txt 直接屏蔽

# 屏蔽无用爬虫
User-agent: DotBot
Disallow: /

User-agent: Amazonbot
Disallow: /

User-agent: ClaudeBot
Disallow: /

User-agent: DataForSeoBot
Disallow: /

User-agent: PerplexityBot
Disallow: /

User-agent: MJ12bot
Disallow: / 

2、Nginx拒绝这些爬虫

加到的网站 server { … } 里面即可:


# 只屏蔽你出现过的无用爬虫
if ($http_user_agent ~* "(DotBot|Amazonbot|ClaudeBot|DataForSeoBot|PerplexityBot|MJ12bot)") {
    return 403;
}

就这一段,完事。

最后重新加载一下配置即可。

sudo nginx -s reload

具体还得观察一段时间 ,看看有没有效果,Nginx直接拒绝那肯定是没问题了,就不知道对正常的搜索引擎有没有影响。

本文首发于 58Linux技术博客,专注Ubuntu桌面使用、Linux服务器运维与网站搭建实战。

发表评论

粤ICP备10052831号 | © 2026 58Linux 技术笔记. All Rights Reserved. | 联系我们 | 关于本站
本站内容开放共享,仅供学习交流 | 专注 Ubuntu & Linux 实战教程
Built with GeneratePress