免费,在 WordPress.org 上
AumCrawl
AumCrawl 是一个免费的 WordPress 插件,回答一个大多数站长答不上来的问题:ChatGPT 到底有没有在读我的站。它记录每一个到访的已知爬虫,包括 AI、搜索引擎、SEO 工具和链接预览,记下它什么时候来、读了哪几页,然后让你把那些只拿内容、从不送回访客的挡在门外。
它做什么
- 记录每一个到访的已知爬虫:谁来的、什么时候、读了哪些页面。
- 把 AI 爬虫分成两类:会送访客回来的(OAI-SearchBot、PerplexityBot、Claude-SearchBot、Google-Extended)和不会的(GPTBot、ClaudeBot、CCBot、Bytespider,以及做外链的 SEO 爬虫)。开关就放在证据旁边。
- 用各家自己公布的反向 DNS 核实来访者是不是它自称的那个。谁都能发一个写着 GPTBot 的 User-Agent。全程不存 IP 地址。
- 把规则追加进 robots.txt,而不是把这个文件接管过去;如果实际在写这个文件的是 Yoast、Rank Math 或 All in One SEO,它会告诉你。
- 直说每种手段有多强:在门口挡掉是真的挡;robots.txt 里的规则只是一个请求;noai 响应头很弱,但不花钱所以放着。
谁该用它
内容本身就是产品的站:产品目录、知识库、写了好几年的博客。它最该在你做任何决定之前装上,因为大多数人是在不知道到底来过哪些机器人的情况下争论要不要拦 AI。
运行要求
- WordPress
- 5.5+
- PHP
- 7.4+
- 版本
- 1.0.1
常见问题
- 它会把 Google 也拦掉吗?
- 不会,而且是故意的:Googlebot、Bingbot,还有 Facebook、X、LinkedIn 那几个做链接预览的爬虫,插件里根本没有开关。关掉其中任何一个都是实打实的损失,不该藏在一个手一滑就能点到的按钮后面。它们照样被记录,所以你能看到 Google 上次是什么时候来的。
- 拦截真的有用吗?
- 对会表明身份的爬虫有用,页面根本不会发给它。robots.txt 里的规则,插件里列出的那些运营方会遵守,而任何决定不遵守的东西就是不遵守。插件把这两件事分开标注,而不是含混地当成一回事。
- 会跟我的 SEO 插件打架吗?
- 不会。robots.txt 本来就挤,所以它是追加而不是替换。如果别的插件已经给某个爬虫写了规则,它会让开并告诉你,而不是再写一条互相矛盾的。
- 它会生成 llms.txt 吗?
- 不会,那是另一件事。AumViso 做这件事,别的插件也有做的。
需要插件做不到的那一部分?
这些是通用到可以做完一次、交出去的那部分。当需求已经不再是一个插件的时候,那就是我们接的定制开发。