免費,在 WordPress.org 上
AumCrawl
AumCrawl 是一個免費的 WordPress 外掛,回答一個大多數站長答不出來的問題:ChatGPT 到底有沒有在讀我的網站。它記錄每一個到訪的已知爬蟲,包含 AI、搜尋引擎、SEO 工具與連結預覽,記下它什麼時候來、讀了哪幾頁,然後讓你把那些只拿內容、從不送回訪客的擋在門外。
它做什麼
- 記錄每一個到訪的已知爬蟲:誰來的、什麼時候、讀了哪些頁面。
- 把 AI 爬蟲分成兩類:會把訪客送回來的(OAI-SearchBot、PerplexityBot、Claude-SearchBot、Google-Extended)和不會的(GPTBot、ClaudeBot、CCBot、Bytespider,以及做外部連結的 SEO 爬蟲)。開關就放在證據旁邊。
- 用各家自己公布的反向 DNS 核實來訪者是不是它自稱的那個。任何人都能送出一個寫著 GPTBot 的 User-Agent。全程不儲存 IP 位址。
- 把規則附加進 robots.txt,而不是把這個檔案接管過去;如果實際在寫這個檔案的是 Yoast、Rank Math 或 All in One SEO,它會告訴你。
- 直說每一種手段有多強:在門口擋掉是真的擋;robots.txt 裡的規則只是一個請求;noai 標頭很弱,但不花錢所以留著。
誰該用它
內容本身就是產品的網站:產品型錄、知識庫、寫了好幾年的部落格。它最該在你做任何決定之前先裝上,因為大多數人是在不知道到底來過哪些機器人的情況下,爭論要不要擋 AI。
執行需求
- WordPress
- 5.5+
- PHP
- 7.4+
- 版本
- 1.0.1
常見問題
- 它會把 Google 也擋掉嗎?
- 不會,而且是刻意的:Googlebot、Bingbot,還有 Facebook、X、LinkedIn 那幾個做連結預覽的爬蟲,外掛裡根本沒有開關。關掉其中任何一個都是實實在在的損失,不該藏在一個手一滑就會按到的按鈕後面。它們照樣被記錄,所以你能看到 Google 上次是什麼時候來的。
- 擋下來真的有用嗎?
- 對會表明身分的爬蟲有用,頁面根本不會送出去。robots.txt 裡的規則,外掛列出的那些營運方會遵守,而任何決定不遵守的東西就是不遵守。外掛把這兩件事分開標示,而不是含混地當成同一回事。
- 會跟我的 SEO 外掛打架嗎?
- 不會。robots.txt 本來就擠,所以它是附加而不是取代。如果別的外掛已經替某個爬蟲寫了規則,它會讓開並告訴你,而不是再寫一條互相牴觸的。
- 它會產生 llms.txt 嗎?
- 不會,那是另一件事。AumViso 在做,其他外掛也有做的。
需要外掛做不到的那一部分?
這些是通用到可以做完一次、交出去的那部分。當需求已經不再是一個外掛的時候,那就是我們接的客製開發。