如果這個工具幫到了你,可以請作者喝杯咖啡 ☕
透過 PTR 反向解析、正向 DNS 回驗和公開 IP 網段,判斷訪問日誌中的 IPv4 或 IPv6 是否能驗證為已知搜索引擎爬蟲。
輸入日誌中的來源 IP,查看完整驗證鏈
伺服器日誌裡出現 66.249.66.1 並帶有 Googlebot User-Agent,只能說明請求方自稱 Googlebot,不能直接證明它來自 Google。頁面檢查日誌中的來源 IPv4 或 IPv6,並分別展示域名解析與公開網段證據,適合排查爬蟲真偽、異常抓取和 WAF 誤攔截。
應填寫實際連線伺服器的來源 IP,不是 User-Agent、域名或 URL。若同一地址連續請求大量頁面,可先覈對身份,再回到日誌檢視頻率、路徑、響應碼和 robots.txt 遵守情況。
第一組是 PTR 反向查詢。系統查詢 IP 對應的主機名,並判斷是否以支援的搜索引擎域名結尾。當前識別 Google、Bing、百度和 Yandex,例如 googlebot.com 與 search.msn.com。
第二組是正向 DNS 回驗。系統把識別出的主機名再次解析成 IP,確認結果包含原地址。PTR 名稱可能配置錯誤或用於偽裝,只有解析回原地址,才形成較完整的雙向 DNS 證據鏈。
第三組是公開 IP 網段。伺服器讀取 Google common crawlers、Bingbot 和 DuckDuckBot 當前可取得的地址列表並進行匹配。百度和 Yandex 未接入公開網段,主要依靠域名字尾與正向回驗。
66.249.66.1,IPv6 使用完整或標準壓縮格式。示例 IP 僅用於熟悉操作。正式排查應複製事故時間段內的真實日誌地址。
示例一:覈對疑似 Googlebot。把日誌中的 66.249.66.1 填入輸入框。若該地址命中成功載入的 Google common crawlers 網段,頁面會顯示“已驗證”,並在公開網段卡片中標出 Google 來源;若 PTR 同時返回 googlebot.com 主機名且正向解析包含原 IP,兩條證據會相互印證。DNS 與公開列表會變化,所以應以實際查詢結果爲準,不要把示例文字當作永久白名單。
示例二:覈對普通公共 DNS 地址。輸入 8.8.8.8 時,它可能有 Google 相關的網路歸屬或主機名,但這不代表它屬於 Google common crawlers。頁面若沒有命中爬蟲網段,也沒有形成受支援的雙向 DNS 證據,就會給出“未驗證”。這個對照說明“屬於某家公司”和“屬於該公司的搜尋爬蟲”是兩個不同結論。
可疑結果示例:某個 PTR 名稱以 googlebot.com 結尾,但正向解析沒有返回原 IP,頁面會標記為“可疑”。此時不應因為名稱像 Googlebot 就放行,也不要立刻斷言請求惡意;先儲存證據並檢查 DNS、ASN、訪問行為和持續時間。
| 結論 | 頁面依據 | 下一步 |
|---|---|---|
| 已驗證 | 命中已載入的公開網段,或受支援的爬蟲域名正向解析回原 IP | 結合訪問行為決定放行或調整限速,不代表所有請求都安全 |
| 可疑 | PTR 名稱像搜尋爬蟲但回驗失敗,或網段與域名證據指向不同服務商 | 保留日誌,複查 DNS 和請求路徑,不按名稱直接加入白名單 |
| 未驗證 | 沒有命中已支援網段,也沒有有效雙向 DNS 證據 | 確認上游列表是否可用,再按行為設定限速、挑戰或 WAF 規則 |
“已驗證”表示當前至少有一條身份驗證鏈成立,不代表爬蟲一定遵守抓取規則;“未驗證”也不是惡意判決,可能來自未覆蓋的搜索引擎、企業爬蟲、監控服務、DNS 超時或公開列表暫時不可用。
站點接入 Cloudflare、阿里雲 CDN、負載均衡或自建反向代理後,Web 伺服器日誌裡最靠近連線層的地址可能是代理節點。如果把代理節點 IP 拿來查詢,得到的結論與真實訪客無關。應先確認平臺傳遞訪客地址的請求頭,並只信任來自已配置代理節點的頭部,不能無條件採用客戶端自行提交的 X-Forwarded-For。
一條轉發鏈可能包含多個地址,通常需要按伺服器的可信代理配置選取正確位置,而不是隨意複製第一個或最後一個。IPv6 地址還可能被方括號包圍並附帶埠,提交前應剝離這些連線資訊。日誌缺少可靠來源 IP 時,任何爬蟲身份查詢都無法彌補採集階段的問題。
對於持續消耗頻寬、探測敏感路徑或無視 robots.txt 的請求,即使身份已經驗證,也可以採用合理的快取、限速和資源保護策略。安全策略應基於行為與業務風險,而不是把搜索引擎名稱當作無限制通行證。
為什麼同一個 IP 再查一次會出現不同結果? DNS 記錄、搜索引擎公開網段和網路連通性都可能變化。某次查詢發生超時,也會導致證據卡暫時缺失,因此應記錄查詢時間並在必要時複覈。
能檢測所有搜索引擎蜘蛛嗎? 不能。公開網段目前覆蓋 Google common crawlers、Bingbot 和 DuckDuckBot,域名回驗還識別百度與 Yandex 的已知字尾。其他搜索引擎、SEO 工具和自建爬蟲可能顯示未驗證。
Baiduspider 為什麼沒有官方 IP 網段命中? 當前實現沒有載入百度公開網段,百度相關判斷依靠 PTR 主機名與正向 DNS 回驗。頁面會如實展示證據,不會把缺失的網段能力包裝成已支援。
未驗證的地址應該立即封禁嗎? 先排除代理日誌取值錯誤、DNS 超時和上游列表不可用,再觀察請求頻率與路徑。對高風險行為可以先限速或挑戰,是否永久封禁應依據持續證據。
可以批次提交整份日誌嗎? 當前頁面一次驗證一個 IPv4 或 IPv6,不支援貼上整份日誌。需要批次審計時,應先在日誌系統中去重、限速並保留時間範圍,再使用經過授權的內部流程。
現在可以回到上方輸入框,用訪問日誌中的一個真實來源 IP 完成驗證,並按三張證據卡儲存覈對結果。