Cookie の使用について.本サイトでは、基本機能の提供に必要な必須 Cookie を使用しています。さらに、同意いただいた場合に限り、アクセス解析 Cookie を利用して利用状況を把握し、サービス改善に役立てます。詳しくは .
このツールが役に立ったら、開発者にコーヒーを奢ってください ☕
通过 PTR 反向解析、正向 DNS 回验和公开 IP 网段,判断访问日志中的 IPv4 或 IPv6 是否能验证为已知搜索引擎爬虫。
ログの送信元 IP を入力すると、検証チェーン全体を確認できます
服务器日志里出现 66.249.66.1 并带有 Googlebot User-Agent,只能说明请求方自称 Googlebot,不能直接证明它来自 Google。页面检查日志中的来源 IPv4 或 IPv6,并分别展示域名解析与公开网段证据,适合排查爬虫真伪、异常抓取和 WAF 误拦截。
应填写实际连接服务器的来源 IP,不是 User-Agent、域名或 URL。若同一地址连续请求大量页面,可先核对身份,再回到日志查看频率、路径、响应码和 robots.txt 遵守情况。
第一组是 PTR 反向查询。系统查找 IP 对应的主机名,并判断是否以支持的搜索引擎域名结尾。当前识别 Google、Bing、百度和 Yandex,例如 googlebot.com 与 search.msn.com。
第二组是正向 DNS 回验。系统把识别出的主机名再次解析成 IP,确认结果包含原地址。PTR 名称可能配置错误或用于伪装,只有解析回原地址,才形成较完整的双向 DNS 证据链。
第三组是公开 IP 网段。服务器读取 Google common crawlers、Bingbot 和 DuckDuckBot 当前可取得的地址列表并进行匹配。百度和 Yandex 未接入公开网段,主要依靠域名后缀与正向回验。
66.249.66.1,IPv6 使用完整或标准压缩格式。示例 IP 仅用于熟悉操作。正式排查应复制事故时间段内的真实日志地址。
示例一:核对疑似 Googlebot。把日志中的 66.249.66.1 填入输入框。若该地址命中成功加载的 Google common crawlers 网段,页面会显示“已验证”,并在公开网段卡片中标出 Google 来源;若 PTR 同时返回 googlebot.com 主机名且正向解析包含原 IP,两条证据会相互印证。DNS 与公开列表会变化,所以应以实际查询结果为准,不要把示例文字当作永久白名单。
示例二:核对普通公共 DNS 地址。输入 8.8.8.8 时,它可能有 Google 相关的网络归属或主机名,但这不代表它属于 Google common crawlers。页面若没有命中爬虫网段,也没有形成受支持的双向 DNS 证据,就会给出“未验证”。这个对照说明“属于某家公司”和“属于该公司的搜索爬虫”是两个不同结论。
可疑结果示例:某个 PTR 名称以 googlebot.com 结尾,但正向解析没有返回原 IP,页面会标记为“可疑”。此时不应因为名称像 Googlebot 就放行,也不要立刻断言请求恶意;先保存证据并检查 DNS、ASN、访问行为和持续时间。
| 结论 | 页面依据 | 下一步 |
|---|---|---|
| 已验证 | 命中已加载的公开网段,或受支持的爬虫域名正向解析回原 IP | 结合访问行为决定放行或调整限速,不代表所有请求都安全 |
| 可疑 | PTR 名称像搜索爬虫但回验失败,或网段与域名证据指向不同服务商 | 保留日志,复查 DNS 和请求路径,不按名称直接加入白名单 |
| 未验证 | 没有命中已支持网段,也没有有效双向 DNS 证据 | 确认上游列表是否可用,再按行为设置限速、挑战或 WAF 规则 |
“已验证”表示当前至少有一条身份验证链成立,不代表爬虫一定遵守抓取规则;“未验证”也不是恶意判决,可能来自未覆盖的搜索引擎、企业爬虫、监控服务、DNS 超时或公开列表暂时不可用。
站点接入 Cloudflare、阿里云 CDN、负载均衡或自建反向代理后,Web 服务器日志里最靠近连接层的地址可能是代理节点。如果把代理节点 IP 拿来查询,得到的结论与真实访客无关。应先确认平台传递访客地址的请求头,并只信任来自已配置代理节点的头部,不能无条件采用客户端自行提交的 X-Forwarded-For。
一条转发链可能包含多个地址,通常需要按服务器的可信代理配置选取正确位置,而不是随意复制第一个或最后一个。IPv6 地址还可能被方括号包围并附带端口,提交前应剥离这些连接信息。日志缺少可靠来源 IP 时,任何爬虫身份查询都无法弥补采集阶段的问题。
对于持续消耗带宽、探测敏感路径或无视 robots.txt 的请求,即使身份已经验证,也可以采用合理的缓存、限速和资源保护策略。安全策略应基于行为与业务风险,而不是把搜索引擎名称当作无限制通行证。
为什么同一个 IP 再查一次会出现不同结果? DNS 记录、搜索引擎公开网段和网络连通性都可能变化。某次查询发生超时,也会导致证据卡暂时缺失,因此应记录查询时间并在必要时复核。
能检测所有搜索引擎蜘蛛吗? 不能。公开网段目前覆盖 Google common crawlers、Bingbot 和 DuckDuckBot,域名回验还识别百度与 Yandex 的已知后缀。其他搜索引擎、SEO 工具和自建爬虫可能显示未验证。
Baiduspider 为什么没有官方 IP 网段命中? 当前实现没有加载百度公开网段,百度相关判断依靠 PTR 主机名与正向 DNS 回验。页面会如实展示证据,不会把缺失的网段能力包装成已支持。
未验证的地址应该立即封禁吗? 先排除代理日志取值错误、DNS 超时和上游列表不可用,再观察请求频率与路径。对高风险行为可以先限速或挑战,是否永久封禁应依据持续证据。
可以批量提交整份日志吗? 当前页面一次验证一个 IPv4 或 IPv6,不支持粘贴整份日志。需要批量审计时,应先在日志系统中去重、限速并保留时间范围,再使用经过授权的内部流程。
现在可以回到上方输入框,用访问日志中的一个真实来源 IP 完成验证,并按三张证据卡保存核对结果。