GEO 技术检测

AI 爬虫
抓取验证工具

模拟国内外主流 AI 爬虫访问你的网站,检查真实响应、robots.txt 与 Meta robots 设置。

✓ 国内外爬虫✓ 真实 HTTP 状态✓ Markdown 报告

检查 AI 爬虫是否能访问

17 项 检测

GenieWiki 会使用不同公开 User-Agent 发送有限请求;仅支持公开网页,禁止内网地址与特殊端口,每小时最多检测 3 次。

同时覆盖海外与国内 AI 生态

01

海外主流

OpenAI、Claude、Perplexity、Google、Bing 与 Common Crawl。

02

国内主流

Kimi、百度,以及标注为实验性的字节、DeepSeek、通义、智谱和 MiniMax UA。

03

多层判断

综合真实响应、robots.txt、Meta robots 与 X-Robots-Tag,不只看单一规则。

为什么要检查 AI 爬虫访问?

内容写得再好,如果服务器、robots.txt 或页面指令阻止抓取,搜索引擎和部分 AI 系统也可能无法获取。抓取检测是内容优化之前的基础排查。

01

发现服务器拦截

用不同公开 User-Agent 请求页面,检查是否出现 401、403、429 或 5xx 等异常响应。

02

核对 robots.txt

识别针对特定爬虫或通配 User-Agent 的 Allow 与 Disallow 规则,找到可能的配置冲突。

03

检查页面级指令

读取 Meta robots 与 X-Robots-Tag,判断页面是否声明 noindex、nofollow 或其他限制。

04

覆盖国内外生态

同时检查海外主流抓取器与国内常见、实验性 User-Agent,形成统一排查清单。

四种状态分别意味着什么?

可访问

该次模拟请求获得正常响应

通常表示服务器没有按这个 User-Agent 拒绝请求,但不代表对应厂商一定会收录、训练或引用页面。

继续检查 robots.txt、Meta robots 与内容质量
被拦截

服务器明确拒绝了访问

常见原因包括防火墙规则、Bot 管理、CDN 安全策略、限流或站点需要登录。

结合状态码和服务器日志定位原因
请求异常

检测期间未能取得有效响应

可能由超时、DNS、TLS、重定向异常或目标服务器暂时不可用导致,不应直接判断为永久封禁。

稍后重试,并在本地或服务器侧交叉检查
仅规则

只检查 robots.txt 中的控制标记

例如 Google-Extended 是用于控制部分生成式 AI 使用的 robots.txt 产品令牌,并不是普通网页抓取 User-Agent。

因此不会用它发送模拟页面请求

不要只看一个绿色状态

“能请求到页面”和“允许被索引或用于 AI 产品”是不同问题。判断时需要结合多个层级,而不是把单次测试当作最终结论。

01

HTTP 响应

先确认网页可达、状态码正常,并留意不同 User-Agent 是否获得不同响应。

02

抓取规则

查看 robots.txt 对特定爬虫和通配规则的允许、禁止及路径匹配。

03

索引指令

检查 Meta robots 和 X-Robots-Tag,但要注意不同机器人是否遵守这些指令。

检测到问题后该怎么处理?

  1. 确认

    先核对目标 URL

    确保检测的是公开正式页面,而不是登录页、预览地址、后台或已经失效的链接。

  2. 定位

    根据状态码缩小范围

    403 常见于安全拦截,429 多与限流有关,5xx 则需要查看服务器或函数运行日志。

  3. 核对

    检查 robots.txt 的具体规则

    同时查看特定 User-Agent 与星号通配规则,避免只修改一条却仍被更广泛的规则覆盖。

  4. 复测

    修改配置后再次验证

    等待 CDN 与 DNS 缓存更新,然后重新检测,并用服务器日志确认真实请求行为。

“可访问”不等于“必然被引用”

某 AI Bot 返回 200,robots.txt 显示允许,Meta robots 未限制。

技术层 当前模拟请求可达内容层 仍需清晰、可信、可核验结果层 收录与引用由平台决定

关于 AI 爬虫抓取检测

检测显示可访问,是否代表一定会被 AI 引用?

不代表。可访问只说明该次模拟请求获得了正常响应;平台是否抓取、索引、训练或引用,还取决于其政策、内容质量和其他信号。

为什么 User-Agent 可以模拟?

User-Agent 只是请求头中的字符串,任何客户端都可以填写。因此本工具检测的是网站针对该字符串的响应,不能证明请求来自对应 AI 厂商。

检测会伤害目标网站吗?

工具仅对用户确认拥有或获授权的网站发送有限次数请求,并限制频率、响应大小、跳转次数、端口和内网地址,降低滥用风险。

robots.txt 返回 404 是不是错误?

通常表示站点没有提供 robots.txt。它不等于禁止所有爬虫,但建议网站明确配置规则,方便表达抓取偏好。

Google-Extended 为什么显示“仅规则”?

Google-Extended 是 robots.txt 产品令牌,用于控制部分生成式 AI 使用场景,不是用于普通网页请求的 HTTP User-Agent,所以只做规则匹配。

国内 AI 爬虫为什么有“非官方”标记?

部分名称来自公开日志或社区观察,尚缺少稳定的厂商官方文档。工具将其标为实验性,便于排查但不把它们描述为官方确认。

为什么同一网站不同时间结果可能不同?

CDN、WAF、限流、服务器负载、DNS、缓存和临时网络状态都会影响响应。重要结论应多次验证并结合服务器日志。

检测前为什么必须确认网站授权?

工具会代表你向目标网站发送多次请求。只检测自己拥有或明确获准的网站,可以避免对无关站点造成不必要访问。