海外主流
OpenAI、Claude、Perplexity、Google、Bing 与 Common Crawl。
GenieWiki
模拟国内外主流 AI 爬虫访问你的网站,检查真实响应、robots.txt 与 Meta robots 设置。
输入网站 URL
通常需要 10~30 秒,请不要重复提交
检测完成
| AI Bot | 地区 / 厂商 | 访问状态 | 状态码 | 响应 | robots.txt | Meta robots |
|---|
本工具只能证明“以该 User-Agent 从 GenieWiki 服务器访问时”的响应。User-Agent 可以伪造,不能证明请求来自对应厂商;部分用户触发型抓取器也可能不遵循 robots.txt。非官方 UA 仅供排查,不代表厂商确认。
检测范围
OpenAI、Claude、Perplexity、Google、Bing 与 Common Crawl。
Kimi、百度,以及标注为实验性的字节、DeepSeek、通义、智谱和 MiniMax UA。
综合真实响应、robots.txt、Meta robots 与 X-Robots-Tag,不只看单一规则。
GEO 的技术入口
内容写得再好,如果服务器、robots.txt 或页面指令阻止抓取,搜索引擎和部分 AI 系统也可能无法获取。抓取检测是内容优化之前的基础排查。
用不同公开 User-Agent 请求页面,检查是否出现 401、403、429 或 5xx 等异常响应。
识别针对特定爬虫或通配 User-Agent 的 Allow 与 Disallow 规则,找到可能的配置冲突。
读取 Meta robots 与 X-Robots-Tag,判断页面是否声明 noindex、nofollow 或其他限制。
同时检查海外主流抓取器与国内常见、实验性 User-Agent,形成统一排查清单。
结果解读
通常表示服务器没有按这个 User-Agent 拒绝请求,但不代表对应厂商一定会收录、训练或引用页面。
继续检查 robots.txt、Meta robots 与内容质量常见原因包括防火墙规则、Bot 管理、CDN 安全策略、限流或站点需要登录。
结合状态码和服务器日志定位原因可能由超时、DNS、TLS、重定向异常或目标服务器暂时不可用导致,不应直接判断为永久封禁。
稍后重试,并在本地或服务器侧交叉检查例如 Google-Extended 是用于控制部分生成式 AI 使用的 robots.txt 产品令牌,并不是普通网页抓取 User-Agent。
因此不会用它发送模拟页面请求检测层级
“能请求到页面”和“允许被索引或用于 AI 产品”是不同问题。判断时需要结合多个层级,而不是把单次测试当作最终结论。
先确认网页可达、状态码正常,并留意不同 User-Agent 是否获得不同响应。
查看 robots.txt 对特定爬虫和通配规则的允许、禁止及路径匹配。
检查 Meta robots 和 X-Robots-Tag,但要注意不同机器人是否遵守这些指令。
排查流程
确保检测的是公开正式页面,而不是登录页、预览地址、后台或已经失效的链接。
403 常见于安全拦截,429 多与限流有关,5xx 则需要查看服务器或函数运行日志。
同时查看特定 User-Agent 与星号通配规则,避免只修改一条却仍被更广泛的规则覆盖。
等待 CDN 与 DNS 缓存更新,然后重新检测,并用服务器日志确认真实请求行为。
结果示例
某 AI Bot 返回 200,robots.txt 显示允许,Meta robots 未限制。
常见问题
不代表。可访问只说明该次模拟请求获得了正常响应;平台是否抓取、索引、训练或引用,还取决于其政策、内容质量和其他信号。
User-Agent 只是请求头中的字符串,任何客户端都可以填写。因此本工具检测的是网站针对该字符串的响应,不能证明请求来自对应 AI 厂商。
工具仅对用户确认拥有或获授权的网站发送有限次数请求,并限制频率、响应大小、跳转次数、端口和内网地址,降低滥用风险。
通常表示站点没有提供 robots.txt。它不等于禁止所有爬虫,但建议网站明确配置规则,方便表达抓取偏好。
Google-Extended 是 robots.txt 产品令牌,用于控制部分生成式 AI 使用场景,不是用于普通网页请求的 HTTP User-Agent,所以只做规则匹配。
部分名称来自公开日志或社区观察,尚缺少稳定的厂商官方文档。工具将其标为实验性,便于排查但不把它们描述为官方确认。
CDN、WAF、限流、服务器负载、DNS、缓存和临时网络状态都会影响响应。重要结论应多次验证并结合服务器日志。
工具会代表你向目标网站发送多次请求。只检测自己拥有或明确获准的网站,可以避免对无关站点造成不必要访问。