GEO 知识库 / 词条
官网对 AI 友好吗?一份 AI 可抓取性自查清单
GEO 的一切前提是:AI 先能读到你、读懂你。很多官网不是内容不行,而是在技术层就把 AI 挡在了门外。以下清单分三组共 12 项,可以逐项自查。
可抓取:让 AI 进得来
- robots.txt 显式允许 AI 爬虫(Bytespider、GPTBot、ClaudeBot、PerplexityBot 等)——默认全允许就写明。
- 正文是静态 HTML,禁用 JavaScript 后内容仍完整(AI 爬虫多数不执行 JS)。
- 有 sitemap.xml,URL 干净、规范化统一。
- 服务器对爬虫访问不设歧视性门槛(验证码、风控拦截)。
可理解:让 AI 读得懂
- 每页一个 H1,直答该页主题;H2 小节自包含——AI 抽取的是”内容块”,不是整页。
- 定价、指标、平台支持等事实用表格呈现,AI 引用表格的比例显著更高。
- 品牌实体命名一致:首次出现用全称,之后统一称谓,别在多种叫法间随机切换。
- 关键页面带 JSON-LD 结构化数据(Organization、FAQPage、TechArticle 等)。
可信任:让 AI 敢引用
- 联系方式、备案信息、公司主体真实可查。
- 数据与结论注明出处与日期,页面带明确的更新时间(AI 偏好新鲜且可验证的内容)。
- 不堆砌关键词、不拼凑同质页面——低质信号会被模型降权。
- 全网实体信息一致:官网、百科、公众号对品牌的一句话定位一字不差。
这份清单是 问潮(AnswerTide) 官网体检模块 22 项检查的简化版(问潮官网本身也按此清单实施)。体检完全遵守 robots.txt 并要求验证站点所有权,五组加权评分帮你定位短板在哪一组。
想知道你的品牌此刻在五家 AI 平台上的提及率、排名与信源?申请免费诊断报告,1 个工作日内人工交付。