本文 2,050 字 · 阅读约 6 分钟作者 Rita Tang
为什么 AI 读不懂您的网站
客人问 AI「维也纳有没有靠谱的中医推拿」,它给了几家,没有您。网站明明在线上,做得也不难看。五个最常见的原因,以及一份五分钟能跑完的自查。
客人在 ChatGPT 里问:维也纳哪里能做中式推拿(chinesische Massage Wien)。它给了几家,没有您。
您的网站在线上,做得也不难看,Google 上搜店名也找得到。问题出在哪?
AI 和搜索引擎要的东西不一样
Google 给的是十条链接。它可以把一个自己并没完全看懂的网页排在第七位——反正点不点由客人决定。
AI 给的是一个答案。它必须先读懂您,才敢提起您;而且它会去别处对一遍,确认这些信息靠得住。
所以门槛高了一档:不只是「被收录」,而是被读懂、并且能被交叉验证。
先排除一件事:爬虫进不进得来
后面五条讲的都是「内容读不读得懂」。但有一关在更上游:AI 的爬虫能不能访问到您的网站。
去读网页的不是 ChatGPT 本身,是几个专门的爬虫——ChatGPT 用 OAI-SearchBot 和 ChatGPT-User,Perplexity 用 PerplexityBot,Claude 用 Claude-SearchBot。它们被拦在门外,网站写得再好也等于零。
而这件事经常是被无意中拦住的。Cloudflare 这类服务有一个「阻止 AI 爬虫」的开关,打开之后一次拦掉一批。它不区分两件事:「把内容拿去训练模型」和「有人提问时来读一下」——而后者正是您需要的那一个。
我在两个真实站点上都见过:搜索引擎全部放行,AI 爬虫统一返 403。从外面完全看不出来,浏览器打开一切正常。
**这一层自己不好查。**要逐个 User-Agent 发请求,再和普通浏览器拿到的状态码对比;同时还要看 robots.txt 里有没有针对这些名字的 Disallow——服务器和 robots 是两层,都得查。这是我做免费诊断时一定会跑的一项。
内容层面五个最常见的原因
一、要紧的信息只在图片里
菜单是一张 JPG,价目表做成了海报,营业时间印在了一张漂亮的图上。
有个误解值得先说清:**模型本身早就能读图。**您把菜单截图贴进 ChatGPT,它读得一字不差。
问题不在模型,在送内容进去的那条管道。去抓您网站的爬虫——OAI-SearchBot、ClaudeBot、PerplexityBot——只取服务器返回的 HTML,不渲染页面、不跑 JavaScript、不截图。图片到它们那儿只剩一个 alt 属性,没写就什么都没有。
(Google 的 Gemini 和 Apple 的 Applebot 会渲染,所以不是一刀切。但 ChatGPT 这条最主要的路不渲染。)
所以结论一样,理由更准:不是「AI 瞎了」,是读您网站的那一批拿不到。
怎么知道自己是哪一种:在网页上用鼠标拖选价格或营业时间,按 Ctrl+C,粘到记事本里。粘得出来是文本,粘不出来就是图片。
这一条我在维也纳见得最多,而被放进图片的往往正是最要紧的两样——价格和营业时间。
二、没有一句话说清「您是谁、在哪、做什么」
AI 需要一句能整句搬走的定义。而大多数网站的首页写的是这个:
我们致力于为客户提供优质的服务与体验。
这句话没有主语、没有城市、没有业务,任何行业的任何公司都能用。AI 拿它没有办法。
换成这样就能用了:
XX 推拿是位于维也纳第七区的中医推拿馆,提供推拿、拔罐与艾灸,周一至周六营业。
不需要华丽,需要自带主语和事实。
三、各处的信息对不上
网站写周一休息,Google 商家资料写周日休息,Facebook 又是第三个版本。
AI 会交叉验证。对不上的时候,它更可能干脆不提您——不提总比提错安全。
这一条最容易被忽略,因为每一处单独看都没问题。
四、内容要靠 JavaScript 才出现
折叠起来的常见问题、点一下才加载的价目表、登录墙后面的内容。
这一条和第一条同源,但后果更隐蔽:Googlebot 会执行 JavaScript,而 OAI-SearchBot、ClaudeBot、PerplexityBot 不会。
所以会出现这种情况——您在 Google 上排得还不错,但 AI 就是不提您。因为 Google 看见的是浏览器渲染完的样子,AI 看见的是服务器最初返回的那份 HTML。两者可以差得很远。
怎么知道:在网页上点右键 →「查看网页源代码」,用 Ctrl+F 搜您的价格。**搜得到,AI 才看得到。**注意这和上面那个复制测试测的不是同一件事——浏览器里能选中的字,不一定在这份源代码里。
顺带说一句:折叠本身没问题——只要折起来的文字确实在最初那份 HTML 里。这是做法的差别,不是要不要折的差别。
五、只有社交主页,没有网站
平台不让抓,AI 就读不到。而且平台的规则随时会改,账号也可能被封。
社交主页是租来的地。它可以是入口,不能是地基。
五分钟自查
四步,不用装任何工具。每一步都写了做什么和结果怎么读。
第一步 · 复制测试
做什么 在您网站上用鼠标拖选价格、营业时间、地址,按 Ctrl+C,粘到记事本里。
怎么读 粘得出来 → 是文本,AI 拿得到。粘不出来 → 是图片,对 AI 等于没写。
第二步 · 查看源代码,搜两样
做什么 在网页上点右键 →「查看网页源代码」,然后用 Ctrl+F 搜两次:一次搜您的价格,一次搜 ld+json。
怎么读 搜得到价格 → AI 也看得到;搜不到 → 那段内容是 JavaScript 后来加上的,AI 看不见。
搜得到 ld+json → 您的网站给机器留了一份说明书;什么都没有 → 没留。
第三步 · 用德语问一遍
做什么 打开 ChatGPT 或 Gemini,用客人真会打的德语词问——Massage Wien、chinesisches Restaurant Wien。别用中文,也别带店名。
怎么读 看它提谁、怎么描述他们。您在不在里面、被怎么描述,就是您现在的位置。
为什么这两条限制很要紧:您的客人多数是本地人,他们搜的是德语;而带上店名去问,等于让 AI 照着名字念一遍,什么也证明不了。
第四步 · 三处对照
做什么 把网站、Google 商家资料、社交主页上的营业时间、地址、电话、服务名称摆在一起看。
怎么读 任何一处不一样,就是一个待修的地方。信息对不上时,AI 更可能干脆不提您。
跑完这四步,您大概就知道自己在哪一档了。
这不是玄学,但也不是开关
把这些修好,不等于 AI 明天就会推荐您。它意味着您从「读不到」变成了「读得到」——在那之前,后面的一切都无从谈起。
至于这件事今年为什么突然要紧,我另写了一篇,里面是奥地利和欧盟的实际数字:找店的方式已经变了,您的网站还没跟上。
如果您想知道自己的网站现在处在哪一档,把网址发给我就行——免费诊断,两个工作日,不收费。
来源
- 各家 AI 爬虫的名称与用途:OpenAI 爬虫说明(OAI-SearchBot / ChatGPT-User / GPTBot 的分工)
- AI 爬虫的识别与拦截:Cloudflare 机器人文档、AI Crawl Control
- 爬虫会不会渲染页面、跑 JavaScript:MarketerFirst 的实测,2026 年 8 月,四个零售商各测一个商品页。样本很小,作者自己也写了「一个数据点,不是结论」——但它测出四家里有 49%–89% 的可见文字不在 HTML 里,其中一家连价格都没有。这一层官方文档不说,目前只有第三方实测可参考。
爬虫的名字和各家的规则会变。这篇文章里的具体名称如果和您查到的不一样,以官方文档为准。