本文 2,050 字 · 阅读约 6 分钟作者 Rita Tang

为什么 AI 读不懂您的网站

客人问 AI「维也纳有没有靠谱的中医推拿」,它给了几家,没有您。网站明明在线上,做得也不难看。五个最常见的原因,以及一份五分钟能跑完的自查。


客人在 ChatGPT 里问:维也纳哪里能做中式推拿(chinesische Massage Wien)。它给了几家,没有您。

您的网站在线上,做得也不难看,Google 上搜店名也找得到。问题出在哪?

AI 和搜索引擎要的东西不一样

Google 给的是十条链接。它可以把一个自己并没完全看懂的网页排在第七位——反正点不点由客人决定。

AI 给的是一个答案。它必须先读懂您,才敢提起您;而且它会去别处对一遍,确认这些信息靠得住。

所以门槛高了一档:不只是「被收录」,而是被读懂、并且能被交叉验证

先排除一件事:爬虫进不进得来

后面五条讲的都是「内容读不读得懂」。但有一关在更上游:AI 的爬虫能不能访问到您的网站。

去读网页的不是 ChatGPT 本身,是几个专门的爬虫——ChatGPT 用 OAI-SearchBot 和 ChatGPT-User,Perplexity 用 PerplexityBot,Claude 用 Claude-SearchBot。它们被拦在门外,网站写得再好也等于零。

而这件事经常是被无意中拦住的。Cloudflare 这类服务有一个「阻止 AI 爬虫」的开关,打开之后一次拦掉一批。它不区分两件事:「把内容拿去训练模型」和「有人提问时来读一下」——而后者正是您需要的那一个。

我在两个真实站点上都见过:搜索引擎全部放行,AI 爬虫统一返 403。从外面完全看不出来,浏览器打开一切正常。

**这一层自己不好查。**要逐个 User-Agent 发请求,再和普通浏览器拿到的状态码对比;同时还要看 robots.txt 里有没有针对这些名字的 Disallow——服务器和 robots 是两层,都得查。这是我做免费诊断时一定会跑的一项。

内容层面五个最常见的原因

一、要紧的信息只在图片里

菜单是一张 JPG,价目表做成了海报,营业时间印在了一张漂亮的图上。

有个误解值得先说清:**模型本身早就能读图。**您把菜单截图贴进 ChatGPT,它读得一字不差。

问题不在模型,在送内容进去的那条管道。去抓您网站的爬虫——OAI-SearchBot、ClaudeBot、PerplexityBot——只取服务器返回的 HTML,不渲染页面、不跑 JavaScript、不截图。图片到它们那儿只剩一个 alt 属性,没写就什么都没有。

(Google 的 Gemini 和 Apple 的 Applebot 会渲染,所以不是一刀切。但 ChatGPT 这条最主要的路不渲染。)

所以结论一样,理由更准:不是「AI 瞎了」,是读您网站的那一批拿不到

怎么知道自己是哪一种:在网页上用鼠标拖选价格或营业时间,按 Ctrl+C,粘到记事本里。粘得出来是文本,粘不出来就是图片。

这一条我在维也纳见得最多,而被放进图片的往往正是最要紧的两样——价格和营业时间

二、没有一句话说清「您是谁、在哪、做什么」

AI 需要一句能整句搬走的定义。而大多数网站的首页写的是这个:

我们致力于为客户提供优质的服务与体验。

这句话没有主语、没有城市、没有业务,任何行业的任何公司都能用。AI 拿它没有办法。

换成这样就能用了:

XX 推拿是位于维也纳第七区的中医推拿馆,提供推拿、拔罐与艾灸,周一至周六营业。

不需要华丽,需要自带主语和事实

三、各处的信息对不上

网站写周一休息,Google 商家资料写周日休息,Facebook 又是第三个版本。

AI 会交叉验证。对不上的时候,它更可能干脆不提您——不提总比提错安全。

这一条最容易被忽略,因为每一处单独看都没问题。

四、内容要靠 JavaScript 才出现

折叠起来的常见问题、点一下才加载的价目表、登录墙后面的内容。

这一条和第一条同源,但后果更隐蔽:Googlebot 会执行 JavaScript,而 OAI-SearchBot、ClaudeBot、PerplexityBot 不会。

所以会出现这种情况——您在 Google 上排得还不错,但 AI 就是不提您。因为 Google 看见的是浏览器渲染完的样子,AI 看见的是服务器最初返回的那份 HTML。两者可以差得很远。

怎么知道:在网页上点右键 →「查看网页源代码」,用 Ctrl+F 搜您的价格。**搜得到,AI 才看得到。**注意这和上面那个复制测试测的不是同一件事——浏览器里能选中的字,不一定在这份源代码里。

顺带说一句:折叠本身没问题——只要折起来的文字确实在最初那份 HTML 里。这是做法的差别,不是要不要折的差别。

五、只有社交主页,没有网站

平台不让抓,AI 就读不到。而且平台的规则随时会改,账号也可能被封。

社交主页是租来的地。它可以是入口,不能是地基。

五分钟自查

四步,不用装任何工具。每一步都写了做什么结果怎么读

第一步 · 复制测试

做什么 在您网站上用鼠标拖选价格、营业时间、地址,按 Ctrl+C,粘到记事本里。

怎么读 粘得出来 → 是文本,AI 拿得到。粘不出来 → 是图片,对 AI 等于没写。

第二步 · 查看源代码,搜两样

做什么 在网页上点右键 →「查看网页源代码」,然后用 Ctrl+F 搜两次:一次搜您的价格,一次搜 ld+json

怎么读 搜得到价格 → AI 也看得到;搜不到 → 那段内容是 JavaScript 后来加上的,AI 看不见。 搜得到 ld+json → 您的网站给机器留了一份说明书;什么都没有 → 没留。

第三步 · 用德语问一遍

做什么 打开 ChatGPT 或 Gemini,用客人真会打的德语词问——Massage Wienchinesisches Restaurant Wien别用中文,也别带店名。

怎么读 看它提谁、怎么描述他们。您在不在里面、被怎么描述,就是您现在的位置。

为什么这两条限制很要紧:您的客人多数是本地人,他们搜的是德语;而带上店名去问,等于让 AI 照着名字念一遍,什么也证明不了。

第四步 · 三处对照

做什么 把网站、Google 商家资料、社交主页上的营业时间、地址、电话、服务名称摆在一起看。

怎么读 任何一处不一样,就是一个待修的地方。信息对不上时,AI 更可能干脆不提您。

跑完这四步,您大概就知道自己在哪一档了。

这不是玄学,但也不是开关

把这些修好,不等于 AI 明天就会推荐您。它意味着您从「读不到」变成了「读得到」——在那之前,后面的一切都无从谈起。

至于这件事今年为什么突然要紧,我另写了一篇,里面是奥地利和欧盟的实际数字:找店的方式已经变了,您的网站还没跟上

如果您想知道自己的网站现在处在哪一档,把网址发给我就行——免费诊断,两个工作日,不收费。


来源

爬虫的名字和各家的规则会变。这篇文章里的具体名称如果和您查到的不一样,以官方文档为准。