网站做好了,自己搜公司名能搜到,搜业务词一条都没有。等了三个月还是这样。
这件事的麻烦之处在于:这些问题全都不会报错。页面打开正常,颜色正常,手机上看也正常。出问题的地方全在你看不见的位置,而搜索引擎只看那些位置。
下面六个是最常见的,按我们实际遇到的频率排。每一条都附了自查方法。
一、同一篇内容有两个地址,而且都说自己是正版
这是最隐蔽也最伤的一个。
同一篇文章能从两个地址打开,比如 /why-us/ 和 /blog/why-us/,内容一模一样。这本身不致命——只要告诉 Google 哪个是正版就行,这个声明叫 canonical。
问题是很多站两个地址各自声明自己是正版。Google 看到的就是两篇内容相同的独立文章,它不知道该给谁排名,于是权重被劈成两半,两边都排不上去。
我们自己的站上个月就是这样,六篇文章各有两个地址,各自 canonical 指向自己。
怎么查:用几种方式打开同一篇内容(带斜杠、不带斜杠、带 www、不带 www、大小写不同),看是不是都返回 200。然后看每个地址的网页源码里 canonical 指向哪。全部指向同一个才是对的。
二、不存在的地址返回 200
正常情况下,访问一个不存在的地址应该返回 404,等于告诉 Google「这里没东西,别记」。
但很多网站——尤其是用框架或者 AI 生成的——会给任何地址都返回一个页面,状态码 200。比如访问 /随便打几个字/,它返回首页或者一个空模板,状态码显示一切正常。
这叫软 404。后果是 Google 会顺着这种地址一直爬下去,因为每个都”存在”。它会浪费掉分配给你网站的抓取额度,还可能收录一堆重复的空页面,拉低整站评价。
这个错我们自己刚犯过:新加的案例页路由把 /cases/任意字符/ 全接了下来,不认识的就渲染成了博客列表页,状态码 200。
怎么查:在你网站地址后面随便加一段字符,比如 /asdfghjkl/,看返回的状态码。必须是 404。用浏览器看不出状态码,要用开发者工具的网络面板,或者命令行。
三、内容是 JavaScript 画上去的
AI 生成的页面经常把内容放在脚本里,页面加载后再填进去。人看没问题,因为浏览器执行了脚本。
但抓取方不一定会执行。有些会,有些不会,AI 搜索引擎大多不会。它们读到的是脚本执行之前的那份 HTML。
我们站上有个数字动画,从 0 滚到 500。HTML 里写的初始值是 0,滚动到时才变成 500+。结果爬虫和 AI 读到的字面是「0 已交付网站」——全页唯一用来证明规模的数字,讲的是反话。
怎么查:浏览器里右键「查看网页源代码」(不是「检查元素」,那是执行后的)。在源码里搜你页面上的关键文字。搜不到,就说明抓取方也读不到。
四、站点地图里全是跳转和不存在的页面
站点地图是你主动交给 Google 的清单。清单上的每一条都应该是能直接打开、状态 200、你希望被收录的页面。
常见的错是:清单里放了会 301 跳转的旧地址,放了分类归档这种没什么内容的页面,放了已经删掉的页面。
这不会让你被惩罚,但会浪费抓取额度,也让 Google 对这份清单的信任下降。
怎么查:打开 你的域名/sitemap.xml 或 /wp-sitemap.xml,把里面的地址逐个点开。全都应该是 200,没有跳转。
五、双语网站没有告诉 Google 哪个版本给谁看
中英双语站,两套页面内容对应但语言不同。如果不加说明,Google 可能把它们当成重复内容,也可能给新西兰的英文用户推中文页。
说明的方式叫 hreflang,每个页面上要写清楚:这一页是中文版,对应的英文版在哪,默认版本是哪个。
怎么查:看网页源代码里有没有 hreflang。中英各一条,通常还要一条 x-default。而且两边要互相指向——中文页指向英文页,英文页也要指回中文页。只有单向的不算数。
六、文章之间没有任何链接
这条不像前五个那样是”错误”,但影响一样大。
Google 通过链接理解一个网站的结构和重点。如果你的文章全是孤岛,谁也不指向谁,也不指向服务页面,那么每一篇的权重都留在自己那里,流不到你真正想让人看到的页面上。
我们自己审计时发现,六篇文章指向服务页的链接数是零。读者看完一篇关于「企业为什么需要网站」的文章,站内没有任何一条路通向建站服务页。
怎么查:打开你的一篇文章,数一数正文里有几条指向自己网站其他页面的链接。零条就是问题。
为什么 AI 特别容易在这几处出错
不是 AI 笨。是这六件事有一个共同点:做错了不会有任何反馈。
写错的代码会报错,AI 能看到报错然后改。但 canonical 写错不报错,hreflang 漏了不报错,软 404 不报错,缺内链更不报错。页面照常显示,一切看起来都对。
AI 是靠反馈修正的。没有反馈的地方,它就只能靠训练里学到的惯例——而这些惯例在具体的站点结构下经常不成立。
人在这里的作用不是”比 AI 懂 SEO”,而是知道哪些地方必须主动去查。上面每一条的自查方法都不难,难的是知道有这回事、并且真的去查了。
一个更省事的顺序
如果你要自己排查,按这个顺序:先查二(软 404),因为它影响整站抓取;再查三(JS 渲染),因为它决定内容存不存在;再查一(重复地址)和五(双语),它们决定权重去哪;最后查四和六。
查完还是没有起色,通常问题就不在技术层面了,而在内容本身没有对应的搜索需求——那是另一个话题。
我们的 SEO 与 GEO 服务做的第一件事就是把上面这些逐项跑一遍,因为它们是地基。地基不对,后面写多少内容都是在漏水的桶里装水。