第 4 课 / 共 6 课

打开上线页面检查

我能打开网页,Google 就一定能读到吗?

本页目录

你用自己的钥匙进得了门,不代表访客也进得去。网页可能只有登录后才能看,也可能对搜索程序有不同规则。先做普通访客的三件检查,再由有权限的人确认搜索这边。两份结果分开记录。

现在只做这一件事

仅对原本应公开的页面:在未登录的浏览器窗口打开最终地址,检查能否打开、主要文字和图片是否出现、主按钮能否完成它写明的动作。

一份填好的记录,长这样

填好示例 · 全部是假设
假设检查记录:
普通访客:网页能打开;说明可见;点击开始后数字倒数。
Google 是否能读到:未检查。
Google 是否已收录:未检查。
结论:访客检查通过,不能据此说 Google 已读到或已收录。

按你的情况继续

我还没有网站

先用上面的假设记录回答:哪些已检查,哪些还不知道?也可从第1课找到的公开页面练习普通浏览,只用无需注册、无需付款的功能。不拥有它就不查其站长报告。练习浏览不是你已发布网站。

我已经有网站

按三项做一次普通访问检查,保存地址、日期、观察。需要确认 Google 时再请有权限的管理者使用 Google Search Console:这是 Google 的免费站长工具,需要相应网站权限。

保存在你自己的纸或文档里,不用上传。未做的项目写“未检查”,不要补猜测。

怎样算完成?

三项浏览器检查有真实结果,或你能正确解释示例的结论;Google 未查就保留未知。需要修复的问题已写清交给谁,不擅改私密保护。

现在还不用做什么?

没有公开页或管理权限,先读例子,不用注册 Search Console。网页本来就应私密,保留登录,不做公开搜索检查。

需要时,再展开

需要维护者帮忙时,再展开

请维护者检查:Google 能否取得主要内容;是否有意外的抓取限制(robots.txt);是否误留“不收录”指令(noindex)。这两类规则不是隐私保护。若有重复网址,还要查建议代表网址(canonical);站点地图(sitemap)只是网址清单。双语标注等专项继续使用原详细教程。先报问题,不让新手直接改代码。

Search Console 的两种检查不要混在一起

“网址检查”显示 Google 已保存的索引信息;“实时测试”检查当前页面能否被访问和处理的部分条件。实时测试成功不等于页面已收录,也不保证展示。保存原报告文字、日期和是哪种检查;不要凭截图猜结论。

完整工作清单、技术教程、模板和来源

上面的小练习完成后,再按真实项目需要查阅。这份详细清单保留原有六阶段的全部工作范围。

内容依据已核对 · 未在真实网站端到端执行

从这里开始的条件

页面已准备发布,或已有公开页面需要检查;不要求先重做第 1–3 步。

本步目标

发布一个有权公开的页面,并留下可访问性、索引指令和实际部署的检查证据。

先弄懂这些概念

  • 抓取是搜索引擎读取页面;收录是进入索引;排名是特定查询下的展示顺序。三者不能互相代替。
  • robots.txt 管抓取;noindex 用来排除收录且需被爬虫读到;登录保护用于真正私密的内容。不要为了 SEO 去掉隐私保护。
  • sitemap 是供发现网址的清单;提交成功不代表收录。canonical 是偏好信号,搜索引擎可能另选代表网址。
发现 URL

搜索引擎知道这个网址存在。

不要混淆:被发现不等于已经访问或收录。

查看例子与证据 →
抓取

爬虫向服务器请求页面和资源。

不要混淆:返回成功不等于内容已被索引。

查看例子与证据 →
渲染

运行页面代码,把页面组装成可读取的内容。

不要混淆:自己浏览器看得见,不证明爬虫也能得到相同内容。

查看例子与证据 →
索引 / 收录

搜索引擎处理页面,并将相关信息存入搜索索引。

不要混淆:已收录不保证会在某个查询下展示。

查看例子与证据 →
抓取规则文件

放在网站根目录、告诉守规矩爬虫哪些路径可以抓取的文件。

不要混淆:robots.txt 不是可靠的去索引或隐私保护手段。

查看例子与证据 →
不索引指令

告诉支持它的搜索引擎不要把这个页面放进搜索结果。

不要混淆:Google 必须能抓取页面才能读取 noindex;它也不是登录保护。

查看例子与证据 →
规范网址

相似或重复内容里,你建议搜索引擎优先认定的代表网址。

不要混淆:canonical 是信号,不是强制命令、跳转或删页。

查看例子与证据 →
站点地图

列出你希望搜索引擎发现的重要网址的文件。

不要混淆:提交成功不保证抓取或收录,也替代不了页面间导航。

查看例子与证据 →
语言 / 地区版本标注

告诉 Google 哪些网址是同一内容的不同语言或地区版本。

不要混淆:它不会翻译页面,也不应把无关页面强行配成语言版本。

查看例子与证据 →

开始前准备

  • 已验收内容包;对目标站点和发布操作的权限;备份/回滚方式。
  • 已有站可以直接带一个需要排查的公开 URL 进入;站点应保密时选择公开练习页,保持现有保护。

跟着做

04.1先确定发布边界

明确页面应该公开还是私密、目标域名、语言地址和谁批准发布。保存当前版本或可恢复提交。先在预览中检查正文、主要按钮和手机布局;预览通过仅代表预览环境。

产物:发布范围、回滚点、预览检查记录。

04.2检查真实线上页面

通过既有流程发布后,在未登录浏览器打开最终 URL。确认最终页面正常返回、正文可读、关键资源可用、链接可点击。记录重定向和最终地址。需要开发工具时让有经验的人协助,不凭截图猜 HTTP 状态。

产物:线上地址、检查时间、状态/正文/移动端证据。

04.3检查抓取和索引信号

检查适用的 robots.txt 规则、HTML robots meta 和响应头 X-Robots-Tag,确认没有意外阻止;再看 canonical、title、description 与站内入口链接。不要把 robots.txt 放行当作已收录。发现指向错误域名的 canonical 或大范围规则时停止批量修改。

产物:单页技术检查表,每项为通过/失败/未检查。

04.4整理 sitemap 和语言信号

如站点有 sitemap,确认列出应公开的规范 URL,没有混入私密页/测试页;lastmod 只在能准确提供时使用。双语页面检查互相对应的 hreflang 和可点击语言切换;不要把英文版统一 canonical 到中文。

产物:sitemap 检查记录;双语对应检查记录。

04.5由有权限的人检查 Search Console

在正确资源中检查 URL,分别记录已保存的索引信息与实时测试结果;必要时由有权限的人提交 sitemap 或请求编入索引。没有账号权限写“未检查”,不能编造截图或状态。提交后保留时间与结果,等待不等于成功。

产物:部署检查单与索引状态记录,明确证据范围。

可用工具

  • 浏览器和开发者工具、已有 CMS/部署流程;Search Console 需要对应站点权限。
  • 本站旧教程:抓取检查、提交 sitemap、单页检查。这三篇仅支持本阶段,不证明其他阶段已实测。

交给 Agent 的步骤内任务

你要交付什么

  • 发布记录:版本、最终 URL、时间、回滚点、各检查结果、证据链接、账号内未检查项、下一次复查条件。

复制本阶段空白模板 →

完成标准

  • 目标公开页可正常访问,关键任务可用,无已知意外索引阻碍;私密保护未更改;线上与预览结果分开;收录未知可进入观察,但不能标记收录成功。

遇到这些情况先停下

  • 登录保护有意存在、无发布权限、页面错误、意外 noindex、错误 canonical 或无法回滚:先修复或交给负责人,暂停扩大发布。

下一步

技术阻碍解决后,进入第 5 步帮助合适的人发现页面;同时保留索引观察。

官方来源

阶段拆分、清单、产物模板与诊断顺序是 First Crawl 的原创教学设计,不是 Google 的官方认证课程或排名公式。

我已理解这一步,看看 AI 能帮什么

可选。先确认输入和要检查的结果;安装不代表完成,也不授权发布、发消息或读账号。

这些完整包来源已审阅,真实网站未运行。后台需要已有权限;完整执行包提供中文和英文。

继续下一课

下一课:给这张页面安排一个别人走得到的入口。