网站已上线却搜不到?先做这份 10 分钟抓取自检

从 HTTP 状态、robots.txt、sitemap 到规范网址,按搜索引擎真正看到页面的顺序排查。

第一步不是搜站名,而是看状态码

在浏览器里“看起来能打开”不代表爬虫能取得相同内容。登录态、地区规则、Bot 防护和 CDN 挑战都可能让普通浏览器看到正文,却向匿名请求返回 403。

用无登录窗口访问首页,再用 curl 检查响应状态。首页应返回 200;永久迁移使用 301 或 308。不要用 403 当作限速手段。

  1. 检查首页:curl -I https://你的域名/
  2. 检查爬虫入口:curl -I https://你的域名/robots.txt
  3. 检查网址清单:curl -I https://你的域名/sitemap.xml
  4. 若任一地址返回 4xx/5xx,先修托管或防火墙,再谈内容排名。

确认 robots.txt 说的是你想说的话

robots.txt 用于管理抓取,不是隐藏网页的可靠方式。公开内容站通常允许主要爬虫访问,并在文件中写入完整的 sitemap 地址。

尤其要检查部署预览环境留下的 Disallow: /、登录保护或 noindex 是否被带到正式环境。

Sitemap 只放规范网址

站点地图应使用完整绝对地址,并只列出你希望出现在搜索结果中的规范版本。如果同一内容同时存在测试域名、自定义域名和带参数地址,统一 canonical 与 sitemap,避免搜索引擎猜测主版本。

最后才是提交与观察

在 Search Console 验证域名后提交 sitemap,并用网址检查工具测试实时页面。提交站点地图只是发现提示,不保证收录;内容质量、重复度和站点可用性仍会影响结果。

新站不要每天反复改日期或批量提交。记录首次发现、首次抓取、首次收录和获得展示的时间,按周判断趋势。

核验来源

内容说明

本文由 iPunk 编辑流程辅助整理,并按可复现性、风险和实际成本进行人工复核。工具与政策会变化,请以产品当前页面为准。