科技行业网站常遇到一个矛盾:内容质量很高,搜索引擎却迟迟不来抓取。问题通常不在内容本身,而在技术链路中的某个环节。以下排查顺序基于依赖关系设计——状态码是基础,robots.txt是入口,canonical是方向,sitemap是地图,内链是路径,渲染是内容可见性,日志是验证。跳步排查容易误判,比如花大量时间优化渲染,却发现页面返回404。
第一步:状态码——服务器是否正常返回200
抓取的前提是服务器能正常响应。页面返回4xx(如404、410)或5xx(如500、503)时,爬虫直接放弃。
操作: 用Google Search Console的“网址检查”工具输入目标URL,查看“抓取”结果中的状态码。也可用cURL命令或浏览器开发者工具的网络面板直接查看响应头。
常见问题:
- 新发布页面返回404,通常是URL规则变更后未做301重定向。
- 服务器偶尔返回503,导致爬虫认为网站不稳定而降低抓取频率。
- CDN或WAF配置错误,对爬虫返回403。
边界: 301跳转本身不算错误,但搜索引擎会抓取最终目标URL。跳转链超过5跳或目标URL返回非200状态码时,抓取仍会失败。确保最终目标URL稳定返回200。
第二步:robots.txt——是否无意中屏蔽了搜索引擎
爬虫访问网站时首先读取robots.txt。配置错误可能直接阻止抓取重要页面。
操作: 访问 https://你的域名/robots.txt 确认文件内容。用Google Search Console的“robots.txt测试工具”验证是否有规则意外屏蔽关键路径。
常见问题:
- 使用
Disallow: /屏蔽了整个网站(常见于开发环境配置误上线)。 - 屏蔽了
/assets/或/js/等静态资源目录,导致搜索引擎无法加载CSS和JavaScript,影响渲染。 - 多个
User-agent规则冲突,导致Googlebot被错误规则限制。
执行: 检查 User-agent: Googlebot 对应的规则,只屏蔽不需要被抓取的路径(如后台管理页面、临时测试页面)。静态资源目录建议允许抓取。
第三步:canonical标签——是否指向了错误页面
canonical标签告诉搜索引擎哪个URL是当前页面的权威版本。指向错误时,搜索引擎可能索引不相关页面,甚至放弃抓取当前页面。
操作: 查看页面HTML源代码中的 <link rel="canonical" href="..." /> 标签,确认href属性指向的URL是否正确。
常见问题:
- 分页列表页的canonical指向第一页,导致后续页面不被抓取。
- 动态参数生成的URL(如
?sort=price)的canonical指向不存在的URL。 - 开发环境或测试环境的canonical标签未更新,指向旧域名。
边界: canonical标签指向的URL返回404或被robots.txt屏蔽时,搜索引擎认为当前页面没有权威版本,可能完全不索引。确保canonical指向的URL可被抓取且返回200。
第四步:sitemap——是否提交了正确且完整的URL列表
sitemap是搜索引擎发现新页面的重要途径。格式错误、包含无效URL或未提交时,优质内容可能长期不被发现。
操作: 在Google Search Console中提交sitemap,查看“已提交的网址”报告,确认URL数量、状态码和错误数。
常见问题:
- sitemap包含大量返回404或301的URL,导致搜索引擎认为网站质量低。
- sitemap未包含最新发布的内容,或更新频率过低。
- sitemap文件超过50MB或包含超过50,000个URL(需分片)。
执行: 用Screaming Frog或Sitebulb等工具抓取sitemap,检查每个URL的状态码。确保sitemap只包含返回200的、可索引的页面,并定期更新。
第五步:内链——页面是否被其他页面有效链接
内链是爬虫发现页面的主要途径。页面没有来自站内其他页面的链接时,可能成为“孤立页面”,爬虫难以发现。
操作: 用Google Search Console的“链接”报告查看目标页面有多少来自站内的链接。也可用爬虫工具模拟爬虫路径,确认页面是否被有效链接。
常见问题:
- 新发布的博客文章未在首页、分类页或相关文章模块中添加链接。
- 页面仅通过JavaScript动态加载的菜单或推荐模块链接,而搜索引擎无法解析这些JS。
- 内链使用了
nofollow属性,阻止了权重传递。
执行: 确保每个重要页面至少有一个来自站内其他页面的、可被爬虫抓取的HTML链接。新内容在首页或相关栏目页添加显式链接,或通过“最新文章”模块自动生成。
第六步:渲染——JavaScript内容是否被正确解析
科技行业网站常使用JavaScript框架(如React、Vue)构建动态内容。搜索引擎无法正确渲染时,关键内容可能被遗漏。
操作: 用Google Search Console的“网址检查”工具查看“抓取”和“渲染”结果。对比“抓取的HTML”和“渲染后的页面”,确认重要内容(如正文、标题、链接)是否出现在渲染结果中。
常见问题:
- 内容通过JavaScript异步加载,而搜索引擎的渲染队列有限,导致内容未被解析。
- 使用了客户端渲染(CSR)且未做服务端渲染(SSR)或预渲染,导致爬虫看到空白页面。
- 关键数据通过API获取,而API被防火墙或CORS策略阻止。
边界: 即使页面能渲染,如果渲染后的内容包含大量重复或低质量信息(如无限滚动加载的无关内容),搜索引擎可能降低页面权重。确保渲染后的内容与用户看到的一致,且结构清晰。
第七步:服务器日志——确认搜索引擎爬虫的实际访问行为
前六步基于工具和配置的推断,服务器日志提供最直接的证据:爬虫是否真的来过、访问了哪些URL、返回了什么状态码。
操作: 从服务器或CDN获取访问日志,过滤出Googlebot的User-Agent(Mozilla/5.0 (compatible; Googlebot/2.1; +http://www.google.com/bot.html)),分析其访问模式。
常见问题:
- 爬虫访问频率极低,说明网站权重或内容更新频率不足以吸引爬虫。
- 爬虫访问了robots.txt后立即离开,说明被规则屏蔽。
- 爬虫访问了页面但返回500错误,说明服务器不稳定。
执行: 用GoAccess、AWStats或ELK Stack分析日志。重点关注:
- 爬虫访问的URL列表与sitemap的匹配度。
- 爬虫访问的时间分布(是否集中在特定时段)。
- 爬虫访问后返回的状态码分布。
日志显示爬虫从未访问过某个重要页面时,说明该页面在爬虫的发现路径中缺失,需要回到前几步检查内链和sitemap。
排查顺序就是决策顺序
以上七步的顺序基于依赖关系:状态码是基础,robots.txt是入口,canonical是方向,sitemap是地图,内链是路径,渲染是内容可见性,日志是验证。跳步排查容易导致误判。
对于科技行业网站,内容质量是前提,但技术链路必须畅通。按此顺序排查后仍存在抓取问题,建议进行深度技术审计,检查服务器配置、DNS解析、CDN缓存策略等底层因素。天行GEO的技术审计服务可以系统化排查这些复杂问题。更多常见抓取问题的解答,可参考我们的FAQ页面。
Q&A
问:检查状态码时,301跳转是否算正常? 答:301是正常跳转,但搜索引擎会抓取最终目标URL,需确保目标URL返回200。跳转链过长或目标URL不可用时,抓取仍会失败。
问:sitemap提交后多久会被抓取? 答:通常几天内,但可通过Google Search Console手动请求加速。sitemap频繁更新时,搜索引擎也会自动提高抓取频率。
内容质量与用户价值原则可参考 Google Helpful Content 官方文档。