网站日志分析:看懂谷歌爬虫抓取行为

为什么 GSC 之外还要看日志

GSC 的报告是谷歌抽样处理后的汇总数据,而服务器日志记录的是每一次真实请求:来了没有、什么时候来的、请求了什么、返回了什么码、用了多久。想知道谷歌到底在你的站上做了什么,日志是唯一的一手材料。

日志里每条记录有什么

字段能看出什么
客户端 IP谁来的(需验证是不是真 Googlebot)
时间戳抓取时段与频率
请求 URL抓了哪些页,有没有抓无效页
HTTP 状态码200/301/404/5xx 的分布
User-Agent是移动 Googlebot 还是桌面 Googlebot
响应时间与字节数慢页、空页、超大的页

先验证是不是真 Googlebot

User-Agent 可以伪造,不能只靠它。谷歌官方给的验证方法是两步:对 IP 做反向 DNS 查询,得到主机名后确认以 .googlebot.com.google.com 结尾;再对这个主机名做正向 DNS 查询,确认解析回原来的 IP。两步都对上才是真的(来源见文末)。

六个值得看的维度

维度看什么异常信号
抓取频率趋势Googlebot 每天请求数持续下滑,说明站点健康度或预算出问题
状态码分布200 占比 vs 4xx/5xx5xx 突增、大量 404 说明有坏链或服务器不稳
抓取去向请求落在哪些目录大量请求打在参数页、筛选页,预算被浪费
重要页是否被抓关键 URL 有没有出现过从没出现 = 孤岛页或入口太深
响应时间平均与 P95慢页被抓的次数明显更少
设备类型移动 / 桌面 Googlebot 比例移动优先索引下,移动抓取应占多数

标准分析步骤

  1. 拿到原始日志:Apache/Nginx 的 access log,或云厂商的日志服务导出;
  2. 过滤爬虫:先按 UA 粗筛,再用反查 DNS 验证 IP;
  3. 聚合统计:按天、按状态码、按目录、按 URL 汇总;
  4. 与 GSC 对照:日志里抓了很多但 GSC 显示未收录,问题在索引端;日志里根本没来过,问题在发现端;
  5. 输出清单:要修的 5xx、要删的无效页、要补内链的重要页。

常见发现与对应动作

  • 大量 301 请求 → 站内链接还指向旧地址,直接改成最终地址;
  • 抓取集中在低价值目录 → 用 robots.txt 或 noindex 收敛,把预算还给重要页;
  • 重要页从未被抓 → 补内链、进 sitemap;
  • 抓取次数多但收录少 → 内容质量或重复度问题,别再死磕抓取;
  • 响应时间长的页抓取少 → 优先优化这些页的性能。

常见错误

  • 只看 UA 不验 DNS,把假爬虫统计进去;
  • 日志只留几天,看不出趋势;
  • 开启 CDN 后只看 CDN 日志,漏掉源站日志或被回源掩盖的真实情况;
  • 分析完不落到具体动作,报告做了一堆但什么都没改。

来源:https://developers.google.com/search/docs/crawling-indexing/verifying-googlebot

来源:https://developers.google.com/search/blog/2018/10/what-crawl-budget-means-for-googlebot

您可能还会对下面的文章感兴趣: