网站日志分析:看懂谷歌爬虫抓取行为
为什么 GSC 之外还要看日志
GSC 的报告是谷歌抽样处理后的汇总数据,而服务器日志记录的是每一次真实请求:来了没有、什么时候来的、请求了什么、返回了什么码、用了多久。想知道谷歌到底在你的站上做了什么,日志是唯一的一手材料。
日志里每条记录有什么
| 字段 | 能看出什么 |
|---|---|
| 客户端 IP | 谁来的(需验证是不是真 Googlebot) |
| 时间戳 | 抓取时段与频率 |
| 请求 URL | 抓了哪些页,有没有抓无效页 |
| HTTP 状态码 | 200/301/404/5xx 的分布 |
| User-Agent | 是移动 Googlebot 还是桌面 Googlebot |
| 响应时间与字节数 | 慢页、空页、超大的页 |
先验证是不是真 Googlebot
User-Agent 可以伪造,不能只靠它。谷歌官方给的验证方法是两步:对 IP 做反向 DNS 查询,得到主机名后确认以 .googlebot.com 或 .google.com 结尾;再对这个主机名做正向 DNS 查询,确认解析回原来的 IP。两步都对上才是真的(来源见文末)。
六个值得看的维度
| 维度 | 看什么 | 异常信号 |
|---|---|---|
| 抓取频率趋势 | Googlebot 每天请求数 | 持续下滑,说明站点健康度或预算出问题 |
| 状态码分布 | 200 占比 vs 4xx/5xx | 5xx 突增、大量 404 说明有坏链或服务器不稳 |
| 抓取去向 | 请求落在哪些目录 | 大量请求打在参数页、筛选页,预算被浪费 |
| 重要页是否被抓 | 关键 URL 有没有出现过 | 从没出现 = 孤岛页或入口太深 |
| 响应时间 | 平均与 P95 | 慢页被抓的次数明显更少 |
| 设备类型 | 移动 / 桌面 Googlebot 比例 | 移动优先索引下,移动抓取应占多数 |
标准分析步骤
- 拿到原始日志:Apache/Nginx 的 access log,或云厂商的日志服务导出;
- 过滤爬虫:先按 UA 粗筛,再用反查 DNS 验证 IP;
- 聚合统计:按天、按状态码、按目录、按 URL 汇总;
- 与 GSC 对照:日志里抓了很多但 GSC 显示未收录,问题在索引端;日志里根本没来过,问题在发现端;
- 输出清单:要修的 5xx、要删的无效页、要补内链的重要页。
常见发现与对应动作
- 大量 301 请求 → 站内链接还指向旧地址,直接改成最终地址;
- 抓取集中在低价值目录 → 用 robots.txt 或 noindex 收敛,把预算还给重要页;
- 重要页从未被抓 → 补内链、进 sitemap;
- 抓取次数多但收录少 → 内容质量或重复度问题,别再死磕抓取;
- 响应时间长的页抓取少 → 优先优化这些页的性能。
常见错误
- 只看 UA 不验 DNS,把假爬虫统计进去;
- 日志只留几天,看不出趋势;
- 开启 CDN 后只看 CDN 日志,漏掉源站日志或被回源掩盖的真实情况;
- 分析完不落到具体动作,报告做了一堆但什么都没改。
来源:https://developers.google.com/search/docs/crawling-indexing/verifying-googlebot
来源:https://developers.google.com/search/blog/2018/10/what-crawl-budget-means-for-googlebot
