Page loaded

爬虫很忙,但大部分工作只是重复抓取

2026-06-26·32 分钟·作者 Ethan

一份匿名电商复盘发现,约 82% 抓取在重复访问已知 URL,参数页、移动重复页和分页继续消耗预算。本文给出日志诊断方法。

很多站点看到抓取量稳定,第一反应是“搜索引擎挺活跃”。但抓取预算看重的从来不是请求总数,而是这些请求有没有落到规范、可索引、对业务有价值的 URL 上。Google 对抓取预算的说明说得很明确:抓取能力和抓取需求都有限,浪费在低价值地址上的请求,会挤占真正该抓的页面。

抓取量不低,问题是抓错了地方

这组案例里,最醒目的信号有四个:约 82% 的爬虫活动是在重复访问已知 URL;超过 39% 的请求落到带参数 URL;商品详情页抓取中,重复的移动端 URL 占比超过 50%;类目/列表页抓取中,分页 URL 吸收了约 40% 的请求。单看某一个数字,都已经不算小;放在一起看,问题就很清楚了:爬虫并不闲,但大量请求没有流向“新增、规范、可索引”的主版本页面。

信号 案例观察 对抓取效率的含义 决策判断
重复访问已知 URL 约 82% 新页面发现空间被压缩 若新增页收录慢,应优先查重复入口
参数化 URL 命中 >39% 排序、筛选、追踪参数在分流请求 应排查参数生成规则
商品详情页中的重复移动端 URL >50% 同一内容被多版本反复抓取 先核对移动端 URL 体系与规范信号
类目/列表页中的分页 URL 约 40% 深分页吞掉列表抓取机会 先看分页是否可索引、是否被站内大量链接

换个更容易决策的角度看:100 次抓取里,大约 82 次在回访旧地址;参数 URL 的命中也已经超过三分之一;商品详情抓取里,每 2 次就有 1 次落到重复移动端版本;类目抓取里,每 5 次大约有 2 次给了分页。它们分母不同,不能直接相加,但已经足够说明一件事:抓取总量不低,不代表分配合理。对电商站尤其如此。详情页、类目页、筛选页、分页页,本来就容易制造大量近似 URL。Google 对 faceted navigation 的最佳实践也一直在提醒,参数和组合页如果缺少约束,抓取会被迅速稀释。

同一案例的后续快照还给了两个补充信号:非 200 的类目/列表 URL 占抓取预算约 14%,高于前一快照的约 9%;站点结构中发现的 4xx URL 数量增长了 3.5 倍。这不能直接证明某个改动导致了抓取恶化,但足以支持一个判断:问题不在“爬虫来得少”,而在 URL 体系持续把请求引向重复页、参数页、分页页和失效页。后续排查的重点,也就不该停留在抓取次数曲线上,而要回到日志和 URL 生成规则本身。

爬虫很忙,但大部分工作只是重复抓取编辑视觉图
电商网站把抓取预算浪费在哪? — Convertos.ai original workflow poster.
电商网站把抓取预算浪费在哪? — Convertos.ai original explainer.

这段原创口播视频,把正文的判断压缩成三个检查步骤:先盘点 URL,再用日志验证,最后收紧发现路径。视频只是摘要,不承载正文之外的关键结论;无障碍版本见 字幕文字稿

视频文字稿

电商站最常见的抓取浪费,来自筛选、排序、站内搜索、追踪参数和重复路径。问题不只是 URL 多,而是低价值地址比新品和核心类目更容易被发现。先按规则盘点 URL,再用服务器日志确认 Googlebot 实际抓了什么。随后处理内链、参数、canonical 和 sitemap。两到四周后,用相同口径复测高价值页面获得的抓取占比。

匿名抓取分配图:82%为重访、超过39%落在参数URL、产品页重复移动URL超过50%、类目分页约40%
这些比例的分母不同,不能相加,但都指向大规模低价值抓取。

四类 URL 在消耗抓取机会

把抓取浪费一概叫成“重复内容”,很容易把优先级看错。真正消耗抓取机会的,往往是四种不同的 URL:已知 URL 的反复重抓、参数组合页、移动端重复路径、分页页。它们的成因不同,修法不同,业务风险也不同。混在一起看,团队只会在 robots、canonical、站内链接和 URL 生成规则之间来回试错。

先看已知 URL 的重抓。案例期内,约 82% 的爬虫活动落在“已经发现过的 URL”上。这个数字本身不一定异常,Google 也明确说过,抓取预算会受站点健康、URL 价值和服务器承载影响,重抓本来就是正常行为的一部分。抓取预算说明 真正的问题在于,这些请求回到的是不是值得更新检测的页面。如果已知 URL 里混入大量参数页、移动重复页或深分页,那么重抓越勤,浪费越稳定。

第二类是参数组合页。案例里,超过 39% 的抓取请求到达带参数的 URL。这里不能把所有参数都一刀切。排序、筛选、追踪、会话、库存视图,价值并不一样。麻烦在于组合膨胀。Google 对 faceted navigation 的建议很直接:不要让无穷组合通过可抓取链接无限扩散。Faceted navigation 最佳实践与常见错误

第三类是移动重复路径。这类问题常常被忽略,因为它“能打开”,看起来不像错误页。但在该案例的一段产品详情抓取中,重复的移动 URL 吃掉了超过 50% 的详情页抓取活动。这里说的不是响应式页面,而是同一内容被拆成另一套可抓取路径,比如独立移动目录、移动参数版本或历史兼容路由。对抓取分配来说,这类 URL 的影响比文案重复更直接:本该流向标准详情页的请求,被分流到了另一条路径。

第四类是分页页。案例中的分类/列表抓取里,分页吸收了约 40% 的抓取活动。分页不是不能抓,而是要看深度和返回状态是否合理。后续快照里,非 200 的分类/列表 URL 已消耗 14% 的抓取机会,高于前一快照的约 9%;同时,站点结构中被发现的 4xx URL 数量增长了 3.5 倍。这些变化只能说明关联,不能直接断言由分页导致,但足以提示一个现实问题:当分页、筛选和失效列表互相串联时,抓取会从“探索更多商品”变成“反复撞墙”。

URL 类型 案例中表现 主要风险 更适合优先检查的点
已知 URL 重抓 约 82% 爬虫活动 抓取集中在低价值旧地址 日志中高频 URL 是否为规范可索引页
参数组合页 超过 39% 请求到达参数 URL 组合膨胀,稀释抓取 参数是否可被站内链接持续暴露
移动重复路径 超过 50% 详情抓取被消耗 详情页信号分流 是否存在独立移动路径或历史兼容路由
分页页 约 40% 列表抓取 深分页与失效页占位 分页深度、返回码、失效列表入口

实操里可以用一个简单标准排优先级:如果某类 URL 同时满足“请求占比高”和“业务承载弱”,就先处理。按这个标准,这组案例里通常先看移动重复路径和参数组合,再看深分页,最后才讨论正常的已知 URL 重抓。因为前两类更容易把请求从规范页直接分走,分页则更容易把请求带向非 200 或低价值列表。

抓取次数上涨,也可能是坏消息

很多团队看到抓取曲线抬头,会下意识觉得“搜索引擎更活跃了”。但抓取量本身不代表质量。Google 对抓取预算的解释讲得很清楚,预算是否有效,取决于请求有没有落到值得抓、能返回稳定信号的 URL。就这组案例的两次快照看,爬虫活动里约 82% 都在回访已知 URL,超过 39% 到了带参数 URL,这说明“更忙”很可能只是重复劳动变多,不等于新内容发现更充分。这里的前后变化只说明关联,不是严格因果。

更直接的坏信号出现在列表页。后一次快照里,非 200 的分类/列表 URL 抓取占比升到 14%,而前一次约为 9%。如果把分类/列表抓取量粗略看作同一口径,那么浪费在非 200 上的请求明显增加。这不是小波动,因为同一批列表页本来还被分页吞掉了约 40% 的抓取活动。也就是说,在“列表页池子”内部,先有大量请求落到翻页,再有更高比例落到非 200,真正能服务索引和分发的有效请求空间会被继续压缩。抓取预算说明里提到,低价值和错误页面会影响抓取效率,这里正好能对上。

指标 前一次快照 后一次快照 变化解读
非 200 分类/列表 URL 抓取占比 约 9% 14% 列表抓取质量变差
站内发现的 4xx URL 数量 1x 3.5x 站内可发现错误入口显著增多

再看站内发现层面,4xx URL 数量在两次快照之间增长了 3.5 倍。这个指标比单纯的服务器错误数更关键,因为它说明错误 URL 不是偶发访问,而是已经进入站内结构,被导航、筛选、分页、内部链接或模板持续暴露给爬虫。抓取次数上涨如果同时伴随“可发现的 4xx”暴增,通常意味着站点在主动制造新的抓取终点。此时再去庆祝抓取量增长,判断就容易偏掉。

所以,实务上可以用一条很直接的规则:如果总抓取上涨,但非 200 列表页占比同步上升,且站内发现 4xx 数量明显扩张,就把这次上涨视为负面信号,优先排查 URL 生成和内部链接入口,而不是把注意力放在服务器吞吐或抓取频次本身。

先看日志,再回到 URL 生成规则

抓取诊断不要从“收录少不少”开始,而要先从日志里把 Googlebot 的请求拆开。最小可用字段其实只有五个:请求 URL、状态码、canonical、是否可索引、页面类型。再加一列“业务价值”,才能判断这些请求是不是流向了该被抓的地方。Google 对抓取预算的定义本身就强调两件事:抓得动,和抓得值不值。抓取预算说明

下面这张表适合直接套到日志抽样里。样本期短,更适合看“流向”;样本期长,更适合看“入口规则”是不是在持续制造垃圾 URL。

日志信号 典型表现 应回查的 URL 生成规则 处理优先级
200 + 可索引 + 自指 canonical + 高价值页面 商品详情、核心类目稳定被抓 保持内链与 sitemap 一致
200 + canonical 指向别的 URL 参数页、移动版重复页、排序页 参数拼接、模板输出、移动版映射
200 + noindex 搜索结果页、筛选组合页 站内搜索、筛选器、分页规则 中高
3xx 链式跳转 http/https、尾斜杠、大小写混用 规范化与重写规则冲突
4xx/5xx 下线商品、失效类目、错误分页 删除流程、链接生成、缓存失配
非 200 的类目/列表页 本应承接抓取却返回异常 分页、筛选、类目树生成 最高

这张表按“请求占比 × 页面价值 × 可修复性”排优先级。例如某次快照里,超过 39% 的爬虫请求落在参数化 URL,上来就说明问题不在抓取总量,而在 URL 入口。再看商品详情抓取里,重复移动版 URL 吃掉了超过 50% 的请求;类目/列表抓取里,分页又吸收了约 40%。这两类都常见于模板或路由层批量生成,修一条规则,通常比清理单个页面有效得多。

异常页也一样。后一次快照中,非 200 的类目/列表 URL 消耗了约 14% 的抓取机会,前一次约 9%。同一阶段,站点结构里被发现的 4xx URL 数量增长了 3.5 倍。这里不能直接说“4xx 导致了抓取浪费上升”,但足够支持一个排查顺序:先核对类目树、分页器、筛选器、下线流程是否持续吐出失效链接,再去看 robots、canonical 和 sitemap 有没有把这些 URL 继续暴露给爬虫。

实操时,建议先把日志里的 URL 按“页面类型”归类,再回到生成规则找入口。参数页多,就查 faceted navigation、排序、追踪参数、内部搜索是否被链接系统放大;Google 对 faceted navigation 的错误模式有很具体的说明,可以直接对照排查。Faceted navigation 最佳实践与常见错误 如果日志显示约 82% 的爬虫活动都在重复访问已知 URL,那就别急着追求“更多抓取”,先确认这些重复请求里,有多少落在 200、可索引、规范且有业务价值的页面上。这个比例,才决定抓取是不是在做正事。

修产生垃圾 URL 的入口,不要逐条擦地

抓取异常一旦出现在日志里,很多团队会先去“删一批坏 URL、补几个屏蔽规则”。但如果入口还在持续产出,清理动作就只是擦地。更有效的做法,是按“哪里在制造可抓取链接”来排优先级:内部链接源、参数规则、移动重复、分页、站点地图、错误模板。因为抓取预算看的是站点整体可抓取空间与服务器承载,不是某个目录的单点修补。Google 对抓取预算的说明也强调,重复和低价值 URL 会分散抓取资源。

下面这组案例只反映两个时间截面的关联变化,不能当作严格因果实验,但足够指导排障顺序:

入口类型 案例现象 对应动作 优先级判断
内部链接到参数 URL 超过 39% 抓取到达参数化 URL 先改模板、筛选器、推荐位的链接生成规则 最高,因其直接放大可发现性
移动重复 URL 商品详情抓取中,重复移动 URL 占比超过 50% 合并移动/桌面 URL 策略,修正 canonical 与内部链接指向 最高,因其吞掉核心页抓取
分页 类目/列表抓取约 40% 落在分页 限制深分页暴露,减少无需求页进入站内链接流 高,因其规模大且常无新增价值
非 200 类目/列表 后一快照占抓取预算 14%,前一快照约 9% 修复模板输出、下线失效入口、从 sitemap 移除 高,因其直接浪费请求
站内 4xx 结构性暴露 两次快照间,站点结构中发现的 4xx URL 增长 3.5 倍 排查导航、面包屑、聚合页、活动页模板 高,说明坏入口在扩散

判断顺序可以很简单:谁既“可被发现”又“量大”,谁先修。按这个规则,参数链接和移动重复通常排在最前。因为它们不是孤立坏页,而是模板级放量器。如果某阶段超过 39% 抓取落到参数 URL,同时约 82% 抓取在重复访问已知 URL,那么新增抓取机会里真正流向新规范页的空间会被进一步压缩。此时逐条提交移除,收益远小于把筛选、排序、追踪参数从内部链接里拿掉,或按 Faceted navigation 最佳实践收紧可抓取组合。

分页和错误模板排在后面,不是因为不重要,而是因为它们常常是“次级放大器”。类目分页吸收了约 40% 的列表抓取,如果这些分页还夹带非 200 状态,浪费会叠加。后一快照里,非 200 的类目/列表 URL 已吃掉 14% 抓取预算,高于前一快照的约 9%。这说明问题不只在旧 URL 残留,更可能是模板、导航或 sitemap 仍在持续喂给爬虫错误地址。站点结构中 4xx URL 数量又增长了 3.5 倍,也支持这个判断。

落地时可以用一条决策线:凡是出现在主导航、列表、推荐位、面包屑、HTML sitemap、XML sitemap 里的垃圾 URL,都按入口问题处理;凡是只存在于历史外链或旧抓取记录里的,再考虑逐条清理。目标不是让抓取量下降,而是让请求更多流向规范、可索引、能承接业务的页面。

上线后要证明抓取流向真的变了

修完入口、参数规则和分页后,复盘不能只看“总抓取量有没有涨”。更有用的是看四个结果:有效抓取占比、发现时延、可索引覆盖、搜索结果变化。Google 对抓取预算的说明也强调,抓取是否高效,取决于爬虫能否把请求花在有价值的 URL 上,而不是反复消耗在低价值地址上。抓取预算说明

可以做一个很小但够用的上线前后对照,样本口径保持一致,比如都取同类观察窗口、都只看 Googlebot、都按 URL 类型拆分。下面这张表适合直接拿去周会用:

指标 上线前快照 上线后快照 怎么判断
有效抓取占比 = 200 且规范可索引 URL 抓取 / 总抓取 待记录 待记录 看是否持续改善
参数 URL 抓取占比 >39% 待记录 看是否明显下降
商品详情中重复移动端 URL 占比 >50% 待记录 看重复入口是否被压缩
列表/分类中分页抓取占比 约 40% 待记录 看分页是否继续大量占位
非 200 列表/分类 URL 占比 约 9% 后升至 14% 待记录 看是否回落
站内结构发现的 4xx URL 数 两次快照间增至 3.5 倍 待记录 看是否停止扩张

这里最关键的是“有效抓取占比”。如果某阶段约 82% 的爬虫活动都在重访已知 URL,而参数 URL 又占去超过 39%,那就算总请求数很高,也很难说明新增、规范、可索引页面得到了更多机会。一个简单算法是:把日志里的抓取请求按“200 且 canonical 指向自身、未 noindex、非参数垃圾页”归为有效,再除以总抓取。这个比例比总抓取量更接近业务目标。

发现时延也要看。做法很直接:抽一批新上架或新生成的规范 URL,记录它们首次出现在站内链接中的时间,再对照日志里首次被抓取的时间。若上线后发现时延缩短,说明爬虫更快碰到正确入口;若时延没变,但参数页和分页仍吃掉大量请求,通常表示流量只是被重新分配到另一批低价值 URL。

再往后看可索引覆盖和搜索结果。可索引覆盖不是看“收录总量”,而是看目标目录、商品详情、核心分类这些页面里,能被抓到、能返回 200、能进入索引候选的比例是否提高。搜索结果则用 Search Console 的效果报告按页面组观察点击、展现和平均排名,避免把短期波动误判成修复效果。效果报告说明

最后的决策也应该很具体:如果上线后观察期内,有效抓取占比没有提升,且非 200 列表页占比没有从高位回落,或者站内结构发现的 4xx URL 还在继续增加,就先暂停扩内容和新增流量入口,回头检查 URL 生成规则、模板链接和导航源。

复测时把同一批数据、口径和下一次检查日期记进SEO 审查流程。证据已经落到具体页面后,再用Convertos SEO 指南处理页面动作。

声明

案例数据来自一份 2026 年大型跨境电商平台运营复盘。数据经许可使用,企业、供应商、域名、系统和人员信息均已删除。文中的前后变化只能说明关联,不能当作严格的因果实验。

需要我给你一些具体建议?

直接来问我,沟通你的 SEO / GEO 问题

你可以直接通过邮箱、微信或 LinkedIn 联系我。我会先帮你判断问题优先级,再给你一个可执行的起步方案。

邮箱: 发送邮件微信: 15765565449LinkedIn