没有历史数据时,区间预算应当由可观察的工作量和外部约束推导,而不是由“大概会收录多少页”反推。可以给出的结论是:把预算拆成“确定性成本”和“不确定成本”两段,前者用当前可执行的最小动作计量,后者给出上限和触发条件。这样得到的区间,即使宽,也仍然可被验证和调整。
缺少历史数据时,最容易犯的错误是直接问“收录一页要多少钱”。这个问法把两个不同性质的量混在一起:一是你为了让页面具备被收录条件而投入的工程或内容成本,二是收录结果本身。后者不由你单方面决定,也不该成为报价的计价单位。
可用的两个锚点是:
把两者分开后,预算区间的下限是确定性成本,上限是确定性成本加上不确定成本的上限。区间宽不是缺陷,而是对信息不足的诚实表达。
在没有任何历史数据的情况下,先执行一个能产生数据的最小动作,而不是先谈全量预算。一个可行的最小动作是:选取一批结构相同、数量可控的页面(例如某个栏目下的若干条),完成基础技术配置后观察抓取与收录状态的变化。
这个动作的作用不是证明“方法有效”,而是产生你自己的第一组基线数据:处理这批页面实际花了多少时间、哪些环节反复返工、抓取是否在预期时间内发生。假设你选了二十条页面,发现其中一半需要额外改写内容模板,那么全量预算就不能按“每条固定工时”线性外推,而要单独列出模板改写的成本项。
需要强调的是,抓取量或收录量在某个时间段归零,不能单独证明配置正确或错误。它可能来自抓取预算分配、站点整体质量、服务器响应、页面重复度,也可能只是周期尚未走完。因此最小动作的产出是成本数据,不是效果结论。
区间预算成立的前提是:网站结构相对统一,页面类型可归类,且你至少拥有对站点文件或发布流程的修改权限。只要满足这些条件,按页面类型分组估算就是可行的。
反例是:站点由多套历史系统拼接而成,同一类页面在不同目录下的模板、URL 规则和发布方式都不同。此时“按页面数估算”会严重低估实际工时,因为每条路径都可能需要单独排查。这种情况下区间预算不应再以页面数量为单位,而应以“需要单独处理的路径数”为单位,并明确说明哪些路径尚未纳入。
另一个会使区间失效的因素是把自然收录与广告计费混在一起。广告投放按展示或点击计费,与页面是否被自然收录是两套逻辑,不能互相折算,也不能用广告预算替代收录相关的工作成本。
一个可用的区间表述应当包含三部分:假设、动作、上限触发条件。例如可以写成:“在站点结构统一、模板可复用的假设下,完成基础配置与一批样本页处理,预计投入 X 到 Y 个人时;若样本中超过半数页面需要单独改写模板,则上限上调,并先暂停全量推进。”
下一步动作是:先执行最小动作并记录实际工时,用真实数据替换估算中的假设值,再决定是扩大范围还是先修复结构问题。这样得到的预算区间会随着信息增加而收窄,而不是一开始就给出一个看似精确、实则无法验证的数字。