不能直接拼接。pr值这类历史评分在旧记录里通常只有一个数值加日期,而新记录往往换了字段名、换了统计对象,甚至换成了别的体系。没有共同字段,强行拼成一条曲线,得到的只是折线的形状,不是同一件事的变化。要判断能不能拼,先看两批数据是否共享至少一个可对齐的维度,比如同一URL、同一时间粒度、同一评分口径。
假设你手上有两段记录:一段是多年前导出的pr值列表,字段是url, pr, date;另一段是近期从某个页面指标工具导出的表格,字段是page, score, updated。把两段按行号顺序接起来画图,曲线可能相当平滑,看起来像“持续上升”或“持续衰减”。但当你回头查某一天的数值时,会发现它既不对应旧记录的日期,也不对应新记录的抓取时间。这种平滑是排序造成的,不是趋势。
这就是拼接最常见的陷阱:共同字段缺失时,行序会被误当作时间序。旧数据按URL字母排序、新数据按抓取时间排序,两者一接,横轴就变成了假的。
面对“拼不上”的结果,通常有两种解释,需要分开对待。
page字段可能指向页面级指标,也可能是站点级汇总。对象不同,数值自然不可比。还有一种容易被忽略的情况:旧记录里的pr值本身可能是第三方仿值,而不是官方来源。如果这一点无法核实,那么无论新数据多干净,拼接的起点就是不确定的。
要判断到底是对象变了还是口径变了,最有效的动作是找重叠期。具体做法:在两批数据各自覆盖的时间范围内,找出至少一个同时出现在旧记录和新记录里的URL或页面,比较它在这两套数据里的值。
这个动作的结果会直接决定下一步:找到重叠锚点,就进入口径换算;找不到,就停止拼图,把两段数据当作两个独立事实来写。
假设旧表有1000行,字段为url, pr;新表有800行,字段为page, score。两表都包含example.com/a这一条。旧表记为3,新表记为62。再抽另外五条重叠URL,发现旧值3对应新值60上下,旧值4对应新值75上下。此时可以假设两套分值之间存在单调关系,但样本太少,只能作为“可能同源”的线索,不能当成换算公式。若五条重叠URL里有两三条对不上,更合理的结论是两套数据覆盖的对象范围不同,拼接应当停止。
这个例子的关键不是数字本身,而是用重叠样本检验可比性。没有这一步,任何拼接都只是视觉上的连续。
把上面的判断收拢成可执行的条件:
updated是抓取时间还是更新时间,必须分清。时间语义不同,横轴就不可比。三条都满足,才可以谨慎拼接,并在图注或说明里写清换算依据;缺任何一条,更稳妥的做法是分段呈现,而不是连成一条趋势线。真正影响下一步的不是曲线好不好看,而是你能否指出每一个拼接点对应的实体和时间。