先给结论:不要用“排除内部流量后总量下降多少”来判断有没有误删真实访问。总量下降只能说明过滤规则生效了,不能说明被过滤的一定是内部流量。可靠做法是把排除前后的访问逐条对照,找出被移出的记录,再用可核对的证据链判断这些记录属于内部、机器还是真实用户。
多个角色对同一事实理解不同,通常是因为各自看的不是同一份数据。运营看的是站内统计,技术看的是日志,投放看的是平台报表,三者口径不同,讨论就会变成各说各话。要把它转成可执行的项目,先固定三件事:
把这三件事写进一份表格,每个角色填自己掌握的部分,分歧点就会从“我觉得删多了”变成“这条记录该不该算真实访问”。
总量对比是最容易误导的一步。假设排除规则命中了一批公司出口IP,总量从一万降到八千,看起来只是少了内部访问;但如果这批IP里混着员工在家办公时的公网出口,被删的就可能包含真实用户。总量无法区分这两种情况。
正确动作是做差集:把排除前的记录和排除后的记录按唯一标识对齐,取出“只在排除前出现”的那部分。这份差集就是被过滤掉的全部访问。接下来只需判断差集里的每一条属于哪一类,而不是去猜总量变化是否合理。这一步的结果直接决定下一步:如果差集里几乎都是已知内部标识,规则可以保留;如果出现大量陌生标识,就要先暂停扩大过滤范围。
差集里的记录不会自带标签,需要用可核对的证据来归类。以下证据按可靠性从高到低排列:
关键原则是:任何单一指标都不足以证明一条访问是内部流量。IP会变,UA会伪装,时间规律也可能只是某个真实用户的习惯。至少两条独立证据同时指向同一结论,才适合把它移出真实访问。
假设某站点把公司办公网出口IP加入排除名单,排除后站内统计下降约两成。运营认为删掉的都是内部访问,技术认为删多了。此时不要争论比例,而是导出差集,按上面的证据逐条核对。假设差集里七成记录带有内部账号标识,两成来自该出口IP且UA与公司设备一致,剩下一成是陌生IP、正常UA、有完整页面浏览路径。那么结论是:规则大体有效,但那一成需要先恢复或单独放行,再观察它们是否产生注册、咨询等后续行为。这个例子的数字只用于说明比较方法,不代表任何真实站点的结果。
核对结果通常指向三种处理,不同条件对应不同选择:
每次调整后重新做一次差集对照,确认被移出的记录是否符合预期。这个动作会直接影响下一步:只有差集干净了,基于站内统计做的流量分析才值得继续往下推进。
有时排除内部流量后,某个来源的请求量或抓取量直接归零。这不能单独证明过滤准确。归零还有别的合理解释:规则过宽把整个网段屏蔽了,采集脚本本身停了,或者数据管道在过滤环节出错导致记录丢失。要区分这些原因,需要回到原始日志确认过滤前后的记录是否连续、被删记录是否有替代来源。第三方估算、搜索引擎报告和站内统计的口径本来就不同,任何一方归零都不足以还原真实访问的全貌,只能作为线索之一。
把差集核对、证据分级和调整后复查看成一条固定流程,就能在每次排除内部流量时,及时发现自己是否误删了真实访问,并据此决定是保留、收窄还是回退规则。