优先迁出的不是点击数字本身,而是能重建判断依据的三类数据:带时间戳的原始点击记录、查询词与落地页的对应关系、以及你为这些数据做过的标记和排除规则。只导出汇总报表,迁移后基本无法继续用;导出明细并保留口径,才有继续分析的基础。
停服前最容易被忽略的遗漏条件是:很多工具允许你随时重新查询,于是没人备份明细。一旦服务不可用,重新查询这条路就断了。判断优先级时,可以问一句:这份数据能不能从别处再算出来?
所以迁移顺序应当是:先保明细,再保口径,最后才考虑要不要把聚合报表一起搬走。
粒度决定迁移后还能回答什么问题。只导出“某页面某天总点击数”,迁移后你无法再按查询词、设备或地区切分,也无法复核异常波动。建议至少保留到“时间戳 + 查询词 + 落地页 + 来源标记”这一层。
假设一个场景:某页面点击量在两周内先升后降。如果只有每日汇总,你只能看到曲线;如果有明细,你可以检查下降是否集中在某个查询词或某个来源标记上。这个检查动作会直接决定下一步——是继续观察,还是把该来源单独排除后重算。没有明细,这一步做不了。
导出时注意字段是否被工具截断,比如查询词只保留前若干字符、时间只到日期不到小时。截断后的数据迁移过去仍然残缺,需要当场确认能否导出完整字段。
同一批点击,在不同口径下会得出相反结论。停服前应当把以下内容一并记录,哪怕只是纯文本:
这些规则迁到新工具后未必能直接套用,但它们是重新建立可比口径的唯一线索。缺少它们,新工具里的数字和旧记录对不上时,你无法判断是数据变了还是口径变了。
不是所有数据都值得迁。可以按下面的条件分流:
一个可执行的动作是:先导出全量明细,再按“是否还会被查询”筛一遍,把确定不再使用的部分单独归档而不是直接删除。归档的好处是,当新口径出现争议时还能回查;代价是占用存储和管理精力,需要你权衡。
迁移完成不等于可以停手。选一个时间窗口,在新旧数据之间做同口径对比:
需要说明的是,请求量、抓取量或某项统计归零,并不能单独证明迁移正确或错误。它也可能是采集延迟、过滤条件变化或上游本身波动造成的。要结合明细和口径一起看,才能判断下一步是修正映射还是继续观察。
如果验证后仍对不上,先不要急着补数据,而是回到口径记录逐条核对;多数偏差来自规则差异,而不是数据本身缺失。