为什么归因总是不清不楚
先看一个常见的场景。某个买家在周一通过广告点了你的商品,当时没有下单;周三他收藏了;周五直接搜索商品名称完成购买。这笔订单在广告报表里可能算给了周一那个词,也可能完全算不到。
这类跨天、跨渠道的路径在真实购买里非常普遍。客单价越高,买家考虑的时间越长,路径就越复杂,经过的接触点也越多,归因的难度随之上升。
第二个原因是很多触达根本没有留下记录。买家可能是听朋友提了一句,或者在线下看到同款,然后到平台上来搜索。这些前置的影响在数据里完全看不到,却实实在在推动了购买。
第三个原因是归因本身没有标准答案。把功劳算给谁,取决于你想奖励哪一环的工作。想奖励拉新就偏首次触达,想奖励促成就偏最后一次点击,立场不同,结论就不同。
所以归因不清不楚是结构性的,不是水平问题。承认这一点,比追求一个精确无误的归因结果更实际,后面要做的就是把结论限定在它撑得住的范围内。
判断归因问题属于哪一类,可以从一个简单的动作开始:把这笔订单的完整路径画出来,从第一次接触到最终下单,中间经过了哪些环节,哪些环节有数据、哪些没有。
画完之后你会发现,有数据的部分往往只是全程的一小段。前期的认知、线下的接触、朋友的口碑,这些都没有记录,但它们对最终下单的影响可能并不小。
第二步是分清这次要解决的问题属于哪一类。是想知道哪个词带来了新客,还是想知道哪个词促成了成交,两个问题需要两套完全不同的口径来回答。
第三步是选定一个口径并且写下来。口径一旦选定就固定一段时间不要改,因为口径换来换去,前后的数据无法比较,判断也就失去了连续性。
最后是接受结论的有限性。归因告诉你的是一个大致的分配方向,不是一笔一笔的精确账目。把它的定位摆正,用起来反而更踏实。
有一个具体的例子能说明路径的复杂程度。一位买家在两周内先后接触了六个环节,包括搜索一个大类词、点开三条广告、收藏其中一条、看了两篇相关内容,最后在某个晚上直接搜商品名下单。这六个环节里,平台能记录下来的可能只有三四次点击,剩下的内容浏览和线下了解完全不在数据里,如果把订单算给最后一个搜索词,前面五个环节的推动作用就全部被抹掉了,而实际上正是前面那些环节让他最终决定买。
还有一个容易被忽略的因素是决策的时间跨度。不同品类的决策周期差别很大,日用消耗品可能几分钟就决定了,家具家电要反复比较几周。跨度越长,中间可能发生的接触越多,归因能捕捉到的比例就越低,结论的偏差也就越大,所以在判断归因可信度的时候,先看一眼自己这个品类的典型决策周期有多长,是一个很实用的起点。
理解这些之后,对待归因的心态会平和很多。它不是一个能算出精确答案的工具,而是一个能给出大致方向的参照,用参照的心态去用它,反而比追求精确更能得出有用的结论,也不会因为数字对不上而反复怀疑自己的判断。

归因的第一步不是算数,而是先想清楚这次要回答的到底是哪一个问题
平台自带的归因口径
平台报表给出的归因结果通常是按一个固定口径算出来的,最常见的是末次点击。也就是把这笔订单的功劳,算给下单前最后一次被点击的那个词或者那条广告。
这个口径的优点是清晰、可复现,同一个订单在同样的条件下每次都能得到同样的归属,便于做前后对比。它的缺点是把前面那些起到推动作用的接触点全部忽略了。
除了末次点击,有的地方还会提供首次点击口径,把功劳算给第一次带来触达的那个词。这个口径更适合看拉新和认知的作用,看短期效率就会失真。
了解平台用的是哪种口径,是使用数据的前提。同一份报表里不同模块可能用的是不同口径,直接横向比较会出现看似矛盾的结论,实际上是两个口径在各自回答不同的问题。
使用平台数据的时候,建议先花一点时间把每个数据块的口径确认一遍,写在自己的记录里。这一步看着琐碎,但它能挡掉后面很多因为口径混淆造成的误判。
使用平台数据的第一步是找到口径说明。多数后台在数据模块的角落会写明这个数字是怎么算的,比如是不是按下单前的最后一次点击计算、时间窗口是几天。
找到说明之后,把它抄到自己的一份说明文档里,注明是从哪里看到的、什么时候确认的。口径偶尔会调整,有这份记录,调整之后你能立刻发现差异。
第二步是做一次小验证。挑几笔路径相对简单的订单,自己动手按口径算一遍,看结果和后台显示的是否一致。验证过一遍之后,你对这个口径的理解才算是真的到位。
第三步是确认不同模块的口径是否一致。同一个后台里,商品维度的数据和广告维度的数据很可能用的不是同一个口径,直接对比会得出错误结论。
确认完这些之后再去看数据,你会发现很多原本看起来矛盾的地方其实并不矛盾,只是两个口径在回答不同的问题,把它们摆正位置,判断就清爽了。
有一个具体的情况值得留意,就是同一个后台里不同模块的口径差异。广告模块通常按点击计算,商品模块可能按订单创建时间计算,两个模块在时间轴上的归属并不一致,一笔周五深夜下单的订单,在广告模块算在周五,在商品模块可能算在周六,这种差异在周末和大促期间尤其明显,如果不知道这一点,很容易以为是数据出了问题,白白花时间去排查一个本来正常的现象。
另外一个情况是关于时间窗口的设置。多数后台允许选择归因的时间窗口,窗口设得越长,能算进来的路径就越多,但相关性也会变弱。同一个词在一个短窗口下可能表现平平,在长窗口下看起来表现很好,差异仅仅来自窗口的设置,而不是词本身的变化,所以在做前后对比的时候,一定要确认两边的窗口设置是一致的,否则比较的结果没有意义。
把这些口径细节整理成一份自己的说明文档,是使用平台数据的一项基本功。文档不用长,把每个常用模块的口径和时间窗口写清楚就够了。它的价值在于,当你或者同事对某个数字产生疑问时,不需要重新去后台翻找,翻开文档就能立刻确认,省下来的时间积累起来相当可观。

实际工作中绝大多数判断都依赖末次点击,理解它的局限比换用更复杂的方法更紧迫
多词触达时的归属问题
多词触达指的是买家在成交前接触过好几个词。可能先是搜一个大类词看到你,后来又搜一个具体的功能词,最后通过品牌名或者收藏进入。这三个词都在路径上出现过。
最省事的处理办法是把功劳全给最后一个词。省事的同时会带来一个副作用,前面那些词的真实价值被系统性低估,投入的时候你可能会误以为它们没用,把预算集中到末次点击表现好的词上。
另一种处理是平均分摊。把所有接触过的词都算上一份,看起来更公平,实际上也没有区分轻重,一个只是顺带经过的词和一个真正推动决策的词分到了同样的功劳。
比较务实的方式是按作用分。把路径里明显起到推动作用的词单独记下来,把只是顺带经过的排除掉,重点保留推动第一次关注和推动最终下单的那两个到三个词,作为判断的主要依据。
这个处理方式带有主观判断,但比机械的算法更贴近真实。用的时候把判断依据写清楚,别人接手时能理解你为什么这么分,而不是看到一个无法解释的分配结果。
处理多词归属之前,先确认路径确实存在多词触达。打开几笔订单的路径,看有没有买家在成交前接触过不同的词。如果多数订单都只有一次接触,那归属问题本身就不突出。
确认存在多词触达之后,把触达的词按时间顺序排一排,看每个词大致处在什么位置。排在前面的通常是认知阶段的词,排在后面的多是决策阶段的词。
接着判断每个词的作用强度。可以从它之后买家的动作来判断,如果接触某个词之后买家的行为明显往前走了一步,比如从浏览变成了加购,那这个词的作用就相对明确。
然后按作用把词分成两类,一类是推动型的,一类是顺带型的。归因的时候把重点放在推动型上,顺带型的词只记录不参与主要分配。
最后把这个判断过程写下来。归因带主观成分是正常的,把判断依据写清楚,别人就能理解你的分配逻辑,也能在发现不对的时候指出具体是哪一步判断出了问题。
有一个处理多词归属的实用思路,是把路径上的词按职能分成三层。最前面一层负责让人知道有这个商品存在,中间一层负责让人开始考虑,最后面一层负责推动下单。三层词的价值性质不同,用同一套标准去衡量它们本来就不合适,分层的意义就在于让每一层用自己的标准接受评价,而不是被拉到同一个尺子上比高低。
分层之后会发现一个常见的失衡,就是最前面那一层往往被严重低估。因为它离成交最远,在末次点击口径下几乎拿不到任何功劳,投入的时候很容易被砍掉。但把这一层砍掉之后,会发现后面几层词的效率也在下降,因为新的买家没有被带进来,整个路径的入口变窄了,这个连锁反应在调整后的一两个月内会逐渐显现出来,届时再想恢复,成本会高得多。
所以在归属判断里,比较稳妥的做法是给三层词各自设一套观察指标。入口层的看新客数量和进店量,中间层的看加购和收藏,转化层的看下单和复购。三套指标各看各的,不用强行换算成一个统一的贡献值,这样既能看清每一层的健康状况,也避免了因为强行合并而造成的失真。
| 归因口径 | 怎么算 | 适合回答什么 | 主要局限 | |||||||
|---|---|---|---|---|---|---|---|---|---|---|
| 末 | 次 | 点 | 击 | |||||||
| 算 | 给 | 下 | 单 | 前 | 最 | 后 | 一 | 次 | 点 | 击 |
| 短 | 期 | 转 | 化 | 效 | 率 | |||||
| 忽 | 略 | 前 | 面 | 的 | 推 | 动 | 作 | 用 |
用转化路径看词的贡献
看转化路径的第一步是把同一个买家的多次接触按时间排出来。搜过什么词、看过什么页面、隔了多久回来,把这些串成一条线,单笔订单的路径就清楚了。
第二步是把若干条路径放在一起找规律。比如多数成交路径都是先经过一个大类词再经过一个功能词,那么这两个词就构成了一条常见的组合,它们的贡献应该一起看,而不是分开评判。
第三步是看路径的长度分布。路径普遍很短,说明买家决策快,末次点击的参考价值就高一些;路径普遍很长,说明前置接触的影响大,只看末次点击会丢掉很多信息。
第四步是找路径上的关键节点。哪一步是你自己的动作带来的,比如投了广告或者做了内容,只有这部分才是你能控制的,归因的意义也主要体现在这一部分上。
把路径整理出来之后,你会对买家的决策过程有一个具体的印象。这个印象比任何单一的归因数字都更能指导实际动作,因为它告诉你该在哪个环节加把劲。
整理路径的第一步是确定看多长时间。窗口太短会把还没走完的路径漏掉,太长又会把不相关的行为串进来,常用的做法是先看一个和商品决策周期匹配的窗口。
第二步是把路径按长度分组,分成短路径和长路径两类,分别看它们各自经过哪些词。两类路径的词构成往往差别很大,混在一起看会互相抵消。
第三步是找短路径里的高频词。短路径通常是决策快的订单,它们经过的词和最终成交的关联最直接,这部分词的表现对判断投放效率更有参考价值。
第四步是看长路径里反复出现的前段词。这些词不直接促成成交,但它们把买家拉进了路径,属于认知层面的贡献,评估的时候要单独拿出来看。
最后把两类词的结论合并,形成一份完整的判断。短路径词看效率,长路径词看拉新,各管一段,这样得出来的结论比笼统地比较词更有针对性。
有一个细节会让路径分析的结果更可信,就是在整理路径时保留买家的行为动作,而不只是记录接触过哪些词。同一个词后面跟着加购和同一个词后面跟着跳出,含义完全不同,前者说明这个词带来了推进,后者说明它只是被路过了一下,把动作一起记下来,判断词的贡献时就有了具体的依据,而不是只凭接触次数多少来推断。
另一个细节是留意路径里的重复接触。买家可能在几天内多次搜同一个词,每次看一眼就走了,这种重复接触表面上增加了这个词的出现次数,实际上并没有带来实质推进。在统计贡献的时候,把重复而没有后续动作的接触单独归一类,不要让它们和有效接触混在一起,否则会把一个效果一般的词算得比实际更重。
把这两点做进路径记录里之后,你会得到一个比单纯统计点击次数丰富得多的判断基础。它的成本只是在记录时多写一列动作状态,收益是后续所有的分析都建立在更真实的信息上,这个投入在整个归因工作里算是性价比很高的一步。
归因结论的可信度边界
第一个边界是样本量。靠几十个订单得出的归因结论稳定性很差,路径稍微一变排序就会翻转。样本太小的时候,结论只能当参考,不能当依据。
第二个边界是路径长度。路径长度波动很大的品类,归因本身就很不稳定,今天看起来是某个词在起作用,换一批订单可能就变成另一个词。这种情况下更适合看长期趋势而不是单期结果。
第三个边界是时间窗口。归因一般是按一个固定的时间窗口算的,窗口设得长短会直接影响结果。窗口太短,长决策周期的订单会被漏掉;窗口太长,又会把偶然的相关算成因果。
第四个边界是数据完整度。只有广告数据的店铺,看到的是广告这条线;加入了自然流量的店铺,看到的路径会完整一些。数据越不完整,归因结论的适用范围就越窄。
所以每次得出结论之后,最好顺手标一下这个结论的可信度档位。样本足、路径稳、窗口合适的可以当作结论用,其余的先当作方向,等数据更充分之后再回头确认。
评估可信度可以先算一个简单的比例,就是订单数除以路径长度的平均值。这个比例越高,说明单位路径上的样本越充足,结论的稳定性越好。
接着看路径长度分布的集中程度。多数路径长度接近,说明买家的决策模式比较统一,归因的干扰小;长度从一次到十几次都有,说明决策模式差异很大,归因结论要谨慎使用。
再看时间窗口的覆盖情况。统计一下有多少订单的路径长度超过了设定的窗口,超出的比例高,说明窗口设得太短,有一批订单的前段接触没有被算进去。
最后检查数据来源的覆盖范围。只覆盖广告和覆盖广告加自然流量,得到的路径完整度差别很大,完整度低的时候,结论要相应下调使用强度。
把这些检查做成一张简单的清单,每次得出结论之前过一遍。清单不复杂,但它能有效地把不可靠的结论挡在使用之前。
有一个判断可信度的简单办法是做一次内部一致性检验。把同一批订单按两种不同的口径各算一遍,看两份结果的排序差异有多大。如果两种口径下排在前列的词基本一致,说明这批数据的结论比较稳固;如果两份结果差别很大,说明这批数据对口径很敏感,任何一个结论都不能直接用,需要更多数据或者换一个更稳定的观察方式。
还有一个边界是关于季节性。旺季和淡季的买家结构、决策速度、路径长度往往都不一样,用旺季数据得出的归因结论,直接套到淡季上往往会偏。稳妥的做法是把旺季和淡季的结论分开统计,各自形成一套参考,不要试图用一套结论覆盖全年,那样反而哪一段都不准。
最后一个边界是新链接。刚上架的链接样本少、路径短、买家以尝鲜为主,这个阶段的数据结构和大规模稳定销售之后差别很大。用新链接的数据去做归因,得出的结论主要反映的是早期买家的特点,不能代表这个商品稳定的买家群体,观察期至少要等到链接有了稳定的日销量之后再开始。

没有一种口径在所有维度上都占优,选择取决于你要回答的问题和手上的数据条件
辅助判断的几种办法
第一种办法是分组对照。留一部分词不投广告,看自然流量能不能把它们接住,再对比投了广告的那部分词的表现。两者的差就是这个词带来的净贡献。
这种办法的好处是接近真实的因果判断,因为它排除了自然流量的干扰。代价是需要留出空白、需要等一段时间,短期看不到结果,适合用在重要词的判断上。
第二种办法是做小幅度的增量测试。在某个词上多投一点预算,看订单增加了多少。增加的部分主要是这个预算带来的,这样能大致估算出这个词的边际效率。
第三种办法是人工观察。挑几个典型的买家,看他的完整路径是怎么走的,虽然不能代表整体,但能提供数据里看不到的细节,帮助你理解数据背后到底发生了什么。
这几种办法各有各的适用场景。分组对照适合重要决策,增量测试适合验证投放效率,人工观察适合补充理解。它们的作用是互相印证,不是互相替代。
做分组对照的时候,选哪部分词留白是有讲究的。应该选几个有代表性的词,而不是把表现最差的词挑出来不投,否则对比出来的差异里混着词本身的好坏,说明不了净贡献。
选的对照组要留足时间,至少覆盖一个完整的决策周期,不然长路径的订单还没有走完,对比结果会偏向短路径,得出一个不完整的结论。
做增量测试的时候,加的预算幅度要小,最好在现有基础上加一两成。加得太多会改变竞争环境,引入新的变量,测试的结果就不再只反映这个词本身的边际效率了。
人工观察挑选样本时,优先挑那些路径完整的订单,路径断在中间的订单看不到全貌,参考价值有限。数量不用多,十几个有代表性的就够了。
三种办法得出的结论最好互相印证一遍。如果三种办法都指向同一个词,那这个判断的可靠程度就很高;如果分歧很大,说明还有没弄清的因素,先别急着下结论。
分组对照在实际操作中有几种不同的做法。一种是把词彻底停掉看自然流量能不能接住,这适合判断这个词有没有自然需求的底子;另一种是把预算减半看订单掉多少,这适合判断这个词对预算的依赖程度。两种做法回答的问题不同,选之前先想清楚这次要弄清的是什么,避免做完了才发现测的不是自己关心的事情。
增量测试有一个容易踩的坑是同时段的其他变化。测试期间如果恰好赶上了类目大促或者竞品集中降价,订单的变化里就掺进了这些因素,无法确定哪部分来自加预算。所以安排增量测试的时候尽量避开大促,选一个相对平静的时间段,测试的结论才干净。
人工观察虽然样本少,但它有一个数据比不上的好处,就是能发现你原本没有预料到的路径。数据报表只呈现你设定好的维度,而人工看订单时,你可能会注意到买家在某个环节停留了很久、或者中途换了一个完全不同的搜索方向,这些意外的发现往往比验证既有假设更有价值,值得在常规分析之外定期做几次。

归因口径稳定下来之后,判断的反复明显减少,重点词的投入命中率逐步提升
归因结果怎么用
第一个用法是做相对比较。哪个词的贡献比另一个大,这个排序在多数情况下是相对稳定的,即便具体数值不准,排序本身仍然可以参考。
第二个用法是发现被低估的词。如果某个词在末次点击口径下表现一般,但路径分析里发现它频繁出现在成交路径的前段,那它可能是一个被低估的拉新词,值得给它更多资源。
第三个用法是调整预算的分配方向。归因结论不是精确的账本,但足以让你看出钱应该往哪个方向挪,把它当成方向指示而不是金额分配的依据。
第四个用法是验证调整有没有效果。口径固定之后,同一个词在调整前后的归因表现可以比较,这个比较虽然不精确,但用来判断方向对不对是够用的。
需要避免的用法是拿归因结果去精确考核某个人的工作。归因本身的误差就大于个人表现之间的差异,用它做精确考核,往往会得出站不住脚的结论,反而伤害团队判断。
把归因结果拿去做比较的时候,比较的对象要选择得当。同一个词在不同时间段的表现可以比较,不同词之间的比较要考虑它们各自的量级,量级差太远的词直接比贡献没有意义。
发现被低估的词之后,给它资源的方式要克制一些。不要一次性把预算提上去,先小幅增加,观察它的表现是不是能撑住,因为归因分析本身带有误差,直接把结论当成事实去重仓是有风险的。
调整预算的时候要留出观察期,期内不要再次调整。归因数据本身就有滞后,调整后立刻看数据会得到误导性的反馈,通常需要等一到两个完整的决策周期才看得清。
用归因结果验证效果的时候,比的是同一个口径下的前后变化,不是一个口径下的前和另一个口径下的后。跨口径的比较会得出一个虚假的改善,白白误导后面的决策。
最后建议每隔一段时间回头看看之前的归因结论有没有被后续数据推翻。被推翻的比例高,说明当前的判断方法还需要改进;比例低,说明这套方法在这个品类里是站得住的。
把归因结果用起来的关键在于给它设一个合理的职责范围。它可以参与预算分配的讨论,可以提示哪个词被低估了,可以用于观察调整后的方向对不对,这些都是它擅长的。它不适合承担精确的业绩核算、个人绩效的评定或者财务层面的对账,这些用途对精度的要求超过了归因本身能达到的水平,勉强使用只会带来争议。
在使用归因结论做决策时,建议配上一条验证回路。根据结论做了一个调整之后,过一段时间回来看这个调整是否产生了预期中的变化。如果变化和预期一致,说明这次的归因判断是靠谱的;如果完全相反,就要回头检查是归因算错了,还是执行环节出了问题,把两种情况区分开,才不会把执行失误误判为归因方法有误。
最后要接受一个现实,归因是一个不断逼近的过程,不会有一个一劳永逸的准确答案。数据积累得越多、路径记录得越细、验证回路跑的次数更多,你的判断会越来越接近真实,但永远不会完全精确。把目标定在越来越接近上,比追求一步到位要踏实得多。