← 返回 QuantGrowth 首页

广告系统多路召回全拆解:规则、协同过滤、双塔召回核心原理与落地优劣

广告
广告
广告系统多路召回全拆解:规则、协同过滤、双塔召回核心原理与落地优劣笔记配图
广告系统多路召回全拆解:规则、协同过滤、双塔召回核心原理与落地优劣笔记配图
广告系统多路召回全拆解:规则、协同过滤、双塔召回核心原理与落地优劣笔记配图
广告系统多路召回全拆解:规则、协同过滤、双塔召回核心原理与落地优劣笔记配图
广告系统多路召回全拆解:规则、协同过滤、双塔召回核心原理与落地优劣笔记配图
广告系统多路召回全拆解:规则、协同过滤、双塔召回核心原理与落地优劣笔记配图
广告系统多路召回全拆解:规则、协同过滤、双塔召回核心原理与落地优劣笔记配图

广告系统中的召回方式多样,各有千秋:规则召回稳定兜底,协同过滤经典实用,双塔向量则凭借深度学习成为个性化推荐的主力。

在广告系统的世界里,召回是地基,排序是上层建筑,而召回的核心目标,是从百万级广告池中快速筛出高质量候选集,快、全、准缺一不可。

做广告、推荐算法的同学都知道:召回是整个广告系统的地基。排序精不精细,决定点击率上限;但召回好不好,直接决定流量天花板。召回阶段的核心目标只有一个:从百万级广告池中,用极低耗时(RTB 百毫秒级),筛出千级高质量候选集,快、全、准缺一不可。

召回负责“广撒网”,排序负责“精捕鱼”。

一、规则召回:所有广告系统的「保底基石」

核心原理:基于业务硬规则、标签匹配、定向条件做精准筛选,无模型、无机器学习,纯逻辑匹配。
典型逻辑:用户性别/年龄/地域/兴趣标签 → 匹配广告定向人群、类目、关键词,比如「25 岁一线城市男性,召回数码、汽车类广告」。
优点

  • 绝对稳定、可解释性 100%,无黑盒问题,方便业务排查
  • 彻底解决冷启动,新用户、新广告无行为数据也能正常召回
  • 耗时极低、运维简单,适配所有流量场景

缺点

  • 只能匹配显性、已知兴趣,完全挖掘不到用户隐性偏好
  • 拓展性极差,极易同质化,流量利用率低
  • 依赖人工配置规则,人力成本高,无法适配复杂个性化场景

落地定位:全场景兜底召回,保证流量不空置。

二、经典的协同过滤:人以群分,物以类聚

协同过滤(Collaborative Filtering)算法在 1992 年诞生,是推荐、广告领域最经典的无监督召回算法,至今仍是各大广告平台的基础兜底策略。CF 完全依托用户行为数据挖掘兴趣,无需依赖广告内容特征。

下图用 User-CF 举例,用户 E 对四个商品的偏好和 B 最相似(余弦相似度最高),B 对书籍不喜欢,所以认为 E 也不喜欢书籍

余弦相似度计算

优点

  1. 不需要用户、广告物料特征
    仅依靠用户对广告的点击、曝光、转化行为即可计算相似度,不用解析文案、图片、标签、用户画像,省去特征工程。
  2. 架构简单,上线和维护成本低
    无复杂模型结构,仅做相似度矩阵计算,推理速度快。

缺点

  1. 新用户、新广告完全无法召回
    必须有历史行为交互数据才能计算相似度,零行为样本无任何关联依据,直接失效。
  2. 内容高度同质化,易形成信息茧房
    始终推荐和历史行为最相似的广告,不断强化单一偏好,缺少差异化候选。
  3. 数据稀疏场景下效果大幅下滑
    大部分用户点击行为极少,交互矩阵过于稀疏,相似度计算失真,召回精准度暴跌。
  4. 无法利用物料先验信息,泛化能力弱
    不理解广告本身内容属性,不能根据广告标题、类目、人群定向做逻辑兜底,场景迁移能力差。

三、双塔向量召回:工业界当前「主流顶梁柱」

DSSM(Deep Structured Semantic Models)也叫深度语义匹配模型,最早是微软 2013 年发表的一篇应用于 NLP 领域中计算语义相似度任务的文章。

user 侧一个塔,item 侧一个塔。user 侧特征和 item 侧特征分别经过各自的 DNN(Deep Neural Networks)后得到 user embedding 和 item embedding(要保证维度相同)

深度学习双分支建模,用户塔 + 广告塔分别编码向量,通过向量相似度做召回。 用户塔:编码用户画像、历史行为、上下文、场景特征;广告塔:编码广告类目、图文、统计、标签特征,最终向量空间近邻匹配召回。

计算两个语义向量的 cos 距离来表示语义相似度

优点

  • 融合全方位特征:同时利用行为、内容、画像、场景信息,表达能力远超规则、CF
  • 缓解数据稀疏问题,长尾用户、长尾广告召回效果显著提升
  • 向量检索高效,适配百万级广告池,兼顾精度和速度

缺点

  • 依旧依赖历史行为数据,纯新用户、纯新广告冷启动仍弱势
  • 向量黑盒、可解释性差,业务调优、问题排查难度大
  • 模型训练、特征工程成本高,迭代周期长

落地定位:广告系统核心主力召回,承接大部分个性化流量,是平衡精度和覆盖度的最优解。

以上三种召回方式,各自有不可替代的业务定位,没有哪一种算法能够单独撑起广告召回全场景。
规则召回守住流量底线,保证新用户、新广告不会出现无内容可推的情况;协同过滤依靠用户行为共现关系,低成本挖掘群体共性偏好;双塔向量召回凭借深度学习强大的特征融合能力,成为个性化推荐的核心主力。

其他常见的召回还有内容/语义召回:解决「语义相似、字面不同」匹配问题。生成式召回:彻底颠覆传统「检索式召回」逻辑,传统方式是「从存量广告池中找匹配项」,生成式召回是模型直接生成用户当下最需要的广告特征,再回池匹配相似物料