← 返回 QuantGrowth 首页

召回粗排主打轻量化,为何精排阶段得上 DeepFM、MMOE 与 ESMM?

广告
广告
召回粗排主打轻量化,为何精排阶段得上 DeepFM、MMOE 与 ESMM?笔记配图
召回粗排主打轻量化,为何精排阶段得上 DeepFM、MMOE 与 ESMM?笔记配图
召回粗排主打轻量化,为何精排阶段得上 DeepFM、MMOE 与 ESMM?笔记配图
召回粗排主打轻量化,为何精排阶段得上 DeepFM、MMOE 与 ESMM?笔记配图
召回粗排主打轻量化,为何精排阶段得上 DeepFM、MMOE 与 ESMM?笔记配图
召回粗排主打轻量化,为何精排阶段得上 DeepFM、MMOE 与 ESMM?笔记配图
召回粗排主打轻量化,为何精排阶段得上 DeepFM、MMOE 与 ESMM?笔记配图

为什么召回、粗排可以用双塔、简单 MLP,精排一定要上 DeepFM、xDeepFM、MMOE、ESMM 这些复杂的深度模型?

到了精排阶段仅剩余百条内广告,算力压力极小,且直接决定广告竞价与平台收益。

  • 依赖多维度高阶特征交叉,所以用 DeepFM/xDeepFM;
  • 需同时拟合点击、转化、负反馈等冲突目标,所以用 MMOE;

召回、粗排受量级和时延限制只能轻量化;精排无强速度约束,以收益精准度为第一目标,因此使用复杂模型。

一、传统机器学习:LR / GBDT

在深度学习兴起之前,LR(Logistic Regression)逻辑回归因为其结构简单、可解释性强,是各大厂的主力模型。虽然叫回归,但实际是分类模型,常用于二分类(点击问题)

x 指的是所有特征组成的向量,w 是权重向量,CTR_predict 是最终模型的预测值

假设广告 1 和广告 2 出价相同,广告 1 的 pCTR 更高,则返回广告 1 给用户

早期精排全是线性模型:

  • 人工特征交叉
  • 记忆性强、泛化弱
  • 无法自动学习高阶交叉特征

痛点:特征工程人工堆砌,无法适配海量用户 & 广告组合。

二、经典特征交叉 DeepFM/xDeepFM

目前**中小厂精排主流,**解决核心问题:自动高阶特征交叉

  • FM 层:学习低维稀疏特征交叉(用户性别、类目、地域)
  • DNN 层:学习高维隐性交叉
  • 无需人工构造交叉特征

该图并列展示 DeepFM、PNN 两种经典 CTR 深度模型,二者共享底层输入与 Embedding 层,核心差异体现在二阶交互层(FM 层/Product 层)的输出流向;用两种连线区分网络权重类型:

  1. 红色边(weight-1 connections):固定权重 = 1,无任何可训练参数,仅做数据直通、复制、求和;
  2. 灰色边(normal connections):标准全连接边,带有可训练权重矩阵/偏置,是网络需要学习的参数。

优点:拟合能力远强于 LR,结构简单、易收敛、易上线
缺点:所有任务共享一套参数,多任务相互冲突

三、大厂标配的MMoE

MMoE(Multi-gate Mixture-of-Experts)多门控混合专家网络,是现在字节、阿里主流精排底座。广告精排不止一个任务:点击 CTR、下单 CVR、付费 ROI、负反馈、退款等。不同任务梯度方向完全不一样,单 DNN 会导致任务冲突、互相拖累

MMoE 解决方案:

  • 多个 Expert 网络共享底层特征
  • 每个 Gate 为不同任务动态选择最优 Expert 组合
  • 彻底解决 任务冲突、主次争抢参数

它的核心思想非常好理解:
不再用一套共享参数扛所有任务,而是用多个专家网络分工协作,每个任务自己动态选专家。

Shared Bottom + MMoE 架构极简解析

The architecture of shared bottom and multi-gated mixture-of-experts (MMoE)

3.1、Shared Bottom(共享底层)

  • 最底层:所有任务共用同一组 Embedding + 基础网络层
  • 作用:通用特征提取,学习全部任务共享的基础用户 / 物品共性信息,大幅减少参数量、降低计算开销。
  • 缺陷:纯共享底层易出现任务冲突(某一任务梯度主导参数更新,其他任务效果变差)。

3.2、Multi-gated Mixture-of-Experts(MMoE,多门控混合专家)

在共享底之上替换单一任务塔前层,拆分为专家网络 Expert + 门控网络 Gate

Experts 专家层”语义重复,但按规则不进行推测性修改,所以输出原内容)

多个互相独立的小型子网络,每个 Expert 捕捉一类通用特征模式,不绑定具体任务。

Multi-Gate 多门控:每个任务单独配备一个 Gate 门控
门控输入共享底层输出,输出一组权重,对所有 Expert 的输出做加权求和,生成该任务专属中间表征。

Task Towers 任务塔

每个任务再接独立全连接塔,输出该任务预测结果。

极简流程:输入特征 → 共享底层(Shared Bottom)→ 多个 Expert 并行提取不同特征表达 → 各任务 Gate 分别给 Expert 分配权重加权融合 → 各自任务塔输出预测。

MMOE 的出现,彻底终结了传统 Shared Bottom 单共享参数带来的任务拔河、梯度冲突、大小任务互相拖累的行业痛点。

它不再粗暴地让所有任务共用一套表征,而是通过多专家解耦 + 任务专属门控加权的软共享机制,让不同任务自适应匹配最适合自己的特征表达:CTR 侧重浅层兴趣特征、CVR 侧重深层转化特征、负反馈任务侧重风险偏好特征,真正实现各取所长、互不干扰、协同增益

四、结束语

精排作为广告系统最深、最精细、最决定营收的核心模块,技术迭代从早期人工特征 LR,到自动交叉 DeepFM,再到现在多任务 MMoE + 因果 ESMM 组合,本质都是在解决同一个问题:更精准地预判用户真实意愿,在用户体验和平台收益之间找到最优平衡点。