为什么召回、粗排可以用双塔、简单 MLP,精排一定要上 DeepFM、xDeepFM、MMOE、ESMM 这些复杂的深度模型?
到了精排阶段仅剩余百条内广告,算力压力极小,且直接决定广告竞价与平台收益。
- 依赖多维度高阶特征交叉,所以用 DeepFM/xDeepFM;
- 需同时拟合点击、转化、负反馈等冲突目标,所以用 MMOE;
召回、粗排受量级和时延限制只能轻量化;精排无强速度约束,以收益精准度为第一目标,因此使用复杂模型。
一、传统机器学习:LR / GBDT
在深度学习兴起之前,LR(Logistic Regression)逻辑回归因为其结构简单、可解释性强,是各大厂的主力模型。虽然叫回归,但实际是分类模型,常用于二分类(点击问题)

x 指的是所有特征组成的向量,w 是权重向量,CTR_predict 是最终模型的预测值

假设广告 1 和广告 2 出价相同,广告 1 的 pCTR 更高,则返回广告 1 给用户
早期精排全是线性模型:
- 人工特征交叉
- 记忆性强、泛化弱
- 无法自动学习高阶交叉特征
痛点:特征工程人工堆砌,无法适配海量用户 & 广告组合。
二、经典特征交叉 DeepFM/xDeepFM
目前**中小厂精排主流,**解决核心问题:自动高阶特征交叉
- FM 层:学习低维稀疏特征交叉(用户性别、类目、地域)
- DNN 层:学习高维隐性交叉
- 无需人工构造交叉特征

该图并列展示 DeepFM、PNN 两种经典 CTR 深度模型,二者共享底层输入与 Embedding 层,核心差异体现在二阶交互层(FM 层/Product 层)的输出流向;用两种连线区分网络权重类型:
- 红色边(weight-1 connections):固定权重 = 1,无任何可训练参数,仅做数据直通、复制、求和;
- 灰色边(normal connections):标准全连接边,带有可训练权重矩阵/偏置,是网络需要学习的参数。
优点:拟合能力远强于 LR,结构简单、易收敛、易上线
缺点:所有任务共享一套参数,多任务相互冲突
三、大厂标配的MMoE
MMoE(Multi-gate Mixture-of-Experts)多门控混合专家网络,是现在字节、阿里主流精排底座。广告精排不止一个任务:点击 CTR、下单 CVR、付费 ROI、负反馈、退款等。不同任务梯度方向完全不一样,单 DNN 会导致任务冲突、互相拖累。
MMoE 解决方案:
- 多个 Expert 网络共享底层特征
- 每个 Gate 为不同任务动态选择最优 Expert 组合
- 彻底解决 任务冲突、主次争抢参数
它的核心思想非常好理解:
不再用一套共享参数扛所有任务,而是用多个专家网络分工协作,每个任务自己动态选专家。
Shared Bottom + MMoE 架构极简解析

The architecture of shared bottom and multi-gated mixture-of-experts (MMoE)
3.1、Shared Bottom(共享底层)
- 最底层:所有任务共用同一组 Embedding + 基础网络层。
- 作用:通用特征提取,学习全部任务共享的基础用户 / 物品共性信息,大幅减少参数量、降低计算开销。
- 缺陷:纯共享底层易出现任务冲突(某一任务梯度主导参数更新,其他任务效果变差)。
3.2、Multi-gated Mixture-of-Experts(MMoE,多门控混合专家)
在共享底之上替换单一任务塔前层,拆分为专家网络 Expert + 门控网络 Gate:
Experts 专家层”语义重复,但按规则不进行推测性修改,所以输出原内容)
多个互相独立的小型子网络,每个 Expert 捕捉一类通用特征模式,不绑定具体任务。
Multi-Gate 多门控:每个任务单独配备一个 Gate 门控:
门控输入共享底层输出,输出一组权重,对所有 Expert 的输出做加权求和,生成该任务专属中间表征。
Task Towers 任务塔
每个任务再接独立全连接塔,输出该任务预测结果。
极简流程:输入特征 → 共享底层(Shared Bottom)→ 多个 Expert 并行提取不同特征表达 → 各任务 Gate 分别给 Expert 分配权重加权融合 → 各自任务塔输出预测。
MMOE 的出现,彻底终结了传统 Shared Bottom 单共享参数带来的任务拔河、梯度冲突、大小任务互相拖累的行业痛点。
它不再粗暴地让所有任务共用一套表征,而是通过多专家解耦 + 任务专属门控加权的软共享机制,让不同任务自适应匹配最适合自己的特征表达:CTR 侧重浅层兴趣特征、CVR 侧重深层转化特征、负反馈任务侧重风险偏好特征,真正实现各取所长、互不干扰、协同增益。
四、结束语
精排作为广告系统最深、最精细、最决定营收的核心模块,技术迭代从早期人工特征 LR,到自动交叉 DeepFM,再到现在多任务 MMoE + 因果 ESMM 组合,本质都是在解决同一个问题:更精准地预判用户真实意愿,在用户体验和平台收益之间找到最优平衡点。






