黑产已经形成完整上下游供应链,从卡商、IP 代理、改机工具、群控设备再到最终广告变现,形成完整闭环,源源不断输出作弊流量。
很多风控系统过度依赖设备层特征:OAID、IDFA、IP、设备白黑名单。但真机设备农场、AI 动态画像造假、肉鸡设备可以把设备指标做到近乎完全正常。此时流量、会话、页面访问序列就成为非常关键的第二道防线。
一、流量模型反作弊整体技术架构
整套体系自上而下分为接入层、业务模型层、数据层、平台层,底层由安全知识库做支撑。
-
接入层:实时、准实时、离线服务
接收广告全链路事件:广告请求、曝光、点击、下载、激活、转化。
- 实时服务:点击发生时毫秒级风险打分,直接拦截高风险广告点击;
- 准实时服务:分钟级会话聚合,识别短时间团伙行为,做二次复核;
- 离线服务:T+1 批量审计全量流量,挖掘慢作弊、长周期伪造用户,输出巡检与处罚名单给到下游业务、联盟媒体结算系统。
-
业务模型层:面向广告作弊场景的专项模型
基于流量数据产出四大核心业务模型:点击反作弊审计模型、请求‑点击风险预估模型、行为相似团伙模型、异常模式感知模型。
- 点击反作弊审计模型:对已经发生的点击做事后审计,区分真实点击、大点击、诱导点击、脚本点击;
- 请求点击风险预估模型:广告请求阶段前置打分,在还没有产生点击时识别高风险流量源;
- 行为相似团伙模型:利用会话、页面流转相似度,挖掘群控、真机农场、肉鸡羊毛党团伙;
- 异常模式感知模型:无监督模型,识别偏离正常大盘分布的异常流量模式,用来发现黑产新变种。
-
数据层:构建广告全链路流量特征体系
流量模型不只是看单条点击事件,而是把一次用户会话完整的行为全部纳入特征。
核心特征维度:
- 基础维度:IP、媒体渠道、广告位、SDK 版本、地域、运营商;
- 转化链路指标:广告请求量、曝光、点击率、曝光‑点击间隔、点击‑下载间隔、点击‑激活间隔 CTIT;
- 会话页面访问特征(流量模型最核心):用户本次会话访问了哪些页面、页面访问顺序、停留时长、跳转深度、是否访问登录、消息、客服、个人中心、商品详情、购物车。
- 衍生数据:安全画像、用户行为序列、设备‑IP‑账号关联图谱,用来识别团伙关联关系。
-
平台层:算法算力底座
依托 TensorFlow、PyTorch 等机器学习、深度学习框架,引入图网络算法。
- 机器学习:做风险二分类、风险预估;
- 深度学习:处理页面访问序列、会话行为序列;
- 图网络:挖掘设备、IP、账号、媒体之间的团伙关联,识别真机群控、众包羊毛党、混血作弊用户。
底层安全知识库沉淀黑名单、作弊模板、攻击模式、规则样本,为上层模型提供训练样本与先验知识。
二、流量模型的核心杀伤点:页面访问路径异常
作弊流量典型页面访问序列:homepage → list 列表页 → detail 商品详情页,然后直接点击广告。会话结束。
作弊者几乎不会访问登录页 login、消息 message、客服 service、个人中心、购物车等业务功能页面。整个会话全部围绕广告点击展开。
真实普通用户行为:访问首页、浏览商品,会跳转登录、查看消息、找客服咨询、加入购物车,页面访问种类丰富,行为目的是 “消费、咨询、购物”,广告只是浏览过程中间的一环。
黑产哪怕用真实真机、住宅代理 IP、AI 生成设备画像,也很难完整模拟普通用户复杂多样的业务页面交互。
- 模拟器、真机农场脚本为了追求效率,只会执行完成广告点击必要页面;
- 肉鸡设备(安卓无障碍脚本、iOS 快捷指令),脚本任务就是点击广告,不会额外去调用登录、消息、客服页面;
- 众包羊毛党兼职为快速刷任务,尽可能少打开无关页面,快速完成广告点击拿佣金。
页面访问序列特征,可以有效识别:
- 大点击 Click Spamming
- 真机设备农场伪造归因
- 肉鸡设备、无障碍脚本作弊
- 部分混血用户作弊(真实设备,但后链路行为由脚本接管)
三、流量模型如何对抗前文提到的各类广告作弊
1、对抗大点击、无感曝光伪造归因
大点击会大量产生点击事件,但会话页面结构极度单一。大量点击对应的 session 只有首页、列表、详情,没有业务交互行为;
无感曝光:大量曝光上报,但对应的用户会话不存在完整页面浏览记录,曝光事件孤立,没有前置页面访问上下文。
2、对抗劫持归因(Click Injection)
劫持归因 CTIT 时间差很短,叠加流量会话特征:激活瞬间才产生点击事件,该点击对应的 session 没有前置正常页面浏览序列,只有一次广告点击。即使设备是真机,也可以识别异常。
3、对抗 VTA 抢归因(虚假无感曝光抢浏览归因)
作弊媒体上报海量 VTA 曝光,但是曝光事件缺少页面上下文,用户会话没有真实页面渲染访问记录。流量模型识别大量孤立曝光事件,降低这类曝光在 VTA 归因中的权重。
4、对抗真机群控、AI 动态画像造假伪造用户
黑产可以把设备指纹、传感器数据做的高度仿真,但是脚本驱动的会话页面流转模式高度趋同。通过行为序列相似度、图网络聚类,把一批行为路径高度一致的真机设备挖掘出来,识别设备农场团伙。
5、对抗混血用户作弊(真假混合用户)
用户第一次下载打开是真实行为,但后续留存、事件由脚本接管。流量模型区分:首次会话页面访问丰富真实,但后续活跃会话页面只有首页、商品详情、广告点击,业务页面访问缺失,识别后链路脚本接管行为。
四、流量模型的局限性,不能单独作为反作弊的银弹
流量模型有明显短板,工程落地必须和设备特征、IP 特征、归因审计联合使用。
- 正常用户也会出现简单页面访问路径:部分真实用户打开 APP 只看首页和商品详情就点击广告,会产生样本噪声,需要模型做概率打分,不能简单一刀切拦截;
- 高阶黑产可以模拟更多页面跳转:黑产可以在脚本内增加访问 login、message 的伪调用,用来混淆页面特征;需要结合每个页面真实停留时长、接口调用真实性综合判断;
- 只适用于有页面访问的场景:纯 SDK、小游戏、短视频类没有 web/app 页面流转场景,页面序列特征失效,需要改用事件序列特征。
行业成熟做法:流量行为模型输出风险分,和设备风险分、IP 风险分做加权融合,共同输出最终作弊风险等级。
五、工程落地的实践经验
- 不要只使用单条点击事件做特征,一定要以 session 会话为最小分析单元,把一次会话所有请求、页面、广告事件聚合;
- 线上实时模型优先使用轻量化统计特征,复杂序列、图团伙计算放到准实时、离线环节;
- 页面访问序列不要硬规则 “必须访问 XX 页面”,用深度学习序列模型学习大盘正常分布,识别偏离分布的异常会话;
- 离线审计输出的作弊结果,回灌安全知识库,迭代训练线上模型,形成闭环。