← 返回 QuantGrowth 首页

会话序列反作弊:当真机农场、AI 画像骗过设备风控之后

广告
广告

黑产已经形成完整上下游供应链,从卡商、IP 代理、改机工具、群控设备再到最终广告变现,形成完整闭环,源源不断输出作弊流量。

很多风控系统过度依赖设备层特征:OAID、IDFA、IP、设备白黑名单。但真机设备农场、AI 动态画像造假、肉鸡设备可以把设备指标做到近乎完全正常。此时流量、会话、页面访问序列就成为非常关键的第二道防线

一、流量模型反作弊整体技术架构

整套体系自上而下分为接入层、业务模型层、数据层、平台层,底层由安全知识库做支撑。

  1. 接入层:实时、准实时、离线服务

    接收广告全链路事件:广告请求、曝光、点击、下载、激活、转化。

  • 实时服务:点击发生时毫秒级风险打分,直接拦截高风险广告点击;
  • 准实时服务:分钟级会话聚合,识别短时间团伙行为,做二次复核;
  • 离线服务:T+1 批量审计全量流量,挖掘慢作弊、长周期伪造用户,输出巡检与处罚名单给到下游业务、联盟媒体结算系统。
  1. 业务模型层:面向广告作弊场景的专项模型

    基于流量数据产出四大核心业务模型:点击反作弊审计模型、请求‑点击风险预估模型、行为相似团伙模型、异常模式感知模型

  • 点击反作弊审计模型:对已经发生的点击做事后审计,区分真实点击、大点击、诱导点击、脚本点击;
  • 请求点击风险预估模型:广告请求阶段前置打分,在还没有产生点击时识别高风险流量源;
  • 行为相似团伙模型:利用会话、页面流转相似度,挖掘群控、真机农场、肉鸡羊毛党团伙;
  • 异常模式感知模型:无监督模型,识别偏离正常大盘分布的异常流量模式,用来发现黑产新变种。
  1. 数据层:构建广告全链路流量特征体系

    流量模型不只是看单条点击事件,而是把一次用户会话完整的行为全部纳入特征。

    核心特征维度:

  • 基础维度:IP、媒体渠道、广告位、SDK 版本、地域、运营商;
  • 转化链路指标:广告请求量、曝光、点击率、曝光‑点击间隔、点击‑下载间隔、点击‑激活间隔 CTIT;
  • 会话页面访问特征(流量模型最核心):用户本次会话访问了哪些页面、页面访问顺序、停留时长、跳转深度、是否访问登录、消息、客服、个人中心、商品详情、购物车。
  • 衍生数据:安全画像、用户行为序列、设备‑IP‑账号关联图谱,用来识别团伙关联关系。
  1. 平台层:算法算力底座

    依托 TensorFlow、PyTorch 等机器学习、深度学习框架,引入图网络算法。

  • 机器学习:做风险二分类、风险预估;
  • 深度学习:处理页面访问序列、会话行为序列;
  • 图网络:挖掘设备、IP、账号、媒体之间的团伙关联,识别真机群控、众包羊毛党、混血作弊用户。

底层安全知识库沉淀黑名单、作弊模板、攻击模式、规则样本,为上层模型提供训练样本与先验知识。

二、流量模型的核心杀伤点:页面访问路径异常

作弊流量典型页面访问序列:homepage → list 列表页 → detail 商品详情页,然后直接点击广告。会话结束。

作弊者几乎不会访问登录页 login、消息 message、客服 service、个人中心、购物车等业务功能页面。整个会话全部围绕广告点击展开。

真实普通用户行为:访问首页、浏览商品,会跳转登录、查看消息、找客服咨询、加入购物车,页面访问种类丰富,行为目的是 “消费、咨询、购物”,广告只是浏览过程中间的一环。

黑产哪怕用真实真机、住宅代理 IP、AI 生成设备画像,也很难完整模拟普通用户复杂多样的业务页面交互。

  • 模拟器、真机农场脚本为了追求效率,只会执行完成广告点击必要页面;
  • 肉鸡设备(安卓无障碍脚本、iOS 快捷指令),脚本任务就是点击广告,不会额外去调用登录、消息、客服页面;
  • 众包羊毛党兼职为快速刷任务,尽可能少打开无关页面,快速完成广告点击拿佣金。

页面访问序列特征,可以有效识别:

  • 大点击 Click Spamming
  • 真机设备农场伪造归因
  • 肉鸡设备、无障碍脚本作弊
  • 部分混血用户作弊(真实设备,但后链路行为由脚本接管)

三、流量模型如何对抗前文提到的各类广告作弊

1、对抗大点击、无感曝光伪造归因

大点击会大量产生点击事件,但会话页面结构极度单一。大量点击对应的 session 只有首页、列表、详情,没有业务交互行为;

无感曝光:大量曝光上报,但对应的用户会话不存在完整页面浏览记录,曝光事件孤立,没有前置页面访问上下文。

2、对抗劫持归因(Click Injection)

劫持归因 CTIT 时间差很短,叠加流量会话特征:激活瞬间才产生点击事件,该点击对应的 session 没有前置正常页面浏览序列,只有一次广告点击。即使设备是真机,也可以识别异常。

3、对抗 VTA 抢归因(虚假无感曝光抢浏览归因)

作弊媒体上报海量 VTA 曝光,但是曝光事件缺少页面上下文,用户会话没有真实页面渲染访问记录。流量模型识别大量孤立曝光事件,降低这类曝光在 VTA 归因中的权重。

4、对抗真机群控、AI 动态画像造假伪造用户

黑产可以把设备指纹、传感器数据做的高度仿真,但是脚本驱动的会话页面流转模式高度趋同。通过行为序列相似度、图网络聚类,把一批行为路径高度一致的真机设备挖掘出来,识别设备农场团伙。

5、对抗混血用户作弊(真假混合用户)

用户第一次下载打开是真实行为,但后续留存、事件由脚本接管。流量模型区分:首次会话页面访问丰富真实,但后续活跃会话页面只有首页、商品详情、广告点击,业务页面访问缺失,识别后链路脚本接管行为。

四、流量模型的局限性,不能单独作为反作弊的银弹

流量模型有明显短板,工程落地必须和设备特征、IP 特征、归因审计联合使用。

  1. 正常用户也会出现简单页面访问路径:部分真实用户打开 APP 只看首页和商品详情就点击广告,会产生样本噪声,需要模型做概率打分,不能简单一刀切拦截;
  2. 高阶黑产可以模拟更多页面跳转:黑产可以在脚本内增加访问 login、message 的伪调用,用来混淆页面特征;需要结合每个页面真实停留时长、接口调用真实性综合判断;
  3. 只适用于有页面访问的场景:纯 SDK、小游戏、短视频类没有 web/app 页面流转场景,页面序列特征失效,需要改用事件序列特征。

行业成熟做法:流量行为模型输出风险分,和设备风险分、IP 风险分做加权融合,共同输出最终作弊风险等级。

五、工程落地的实践经验

  1. 不要只使用单条点击事件做特征,一定要以 session 会话为最小分析单元,把一次会话所有请求、页面、广告事件聚合;
  2. 线上实时模型优先使用轻量化统计特征,复杂序列、图团伙计算放到准实时、离线环节;
  3. 页面访问序列不要硬规则 “必须访问 XX 页面”,用深度学习序列模型学习大盘正常分布,识别偏离分布的异常会话;
  4. 离线审计输出的作弊结果,回灌安全知识库,迭代训练线上模型,形成闭环。