定义
百度斗篷风控模型是百度广告平台用于识别和拦截Cloak技术(斗篷技术)中多跳关联攻击的一套机器学习评估体系。所谓多跳关联攻击,是指攻击者通过多个中间实体(如共用代理IP、相同支付账户、相似页面模板)将表面无直接关联的多个广告账户、域名或落地页建立间接联系,从而规避百度基于单点维度的风险识别。该模型以图神经网络(Graph Neural Network, GNN)为核心算法,将账户、设备指纹、IP地址、页面内容、转化回传等实体构建为异构关系图,在图上完成风险传导与社区发现,精准识别那些跳过了直接关联检测的隐蔽作弊网络。
在百度斗篷的实际运营中,该模型是AB页跳转服务能否长期稳定运行的关键技术分水岭。相比早期基于规则匹配和阈值判定的风控方式,基于图神经网络的风控模型能够自动学习实体间的高阶关联特征,在毫秒级时间内完成从单次点击请求到跨账户全局风险图谱的推理,显著提升了对复杂作弊模式的识别精度。
工作原理
百度斗篷风控模型的工作原理可以拆解为四个核心阶段:实体识别与构图、邻居采样与特征聚合、风险评分计算、以及决策与反馈闭环。
实体识别与异构构图
模型首先将广告生态中的参与方抽象为不同类型的节点(Node),包括:账户节点(广告主ID、子账户ID)、设备节点(设备指纹、IMEI、OAID)、网络节点(IP地址、User-Agent指纹)、内容节点(落地页URL、页面DOM结构哈希、图片感知哈希)、以及行为节点(点击序列、转化回传事件)。这些节点之间的交互关系构成边(Edge),例如"账户A在设备D上登录"、"设备D通过IP X访问落地页"、"落地页P与落地页Q共享同一套页面模板"等。由此形成的图数据中,一个斗篷站群可能包含数千个账户节点与数万个设备、IP节点,边数量可达百万级。
多跳邻居聚合机制
图神经网络的核心操作是邻居消息传递。对于目标账户节点,模型并非只看其直接相连的一跳邻居(例如直接登录的设备),而是通过2至3层的图卷积或GraphSAGE采样,递归聚合二跳、三跳邻居的特征信息。举例来说:账户A与账户B从未共享过同一设备或IP,但账户A的落地页与账户B的落地页都引用了同一段被改写的JavaScript埋点代码,且该代码的变量命名习惯与某个已知作弊工具包完全一致。在一跳视角下,A与B毫无关联;但在二跳或三跳视角下,模型通过"落地页代码相似度"这个中间节点,将A与B关联到同一风险社区中。这种多跳聚合机制直接针对"多跳关联攻击"中的间接关联绕过手法。
特征聚合与风险评分
模型在聚合邻居信息后,为每个节点生成包含自身属性与邻居结构信息的嵌入向量(Embedding)。例如,一个账户节点的嵌入向量中会融合其直接设备的异常程度(如设备农场中常见的低端机型占比)、其关联IP的离散度、以及其页面内容的亲缘性系数。随后,这些嵌入向量经过一个全连接分类层,输出该账户或该次访问请求的风险评分(通常为0到1之间的连续值)。百度风控的判定阈值并非固定不变,而是根据业务场景动态调整——新账户的冷启动阶段阈值较宽松,而老账户一旦命中高危社区,阈值会收紧至0.15以下,直接触发人工审核或拒绝投放。
决策与反馈闭环
风控模型输出的风险评分传入决策引擎,产生三类动作:放行、验证码挑战、拒绝访问。针对斗篷场景,被判定为高风险的请求会被直接导向一个安全页面,而非用户原本想要看到的白帽页面或推广页面。同时,百度风控系统会将每次判定结果(包括误判与漏判样本)回流至标注系统,用于下一轮模型迭代训练,形成对抗演进的闭环。据业内对百度风控系统的逆向分析观察,该模型的特征更新周期通常在24至72小时之间,针对特定斗篷工具的识别规则会在工具更新后的数天内完成覆盖。
技术分类
从技术实现路径来看,当前百度斗篷风控模型中与图神经网络相关的识别方案主要分为以下三类:
基于同构图的社区发现方案
该类方案将账户与设备视为同一类节点,忽略实体类型差异,仅保留"关联"这一种边关系。通过Louvain或标签传播算法(LPA)在图中划分社区,再对社区整体密度、异常设备占比等指标做统计判别。该方案的优点是计算效率高,适合千万级节点的大规模全量扫描;缺点是丢失了丰富的边类型语义,对刻意伪装成跨类型关联的攻击识别率有限。在实际部署中,该方案多作为图神经网络模型的前置过滤层,用于缩小风险候选集。
基于异构图神经网络的端到端方案
这是当前对抗多跳关联攻击的主流方案。模型使用Relational Graph Convolutional Network(R-GCN)或Heterogeneous Graph Transformer(HGT)等架构,对不同类型节点和边使用独立的变化矩阵进行特征变换,再通过注意力机制学习不同类型邻居对目标节点的重要程度。该方案能够精确回答"账户A通过IP→设备→落地页模板→账户B"这条路径的风险传导强度。代价是训练与推理的算力开销较高,需要依赖GPU集群进行周期性批处理。在一份针对广告风控系统的技术调研中,R-GCN方案在关联账户召回率上相较传统GCN方案提升约17%至23%。
基于图采样与归纳学习的增量方案
由于斗篷站群的账户和域名新增速度极快,全量图训练无法满足实时性要求。GraphSAGE和Cluster-GCN等归纳式学习框架被用于解决这一动态图问题。模型只采样目标节点周围固定大小的邻居子图,不依赖全局图结构,因此新账户首次出现时即可被嵌入到特征空间中完成推理。该方案支持在线学习,百度风控可以做到分钟级新增节点入库并参与下一轮风险评分,对使用新注册域名、新租用IP段的斗篷攻击具备较强的时效性压制能力。
应用场景
百度斗篷风控模型在识别多跳关联攻击方面的典型应用场景包括以下三类:
站群账户关联矩阵识别
斗篷服务商通常为每个推广单元准备多个备用域名和账户,当主账户被处罚后立即切换备用账户。这些备用账户在注册时往往共用同一套营业执照或支付渠道。图神经网络模型能够在这些表面独立的账户之间,通过"共用资质→共用收款账户→共用落地页模板库"的多跳路径,识别出它们同属一个风控实体,从而在备用账户首次投放时就给予较高的初始风险分。
设备农场与代理IP池穿透
使用真实设备农场配合住宅代理IP是目前成本较高的斗篷方案。但同一设备农场中的设备在开机时间、系统语言、传感器校准数据等非显性指纹维度上存在高度统计相关性。这些相关性仅靠单个设备维度无法识别,但图神经网络可以将设备节点与其关联的IP节点、点击时间序列节点构成子图,通过社区密度检测发现这些设备其实共享同一条供电链路或同一台控制服务器。一旦模型在该社区中标记了少量已知作弊设备,整个社区的风险评分都会随之拉升。
落地页内容规避检测
斗篷中的白帽页面经常使用模板批量生成,同一模板的不同变体在DOM结构、CSS类名、甚至JS报错特征上高度相似。传统的内容指纹检测只能识别完全相同的页面副本。图神经网络将页面节点与其渲染后的DOM特征连接,并计算页面间的结构性相似度作为边权,使同源模板生成的数千个变体页面在图中形成一个紧密的簇,从而被整体识别为低质量或作弊内容源。
与相邻概念对比
为更清晰地界定百度斗篷风控模型中图神经网络识别多跳关联攻击的内涵,有必要与以下两个容易混淆的概念进行区分:
与设备指纹直接关联检测的区别
设备指纹检测(如通过Canvas指纹、WebGL指纹、AudioContext指纹做一对一匹配)属于一跳关联,即只判断两个请求是否来自同一物理设备。多跳关联攻击恰恰是针对这一机制设计的:攻击者使用指纹伪造工具为每台设备生成不同的伪装指纹,使设备维度的一跳匹配完全失效。图神经网络的价值在于,它并不依赖设备指纹的完全一致,而是观察设备与设备之间通过其他实体形成的间接路径——例如两台设备在特定时间段内访问了相同的一组落地页且访问顺序高度一致,这本身就是一种多跳关联信号。风控模型中的图神经网络实际是在设备指纹之上叠加了一层结构化的行为关联计算。
与规则引擎中的IP黑名单的区别
传统规则引擎维护一份恶意的IP地址段黑名单,命中即拦截。这种方式的局限在于攻击者可以快速轮换IP,且同一个IP在不同时间可能被不同质量的账户使用。图神经网络不依赖固定的黑名单,而是通过节点嵌入表征IP地址的行为模式。一个IP在图上如果持续与高风险账户社区产生连接,其自身的嵌入向量会逐渐向风险方向漂移,即使该IP从未出现在任何黑名单中,也会被模型给出较高的风险分。这种基于图结构动态嵌入的机制,本质上取代了静态黑名单的即时更新问题。
常见问题
多跳关联攻击与普通关联作弊的本质区别是什么?
普通关联作弊通常表现为直接共享设备、IP或支付信息,属于一跳范围内的显性关联。多跳关联攻击则通过设计中间实体或中间步骤将关联链条拉长,例如使用不同设备、不同网络、但共用一套行为脚本逻辑或一套页面埋点代码。多跳关联攻击的目的是让任何一个单一维度的检测器都无法单独发现两个实体之间的联系。
图神经网络模型在百度斗篷风控中的主要优势是什么?
主要优势在于对高阶特征组合的自动学习能力。传统机器学习模型需要人工构造交叉特征,且无法处理变长的关联路径。图神经网络通过消息传递机制,将邻居信息逐层压缩到节点嵌入中,使得模型能够自动发现"哪些类型的二跳甚至三跳路径组合是高风险的",并在推理阶段对未见过的新型关联模式保持一定的泛化能力。
模型是否会出现误判?百度斗篷中的正常运营者如何避免被误伤?
图神经网络模型的判定本质上是一种概率推断,必然存在误判空间。正常运营者如果长期使用同一设备、固定IP、且落地页跳转逻辑保持稳定,其账户节点在图中的邻居关系较为单调且与低风险社区聚类,风险评分会稳定在低位。频繁更换服务器、大量注册新域名、或者与已知异常社区产生过间接交互,都会导致节点的嵌入向量向高风险方向偏移。保持运营实体的行为一致性与网络拓扑的稳定性,是降低被误判概率的有效方式。
模型的训练数据来源于哪里?
训练数据主要来源于百度风控系统历史标注的作弊账户集合、人工审核确认的违规样本、以及通过蜜罐系统主动捕获的斗篷攻击样本。经过脱敏处理后,这些数据被组织成图结构用于模型训练。模型输出的预测结果会再次通过人工复核流程形成新标注,持续迭代优化。