定义
AB页跳转核心算法是指用于AB跳转场景中,根据访客特征和实时反馈,动态决定将流量导向A页或B页的决策模型。它以多臂老虎机为数学框架,通过动态权重分配实现探索与利用的平衡,从而在保持合规安全的前提下最大化转化收益。核心目标是解决“哪些跳转策略在什么条件下生效”以及“如何分配流量比例”两个问题。
多臂老虎机(Multi-Armed Bandit)是一种在线决策算法,面对多个未知回报的选项,需要在积累信息的同时选择当前最优项。动态权重分配则是将各策略的累计收益转化为实时流量权重,使高回报策略获得更多流量,低回报策略逐步降权。两者结合构成AB页跳转的中枢决策层。
工作原理
多臂老虎机的决策循环
AB页跳转将每个跳转配置(例如UA过滤规则、IP信誉判断、设备指纹匹配后跳转的页面版本)视为一个“臂”。系统每次收到访问请求时,按当前概率分布选择某个臂执行跳转,并记录该次跳转的反馈信号(如点击、转化、停留时长或风控拦截概率)。经过N轮迭代,各臂的收益估计逐渐收敛。
核心的奖励函数可定义为 r = w1转化信号 - w2风险信号 + w3流量质量分。其中转化信号包括下单、注册、咨询等;风险信号包括被识别、封禁、举报等;流量质量分基于代理IP、设备指纹异常等。权重w根据业务场景设定,例如百度品专投放更重视风险系数。
常见策略
UCB1算法:为每个臂计算上置信界,选择上界最高的臂。公式中需包含平均收益p_j、尝试次数n_j和总次数T,即 UCB_j = p_j + sqrt(2ln(T)/n_j)。在AB页跳转中,该策略保证每个跳转配置至少获得一定探索流量,避免长期被低收益配置占用。
Thompson Sampling:假设每个臂的收益服从Beta分布Beta(α, β),每次从分布中采样,选择采样值最大的臂。α为成功次数,β为失败次数。实现简单且对延迟反馈鲁棒,适合AB页跳转中转化信号延迟到达的场景。
epsilon-greedy:以ε概率随机探索,1-ε概率选择当前最优臂。在AB页跳转冷启动阶段,ε可初始化为0.3,运行1000次后衰减至0.05,以保证稳定。
动态权重分配过程
动态权重分配基于各臂的收益估计实时更新。权重公式可设计为 softmax 温度函数,即 W_i = exp(θ_i / τ) / Σ exp(θ_j / τ)。其中θ_i是臂i的平均收益,τ是温度参数,控制分配集中程度。τ高时各策略流量接近,τ低时最优策略被集中。系统每5分钟或每100次请求重算一次权重,并同步到边缘节点。
为防止抖动,引入动量更新:W_new = αW_est + (1-α)W_old,α取0.2-0.4。实际部署中,ABcloakPro斗篷的跳转网关会在Redis中维护各臂的计数器,通过异步批处理更新权重,避免对实时请求产生额外延迟。
整体流程可概括为:请求到达 → 特征提取(UA、IP、设备指纹) → 匹配候选跳转策略 → 根据权重选择策略 → 执行跳转并记录结果 → 周期更新权重。
技术分类
按决策算法框架,AB页跳转核心算法可分为三类:
- 基于频率派的方法:以UCB族算法为代表,依赖中心极限定理计算置信区间。优点是收敛快,适合流量均匀的广告账户;缺点是参数敏感,需要定期清理不再使用的臂。
- 基于贝叶斯的方法: 包括Thompson Sampling和Bayesian UCB。先验可注入业务经验(例如新策略初始α=1,β=9),对延迟反馈容忍度高,适合AB页跳转中转化周期较长的情况。
- 基于对抗扰动的方法: 如EXP3算法,适用于可能出现非平稳环境(竞争对手改变审核策略)时的流量分配。EXP3通过指数权重更新,可快速追踪变化,但方差较大,需要配合风险限额。
按决策粒度可分为站点级、策略组级和会话级。站点级对整个域名流量做统一分配;策略组级将流量划分多个池子,如“百度来源组”、“Google来源组”分别运行独立的多臂老虎机;会话级则为单个用户维持独立权重状态,适合复购行为明显的业务。
按反馈类型还可分为即时反馈型和延迟反馈型。即时反馈型直接使用落地页点击或转化数据;延迟反馈型需将缺失转化归因到最初跳转策略,常用方法包括Delayed Bandit和Survival Analysis。
应用场景
AB页跳转核心算法主要应用于竞价广告投放中的落地页优化。以Google Ads或百度竞价为例,广告主使用ABcloakPro斗篷搭建跳转网关:搜索引擎抓取页面时返回合规的A页,真实用户到达时根据算法选择最合适的B页(如带在线咨询窗口或特定优惠的页面)。在实际投放中,多臂老虎机每天处理上百万次请求,能在3-5天内确定最优跳转组合。
另一类场景是广告审核策略自适应。不同广告账户的审核严格度不同,算法将“跳转后展示的页面版本”作为臂,根据是否被拒登、账户是否受限等信号动态分配。例如某账户使用“视频+短文案”的B页被审核概率为4%,而“图文+联系方式”版本被审核概率为9%,算法会逐步将流量导向低风险版本,同时保留5%的探索流量。
还用于多地区投放。当同一广告活动在欧洲和东南亚投放时,不同地区的访客对落地页的偏好差异大。算法针对每个地区独立运行,动态调整权重至对应地区表现最好的页面,减少人工调价和页面部署工作量。
与相邻概念对比
AB页跳转核心算法常与A/B测试混淆。A/B测试是统计假设检验,以固定样本量和显著性水平评估两个页面是否有显著差异,目的是验证假设;多臂老虎机则是优化,不断将流量倾斜到当前收益最高的策略,没有固定样本量。在AB页跳转场景中,A/B测试多用于冷启动前的预研究,多臂老虎机用于在线迭代。
与灰度发布的区别:灰度发布按版本逐步放量,以稳定性为主要目标,通常采用固定的比例递增(例如10%、50%、100%),且需要人工确认;动态权重分配根据收益实时调整,不需要人工介入,且可能出现权重向非预期策略漂移,因此需要设置最低流量保护线。
与传统的规则引擎(如仅丢弃或转发某些UA)相比,核心算法引入了反馈闭环。规则引擎的准确率依赖专家经验,算法则能够自动发现“新的风险UA”与“高转化用户”之间的隐性特征组合。但算法的解释性较弱,需要记录决策日志用于事后分析。
常见问题
多臂老虎机与强化学习是什么关系?
多臂老虎机是强化学习的简化形式,只有单步决策,不涉及状态转移。在AB页跳转中,每次请求的决策不会改变用户状态,所以用多臂老虎机足够;如果考虑用户连续访问的多步交互,则需要扩展到上下文老虎机(Contextual Bandit)或马尔可夫决策过程。
如何解决冷启动问题?
冷启动时每个臂的尝试次数为0,可选方式包括:先给每个臂分配等量流量收集500次数据;使用贝叶斯先验注入历史经验;或者将新的跳转策略以10%的固定流量先运行24小时,再纳入算法决策。ABcloakPro斗篷的实践中,冷启动阶段通常设置最小流量下限,各臂至少获得总流量的2%至5%。
动态权重分配会收敛到最优解吗?
在平稳环境中,Thompson Sampling和UCB的遗憾值(Regret)均收敛于对数增长,即无限次决策后选择最优臂的概率趋向1。但在广告审核环境存在非平稳性,审核规则会变化,因此算法不会永久收敛,需要温度参数控制探索率,同时引入窗口滑动统计,只使用最近7天数据计算权重。
延迟反馈如何影响算法?
转化信号可能延迟数小时甚至数天。若未正确处理,早期决策会低估转化率。常见方案是采用“观测窗口截断”,只统计24小时内发生的转化;或者使用延迟老虎机算法,为每个臂维护未观测奖励的期望修正项。在具体实现中,需要将点击时间戳和转化时间戳联合存储,避免归因错位。
算法是否存在被反制的可能?
若对手识别出跳转网关的行为模式,可通过发送大量模拟流量干扰奖励估计,导致权重偏移。应对方法包括在奖励函数中加入流量异常惩罚项,对来自同一IP段或相同设备指纹的快速重复请求进行降权,同时定期重置低活跃度的臂。