Cloak技术是本文的核心主题。2023年夏天,上海做跨境保健品的老刘来找我,说他的Google Ads账户又挂了。这是他半年里第三次被封,每次封之前广告跑得好好的,但总在某个时间节点被识别出用了Cloak。他怀疑是服务商给他的系统太差,我帮他看了配置,发现斗篷脚本就写了三行判断——抓一下Google的User-Agent,匹配几个IP段,然后返回一个干净页面。这套逻辑放到三年前还有用,但到了2023年,Google风控早就换了一套玩法。
老刘的问题不是Cloak有没有用,而是他用的Cloak早就是淘汰货。这篇文章我会把平台风控到底怎么识别Cloak这件事拆开讲清楚,结合我自己做技术服务三年的真实数据,说说效果和风险分别在哪里。
Cloak被识破的核心:风控系统在比对什么
广告平台的风控不是某一天突然发现你的页面不对,而是持续在收集访问数据,然后跟它认定的基线做比对。基线就是正常访客的行为模式,包括请求链路的完整性、浏览器指纹的合理性、访问频次分布、停留时长、滚动行为等一系列维度。
很多人以为Cloak就是在服务端判断一下来的是不是爬虫,是就返回白页。平台的风控早就不是靠IP和UA判断了,而是看“整条访问链路是否符合一个真实用户的画像”。如果你的识别逻辑只停留在IP匹配,那你给爬虫返回的页面和给真人返回的页面之间,在响应速度、页面结构、Cookie写入方式、TLS握手参数上都会留下痕迹。风控把这些数据拉出来做关联分析,很快就能锁定你。
三个最容易被识破的技术原因
第一个原因:TLS指纹特征不一致
2024年以后Google在风控体系里加入了TLS指纹检测。真实的Chrome浏览器发起HTTPS请求时,TLS握手过程有固定的指纹特征,包括支持的加密套件、扩展顺序、椭圆曲线参数等。而很多Cloak服务端是用PHP的cURL或者Python的requests库发起请求的,这些库的TLS指纹跟Chrome完全不同。
风控系统在服务端把TLS指纹提取出来一比对,发现你的访问请求跟正常Chrome差一大截,直接就把这次请求标记为高风险。这跟你返回什么页面内容已经没关系了,链路源头就不正常。
应对方式是用Playwright或者Puppeteer控制一个完整的浏览器内核去发出请求,让TLS指纹跟Chrome完全一致。同时还要注掉navigator.webdriver属性,不然无头浏览器本身的特征也会暴露。
第二个原因:判定逻辑只做一次,没有持续校验
不少Cloak的流程是:第一次访问时判断IP或UA,如果是爬虫就返回白页,同时种一个标记cookie。这个逻辑看着没问题,但平台的审核爬虫在后续会换不同的IP、清掉Cookie重新访问你的页面。第二次进来时识别不到之前的标记,又走了真实页面的渲染逻辑,直接暴露。
真正稳定的配置是用Redis做会话状态管理,把IP、设备指纹、cookie三者的关联结果存下来,至少要保存48小时。每次请求都要先查状态,再决定返回哪个版本的页面。同时要针对未命中的请求单独走一套模拟真人行为的降级逻辑,不要直接放行到真实页面。
第三个原因:页面内容相似度太高
你给审核爬虫看的白页和给用户看的真实页面,如果标题、关键词、布局结构完全两套,审核系统只需要把两个页面做一次相似度比对,然后看哪些词被定向替换了,就能判断你在做Cloak。
我见过一个极端的案例,客户做了几十套页面,每套首页标题都换成主投关键词,图片、排版、间距都不一样,结果还是被识别出来。原因是页面里埋的同一个统计代码的DOM结构完全一致。现在平台的检测会去分析DOM树的相似性,只要你两套页面的结构重合度太高,就存在风险。
改进方式是每次生成白页时对DOM节点做随机化处理,包括class名、ID、标签顺序和嵌套层次,让风控无法从结构上识别出页面的同源性。
真实效果:数据说话
讲完识破逻辑,说点实际的。Cloak技术在2025年还有没有效果?我的判断是有,但有效窗口期越来越短。
拿我服务的一个中东COD电商客户举例,他做的是瘦身咖啡,在Google Ads上属于受限品类,用标准落地页过不了审。去年底我们给他配了一套基于无头浏览器的Cloak系统,识别逻辑包含四层:TLS指纹校验、IP信誉库、浏览器Canvas指纹、以及访问速度的贝叶斯判断。
这套配置跑了两个半月,广告花费共7.4万美元,期间被Google爬虫识别到过一次,但我们在爬虫写回报告前就通过日志异常发现,紧急切了降级页面。账户最后保住,整体ROI在1:2.7。
另一个反面案例是在百度投放的仿站项目,客户图便宜用了一套市面上拼凑的PHP斗篷脚本,只做了UA和IP匹配。上线第三天,百度的爬虫用新的IP池直接抓到了真实页面,当天账户就被封了,里面还有8000块余额没提出来。
风险案例:账户冻结后的72小时
今年3月有个朋友账户被Google暂停,他第一时间把日志发给我分析。我们查到的原因是,他用的SaaS斗篷平台在更新规则时引入了一个新的IP段,而恰巧这个IP段覆盖了Google新增的云爬虫网段。爬虫顺着白页摸到了真实页面,页面里放了带夸张承诺的文案,直接被判违规。
账户被暂停后申诉窗口是72小时,Google要求补充产品合规资质、落地页审核记录和投放授权书。这些材料准备起来本身就需要时间,而他在判断要不要承认用了Cloak这个问题上纠结了很久。最后我们建议他如实说明情况,承认是误用了第三方工具,请求恢复。结果申诉被驳回,账户注销,里面的6000多美金广告费到现在也没拿回来。
这个案例能说明的事情有三点:第一,SaaS型Cloak的规则更新不可控,风险全在客户那头;第二,账户一旦被判定违规,资金追回的概率极低;第三,不要在账户里放超出你承受能力的余额,永远是第一原则。
延长Cloak生命周期的方法
Cloak技术想用得久一点,不能只靠供应商,你自己至少要管好这几件事。
实时监控日志,别等封号再看数据
每天花至少二十分钟浏览Nginx访问日志,关注几个信号:来自云服务商IP段的请求数量有没有异常攀升,独立IP的访问频次是不是有规律的间隔,有没有特定的UA频率突然集中出现。出现这些情况基本意味着审核爬虫在对你站点做遍历扫描,需要立刻调整配置。
黑白名单要动态维护,不能一劳永逸
把Google和百度的爬虫IP段拉出来写死在规则里是最初级的做法。现在更有效的是把规则放到实时更新的库里面,每天自动同步新增的IP段,同时结合IP信誉评分做加权。遇到不确定的IP,宁可让它看到白页,也不要冒险暴露。
定期切换域名和落地方案
同一个域名不要连续用超过三个月