大多数竞品创意库都以同样的方式走向失败。收集正常运转,素材不断累积,四个月后就有了九万个文件,没有人能搜索,同一条广告因为跟踪参数变了而出现了两百次,而策略人员根本不打开它,因为找到任何东西都比问同事更费时间。
工程问题不在于获取创意素材。而在于去重和元数据。把这两件事做对,一个规模不大的库就真正有用。做错了,数量只会让情况更糟,而不是更好。
先从许可的来源收集
在构建任何东西之前,先使用平台的广告库。Meta、Google、TikTok 和 LinkedIn 都发布了可搜索的活跃广告存档,它们是现存最便宜、最完整、最经得起推敲的竞品创意来源。
它们提供素材、广告主、投放日期,通常还有投放版位,而且格式本就是为查询而设计的。从这里开始,只为它们没覆盖的部分构建收集能力:展示和原生版位、零售媒体、联盟内容、邮件和新闻通讯版位、以及落地页素材。
这个顺序在商业上和法律上都很重要。花在重新收集存档已经公开的内容上的工程投入,就是没有花在没人拥有的那部分上的投入。
去重是整个系统的核心
同一条创意会以多种方式多次到达你手中:带着不同的跟踪参数重新投放、为不同版位调整尺寸、被 CDN 重新压缩、广告主重新上传但内容未变,或者被你自己的收集器捕获了两次。
精确文件哈希解决不了这个问题,因为一个字节的差异就会产生不同的哈希值,而 CDN 不断产生这类差异。真正有效的是分层的身份识别。
图像的感知哈希。 从图像结构而非字节计算出的哈希值,这样同一条创意的缩放版本或重新压缩版本会落在原始版本附近。存储哈希值,并按距离阈值分组,而不是按相等性分组。
视频的帧采样。 在固定间隔提取帧的感知哈希,加上时长。以不同比特率重新编码的视频会匹配;真正不同的剪辑版本则不会。
规范化的文案文本。 将大小写、标点和空白统一处理后的标题和正文。当素材本身被改动过时,文案往往是最稳定的识别标识。
一个创意家族,而不是一条扁平记录。 将变体归组到一个父记录下,并保持每个变体与之关联。变体数量是一个真实的信号,因为一个竞品为同一个概念制作四十个变体意味着他们在测试,这一点值得了解。
通过人工审核一组已匹配和未匹配的样本,凭经验确定距离阈值,然后记录得出的误合并率和误拆分率。没有这些数字,没人能衡量建立在这个库之上的报告存在多大误差。
使其可搜索,这意味着要提取文本
一张没人能搜索的图片就只是一个文件。创意库的大部分价值在于能够查询哪些竞品在使用某个特定说法,而这需要文字。
对图像创意运行 OCR 以捕获图片上的文案,那里往往是实际优惠信息所在。转录视频和音频。然后将提取的文本与结构化元数据一起建立索引。这一步,正是能被真正使用的库和被遗忘的存档之间的区别。
将提取的文本存为独立字段,而不是覆盖任何内容,并保留置信度分数。对风格化的广告文案做 OCR 并不完美,置信度低的提取结果应该明显标注为低置信度,而不是悄无声息地出错。
元数据方案
素材只是记录中较小的一半。
| 字段 | 说明 |
|---|---|
| 创意家族 ID | 去重的父记录,使变体归组 |
| 感知哈希 | 加上所用的算法和阈值,保证结果可复现 |
| 显示的广告主 | 与母品牌不同的情况比预期更常见 |
| 版位与投放位置 | 搜索、动态消息、展示、原生、零售媒体、邮件 |
| 市场 | 国家,若投放是本地化的则加上城市 |
| 首次及最后出现时间 | 你观测到的投放窗口,而非宣称的窗口 |
| 观测点 | 观测所来自的出口国家和城市 |
| 设备画像 | 桌面或移动,因为创意会有所不同 |
| 提取的文本 | OCR 或转录文本,带置信度分数 |
| 落地 URL 与重定向链 | 优惠实际所在的位置 |
| 来源 | 来自哪个广告库或哪个被观测到的投放位置 |
首次及最后出现时间是让库变成时间线的关键。一条投放了四个月的创意是被验证过的表现者;一条只投放了六天的创意则是失败的测试。这个区别构成了大部分战略价值,而它只需要一个字段。
收集层
对于广告库没有覆盖的部分,有两个属性很重要。
展示和原生创意是有定向投放的,所以观测点决定了你到底能看到什么。带国家定向的住宅代理可以让每个市场的收集来自该市场本身。使用 Shifter 网关时,定向和会话信息写在对 p.shifter.io:443 的凭据中:
customer-USERNAME-country-de-sid-creative-de-07-ttl-600:PASSWORD
country-de 设定市场,sid-creative-de-07 在一次收集过程中保持一个出口,这样一次快照中的创意就属于同一个连贯会话,而不是混杂着多个观测点。
第二个重要属性是带宽,创意收集异常沉重,因为负载本身就是重点所在。图片和视频就是素材,所以通常那种”屏蔽它们”的建议在这里不适用。相反,要控制的是数量:只要来源暴露出可以哈希或与已有内容比较的素材 URL,就在下载前先去重;跳过已经拥有变体的创意家族的重复抓取;在缩略图就能回答问题的地方限制分辨率。管道规模的确定方法见预测住宅代理带宽用量,成本控制手段见削减代理带宽成本。
保持请求速率正常并配以真实的退避策略,如速率限制与请求节流中所述。
关于版权,直白地说
竞品的创意是他们的受版权保护的作品。为内部竞争分析收集它属于正常的商业研究。重新发布它则不然。
让库保持可辩护性的实际规则:保持内部化,置于访问控制之下,不要在任何面向客户或公开的内容中呈现它。不要在自己的广告、网站或已发布内容中使用竞品的素材。在内部演示文稿中注明出处,并在每条记录上保留来源和日期。设定保留期限,而不是永久保存所有内容。任何外部使用之前,包括会流出公司的销售演示文稿,都要先咨询意见。
不要点击竞品广告以到达其创意或落地页。点击会让他们花钱,这就把观察变成了干扰;应该从标记代码和重定向链中解析目的地。更广泛的框架见用于竞品广告情报的住宅代理。
一个可运作的库能用来做什么
四个问题证明了构建这个库的价值,它们都是对元数据的查询,而不是对素材的浏览。
竞品在做什么说法,在哪里做。 按市场切分,对提取的文案进行文本搜索。
什么留存下来。 按观测到的投放时长排序的创意,这是最接近表现效果的公开替代指标。
在测试什么。 每个创意家族的变体数量,以及新家族出现的速度。
定位何时发生了变化。 携带新说法的创意家族的首次出现日期时间线,常常能展现出逐市场推出的过程。
常见问题
库应该追溯多远?
足以确定什么能持久留存,这通常意味着一年。超过这个期限的保留很少会改变决策,反而增加了你所持有内容的版权风险面。
我应该存储素材本身还是只存储 URL?
存储素材本身。创意 URL 会失效,一个满是死链接的库不是库。同时也存储 URL,用于溯源。
这些项目失败的最常见原因是什么?
没有去重,其次是没有文本提取。前者让库因数量过大而无法使用,后者让库无法被搜索。
我能在公开博客文章或广告中展示竞品创意吗?
未经咨询不能。内部分析是安全的用法。公开发布是别人的版权决定,不是你的。
结论
竞品创意库是一个附带文件的元数据产品。先查询官方广告库,只收集它们没覆盖的部分,给每个素材赋予感知身份,使变体归组而不是堆积,提取文本使其可搜索,记录首次和最后出现时间,以便区分被验证过的创意和失败的测试。