スクレイピング

自動スクレイピングで構築する競合クリエイティブライブラリ

クリエイティブライブラリは重複排除とメタデータの問題であり、ダウンロードの問題ではない。検索可能かつ合法的な状態を保つための構築方法。

Chris Collins

Chris Collins

2026年9月10日 · 1 分で読める

競合クリエイティブライブラリのほとんどは、同じようにして死んでいく。収集は機能し、アセットは蓄積されるが、4か月後には9万ファイルが存在し、誰も検索できず、トラッキングパラメータが変わっただけで同じ広告が200回出現し、何かを探すよりも同僚に聞いた方が早いために誰もストラテジストが開こうとしない。

エンジニアリング上の問題はクリエイティブの取得ではない。重複排除とメタデータである。この2つを正しく行えば、小規模なライブラリでも真に有用になる。誤れば、量が増えるほど事態は悪化する。

まず許可された情報源から収集する

何かを構築する前に、プラットフォームの広告ライブラリを利用する。Meta、Google、TikTok、LinkedInはいずれも稼働中の広告を検索可能な形でアーカイブとして公開しており、それは既存する競合クリエイティブの情報源の中で最も安価で、最も網羅的で、最も正当性のあるものである。

これらはアセット、広告主、掲載期間、そしてしばしば掲載面までも、照会されることを前提とした形式で提供してくれる。まずそこから始め、それらがカバーしていない部分、すなわちディスプレイやネイティブの掲載面、リテールメディア、アフィリエイトコンテンツ、メールやニュースレターの掲載、ランディングページのアセットに限って収集を構築する。

この順序は法的にだけでなく商業的にも重要である。アーカイブがすでに公開しているものを再収集するために費やされるエンジニアリングの労力は、誰も持っていない部分に費やされない労力である。

重複排除がシステムの核心である

同じクリエイティブは何度もあなたのもとに届く。トラッキングパラメータを変えて再配信されたり、異なる掲載面向けにリサイズされたり、CDNによって再圧縮されたり、変更なしに広告主によって再アップロードされたり、あるいは自社の収集システムによって二重に取得されたりする。

厳密なファイルハッシュではこれを解決できない。1バイトの違いでも異なるハッシュが生成され、CDNはそうした違いを絶えず生み出すからである。有効なのは階層化されたアイデンティティである。

画像に対する知覚ハッシュ。バイト列ではなく画像の構造から計算されるハッシュであり、同じクリエイティブのリサイズ版や再圧縮版が元のものに近い値になる。ハッシュを保存し、等価性ではなく距離のしきい値でグループ化する。

動画に対するフレームサンプリング。一定間隔でのフレームの知覚ハッシュと、それに加えて再生時間を用いる。異なるビットレートで再エンコードされた動画は一致するが、本当に異なるカット版は一致しない。

正規化されたコピーテキスト。見出しと本文について、大文字小文字、句読点、空白を正規化したもの。アセット自体が作り直された場合でも、コピーが最も安定した識別子であることが多い。

フラットなレコードではなく、クリエイティブファミリー。バリアントを親の下にグループ化し、すべてのバリアントをそれにリンクさせておく。バリアント数は実質的なシグナルであり、ある競合が1つのコンセプトについて40のバリアントを制作しているなら、それはテストを行っているということであり、それを知る価値がある。

距離のしきい値は、一致・不一致のペアのサンプルを手作業でレビューして経験的に決定し、その結果としての誤結合率と誤分割率を記録する。この数値がなければ、そのライブラリを基にしたレポートに含まれる誤差の大きさを誰も見積もることができない。

検索可能にする、つまりテキストを抽出する

誰も検索できない画像はただのファイルである。クリエイティブライブラリの価値の大半は、ある競合がどの主張を使っているかを問い合わせられることにあり、それには言葉が必要である。

画像クリエイティブに対してOCRを実行し、画像内のコピーを取得する。それは実際のオファーが記載されている場所であることが多い。動画や音声は文字起こしする。そのうえで、抽出したテキストを構造化メタデータと並べてインデックス化する。この1ステップこそが、使われるライブラリと忘れられるアーカイブとの分かれ目である。

抽出したテキストは何かを上書きするのではなく独自のフィールドとして保存し、信頼度スコアも保持する。装飾的な広告コピーに対するOCRは不完全であり、信頼度の低い抽出結果は、静かに間違っているのではなく、目に見える形で低信頼度であるべきである。

メタデータのスキーマ

アセットはレコードの半分より小さい部分にすぎない。

フィールド備考
クリエイティブファミリーID重複排除の親であり、これによってバリアントがグループ化される
知覚ハッシュ使用したアルゴリズムとしきい値も合わせて記録し、結果の再現性を保つ
表示された広告主名想定以上の頻度で親ブランドと異なる
掲載面とプレースメント検索、フィード、ディスプレイ、ネイティブ、リテールメディア、メール
市場国、そして掲載がローカルな場合は都市
初回・最終確認日主張されたものではなく、観測された掲載期間
観測地点観測が行われた出口の国と都市
デバイスプロファイルデスクトップかモバイルか、クリエイティブが異なるため
抽出テキストOCRまたは文字起こし、信頼度スコア付き
ランディングURLとリダイレクトチェーン実際にオファーが存在する場所
ソースどの広告ライブラリ、あるいはどの観測された掲載から来たものか

初回確認日と最終確認日こそが、ライブラリをタイムラインへと変える要素である。4か月間掲載され続けたクリエイティブは実証済みの成功例であり、6日間で終わったものは失敗したテストである。この区別が戦略的価値の大半を占め、しかもフィールド1つで済む。

収集レイヤー

広告ライブラリがカバーしていない部分については、2つの特性が重要になる。

ディスプレイやネイティブのクリエイティブはターゲティングされているため、観測地点によって何を配信されるかがそもそも決まる。国指定のレジデンシャルプロキシを使えば、各市場の収集をその市場から行うことができる。Shifterのゲートウェイでは、ターゲティングとセッションはp.shifter.io:443に対する認証情報の中に含める。

customer-USERNAME-country-de-sid-creative-de-07-ttl-600:PASSWORD

country-deが市場を設定し、sid-creative-de-07が収集パスを通じて1つの出口を保持するため、あるスナップショット内のクリエイティブは複数の観測地点が混在したものではなく、一貫した1つのセッションに属することになる。

2つ目の特性は帯域幅であり、クリエイティブ収集は特異的に負荷が重い。ペイロードそのものが目的だからである。画像や動画はアセットそのものなので、通常のブロックすべきというアドバイスは当てはまらない。代わりに量を制御する。ソースがハッシュ化または既存のものと比較できるアセットURLを公開している場合はダウンロード前に重複排除を行い、すでにバリアントを保有しているクリエイティブファミリーの再取得はスキップし、サムネイルで用が足りる場合は解像度に上限を設ける。パイプラインのサイジングについてはレジデンシャルプロキシの帯域幅予測で、コストのてこについてはプロキシ帯域幅コストの削減で扱っている。

リクエストレートは実際のバックオフを伴って通常の範囲に保つ。レート制限とリクエストスロットリングを参照。

著作権について、率直に

競合のクリエイティブは彼らの著作物である。社内での競合分析のためにそれを収集することは、通常の事業調査である。それを再公開することはそうではない。

ライブラリの正当性を保つための実務的なルールは以下の通りである。社内限定にし、アクセス制御下に置き、顧客向けや公開のものには一切表出させない。競合のアセットを自社の広告、ウェブサイト、公開コンテンツに使用しない。社内資料では出典を明示し、すべてのレコードにソースと日付を記録する。永久に保持するのではなく、保持期間を設定する。そして、社外への持ち出しを含むいかなる外部利用の前にも、社外に出る営業資料であっても、助言を受ける。

競合の広告をクリックしてクリエイティブやランディングページに到達してはならない。クリックは彼らに費用を発生させ、それは観察を妨害行為に変えてしまう。代わりにマークアップとリダイレクトチェーンから到達先を解決する。より広い枠組みについては競合広告インテリジェンスのためのレジデンシャルプロキシを参照。

機能するライブラリは何に使われるか

構築を正当化する4つの問いがあり、そのいずれもアセットを閲覧することではなく、メタデータへの照会である。

競合はどの主張をしているか、そしてどこで。抽出されたコピー全体に対するテキスト検索を市場ごとに分ける。

何が生き残るか。観測された掲載期間でランク付けされたクリエイティブであり、これは何が成果を上げているかを示す最も近い公開の代理指標である。

何がテストされているか。クリエイティブファミリーごとのバリアント数と、新しいファミリーが現れる速さ。

ポジショニングがいつ変化したか。新しい主張を含むファミリーの初回確認日のタイムラインであり、しばしば市場ごとの段階的展開を示す。

よくある質問

ライブラリはどれくらい過去まで遡るべきか。

何が持続するかを確立するのに十分な期間であり、通常は1年を意味する。それを超える保持は決定を変えることがめったになく、抱えることになる著作権リスクを増やすだけである。

アセットを保存すべきか、それともURLだけでよいか。

アセットを保存すべきである。クリエイティブのURLは失効するため、リンク切れのライブラリはライブラリとは言えない。出所を明らかにするためにURLも合わせて保存する。

これらのプロジェクトが失敗する最も一般的な理由は何か。

重複排除がないこと、次にテキスト抽出がないことである。前者はライブラリを量によって使い物にならなくし、後者は検索不能にする。

競合のクリエイティブを公開ブログ記事や広告に表示してもよいか。

助言なしにはできない。社内分析は安全な用途である。公開は自分の判断ではなく、他者の著作権に関する判断事項である。

結論

競合クリエイティブライブラリは、ファイルが付随したメタデータ製品である。まず公式の広告ライブラリに照会し、それらがカバーしていないものだけを収集し、すべてのアセットに知覚的アイデンティティを与えてバリアントが積み上がるのではなくグループ化されるようにし、テキストを抽出して検索可能にし、初回・最終確認日を記録して実証済みのクリエイティブと失敗したテストを区別できるようにする。

社内限定に保ち、出所を記録し、他者のクリエイティブを他者の資産として扱う。製品の概要はマーケティングとアドテックのページに、料金は料金ページにある。

始める準備はできていますか?

Shifterのレジデンシャルプロキシをお試しください。IP 205M+件、195+カ国、$0.10/GBから。

始める