대부분의 경쟁사 크리에이티브 라이브러리는 같은 방식으로 죽는다. 수집은 진행되고, 자산은 쌓이지만, 넉 달이 지나면 아무도 검색할 수 없는 9만 개의 파일이 생기고, 추적 파라미터가 바뀌었다는 이유만으로 같은 광고가 200번씩 나타나며, 무언가를 찾는 것이 동료에게 물어보는 것보다 오래 걸려서 전략가는 아예 열어보지도 않게 된다.
엔지니어링 문제는 크리에이티브를 확보하는 것이 아니다. 중복 제거와 메타데이터가 문제다. 이 두 가지를 제대로 해내면 규모가 작은 라이브러리도 실질적으로 유용해진다. 잘못하면 물량이 늘어날수록 상황은 오히려 나빠진다.
허용된 소스부터 수집하라
무언가를 구축하기 전에 플랫폼의 광고 라이브러리부터 활용하라. Meta, Google, TikTok, LinkedIn은 모두 활성 광고에 대한 검색 가능한 아카이브를 공개하고 있으며, 이는 현존하는 경쟁사 크리에이티브 소스 중 가장 저렴하고, 가장 완전하며, 가장 방어 가능한 소스다.
이들은 자산, 광고주, 게재 기간, 그리고 종종 게재 지면까지 조회 가능한 형태로 제공한다. 여기서부터 시작하고, 이들이 다루지 않는 부분에 대해서만 별도의 수집 체계를 구축하라. 디스플레이 및 네이티브 지면, 리테일 미디어, 제휴 콘텐츠, 이메일 및 뉴스레터 지면, 랜딩 페이지 자산이 그것이다.
이 순서는 법적으로뿐 아니라 상업적으로도 중요하다. 이미 아카이브가 공개한 것을 다시 수집하는 데 쓰인 엔지니어링 노력은, 아무도 다루지 않는 부분에 쓸 수 없는 노력이다.
중복 제거가 시스템의 전부다
동일한 크리에이티브는 여러 경로로 여러분에게 도달한다. 추적 파라미터가 다른 채로 다시 게재되거나, 다른 지면용으로 리사이즈되거나, CDN에서 재압축되거나, 변경 없이 광고주가 재업로드하거나, 여러분의 수집기가 두 번 캡처하는 경우도 있다.
정확한 파일 해싱은 이 문제를 해결하지 못한다. 단 1바이트만 달라져도 다른 해시가 생성되는데, CDN은 그런 차이를 끊임없이 만들어내기 때문이다. 효과가 있는 것은 계층화된 식별 방식이다.
이미지용 지각적 해싱(perceptual hashing). 바이트가 아니라 이미지 구조로부터 계산되는 해시로, 리사이즈되거나 재압축된 동일 크리에이티브의 버전이 원본과 가까운 값을 갖게 된다. 해시를 저장하고, 동일성이 아니라 거리 임계값으로 그룹화하라.
영상용 프레임 샘플링. 일정 간격으로 추출한 프레임의 지각적 해시와 영상 길이를 함께 사용한다. 다른 비트레이트로 재인코딩된 영상은 매치되지만, 실제로 다른 컷은 매치되지 않는다.
정규화된 카피 텍스트. 대소문자, 구두점, 공백을 정규화한 헤드라인과 본문. 자산 자체가 변형된 경우, 카피가 가장 안정적인 식별자인 경우가 많다.
평면 레코드가 아닌 크리에이티브 패밀리. 변형들을 부모 항목 아래 그룹화하고, 모든 변형이 여기에 연결되도록 유지하라. 변형 개수는 실질적인 신호다. 한 경쟁사가 하나의 콘셉트로 40개의 변형을 만들어냈다면 이는 테스트 중이라는 뜻이고, 이는 알아둘 가치가 있다.
거리 임계값은 매치된 쌍과 매치되지 않은 쌍의 샘플을 직접 검토하며 경험적으로 정하고, 그 결과로 나온 오탐 병합률과 오탐 분리율을 기록하라. 이 수치가 없으면 그 라이브러리를 기반으로 만든 보고서의 오차 규모를 아무도 가늠할 수 없다.
검색 가능하게 만들 것, 즉 텍스트를 추출할 것
아무도 검색할 수 없는 이미지는 그저 파일일 뿐이다. 크리에이티브 라이브러리의 가치 대부분은 특정 경쟁사가 어떤 문구를 사용하고 있는지 질의할 수 있다는 데 있고, 이를 위해서는 단어가 필요하다.
이미지 크리에이티브에는 OCR을 실행하여 이미지 안의 카피를 포착하라. 실제 오퍼가 담겨 있는 경우가 많다. 영상과 오디오는 트랜스크립션하라. 그런 다음 추출된 텍스트를 구조화된 메타데이터와 함께 인덱싱하라. 이 한 단계가 사용되는 라이브러리와 잊혀지는 아카이브를 가르는 차이다.
추출된 텍스트는 다른 무언가를 덮어쓰는 대신 별도의 필드로 저장하고, 신뢰도 점수도 함께 보관하라. 스타일화된 광고 카피에 대한 OCR은 완벽하지 않으며, 신뢰도가 낮은 추출 결과는 조용히 틀리는 대신 눈에 띄게 신뢰도가 낮다고 표시되어야 한다.
메타데이터 스키마
자산은 레코드의 절반보다 작은 부분에 불과하다.
| 필드 | 비고 |
|---|---|
| 크리에이티브 패밀리 ID | 중복 제거 상위 항목으로, 변형들을 그룹화한다 |
| 지각적 해시 | 재현 가능하도록 사용된 알고리즘과 임계값을 함께 |
| 표시된 광고주 | 예상보다 자주 상위 브랜드와 다르다 |
| 지면 및 배치 | 검색, 피드, 디스플레이, 네이티브, 리테일 미디어, 이메일 |
| 시장 | 국가, 그리고 배치가 로컬인 경우 도시 |
| 최초 및 최종 관측일 | 여러분이 관측한 게재 기간, 주장된 기간이 아니라 |
| 관측 지점 | 관측이 이루어진 출구 국가 및 도시 |
| 기기 프로필 | 데스크톱 또는 모바일, 크리에이티브가 다르기 때문에 |
| 추출된 텍스트 | OCR 또는 트랜스크립트, 신뢰도 점수 포함 |
| 랜딩 URL 및 리다이렉트 체인 | 오퍼가 실제로 존재하는 위치 |
| 소스 | 어느 광고 라이브러리에서, 또는 어느 관측된 배치에서 왔는지 |
최초 관측일과 최종 관측일은 라이브러리를 타임라인으로 바꿔주는 요소다. 넉 달간 게재된 크리에이티브는 검증된 우수 성과물이고, 6일간 게재된 것은 실패한 테스트다. 이 구분이 전략적 가치의 대부분을 차지하며, 필드 하나만 있으면 된다.
수집 계층
광고 라이브러리가 다루지 않는 부분에는 두 가지 속성이 중요하다.
디스플레이와 네이티브 크리에이티브는 타겟팅되므로, 관측 지점이 애초에 무엇이 노출되는지를 결정한다. 국가 타겟팅이 가능한 레지덴셜 프록시를 사용하면 각 시장의 수집이 해당 시장에서 이루어지도록 할 수 있다. Shifter 게이트웨이를 사용하는 경우, 타겟팅과 세션은 p.shifter.io:443에 대한 인증 정보에 포함된다.
customer-USERNAME-country-de-sid-creative-de-07-ttl-600:PASSWORD
country-de가 시장을 설정하고, sid-creative-de-07이 수집 패스 전체에서 하나의 출구를 유지시켜, 스냅샷 안의 크리에이티브들이 여러 관측 지점이 섞인 것이 아니라 하나의 일관된 세션에 속하게 된다.
두 번째 속성은 대역폭이며, 크리에이티브 수집은 페이로드 자체가 목적이기 때문에 유난히 무겁다. 이미지와 영상이 곧 자산이므로, 이를 차단하라는 일반적인 조언은 여기서는 적용되지 않는다. 대신 물량을 통제하라. 소스가 해시를 계산하거나 이미 보유한 것과 비교할 수 있는 자산 URL을 노출하는 경우 다운로드 전에 중복 제거하고, 이미 변형을 보유한 크리에이티브 패밀리는 재수집을 건너뛰며, 썸네일로 질문에 답할 수 있는 경우 해상도를 제한하라. 파이프라인 규모 산정은 레지덴셜 프록시 대역폭 예측에서 다루며, 비용 절감 방안은 프록시 대역폭 비용 절감에서 다룬다.
실제 백오프를 사용하여 요청 속도를 평범하게 유지하라. 레이트 리미팅과 요청 스로틀링을 참고하라.
저작권, 명확하게
경쟁사의 크리에이티브는 그들의 저작권이 있는 저작물이다. 내부 경쟁 분석을 위해 이를 수집하는 것은 평범한 사업 조사에 해당한다. 이를 재게시하는 것은 그렇지 않다.
라이브러리를 방어 가능하게 유지하는 실무 규칙은 다음과 같다. 내부용으로만 유지하고, 접근 통제 아래 두며, 고객 대면 또는 공개용 자료 어디에도 노출하지 마라. 경쟁사의 자산을 여러분 자신의 광고, 웹사이트, 또는 발행된 콘텐츠에 사용하지 마라. 내부 자료에서는 출처를 표시하고 모든 레코드에 소스와 날짜를 남겨라. 모든 것을 영구히 보관하는 대신 보존 기간을 설정하라. 그리고 외부 사용 전에는, 회사 밖으로 나가는 영업 자료를 포함하여, 반드시 자문을 구하라.
경쟁사의 크리에이티브나 랜딩 페이지에 도달하기 위해 경쟁사 광고를 클릭하지 마라. 클릭은 그들에게 비용을 발생시키며, 이는 관측을 간섭으로 바꾼다. 대신 마크업과 리다이렉트 체인으로부터 목적지를 확인하라. 더 넓은 맥락은 경쟁사 광고 인텔리전스를 위한 레지덴셜 프록시에서 다룬다.
작동하는 라이브러리는 어디에 쓰이는가
네 가지 질문이 이 구축을 정당화하며, 이들은 모두 자산을 훑어보는 것이 아니라 메타데이터에 대한 질의다.
경쟁사들이 어떤 주장을 어디서 하고 있는가. 시장별로 나누어 추출된 카피 전체를 텍스트 검색.
무엇이 살아남는가. 관측된 게재 기간으로 순위를 매긴 크리에이티브, 이는 성과에 대한 가장 근접한 공개 대리 지표다.
무엇이 테스트되고 있는가. 크리에이티브 패밀리별 변형 개수, 그리고 새로운 패밀리가 얼마나 빨리 나타나는가.
포지셔닝이 언제 바뀌었는가. 새로운 주장을 담은 패밀리들의 최초 관측일 타임라인, 이는 종종 시장별 순차 롤아웃을 보여준다.
FAQ
라이브러리는 얼마나 오래 전까지 거슬러 올라가야 하는가?
무엇이 지속되는지 파악할 수 있을 만큼이면 충분하며, 이는 보통 1년을 의미한다. 그 이상의 보존은 의사결정을 거의 바꾸지 못하면서 보유하고 있는 저작권 리스크만 늘린다.
자산을 저장해야 하는가, 아니면 URL만 저장해도 되는가?
자산을 저장하라. 크리에이티브 URL은 만료되며, 죽은 링크들의 라이브러리는 라이브러리가 아니다. 출처 확인을 위해 URL도 함께 저장하라.
이런 프로젝트들이 실패하는 가장 흔한 이유는 무엇인가?
중복 제거의 부재, 그 다음이 텍스트 추출의 부재다. 전자는 라이브러리를 물량 때문에 쓸 수 없게 만들고, 후자는 검색할 수 없게 만든다.
경쟁사의 크리에이티브를 공개 블로그 게시물이나 광고에 보여줘도 되는가?
자문 없이는 안 된다. 내부 분석이 안전한 사용이다. 발행은 여러분이 아니라 다른 누군가의 저작권 결정이다.
결론
경쟁사 크리에이티브 라이브러리는 파일이 첨부된 메타데이터 제품이다. 먼저 공식 광고 라이브러리를 조회하고, 이들이 다루지 않는 것만 수집하며, 모든 자산에 지각적 식별자를 부여하여 변형들이 쌓이는 대신 그룹화되도록 하고, 텍스트를 추출하여 검색 가능하게 만들고, 최초 및 최종 관측일을 기록하여 검증된 크리에이티브와 실패한 테스트를 구분할 수 있게 하라.
내부용으로 유지하고, 출처를 기록하며, 타인의 크리에이티브를 타인의 재산으로 취급하라. 제품 관점은 마케팅 및 애드테크 페이지에서, 요금은 가격 페이지에서 확인할 수 있다.