Scraping

Cómo crear una biblioteca de creativos de la competencia con scraping automatizado

Una biblioteca de creativos es un problema de deduplicación y metadatos, no de descarga. Cómo crear una que se mantenga rastreable y legal.

Chris Collins

Chris Collins

10 de septiembre de 2026 · 9 min de lectura

La mayoría de las bibliotecas de creatividades de la competencia mueren de la misma manera. La recopilación funciona, los archivos se acumulan y, tras cuatro meses, hay noventa mil archivos que nadie puede buscar, en los que el mismo anuncio aparece doscientas veces porque cambió un parámetro de seguimiento, y que ningún estratega abre porque encontrar algo lleva más tiempo que preguntarle a un compañero.

El problema de ingeniería no es adquirir creatividades. Es la deduplicación y los metadatos. Si se resuelven bien esos dos aspectos, una biblioteca modesta resulta realmente útil. Si se resuelven mal, el volumen empeora las cosas en lugar de mejorarlas.

Recopila primero de las fuentes permitidas

Antes de construir nada, utiliza las bibliotecas de anuncios de las plataformas. Meta, Google, TikTok y LinkedIn publican archivos consultables de publicidad activa, y son la fuente de creatividades de la competencia más barata, más completa y más defendible que existe.

Te dan el activo, el anunciante, las fechas de emisión y a menudo los soportes, en un formato pensado para ser consultado. Empieza por ahí, y construye recopilación propia solo para lo que no cubren: ubicaciones de display y native, retail media, contenido de afiliación, ubicaciones de email y newsletter, y activos de landing pages.

Ese orden importa tanto comercial como legalmente. El esfuerzo de ingeniería dedicado a volver a recopilar lo que un archivo ya publica es esfuerzo que no se dedica a las partes que nadie tiene.

La deduplicación es todo el sistema

La misma creatividad te llega muchas veces: servida de nuevo con distintos parámetros de seguimiento, redimensionada para diferentes ubicaciones, recomprimida por una CDN, resubida por el anunciante sin cambios, o capturada dos veces por tu propio recopilador.

El hash exacto de archivos no resuelve esto, porque un solo byte de diferencia produce un hash distinto y las CDN generan esas diferencias constantemente. Lo que funciona es una identidad por capas.

Hash perceptual para imágenes. Un hash calculado a partir de la estructura de la imagen en lugar de los bytes, de modo que una versión redimensionada o recomprimida de la misma creatividad quede cerca del original. Guarda el hash y agrupa por umbral de distancia en lugar de por igualdad.

Muestreo de fotogramas para vídeo. Hashes perceptuales de fotogramas a intervalos fijos, más la duración. Un vídeo recodificado a otro bitrate coincide; un montaje genuinamente diferente no.

Texto de copy normalizado. El titular y el cuerpo del texto con mayúsculas, puntuación y espacios en blanco normalizados. El copy suele ser el identificador más estable cuando el propio activo se ha reelaborado.

Una familia de creatividades, no un registro plano. Agrupa las variantes bajo un elemento padre, y mantén cada variante enlazada a él. El número de variantes es una señal real, ya que un competidor que produce cuarenta variantes de un mismo concepto está haciendo pruebas, y eso vale la pena saberlo.

Elige el umbral de distancia de forma empírica revisando manualmente una muestra de pares emparejados y no emparejados, y registra las tasas resultantes de fusión falsa y división falsa. Sin esas cifras, nadie puede dimensionar el error de un informe construido sobre la biblioteca.

Hazla consultable, lo que significa extraer texto

Una imagen que nadie puede buscar es solo un archivo. La mayor parte del valor de una biblioteca de creatividades está en poder preguntar qué competidores están usando una determinada afirmación, y eso requiere las palabras.

Ejecuta OCR sobre las creatividades de imagen para capturar el copy que aparece sobre la imagen, que con frecuencia es donde reside la oferta real. Transcribe vídeo y audio. Luego indexa el texto extraído junto con los metadatos estructurados. Este único paso es la diferencia entre una biblioteca que se usa y un archivo que se olvida.

Guarda el texto extraído como un campo propio en lugar de sobrescribir nada, y conserva la puntuación de confianza. El OCR sobre copy publicitario estilizado es imperfecto, y una extracción de baja confianza debería mostrarse visiblemente como de baja confianza en lugar de estar equivocada de forma silenciosa.

El esquema de metadatos

El activo es la mitad más pequeña de un registro.

CampoNotas
ID de familia de creatividadEl elemento padre de la deduplicación, para que las variantes se agrupen
Hash perceptualMás el algoritmo y el umbral utilizados, para que los resultados sigan siendo reproducibles
Anunciante tal como se muestraQue difiere de la marca matriz más a menudo de lo esperado
Soporte y ubicaciónBúsqueda, feed, display, native, retail media, email
MercadoPaís, y ciudad cuando la ubicación es local
Primera y última vez vistaLa ventana de emisión tal como la observaste, no tal como se declara
Punto de observaciónPaís y ciudad de salida desde donde se hizo la observación
Perfil de dispositivoEscritorio o móvil, ya que la creatividad difiere
Texto extraídoOCR o transcripción, con una puntuación de confianza
URL de destino y cadena de redireccionesDónde reside realmente la oferta
FuenteDe qué biblioteca de anuncios o qué ubicación observada procede

La primera y la última vez vista son lo que convierte una biblioteca en una línea temporal. Una creatividad que estuvo activa durante cuatro meses es un rendidor probado; una que estuvo activa seis días fue una prueba fallida. Esa distinción constituye la mayor parte del valor estratégico y cuesta un solo campo.

La capa de recopilación

Dos propiedades importan para las partes que las bibliotecas de anuncios no cubren.

Las creatividades de display y native están segmentadas, así que el punto de observación determina qué se te sirve. Los proxies residenciales con segmentación por país permiten que la recopilación de cada mercado proceda de ese mercado. Con la puerta de enlace de Shifter, la segmentación y la sesión van en las credenciales frente a p.shifter.io:443:

customer-USERNAME-country-de-sid-creative-de-07-ttl-600:PASSWORD

country-de fija el mercado y sid-creative-de-07 mantiene una salida durante todo un pase de recopilación, de modo que las creatividades de una captura pertenecen a una sesión coherente en lugar de a varios puntos de observación mezclados.

La segunda propiedad es el ancho de banda, y la recopilación de creatividades es inusualmente pesada porque el propio contenido es lo que importa. Las imágenes y los vídeos son el activo, así que el consejo habitual de bloquearlos no se aplica aquí. En su lugar, controla el volumen: deduplica antes de descargar siempre que la fuente exponga una URL de activo que puedas hashear o comparar con lo que ya tienes, evita volver a recuperar una familia de creatividades de la que ya tienes variantes, y limita la resolución cuando una miniatura ya responde a la pregunta. El dimensionamiento del pipeline se trata en previsión del ancho de banda de proxies residenciales, y las palancas de coste en cómo reducir los costes de ancho de banda de proxies.

Mantén las tasas de solicitud dentro de lo habitual con un backoff real, como en limitación de tasa y regulación de solicitudes.

Los derechos de autor, sin rodeos

La creatividad de un competidor es su obra protegida por derechos de autor. Recopilarla para análisis competitivo interno es investigación empresarial ordinaria. Republicarla no lo es.

Las reglas prácticas que mantienen defendible una biblioteca: mantenla interna, con control de acceso, y no la muestres en nada dirigido a clientes o público. No uses el activo de un competidor en tu propia publicidad, en tu web ni en contenido publicado. Cita la fuente en presentaciones internas y conserva la fuente y la fecha en cada registro. Establece un periodo de retención en lugar de conservarlo todo indefinidamente. Y consulta antes de cualquier uso externo, incluida una presentación comercial que salga de la empresa.

No hagas clic en los anuncios de la competencia para llegar a su creatividad o a su landing page. Un clic les cuesta dinero, lo que convierte la observación en interferencia; resuelve el destino a partir del marcado y de la cadena de redirecciones en su lugar. El planteamiento más amplio está en proxies residenciales para inteligencia de anuncios de la competencia.

Para qué sirve una biblioteca que funciona

Cuatro preguntas justifican la construcción, y todas son consultas sobre metadatos en lugar de navegación sobre activos.

Qué afirmaciones están haciendo los competidores, y dónde. Una búsqueda de texto sobre el copy extraído, segmentada por mercado.

Qué sobrevive. Creatividades clasificadas por duración de emisión observada, que es el indicador público más cercano a lo que funciona.

Qué se está probando. Recuento de variantes por familia de creatividad, y con qué rapidez aparecen familias nuevas.

Cuándo cambió el posicionamiento. Una línea temporal de fechas de primera aparición de familias que llevan una afirmación nueva, que con frecuencia muestra un despliegue mercado por mercado.

Preguntas frecuentes

¿Cuánto tiempo atrás debería llegar una biblioteca?

Lo suficiente para establecer qué persiste, lo que normalmente significa un año. La retención más allá de eso rara vez cambia una decisión y aumenta la exposición en materia de derechos de autor que estás asumiendo.

¿Debería guardar los activos o solo las URL?

Guarda los activos. Las URL de las creatividades caducan, y una biblioteca de enlaces muertos no es una biblioteca. Guarda también la URL, por motivos de procedencia.

¿Cuál es el motivo más común por el que fracasan estos proyectos?

Falta de deduplicación, seguida de falta de extracción de texto. Lo primero hace que la biblioteca sea inutilizable por volumen, lo segundo hace que no se pueda consultar.

¿Puedo mostrar creatividades de la competencia en una entrada de blog pública o en un anuncio?

No sin asesoramiento. El análisis interno es el uso seguro. La publicación es una decisión de derechos de autor de otra persona, no tuya.

En resumen

Una biblioteca de creatividades de la competencia es un producto de metadatos con archivos adjuntos. Consulta primero las bibliotecas de anuncios oficiales, recopila solo lo que no cubren, dale a cada activo una identidad perceptual para que las variantes se agrupen en lugar de acumularse, extrae el texto para que se pueda consultar, y registra la primera y la última vez vista para poder distinguir una creatividad probada de una prueba fallida.

Mantenla interna, conserva la procedencia y trata la creatividad de otro como la propiedad de otro. La vista de producto está en la página de marketing y adtech, con las tarifas en la página de precios.

¿Listo para empezar?

Prueba los proxies residenciales de Shifter, más de 205M IPs, más de 195 países, desde 0,75 $/GB.

Comenzar