Scraping

Cómo analizar el surtido de la competencia y las carencias del catálogo

El análisis del surtido es un problema de correspondencia antes de ser una comparación. Cómo enumerar un catálogo, emparejar productos honestamente y separar las carencias reales del ruido.

Chris Collins

Chris Collins

7 de septiembre de 2026 · 8 min de lectura

El análisis de surtido suena como aritmética de conjuntos. Coges su catálogo, coges el tuyo, restas. Los huecos son la oportunidad.

La aritmética es trivial. Todo lo que hace que el resultado sea correcto o incorrecto ocurre antes: si has enumerado su catálogo o simplemente lo has muestreado, y si “el mismo producto” en su web y en la tuya se reconoce realmente como el mismo producto. Si te equivocas en cualquiera de los dos, la resta produce una lista de oportunidades convincente que en su mayoría son artefactos.

El problema del emparejamiento es todo el problema

El mismo artículo se describe de forma distinta en cada minorista que lo vende. Convenciones de título diferentes, ortografías de marca diferentes, tamaños de paquete diferentes, agrupaciones diferentes y SKUs internos que no significan nada fuera de cada empresa.

Si tu emparejador falla en el veinte por ciento de los artículos, entonces el veinte por ciento de su catálogo parece un hueco que deberías cubrir y el veinte por ciento del tuyo parece diferenciación única. Ambas conclusiones son incorrectas, son incorrectas en la dirección que hace que el análisis parezca valioso, y nada en el resultado las señala.

Empareja en este orden:

Identificadores estándar primero. GTIN, UPC, EAN, ISBN, MPN. Donde estén publicados son casi definitivos, y deberían ser tu clave principal siempre que estén disponibles.

Marca más modelo normalizado en segundo lugar. Normaliza de forma agresiva: mayúsculas y minúsculas, puntuación, espacios en blanco, alias de marca, abreviaturas comunes. Guarda la forma normalizada para que una decisión de emparejamiento pueda auditarse más tarde.

Emparejamiento por atributos en tercer lugar. Tamaño, color, capacidad, número de unidades por paquete. Aquí es donde el tamaño del paquete causa más daño, porque un paquete de seis y una unidad suelta son productos genuinamente distintos que comparten casi todos los atributos y a menudo comparten título.

Revisión humana de una muestra, siempre. Extrae una muestra aleatoria de coincidencias y de no coincidencias y que alguien las revise. Esto produce el dato que hace que todo lo demás sea interpretable: tu tasa de emparejamiento. Un análisis presentado sin ella es un análisis al que nadie puede calcularle el error.

Enumera, no muestrees

El segundo fallo es tratar un rastreo como un censo cuando era una muestra.

La mayoría de las superficies de catálogo limitan lo que te mostrarán. Un listado de categoría puede detenerse en un número fijo de páginas independientemente de cuántos productos afirme tener. Los resultados de búsqueda suelen estar limitados con más severidad que la navegación por categorías. Los filtros y facetas son con frecuencia la única forma de llegar a la cola larga, al dividir una categoría grande en segmentos lo bastante pequeños como para poder recuperarse por completo.

El método práctico es recorrer el árbol de categorías en lugar de buscar, subdividir cualquier nodo cuyo número de resultados exceda el límite de página visible, y registrar para cada nodo tanto el recuento de productos declarado como el número que realmente recuperaste. Ese segundo número es tu evidencia. Cuando lo declarado y lo recuperado divergen, has encontrado el límite de tu propia visibilidad, y todo lo que quede más allá se presentará como un hueco en tu catálogo en lugar de un hueco en tus datos.

Las estructuras de categorías también difieren entre minoristas, así que no asumas que su categoría es tu categoría. Empareja a nivel de producto y consolida después en tu propia taxonomía.

La mecánica específica de cada minorista está en cómo extraer datos de productos de Amazon y monitorización de disponibilidad y stock de productos.

Los catálogos son regionales

El mismo minorista maneja surtidos distintos según el mercado, y a menudo ofrece un catálogo completamente diferente según la tienda.

Si tu recopilación se ejecuta desde un solo país, cada producto que ellos ofrecen únicamente en otro mercado aparece como ausente, y cada producto que se ofrece únicamente en el mercado desde el que recopilas aparece como universal. Para un negocio que vende en varios mercados, esto no es una corrección menor. Cambia qué huecos son reales.

Los proxies residenciales con segmentación por país mantienen el catálogo de cada mercado diferenciado. Con la puerta de enlace de Shifter, el destino y la sesión van en las credenciales frente a p.shifter.io:443:

customer-USERNAME-country-es-sid-cat-es-0119-ttl-600:PASSWORD

country-es fija el mercado, sid-cat-es-0119 mantiene una única salida durante todo un recorrido de categoría para que la paginación se mantenga coherente, y ttl-600 conserva esa dirección durante diez minutos. Una sesión por cada recorrido de categoría, no una por cada solicitud de página, es la regla. Rotar a mitad de un recorrido es como terminan mezclándose en una misma instantánea de catálogo páginas procedentes de dos puntos de vista distintos.

Mantén la concurrencia moderada y reduce la velocidad ante errores en lugar de forzar el paso, como se describe en limitación de tasa y regulación de solicitudes. La vista de producto está en la página de proxies residenciales para comercio electrónico.

Los cuatro resultados

Una vez que los productos están emparejados y los catálogos enumerados, la comparación produce cuatro cosas distintas, y confundirlas es el error analítico más común.

Huecos reales. Ellos lo tienen, tú no. El resultado principal, y solo fiable en proporción a tu tasa de emparejamiento.

Huecos inversos. Tú lo tienes, ellos no. Normalmente se ignoran, y normalmente son más valiosos, porque este es tu inventario de diferenciación y el equipo de merchandising puede actuar sobre él de inmediato.

Huecos de profundidad. Ambos tenéis la marca, ellos tienen cuarenta SKUs y tú tienes seis. Esto rara vez aparece en una diferencia de conjuntos ingenua porque la marca está presente en ambos lados, y a menudo es el hallazgo comercial más importante de todo el ejercicio.

Huecos fantasma. Fallos de emparejamiento disfrazados de huecos reales. Todo análisis los tiene. La pregunta es si has medido cuántos.

Presenta los tres primeros con el cuarto cuantificado junto a ellos. “Doscientos cuarenta huecos reales con una tasa de emparejamiento del noventa y uno por ciento” es un hallazgo utilizable. “Doscientos cuarenta huecos” es un número esperando hacerle perder la semana a un gestor de categoría.

Cadencia y desviación

Los catálogos cambian mucho más despacio que los precios, lo cual es conveniente: una enumeración completa semanal o quincenal suele ser suficiente, con una cadencia más rápida en categorías bajo competencia activa.

Lo que importa más que la frecuencia es la estabilidad. Mantén fijos entre ejecuciones el recorrido, las reglas de emparejamiento y el mapeo de categorías, y versiónalos. Si tu recuento de huecos cae bruscamente, la primera pregunta es si su surtido cambió o si lo hizo tu emparejador. Una comparación entre ejecuciones de la tasa de emparejamiento y los recuentos recuperados responde a eso en segundos y evita mucho análisis desperdiciado.

Preguntas frecuentes

¿Qué tasa de emparejamiento es lo bastante buena para actuar?

Por encima del noventa por ciento es viable para decisiones a nivel de categoría. Por debajo del ochenta, la lista de huecos es en su mayoría ruido de emparejamiento y el esfuerzo pertenece al emparejador más que al análisis.

¿Debería usar la búsqueda o el recorrido de categorías para enumerar?

El recorrido de categorías, subdividido con facetas donde un nodo supere el límite de página. La búsqueda está limitada con más severidad y su clasificación está personalizada, lo que la convierte en una mala herramienta de enumeración.

¿Cómo manejo los listados de marketplace de vendedores externos?

Trátalos como un conjunto separado. Mezclar el surtido propio y el de marketplace exagera la gama comprometida de un competidor, ya que un listado de un tercero no es una decisión de compra que ellos hayan tomado.

¿Y si no publican identificadores estándar?

Apóyate más en la marca y el modelo normalizados, acepta una tasa de emparejamiento más baja, y mídela honestamente. Algunas categorías, en particular ropa y marca blanca, nunca emparejarán con limpieza, y la respuesta correcta es informar del nivel de confianza en lugar de la certeza.

La conclusión

La comparación al final del análisis de surtido es aritmética. El trabajo está río arriba: enumerar un catálogo en lugar de muestrearlo, saber dónde termina tu visibilidad, emparejar productos con una regla que puedas auditar, y separar los huecos reales de los huecos de profundidad y de los fallos de emparejamiento.

Recopila cada mercado por separado, mantén las sesiones coherentes a lo largo de un recorrido, registra los recuentos declarados frente a los recuperados, y publica tu tasa de emparejamiento junto a cada cifra de huecos. Las tarifas están en la página de precios.

¿Listo para empezar?

Prueba los proxies residenciales de Shifter, más de 205M IPs, más de 195 países, desde 0,75 $/GB.

Comenzar