La infraestructura de proxies residenciales suele analizarse en términos de escala: número de IPs, cobertura de países, segmentación por ciudad y ASN, y velocidad de rotación.
Esas cuestiones importan. Pero para investigadores de mercado, científicos de datos, equipos de IA y cualquiera que utilice datos de la web pública para tomar decisiones, hay otra pregunta que también importa: ¿es el conjunto de datos resultante representativo?
Imagine recopilar 100.000 observaciones destinadas a describir el mercado del Reino Unido. Todas las solicitudes se completan con éxito y miles de IPs rotan, y sin embargo una proporción desproporcionada procede de Londres y de un puñado de grandes redes de banda ancha, mientras que otras regiones e ISPs más pequeños aparecen solo ocasionalmente.
La infraestructura funcionó. Puede que la muestra no lo haya hecho. En sentido estricto, el pool de proxies define el marco de muestreo disponible; las salidas seleccionadas de él y las observaciones resultantes constituyen la muestra.
Esa distinción importa porque el sesgo de muestreo de datos no requiere solicitudes fallidas, crawlers rotos ni datos evidentemente incorrectos. Puede surgir cuando observaciones individualmente válidas se recopilan en proporciones que no representan adecuadamente a la población estudiada.
La teoría estadística del muestreo lleva décadas abordando este problema. NIST señala que los hechos sobre una muestra no son automáticamente hechos sobre la población, y que la adecuación de la muestra depende de la representatividad, además del tamaño, la variabilidad y la precisión requerida.
Puntos clave
- Los grandes pools de proxies generan diversidad de acceso, no representatividad automática.
- El sesgo de muestreo puede surgir por geografía, ASNs, temporalidad y puntos de observación correlacionados.
- La estratificación, las cuotas, el muestreo temporal, la elaboración de informes y la ponderación pueden reducir el sesgo.
- La cobertura de red y la cobertura de muestra responden a preguntas diferentes.
- La diversidad de acceso no es lo mismo que la representatividad de la muestra.
La cobertura de red no es cobertura de muestra
Operamos una red de más de 205 millones de IPs residenciales en más de 195 países, con segmentación a nivel de país, región, ciudad y ASN. Esas capacidades amplían enormemente el número de lugares desde los que un equipo de datos puede observar la web pública.
Pero la cobertura de infraestructura describe el espacio de observación posible. No indica qué proporción de ese espacio ha muestreado realmente su conjunto de datos final.
Esa es la diferencia entre cobertura de red y cobertura de muestra.
Una red puede exponer miles de ASNs mientras que un rastreo concreto recibe la mayoría de las observaciones a través de un pequeño subconjunto de ellos. Del mismo modo, una cobertura nacional puede producir un conjunto de datos con predominio urbano si hay más salidas disponibles en las grandes áreas metropolitanas.
Los pools grandes permiten un muestreo diverso; no lo hacen automático.
Cómo entra el sesgo de muestreo de datos en un conjunto de datos web
El sesgo de muestreo no requiere observaciones incorrectas. Un producto puede costar genuinamente 89 $ en una ubicación y 93 $ en otra. El problema aparece cuando un entorno se observa miles de veces y otro solo ocasionalmente, y sin embargo el agregado se trata como representativo del mercado en su conjunto.
Concentración geográfica. Un conjunto de datos nacional puede reflejar de forma desproporcionada ciudades o regiones de alta densidad.
Concentración de ASN o ISP. Muchas IPs residenciales distintas pueden seguir originándose en un número relativamente reducido de redes de banda ancha.
Sesgo temporal. La recopilación concentrada en horas, días o períodos concretos puede pasar por alto variaciones significativas en otros momentos del ciclo.
Sesgo de disponibilidad. Las salidas residenciales son dinámicas, por lo que las direcciones disponibles en un momento dado pueden no reflejar la distribución disponible más tarde.
Sesgo de entorno repetido. Direcciones IP diferentes no son necesariamente entornos de observación independientes cuando comparten el mismo ISP, ciudad y contexto de red más amplio.
Esto conduce a una distinción operativa importante: el fallo de las solicitudes es un problema de infraestructura. El sesgo de muestreo puede existir aunque todas las solicitudes se completen con éxito.
Nuestros benchmarks muestran por qué importan las ventanas de medición
Nuestros benchmarks de proxies residenciales muestran por qué las cifras de red publicitadas necesitan contexto. En lugar de basarnos únicamente en el tamaño de pool anunciado, medimos las IPs que están activas y accesibles durante una ventana de prueba definida.
De nuestro benchmark de DataImpulse, la ejecución en EE. UU. con 250.000 solicitudes por red:
| Prueba en EE. UU., 250.000 solicitudes cada uno | Shifter | DataImpulse |
|---|---|---|
| IPs activas observadas | 136.667 | 86.976 |
| ASNs distintos | 1.606 | 967 |
| Ciudades distintas | 5.813 | 4.513 |
| Tasa de éxito | 99,8% | 99,6% |
La metodología importa tanto como el resultado. El recuento representa las IPs activas y accesibles durante la ventana de prueba, no todas las direcciones que cada red podría proporcionar a lo largo de un día entero, ya que los puntos finales residenciales entran y salen del pool.
Eso es pensamiento de muestreo: una medición tiene una población, una ventana, un volumen y una metodología. Alcanzar 1.606 ASNs muestra una amplia cobertura potencial, pero no la proporción de observaciones aportadas por cada ASN.
El siguiente paso es medir no solo la amplitud de la red, sino cómo se distribuyeron realmente las observaciones dentro de ella. La diversidad de acceso y la representatividad de la muestra no son lo mismo. Un pool de proxies amplio crea posibles puntos de observación; el diseño de la recopilación determina la distribución que termina en el conjunto de datos.
Primero defina qué está intentando representar
Antes de preguntarse si un conjunto de datos es representativo, hay una pregunta más fundamental: ¿representativo de qué? No existe una distribución de proxies universalmente correcta.
Si está monitorizando precios minoristas, su población objetivo podría ser las regiones en las que opera un comercio. Para la verificación de anuncios, la población podría ser una combinación de ciudad, ISP, tipo de dispositivo y hora del día. Para el análisis de búsquedas localizadas, una unidad de muestreo significativa podría ser ubicación por dispositivo por motor de búsqueda por hora, en lugar de simplemente una IP del Reino Unido.
Nuestra SERP API admite geosegmentación a nivel de ciudad y resultados de búsqueda de escritorio o móvil precisamente porque el SERP que experimenta un usuario no representa necesariamente el SERP que se experimenta en otro lugar.
Un estudio nacional podría usar una geografía ponderada por población, mientras que otro proyecto puede requerir una representación equitativa de las principales regiones comerciales. El objetivo de la investigación debe venir primero.
En lugar de decir “recopilar 100.000 solicitudes del Reino Unido”, una mejor pregunta de diseño de datos es: ¿qué entornos de observación del Reino Unido deberían representar esas 100.000 solicitudes, y en qué proporciones?
Estratifique la muestra de proxies
Una idea útil de la teoría clásica de muestreo es el muestreo estratificado: dividir el espacio de observación en grupos significativos y recopilar de cada uno deliberadamente, en lugar de extraer de un único pool nacional indiferenciado.
Para un conjunto de datos a nivel de todo el Reino Unido, los estratos geográficos podrían incluir Londres, el South East, Midlands, North West, North East, Escocia, Gales e Irlanda del Norte. Esos grupos geográficos podrían luego subdividirse por ASN o ISP.
Un plan de recopilación podría especificar que el conjunto de datos requiere observaciones de múltiples sistemas autónomos dentro de cada región importante, en lugar de simplemente aceptar las salidas que la rotación proporcione de forma natural. Aquí es donde la segmentación a nivel de infraestructura se vuelve estadísticamente útil. Nuestra infraestructura de proxies residenciales admite segmentación por región, ciudad y ASN, de modo que los equipos pueden usar esos controles no solo para el acceso, sino como parte de la propia metodología de recopilación.
Las proporciones objetivo no tienen por qué ser iguales. Los investigadores podrían usar población, presencia de tiendas, distribución de clientes, gasto en campañas, o sobremuestreo deliberado de mercados más pequeños cuando las condiciones raras son importantes.
La cuestión no es que una distribución sea la correcta. La cuestión es que la distribución debe ser intencionada.
Asigne una cuota a cada estrato
La estratificación se vuelve operativa cuando se combina con cuotas. En lugar de permitir que un crawler siga extrayendo salidas hasta alcanzar un objetivo general de solicitudes, un pipeline consciente del muestreo podría definir límites y mínimos antes de que comience la recopilación.
Por ejemplo, limitar la concentración de ASN, establecer recuentos mínimos por región prioritaria y exigir múltiples ASNs independientes dentro de ciudades importantes.
Una vez que se cumple una cuota, la recopilación puede desplazarse hacia estratos infrarrepresentados. La rotación sigue siendo importante, pero opera dentro del diseño de muestreo en lugar de esperarse que cree la distribución correcta por sí misma.
La selección de proxies se convierte entonces en parte del control de calidad de datos.
El tiempo forma parte de la muestra
La geografía es solo una fuente de variación. El tiempo también importa. Un conjunto de datos recopilado enteramente entre las 9 de la mañana y el mediodía puede no describir el mismo mundo que uno muestreado a lo largo de un ciclo completo de 24 horas.
Esto puede importar para precios de viajes, disponibilidad de entregas, inventario de marketplaces, anuncios de búsqueda, promociones, precios dinámicos y cambios en los resultados de búsqueda.
Para estos casos de uso, las ventanas de recopilación deberían convertirse en estratos por sí mismas. La mañana, la tarde, la noche y la madrugada podrían recibir cada una una cuota. Los estudios más largos pueden requerir muestreo de días de semana y fines de semana, u observaciones repetidas durante varios días.
Esto es especialmente importante porque la disponibilidad de proxies puede ser en sí misma dependiente del tiempo. La composición de los dispositivos residenciales accesibles a través de una red cambia a medida que los usuarios, las conexiones y los dispositivos entran y salen. Por tanto, una salida de proxy no es meramente un punto de observación geográfico. Es un punto de observación en espacio y tiempo.
Informe sobre la distribución, no solo sobre el volumen
La mayoría de los resúmenes de recopilación hacen hincapié en la escala: solicitudes procesadas, páginas recopiladas o IPs utilizadas. Esas cifras muestran volumen, pero no si el conjunto de datos resultante representa adecuadamente a la población que pretende describir.
Creemos que los conjuntos de datos web serios deberían llevar cada vez más algo parecido a un informe de cobertura de muestra.
| Métrica | Qué informar | Por qué importa |
|---|---|---|
| Distribución geográfica | Recuentos por país, región y ciudad | Muestra la geografía de la observación |
| Distribución de ASN | ASNs únicos y concentración | Muestra la concentración de red |
| Distribución temporal | Observaciones por franja horaria | Muestra la concentración en ventanas temporales |
| Distribución por dispositivo | Cuota por perfil de dispositivo relevante | Muestra el equilibrio entre dispositivos |
| Calidad de la recopilación | Éxito y concentración de salidas repetidas | Separa la entrega de la diversidad |
| Brechas de cobertura | Estratos ausentes o insuficientemente cubiertos | Hace explícita la infrarrepresentación |
Esto refleja un principio más amplio: la procedencia debería describir no solo de dónde proceden los datos, sino desde dónde y cuándo se observaron. Ese argumento se desarrolla en detalle en el caso a favor de un estándar de punto de observación.
La cobertura de red muestra dónde podría observar la infraestructura. La cobertura de muestra muestra dónde observó realmente el conjunto de datos. Los equipos de datos necesitan cada vez más ambas cosas.
Para pipelines de recopilación gestionados, nuestra Web Scraping API se encarga de la rotación de proxies, el renderizado en navegador, la resolución de CAPTCHAs y los reintentos. La siguiente capa metodológica corresponde al propio diseño de la recopilación: decidir cómo deberían distribuirse esas observaciones exitosas.
La ponderación puede corregir el desequilibrio, dentro de ciertos límites
El diseño de muestreo nunca será perfecto, y ahí es donde la ponderación puede ayudar. Si Londres representa el 20% de la distribución objetivo pero produce el 40% de las observaciones, los analistas pueden reducir su influencia dando más peso a las regiones infrarrepresentadas.
La Oficina del Censo de EE. UU. explica que las unidades de muestra pueden tener probabilidades de selección diferentes y que la tasa de respuesta y la cobertura varían entre subpoblaciones. La ponderación compensa esa representación diferencial para que las estimaciones se relacionen mejor con la población objetivo.
Pero la ponderación tiene límites. Si falta una región relevante, ningún ajuste puede crear observaciones que nunca se recopilaron. Incluso cuando existen observaciones, la ponderación funciona mejor cuando los investigadores entienden por qué ciertos grupos estaban sobre- o infrarrepresentados.
El trabajo de Pew Research Center sobre el muestreo no probabilístico en línea ofrece un paralelismo útil: los métodos de reclutamiento, selección, trabajo de campo y ponderación pueden afectar materialmente a las estimaciones, y unos procedimientos de muestreo y ponderación más sólidos pueden mejorar algunos resultados.
Los encuestados no son IPs de proxies residenciales, pero la lección metodológica se traslada: una muestra grande no elimina la necesidad de entender cómo se construyó.
La industria de proxies necesita una mentalidad eficaz de cobertura de muestra
Los equipos que evalúan la infraestructura de proxies residenciales suelen preguntar sobre tamaño del pool, países, tasa de éxito, latencia, rotación, geosegmentación y cobertura de ASN. Creemos que las preguntas sobre la calidad de la muestra merecen situarse junto a ellas.
- Concentración de observaciones. ¿Qué grado de concentración tuvieron las observaciones que realmente recibimos?
- Participación de red. ¿Cuántos ASNs independientes contribuyeron de forma significativa al conjunto de datos?
- Equilibrio geográfico. ¿Qué estratos estuvieron sobrerrepresentados, infrarrepresentados o ausentes?
- Estabilidad temporal. ¿Cambió la distribución de las observaciones durante el período de recopilación?
- Carga de ajuste. ¿Cuánta ponderación se necesita después para alinear la muestra con la distribución objetivo?
Podríamos describir la respuesta de forma colectiva como cobertura de muestra efectiva. No debería convertirse en una puntuación universal; la definición relevante de cobertura depende de la pregunta de investigación.
Para un proyecto, la cobertura por ciudad puede predominar; para otro, la diversidad de ASN, la cobertura temporal o la distribución por dispositivo pueden importar más. Lo que importa es ir más allá de la suposición de que más direcciones IP significan automáticamente una mejor muestra estadística.
Una mayor amplitud de red crea más posibilidades de muestreo. La representatividad sigue dependiendo de cómo se utilice esa infraestructura.
De la infraestructura de proxies a la infraestructura de observación
Los proxies residenciales alimentan cada vez más pipelines analíticos para precios, conjuntos de datos de IA, inteligencia de mercado, analítica de búsquedas, monitorización de marca y verificación de anuncios, ámbitos en los que los datos recopilados se utilizan para describir algo más amplio que las páginas individuales solicitadas.
Eso cambia el estándar para la infraestructura de datos web. La pregunta ya no es solo “¿podemos acceder a este mercado?”, sino también “¿podemos justificar cómo lo hemos observado?”.
En Shifter, creemos que los grandes pools, la amplia cobertura de ASN, la geosegmentación precisa y la rotación fiable siguen siendo fundamentales. Crean el espacio de observación, pero son el comienzo de la metodología, no el final.
Un pool de proxies residenciales le ofrece posibles puntos de observación, y la rotación selecciona entre ellos. Ninguno de los dos garantiza que las observaciones finales representen el mundo que pretendía medir.
Eso requiere muestreo deliberado, cuotas, recopilación consciente del tiempo, informes de distribución y, cuando corresponda, ponderación estadística. La diversidad de acceso y la representatividad de la muestra no son lo mismo. La próxima generación de infraestructura de datos web debería permitir medir ambas cosas. Los planes y tarifas están en la página de precios.