Blog

Guías, Tutoriales e Ideas

Aprende sobre proxies residenciales, web scraping, estrategias de recopilación de datos y buenas prácticas del sector con el equipo de Shifter.

Conocimiento
Conocimiento 9 min de lectura

Normalización de precios, números y fechas entre configuraciones regionales

1.234,56 € y $1,234.56 son ambos precios, y 03/04/2026 son dos fechas distintas. Cómo analizar correctamente los valores extraídos según la configuración regional, con código probado.

James Meadow James Meadow · 30 de septiembre de 2026
Scraping
Scraping 9 min de lectura

Encontrar la API detrás de la página: recopilar desde endpoints JSON en lugar de HTML

Muchas páginas cargan sus datos como JSON. Cómo encontrar el endpoint que los transporta, por qué a menudo está vinculado a la sesión de la página y cómo recopilarlos de forma responsable.

Chris Collins Chris Collins · 30 de septiembre de 2026
Noticias
Noticias 6 min de lectura

Presentamos IP Info: una API gratuita de geolocalización de IP, sin necesidad de clave API

IP Info es la API gratuita de geolocalización de IP y ASN de Shifter. Funciona con la misma base de datos que respalda nuestros pools de proxies, no necesita registro ni clave API, y está lista para agentes de IA.

James Meadow James Meadow · 29 de septiembre de 2026
Conocimiento
Conocimiento 9 min de lectura

Schema Drift en Datos Extraídos: Detectando Extractores Rotos Antes que tus Usuarios

Los scrapers rara vez fallan cuando un sitio cambia. Siguen funcionando y devuelven datos sutilmente incorrectos. Cómo los contratos de datos y el perfilado por lotes detectan la deriva a tiempo.

Matt Brown Matt Brown · 29 de septiembre de 2026
Scraping
Scraping 9 min de lectura

Sitemaps como fuente de descubrimiento: encontrar todas las URL sin rastrear el sitio entero

Los sitemaps XML enumeran las URL de un sitio, y a veces cuándo cambiaron. Cómo leerlos correctamente, y por qué nunca debes confiar en lastmod sin comprobarlo.

James Meadow James Meadow · 29 de septiembre de 2026
Scraping
Scraping 10 min de lectura

Extracción con LLM vs selectores: cuándo dejar que un modelo lea la página

Hicimos que un modelo de lenguaje extenso extrajera campos de 18 páginas de noticias en vivo y lo comparamos con los datos estructurados propios de esas páginas. Precisión, coste y cuándo usarlo.

Chris Collins Chris Collins · 28 de septiembre de 2026
Conocimiento
Conocimiento 10 min de lectura

Deduplicación de datos extraídos: resolución de entidades para productos, empresas y listados

El mismo producto, empresa o listado aparece muchas veces en distintas fuentes y ejecuciones. Cómo normalizar identificadores, hacer coincidencias de forma segura a gran escala y mantener un único registro limpio.

Matt Brown Matt Brown · 28 de septiembre de 2026
Conocimiento
Conocimiento 9 min de lectura

Coste por Registro Limpio: la Métrica de Scraping que Finanzas Realmente Entiende

Los gigabytes y el número de solicitudes no le dicen a finanzas cuánto cuesta realmente el dato. Cómo medir el coste por registro limpio y por cambio útil, y qué palancas lo influyen más.

James Meadow James Meadow · 27 de septiembre de 2026