Guías, Tutoriales e Ideas
Aprende sobre proxies residenciales, web scraping, estrategias de recopilación de datos y buenas prácticas del sector con el equipo de Shifter.
Normalización de precios, números y fechas entre configuraciones regionales
1.234,56 € y $1,234.56 son ambos precios, y 03/04/2026 son dos fechas distintas. Cómo analizar correctamente los valores extraídos según la configuración regional, con código probado.
Encontrar la API detrás de la página: recopilar desde endpoints JSON en lugar de HTML
Muchas páginas cargan sus datos como JSON. Cómo encontrar el endpoint que los transporta, por qué a menudo está vinculado a la sesión de la página y cómo recopilarlos de forma responsable.
Presentamos IP Info: una API gratuita de geolocalización de IP, sin necesidad de clave API
IP Info es la API gratuita de geolocalización de IP y ASN de Shifter. Funciona con la misma base de datos que respalda nuestros pools de proxies, no necesita registro ni clave API, y está lista para agentes de IA.
Schema Drift en Datos Extraídos: Detectando Extractores Rotos Antes que tus Usuarios
Los scrapers rara vez fallan cuando un sitio cambia. Siguen funcionando y devuelven datos sutilmente incorrectos. Cómo los contratos de datos y el perfilado por lotes detectan la deriva a tiempo.
Sitemaps como fuente de descubrimiento: encontrar todas las URL sin rastrear el sitio entero
Los sitemaps XML enumeran las URL de un sitio, y a veces cuándo cambiaron. Cómo leerlos correctamente, y por qué nunca debes confiar en lastmod sin comprobarlo.
Extracción con LLM vs selectores: cuándo dejar que un modelo lea la página
Hicimos que un modelo de lenguaje extenso extrajera campos de 18 páginas de noticias en vivo y lo comparamos con los datos estructurados propios de esas páginas. Precisión, coste y cuándo usarlo.
Deduplicación de datos extraídos: resolución de entidades para productos, empresas y listados
El mismo producto, empresa o listado aparece muchas veces en distintas fuentes y ejecuciones. Cómo normalizar identificadores, hacer coincidencias de forma segura a gran escala y mantener un único registro limpio.
Coste por Registro Limpio: la Métrica de Scraping que Finanzas Realmente Entiende
Los gigabytes y el número de solicitudes no le dicen a finanzas cuánto cuesta realmente el dato. Cómo medir el coste por registro limpio y por cambio útil, y qué palancas lo influyen más.