Scraping

Creación de una base de datos de leads B2B mediante web scraping (conforme a la normativa y a escala)

Una base de datos de leads es un modelo de cuentas con contactos asociados, no una lista de correos electrónicos. Cómo crear una a partir de fuentes públicas con el cumplimiento normativo integrado en el esquema.

Chris Collins

Chris Collins

17 de septiembre de 2026 · 10 min de lectura

La mayoría de las bases de datos de leads B2B fallan de dos maneras, y ninguna de ellas es un fallo de scraping. Se degradan, porque las personas cambian de trabajo y las empresas cambian de forma más rápido de lo que nadie actualiza los registros. O se convierten en un pasivo, porque nadie puede decir de dónde vino un contacto, en base a qué se conserva, o si esa persona pidió ser eliminada.

Ambos fallos son decisiones de diseño tomadas el primer día. Esta guía trata sobre cómo construir una base de datos de leads a partir de fuentes públicas de forma que se mantenga precisa y defendible. El razonamiento de por qué la infraestructura de proxies importa para la generación de leads en primer lugar está en proxies residenciales para la generación de leads B2B. Esta es la construcción.

Empieza por el perfil de cliente ideal, no por el scraper

El perfil de cliente ideal decide qué fuentes importan, qué campos necesitas y qué tamaño debe tener la base de datos. Escríbelo antes de que empiece cualquier recopilación: sectores, franjas de tamaño, regiones, modelos de negocio y las señales observables que indican encaje.

Un perfil claro mantiene la base de datos pequeña y relevante. Uno vago produce una base de datos grande de empresas a las que nunca se les venderá nada, todas las cuales siguen conllevando las mismas obligaciones de cumplimiento que aquellas a las que sí.

Construye primero el universo de cuentas

Las empresas son la capa estable. Constrúyelas antes que cualquier contacto, a partir de fuentes que describen organizaciones en lugar de personas.

FuenteQué te aportaNotas
Registros mercantilesNombre legal, número de registro, estado, domicilio socialAutoritativa; muchas ofrecen archivos masivos o APIs
Directorios sectoriales y de asociacionesListas de miembros por sector y regiónA menudo paginados y con límite de frecuencia
Listas de expositores y patrocinadores de conferenciasEmpresas que invierten en tu categoríaLimitadas en el tiempo y muy relevantes
Marketplaces y directorios de sociosEmpresas que se integran con una plataforma determinadaSeñal tecnográfica fuerte
Sitios web de empresasProductos, ubicaciones, precios, clientesLa fuente más rica, y la más variada
Ofertas de empleoCrecimiento, estructura de equipo, herramientas en usoUna señal anticipada; ver datos de portales de empleo

Donde un registro o directorio publique datos masivos o una API, úsalos. Haz scraping de lo que no se ofrezca de ninguna otra manera.

Resuelve la identidad de la empresa antes que nada

La misma empresa aparece bajo un nombre legal, un nombre comercial, varios dominios, y como matriz y filiales. Si la identidad no se resuelve, la base de datos se llena de duplicados, y todos los recuentos posteriores quedan inflados.

Usa el dominio web principal como clave de trabajo, ya que es el identificador que comparten más fuentes. Normaliza los nombres legales eliminando sufijos y puntuación, adjunta identificadores de registro donde los tengas, y modela las relaciones de matriz y filial de forma explícita en lugar de fusionarlas. Mide la tasa de duplicados en una muestra revisada a mano y mantenla visible.

Datos firmográficos y señales, cada uno con una fuente

Para cada campo de empresa, almacena tres cosas: el valor, de dónde vino y cuándo se observó. El sector, la franja de tamaño, las ubicaciones, los indicadores tecnológicos y la actividad de contratación cambian todos, y un valor sin fecha no puede ser fiable seis meses después.

Señales como picos de contratación o lanzamientos de nuevos productos son eventos más que atributos, y pierden valor rápidamente. El razonamiento para tratarlas así está en scraping de señales de intención para impulsar la inteligencia de ventas.

La capa de contactos: primero los roles, después las personas

Los contactos son donde se concentran tanto la degradación como el riesgo de cumplimiento, así que añádelos al final y con cuidado.

Modela los roles antes que las personas. “Responsable de ingeniería de datos en esta empresa” sigue siendo cierto mucho después de que la persona que lo ocupaba se haya ido. Almacena el rol como el registro duradero y adjunta a la persona actual como una observación con fecha. El mismo principio se expone en construir datos de mapeo de talento y organigramas.

Mantente en el contexto profesional. Nombre, rol, empresa y un correo electrónico laboral o teléfono profesional publicados en un contexto profesional. Las direcciones de correo personales, los números de teléfono personales, las direcciones particulares y los perfiles sociales no relacionados con el trabajo no tienen cabida en una base de datos B2B.

Recopila solo lo que es público, y solo donde esté permitido. No hagas scraping de contenido detrás de un inicio de sesión, y respeta los términos de cada fuente.

No sondees servidores de correo para adivinar direcciones. Generar direcciones probables y probarlas contra el servidor de correo de una empresa se considera ampliamente abusivo, daña tu reputación de envío, y no añade nada defendible. Si necesitas direcciones verificadas, usa un servicio de verificación que hayas evaluado, o confía en direcciones que las propias personas hayan publicado.

Diseña el cumplimiento dentro del esquema

El cumplimiento que vive en un documento de política y no en el modelo de datos no sobrevive al contacto con una base de datos real. Ponlo en las tablas.

CampoPropósito
URL de origen y tipo de fuenteDemuestra de dónde vino cada valor
Recopilado enRespalda las decisiones de actualidad y retención
Referencia de base legalVincula el registro con la base documentada para conservarlo
PropósitoLimita el uso a lo que cubre la base legal
Jurisdicción, cuando se conozcaDetermina qué normas aplican al contacto comercial
Estado de notificaciónRegistra si y cuándo se informó a la persona
Vencimiento de retenciónFuerza una revisión o eliminación
Indicador de supresiónDetiene todo procesamiento y contacto posterior

Algunos puntos legales dan forma a esos campos. Son generales, y deberías trabajar con tu propia asesoría legal.

  • Los datos de contacto profesionales son datos personales. Bajo el RGPD, el correo laboral de una persona identificada sigue siendo un dato personal, y el reglamento se aplica.
  • El interés legítimo debe estar documentado. Es la base habitual para la prospección B2B, y requiere una evaluación de ponderación por escrito, no una suposición.
  • Hay que informar a las personas. Cuando obtienes los datos de alguien a partir de fuentes distintas de esa persona, el RGPD generalmente exige informarla, como muy tarde en el primer contacto cuando uses esos datos para comunicarte.
  • California ya no exime los datos B2B. Desde 2023, la información de contacto empresarial entra dentro del ámbito de la ley de privacidad de California.
  • Las normas de contacto comercial varían. Las normas para correo electrónico no solicitado a direcciones empresariales difieren según el país, y algunas exigen consentimiento previo incluso para B2B. Las normas estadounidenses de correo comercial exigen una opción de baja funcional.

La lista de supresión es permanente y global. Cuando alguien se da de baja o pide ser eliminado, elimínalo de todas las tablas derivadas, cachés y exportaciones, y conserva un registro mínimo que evite que vuelva a ser recopilado. Una supresión que se deshace en el siguiente rastreo no es una supresión.

El enfoque más amplio está en proxies residenciales y cumplimiento del RGPD.

Recopilar a escala

Distintas fuentes se mueven a velocidades distintas, así que da a cada una su propia cadencia en lugar de un rastreo global único.

FuenteCadencia habitual
Registros mercantilesMensual, o según su propio calendario de publicación
Directorios y listas de asociacionesSemanal a mensual
Sitios web de empresasMensual, con detección de cambios
Ofertas de empleoDiaria
Listas de eventosCuando se publican, y luego congeladas

Los directorios suelen estar paginados y limitados. Mantén una única salida durante todo un recorrido para que la paginación se mantenga coherente, y rota para peticiones de página independientes. Con la puerta de enlace de Shifter, ambas cosas se configuran en las credenciales frente a p.shifter.io:443:

customer-USERNAME-country-de-sid-dir-assoc-07-ttl-600:PASSWORD

Los directorios y registros regionales suelen servir contenido de forma distinta según la ubicación, así que recopila cada región desde esa región. Mantén tasas de petición normales y reduce la velocidad ante errores, como en limitación de tasa y regulación de peticiones. Para directorios que cargan resultados con JavaScript, una petición renderizada suele ser más sencilla que ejecutar tus propios navegadores; consulta cuándo necesitas una API de web scraping.

La actualidad es un proceso

Una base de datos de leads se degrada continuamente. Integra la actualización en las operaciones en lugar de programar una limpieza anual.

  • Reverifica los contactos según un calendario, y marca como obsoleto cualquier vínculo persona-rol más antiguo que tu umbral.
  • Vuelve a rastrear las fuentes de empresas según su cadencia, y registra lo que cambió.
  • Retroalimenta los resultados del contacto comercial. Los rebotes, las bajas y las respuestas de “ya no trabaja aquí” son la señal de actualidad más precisa que obtendrás, y deben actualizar la base de datos, no solo la herramienta de contacto comercial.

Medir la base de datos

MétricaQué te dice
Cobertura del perfil de cliente idealSi la base de datos contiene el mercado al que vendes
Tasa de duplicadosSi la resolución de identidad está funcionando
Completitud de camposDónde las fuentes son escasas
Distribución de obsolescenciaCuánto de los datos ha superado su umbral de actualización
Tasas de rebote y bajaPrecisión real y salud del consentimiento
Coincidencias de supresión durante la recopilaciónSi se están volviendo a recopilar personas suprimidas

Preguntas frecuentes

¿Es legal hacer scraping de datos de contacto B2B?

Puede serlo, cuando los datos son públicos, de contexto exclusivamente profesional, se conservan sobre una base legal documentada, y se gestionan con transparencia y opciones de baja. La respuesta depende de la jurisdicción y el uso, así que involucra a tu asesoría legal.

¿Podemos hacer scraping de plataformas de redes profesionales?

No detrás de un inicio de sesión, ni contra sus términos. Construye a partir de sitios de empresas, registros y directorios en su lugar.

¿Deberíamos comprar datos en lugar de construirlos?

Los datos con licencia complementan bien una construcción propia. Las obligaciones de cumplimiento sobre cómo los usas siguen recayendo en ti.

¿Con qué frecuencia se deben reverificar los contactos?

Con la frecuencia suficiente para que la proporción de datos obsoletos se mantenga pequeña. Muchos equipos revisan trimestralmente las cuentas objetivo activas y dejan que la retroalimentación del contacto comercial señale el resto.

En resumen

Una base de datos de leads B2B que perdura es primero un modelo de cuentas y después una lista de contactos. Construye las empresas a partir de fuentes autoritativas, resuelve su identidad, almacena cada valor con su fuente y fecha, adjunta los contactos a nivel de rol con datos de contexto exclusivamente profesional, y coloca la base legal, la notificación, la retención y la supresión en el esquema en lugar de en una política.

Recopila cada fuente según su propia cadencia, mantén la actualización funcionando de forma continua, y retroalimenta los resultados del contacto comercial en los datos. La visión de producto está en la página de recopilación de datos para generación de leads, y el aspecto de enriquecimiento se trata en enriquecimiento de contactos y empresas.

¿Listo para empezar?

Prueba los proxies residenciales de Shifter, más de 205M IPs, más de 195 países, desde 0,75 $/GB.

Comenzar