La mayoría de las bases de datos de leads B2B fallan de dos maneras, y ninguna de ellas es un fallo de scraping. Se degradan, porque las personas cambian de trabajo y las empresas cambian de forma más rápido de lo que nadie actualiza los registros. O se convierten en un pasivo, porque nadie puede decir de dónde vino un contacto, en base a qué se conserva, o si esa persona pidió ser eliminada.
Ambos fallos son decisiones de diseño tomadas el primer día. Esta guía trata sobre cómo construir una base de datos de leads a partir de fuentes públicas de forma que se mantenga precisa y defendible. El razonamiento de por qué la infraestructura de proxies importa para la generación de leads en primer lugar está en proxies residenciales para la generación de leads B2B. Esta es la construcción.
Empieza por el perfil de cliente ideal, no por el scraper
El perfil de cliente ideal decide qué fuentes importan, qué campos necesitas y qué tamaño debe tener la base de datos. Escríbelo antes de que empiece cualquier recopilación: sectores, franjas de tamaño, regiones, modelos de negocio y las señales observables que indican encaje.
Un perfil claro mantiene la base de datos pequeña y relevante. Uno vago produce una base de datos grande de empresas a las que nunca se les venderá nada, todas las cuales siguen conllevando las mismas obligaciones de cumplimiento que aquellas a las que sí.
Construye primero el universo de cuentas
Las empresas son la capa estable. Constrúyelas antes que cualquier contacto, a partir de fuentes que describen organizaciones en lugar de personas.
| Fuente | Qué te aporta | Notas |
|---|---|---|
| Registros mercantiles | Nombre legal, número de registro, estado, domicilio social | Autoritativa; muchas ofrecen archivos masivos o APIs |
| Directorios sectoriales y de asociaciones | Listas de miembros por sector y región | A menudo paginados y con límite de frecuencia |
| Listas de expositores y patrocinadores de conferencias | Empresas que invierten en tu categoría | Limitadas en el tiempo y muy relevantes |
| Marketplaces y directorios de socios | Empresas que se integran con una plataforma determinada | Señal tecnográfica fuerte |
| Sitios web de empresas | Productos, ubicaciones, precios, clientes | La fuente más rica, y la más variada |
| Ofertas de empleo | Crecimiento, estructura de equipo, herramientas en uso | Una señal anticipada; ver datos de portales de empleo |
Donde un registro o directorio publique datos masivos o una API, úsalos. Haz scraping de lo que no se ofrezca de ninguna otra manera.
Resuelve la identidad de la empresa antes que nada
La misma empresa aparece bajo un nombre legal, un nombre comercial, varios dominios, y como matriz y filiales. Si la identidad no se resuelve, la base de datos se llena de duplicados, y todos los recuentos posteriores quedan inflados.
Usa el dominio web principal como clave de trabajo, ya que es el identificador que comparten más fuentes. Normaliza los nombres legales eliminando sufijos y puntuación, adjunta identificadores de registro donde los tengas, y modela las relaciones de matriz y filial de forma explícita en lugar de fusionarlas. Mide la tasa de duplicados en una muestra revisada a mano y mantenla visible.
Datos firmográficos y señales, cada uno con una fuente
Para cada campo de empresa, almacena tres cosas: el valor, de dónde vino y cuándo se observó. El sector, la franja de tamaño, las ubicaciones, los indicadores tecnológicos y la actividad de contratación cambian todos, y un valor sin fecha no puede ser fiable seis meses después.
Señales como picos de contratación o lanzamientos de nuevos productos son eventos más que atributos, y pierden valor rápidamente. El razonamiento para tratarlas así está en scraping de señales de intención para impulsar la inteligencia de ventas.
La capa de contactos: primero los roles, después las personas
Los contactos son donde se concentran tanto la degradación como el riesgo de cumplimiento, así que añádelos al final y con cuidado.
Modela los roles antes que las personas. “Responsable de ingeniería de datos en esta empresa” sigue siendo cierto mucho después de que la persona que lo ocupaba se haya ido. Almacena el rol como el registro duradero y adjunta a la persona actual como una observación con fecha. El mismo principio se expone en construir datos de mapeo de talento y organigramas.
Mantente en el contexto profesional. Nombre, rol, empresa y un correo electrónico laboral o teléfono profesional publicados en un contexto profesional. Las direcciones de correo personales, los números de teléfono personales, las direcciones particulares y los perfiles sociales no relacionados con el trabajo no tienen cabida en una base de datos B2B.
Recopila solo lo que es público, y solo donde esté permitido. No hagas scraping de contenido detrás de un inicio de sesión, y respeta los términos de cada fuente.
No sondees servidores de correo para adivinar direcciones. Generar direcciones probables y probarlas contra el servidor de correo de una empresa se considera ampliamente abusivo, daña tu reputación de envío, y no añade nada defendible. Si necesitas direcciones verificadas, usa un servicio de verificación que hayas evaluado, o confía en direcciones que las propias personas hayan publicado.
Diseña el cumplimiento dentro del esquema
El cumplimiento que vive en un documento de política y no en el modelo de datos no sobrevive al contacto con una base de datos real. Ponlo en las tablas.
| Campo | Propósito |
|---|---|
| URL de origen y tipo de fuente | Demuestra de dónde vino cada valor |
| Recopilado en | Respalda las decisiones de actualidad y retención |
| Referencia de base legal | Vincula el registro con la base documentada para conservarlo |
| Propósito | Limita el uso a lo que cubre la base legal |
| Jurisdicción, cuando se conozca | Determina qué normas aplican al contacto comercial |
| Estado de notificación | Registra si y cuándo se informó a la persona |
| Vencimiento de retención | Fuerza una revisión o eliminación |
| Indicador de supresión | Detiene todo procesamiento y contacto posterior |
Algunos puntos legales dan forma a esos campos. Son generales, y deberías trabajar con tu propia asesoría legal.
- Los datos de contacto profesionales son datos personales. Bajo el RGPD, el correo laboral de una persona identificada sigue siendo un dato personal, y el reglamento se aplica.
- El interés legítimo debe estar documentado. Es la base habitual para la prospección B2B, y requiere una evaluación de ponderación por escrito, no una suposición.
- Hay que informar a las personas. Cuando obtienes los datos de alguien a partir de fuentes distintas de esa persona, el RGPD generalmente exige informarla, como muy tarde en el primer contacto cuando uses esos datos para comunicarte.
- California ya no exime los datos B2B. Desde 2023, la información de contacto empresarial entra dentro del ámbito de la ley de privacidad de California.
- Las normas de contacto comercial varían. Las normas para correo electrónico no solicitado a direcciones empresariales difieren según el país, y algunas exigen consentimiento previo incluso para B2B. Las normas estadounidenses de correo comercial exigen una opción de baja funcional.
La lista de supresión es permanente y global. Cuando alguien se da de baja o pide ser eliminado, elimínalo de todas las tablas derivadas, cachés y exportaciones, y conserva un registro mínimo que evite que vuelva a ser recopilado. Una supresión que se deshace en el siguiente rastreo no es una supresión.
El enfoque más amplio está en proxies residenciales y cumplimiento del RGPD.
Recopilar a escala
Distintas fuentes se mueven a velocidades distintas, así que da a cada una su propia cadencia en lugar de un rastreo global único.
| Fuente | Cadencia habitual |
|---|---|
| Registros mercantiles | Mensual, o según su propio calendario de publicación |
| Directorios y listas de asociaciones | Semanal a mensual |
| Sitios web de empresas | Mensual, con detección de cambios |
| Ofertas de empleo | Diaria |
| Listas de eventos | Cuando se publican, y luego congeladas |
Los directorios suelen estar paginados y limitados. Mantén una única salida durante todo un recorrido para que la paginación se mantenga coherente, y rota para peticiones de página independientes. Con la puerta de enlace de Shifter, ambas cosas se configuran en las credenciales frente a p.shifter.io:443:
customer-USERNAME-country-de-sid-dir-assoc-07-ttl-600:PASSWORD
Los directorios y registros regionales suelen servir contenido de forma distinta según la ubicación, así que recopila cada región desde esa región. Mantén tasas de petición normales y reduce la velocidad ante errores, como en limitación de tasa y regulación de peticiones. Para directorios que cargan resultados con JavaScript, una petición renderizada suele ser más sencilla que ejecutar tus propios navegadores; consulta cuándo necesitas una API de web scraping.
La actualidad es un proceso
Una base de datos de leads se degrada continuamente. Integra la actualización en las operaciones en lugar de programar una limpieza anual.
- Reverifica los contactos según un calendario, y marca como obsoleto cualquier vínculo persona-rol más antiguo que tu umbral.
- Vuelve a rastrear las fuentes de empresas según su cadencia, y registra lo que cambió.
- Retroalimenta los resultados del contacto comercial. Los rebotes, las bajas y las respuestas de “ya no trabaja aquí” son la señal de actualidad más precisa que obtendrás, y deben actualizar la base de datos, no solo la herramienta de contacto comercial.
Medir la base de datos
| Métrica | Qué te dice |
|---|---|
| Cobertura del perfil de cliente ideal | Si la base de datos contiene el mercado al que vendes |
| Tasa de duplicados | Si la resolución de identidad está funcionando |
| Completitud de campos | Dónde las fuentes son escasas |
| Distribución de obsolescencia | Cuánto de los datos ha superado su umbral de actualización |
| Tasas de rebote y baja | Precisión real y salud del consentimiento |
| Coincidencias de supresión durante la recopilación | Si se están volviendo a recopilar personas suprimidas |
Preguntas frecuentes
¿Es legal hacer scraping de datos de contacto B2B?
Puede serlo, cuando los datos son públicos, de contexto exclusivamente profesional, se conservan sobre una base legal documentada, y se gestionan con transparencia y opciones de baja. La respuesta depende de la jurisdicción y el uso, así que involucra a tu asesoría legal.
¿Podemos hacer scraping de plataformas de redes profesionales?
No detrás de un inicio de sesión, ni contra sus términos. Construye a partir de sitios de empresas, registros y directorios en su lugar.
¿Deberíamos comprar datos en lugar de construirlos?
Los datos con licencia complementan bien una construcción propia. Las obligaciones de cumplimiento sobre cómo los usas siguen recayendo en ti.
¿Con qué frecuencia se deben reverificar los contactos?
Con la frecuencia suficiente para que la proporción de datos obsoletos se mantenga pequeña. Muchos equipos revisan trimestralmente las cuentas objetivo activas y dejan que la retroalimentación del contacto comercial señale el resto.
En resumen
Una base de datos de leads B2B que perdura es primero un modelo de cuentas y después una lista de contactos. Construye las empresas a partir de fuentes autoritativas, resuelve su identidad, almacena cada valor con su fuente y fecha, adjunta los contactos a nivel de rol con datos de contexto exclusivamente profesional, y coloca la base legal, la notificación, la retención y la supresión en el esquema en lugar de en una política.
Recopila cada fuente según su propia cadencia, mantén la actualización funcionando de forma continua, y retroalimenta los resultados del contacto comercial en los datos. La visión de producto está en la página de recopilación de datos para generación de leads, y el aspecto de enriquecimiento se trata en enriquecimiento de contactos y empresas.