A maioria dos bancos de dados de leads B2B falha de uma de duas formas, e nenhuma delas é uma falha de scraping. Eles se deterioram, porque as pessoas trocam de emprego e as empresas mudam de forma mais rápido do que alguém atualiza os registros. Ou se tornam um passivo, porque ninguém consegue dizer de onde veio um contato, com base em quê ele é mantido, ou se essa pessoa pediu para ser removida.
Ambas as falhas são decisões de design tomadas no primeiro dia. Este guia trata da construção de um banco de dados de leads a partir de fontes públicas, de modo que ele permaneça preciso e defensável. O argumento de por que a infraestrutura de proxy importa para a geração de leads, antes de tudo, está em proxies residenciais para geração de leads B2B. Esta é a construção.
Comece pelo perfil de cliente ideal, não pelo scraper
O perfil de cliente ideal decide quais fontes importam, quais campos você precisa e qual deve ser o tamanho do banco de dados. Registre-o por escrito antes de qualquer coleta começar: setores, faixas de tamanho, regiões, modelos de negócio e os sinais observáveis que indicam adequação.
Um perfil claro mantém o banco de dados pequeno e relevante. Um perfil vago produz um grande banco de dados de empresas para as quais ninguém jamais venderá, e todas elas ainda carregam as mesmas obrigações de conformidade que as empresas para as quais você realmente vende.
Construa primeiro o universo de contas
Empresas são a camada estável. Construa-as antes de qualquer contato, a partir de fontes que descrevem organizações, e não pessoas.
| Fonte | O que ela fornece | Observações |
|---|---|---|
| Registros empresariais | Nome legal, número de registro, status, endereço registrado | Autoritativo; muitos oferecem arquivos em massa ou APIs |
| Diretórios de setor e associações | Listas de membros por setor e região | Frequentemente paginados e com limite de taxa |
| Listas de expositores e patrocinadores de conferências | Empresas investindo na sua categoria | Limitadas no tempo e altamente relevantes |
| Diretórios de marketplace e parceiros | Empresas que se integram a uma determinada plataforma | Forte sinal tecnográfico |
| Sites de empresas | Produtos, localizações, preços, clientes | A fonte mais rica, e a mais variada |
| Vagas de emprego | Crescimento, estrutura de equipe, ferramentas em uso | Um sinal antecedente; veja dados de portais de vagas |
Quando um registro ou diretório publica dados em massa ou uma API, use-os. Faça scraping apenas do que não é oferecido de nenhuma outra forma.
Resolva a identidade da empresa antes de qualquer coisa
A mesma empresa aparece sob um nome legal, um nome fantasia, vários domínios, e como matriz e subsidiárias. Se a identidade não for resolvida, o banco de dados se enche de duplicatas, e toda contagem posterior fica inflada.
Use o domínio web principal como chave de trabalho, já que é o identificador que a maioria das fontes compartilha. Normalize nomes legais removendo sufixos e pontuação, associe identificadores de registro onde você os tiver, e modele explicitamente as relações entre matriz e subsidiárias em vez de mesclá-las. Meça a taxa de duplicação em uma amostra verificada manualmente e mantenha-a visível.
Firmográficos e sinais, cada um com uma fonte
Para cada campo de empresa, armazene três coisas: o valor, de onde ele veio, e quando foi observado. Setor, faixa de tamanho, localizações, indicadores de tecnologia e atividade de contratação, tudo isso muda, e um valor sem data não pode ser confiável seis meses depois.
Sinais como picos de contratação ou lançamentos de novos produtos são eventos, e não atributos, e perdem valor rapidamente. O argumento para tratá-los dessa forma está em scraping de sinais de intenção para impulsionar sales intelligence.
A camada de contatos: cargos primeiro, pessoas depois
Os contatos são onde tanto a deterioração quanto o risco de conformidade se concentram, então adicione-os por último e com cuidado.
Modele cargos antes de pessoas. “Head of data engineering nesta empresa” permanece verdadeiro muito tempo depois que a pessoa que o ocupava saiu. Armazene o cargo como o registro duradouro e associe a pessoa atual a ele como uma observação com data. O mesmo princípio é apresentado em construindo dados de mapeamento de talentos e organogramas.
Mantenha-se no contexto profissional. Nome, cargo, empresa e um e-mail de trabalho ou telefone comercial publicados em um contexto profissional. Endereços de e-mail pessoais, números de telefone pessoais, endereços residenciais e perfis sociais não relacionados ao trabalho não pertencem a um banco de dados B2B.
Colete apenas o que é público, e apenas onde você tem permissão. Não faça scraping de conteúdo atrás de login, e respeite os termos de cada fonte.
Não sonde servidores de e-mail para adivinhar endereços. Gerar endereços prováveis e testá-los contra o servidor de e-mail de uma empresa é amplamente tratado como abusivo, prejudica sua reputação de envio, e não adiciona nada defensável. Se você precisa de endereços verificados, use um serviço de verificação que você já avaliou, ou dependa de endereços que as próprias pessoas publicaram.
Projete a conformidade dentro do esquema
A conformidade que vive em um documento de política e não no modelo de dados não sobrevive ao contato com um banco de dados real. Coloque-a nas tabelas.
| Campo | Finalidade |
|---|---|
| URL de origem e tipo de fonte | Comprova de onde cada valor veio |
| Coletado em | Apoia decisões de atualidade e retenção |
| Referência de base legal | Vincula o registro à base documentada para mantê-lo |
| Finalidade | Limita o uso ao que a base cobre |
| Jurisdição, quando conhecida | Determina quais regras se aplicam à abordagem |
| Status de notificação | Registra se e quando a pessoa foi informada |
| Prazo de retenção | Força revisão ou exclusão |
| Sinalizador de suspensão | Interrompe todo processamento e abordagem adicional |
Alguns pontos da lei moldam esses campos. Eles são gerais, e você deve trabalhar com sua própria assessoria jurídica.
- Dados de contato profissional são dados pessoais. Sob o GDPR, o e-mail de trabalho de uma pessoa nomeada ainda é dado pessoal, e a regulamentação se aplica.
- O interesse legítimo precisa ser documentado. É a base usual para prospecção B2B, e exige uma avaliação de balanceamento por escrito, não uma suposição.
- As pessoas devem ser informadas. Quando você obtém os dados de alguém a partir de fontes diferentes da própria pessoa, o GDPR geralmente exige informá-la, no mais tardar no primeiro contato, quando você usa os dados para se comunicar.
- A Califórnia não mais isenta dados B2B. Desde 2023, informações de contato profissional estão dentro do escopo da lei de privacidade da Califórnia.
- As regras de abordagem variam. As regras para e-mails não solicitados a endereços profissionais diferem por país, e algumas exigem consentimento prévio mesmo para B2B. As regras de e-mail comercial dos EUA exigem um opt-out funcional.
A lista de suspensão é permanente e global. Quando alguém opta por saída (opt-out) ou pede para ser excluído, remova-o de todas as tabelas derivadas, caches e exportações, e mantenha um registro mínimo que evite que seja coletado novamente. Uma suspensão que é desfeita pelo próximo crawl não é uma suspensão.
O enquadramento mais amplo está em proxies residenciais e conformidade com o GDPR.
Coletando em escala
Fontes diferentes se movem em velocidades diferentes, então dê a cada uma seu próprio ritmo, em vez de um único crawl global.
| Fonte | Cadência típica |
|---|---|
| Registros | Mensal, ou conforme seu próprio cronograma de publicação |
| Diretórios e listas de associações | Semanal a mensal |
| Sites de empresas | Mensal, com detecção de mudanças |
| Vagas de emprego | Diária |
| Listas de eventos | Quando publicadas, depois congeladas |
Diretórios geralmente são paginados e limitados. Mantenha uma saída fixa durante toda a varredura para que a paginação permaneça consistente, e alterne para buscas de página independentes. Com o gateway Shifter, ambos são definidos nas credenciais em p.shifter.io:443:
customer-USERNAME-country-de-sid-dir-assoc-07-ttl-600:PASSWORD
Diretórios e registros regionais frequentemente servem conteúdo diferente conforme a localização, então colete cada região a partir dessa região. Mantenha as taxas de requisição normais e reduza a frequência em caso de erros, como em limitação de taxa e throttling de requisições. Para diretórios que carregam resultados com JavaScript, uma requisição renderizada costuma ser mais simples do que executar seus próprios navegadores; veja quando você precisa de uma web scraping API.
Atualidade é um processo
Um banco de dados de leads se deteriora continuamente. Incorpore a atualização às operações, em vez de programar uma limpeza anual.
- Reverifique os contatos em um cronograma, e marque como obsoleto qualquer vínculo pessoa-cargo mais antigo do que o seu limite.
- Refaça o crawl das fontes de empresas na sua cadência, e registre o que mudou.
- Realimente os resultados da abordagem. Bounces, opt-outs e respostas do tipo “não trabalho mais aqui” são o sinal de atualidade mais preciso que você terá, e eles devem atualizar o banco de dados, não apenas a ferramenta de abordagem.
Medindo o banco de dados
| Métrica | O que ela indica |
|---|---|
| Cobertura do perfil de cliente ideal | Se o banco de dados contém o mercado para o qual você vende |
| Taxa de duplicação | Se a resolução de identidade está funcionando |
| Completude de campos | Onde as fontes são escassas |
| Distribuição de obsolescência | Quanto dos dados passou do limite de atualização |
| Taxas de bounce e opt-out | Precisão no mundo real e saúde do consentimento |
| Acertos de suspensão durante a coleta | Se pessoas suspensas estão sendo coletadas novamente |
Perguntas frequentes
Fazer scraping de dados de contato B2B é legal?
Pode ser, quando os dados são públicos, restritos ao contexto profissional, mantidos com base em uma base legal documentada, e tratados com transparência e opt-outs. A resposta depende da jurisdição e do uso, então envolva uma assessoria jurídica.
Podemos fazer scraping de plataformas de networking profissional?
Não atrás de um login, e não contra os termos delas. Em vez disso, construa a partir de sites de empresas, registros e diretórios.
Devemos comprar dados em vez de construí-los?
Dados licenciados complementam bem uma construção própria. As obrigações de conformidade sobre como você os usa continuam sendo suas.
Com que frequência os contatos devem ser reverificados?
Com frequência suficiente para que a parcela obsoleta permaneça pequena. Muitas equipes reverificam as contas-alvo ativas trimestralmente e deixam que o feedback da abordagem sinalize o restante.
Conclusão
Um banco de dados de leads B2B que dura é, primeiro, um modelo de contas e, depois, uma lista de contatos. Construa as empresas a partir de fontes autoritativas, resolva sua identidade, armazene cada valor com sua fonte e data, associe contatos no nível do cargo apenas com dados de contexto profissional, e coloque base legal, notificação, retenção e suspensão no esquema, em vez de em uma política.
Colete cada fonte em sua própria cadência, mantenha a atualização em execução contínua, e realimente os resultados da abordagem nos dados. A visão de produto está na página de coleta de dados para geração de leads, e o lado de enriquecimento é abordado em enriquecimento de contatos e empresas.