스크래핑

웹 스크래핑으로 구축하는 B2B 리드 데이터베이스 (컴플라이언스를 지키며 대규모로)

리드 데이터베이스는 이메일 목록이 아니라 연락처가 연결된 계정 모델이다. 컴플라이언스를 스키마에 내재시켜 공개 출처로부터 이를 구축하는 방법을 소개한다.

Chris Collins

Chris Collins

2026년 9월 17일 · 7 분 소요

대부분의 B2B 리드 데이터베이스는 두 가지 방식 중 하나로 실패하며, 둘 다 스크래핑 실패는 아니다. 사람들이 이직하고 회사가 형태를 바꾸는 속도가 누구도 레코드를 갱신하는 속도보다 빠르기 때문에 데이터는 부패한다. 또는 어떤 연락처가 어디서 왔는지, 어떤 근거로 보유되는지, 해당 인물이 삭제를 요청했는지 아무도 말할 수 없기 때문에 부채가 된다.

두 실패 모두 첫날에 내려진 설계 결정이다. 이 가이드는 공개 출처로부터 리드 데이터베이스를 구축하여 정확성과 방어 가능성을 유지하는 방법을 다룬다. 프록시 인프라가 애초에 리드 생성에 왜 중요한지에 대한 논거는 B2B 리드 생성을 위한 레지덴셜 프록시에 있다. 이 글은 그 구축 방법이다.

스크래퍼가 아니라 이상적인 고객 프로필에서 시작하라

이상적인 고객 프로필은 어떤 출처가 중요한지, 어떤 필드가 필요한지, 데이터베이스가 얼마나 커야 하는지를 결정한다. 수집을 시작하기 전에 산업, 규모대, 지역, 비즈니스 모델, 적합성을 나타내는 관찰 가능한 신호를 문서화하라.

명확한 프로필은 데이터베이스를 작고 관련성 있게 유지한다. 모호한 프로필은 누구에게도 판매하지 않을 회사들로 가득 찬 대형 데이터베이스를 만들어내며, 이 모든 회사는 여전히 판매 대상인 회사들과 동일한 컴플라이언스 의무를 지닌다.

계정 유니버스를 먼저 구축하라

회사는 안정적인 계층이다. 연락처보다 먼저, 사람이 아니라 조직을 설명하는 출처로부터 회사를 구축하라.

출처제공하는 것참고 사항
사업자 등록부법인명, 등록번호, 상태, 등록 주소권위 있는 출처; 다수가 대량 파일이나 API를 제공
산업 및 협회 디렉터리부문 및 지역별 회원 목록종종 페이지네이션되고 속도 제한이 있음
콘퍼런스 전시자 및 스폰서 목록해당 카테고리에 투자하는 회사들시한부이며 관련성이 매우 높음
마켓플레이스 및 파트너 디렉터리특정 플랫폼과 통합하는 회사들강력한 테크노그래픽 신호
회사 웹사이트제품, 위치, 가격, 고객가장 풍부하고 가장 다양한 출처
채용 공고성장, 팀 구조, 사용 중인 도구선행 지표; 채용 게시판 데이터 참조

등록부나 디렉터리가 대량 데이터나 API를 제공하는 경우 이를 사용하라. 다른 방법으로 제공되지 않는 것만 스크래핑하라.

다른 무엇보다 먼저 회사 신원을 해결하라

같은 회사가 법인명, 상호, 여러 도메인, 모회사 및 자회사로 나타난다. 신원이 해결되지 않으면 데이터베이스는 중복으로 채워지고 이후의 모든 집계가 부풀려진다.

주요 웹 도메인을 작업 키로 사용하라. 이는 대부분의 출처가 공유하는 식별자이기 때문이다. 접미사와 구두점을 제거하여 법인명을 정규화하고, 보유하고 있는 경우 등록부 식별자를 부착하며, 모회사와 자회사 관계는 병합하지 말고 명시적으로 모델링하라. 수작업으로 확인한 표본에서 중복률을 측정하고 이를 계속 가시적으로 유지하라.

각각 출처가 있는 기업 정보 및 신호

모든 회사 필드에 대해 세 가지를 저장하라: 값, 출처, 관찰 시점. 산업, 규모대, 위치, 기술 지표, 채용 활동은 모두 변화하며, 날짜가 없는 값은 6개월 후 신뢰할 수 없다.

채용 급증이나 신제품 출시 같은 신호는 속성이 아니라 이벤트이며, 가치가 빠르게 소멸한다. 이를 그렇게 취급해야 하는 이유는 영업 인텔리전스를 위한 인텐트 신호 스크래핑에 나와 있다.

연락처 계층: 역할이 먼저, 사람은 그다음

부패와 컴플라이언스 위험이 집중되는 곳이 연락처이므로 마지막에, 신중하게 추가하라.

사람보다 역할을 먼저 모델링하라. “이 회사의 데이터 엔지니어링 책임자”는 그 자리를 맡은 사람이 떠난 후에도 오랫동안 유효하다. 역할을 지속적인 레코드로 저장하고 현재 그 자리에 있는 사람을 날짜가 있는 관찰값으로 부착하라. 같은 원칙이 인재 매핑 및 조직도 데이터 구축에 제시되어 있다.

비즈니스 맥락에 머물러라. 전문적 맥락에서 공개된 이름, 역할, 회사, 업무 이메일 또는 업무용 전화번호. 개인 이메일 주소, 개인 전화번호, 자택 주소, 업무와 무관한 소셜 프로필은 B2B 데이터베이스에 속하지 않는다.

공개되어 있고 허용된 경우에만 수집하라. 로그인 뒤에 있는 콘텐츠는 스크래핑하지 말고, 각 출처의 이용약관을 존중하라.

메일 서버를 프로빙하여 주소를 추측하지 마라. 가능성 있는 주소를 생성하여 회사 메일 서버에 테스트하는 것은 널리 남용으로 간주되며, 발신 평판을 훼손하고, 방어할 수 있는 것을 전혀 추가하지 않는다. 검증된 주소가 필요하다면 검증된 검증 서비스를 사용하거나, 사람들이 직접 공개한 주소에 의존하라.

스키마에 컴플라이언스를 설계하라

정책 문서에만 존재하고 데이터 모델에는 없는 컴플라이언스는 실제 데이터베이스와의 접촉에서 살아남지 못한다. 이를 테이블에 넣어라.

필드목적
출처 URL 및 출처 유형각 값이 어디서 왔는지 증명
수집 시각신선도 및 보존 결정을 지원
법적 근거 참조레코드를 보유의 문서화된 근거와 연결
목적사용을 근거가 커버하는 범위로 제한
관할권(알려진 경우)아웃리치에 적용되는 규칙을 결정
통지 상태해당 인물에게 언제 통지했는지 기록
보존 만료검토 또는 삭제를 강제
억제 플래그모든 추가 처리 및 아웃리치를 중단

몇 가지 법적 요점이 이러한 필드를 형성한다. 이는 일반적인 내용이며, 자체 법률 자문을 받아야 한다.

  • 업무용 연락처 정보는 개인 데이터다. GDPR 하에서 실명이 붙은 사람의 업무 이메일은 여전히 개인 데이터이며, 규정이 적용된다.
  • 정당한 이익은 문서화되어야 한다. 이는 B2B 프로스펙팅의 일반적인 근거이며, 추정이 아니라 서면 균형 평가가 필요하다.
  • 사람들에게 알려야 한다. 본인이 아닌 출처에서 누군가의 데이터를 획득한 경우, GDPR은 일반적으로 통지를 요구하며, 늦어도 그 데이터를 사용해 연락하는 첫 시점에는 통지해야 한다.
  • 캘리포니아는 더 이상 B2B 데이터를 면제하지 않는다. 2023년 이후로 업무용 연락처 정보는 캘리포니아 개인정보보호법의 범위에 포함된다.
  • 아웃리치 규칙은 다양하다. 업무용 주소로 보내는 원치 않는 이메일에 대한 규칙은 국가별로 다르며, 일부는 B2B에도 사전 동의를 요구한다. 미국의 상업용 이메일 규칙은 작동하는 옵트아웃을 요구한다.

억제 목록은 영구적이고 전역적이다. 누군가 옵트아웃하거나 삭제를 요청하면 모든 파생 테이블, 캐시, 내보내기에서 제거하고, 재수집을 막는 최소한의 기록을 유지하라. 다음 크롤링에 의해 무효화되는 억제는 억제가 아니다.

더 넓은 프레이밍은 레지덴셜 프록시와 GDPR 준수에 있다.

대규모로 수집하기

서로 다른 출처는 서로 다른 속도로 움직이므로, 하나의 전역 크롤링이 아니라 각 출처에 고유한 주기를 부여하라.

출처일반적인 주기
등록부매월, 또는 자체 공개 일정에 따라
디렉터리 및 협회 목록매주에서 매월
회사 웹사이트매월, 변경 감지 포함
채용 공고매일
이벤트 목록게시될 때, 이후 고정

디렉터리는 대개 페이지네이션되고 스로틀링된다. 페이지네이션이 일관되게 유지되도록 전체 순회 동안 하나의 종료 IP를 유지하고, 독립적인 페이지 가져오기에는 로테이션하라. Shifter 게이트웨이를 사용하면 두 가지 모두 p.shifter.io:443에 대한 자격 증명에서 설정된다:

customer-USERNAME-country-de-sid-dir-assoc-07-ttl-600:PASSWORD

지역 디렉터리와 등록부는 종종 위치에 따라 다르게 응답하므로, 각 지역은 해당 지역에서 수집하라. 속도 제한 및 요청 스로틀링에서와 같이 요청 속도를 평범하게 유지하고 오류 발생 시 백오프하라. 결과를 JavaScript로 로드하는 디렉터리의 경우, 자체 브라우저를 운영하는 것보다 렌더링된 요청이 더 간단할 때가 많다; 웹 스크래핑 API가 필요한 경우를 참조하라.

신선도는 하나의 프로세스다

리드 데이터베이스는 지속적으로 부패한다. 연간 정리 작업을 계획하기보다 새로고침을 운영에 내장하라.

  • 일정에 따라 연락처를 재검증하고, 임계값보다 오래된 사람-역할 연결은 오래된 것으로 표시하라.
  • 회사 출처를 그들의 주기에 맞춰 재크롤링하고, 무엇이 바뀌었는지 기록하라.
  • 아웃리치 결과를 피드백하라. 반송, 옵트아웃, “더 이상 여기 없음” 답장은 얻을 수 있는 가장 정확한 신선도 신호이며, 아웃리치 도구뿐만 아니라 데이터베이스도 업데이트해야 한다.

데이터베이스 측정하기

지표알려주는 것
이상적인 고객 프로필의 커버리지데이터베이스가 판매 대상 시장을 포함하는지 여부
중복률신원 해결이 작동하는지 여부
필드 완전성출처가 부실한 부분
오래됨 분포새로고침 임계값을 넘긴 데이터의 비율
반송 및 옵트아웃 비율실제 정확성 및 동의 건전성
수집 중 억제 히트억제된 사람들이 재수집되고 있는지 여부

FAQ

B2B 연락처 데이터를 스크래핑하는 것이 합법적인가?

데이터가 공개되어 있고, 업무 맥락에 한정되며, 문서화된 법적 근거로 보유되고, 투명성과 옵트아웃으로 처리되는 경우 합법적일 수 있다. 답은 관할권과 용도에 따라 달라지므로 법률 자문을 받아라.

전문 네트워킹 플랫폼을 스크래핑할 수 있는가?

로그인 뒤에서는 안 되며, 그들의 약관에 반해서도 안 된다. 대신 회사 사이트, 등록부, 디렉터리로부터 구축하라.

직접 구축하기보다 데이터를 구매해야 하는가?

라이선스된 데이터는 구축을 잘 보완한다. 그것을 사용하는 방식에 대한 컴플라이언스 의무는 여전히 당신에게 있다.

연락처는 얼마나 자주 재검증해야 하는가?

오래된 비율이 작게 유지될 만큼 자주. 많은 팀이 활성 타깃 계정을 분기별로 재확인하고 나머지는 아웃리치 피드백이 플래그하도록 둔다.

결론

오래 지속되는 B2B 리드 데이터베이스는 먼저 계정 모델이고, 그다음이 연락처 목록이다. 권위 있는 출처로부터 회사를 구축하고, 신원을 해결하고, 모든 값을 출처와 날짜와 함께 저장하고, 업무 맥락 데이터만 사용하여 역할 수준에서 연락처를 부착하고, 법적 근거, 통지, 보존, 억제를 정책이 아니라 스키마에 넣어라.

각 출처를 고유한 주기로 수집하고, 새로고침을 지속적으로 운영하며, 아웃리치 결과를 데이터로 피드백하라. 제품 관점은 리드 생성 데이터 수집 페이지에 있고, 보강 측면은 연락처 및 회사 보강에서 다룬다.

시작할 준비가 되셨나요?

205M개 이상의 IP, 195개 이상의 국가를 지원하는 Shifter의 레지덴셜 프록시를 $0.10/GB부터 이용해보세요.

시작하기