스크래핑

스크래핑 시 차단을 피하는 방법

더 나은 세션 제어, 속도 조절, 핑거프린팅, 타겟팅을 활용해 레지덴셜 프록시로 스크래핑할 때 차단을 피하는 방법을 알아보세요.

Chris Collins

Chris Collins

2026년 6월 4일 · 7 분 소요

레지덴셜 프록시 풀을 사용하면 데이터센터 IP로는 절대 도달할 수 없는 시장, 스토어프론트, 지역화된 SERP에 접근할 수 있다. 하지만 봇처럼 행동하는 스크레이퍼를 구해주지는 못한다. 이것이 팀들이 “레지덴셜 프록시로 스크래핑할 때 차단을 피하는 방법”을 물을 때 저지르는 핵심적인 실수다. 프록시는 하나의 계층일 뿐이다. 탐지 시스템은 전체 요청 패턴을 점수화한다. IP 품질, 세션 일관성, 헤더, TLS 동작, 탐색 흐름, 요청 속도, 쿠키 처리, 심지어 재시도가 사람처럼 보이는지 기계적으로 보이는지까지 포함해서다.

대규모로 수집을 운영한다면, 차단 회피는 숨는 것보다 명백한 이상 징후를 줄이는 것에 가깝다. 목표는 보이지 않는 것이 아니라 운영상 정상으로 보이는 것이다.

레지덴셜 프록시로 스크래핑할 때 차단을 피하는 방법

첫 번째 결정은 세션 설계다. 많은 스크레이퍼가 IP 변경이 많을수록 항상 위험이 낮아진다고 가정하여 지나치게 공격적으로 로테이션한다. 단순한 대상에서는 이것이 통할 수 있다. 더 성숙한 안티봇 스택에서는 지속적인 IP 교체 자체가 하나의 시그니처가 된다. 특히 동일한 브라우저 핑거프린트, 쿠키 저장소, 사용자 흐름이 몇 번의 요청마다 새로운 가정용 IP에서 나타날 때 그렇다.

바로 이 지점에서 고정 세션과 로테이팅 세션을 의도적으로 사용해야 한다. 로그인 상태, 다단계 탐색, 장바구니, 검색 세분화 등 쿠키와 IP 평판이 일정 기간 동안 정렬되어야 하는 경로처럼 대상이 연속성을 기대하는 경우 고정 세션을 사용한다. 공개된 제품 상세 페이지를 수집하거나 여러 지역에 걸쳐 검색 결과 순위를 확인하는 것처럼 각 요청이 독립적인 경우 로테이팅 세션을 사용한다.

이 트레이드오프는 단순하다. 고정 세션은 행동 일관성을 향상시키지만 하나의 세션이 플래그되면 노출이 증가한다. 빠른 로테이션은 위험을 분산시키지만 다른 모든 신호가 동일하게 유지되면 부자연스러워 보일 수 있다. 올바른 선택은 사이트 아키텍처와 그 배후의 안티봇 모델에 달려 있다.

세션 길이를 대상 워크플로우에 맞추기

좋은 규칙은 타이머만이 아니라 워크플로우 경계에서 로테이션하는 것이다. 사용자가 떠나기 전에 합리적으로 5개에서 10개의 페이지 조회를 완료할 것이라면, 그 시퀀스 동안 동일한 IP와 쿠키 컨텍스트를 유지한다. 스크레이퍼가 서로 관련 없는 URL에 단발성 요청을 하고 있다면 세션을 짧게 한다.

대량으로 운영하는 팀은 대개 트래픽을 세분화함으로써 더 나은 결과를 얻는다. 카테고리 탐색에는 하나의 프로필을, 제품 상세 추출에는 다른 프로필을, 가격 갱신이나 SERP 확인에는 또 다른 프로필을 사용한다. 이는 패턴 간 오염을 줄이고 차단율이 변할 때 튜닝을 더 쉽게 만든다.

요청 패턴은 프록시 유형보다 더 중요하다

레지덴셜 IP는 즉각적인 거부 가능성을 낮추지만, 나쁜 속도 조절을 정당화하지는 않는다. 차단으로 가는 가장 빠른 길은 동일한 호스트명, 경로 패턴, 계정 컨텍스트에 대한 예측 가능한 동시성 급증이다.

초당 요청 수만이 아니라 요청 밀도로 생각하라. 대상은 전 세계적으로 분당 수천 건의 요청을 허용할 수 있지만, 하나의 세션에서 한 엔드포인트로 거의 동일한 20개의 요청이 몰리는 것은 플래그할 수 있다. 수요를 페이지, 세션, 시간 구간에 걸쳐 분산시켜라. 지터를 도입하라. 기계적으로 생성된 것처럼 보이는 깔끔한 간격을 보내는 대신, 현실적인 범위 내에서 요청 간 지연을 다양화하라.

프록시 계층에서 사실상 무제한의 동시성을 사용할 수 있을 때 이 점은 더욱 중요해진다. 인프라 여유 공간은 유용하지만, 스크레이퍼가 애플리케이션 수준의 스로틀링 없이 이를 소비한다면 그저 규모 있게 차단을 가속화하는 것에 불과하다.

속도 조절은 고정된 전역 한도가 아니라 페이지 가치를 따라야 한다

검색, 로그인, 장바구니 추가, 재고 엔드포인트 같은 고가치 페이지는 대개 더 낮은 동시성과 더 긴 지연이 필요하다. 정적인 제품 페이지는 종종 더 많은 처리량을 지원할 수 있다. API 기반 페이지는 안티봇 시스템이 해당 엔드포인트를 더 적극적으로 감시하기 때문에 HTML 페이지보다 더 엄격한 속도 조절이 필요한 경우가 있다.

성숙한 설정은 적응형 스로틀링을 사용한다. 응답 시간이 상승하거나, 캡차 빈도가 증가하거나, 소프트 블록 페이지가 나타나면, 스크레이퍼는 경로, 지역, 세션 유형별로 자동으로 속도를 낮춰야 한다. 하드코딩된 속도는 시장이나 시즌을 넘어서 살아남는 경우가 드물다.

헤더, 쿠키, 브라우저 핑거프린트는 내부 일관성이 필요하다

흔한 운영상 실패는 레지덴셜 IP를 저품질 요청 프로필과 섞는 것이다. IP가 시카고의 실제 소비자 네트워크로 해석되더라도 요청 헤더, 시간대, 언어 설정, 브라우저 핑거프린트가 불일치하는 환경을 시사한다면 탐지 점수가 상승한다.

일관성이 참신함을 이긴다. 소수의 현실적인 클라이언트 프로필 세트를 구축하고 올바르게 재사용하라. user-agent 문자열을 최신 브라우저 버전과 일치시켜라. 적절할 때 Accept-Language를 대상 로케일과 일치시켜라. 세션 내에서 쿠키를 유지하라. 브라우저 자동화 스택을 사용하는 경우 일관된 시간대, 화면 크기, 플랫폼 시그니처를 유지하라.

지나치게 무작위화하지 마라. 모든 요청에서 무작위 값을 사용하면 인공적으로 보인다. 실제 사용자는 세션 내에서 반복적이다.

브라우저 기반 스크래핑은 더 강한 핑거프린트 규율이 필요하다

Playwright, Puppeteer, Selenium으로 페이지를 렌더링하고 있다면 IP 로테이션만으로는 충분하지 않다. TLS 핑거프린트, WebGL, 캔버스 동작, 폰트 세트, navigator 속성, 자동화 흔적은 사이트가 당신의 프록시를 신경 쓰기도 전에 차단을 유발할 수 있다. 브라우저 핑거프린트는 대상별로 강화되고, 모니터링되고, 테스트되어야 한다.

혼합된 대상을 스크래핑하는 팀의 경우, 경량 HTTP 수집을 브라우저가 필요한 흐름과 분리하는 것이 흔히 합리적이다. JavaScript 실행이나 상호작용 단계가 필요한 곳에서만 브라우저를 사용하라. 그러면 비용이 낮아지고 관리해야 할 핑거프린팅 표면의 수가 줄어든다.

지오 타겟팅은 정확성을 향상시키는 만큼 차단도 줄일 수 있다

많은 팀이 지오 타겟팅을 데이터 정확성 측면에서만 생각한다. 하지만 이는 신뢰에도 영향을 미친다. 소매업체가 텍사스 사용자에게 텍사스 재고를 제공한다면, 올바른 도시나 지역에서 요청을 보내는 것이 불일치 신호를 줄인다. 이는 지역화된 SERP, 광고 검증, 여행 가격, 마켓플레이스 가용성에도 마찬가지로 적용된다.

국가 수준의 타겟팅은 폭넓은 조사에는 대개 충분하다. 대상이 위치에 따라 크게 개인화하거나, 지역 가용성 자체가 데이터 포인트일 때는 도시 수준의 타겟팅이 가치를 가진다. ASN 수준의 타겟팅은 사이트가 특정 소비자 ISP에 대해 다르게 동작할 때 도움이 될 수 있다.

잘못된 위치를 사용하는 것은 결과 집합을 왜곡하는 것 이상의 문제를 일으킨다. 의심스러운 트래픽 패턴을 위해 설계된 챌린지 흐름으로 몰아넣을 수 있다. 정밀도가 중요하다.

재시도 로직은 좋은 스크레이퍼가 나빠지는 지점이다

차단된 요청이 항상 실패는 아니다. 때로는 속도 조절 신호이거나, 세션 품질 문제이거나, 일시적인 챌린지일 수 있다. 중요한 것은 시스템이 어떻게 대응하는가이다.

나쁜 재시도 로직은 동일한 헤더, 동일한 핑거프린트, 동일한 경로 패턴, 심지어 때로는 동일하게 손상된 세션으로 즉시 동일한 요청을 반복한다. 이는 문제를 더 악화시킨다. 더 나은 재시도 로직은 먼저 실패를 분류한다. 타임아웃, 403, 캡차 페이지, 잘못된 형식의 응답이 모두 동일한 복구 경로를 유발해서는 안 된다.

예를 들어, 타임아웃은 동일한 세션 내에서 짧은 재시도를 정당화할 수 있다. 캡차나 차단 페이지는 대개 세션 폐기, 쿨다운, 그리고 해당 경로에서 동시성을 낮출 것을 요구한다. 429가 갑자기 증가하는 것은 전체 작업이 아니라 하나의 엔드포인트만 속도를 늦춰야 함을 나타낼 수 있다.

HTTP 상태 코드뿐 아니라 소프트 블록도 주시하라

가장 값비싼 데이터 품질 실패 중 일부는 소프트 블록에서 발생한다. 빈 결과 페이지, 잘린 목록, 오래된 캐시된 콘텐츠, 강제 리디렉션, 200 상태 코드로 반환되는 챌린지 페이지 등이다. 모니터링이 상태 코드만 추적한다면, 유용한 데이터를 수집하지 못한 채 몇 시간 동안 계속 스크래핑할 수 있다.

이것이 응답 검증이 중요한 이유다. 예상되는 페이지 요소, 콘텐츠 길이 임계값, 구조화된 데이터 존재 여부, 차단과 관련된 알려진 텍스트 패턴을 확인하라. 성능 저하를 더 빨리 감지할수록 대역폭과 연산에 낭비하는 것이 줄어든다.

프록시 품질은 여전히 중요하다

모든 레지덴셜 트래픽이 같은 방식으로 작동하지는 않는다. 풀 크기, 로테이션 제어, 지리적 깊이, 세션 안정성, 라우팅 품질이 모두 차단율에 영향을 미친다. 큰 네트워크는 부하를 분산할 더 많은 여지를 주지만, 플랫폼이 고정성, 타겟팅, 동시성에 대한 실용적인 제어 수단을 제공할 때만 그렇다.

엔터프라이즈 규모에서는 관측 가능성이 IP 풀 자체만큼이나 중요하다. 작업별, 지역별, 성공률별, 실패 유형별 사용량을 볼 수 있어야 한다. 그렇지 않으면 눈을 가린 채 튜닝하는 셈이다. 실시간 사용 데이터와 세밀한 타겟팅 제어를 제공하는 프로바이더는 문제가 대상인지, 스크레이퍼인지, 세션 정책인지, 지역 조합인지 분리하기 더 쉽게 만들어준다.

여기서 비용 효율성도 운영상 관련이 있게 된다. 프로바이더의 가격 정책이 모든 요청을 과도하게 최적화하도록 강제한다면, 팀은 흔히 테스트를 충분히 하지 못하고 더 나은 세션 전략을 놓치게 된다. 인프라는 실험을 지원해야 하며 벌해서는 안 된다. 이것이 대규모 운영자들이 프리미엄 벤더 마진을 지불하지 않고도 레지덴셜 커버리지, 세션 제어, 동시 작업을 실행할 여지가 필요할 때 Shifter 같은 플랫폼을 사용하는 이유 중 하나다.

차단율이 가장 낮은 팀은 스크래핑을 분산 시스템 엔지니어링처럼 다룬다

이들은 레지덴셜 프록시가 작동하는지 묻지 않는다. 이 대상에 어떤 세션 모델이 맞는지, 어떤 경로가 브라우저 실행이 필요한지, 지역별로 어떤 실패 모드가 나타나는지, 사람의 개입 없이 스크레이퍼가 얼마나 빨리 적응할 수 있는지를 묻는다.

이 사고방식이 결과를 바꾼다. 헤더가 일관되고, 세션이 실제 워크플로우에 매핑되고, 속도 조절이 대상의 피드백에 적응하고, 재시도 로직이 노이즈와 탐지를 구분할 때, 레지덴셜 프록시는 무딘 도구이기를 멈추고 인프라처럼 작동하기 시작한다.

차단을 줄이려 한다면, IP를 더 사기 전에 먼저 행동을 감사하는 것부터 시작하라. 대부분의 스크래핑 시스템은 공급 부족이 아니라 일관성 부족으로 실패한다.

시작할 준비가 되셨나요?

205M개 이상의 IP, 195개 이상의 국가를 지원하는 Shifter의 레지덴셜 프록시를 $0.75/GB부터 이용해보세요.

시작하기