가이드, 튜토리얼 및 인사이트
레지덴셜 프록시, 웹 스크래핑, 데이터 수집 전략 및 업계 모범 사례를 Shifter 팀으로부터 배우세요.
보호가 강력한 사이트 스크래핑 방법: 단순 요청에서 완전한 스텔스까지의 단계적 접근
모든 스크래핑을 최대 스텔스로 실행하지 마세요. 대상에 맞게 노력을 조정하세요. 단순한 클라이언트와 깨끗한 IP로 시작하고, 사이트가 강제할 때만 단계를 높이세요.
로그인이 필요한 사이트를 스크래핑하는 방법: 세션, 쿠키, 그리고 대규모 스티키 프록시
로그인 뒤에서 스크래핑하는 것은 로테이션이 아니라 신원의 문제다. 세션 쿠키를 유지하고, 각 계정을 하나의 깨끗한 스티키 IP에 고정하며, 차단 없이 로그인 상태를 유지하라.
스크레이퍼가 페이지를 로드하기도 전에 차단되는 이유: TLS와 HTTP/2 핑거프린팅
깨끗한 레지덴셜 IP, 진짜 User-Agent인데도 즉시 차단된다고? Anti-bot은 요청이 읽히기도 전에 TLS와 HTTP/2 계층에서 HTTP 클라이언트의 핑거프린트를 확인한다.
안티디텍트 브라우저란 무엇이며 레지덴셜 프록시는 어떻게 연관되는가
안티디텍트 브라우저는 각 프로필에 고유한 디바이스 핑거프린트를 부여합니다. 하지만 이것은 신원의 절반에 불과하며, 나머지 절반은 IP이고, 이 둘은 서로 일치해야 합니다.
Scrapy에서 커스텀 미들웨어로 레지덴셜 프록시 로테이션하기
Scrapy는 meta를 통해 프록시를 설정하지만, Proxy-Authorization 캐싱 문제가 로테이션을 망가뜨립니다. 이를 해결하는 커스텀 미들웨어는 아이덴티티를 로테이션하고 차단 시 재시도합니다.
Selenium에서 레지덴셜 프록시 사용하는 방법 (인증이 필요한 프록시 포함)
Selenium은 프록시 호스트를 쉽게 설정할 수 있지만 인증 정보를 전달하는 내장 기능은 없습니다. Selenium Wire, 확장 프로그램, 또는 CDP를 사용하여 인증이 필요한 프록시를 처리하는 방법을 알아봅니다.
페이지네이션과 무한 스크롤을 대규모로 안정적으로 스크래핑하는 방법
페이지네이션은 스크래퍼가 데이터를 조용히 잃어버리는 지점입니다: 페이지 건너뛰기, 중복 집계, 조기 종료. 모든 항목을 한 번씩 가져오고 완료 시점을 아는 방법.
Shifter vs Decodo: 5개국에서 살아있는 IP를 모두 세어봤다
Shifter는 GB당 $0.75부터 시작하는 반면 Decodo는 $2.75다. 우리는 5개국에서 각각 560,000건의 요청을 보내 고유한 종료 IP를 모두 세었다. 전체 결과와 방법을 공개한다.
Puppeteer에서 레지덴셜 프록시 사용하는 방법 (page.authenticate 포함)
Puppeteer의 프록시: 프록시는 launch args에, 인증 정보는 page.authenticate에 지정하며, 하나의 게이트웨이를 통해 페이지별 지역 로테이션과 리소스 차단을 수행합니다.