검색 데이터에는 말로 표현하기는 쉽지만 해결하기는 어려운 정확성 문제가 있다. 결과 집합은 누가 질문하는지에 따라 달라지며, “누가 질문하는지”의 요소 중 통제하지 못한 모든 부분은 측정에 추가되는 잡음이다.
프록시를 활용한 검색 수집에 관한 논의는 대부분 차단 회피에 관한 것이다. 이는 중요하지만 처리량에 관한 문제다. 정확성은 다른 문제이며, 대시보드의 순위 변동이 실제인지를 결정하는 문제다. 바로 이 지점에서 고정 ISP 프록시는 레지덴셜 로테이팅이 할 수 없는 일을 해내며, 동시에 잘못된 절반의 작업에 사용하면 실망을 안겨주는 지점이기도 하다.
정확성이란 관측 지점을 고정하는 것을 의미한다
순위는 키워드의 속성이 아니다. 특정 장소, 특정 겉보기 신원, 특정 시점에서 던진 질문에 대한 답이다. 이 중 무엇이든 바뀌면 답도 정당하게 바뀔 수 있다.
시간에 따른 연속 시리즈는 이것이 가장 크게 작용하는 사례다. 90일 동안 매일 특정 키워드를 측정하는데 관측 지점이 매번 바뀐다면, 시리즈에는 두 가지 신호가 섞여 있게 된다. 순위가 어떻게 변했는지와 관측 지점이 어떻게 변했는지다. 사후에 이 둘을 분리하는 것은 불가능하다.
고정 IP는 이 변수 중 하나를 완전히 제거한다. 매일 같은 주소, 같은 네트워크, 같은 ISP다. 그 관측 지점이 지닌 편향이 무엇이든 일정하게 유지되며, 일정한 편향은 델타(변화량)에서 상쇄된다. 이것이 검색 수집에서 ISP 프록시에 대한 실질적인 정확성 논거이며, 차단율과는 아무 관련이 없다.
고정 ISP 주소가 주는 것
고정된 지리적 신원. ISP 주소는 실제 인터넷 서비스 제공업체에 등록되어 있으며 위치 정보가 일관되게 나타난다. 요청 사이에 인접한 대도시권 사이를 오가지 않는데, 이는 로테이팅 풀이 설계상 하는 일과 대조된다.
세션 전체의 일관성. 검색 인터페이스는 세션이 진행되는 동안 개인화하고 조정한다. 질의는 한 주소에서, 두 번째 페이지는 다른 주소에서 도착하는 수집 프로세스는 일관된 세션을 보는 것이 아니며, 사용자가 보는 것을 보는 것도 아니다.
속도와 안정성. ISP 주소는 레지덴셜 연결의 등록 정보를 지니면서 데이터센터 인프라 위에 있으므로, 지연 시간과 일관성은 홈 라인보다는 데이터센터 연결에 가깝다. 시간이 정해진 수집 창에서는 이것이 중요한데, 6시간이 걸리는 수집 실행은 6개의 서로 다른 시점을 측정하는 것이기 때문이다.
신뢰할 수 있는 네트워크 신원. 이 주소는 잘 알려진 클라우드 제공업체 블록이 아니라 소비자 ISP 대역에 속하며, 이것이 대부분의 방어 체계가 가장 먼저 구분하는 기준이다.
세 가지 IP 유형에 대한 전반적인 비교는 ISP vs 레지덴셜 프록시에서, 데이터센터 쪽 비교는 대규모 스크래핑을 위한 ISP 프록시 vs 데이터센터 프록시에서 다룬다.
고정 주소가 도움이 되지 않는 지점
이 부분은 실패 모드가 비용이 크므로 직설적으로 말할 필요가 있다.
고정 IP는 반복되는 신원이며, 반복은 볼륨 기반 방어 체계가 정확히 찾는 대상이다. 하루에 한 주소에서 만 건의 검색 질의가 나오는 것은 그럴듯한 사용자가 아니며, 헤더를 아무리 조정해도 이 산술을 바꿀 수 없다. 주소당 특정 질의율을 넘어서면 고정 풀은 저하된다. 순위에 의해 형성된 결과가 아니라 스로틀링에 의해 형성된 결과를 수집하게 되며, 그런데도 그 결과는 여전히 데이터베이스에 깨끗하게 파싱된다.
그 임계값은 대부분의 팀이 예상하는 것보다 낮으며, 검색 엔진, 질의 유형, 지역에 따라 달라진다. 중요한 부분은 그 임계값을 넘어서면 데이터가 들어오는 것을 멈추는 게 아니라는 점을 인식하는 것이다. 데이터는 정확성을 잃을 뿐이다.
그러므로 정직한 입장은, 고정 주소는 일관성을 사주지만 규모를 잃게 하고, 로테이션은 규모를 사주지만 일관성을 희생시킨다는 것이다. 둘 중 어느 것도 작업의 두 절반 모두에 대한 답은 아니다.
수집 계층을 목적별로 분리하라
실제로 작동하는 설계는 이것들을 서로 다른 전송 방식을 지닌 두 개의 다른 작업으로 취급한다.
고정 주소 위의 컨트롤 패널. 매일 같은 ISP 주소에서, 관심 있는 지역에서 측정하는 적당한 규모의 키워드 집합이다. 이것이 참조 시리즈다. 주소당 질의율이 그럴듯하게 유지될 만큼 작으며, 여기서 나타나는 변동이 실제 세계의 변동이 되도록 안정적이다.
로테이팅 주소 또는 API 위의 볼륨 패널. 커버리지가 고정된 관측 지점보다 더 중요하고, 요청당 로테이션이 처리량을 유지하는 핵심인 전체 키워드 집합이다. 검색에 있어서는, 이것이 SERP API가 흡수하기 위해 존재하는 부분인데, 이는 수집 계층을 문제 목록에서 완전히 제거하기 때문이다.
컨트롤 패널은 볼륨 패널이 거짓 정보를 주고 있는지를 알려주는 역할을 한다. 둘 다 추적하는 키워드에서 두 패널이 불일치할 때, 이는 수집에 관한 신호이며, 안정적인 참조를 가지고 있는 것만이 이를 볼 수 있는 유일한 방법이다. 이 뒤에 있는 측정 원칙은 채용 게시판 데이터와 노동시장 인텔리전스에서와 동일하다. 수집하는 대상만이 아니라 자신의 커버리지 자체를 측정하라는 것이다.
SEO 플랫폼을 위한 실무 노트
위치는 한 번 설정된다. ISP 플랜은 주소가 프로비저닝되기 전에 국가 분포가 선택되며, 이후에는 변경할 수 없다. 이번 분기의 클라이언트 목록이 아니라 참조 시리즈가 커버해야 하는 시장을 기준으로 지리적 분포를 결정하라. 7개국을 이용할 수 있다.
질의율이 예산이고, 대역폭이 아니다. ISP 플랜은 무제한 트래픽을 제공하므로, 관리해야 할 제약은 기가바이트가 아니라 주소당 하루 질의 수다. 이는 일반적인 계획 방식을 뒤집는다. 데이터 볼륨이 아니라, 주소당 질의율을 그럴듯하게 유지하는 데 필요한 주소 수로 규모를 정하라.
IP를 명시된 위치와 짝지어라. 검색 인터페이스가 명시적인 위치 매개변수를 받아들이는 경우, 이를 사용하고 해당 주소가 실제로 위치한 곳과 일치하는지 확인하라. 서로 불일치하는 두 개의 위치 신호는 어느 쪽과도 일치하지 않는 결과 집합을 만들어낸다. 이는 지역 SEO를 위한 지리 타겟 SERP API에서 깊이 다룬다.
모든 관측에 관측 지점을 기록하라. 주소, 명시된 위치, UTC 타임스탬프다. 관측 지점이 없는 순위 행은 감사할 수 없으며, 클라이언트가 수치에 이의를 제기하는 첫 순간에 정확히 무엇을 어디서 질의했는지 재구성할 수 있길 원하게 될 것이다.
FAQ
순위 추적에는 ISP 프록시가 레지덴셜보다 나은가?
안정적인 참조 시리즈에는 그렇다, 일관성이 핵심이기 때문이다. 대규모 전체 키워드 집합에는 그렇지 않다, 주소당 질의율이 그럴듯하지 않게 되기 때문이다. 대부분의 플랫폼은 둘 다 필요하다.
고정 IP는 시간이 지나면서 개인화된 결과를 받게 되는가?
신호가 누적될 수 있으며, 이는 실질적으로 고려해야 할 사항이다. 이는 컨트롤 패널을 좁게 유지하고 그 목적을 명확히 해야 한다는 근거가 된다. 컨트롤 패널은 일관된 참조이지 중립적인 관찰자라는 주장이 아니다. 대규모로 수집된 것 중 중립적인 것은 없다.
참조 패널에는 몇 개의 주소가 필요한가?
각 주소가 해당 지역의 그럴듯한 일일 질의율 미만을 유지할 만큼 충분해야 하며, 이는 보통 패널 규모가 지역 곱하기 키워드를 보수적인 주소당 비율로 나눈 값이 된다는 것을 의미한다. 보수적으로 시작하고 성공률이 유지되는 것을 측정한 후에 확장하라.
ISP 프록시를 플랫폼 전체에 사용할 수 있는가?
경제적으로도, 정확성 측면에서도 그럴 수 없다. 고정 주소에서의 볼륨 수집은 결과물에서 감지하기 어려운 방식으로 저하된다. 그 속성이 핵심인 곳에서 사용하라.
결론
검색 데이터에서 ISP 프록시에 대한 정확성 논거는 좁지만 실질적이다. 고정된 관측 지점은 시간 시리즈를 그 자체와 비교 가능하게 만든다. 이는 큰 가치가 있으며, 동일한 주소를 실제 사용자라면 만들어내지 않을 질의율로 밀어붙인다면 아무런 가치도 없다.
참조 시리즈는 고정 주소 위에 구축하고, 볼륨은 다른 곳에서 실행하며, 둘 사이의 불일치를 품질 신호로 활용하라. 플랜과 국가 커버리지는 ISP 프록시 요금제 페이지에 있다.