스크래핑

경쟁사 상품 구성 및 카탈로그 공백 분석 방법

상품 구성 분석은 비교 이전에 매칭 문제다. 카탈로그를 나열하고 제품을 정직하게 매칭하며 실제 공백과 노이즈를 구분하는 방법.

Chris Collins

Chris Collins

2026년 9월 7일 · 5 분 소요

어소트먼트 분석은 집합 연산처럼 들린다. 상대의 카탈로그를 가져오고, 내 것을 가져와서 뺀다. 남는 차이가 기회라는 것이다.

산술 자체는 사소하다. 답이 맞고 틀리고를 결정하는 모든 것은 그 전에 일어난다. 상대의 카탈로그를 전수 조사했는지 아니면 그저 표본만 추출했는지, 그리고 상대 사이트와 내 사이트에서 “같은 상품”이 실제로 같은 상품으로 인식되는지 여부다. 둘 중 하나라도 틀리면, 뺄셈은 대부분 인공물에 불과한 기회 목록을 자신 있게 내놓는다.

매칭 문제가 전체 문제다

같은 품목이라도 이를 판매하는 모든 소매업체는 저마다 다르게 표현한다. 서로 다른 제목 규칙, 서로 다른 브랜드 표기, 서로 다른 포장 단위, 서로 다른 번들링, 그리고 회사 외부에서는 아무 의미도 없는 내부 SKU들이 있다.

매처가 상품의 20퍼센트에서 실패한다면, 상대 카탈로그의 20퍼센트는 채워야 할 격차처럼 보이고, 내 카탈로그의 20퍼센트는 고유한 차별화 요소처럼 보인다. 두 결론 모두 틀렸고, 게다가 분석이 가치 있어 보이는 방향으로 틀려 있으며, 결과물의 어디에도 이를 알려주는 표시는 없다.

다음 순서로 매칭하라:

표준 식별자를 우선한다. GTIN, UPC, EAN, MPN. 이러한 식별자가 공개된 경우 거의 확정적이므로, 사용 가능한 곳이라면 이를 기본 키로 삼아야 한다.

브랜드와 정규화된 모델명을 두 번째로 삼는다. 대소문자, 구두점, 공백, 브랜드 별칭, 흔한 약어까지 공격적으로 정규화하라. 정규화된 형태를 저장해두면 나중에 매칭 결정을 감사할 수 있다.

속성 매칭을 세 번째로 둔다. 크기, 색상, 용량, 포장 수량이다. 포장 단위가 가장 큰 피해를 입히는 지점이 바로 여기인데, 6개들이 묶음과 낱개 상품은 거의 모든 속성을 공유하고 종종 제목도 같지만 실제로는 완전히 다른 상품이기 때문이다.

표본에 대한 사람의 검토는 항상 필요하다. 매칭된 것과 매칭되지 않은 것의 무작위 표본을 뽑아 사람이 확인하게 하라. 이를 통해 나머지 모든 것을 해석 가능하게 만드는 수치, 즉 매칭률이 나온다. 이 수치 없이 보고된 분석은 아무도 오차 규모를 가늠할 수 없는 분석이다.

전수 조사하라, 표본 추출하지 말라

두 번째 실패는 표본에 불과한 크롤링 결과를 전수 조사로 취급하는 것이다.

대부분의 카탈로그 화면은 보여줄 수 있는 것에 상한을 둔다. 카테고리 목록은 주장하는 상품 수와 관계없이 고정된 페이지 수에서 멈출 수 있다. 검색 결과는 보통 카테고리 탐색보다 더 엄격하게 상한이 걸린다. 필터와 패싯은 대형 카테고리를 완전히 반환 가능한 작은 단위로 쪼개는, 꼬리 부분에 도달하는 유일한 방법인 경우가 많다.

실용적인 방법은 검색 대신 카테고리 트리를 탐색하고, 표시 페이지 상한을 초과하는 노드는 세분화하며, 모든 노드에 대해 주장된 상품 수와 실제로 가져온 수 두 가지를 기록하는 것이다. 두 번째 수치가 바로 증거다. 주장된 수치와 가져온 수치가 어긋나면, 자신의 가시성 경계를 발견한 것이며, 그 너머의 모든 것은 데이터의 격차가 아니라 내 카탈로그의 격차로 나타나게 된다.

카테고리 구조도 소매업체마다 다르므로, 상대의 카테고리가 내 카테고리와 같다고 가정하지 말라. 상품 수준에서 매칭한 뒤 나중에 자신의 분류 체계로 취합하라.

소매업체별 세부 기법은 Amazon 상품 데이터 스크래핑상품 가용성 및 재고 모니터링에 있다.

카탈로그는 지역적이다

같은 소매업체라도 시장별로 취급하는 구성이 다르며, 종종 스토어프런트별로 완전히 다른 카탈로그를 제공한다.

한 국가에서만 수집을 진행하면, 상대가 다른 시장에서만 취급하는 모든 상품은 없는 것처럼 보이고, 마침 내가 수집하는 시장에서만 취급되는 모든 상품은 보편적인 것처럼 보인다. 여러 시장에서 판매하는 사업체에게 이는 사소한 보정이 아니다. 어떤 격차가 실제인지를 바꿔놓는다.

국가 타겟팅이 가능한 레지덴셜 프록시는 각 시장의 카탈로그를 구분되게 유지해준다. Shifter 게이트웨이를 사용하면, 타겟팅과 세션은 p.shifter.io:443에 대한 자격 증명 안에 들어간다.

customer-USERNAME-country-es-sid-cat-es-0119-ttl-600:PASSWORD

country-es는 시장을 설정하고, sid-cat-es-0119는 전체 카테고리 탐색 동안 하나의 출구를 유지시켜 페이지네이션을 일관되게 만들며, ttl-600은 해당 주소를 10분간 유지시킨다. 카테고리 탐색당 하나의 세션이어야 하며, 페이지 요청당 하나가 아니다. 탐색 도중 로테이션을 하면 서로 다른 두 관측 지점에서 온 페이지들이 하나의 카탈로그 스냅샷에 섞여 들어가게 된다.

동시성은 적당히 유지하고, 오류가 발생하면 밀어붙이기보다 물러서라. 속도 제한 및 요청 스로틀링에서 설명한 대로다. 상품 관련 내용은 전자상거래용 레지덴셜 프록시 페이지에 있다.

네 가지 결과물

상품이 매칭되고 카탈로그가 전수 조사되고 나면, 비교는 네 가지 뚜렷한 결과를 낳는데, 이를 뒤섞는 것이 가장 흔한 분석 오류다.

진짜 격차. 상대는 취급하지만 나는 취급하지 않는 경우. 주요 결과물이며, 매칭률에 비례해서만 신뢰할 수 있다.

역격차. 내가 취급하지만 상대는 취급하지 않는 경우. 보통 무시되지만 대개 더 가치가 있는데, 이것이 바로 내 차별화 재고이며 머천다이징 팀이 즉시 활용할 수 있기 때문이다.

깊이 격차. 양쪽 모두 브랜드는 취급하지만, 상대는 40개 SKU를, 나는 6개를 취급하는 경우. 이는 단순 집합 차연산에서는 잘 드러나지 않는데, 브랜드 자체는 양쪽에 다 존재하기 때문이며, 종종 전체 분석에서 가장 큰 상업적 발견이 되기도 한다.

허상 격차. 진짜 격차로 위장한 매칭 실패. 모든 분석에는 이것이 있다. 문제는 그 규모를 측정했는지 여부다.

앞의 세 가지를 보고하되, 네 번째 것을 함께 정량화해서 제시하라. “매칭률 91퍼센트에서 진짜 격차 240건”은 활용 가능한 결과다. “격차 240건”은 카테고리 매니저의 한 주를 낭비시킬 준비가 된 숫자에 불과하다.

주기와 변동

카탈로그는 가격보다 훨씬 느리게 변하는데, 이는 다행스러운 일이다. 주간 또는 격주 전수 조사면 보통 충분하며, 경쟁이 치열한 카테고리는 더 빠른 주기로 진행한다.

주기보다 더 중요한 것은 안정성이다. 탐색 방식, 매칭 규칙, 카테고리 매핑을 실행 간에 고정하고 버전을 관리하라. 격차 수치가 급격히 떨어지면, 먼저 물어야 할 질문은 상대의 구성이 바뀐 것인지 아니면 내 매처가 바뀐 것인지다. 실행 간 매칭률과 가져온 수치의 차이를 비교하면 이를 몇 초 만에 답할 수 있고, 많은 분석 낭비를 막을 수 있다.

FAQ

어느 정도의 매칭률이면 실행에 옮길 만한가?

90퍼센트 이상이면 카테고리 수준 결정에 활용할 만하다. 80퍼센트 미만이면 격차 목록은 대부분 매칭 잡음이며, 노력은 분석이 아니라 매처에 들어가야 한다.

전수 조사에 검색을 써야 하나, 카테고리 탐색을 써야 하나?

카테고리 탐색을 사용하고, 노드가 페이지 상한을 초과하면 패싯으로 세분화하라. 검색은 더 엄격하게 상한이 걸리고 순위가 개인화되어 있어 전수 조사 도구로는 부적합하다.

제3자 판매자의 마켓플레이스 목록은 어떻게 처리하나?

별도의 집합으로 추적하라. 자사 상품과 마켓플레이스 구성을 섞으면 경쟁사가 실제로 결정한 구성보다 과대평가하게 되는데, 제3자 목록은 그들이 내린 구매 결정이 아니기 때문이다.

표준 식별자를 전혀 공개하지 않으면 어떻게 하나?

정규화된 브랜드와 모델에 더 의존하고, 낮은 매칭률을 받아들이며, 이를 정직하게 측정하라. 특히 의류와 자체 브랜드 상품 같은 일부 카테고리는 결코 깔끔하게 매칭되지 않을 것이며, 올바른 대응은 확실성이 아니라 신뢰도를 보고하는 것이다.

결론

어소트먼트 분석 끝에 나오는 비교는 산술이다. 진짜 작업은 그 이전에 있다. 표본이 아닌 전수로 카탈로그를 조사하는 것, 자신의 가시성이 어디서 멈추는지 아는 것, 감사 가능한 규칙으로 상품을 매칭하는 것, 그리고 진짜 격차를 깊이 격차 및 매칭 실패와 구분하는 것이다.

각 시장을 별도로 수집하고, 탐색 전반에 걸쳐 세션을 일관되게 유지하며, 주장된 수치와 가져온 수치를 기록하고, 모든 격차 수치 옆에 매칭률을 함께 게시하라. 요금은 가격 페이지에 있다.

시작할 준비가 되셨나요?

205M개 이상의 IP, 195개 이상의 국가를 지원하는 Shifter의 레지덴셜 프록시를 $0.10/GB부터 이용해보세요.

시작하기