지식

웹 데이터셋에서 AI 생성 콘텐츠를 탐지하고 필터링하는 방법

어떤 탐지기도 AI가 생성한 텍스트를 단독으로 안정적으로 찾아내지 못한다. ML 팀이 프로버넌스, 소스, 중복 및 통계적 신호를 결합해 웹 데이터셋을 필터링하는 방법.

Chris Collins

Chris Collins

2026년 9월 18일 · 8 분 소요

모든 웹 크롤 데이터에는 이제 기계 생성 텍스트가 포함되어 있다. 모델이 작성한 상품 페이지, 수천 개씩 찍어내는 콘텐츠 팜 기사, 사람이 쓰지 않은 리뷰와 포럼 게시물이 그렇다. 많은 용도에서는 이것이 해가 되지 않는다. 하지만 훈련 데이터, 평가 세트, 검색 코퍼스에서는 그렇지 않으며, 그 비중은 계속 커지고 있다.

불편한 사실은, 어떤 탐지기도 문서 단위로 생성된 텍스트를 신뢰성 있게 식별하지 못한다는 점이다. 효과가 있는 방법은 계층적 접근이다. 여러 약한 신호를 결합하고, 자신의 데이터에 맞춰 보정하고, 데이터셋의 용도에 맞는 정책을 적용하는 것이다. 이 가이드는 그 신호들, 결합 방법, 그리고 필터링 자체가 가능하도록 데이터를 수집하는 방법을 다룬다.

중복 제거와 출처 관리를 포함한 스크래핑 데이터셋 구축의 전반적인 파이프라인은 웹 스크래핑으로 데이터셋을 구축하는 방법에서 다룬다. 이 가이드는 생성된 콘텐츠 문제 자체에 초점을 맞춘다.

왜 중요한가, 사용 사례별로

데이터셋 용도생성된 콘텐츠로 인한 위험일반적인 허용 수준
모델 사전 훈련획일화된 스타일, 오류 증폭, 희귀 지식 손실가중치 하향 조정을 전제로 중간 수준
평가 및 벤치마크모델 출력을 반복하는 테스트 항목이 점수를 부풀림매우 낮음
RAG용 검색 코퍼스확신에 찬 하지만 틀린 문단이 사실로서 검색됨위험도가 높은 답변에는 낮음
시장 및 소셜 분석가짜 리뷰와 게시물이 수치와 감성을 왜곡함낮음

훈련의 경우, 이 문제는 잘 문서화되어 있다. 발표된 연구에 따르면 이전 모델의 출력물로 반복 훈련된 모델은 원본 데이터 분포의 희귀한 부분을 잃으며, 이는 모델 붕괴(model collapse)라 불리는 실패로 설명된다. 분석의 경우 문제는 더 단순하다. 생성된 리뷰를 기반으로 만들어진 감성 트렌드는 마케팅 캠페인을 측정하는 것이지 고객을 측정하는 것이 아니다. 이 문제는 수집 측면에서 소셜 플랫폼 스크래핑을 통한 감성 분석에서 다룬다.

단일 탐지기로는 충분하지 않은 이유

AI 텍스트 분류기는 문서마다 점수를 반환하기 때문에 매력적으로 보인다. 하지만 실제로는 웹 데이터에서 정말 중요한 조건들에서 신뢰성이 떨어진다.

  • 짧은 텍스트는 판단할 근거가 너무 적다.
  • 의역되거나 약간 편집된 텍스트는 종종 사람이 쓴 것으로 통과한다.
  • 비영어권 언어는 대개 커버리지가 낮다.
  • 일부 사람의 글은 지나치게 자주 오탐지된다. 연구에 따르면 탐지기는 비원어민 영어 사용자의 글을 기계 생성으로 훨씬 더 높은 비율로 잘못 분류한다.

한 주요 AI 연구소는 낮은 정확도를 이유로 2023년 자체 공개 텍스트 분류기를 철회했다. 분류기 점수는 여러 약한 특징 중 하나로 취급해야 하며, 절대 판정으로 받아들여서는 안 된다.

함께 사용할 때 더 잘 작동하는 신호들

출처와 시간

가장 강력한 단일 신호는 텍스트 안에 있는 것이 아니다. 그 콘텐츠가 처음 관찰된 시점이다.

생성형 텍스트 모델은 2022년 말에 대중에게 널리 이용 가능해졌다. 그 이전에 처음 관찰된 콘텐츠는 분류기가 뭐라고 판단하든 기계 생성일 가능성이 훨씨 낮다. 그 이후에 처음 발견된 콘텐츠가 자동으로 의심스러운 것은 아니지만, 사전 확률은 달라진다.

이는 관찰 시점을 기록해야만 작동한다. 수집 시점에 모든 문서에 최초 관찰 타임스탬프를 저장하고, 모든 복사와 변환 과정에서 이를 유지하며, 주기적으로 재크롤링하여 나중에 조용히 재작성된 페이지를 탐지할 수 있도록 해야 한다. 관찰이 이루어진 시점과 위치를 데이터의 일부로 취급해야 한다는 근거는 벤티지 포인트 표준에서 다룬다.

출처 수준 신호

생성된 콘텐츠는 대개 소수의 운영자에 의해 대규모로 생산되기 때문에, 개별 문서보다 출처를 판단하기가 더 쉽다. 페이지만이 아니라 도메인과 섹션에 점수를 부여하라.

  • 게시 속도. 한 달에 몇 페이지였던 도메인이 갑자기 주당 수천 페이지로 늘어난 경우.
  • 템플릿 균일성. 많은 페이지가 하나의 구조와 제목 패턴을 공유하며, 주제만 바뀌는 경우.
  • 주제 산발성. 하나의 사이트가 균일한 깊이로 서로 무관한 주제들을 다루는 경우.
  • 책임 소재 부재. 저자 표기 없음, 소개 페이지 없음, 연락처 없음, 또는 가짜 필명.
  • 수익화 밀도. 주로 어필리에이트 링크나 광고를 싣기 위해 존재하는 페이지.

근접 중복과 템플릿

콘텐츠 팜은 대개 같은 개요의 여러 의역을 생산하는 경향이 있다. 근접 중복 탐지, 대개 싱글(shingle) 처리된 텍스트에 대한 지역 감지 해싱을 사용한 MinHash는 이러한 변형들을 클러스터로 묶는다. 여러 도메인에 걸친 거의 동일한 페이지의 대규모 클러스터는 대량 생산의 강력한 신호이며, 클러스터를 통째로 검토하는 것이 페이지를 하나씩 검토하는 것보다 훨씬 빠르다.

이런 방식으로 분석할 가능성이 있는 출처에 대해서는 원본 HTML을 보관하라. 템플릿 자체가 텍스트보다 더 명확한 신호일 때가 많기 때문이다.

문서 통계

텍스트의 통계적 속성은 약한 증거로 취급하는 한 도움이 될 수 있다. 참조 언어 모델 기준으로 매우 낮은 퍼플렉시티, 문장 길이와 구조의 낮은 변동성, 일반적인 상투 문구의 과도한 사용은 모두 생성된 텍스트와 관련이 있다.

각각은 일부 사람의 글에서도 흔하다. 간단한 문서, 형식화된 뉴스 단신, 비원어민 작성자의 텍스트가 그렇다. 이들은 조합해서만 사용하고, 언어별로 보정해야 한다.

워터마크가 존재하는 경우

일부 모델 제공업체는 생성된 텍스트에 통계적 워터마크를 삽입하며, 일부는 탐지 도구를 공개했다. 워터마크가 존재하고 탐지 가능한 경우, 이는 강력한 증거다. 다만 이는 참여 모델에서 나온 텍스트만 다루며, 제공업체의 탐지기로만 확인할 수 있고, 의역이나 번역이 이를 약화시킨다. 양성 결과는 의미 있는 것으로, 음성 결과는 정보가 없는 것으로 취급하라.

신호강도주요 약점
최초 관찰 날짜오래된 콘텐츠에 강함수집 시점에 타임스탬프 기록이 필요
출처 수준 패턴도메인 수준에서 강함좋은 사이트에 실린 개별 생성 페이지는 놓침
근접 중복 클러스터콘텐츠 팜에 강함원본, 일회성 생성물은 놓침
문서 통계단독으로는 약함평이한 글과 비원어민 글에 불리하게 작용
분류기 점수단독으로는 약함짧은 텍스트, 편집된 텍스트, 비영어 텍스트에서 신뢰성 낮음
워터마크양성일 때 강함대부분의 텍스트에는 부재

신호에서 필터링 정책으로

신호들을 결합하여 문서당 단일 점수를 만들고, 출처 수준 점수가 문서 점수에 반영되도록 한다. 그런 다음 각 점수 구간에서 어떻게 할지 결정하고, 그 결정이 데이터셋의 목적에 따라 달라지도록 한다.

  • 명확히 인간이 작성한 것으로 보이거나 기준 시점 이전에 처음 관찰된 문서는 유지한다.
  • 경계에 있는 문서는 사전 훈련 혼합물에서 제거하기보다는 가중치를 낮춘다.
  • 생성된 것으로 보이는 문서는 별도 저장소에 격리하여, 필터가 개선되면 결정을 다시 검토할 수 있게 한다.
  • 오염이 가장 큰 피해를 주는 평가 세트처럼 사용 사례가 요구하는 경우에만 제거한다.

필터에 버전을 부여하고, 데이터셋 문서화에 어떤 버전이 어떤 하위 집합을 만들었는지 기록하라. 필터는 데이터에 대한 일련의 결정이며, 이후에 이 데이터셋을 사용하는 누구나 그 결정이 무엇이었는지 알아야 한다.

모든 합성 데이터가 원치 않는 것은 아니다. 의도적으로 생성된 훈련 데이터는 정당한 용도가 있다. 문제는 라벨 없이 유입되어 사람이 쓴 글로 오인되는 생성 콘텐츠다. 그러니 스스로 합성 데이터를 생성하는 경우에는 출처에서부터 라벨을 붙여라.

필터를 측정하라, 잘못 배제되는 대상도 포함해서

누구도 측정하지 않은 필터는 추측일 뿐이다.

자체 크롤에서 라벨링된 검증 세트를 구축하라. 사람이 작성했다고 알고 있는 출처의 문서, 현재 모델을 사용해 목표 언어 전반에서 직접 생성한 샘플, 그리고 사람이 직접 검토한 경계 사례의 무작위 샘플로 구성한다. 언어별, 도메인별로 정밀도와 재현율을 측정하라.

그런 다음 특히 거짓 양성(false positive)을 감사하라. 필터가 비원어민의 글, 평이한 기술 문서, 특정 지역의 글을 불균형하게 제거한다면, 이는 데이터셋을 조용히 좁혀가고 있는 것이며, 이는 나중에 해당 사용자층을 더 못 섬기는 모델로 나타난다. 불균형한 데이터셋의 더 넓은 위험은 당신의 레지덴셜 프록시 풀은 샘플이다, 인터넷 전체가 아니다에서 다룬다.

평가를 정기적으로 다시 실행하라. 생성기는 계속 발전하며, 지난 분기에 작동했던 필터가 아무도 모르게 성능이 저하될 수 있다.

필터링이 가능하도록 수집하라

가장 유용한 신호들의 대부분은 수집 시점에 이루어진 결정에 달려 있다.

  • 모든 문서에 최초 관찰 타임스탬프를 기록하고, 모든 변환 과정에서 이를 보존하라.
  • 출처 메타데이터를 저장하라. 도메인, 섹션, 명시된 경우 게시 날짜, 그리고 페이지가 관찰된 벤티지 포인트.
  • 템플릿 분석이 필요할 수 있는 출처에 대해서는 원본 응답을 보관하고, 파싱 전에 저장하여 더 나은 필터를 재수집 없이 재적용할 수 있게 하라. 이 패턴은 웹 스크래핑 API 데이터를 SQL로 옮기기에서 다룬다.
  • 최초 수집 이후 재작성된 페이지를 탐지하기 위해 일정에 따라 재크롤링하라.
  • 이들을 재활용하는 애그리게이터보다 1차 인간 출처를 우선하라. 포럼, 지역 사이트, 문서, 전문 출판물이 그렇다.

가장 좋은 인간 작성 출처 중 많은 것들이 지역적이며 강하게 보호되어 있다. 올바른 국가에서, 재크롤링할 수 있을 만큼 일관되게 접근하는 것이 수집 인프라가 중요해지는 지점이다. Shifter 게이트웨이를 사용하면, 시장은 p.shifter.io:443에 대한 자격 증명에서 설정되며, 세션 식별자를 생략하면 요청마다 종료 지점이 로테이션되어 독립적인 페이지 가져오기에 적합하다.

customer-USERNAME-country-br:PASSWORD

책임감 있게 수집하라. 각 사이트의 이용 약관을 준수하고, 요청 속도를 적절히 유지하고, 필요하지 않은 개인 데이터는 수집하지 마라. 더 넓은 프레임워크는 AI 데이터 수집을 위한 윤리적 레지덴셜 프록시에서 다룬다.

FAQ

AI 생성 텍스트를 신뢰성 있게 탐지할 수 있는가?

개별 문서에 대해서는 신뢰성이 없다. 출처, 클러스터, 타임스탬프에 걸친 결합된 신호가 어떤 문서 단위 분류기보다 데이터셋 규모에서 훨씬 잘 작동한다.

훈련 세트에서 생성된 콘텐츠를 모두 제거해야 하는가?

반드시 그런 것은 아니다. 경계에 있는 콘텐츠의 가중치를 낮추고 의도적인 합성 데이터에 라벨을 붙이는 것이 대개 공격적인 제거보다 낫다. 공격적인 제거는 사람이 쓴 글도 많이 제거하기 때문이다.

필터링이 데이터셋의 다양성을 줄이는가?

필터가 평이하거나 비원어민 글에 불리하게 작용한다면 그럴 수 있다. 대규모로 필터를 적용하기 전에 언어와 지역별로 거짓 양성을 감사하라.

2022년 말 이전의 콘텐츠는 사람이 쓴 것으로 취급해도 안전한가?

이는 강력한 사전 확률이지만 보장은 아니다. 그 이전에도 자동화된 콘텐츠가 존재했다. 날짜를 다른 신호들과 결합하라.

결론

웹 데이터셋에서 AI 생성 콘텐츠를 제거하는 스위치는 존재하지 않는다. 각각 어느 정도의 증거를 담고 있는 일련의 신호들이 있다. 콘텐츠가 처음 관찰된 시점, 출처가 작동하는 방식, 근접 중복 클러스터에 속하는지 여부, 통계적 특성이 어떤지, 그리고 때때로 워터마크. 이들을 결합하고, 자신의 데이터에 맞춰 보정하고, 데이터셋의 목적에 맞는 정책으로 적용하면 효과가 있다.

이 대부분은 처음부터 타임스탬프, 출처 메타데이터, 원본 응답과 함께 수집하는 것에 달려 있다. 제품 관점은 AI 및 머신러닝 데이터 수집 페이지에서 볼 수 있으며, 수집 측면은 AI 훈련을 위한 웹 데이터 수집에서 다룬다.

시작할 준비가 되셨나요?

205M개 이상의 IP, 195개 이상의 국가를 지원하는 Shifter의 레지덴셜 프록시를 $0.10/GB부터 이용해보세요.

시작하기