스크래핑

디지털 서비스법(Digital Services Act)이 웹 관찰을 규제 인프라로 전환시키고 있다

디지털 서비스법(Digital Services Act) 데이터 접근이 플랫폼 연구를 재편하고 있다. 책임성 확보를 위해 통제된 웹 관찰과 지리적 관측 지점이 왜 중요한지 확인해 보세요.

Matt Brown

Matt Brown

2026년 9월 8일 · 10 분 소요

오랫동안 플랫폼 연구의 근본적인 문제 중 하나는 비대칭성이었다. 디지털 플랫폼은 자사 서비스 전반에 걸친 방대한 양의 활동을 관찰할 수 있는 반면, 해당 플랫폼 외부의 연구자들은 플랫폼이 공개하기로 선택한 데이터만으로 작업해야 하는 경우가 많았다.

유럽연합의 디지털서비스법(Digital Services Act)이 이러한 관계를 바꾸기 시작하고 있다.

디지털서비스법 데이터 접근 프레임워크는 규제 문언에서 벗어나 운영 가능한 연구 인프라로 옮겨가고 있다. 2026년 5월 19일 기준, 디지털서비스조정관(Digital Services Coordinators)은 이미 검증된 연구자(vetted researcher) 자격에 대한 49건의 신청서를 받았다. 유럽연합 집행위원회(European Commission)에 따르면, 해당 신청서들은 주로 소셜미디어 플랫폼과 관련된 것이었으며, 불법 콘텐츠, 광고 투명성, AI 기능에 관한 연구를 포함했다.

이는 중요한 진전이다. 하지만 플랫폼이 보유한 데이터셋에 대한 접근은 연구 문제의 일부에 불과하다. 연구자들이 디지털 플랫폼이 유럽 사람들에게 어떤 영향을 미치는지 이해하고자 한다면, 사용자 측 인터페이스에서 해당 플랫폼을 관찰할 방법도 필요하다. 공식 데이터셋은 일부 질문에 답할 수 있다. 독립적인 관찰은 다른 질문들에 답할 수 있다.

핵심 요약

  • DSA는 연구자 접근을 법적 원칙에서 운영 가능한 연구 체계로 전환시키고 있다.
  • 플랫폼이 제공하는 데이터셋과 독립적인 외부 관찰(outside-in observation)은 서로 다르면서도 상호보완적인 질문에 답한다.
  • X의 2026년 7월 시정 조치는 자격을 갖춘 연구자들이 공개적으로 이용 가능한 플랫폼 데이터에 대한 자동화된 접근이 필요할 수 있음을 재확인시켜준다.
  • 지리적 위치, 기기, 세션 상태, 시간은 사용자가 실제로 경험하는 바를 연구할 때 연구 변수로 취급되어야 한다.
  • 플랫폼 책임성의 다음 단계는 명확한 출처(provenance)를 갖춘 재현 가능한 관찰에 점점 더 의존하게 될 것이다.

디지털서비스법 데이터 접근이 실제로 바꾸는 것

DSA는 독립 연구자들이 초대형 온라인 플랫폼(very large online platforms)과 초대형 온라인 검색엔진(very large online search engines)을 연구할 수 있는 몇 가지 중요한 경로를 마련하고 있다.

한 가지는 내부 플랫폼 데이터에 관한 것이다. 제40조(Article 40)에 따라, 검증된 연구자는 유럽연합 내 시스템적 위험(systemic risks)을 연구하고 플랫폼의 위험 완화 조치의 효과를 평가하는 데 필요한 데이터에 대한 접근을 요청할 수 있다.

이 절차는 상당히 구체화되었다. 2025년 7월, 유럽연합 집행위원회는 연구자 접근에 관한 기술적 조건 및 절차를 규정한 위임법(delegated act)을 채택했다. 또한 연구자, 플랫폼, 디지털서비스조정관 및 기타 관련 당국이 절차의 일부를 관리할 수 있는 DSA 데이터 접근 포털(DSA data access portal)을 만들었다.

내부 데이터를 요청하는 연구자는 중요한 안전장치를 충족해야 한다. 여기에는 연구 기관과의 소속 관계, 상업적 이익으로부터의 독립성, 적절한 데이터 보안 및 기밀성 조치, 개인정보 보호, 연구 자금 출처의 공개, 그리고 연구 결과를 발표하겠다는 약속이 포함된다.

하지만 DSA는 또 다른 범주의 증거, 즉 공개적으로 이용 가능한 플랫폼 데이터도 인정하고 있다. 집행위원회는 관련 조건을 충족하는 연구자는 디지털서비스조정관의 중개 없이도 시스템적 위험 연구를 위해 초대형 온라인 플랫폼 및 검색엔진의 공개 데이터에 접근할 수 있다고 설명한다.

이 구분은 중요하다. 내부 데이터셋은 연구자에게 플랫폼이 기록한 내용을 알려줄 수 있다. API는 플랫폼이 그 인터페이스를 통해 제공한 내용을 알려줄 수 있다. 투명성 저장소(transparency repository)는 플랫폼이 공개한 내용을 알려줄 수 있다. 이 중 어느 것도 반드시 유럽 사용자가 특정 화면에서, 특정 국가에서, 특정 순간에 실제로 무엇을 경험했는지를 정확히 알려주지는 않는다. 그러려면 관찰이 필요하다.

X 결정은 처음 보이는 것보다 더 중요하다

X에 대한 유럽연합 집행위원회의 집행 조치는 이러한 구분을 유난히 눈에 띄게 만든다. 2025년 12월, 집행위원회는 여러 DSA 투명성 위반에 대해 X에 1억 2천만 유로의 과징금을 부과했다. 그중 하나는 연구자들에게 공개 데이터에 대한 적절한 접근을 제공하지 못한 것이었다. 집행위원회는 구체적으로 X의 이용약관이 스크래핑을 포함한 방식으로 자격을 갖춘 연구자가 공개 데이터에 독립적으로 접근하는 것을 금지했으며, 그 절차가 EU 내 시스템적 위험에 관한 연구에 불필요한 장벽을 만들었다고 밝혔다.

연구 방법론의 관점에서 보면 다음 전개가 더욱 흥미롭다. 2026년 7월, 집행위원회는 X가 연구자 심사를 개선하고 가속화하며, 자격을 갖춘 연구자에게 무료로 접근을 제공하고, 적절한 양의 데이터를 제공하며, 자격을 갖춘 연구자가 공개적으로 이용 가능한 데이터를 스크래핑하는 것을 계약상 금지하지 않도록 약관을 수정하겠다고 약속한 행동 계획(action plan)을 수용했다.

이는 무제한적인 스크래핑을 위한 포괄적인 법적 승인으로 해석되어서는 안 된다. 연구자들은 여전히 해당 DSA 조건 및 기타 법적, 윤리적, 개인정보보호, 보안 요건 내에서 활동해야 한다.

하지만 이는 중요한 원칙을 확립한다. 공개 정보의 독립적인 수집은 반드시 플랫폼 책임성 밖에 존재하는 활동이 아니다. 올바른 조건 하에서는 그것이 책임성 인프라 자체의 일부가 될 수 있다. 집행위원회는 다른 곳에서도 유사한 입장을 취했다. AliExpress와의 DSA 약속에서, 해당 플랫폼은 제40조 12항(Article 40(12)) 기준을 충족하는 연구자가 데이터 스크래핑과 같은 자동화된 방법을 통해 시스템적 위험을 연구하기 위해 공개 데이터에 독립적으로 접근하고 이를 사용할 수 있도록 하는 데 동의했다.

따라서 규제 관련 논의는 연구자가 API 키를 받을 수 있는지에 관한 단순한 질문을 넘어, 연구자가 플랫폼이 실제로 무엇을 하는지 독립적으로 연구할 수 있는지로 옮겨가고 있다.

API는 플랫폼이 공개하는 것을 알려주고, 관찰은 사용자가 경험하는 것을 알려준다

공식 접근은 여전히 필수적이다. 플랫폼이 보유한 데이터셋에는 조정(moderation) 이력, 내부 분류, 집계 지표, 시스템 기록, 또는 외부에서 재구성하는 것이 불가능한 과거 정보가 포함될 수 있다. 연구용 API는 대규모 분석을 더 쉽게 만들어줄 수 있다. 광고 저장소는 캠페인에 관한 구조화된 증거를 제공할 수 있다. 투명성 데이터베이스는 조정 결정 및 시행 활동에 관한 중요한 정보를 공개할 수 있다. 이들은 내부에서 바깥으로(inside-out) 향하는 형태의 증거다.

하지만 책임성은 바깥에서 안으로(outside-in) 향하는 증거도 필요로 한다.

점점 더 중요해지는 연구 질문의 종류들을 생각해보자. 마드리드에 있는 사용자가 특정 검색을 할 때 무엇을 보는가? 어떤 광고가 이탈리아에서는 보이지만 네덜란드에서는 보이지 않는가? 정치적 또는 상업적 공개는 시장 간에 일관되게 제시되는가? 추천 인터페이스는 유럽의 다른 국가에서 다른 결과를 반환하는가? 모바일 경험은 데스크톱 경험이 노출하지 않는 정보를 노출하는가? 플랫폼 변경 사항은 EU 전역에서 동시에 배포되는가? 관찰된 행동이 하루, 일주일, 또는 한 달 후에 재현될 수 있는가?

이는 데이터베이스 내부에 무엇이 존재하는지에 관한 질문이 반드시 아니다. 이는 누군가가 시스템과 상호작용할 때 시스템이 어떻게 작동하는지에 관한 질문이다.

가장 강력한 연구 설계는 점점 더 두 관점을 결합하게 될 것이다. 플랫폼이 보고한 데이터는 연구자에게 시스템이 무엇을 기록하는지 알려준다. 독립적인 관찰은 시스템이 무엇을 제시하는지 확립하는 데 도움이 된다. 어느 쪽도 본질적으로 더 우월하지 않다. 그것들은 서로 다른 것을 측정한다. 그리고 두 가지가 일치하지 않을 때, 그 불일치 자체가 중요한 연구 결과가 될 수 있다.

지리적 위치는 프록시 설정이 아니라 연구 변수다

이 지점에서 인터넷 인프라는 연구 방법론의 일부가 된다. 웹 플랫폼은 반드시 균일한 환경이 아니다. 지리적 위치는 온라인 경험의 가용성, 광고, 언어, 인터페이스, 검색 결과, 규제 공개사항, 제품 기능 및 기타 요소에 영향을 미칠 수 있다.

따라서 연구자가 “이것이 플랫폼이 표시한 내용이다”라고 말할 때, 당연한 후속 질문이 생긴다. 누구에게, 어디에서 표시되었는가?

Shifter는 지리적 위치가 점점 더 실험 변수로 취급되어야 한다고 생각한다. 우리의 레지덴셜 프록시 네트워크는 195개 이상의 국가에 걸쳐 레지덴셜 IP에 대한 접근을 제공하며, 지리적 타겟팅을 통해 통제된 인터넷 관측 지점(vantage points)을 확립하는 데 사용될 수 있다. 이러한 인프라는 하나의 연결이 모든 유럽 사용자의 경험을 대표한다고 가정하는 대신, 동일한 공개적으로 접근 가능한 인터페이스를 여러 정의된 지리적 위치에서 관찰해야 하는 연구자를 지원할 수 있다.

이는 레지덴셜 IP가 인간 사용자 경험의 모든 요소를 자동으로 재현한다는 의미는 아니다. 플랫폼은 IP 지리적 위치를 넘어 쿠키, 계정 이력, 언어 설정, 기기 특성, 세션 상태 등 많은 신호를 고려할 수 있다. 바로 그렇기 때문에 방법론이 중요하다. 지리적 위치는 연구 인프라의 눈에 보이지 않는 속성으로 취급되어서는 안 되며, 다른 변수들과 함께 기록되어야 한다.

규제 등급의 관찰에는 접근뿐 아니라 방법이 필요하다

바깥에서 안으로 향하는 웹 관찰이 규제 관련 연구에 기여하기 시작하면, 증거의 기준도 그에 맞춰 높아져야 한다. “우리는 페이지를 열어 이것을 보았다”는 방법론이 아니다.

엄격한 관찰에는 다른 연구자가 이해하고, 이의를 제기하며, 이상적으로는 재현할 수 있도록 충분한 맥락 정보가 수반되어야 한다. 이러한 기록에는 관찰 타임스탬프, 대상 URL 또는 플랫폼 화면, 출구 국가 및 도시, 관련이 있는 경우 ASN 또는 ISP, 기기 및 브라우저 프로필, 언어 설정, 인증 상태, 계정 또는 세션 상태, 실험 조건, 관찰된 결과, 적절한 경우 스크린샷, HTML 또는 구조화된 증거, 반복 테스트 결과, 검증 상태가 포함될 수 있다.

결국 연구자들은 웹 관찰을 위한 출처 연쇄(chain of provenance)가 필요하다. 우리는 관측 지점 표준을 위한 논거에서 그 기록이 무엇을 포함해야 하는지 제시했다.

동일한 원칙이 이미 우리가 인프라 벤치마킹에 접근하는 방식을 형성하고 있다. 우리는 서로 다른 요청 볼륨, 머신, 테스트 조건을 사용하여 두 네트워크를 비교한 다음 그 결과를 유의미한 것으로 취급하지 않는다. 테스트는 일치하는 요청 수, 일관된 동시성 및 대상, 통제된 환경을 사용한다. 우리는 또한 테스트 기간 동안 실제로 관찰된 IP와, 한 순간에 측정할 수 없는 훨씬 더 큰 광고상 네트워크 총계를 구분한다.

플랫폼 행동에 관한 연구도 동일한 규율을 요구한다. 지리적 위치가 변경되면 다른 변수는 안정적으로 유지하라. 기기 유형이 변경되면 지리적 위치를 통제하라. 놀라운 결과가 한 번 나타나면 반복하라. 차이가 여러 관찰에 걸쳐 지속되면, 그것이 지속되는 조건을 기록하라.

DSA 책임성은 측정 문제가 되어가고 있다. 내부 데이터는 플랫폼이 기록하는 것을 드러낼 수 있고, 바깥에서 안으로의 관찰은 사용자가 실제로 경험하는 것을 검증할 수 있다. 가장 강력한 증거는 통제되고 재현 가능한 조건 하에서 이 둘을 삼각측량(triangulating)함으로써 점점 더 얻어질 것이다.

스크래핑 인프라에서 관찰 인프라로

프록시 기술은 역사적으로 상당히 운영적인 관점에서 논의되어 왔다. 얼마나 많은 요청을 할 수 있는가? 얼마나 빠르게 IP 주소를 로테이션할 수 있는가? 얼마나 안정적으로 대규모로 정보를 수집할 수 있는가?

이러한 질문들은 여전히 많은 애플리케이션에 중요하다. 예를 들어 우리의 웹 스크래핑 API는 공개 웹 데이터 수집과 관련된 많은 인프라를 제거하도록 설계되었으며, 우리의 SERP API는 지리적 위치와 기기 전반에 걸친 구조화된 검색 결과를 제공한다.

하지만 프록시 인프라에 대해 생각하는 또 다른 방식이 있다. 연구자들에게 중요한 역량은 단순한 수집이 아닐 수 있다. 그것은 통제된 존재(controlled presence)일 수 있다.

연구 시스템은 하나의 관찰이 프랑스에서의 연결을, 다른 하나가 독일에서의 연결을 나타냈으며, 둘 다 정의된 시간 창 내에서 수행되었고, 나머지 실험 조건은 가능한 한 유사하게 유지되었다고 말할 수 있어야 한다.

이는 질문을 “우리가 웹의 얼마나 많은 부분을 수집할 수 있는가?”에서 “웹이 관찰된 조건을 얼마나 신뢰성 있게 재현할 수 있는가?”로 바꾼다. 이는 매우 다른 인프라 문제다. 그리고 DSA 연구 생태계가 성숙해짐에 따라, 우리는 이것이 더욱 중요한 문제가 될 것이라고 믿는다.

DSA 연구 스택은 어떤 모습일 수 있을까

성숙한 플랫폼 책임성 프로젝트는 하나의 증거 출처에 의존하는 경우가 거의 없을 것이다. 대신, 우리는 연구팀들이 계층화된 시스템을 구축할 것이라고 예상한다.

증거 계층제공하는 것예시
플랫폼 제공 증거플랫폼이 보유하거나 공개한 정보DSA 데이터셋, 공식 API, 광고 저장소, 투명성 공개
통제된 관찰사용자 대면 서비스로부터의 반복 가능한 증거정의된 지리적 관측 지점, 기기 프로필 및 세션
출처 메타데이터관찰을 이해하고 재현하는 데 필요한 맥락타임스탬프, 국가 및 도시, ASN 또는 ISP, 기기, 언어 및 세션 상태
비교 및 검증결과가 고립된 것인지 체계적인 것인지 테스트시장 간 비교, 반복 테스트 및 통제된 변수 변경
연구 거버넌스책임 있는 수집 및 사용에 관한 통제데이터 최소화, 보안 통제, 윤리적 검토 및 문서화된 목적

레지덴셜 프록시 인프라는 주로 통제된 관찰 및 출처 계층에 속한다. 이는 DSA 접근을 대체하지 않는다. 내부 데이터셋을 대체하지 않는다. 그리고 모든 연구 질문에 답하지 않는다. 이것의 역할은 알려진 외부 관측 지점을 확립하고 재현하는 데 도움을 주는 것이다.

이 구분은 중요하다. 왜냐하면 이는 API 대 스크래핑에 관한 논쟁이 되어서는 안 되기 때문이다. 이는 증거 품질에 관한 논쟁이 되어야 한다.

다음 투명성 논쟁은 재현성에 관한 것이 될 것이다

DSA는 이미 플랫폼이 공개해야 하는 내용을 바꾸고 있다. 다음 과제는 플랫폼 행동에 관한 주장이 독립적으로 검증될 수 있는지를 결정하는 것이다.

플랫폼이 특정 공개사항이 유럽 사용자에게 나타난다고 말하면, 연구자는 이를 재현할 수 있는가? 광고 저장소가 한 가지를 보고할 때, 공개 인터페이스는 다른 것을 보여주는가? 연구자들이 한 회원국에서 추천 패턴을 발견하면, 그것이 다른 곳에서도 나타나는가? 규제 조사 이후 인터페이스가 변경되면, 독립적인 관찰자들이 변경이 언제 어디서 발생했는지 문서화할 수 있는가?

그리고 연구가 6개월 후에 반복될 때, 차이가 플랫폼, 위치, 기기, 또는 연구 방법에서 비롯된 것인지 이해할 수 있을 만큼 충분한 맥락 메타데이터가 보존되었는가?

이러한 질문들은 플랫폼 투명성을 단순한 공개에서 벗어나 재현성으로 옮겨간다. 그것은 DSA의 가장 중요한 장기적 효과 중 하나일 수 있다. 이는 연구자들이 데이터를 요청할 수 있는 메커니즘을 만드는 것만이 아니다. 그것은 더 엄격한 플랫폼 관찰 과학을 위한 조건을 만드는 데 도움을 주고 있다.

결론

디지털서비스법 데이터 접근은 독립 연구자들이 유럽 최대 온라인 플랫폼을 이해할 수 있는 능력에 있어 큰 개선을 나타낸다. 하지만 플랫폼이 보유한 데이터는 하나의 관점에 불과하다.

디지털 시스템이 사용자에게 어떤 영향을 미치는지 이해하려면, 연구자들은 국가, 기기, 세션, 인터페이스, 시간에 걸쳐 그러한 시스템을 외부에서 관찰할 필요도 있다.

따라서 플랫폼 책임성의 미래는 단일한 증거 출처를 중심으로 구축될 가능성이 낮다. 그것은 삼각측량에 달려 있을 것이다. 플랫폼이 기록하는 것, 플랫폼이 공개하는 것, 그리고 독립 연구자들이 재현할 수 있는 것.

Shifter는 지리적 관측 지점 인프라가 세 번째 범주에서 유용한 역할을 할 수 있다고 믿는다.

규제 당국과 연구자들이 유럽 최대 플랫폼이 유럽 사용자들에게 어떻게 경험되는지 이해하고자 한다면, 그 플랫폼들이 관찰되는 위치는 기술적인 각주가 아니다. 그것은 증거의 일부다.

이 글은 일반적인 정보 제공을 목적으로 하며 법률 자문을 구성하지 않는다.

시작할 준비가 되셨나요?

205M개 이상의 IP, 195개 이상의 국가를 지원하는 Shifter의 레지덴셜 프록시를 $0.10/GB부터 이용해보세요.

시작하기