이 글은 일반적인 교육 목적의 정보이며, 법률 자문이 아닙니다. 법률은 국가마다 다르고 시간에 따라 변하며, 적용 방식은 구체적인 사실관계에 따라 달라집니다. 본인의 상황에 대해서는 자격을 갖춘 변호사와 상담하시기 바랍니다.
“웹 스크래핑은 합법인가?”는 데이터 업계에서 가장 많이 검색되는 질문 중 하나이며, 솔직한 답은 “대체로 그렇지만, 경우에 따라 다르다”입니다. 웹 스크래핑 자체, 즉 공개적으로 접근 가능한 웹 페이지를 프로그램적으로 읽는 행위는 많은 관할권에서 대체로 합법입니다. 스크래핑을 명백히 문제없는 행위에서 법적으로 위험한 행위로 바꾸는 것은 세 가지 요소의 조합입니다: 무엇을 수집하는지, 어떻게 수집하는지, 그리고 당신과 대상이 어디에 위치하는지입니다.
이 글은 쉬운 언어로 정리한 법적 개요입니다: 대부분의 사안을 결정하는 원칙들, 알아둘 만한 주요 판례들, 그리고 스크래핑을 선을 넘지 않게 유지하는 실질적인 습관들을 다룹니다. 변호사를 대신할 수는 없지만, 올바른 질문을 던지는 데 도움이 될 것입니다.
짧게 요약하면
공개적으로 접근 가능하고 개인정보가 아닌 데이터를, 접근 통제를 우회하지 않고, 대상에 과부하를 주지 않으면서 스크래핑하는 대부분의 경우, 미국과 다른 지역의 법원들은 대체로 이를 허용해왔습니다. 다음 중 어느 것이라도 해당되면 위험이 급격히 커집니다:
- 개인 데이터(이름, 이메일, 프로필)를 스크래핑하는 경우 — 개인정보 보호법이 발동됩니다.
- 우회 권한이 없는 로그인이나 유료 결제 장벽 뒤에서 스크래핑하는 경우.
- 사실을 추출하는 것이 아니라 저작권 콘텐츠를 재게시하는 경우.
- 과도한 부하로 대상 서버의 성능을 저하시키는 경우.
- **이용약관(Terms of Service)**을 위반하여 계약상 책임을 발생시키는 경우.
안전지대, 즉 공개적이고, 개인정보가 아니며, 정중하고, 사실에 기반한 방식에 머무른다면 대부분의 지역에서 안정적인 위치에 있게 됩니다. 위험지대로 발을 들이면 “이것이 합법인가”는 실제로 사실관계에 따라 달라지는 문제가 됩니다.
실제로 이를 결정하는 법적 틀
법적 적법성은 하나의 법이 아니라 여러 개의 겹치는 법 체계로 이루어져 있으며, 하나의 스크래핑 행위가 그중 여러 개에 걸칠 수 있습니다.
1. 컴퓨터 접근 관련 법률(예: 미국의 CFAA). 컴퓨터 사기 및 남용 방지법(Computer Fraud and Abuse Act)은 컴퓨터 시스템에 대한 “무단 접근”을 처벌합니다. 핵심 쟁점은 공개된 페이지를 스크래핑하는 것이 “무단”인지 여부입니다. 최근 미국 법은 이를 상당히 좁혀왔으며(아래 판례 참조), 브라우저만 있으면 누구나 접근할 수 있는 공개 데이터는 일반적으로 “무단 접근”에 해당하지 않습니다. 사용 권한이 없는 인증 뒤의 데이터에 접근하는 것은 이야기가 다릅니다.
2. 계약법 / 이용약관. 대부분의 사이트 이용약관은 자동화된 접근을 금지합니다. 이용약관 위반은 일반적으로 범죄가 아니라 계약 문제이지만, 민사상 책임(계약 위반)에 노출될 수 있습니다. 법원은 “클릭랩(clickwrap)” 약관(“동의함”을 클릭한 경우)을 “브라우즈랩(browsewrap)” 약관(한 번도 상호작용하지 않은 하단의 링크)보다 더 무겁게 취급합니다. 이용약관 위반이 스크래핑을 범죄로 만들지는 않지만, 실질적인 민사 위험은 존재합니다.
3. 저작권. 사실과 데이터는 저작권 보호 대상이 아니며, 창작적 표현이 대상입니다. 가격, 사양, 통계를 추출하는 것은 기사, 사진, 기타 원본 콘텐츠를 복사하여 재게시하는 것보다 훨씬 안전합니다. 저작권이 있는 자료를 복제한다면, 공정 이용(fair use) / 공정 취급(fair dealing)과 라이선스가 관련되는 저작권 영역에 들어서게 됩니다.
4. 데이터베이스 권리(특히 EU에서). EU의 독자적(sui generis) 데이터베이스 권리는 개별 사실이 저작권 보호 대상이 아니더라도, 데이터베이스 편집에 상당한 투자가 이루어진 경우 이를 보호합니다. 보호받는 데이터베이스의 상당 부분을 스크래핑하여 재사용하는 것은 EU에서 이 권리를 침해할 수 있으며, 미국에는 이에 상응하는 개념이 없습니다.
5. 개인정보 보호법(GDPR, CCPA 등). 개인 데이터에 관한 한 이것이 가장 중요합니다. GDPR은 스크래핑을 어디서 하든 관계없이 EU 내 사람들의 개인 데이터에 적용되며, 일반적으로 적법한 근거, 투명성, 개인의 권리 존중을 요구합니다. 얼굴, 프로필, 연락처 등 개인 데이터를 스크래핑하는 것은 가장 위험도가 높은 범주이며, 여러 규제 기관이 이와 관련해 거액의 과징금을 부과했습니다. 캘리포니아의 CCPA/CPRA와 점점 늘어나는 다른 개인정보 보호법들도 각자의 요건을 추가합니다.
6. 동산 침해(Trespass to chattels). 스크래핑이 서버에 과부하를 주는 등 대상의 시스템에 피해를 입힐 때 적용될 수 있는 오래된 법리입니다. 접근 자체가 아니라 피해가 발동 요건입니다.
핵심은 이것입니다: 단일한 “스크래핑법”은 존재하지 않습니다. 스크래핑이 합법인지 여부는 이 중 무엇에 해당하는지에 달려 있으며, 이는 어떤 데이터를, 어떻게, 어디서 수집하는지에 의해 결정됩니다.
알아둘 만한 주요 판례
몇몇 판결들이 실제로 이 문제가 어떻게 전개되는지를 형성해왔습니다. (판례법은 계속 발전하므로, 이를 현재의 최종 결론이 아닌 방향성 참고로 받아들이시기 바랍니다.)
hiQ Labs v. LinkedIn (미국, 제9순회항소법원). hiQ는 공개된 LinkedIn 프로필을 스크래핑했습니다. 법원은 공개적으로 접근 가능한 데이터를 스크래핑하는 것이 CFAA상 “무단 접근”에 해당할 가능성이 낮다는 점을 시사했으며, 이는 공개 데이터 스크래핑이 범죄적 해킹이 아니라는 중요한 신호였습니다. 주목할 점은, hiQ가 이후 LinkedIn 약관 위반과 관련하여 계약 근거로 책임을 지게 되었다는 것으로, 이는 CFAA와 이용약관이 별개의 문제임을 보여줍니다.
Van Buren v. United States (미국 연방대법원, 2021년). 법원은 CFAA의 “허용된 접근 범위 초과” 조항을 좁혔습니다: 합법적으로 가진 접근 권한을 부적절한 목적으로 사용하는 것이 자동으로 CFAA 위반이 되는 것은 아닙니다. 이는 많은 스크래핑 시나리오에서 CFAA 노출을 줄였습니다.
Meta v. Bright Data (미국, 북부 캘리포니아 지방법원, 2024년). 법원은 공개된 Facebook과 Instagram 데이터를 스크래핑하는 것이 Meta의 약관을 위반하지 않았다고 판단했으며, 이는 부분적으로 해당 스크래퍼가 공개 데이터를 수집할 때 로그인 상태가 아니었기 때문입니다. 공개적이고 로그아웃 상태의 스크래핑이 인증을 거친 스크래핑보다 더 확고한 기반 위에 있다는 또 다른 사례입니다.
Clearview AI (EU/영국 규제 기관). 규제 기관들은 Clearview가 얼굴 이미지, 즉 개인 데이터를 적법한 근거 없이 스크래핑하여 인식 데이터베이스를 구축한 것에 대해 과징금을 부과했습니다. 이는 개인 데이터 스크래핑이 엄격한 규칙이 적용되는 개인정보 보호법의 규율을 받는다는 것을 명확히 보여줍니다.
이러한 사례들의 공통된 패턴은 다음과 같습니다: 공개적이고, 로그아웃 상태이며, 개인정보가 아니고, 사실에 기반한 스크래핑이 가장 안전한 기반이며, 인증, 개인 데이터, 재게시된 콘텐츠가 법적 위험이 집중되는 지점입니다.
프록시는 어디에 해당하는가?
흔한 오해 중 하나는 프록시를 사용하면 법적 상황이 달라진다는 것입니다. 어느 방향으로도 그렇지 않습니다.
레지덴셜 프록시는 라우팅 도구로, CDN, VPN, 기업 네트워크를 구동하는 것과 같은 종류의 인프라입니다. 이를 사용하는 것은 합법입니다. 그러나 프록시가 합법성을 세탁해주지는 않습니다: 불법적인 스크래핑을 프록시를 통해 라우팅한다고 해서 합법이 되지 않으며, 합법적인 스크래핑을 프록시를 통해 라우팅한다고 해서 불법이 되지도 않습니다. 프록시는 요청이 어떤 IP에서 오는지를 바꿀 뿐, 그 요청을 해도 되는지를 바꾸지는 않습니다.
프록시가 정당하게 도움이 되는 부분은 대규모로 책임감 있게 운영하는 것, 즉 단일 엔드포인트에 부하를 집중시키지 않도록 부하를 분산하는 것과 지역에 적합한 콘텐츠에 접근하는 것입니다. 근본적인 행위의 적법성은 변하지 않습니다. (저희 수용 가능한 사용 정책은 Shifter에서 허용되는 것을 규정하며, 정확히 이러한 원칙을 따릅니다.)
올바른 쪽에 머무르기 위한 실질적인 모범 사례
블로그 글로 법적 확실성을 얻을 수는 없지만, 이러한 습관을 갖춤으로써 위험을 크게 낮출 수 있습니다. 이는 또한 좋은 엔지니어링이기도 합니다.
- 로그인 뒤가 아닌 공개 데이터를 스크래핑하세요. 인증은 명확한 경계선입니다. 접근하기 위해 로그인하거나 접근 통제를 우회해야 한다면, 이를 고위험으로 간주하고 자문을 구하세요.
- 적법한 근거가 없다면 개인 데이터를 피하세요. 이름, 이메일, 프로필, 특히 생체 정보나 민감 정보는 개인정보 보호법을 발동시킵니다. 개인 데이터가 필요하지 않다면 수집하지 마세요. 필요하다면, 근거와 의무에 대해 제대로 된 자문을 받으세요.
- 부담이 실린 곳에서는 robots.txt를 존중하세요. 이는 법이 아니지만, robots.txt와 사이트가 명시한 의사를 존중하는 것은 선의의 강력한 증거이며, 이는 표준 관행입니다.
- 대상을 저하시키지 마세요. 속도를 제한하고, 합리적인 경우 비수기 시간대에 스크래핑하며, 수집 행위가 사이트 성능에 해를 끼치지 않도록 하세요. 서버 피해는 침해(trespass) 주장의 근거가 되는 요소입니다. (좋은 스크래핑 관행과 적법한 행동은 상당 부분 겹칩니다.)
- 사실을 추출하되, 창작 콘텐츠를 재게시하지 마세요. 가격, 사양, 데이터 포인트는 기사, 이미지, 기타 원본 표현을 복사하는 것보다 훨씬 안전합니다.
- 이용약관을 읽으세요. 특히 클릭랩 약관의 경우 무엇에 동의하는지 알고, 이를 위반할 때의 계약상 위험을 저울질하세요.
- 관할권에 유의하세요. EU 정보주체는 당신이 어디서 운영하든 GDPR을 발동시키며, EU 데이터베이스는 데이터베이스 권리를 발동시키고, 당신 본국의 법률도 적용됩니다. 국경을 넘는 스크래핑은 적용되는 규칙집을 배가시킵니다.
- 목적과 절차를 문서화하세요. 정당하고 잘 문서화된 사용(가격 비교, 연구, 모니터링)은 모호하거나 공격적인 수집보다 방어하기 쉽습니다.
이러한 원칙들은 책임감 있는 데이터셋 구축과 훈련 데이터 수집의 배경이 되는 원칙들과 동일하며, 준수와 품질은 같은 방향을 향합니다.
자주 묻는 질문
웹 스크래핑은 합법인가요? 일반적으로, 접근 통제를 우회하거나 대상에 해를 끼치지 않으면서 공개적으로 접근 가능하고 개인정보가 아닌 데이터를 스크래핑하는 것은 많은 관할권에서 대체로 합법입니다. 개인 데이터, 인증/유료 장벽, 저작권 콘텐츠, 서버 피해, 또는 이용약관 위반이 관련될 때 법적으로 위험해집니다. 이는 항상 구체적인 사실관계와 관할권에 따라 달라집니다.
공개 데이터를 스크래핑하는 것은 합법인가요? 공개적이고 로그아웃 상태의 데이터가 가장 안전한 기반이며, 미국 판례법은 공개적으로 접근 가능한 페이지를 스크래핑하는 것이 “무단 접근”에 해당할 가능성이 낮다는 점을 반복적으로 시사해왔습니다. 그러나 공개라고 해서 제약이 없는 것은 아닙니다: 그 공개 데이터가 개인 데이터라면 개인정보 보호법이 여전히 적용되며, 저작권이 있는 공개 콘텐츠를 재게시하는 것은 여전히 저작권 문제를 야기합니다.
이용약관 위반이 스크래핑을 불법으로 만드나요? 범죄는 아니지만 잠재적으로 민사 문제가 될 수 있습니다. 이용약관 위반은 일반적으로 계약 문제이며, 컴퓨터 접근 관련 법과는 별개로 계약 위반 책임에 노출될 수 있습니다. 클릭랩 약관(적극적으로 동의한 경우)은 브라우즈랩(하단 링크)보다 더 무겁게 다뤄집니다.
개인 데이터를 스크래핑하는 것은 합법인가요? 이는 가장 위험도가 높은 범주입니다. 개인 데이터는 GDPR(스크래핑을 어디서 하든 EU 내 사람들에게 적용됨)과 CCPA 같은 개인정보 보호법을 발동시키며, 이는 일반적으로 적법한 근거를 요구하고 의무를 부과합니다. 여러 규제 기관이 근거 없이 개인 데이터를 스크래핑한 기업에 과징금을 부과했습니다. 개인 데이터를 스크래핑하기 전에 법적 자문을 받으세요.
프록시를 사용하면 스크래핑이 합법 또는 불법이 되나요? 어느 쪽도 아닙니다. 프록시는 합법적인 라우팅 도구입니다; 요청이 어떤 IP에서 오는지를 바꿀 뿐, 근본적인 행위가 허용되는지 여부를 바꾸지는 않습니다. 불법적인 스크래핑을 합법으로 만들 수 없으며, 합법적인 스크래핑을 불법으로 만들지도 않습니다.
저작권이 있는 콘텐츠를 스크래핑하는 것은 합법인가요? 사실(가격, 사양, 숫자)을 추출하는 것은 사실이 저작권 보호 대상이 아니기 때문에 일반적으로 안전합니다. 원본 창작 콘텐츠, 즉 기사, 사진, 영상을 복사하여 재게시하는 것은 공정 이용 / 공정 취급 또는 라이선스에 해당하지 않는 한 저작권을 침해할 수 있습니다.
결론
웹 스크래핑은, 특히 접근 통제를 우회하거나 사이트에 해를 끼치지 않으면서 공개적이고 개인정보가 아닌 사실 데이터를 수집하는 경우, 대부분 합법입니다. 법적 위험은 경계에 존재합니다: 개인 데이터, 인증, 저작권 콘텐츠, 서버 과부하, 그리고 계약 조건입니다. 준수를 유지하는 대부분의 방법은 단순히 이러한 경계에서 벗어나 선의로 행동하는 것입니다.
이 중 어느 것도 본인의 구체적인 프로젝트에 대한 자문을 대체하지 않습니다. 의심스러울 때는 변호사와 상담하세요. 그러나 원칙들은 일관되고 배울 수 있습니다: 공개된 것을 스크래핑하고, 필요한 것만 가져가고, 대상에 해를 끼치지 않고, 개인정보와 저작권을 존중하고, 자신의 관할권을 알아두세요. 그렇게 한다면, 양질의 레지덴셜 프록시 네트워크는 대규모로 공개 데이터를 수집하기 위한 책임감 있는 인프라일 뿐이며, 이는 본래 사용되어야 할 방식 그대로입니다. 웹 스크래핑 자체에 대해 더 알고 싶다면, 웹 스크래핑이란 무엇이며 어떻게 비즈니스를 지원하는지부터 시작해보세요.