뉴욕 타임스 소송, 마이크로소프트·오픈AI 내부 문서에서 AI 데이터 스크래핑 논란 드러내
뉴욕 타임스가 제기한 저작권 소송에서 마이크로소프트와 오픈AI의 검열되지 않은 내부 메모가 공개돼, 경영진이 대규모 콘텐츠 수집을 전례 없는 노동 절도로 규정하고 수익 악순환을 경고한 사실이 드러났다.

뉴욕 타임스와 여러 출판사가 마이크로소프트와 오픈AI를 상대로 제기한 저작권 소송에서 원고 측은 검열되지 않은 내부 문서를 제출했으며, 이는 두 기업이 생성형 AI 모델 학습을 위해 저작권이 있는 자료를 대규모로 수집하는 방식을 어떻게 인식하고 있는지를 새롭게 조명한다.
이 서류에는 Ars Technica(2026년 9월 17일)와 Golem.de(2026년 9월 18일)의 보도에 따르면, 법원 기록에 들어가기 전에 검열되지 않은 이메일과 내부 보고서가 포함돼 있다.
경영진은 관행을 전례 없는 절도로 규정
한 메모에서는 마이크로소프트 응용과학 담당 이사 브렌트 헤흣이 대규모 콘텐츠 수집을 “인류 역사상 가장 큰 노동 절도”라고 표현했으며, 공정 이용 방어에 대한 내부 의문을 제기했다.
법원 서류에 실린 헤흣의 발언은 법적 분석이라기보다 개인적인 견해를 반영한 것으로, 마이크로소프트는 이후 공개 성명에서 이를 개인 의견으로 강조했다.
잠재적 경제 악순환
다른 내부 문서에서는 “파괴적인 순환”을 경고했는데, 저작권이 있는 콘텐츠를 활용한 AI 제품이 원본 생산자의 수익을 감소시키고, 이는 향후 모델 학습에 사용할 수 있는 자료량을 줄이는 결과를 초래한다는 내용이다.
이 메모는 이러한 순환이 출판 생태계의 장기적인 건전성을 위협할 수 있다고 경고했으며, 원고 측도 동일한 우려를 소장에 명시했다.
트래픽 감소와 사용자 행동 증거
원고는 AI가 생성한 답변이 원본 기사 대신 표시된 후 특정 헤드라인의 클릭률이 83 %에서 93 %까지, 다른 경우는 51 %에서 94 %까지 하락한 데이터를 제시했다. 이 수치는 법원이 확정한 사실이 아니라 증거로 제출된 것이다.
오픈AI 내부 메시지에서는 일부 직원이 답변이 이미 AI에 의해 제공될 경우 사용자가 링크를 클릭할 가능성이 낮아질 것이라고 믿었으며, 이는 출판사의 트래픽 감소 주장과 일치한다.
- 브렌트 헤흣은 스크래핑을 ‘인류 역사상 가장 큰 노동 절도’라고 언급했다
- 마이크로소프트는 콘텐츠 생산자를 위한 파괴적인 수익 순환을 경고했다
- 사티아 나델라가 AI 어시스턴트가 사이트 방문을 대체할 수 있다고 증언했다
- 오픈AI 직원들은 사전 생성된 답변이 클릭률을 낮출 것으로 예상했다
마이크로소프트 최고경영자 사티아 나델라는 법정에서 AI 어시스턴트가 사용자가 원본 사이트를 직접 방문하지 않아도 정보를 직접 제공함으로써 실제 방문을 대체할 수 있다고 증언했으며, 이는 트래픽 손실에 대한 내부 우려와 일맥상통한다.
원고는 또한 제3자 공급업체가 약 180만 건의 뉴욕 타임스 기사에 대한 유료 이용 제한을 우회하는 기술을 발견했으며, 이를 이후 모델 학습에 활용했다고 주장한다.
마이크로소프트는 인용된 발언이 개별 직원의 관점일 뿐 회사의 공식 법적 입장이 아니라고 답변했으며, 양사는 저작권이 있는 자료 사용이 공정 이용 범위에 속한다는 입장을 지속하고 있다. 이 주장은 아직 법원의 최종 판단을 받지 못했다.
첫 번째 단락에서는 내부 문서가 공개된 이후 제기된 주요 논점들을 검증하는 과정이 어떻게 진행되는지를 상세히 설명한다. 원고 측이 제출한 메모와 이메일은 법정에서 증거로 채택되었는지 여부, 그리고 법원이 해당 자료의 진위와 완전성을 어떻게 판단했는지가 핵심 검토 항목이다. 검증 절차는 일반적으로 문서의 메타데이터 분석, 서명 확인, 그리고 제출 시점과 내용 변조 가능성을 평가하는 단계로 이루어진다. 이러한 검증 과정을 통해 법원은 문서가 실제 내부 커뮤니케이션을 반영하는지, 혹은 사후 조작된 것이 아닌지를 판단한다. 검증 결과가 확정되면, 해당 문서에 담긴 경영진의 의견과 전략이 소송의 실질적 근거로 작용할 여지가 커진다.
두 번째 단락에서는 경영진이 ‘인류 역사상 가장 큰 노동 절도’라고 표현한 발언의 법적 의미와 한계에 대해 논한다. 이 표현은 개인적인 견해로 분류될 수 있으나, 기업 내부에서 공식적인 전략 논의에 포함되었다면 기업 전체의 정책 방향을 암시하는 것으로 해석될 가능성이 있다. 그러나 법적 관점에서 보면, 개인 의견이 기업의 공식 입장을 대변한다고 보기 위해서는 추가적인 증거, 예를 들어 해당 발언이 공식 보고서에 반영되었는지, 혹은 경영진 회의록에 기록되었는지 등을 확인해야 한다. 따라서 이 발언 자체만으로는 법적 책임을 직접적으로 부과하기 어렵지만, 기업 문화와 의사결정 과정에 대한 추론 근거로 활용될 수 있다.
세 번째 단락은 ‘파괴적인 순환’이라는 개념이 실제 경제 구조에 미치는 영향을 실증적으로 검토한다. 저작권이 있는 콘텐츠가 AI 학습에 활용될 경우 원본 생산자의 수익이 감소하고, 이는 다시 콘텐츠 생산 의욕을 저하시켜 장기적으로 데이터 공급량을 감소시키는 악순환을 초래한다는 논리는 이론적 모델에 기반한다. 이 모델을 검증하기 위해서는 AI 도입 전후의 매출 변화, 이용자 행동 데이터, 그리고 콘텐츠 생산량 변동을 장기적으로 추적해야 한다. 현재 제시된 증거는 제한적이며, 구체적인 수치보다는 추정치에 머물러 있어 실증적 확증을 위해 추가적인 데이터 수집이 필요하다.
네 번째 단락에서는 트래픽 감소와 사용자 행동에 관한 증거의 신뢰성을 평가한다. 원고가 제시한 클릭률 하락 수치는 AI가 제공한 답변이 원본 기사로의 직접 방문을 대체한다는 가설을 뒷받침한다. 그러나 이러한 수치는 법원이 확정한 사실이 아니라 제출된 증거일 뿐이며, 통계적 표본의 대표성, 측정 방법의 일관성, 그리고 외부 변수(예: 시즌성 트래픽 변동, 광고 캠페인 등)의 영향을 배제했는지 여부가 검토돼야 한다. 따라서 현재 단계에서는 이 데이터가 추정치로서만 활용될 수 있으며, 보다 정교한 실험 설계와 통계 분석이 뒤따라야 한다.
다섯 번째 단락은 내부 메시지에서 드러난 직원들의 인식과 기업 차원의 대응 전략 사이의 간극을 짚는다. 일부 직원이 AI 답변이 원본 링크 클릭을 저해한다는 예상은 내부 우려를 반영하지만, 이는 공식적인 기업 정책과는 별개이다. 기업 입장은 이러한 우려를 최소화하기 위해 라이선스 계약을 재검토하거나, AI 출력에 원본 출처를 명시하는 기술적 해결책을 모색할 가능성을 시사한다. 그러나 실제로 이러한 조치가 실행될 경우 비용과 기술적 복잡성이 증가하며, AI 서비스의 사용자 경험에도 영향을 미칠 수 있다.
여섯 번째 단락은 한국 언론 및 콘텐츠 기업에게 미치는 실질적 파급 효과를 정리한다. 내부 문서 공개는 AI 학습 데이터에 대한 투명성 요구를 강화하고, 향후 라이선스 협상에서 보다 엄격한 조건을 제시하게 만들 가능성이 크다. 또한, 데이터 출처를 명확히 밝히는 규제가 도입될 경우, 대규모 언어 모델 운영 비용이 상승하고, 이에 따라 서비스 가격 인상이나 기능 제한이 발생할 수 있다. 궁극적으로 이러한 변화는 콘텐츠 제작자와 AI 기업 간의 권리·의무 재조정을 촉진하고, 저작권 보호와 혁신 사이의 균형을 재정립하는 계기가 될 것이다.
한국의 언론 및 콘텐츠 기업들에게 이번 내부 문서 공개는 AI 기반 콘텐츠에 의존하는 기업들의 위험 수준이 높아졌음을 알린다. 공정 이용에 대한 내부 의심과 구체적인 트래픽 손실 수치는 향후 소송에서 보다 엄격한 라이선스 요구, 데이터 출처 투명성 강화, 그리고 저작권이 보호된 텍스트에 의존하는 대규모 언어 모델 운영 비용 증가로 이어질 가능성을 시사한다.
출처
- Microsoft exec called AI scraping the largest theft of labor in human historyArs Technica · 2026년 9월 17일
- Ungeschwärzte Dokumente belasten Microsoft und OpenAIGolem.de · 2026년 9월 18일



