HomeAIOpenAI 논란 속으로: 한 연구는 회사가 저작권으로 보호된 데이터로 모델을 훈련한다고 비난합니다

OpenAI 논란 속으로: 한 연구는 회사가 저작권으로 보호된 데이터로 모델을 훈련한다고 비난합니다

새로운 연구가 AI Disclosures Project에 의해 발표되어 OpenAI가 채택한 훈련 방법의 투명성과 윤리성에 대한 중요한 의문을 제기합니다. 조사 중심에는 GPT-4o가 있으며, 이 회사의 최신 언어 모델로, O’Reilly Media의 기밀 자료에서 나온 저작권 보호 콘텐츠를 인식하고 사용하는 것으로 비난받고 있습니다.

인공지능 경쟁에서 투명성을 높이기 위한 연구

이 연구는 기술자 Tim O’Reilly와 경제학자 Ilan Strauss가 이끄는 AI Disclosures Project의 일환으로 수행되었습니다. 프로젝트의 목표는 명확합니다: 책임을 강조하여 인공지능 분야에서 더 큰 책임을 촉진하는 것입니다. 이는 LLM (Large Language Models)을 개발하는 기업들이 투명한 관행을 필요로 한다는 점에 중점을 둡니다.

문서, working paper, 는 이러한 모델을 훈련시키는 데 사용된 데이터의 공개에 대한 공식적인 의무가 현재 부족하여 신뢰와 합법성에 심각한 문제를 일으킬 수 있음을 분석합니다. 연구자들은 금융 시장에서 bull 및 bear 시장을 촉진하기 위해 공시 규칙이 생겨난 것처럼, AI 분야에서도 남용과 시스템적 손해를 방지하기 위해 유사한 규제가 필요하다고 주장합니다.

OpenAI, 저작권이 있는 콘텐츠에 대한 테스트 수행: 데이터는 명확하다

그들의 조사를 수행하기 위해, 연구자들은 O’Reilly Media에서 출판한 34 libri protetti da copyright의 법적으로 획득한 데이터셋을 사용했습니다. DE-COP membership inference attack으로 알려진 기술을 통해, 그들은 언어 모델이 인간이 쓴 텍스트와 LLM이 생성한 패러프레이즈 버전을 구별할 수 있는지를 측정했습니다. 결과는 GPT-4o를 지목합니다.

AUROC 점수(모델이 두 클래스를 구별하는 능력을 측정하는 메트릭)는 명확하게 말합니다:

  • GPT-4o는 O’Reilly Media에서 가져온 비공개 콘텐츠를 인식하는 능력에서 82%의 점수를 받았습니다. 이는 해당 콘텐츠가 훈련 데이터에 포함되었을 가능성이 높다는 것을 나타냅니다.
  • 비교를 위해, 모델 GPT-3.5 Turbo는 훨씬 더 약한 인식률(약 50%)을 보였으며, 모델의 경량 버전인 GPT-4o Mini는 공개 및 비공개 콘텐츠를 전혀 인식하지 못했습니다.
  • 데이터는 또한 GPT-4o가 공개적으로 접근할 수 없는 자료 (82% AUROC)를 자유롭게 이용 가능한 O’Reilly 콘텐츠(64% AUROC)보다 더 잘 인식한다는 것을 보여줍니다.
  • 반대로, GPT-3.5 Turbo는 공개 콘텐츠(64%)에 대해 비공개 콘텐츠(54%)보다 더 높은 친숙도를 보입니다.

연구자들이 제안하는 바에 따르면, 저작권이 있는 콘텐츠에 접근할 수 있는 가능한 출처는 LibGen일 수 있습니다. 이는 저작권으로 보호된 책의 무단 디지털 사본을 호스팅하는 잘 알려진 온라인 플랫폼입니다. 연구에서 분석된 모든 책은 실제로 그 가상 도서관에 존재합니다.

AI 산업: 합법성, 경제 및 콘텐츠의 지속 가능성

결과는 더 넓은 문제를 제기합니다: 저작권으로 보호된 데이터를 체계적으로 사용하여 언어 모델을 훈련시키는 것은 원본 콘텐츠를 만드는 전문가들의 경제적 지속 가능성을 위협할 수 있습니다. 기업들이 그들의 출판물 사용에 대해 보상받지 못한다면, 출판을 포함한 정보 생태계 전체가 빈곤해질 위험이 있습니다.

보고서에 따르면, 보상 없이 독점 데이터의 무단 사용은 온라인 콘텐츠의 품질과 다양성 감소에 기여합니다. 이는 단순히 윤리적인 문제일 뿐만 아니라 경제적인 문제이기도 합니다. 수입이 없으면 출판사와 전문 창작자들은 가치 있는 콘텐츠를 계속 생산할 수 없습니다.

연구자들의 우려: 모델이 공개하는 것보다 더 많이 알고 있다

또 다른 측면으로 연구에서 강조된 것은 최신 언어 모델이 인간의 언어와 인공지능이 생성한 언어 사이의 미묘한 차이를 이해하고 재현하는 능력의 향상입니다. 또한, 연구자들은 언어가 시간에 따라 진화하기 때문에 “시간적 편향”이 존재할 가능성을 강조합니다. 이러한 유형의 왜곡을 중화하기 위해, 테스트는 동일한 기간 동안 훈련된 두 모델(GPT-4o 및 GPT-4o Mini)에서 수행되었습니다.

비록 증거가 특정 사례 — OpenAI e i testi O’Reilly — 에 한정되어 있지만, 저자들은 이 현상이 생성적 인공지능 분야에서 널리 퍼져 있고 시스템적일 수 있다고 믿고 있습니다.

훈련 데이터에 대한 합법적인 시장으로?

연구는 더 넓은 반성으로 마무리됩니다: IA 개발자훈련 데이터에 합법적으로 접근할 수 있는 시스템을 구축하는 것이 필요하며, 라이선스 계약과 콘텐츠 창작자에 대한 투명한 보상을 통해 이루어져야 합니다.

일부 기업은 이미 이 방향으로 비즈니스 모델을 개발하고 있습니다. 이는 Defined.ai의 사례로, 저자의 동의를 보장하고 모든 개인 식별 정보를 제거하여 훈련 데이터를 판매하는 플랫폼입니다. 규제된 산업은 일부 대형 AI 기업의 현재 불투명한 행동에 대한 합법적이고 지속 가능한 대안을 제시할 수 있습니다.

정치의 역할: 유럽은 선구자가 될 수 있다

이 보고서는 또한 규제적인 관점을 제공합니다: 새로운 유럽 연합 AI 법안의 발효는 모델 훈련에 대한 공개 의무를 포함하여 긍정적인 순환을 촉발할 수 있습니다. 규칙이 명확하게 정의되고 실제로 적용된다면, 권리 소유자는 마침내 그들의 작품이 언제 어떻게 사용되는지 알 수 있을 것입니다.

이는 창작자의 콘텐츠가 실제로 경제적 자산으로 인식되는 합법적 시장을 만드는 데 있어 중요한 단계가 될 것입니다. 이러한 자산은 AI에 의해 사용됩니다.

OpenAI뿐만 아니라: 점점 더 빈번해지는 관행을 지적하는 연구

상세한 분석을 통해 O’Reilly Media의 34권의 책을 연구한 결과, 연구자들은 OpenAI가 아마도 비공개 및 저작권으로 보호된 데이터에서도 GPT-4o 모델을 훈련했을 가능성을 시사하는 경험적 증거를 제공했습니다.

확인될 경우, 이는 저작권 규정뿐만 아니라 투명성, 동의 및 공정성의 원칙을 잠재적으로 심각하게 위반하는 것으로, 인공지능이 우리 사회와 경제에 점점 더 깊이 영향을 미치는 시대에 대기업들이 준수해야 하는 사항입니다.

Satoshi Voice
이 기사는 인공지능의 지원을 받아 제작되었으며, 정확성과 품질을 보장하기 위해 저널리스트 팀의 검토를 거쳤습니다.
RELATED ARTICLES

Stay updated on all the news about cryptocurrencies and the entire world of blockchain.

Featured video

LATEST