1727316969
2024-09-26 00:30:00
OpenAIは、複数の著者を代表して開発者に対して著作権侵害の申し立てを行っている弁護士に対し、生成AIモデルのトレーニングに使用されたデータを開示することに同意した。
著者ら(ポール・トレンブレイ、サラ・シルバーマン、マイケル・シェイボン、デイビッド・ヘンリー・ファン、タナハシ・コーツら)は昨年、OpenAIとその関連会社を訴え、そのAIモデルが彼らの本で訓練され、彼らの言葉を複製したことは米国著作権法とカリフォルニア州の不正競争規則に違反していると主張した。著者らの訴訟は、 単独請求 [PDF]。
OpenAIは他の原告からも同様の申し立てを受けており、今年初めにはAnthropicも 被害を受けた著者らから訴えられた。
火曜日、米国の治安判事ロバート・イルマンは 命令 [PDF] 著者の弁護士に OpenAI のトレーニング データへのアクセスを許可するプロトコルと条件を指定します。
アクセス条件は厳格で、トレーニングデータセットは機密ソースコード、独自のビジネスプロセス、または秘密の計算式と同等とみなされます。それでも、ChatGPTに使用されたモデル(GPT-3.5、GPT-4など)は、GPT-2の場合と同様に、広く知られている公開データに大きく依存していたと思われます。 リスト コンテンツがスクレイピングされたドメインはGitHubにあります(レジスター リストに載っています。
「トレーニングデータは、インターネットアクセスや他の許可されていないコンピューターやデバイスへのネットワークアクセスのない、安全な部屋にあるセキュリティ保護されたコンピューターでOpenAIによって提供されるものとする」と裁判官の命令書には記されている。
安全な部屋では録音機器の使用は許可されず、OpenAI の法務チームはそこで作成されたメモを検査する権利を有します。
OpenAIは、なぜそのような秘密保持が必要なのかという質問にすぐには答えなかった。考えられる理由の1つは 法的責任に対する恐怖 – オンラインデータの無許可使用の範囲が広く知られるようになれば、さらに多くの訴訟が引き起こされる可能性がある。
今後のAI規制により、開発者はモデルに何が含まれているかについてよりオープンにならざるを得なくなるかもしれない。欧州の 人工知能法2025年8月に発効する「著作権法で保護されているテキストやデータを含む、汎用AIモデルの事前学習や学習に用いられるデータの透明性を高めるため、当該モデルの提供者は、汎用AIモデルの学習に用いられる内容について十分に詳細な概要を作成し、公表することが適切である」と宣言している。
規則には企業秘密や企業機密情報の保護が含まれているが、提供される情報は「著作権者を含む」正当な利益を有する者を満足させ、権利の行使に役立つほど詳細でなければならないことが明確にされている。
カリフォルニア州議会はAIデータ透明性法案を承認した(AB2013)、ギャビン・ニューサム知事の署名を待っている。そして連邦法案である 生成AI著作権開示法は、AI モデルに対して、トレーニングに使用したすべての著作権で保護されたコンテンツを米国著作権局に通知するよう求めています。
トレーニングデータの透明性を求める動きは、すでに多くの著作権侵害の申し立てに直面しているOpenAIにとって懸念材料となるかもしれない。マイクロソフト傘下の開発者は、著作権で保護されたコンテンツの使用はフェアユースに該当し、法的に擁護できると主張し続けている。同社の弁護士は、 答え [PDF] 先月、著者らは修正された訴状を提出した。
「原告は、彼らの本はOpenAIのモデルに知性と言語を教えるために示された人間の知識の一部であると主張している」とOpenAIの弁護士は主張する。「もしそうだとすれば、それは典型的な変革的公正使用となるだろう。」
とはいえ、OpenAI の法務チームは、生成 AI はトレーニング データを再現するのではなく、新しいコンテンツを作成することが目的であると主張しています。モデルのトレーニング プロセス中に著作権で保護された作品を処理することは、単語の頻度、構文パートナー、その他の統計データを抽出するだけなので、著作権を侵害するものではないとされています。
「これらのモデルの目的は、すでに存在する素材を出力することではありません。それを実現するには、はるかに少ない計算量で済む方法があります」とOpenAIの弁護士は主張する。「その代わりに、言語、推論、そして世界に対する理解に基づいて、これまで存在しなかった新しい素材を作り出すことがその目的です。」
それは少し誤解を招く表現です。生成 AI モデルは、予期しない出力が可能ですが、特定のプロンプトと隣接するシステム ルールに関連するトレーニング データから一連のトークンまたは文字を予測するように設計されています。トレーニング データに十分に基づかない予測は幻覚と呼ばれます。たとえ「創造的」であっても、望ましい結果ではありません。
明白な事実ではない
AIモデルがトレーニングデータを逐語的に再現するかどうかは著作権法に関係します。ソースデータと似ているが同一ではないコンテンツを作成する能力 – 「著作権のあるデータのマネーロンダリング開発者のサイモン・ウィリソン氏が説明したように、「ゲームの世界は、法的にも道徳的にも、もう少し複雑です。」
それでも、著作権法が AI モデルの行動や社会への影響に対処するのに適切な制度であるかどうかについては、法学者の間でかなりの懐疑論がある。これまで、米国の裁判所もその懐疑論に同調してきた。
次のように指摘されている。 ポリティコ昨年11月、米国地方裁判所のヴィンセント・チャブリア判事はメタの 却下動議 [PDF] 著者リチャード・カドリー氏に代わってソーシャル メディア大手に対して LLaMa モデルに関して起こされた訴訟のうち、1 件を除くすべての訴訟が却下された。チャブリア氏は、LLaMa 自体が著作権を侵害する二次的著作物であるという主張を「ナンセンス」と呼び、著作権侵害の申し立て、DMCA の申し立て、および州法の申し立てをすべて却下した。
これは、著者らがOpenAIに対して起こした訴訟や、同様の申し立てを行った他の訴訟にとって良い兆候ではない。 600以上の法案が提案されている この問題の解決を目指す米国全土の団体。®
追伸: OpenAIの最高研究責任者ボブ・マグルーは、CTOミラ・ムラティが辞任すると発表した直後に組織を去った。ますます不思議だ。CEOサム・アルトマンは、この変更を認めた。 ここ。
#OpenAI #は著作権弁護士に秘密のトレーニングデータを公開する #Register