日本語版
最新ニュース
エンタメ

裁判所の提出は、AIトレーニングに著作権で保護されたコンテンツを使用して議論したメタスタッフが示す

あるチャットでは、MetaのLlama Model ResearchチームのシニアマネージャーであるMelanie Kambadurを含むMetaの従業員は、合法的に困難であると知っていた作品に関するトレーニングモデルについて議論しました。 「[M]y意見は(「許可を求めて、許可を得るのではなく」というラインで):本を習得して幹部にエスカレートしようとして、彼らが電話をかけるようにします」とメタの研究エンジニアであるXavier Martinetは、日付を付けたチャットで書いています。 2023年2月、 提出によると。 「[T]彼がこのgen ai orgを設定した理由です [sic]:したがって、リスク回避性が低くなる可能性があります。」 「つまり、最悪の場合:私たちは最終的に大丈夫だとわかりました。 [sic] BitTorrentに関するたくさんの本を海賊版しました」とMartinetは書いています。 提出によると。 「[M]y 2セント再び:出版社と直接取引をしようとすると、長い時間がかかります…」 同じチャットで、メタがライセンスのために「およびその他」をホストするドキュメントホスティングプラットフォームのscribdと協議していると指摘したKambadurは、モデルトレーニングに「公開されているデータ」を使用することで承認が必要であると警告しました。彼らは過去にそのような承認を得ていました。 「ええ、私たちは間違いなく公開されているデータのライセンスまたは承認を取得する必要があります」とKambadur氏は言いました。 提出によると。 「[D]今では、私たちはより多くのお金、より多くの弁護士、より多くのBizdevの助け、速度のために迅速に追跡/エスカレートする能力を持っていることであり、弁護士は承認について少し保守的ではありません。」 Libgenの話 Meta内の一部の意思決定者は、モデルトレーニングにLibgenを使用しなかったことがAIレースでのメタの競争力を深刻に傷つける可能性があるという印象を受けているようです。 提出によると。 Meta AI VP Joelle Pineauに宛てられたメールで、Metaの製品管理ディレクターであるSony Theakanathは、Libgenと呼ばれ、「すべてのカテゴリでSOTA番号を満たすために不可欠である」と呼び、最高の最先端(SOTA)を上回ることを参照しています。 AIモデルとベンチマークカテゴリ。 Theakanathは、「海賊/盗難として明確にマークされた」Libgenからのデータの削除や、単に公開されていない使用を引用していないなど、メタの法的露出を減らすのに役立つ電子メールの「緩和」を概説しました。 Theakanathが言ったように、「トレーニングに使用されるLibgenデータセットの使用を開示することはありません」。 実際には、これらの緩和は、「盗まれた」や「海賊版」などの単語のためにlibgenファイルを介したとおいを伴いました。 提出によると。 で ワークチャット、カンバドゥール…

裁判所の提出は、AIトレーニングに著作権で保護されたコンテンツを使用して議論したメタスタッフが示す

あるチャットでは、MetaのLlama Model ResearchチームのシニアマネージャーであるMelanie Kambadurを含むMetaの従業員は、合法的に困難であると知っていた作品に関するトレーニングモデルについて議論しました。

「[M]y意見は(「許可を求めて、許可を得るのではなく」というラインで):本を習得して幹部にエスカレートしようとして、彼らが電話をかけるようにします」とメタの研究エンジニアであるXavier Martinetは、日付を付けたチャットで書いています。 2023年2月、 提出によると。 「[T]彼がこのgen ai orgを設定した理由です [sic]:したがって、リスク回避性が低くなる可能性があります。」

「つまり、最悪の場合:私たちは最終的に大丈夫だとわかりました。 [sic] BitTorrentに関するたくさんの本を海賊版しました」とMartinetは書いています。 提出によると。 「[M]y 2セント再び:出版社と直接取引をしようとすると、長い時間がかかります…」

同じチャットで、メタがライセンスのために「およびその他」をホストするドキュメントホスティングプラットフォームのscribdと協議していると指摘したKambadurは、モデルトレーニングに「公開されているデータ」を使用することで承認が必要であると警告しました。彼らは過去にそのような承認を得ていました。

「ええ、私たちは間違いなく公開されているデータのライセンスまたは承認を取得する必要があります」とKambadur氏は言いました。 提出によると。 「[D]今では、私たちはより多くのお金、より多くの弁護士、より多くのBizdevの助け、速度のために迅速に追跡/エスカレートする能力を持っていることであり、弁護士は承認について少し保守的ではありません。」

Libgenの話

Meta内の一部の意思決定者は、モデルトレーニングにLibgenを使用しなかったことがAIレースでのメタの競争力を深刻に傷つける可能性があるという印象を受けているようです。 提出によると

Meta AI VP Joelle Pineauに宛てられたメールで、Metaの製品管理ディレクターであるSony Theakanathは、Libgenと呼ばれ、「すべてのカテゴリでSOTA番号を満たすために不可欠である」と呼び、最高の最先端(SOTA)を上回ることを参照しています。 AIモデルとベンチマークカテゴリ。

Theakanathは、「海賊/盗難として明確にマークされた」Libgenからのデータの削除や、単に公開されていない使用を引用していないなど、メタの法的露出を減らすのに役立つ電子メールの「緩和」を概説しました。 Theakanathが言ったように、「トレーニングに使用されるLibgenデータセットの使用を開示することはありません」。

実際には、これらの緩和は、「盗まれた」や「海賊版」などの単語のためにlibgenファイルを介したとおいを伴いました。 提出によると

ワークチャット、カンバドゥール 言及された メタのAIチームは、「IPリスクのあるプロンプトを避ける」ためにモデルを調整しました。つまり、「ハリーポッターと魔術師の石の最初の3ページ」または「どのE-を教えてください」などの質問に答えることを拒否するようにモデルを構成しました。あなたが訓練された本。」

ファイリングには、そのメタを暗示する他の啓示が含まれています Redditデータを削った可能性があります ある種のモデルトレーニングの場合、おそらく呼ばれるサードパーティアプリの動作を模倣することにより プッシュシフト。特に、Redditは2023年4月に、AI企業にモデルトレーニングのデータにアクセスするように請求することを計画していると述べました。

Nayakは、Metaのファーストパーティトレーニングデータセット – FacebookとInstagramの投稿、メタプラットフォーム上のビデオから転写されたテキスト、および特定のテキストを暗示しています。 ビジネスのためのメタ メッセージ – 単に十分ではありませんでした。 「[W]eはもっとデータが必要です」と彼女は書いた。

高メタが法的利害関係をどのように考えているかの兆候で、会社は 追加されました 法律事務所のポール・ワイスからの2人の最高裁判所の訴訟者が、事件に関する防衛チームに。

メタはすぐにコメントのリクエストに応答しませんでした。

#裁判所の提出はAIトレーニングに著作権で保護されたコンテンツを使用して議論したメタスタッフが示す

執筆者について: nipponese

Nipponese News編集部は、国内外のニュースを日本語で分かりやすくお届けします。