日本語版
最新ニュース
科学&テクノロジー

著作権で保護されたコンテンツを丸呑みせずに AI モデルをトレーニングできるという証拠がここにあります

2023 年には OpenAI 英国議会に次のように述べた。不可能」を使用して、著作権で保護された素材を使用せずに主要な AI モデルをトレーニングします。 その 人気のスタンス AI の世界では、OpenAI やその他の大手企業が、オンラインで丸呑みした素材を使用して、チャットボットや画像ジェネレーターを動かすモデルをトレーニングし、 著作権侵害を訴える訴訟が相次ぐ。 水曜日の2件の発表は、著作権で保護された素材を許可なく使用することなく、実際に大規模な言語モデルをトレーニングできるという証拠を提供している。フランス政府の支援を受けた研究者グループが、パブリックドメインのテキストだけで構成される最大規模のAIトレーニングデータセットと思われるデータセットを公開した。 そして非営利団体フェアリー・トレーニングドは次のように発表した。 初の認証を取得 これは、ChatGPT の背後にあるようなテクノロジーが、議論の多い AI 業界の標準とは異なる方法で構築できることを示しています。「LLM を公平にトレーニングできない根本的な理由はありません」と、Fairly Trained の CEO、Ed Newton-Rex 氏は言います。 彼は 2024 年 1 月に非営利団体を設立しました 画像生成スタートアップ Stability AI のコンテンツを許可なくスクレイピングする方針に同意できず、同社の役員を辞めた後。Fairly Training は、自社が所有するデータ、ライセンスを取得したデータ、またはパブリック ドメインにあるデータに基づいて AI…

著作権で保護されたコンテンツを丸呑みせずに AI モデルをトレーニングできるという証拠がここにあります

1710981627
2024-03-20 16:00:00

2023 年には OpenAI 英国議会に次のように述べた。不可能」を使用して、著作権で保護された素材を使用せずに主要な AI モデルをトレーニングします。 その 人気のスタンス AI の世界では、OpenAI やその他の大手企業が、オンラインで丸呑みした素材を使用して、チャットボットや画像ジェネレーターを動かすモデルをトレーニングし、 著作権侵害を訴える訴訟が相次ぐ

水曜日の2件の発表は、著作権で保護された素材を許可なく使用することなく、実際に大規模な言語モデルをトレーニングできるという証拠を提供している。

フランス政府の支援を受けた研究者グループが、パブリックドメインのテキストだけで構成される最大規模のAIトレーニングデータセットと思われるデータセットを公開した。 そして非営利団体フェアリー・トレーニングドは次のように発表した。 初の認証を取得 これは、ChatGPT の背後にあるようなテクノロジーが、議論の多い AI 業界の標準とは異なる方法で構築できることを示しています。

「LLM を公平にトレーニングできない根本的な理由はありません」と、Fairly Trained の CEO、Ed Newton-Rex 氏は言います。 彼は 2024 年 1 月に非営利団体を設立しました 画像生成スタートアップ Stability AI のコンテンツを許可なくスクレイピングする方針に同意できず、同社の役員を辞めた後。

Fairly Training は、自社が所有するデータ、ライセンスを取得したデータ、またはパブリック ドメインにあるデータに基づいて AI モデルをトレーニングしたことを証明したい企業に認定を提供します。 非営利団体のとき 打ち上げられた、一部の批評家は、これらの要件を満たす大規模な言語モデルをまだ特定していないと指摘しました。

本日、Fairly Trained は、初の大規模言語モデルを認定したと発表しました。 これは KL3M と呼ばれ、シカゴに本拠を置くリーガル テック コンサルタント会社のスタートアップ 273 Ventures によって開発され、法律、財務、規制に関する文書の厳選されたトレーニング データセットを使用しています。

同社の共同創設者、ジリアン・ボマリート氏は、この方法でKL3Mを訓練するという決定は、法律事務所のような同社の「リスクを嫌う」顧客から来ていると述べた。 「彼らは出所を懸念しており、出力が汚染されたデータに基づいていないことを知る必要があります」と彼女は言います。 「私たちはフェアユースに依存していません。」 クライアントは、法的文書の要約や契約書の草案などのタスクに生成 AI を使用することに興味を持っていましたが、OpenAI や Stability AI などがそうであったように、知的財産に関する訴訟に巻き込まれることは望んでいませんでした。

ボンマリート氏によると、273 Ventures はこれまで大規模な言語モデルに取り組んだことがなかったが、実験として言語モデルをトレーニングすることに決めたという。 「それが可能かどうかを確認するためのテストです」と彼女は言います。 同社は独自のトレーニング データセットである Kelvin Legal DataPack を作成しました。これには、著作権法に準拠するためにレビューされた数千の法的文書が含まれています。

このデータセットは、OpenAI やインターネットを大量に収集した他の企業が編集したデータセットと比較すると小さい (約 3,500 億トークン、つまりデータ単位) ものの、KL3M モデルは予想よりもはるかに優れたパフォーマンスを発揮したとボマリート氏は述べており、これは、データは事前に精査されていました。 「クリーンで高品質なデータがあれば、モデルをそれほど大きくする必要がない可能性があります」と彼女は言います。 データセットをキュレーションすると、設計されたタスクに特化した完成した AI モデルを作成するのに役立ちます。 273 Ventures は現在、このデータへのアクセスを購入したいクライアントに待機リストへの参加枠を提供しています。

白紙の状態

KL3M をエミュレートしようとしている企業は、将来、無料で利用できる侵害のないデータセットの形でさらに多くの支援を受けることができるかもしれません。 水曜日、研究者らは、純粋にパブリックドメインのコンテンツから構成される言語モデル用に利用可能な最大のAIデータセットであると主張するものをリリースした。 Common Corpus は、その名の通り、トレーニングに使用されるデータとほぼ同じサイズのテキストのコレクションです。 OpenAIのGPT-3テキスト生成モデル オープンソース AI プラットフォーム Hugging Face に投稿されています。

このデータセットは、米国議会図書館やフランス国立図書館によってデジタル化されたパブリック ドメインの新聞などのソースから構築されました。 Common CorpusのプロジェクトコーディネーターであるPierre-Carl Langlais氏は、これを「最先端のLLMを訓練するのに十分な大きさのコーパス」と呼んでいます。 ビッグ AI の用語では、データセットには 5,000 億のトークンが含まれています。 OpenAI の最も有能なモデルは、数兆でトレーニングされたと広く信じられています。

#著作権で保護されたコンテンツを丸呑みせずに #モデルをトレーニングできるという証拠がここにあります

執筆者について: nipponese

Nipponese News編集部は、国内外のニュースを日本語で分かりやすくお届けします。