日本語版
最新ニュース
科学&テクノロジー

ハーバード大学が OpenAI と Microsoft の資金提供を受けて大規模な無料 AI トレーニング データセットをリリース

膨大な書籍に加えて、Institutional Data Initiative はボストン公共図書館と協力して、現在パブリックドメインとなっているさまざまな新聞の何百万もの記事をスキャンしており、将来的に同様のコラボレーションを行う用意があると述べています。書籍データセットがリリースされる正確な方法はまだ決まっていません。 Institutional Data Initiative は Google に対し、一般公開に関して協力するよう要請しているが、詳細はまだ検討中である。 Googleのグローバル担当社長、ケント・ウォーカー氏は声明で、同社がこのプロジェクトを「支援できることを誇りに思う」と述べた。IDI のデータセットがどのようにリリースされても、企業が著作権の問題に遭遇するリスクなしに、実質的で高品質の AI トレーニング資料にアクセスできるようにすることを約束する、多数の同様のプロジェクト、スタートアップ、イニシアチブに加わることになります。 Calliope Networks や ProRata などの企業 現れた ライセンスの発行と管理 補償制度 AI トレーニング データの提供に対してクリエイターと権利所有者に報酬を得るように設計されています。他にも新しいパブリックドメイン プロジェクトがあります。昨春、フランスのAIスタートアップPleiasが 展開された プロジェクト コーディネーターのピエール カール ラングレ氏によると、独自のパブリック ドメイン データセットである Common Corpus には、推定 300 ~…

ハーバード大学が OpenAI と Microsoft の資金提供を受けて大規模な無料 AI トレーニング データセットをリリース

1734025927
2024-12-12 14:06:00

膨大な書籍に加えて、Institutional Data Initiative はボストン公共図書館と協力して、現在パブリックドメインとなっているさまざまな新聞の何百万もの記事をスキャンしており、将来的に同様のコラボレーションを行う用意があると述べています。書籍データセットがリリースされる正確な方法はまだ決まっていません。 Institutional Data Initiative は Google に対し、一般公開に関して協力するよう要請しているが、詳細はまだ検討中である。 Googleのグローバル担当社長、ケント・ウォーカー氏は声明で、同社がこのプロジェクトを「支援できることを誇りに思う」と述べた。

IDI のデータセットがどのようにリリースされても、企業が著作権の問題に遭遇するリスクなしに、実質的で高品質の AI トレーニング資料にアクセスできるようにすることを約束する、多数の同様のプロジェクト、スタートアップ、イニシアチブに加わることになります。 Calliope Networks や ProRata などの企業 現れた ライセンスの発行と管理 補償制度 AI トレーニング データの提供に対してクリエイターと権利所有者に報酬を得るように設計されています。

他にも新しいパブリックドメイン プロジェクトがあります。昨春、フランスのAIスタートアップPleiasが 展開された プロジェクト コーディネーターのピエール カール ラングレ氏によると、独自のパブリック ドメイン データセットである Common Corpus には、推定 300 ~ 400 万冊の書籍や定期刊行物が含まれています。フランス文化省の支援により、共通コーパスはオープンソース AI プラットフォーム Hugging Face 上で今月だけで 60,000 回以上ダウンロードされました。先週、Pleiasは、このデータセットでトレーニングされた最初の大規模言語モデルのセットをリリースすると発表した。ラングレ氏はWIREDに対し、これが「オープンデータのみでトレーニングされ、 [EU] AI法」

同様の画像データセットを作成する取り組みも進行中です。 AI スタートアップのスポーン 解放された この夏には、Source.Plus と呼ばれる独自のサービスが提供されます。これには、ウィキメディア コモンズやさまざまな博物館やアーカイブからのパブリック ドメインの画像が含まれています。いくつかの重要な 文化施設 ニューヨークのメトロポリタン美術館のように、彼らは長い間、独自のアーカイブを独立したプロジェクトとして一般に公開してきました。

エド・ニュートン・レックス氏、Stability AI の元幹部で現在は 非営利団体 倫理的にトレーニングされた AI ツールを認定する同社は、これらのデータセットの増加は、高性能で高品質の AI モデルを構築するために著作権で保護された素材を盗む必要がないことを示していると述べています。 OpenAI は以前、英国の議員に対し、次のようになると述べました。不可能」を使用して、著作物を使用せずに ChatGPT のような製品を作成します。 「このような大規模なパブリック ドメイン データセットは、一部の AI 企業がモデルをトレーニングするために著作権で保護された作品をスクレイピングすることを正当化するために使用する『必要性の防御』をさらに破壊します」とニュートン レックス氏は言います。

しかし、IDI やそれに類するプロジェクトが実際に AI トレーニングの現状を変えるかどうかについては、まだ疑問を抱いています。 「これらのデータセットは、おそらく他のデータのライセンス供与と組み合わせて、スクレイピングされた著作権で保護された作品を置き換えるために使用される場合にのみ、プラスの影響を及ぼします。これらが、世界中のクリエイターの無許可のライフワークも含まれるデータセットの一部として、単にミックスに追加されるだけで、AI 企業に圧倒的な利益をもたらすでしょう」と彼は言います。

12/12/24 午前 11 時 18 分 (東部標準時) 更新: このストーリーは Google からのコメントを追加して更新されました。

#ハーバード大学が #OpenAI #と #Microsoft #の資金提供を受けて大規模な無料 #トレーニング #データセットをリリース

執筆者について: nipponese

Nipponese News編集部は、国内外のニュースを日本語で分かりやすくお届けします。