日本語版
最新ニュース
科学&テクノロジー

イーロン・マスク氏もAIトレーニングデータを使い果たしたことに同意

イーロン・マスク氏も他のAI専門家らと同様に、AIモデルをトレーニングするための実世界のデータはほとんど残っていないという。 「私たちは現在、人類の知識の蓄積を基本的に使い果たしています…。 AIトレーニングで」とマスク氏は水曜日遅くにXでストリーミングされたスタッグウェル会長マーク・ペンとのライブストリーミング会話の中で語った。 「それは基本的に去年起こったことです。」 AI企業xAIのオーナーであるマスク氏も、OpenAIの元チーフサイエンティスト、イリヤ・サツケヴァー氏のテーマに同調した。 触れた 機械学習カンファレンスNeurIPSでの12月の講演中。サツケバー氏は、AI業界が「ピークデータ」と呼ぶところに達していると述べ、トレーニングデータの不足により、現在のモデル開発方法からの転換を余儀なくされるだろうと予測した。 実際、マスク氏は、合成データ、つまり AI モデル自体によって生成されたデータが今後の道であると示唆しました。 「補う唯一の方法は、 [real-world data] AI が作成する合成データを使用します。 [training data]」と彼は言いました。 「合成データを使用すると… [AI] それ自体が採点のようなものであり、この自己学習のプロセスを経ることになります。」 Microsoft、Meta、OpenAI、Anthropic などのテクノロジー大手を含む他の企業は、すでに合成データを使用して主力 AI モデルをトレーニングしています。ガートナー 見積もり 2024 年に AI および分析プロジェクトに使用されるデータの 60% は合成的に生成されました。 マイクロソフトの ファイ-4は水曜日の初めにオープンソース化され、実世界のデータと並行して合成データでトレーニングされました。 Googleも同様だった ジェマ モデル。 Anthropic は、最もパフォーマンスの高いシステムの…

イーロン・マスク氏もAIトレーニングデータを使い果たしたことに同意

1736414451
2025-01-09 04:01:00

イーロン・マスク氏も他のAI専門家らと同様に、AIモデルをトレーニングするための実世界のデータはほとんど残っていないという。

「私たちは現在、人類の知識の蓄積を基本的に使い果たしています…。 AIトレーニングで」とマスク氏は水曜日遅くにXでストリーミングされたスタッグウェル会長マーク・ペンとのライブストリーミング会話の中で語った。 「それは基本的に去年起こったことです。」

AI企業xAIのオーナーであるマスク氏も、OpenAIの元チーフサイエンティスト、イリヤ・サツケヴァー氏のテーマに同調した。 触れた 機械学習カンファレンスNeurIPSでの12月の講演中。サツケバー氏は、AI業界が「ピークデータ」と呼ぶところに達していると述べ、トレーニングデータの不足により、現在のモデル開発方法からの転換を余儀なくされるだろうと予測した。

実際、マスク氏は、合成データ、つまり AI モデル自体によって生成されたデータが今後の道であると示唆しました。 「補う唯一の方法は、 [real-world data] AI が作成する合成データを使用します。 [training data]」と彼は言いました。 「合成データを使用すると… [AI] それ自体が採点のようなものであり、この自己学習のプロセスを経ることになります。」

Microsoft、Meta、OpenAI、Anthropic などのテクノロジー大手を含む他の企業は、すでに合成データを使用して主力 AI モデルをトレーニングしています。ガートナー 見積もり 2024 年に AI および分析プロジェクトに使用されるデータの 60% は合成的に生成されました。

マイクロソフトの ファイ-4は水曜日の初めにオープンソース化され、実世界のデータと並行して合成データでトレーニングされました。 Googleも同様だった ジェマ モデル。 Anthropic は、最もパフォーマンスの高いシステムの 1 つを開発するためにいくつかの合成データを使用しました。 クロード 3.5 ソネット。そしてメタはその最新のものを微調整した ラマ シリーズのモデル AIが生成したデータを使用する

合成データでのトレーニングには、コスト削減などの他の利点もあります。 AI スタートアップの Writer は、同社の Palmyra X 004 モデルは、ほぼ完全に合成ソースを使用して開発され、開発にかかった費用はわずか 70 万ドルだと主張しています。 比較した 同等の規模の OpenAI モデルの場合は 460 万ドルと見積もられています。

しかし、デメリットもあります。 いくつかの研究 合成データがモデルの崩壊につながる可能性があることを示唆しています。つまり、モデルの出力において「創造性」が低下し、より偏ったものになり、最終的に機能が大きく損なわれることになります。モデルは合成データを作成するため、これらのモデルのトレーニングに使用されるデータにバイアスや制限がある場合、出力も同様に汚染されます。

#イーロンマスク氏もAIトレーニングデータを使い果たしたことに同意

執筆者について: nipponese

Nipponese News編集部は、国内外のニュースを日本語で分かりやすくお届けします。