日本語版
最新ニュース
科学&テクノロジー

人工知能がAIを餌にすると不条理が待ち受ける

いくつかの研究では、AI モデルが AI 自体によって生成されたデータでトレーニングされると、答えはもはや意味をなさなくなると指摘されています。 もし、人工知能(AI) AIによって生成されたデータで繰り返しトレーニングされると、ますます一貫性のないコンテンツが生成され始め、これはいくつかの科学的研究で指摘されている問題です。 ChatGPTのような生成AIツールの基盤となるモデルは、日常言語による簡単なクエリに基づいてあらゆる種類のコンテンツを生成できるが、膨大な量のデータでトレーニングする必要がある。データはWebから収集されることが多く、AIによって作成された画像やテキストがますます多く含まれている。AIがAIを餌にするこの「オートファジー」はモデルの崩壊につながり、最初は独創性や関連性がどんどん失われ、最終的には意味をなさない応答を生成すると、7月末に科学誌に掲載された記事で述べられている。 自然。 狂牛病に匹敵する現象 具体的には、機械によって生成されるため「合成データ」と呼ばれるこのタイプのデータを使用すると、人工知能モデルが回答を提供するために抽出するサンプルの豊かさが失われます。スキャンした画像のコピーを作成してから印刷するようなものです。印刷が行われるにつれて、結果は判読不能になるまで品質が失われます。 米国のライス大学とスタンフォード大学の研究者らは、画像生成AIモデル「Midjourney」、「Dall-E」、「Stable Diffusion」を研究して同じ結論に達した。彼らは、データが追加されるにつれて、生成される画像は次第に一般的なものになり、不自然な要素が徐々に散りばめられるようになったことを示した。 "人工的な" この現象を狂牛病と比較したモデル。英国で発生したこの伝染病は、牛の死骸の食べ残しや汚染された動物の死体から得た動物性飼料を牛の餌として使ったことに端を発している。 「合成データ」 しかし、人工知能分野の企業は、 「合成データ」 人間が作成したデータに比べてアクセスが容易で、データが豊富にあり、コストが低いため、プログラムをトレーニングするために使用されます。 「未活用の高品質で機械可読な人間のデータソースはますます希少になりつつある」オーストラリアのモナッシュ大学で新技術を専門とする研究者、ジャサン・サドウスキー氏がAFPに説明した。 「何世代にもわたって制御が効かなければ、災害シナリオになる」 モデルの崩壊症候群は 「インターネット全体のデータの品質と多様性を損なう」ライス大学の論文の著者の一人であるリチャード・バラニウク氏は声明で警告した。1990年代に狂牛病危機が食肉産業を壊滅させたように、インターネットは人工知能やモデルによって作られたコンテンツで溢れており、 "クレイジー" 科学者らは、急成長を遂げている数十億ドル規模のAI産業の将来を脅かす可能性があると指摘している。 「AIシステムを構築する研究者や企業にとっての本当の疑問は、どの時点で合成データの使用が過剰になるのかということです。」ジェイサン・サドウスキーも参加。 「インターネットの一部はゴミだ」 しかし、他の専門家にとって、この問題は誇張されており、避けられないものではない。人工知能分野の2つの巨匠、アントロピックとハギングフェイスは、AFPに対し、AIによって生成されたデータを使用していることを認めた。同誌の記事 自然 興味深い理論的視点を提供していますが、Hugging Face の機械学習エンジニアである Anton Lozhkov にとってはあまり現実的ではありません。 「トレーニング (モデルについて) 複数の合成データセットに基づくことは、現実には起こり得ないことだ」彼は保証した。 しかし、アントン・ロシュコフ氏は、AI…

人工知能がAIを餌にすると不条理が待ち受ける

1722660282
2024-08-03 03:42:53

いくつかの研究では、AI モデルが AI 自体によって生成されたデータでトレーニングされると、答えはもはや意味をなさなくなると指摘されています。

もし、人工知能(AI) AIによって生成されたデータで繰り返しトレーニングされると、ますます一貫性のないコンテンツが生成され始め、これはいくつかの科学的研究で指摘されている問題です。

ChatGPTのような生成AIツールの基盤となるモデルは、日常言語による簡単なクエリに基づいてあらゆる種類のコンテンツを生成できるが、膨大な量のデータでトレーニングする必要がある。データはWebから収集されることが多く、AIによって作成された画像やテキストがますます多く含まれている。AIがAIを餌にするこの「オートファジー」はモデルの崩壊につながり、最初は独創性や関連性がどんどん失われ、最終的には意味をなさない応答を生成すると、7月末に科学誌に掲載された記事で述べられている。 自然

狂牛病に匹敵する現象

具体的には、機械によって生成されるため「合成データ」と呼ばれるこのタイプのデータを使用すると、人工知能モデルが回答を提供するために抽出するサンプルの豊かさが失われます。スキャンした画像のコピーを作成してから印刷するようなものです。印刷が行われるにつれて、結果は判読不能になるまで品質が失われます。

米国のライス大学とスタンフォード大学の研究者らは、画像生成AIモデル「Midjourney」、「Dall-E」、「Stable Diffusion」を研究して同じ結論に達した。彼らは、データが追加されるにつれて、生成される画像は次第に一般的なものになり、不自然な要素が徐々に散りばめられるようになったことを示した。 “人工的な” この現象を狂牛病と比較したモデル。英国で発生したこの伝染病は、牛の死骸の食べ残しや汚染された動物の死体から得た動物性飼料を牛の餌として使ったことに端を発している。

「合成データ」

しかし、人工知能分野の企業は、 「合成データ」 人間が作成したデータに比べてアクセスが容易で、データが豊富にあり、コストが低いため、プログラムをトレーニングするために使用されます。 「未活用の高品質で機械可読な人間のデータソースはますます希少になりつつある」オーストラリアのモナッシュ大学で新技術を専門とする研究者、ジャサン・サドウスキー氏がAFPに説明した。

「何世代にもわたって制御が効かなければ、災害シナリオになる」 モデルの崩壊症候群は 「インターネット全体のデータの品質と多様性を損なう」ライス大学の論文の著者の一人であるリチャード・バラニウク氏は声明で警告した。1990年代に狂牛病危機が食肉産業を壊滅させたように、インターネットは人工知能やモデルによって作られたコンテンツで溢れており、 “クレイジー” 科学者らは、急成長を遂げている数十億ドル規模のAI産業の将来を脅かす可能性があると指摘している。 「AIシステムを構築する研究者や企業にとっての本当の疑問は、どの時点で合成データの使用が過剰になるのかということです。」ジェイサン・サドウスキーも参加。

「インターネットの一部はゴミだ」

しかし、他の専門家にとって、この問題は誇張されており、避けられないものではない。人工知能分野の2つの巨匠、アントロピックとハギングフェイスは、AFPに対し、AIによって生成されたデータを使用していることを認めた。同誌の記事 自然 興味深い理論的視点を提供していますが、Hugging Face の機械学習エンジニアである Anton Lozhkov にとってはあまり現実的ではありません。 「トレーニング (モデルについて) 複数の合成データセットに基づくことは、現実には起こり得ないことだ」彼は保証した。

しかし、アントン・ロシュコフ氏は、AI の専門家も他の人たちと同様に、Web の現状に不満を抱いていることを認めています。 「インターネットの一部はゴミだ」同氏は、自社ではすでに収集したデータの整理に多大な努力を払っており、場合によっては最大90%のデータが削除されていると付け加えた。

#人工知能がAIを餌にすると不条理が待ち受ける

執筆者について: nipponese

Nipponese News編集部は、国内外のニュースを日本語で分かりやすくお届けします。