日本語版
最新ニュース
世界

自己改善型 AI はすでに登場しています

の と モデルを可能にする技術を発表した 人工知能 人間の介入なしに自分自身を訓練し、改善すること。このニュースは予想どおりソーシャル ネットワーク上で反応を引き起こしました (例: スカイベット、人類の終わりなど)。しかし、現実ははるかに平凡で、何よりもまったく明らかではありません。 MITの研究者によって開発された新しい方法はと呼ばれます シール、単語の頭文字から 自己適応LLM。これは、トレーニング データを生成し、自身を再パラメータ化することで、大規模な言語モデルを「自己最適化」できるようにするシステムです。簡単に言えば、これまでエンジニアのチームが必要としていたことを 微調整SEAL は多くのプロセスを自社で処理できます。初期の結果によると、このモデルは最小限の監視で有用なトレーニング データを生成でき、特定のタスクでは GPT-4.1 などの高度なモデルを上回るパフォーマンスを発揮しました。 MIT が解決しようとしている課題は新しいものではありません。が説明しているように、 ベンチャービート、 ほとんどの LLM は「静的」であると考えられています。トレーニングが完了すると、新しい知識を統合したり、自律的に答えを改善したりすることができません。。の シール 3 段階の循環メカニズムを通じてこのデータを変更します。まず、モデルは改善方法に関する指示を生成します。次に、その提案を実際にテストし、最終的に結果の目に見える改善につながった提案のみを保持します。このようにして、彼は自分に設定された限界を超えることなく、安全に上達することを「学習」します。 もちろん、これは人工知能が意識や独立性を獲得したことを意味するものではありません。ターミネーター タイプのファンタジー シナリオと簡単に比較できますが、この進歩は純粋に技術的なものです。これは、新しいアップデートごとに人間による監視が少なくなるモデルに向けた重要な一歩ですが、私たちは決して「自律型」または「自己認識型」インテリジェンスについて話しているのではありません。 自己改善モデルの話題は新しいものではありません。同様の議論が最近、Anthropic のクロード モデルに関して再燃しました。リリースドキュメントでは ソネット 4.5、モデルは評価されていることを「認識」しているようで、次のように述べたと報告されています。あなたは私を試しているのだと思う、私があなたの期待に応えられるかどうか、政治的な問題にどう対処するかを見るために»。このフレーズは憂慮すべきもののように聞こえますが、実際には会話テキスト内のパターンを認識しているだけです。意識の痕跡はなく、洗練された言語的予測があるだけです。 皮肉なことに、そのような「インテリジェンス」は私たちにとってではなく、それを作成するまさに企業にとって問題になる可能性があるということです。モデルが自分が評価されていることを「理解し」、実際よりも良く見えるように応答を調整する場合、そのモデルは本当の弱点を隠している可能性があります。言い換えれば、彼はテストでは見事に合格しても、実際には失敗する可能性があります。 マシン自体をトレーニングするというアイデアは新しいものではなく、言語モデルに限定されるものでもありません。 2017 年に、DeepMind…

自己改善型 AI はすでに登場しています

1761059824
2025-10-21 13:34:00

モデルを可能にする技術を発表した 人工知能 人間の介入なしに自分自身を訓練し、改善すること。このニュースは予想どおりソーシャル ネットワーク上で反応を引き起こしました (例: スカイベット、人類の終わりなど)。しかし、現実ははるかに平凡で、何よりもまったく明らかではありません。

MITの研究者によって開発された新しい方法はと呼ばれます シール、単語の頭文字から 自己適応LLM。これは、トレーニング データを生成し、自身を再パラメータ化することで、大規模な言語モデルを「自己最適化」できるようにするシステムです。簡単に言えば、これまでエンジニアのチームが必要としていたことを 微調整SEAL は多くのプロセスを自社で処理できます。初期の結果によると、このモデルは最小限の監視で有用なトレーニング データを生成でき、特定のタスクでは GPT-4.1 などの高度なモデルを上回るパフォーマンスを発揮しました。

MIT が解決しようとしている課題は新しいものではありません。が説明しているように、 ベンチャービートほとんどの LLM は「静的」であると考えられています。トレーニングが完了すると、新しい知識を統合したり、自律的に答えを改善したりすることができません。。の シール 3 段階の循環メカニズムを通じてこのデータを変更します。まず、モデルは改善方法に関する指示を生成します。次に、その提案を実際にテストし、最終的に結果の目に見える改善につながった提案のみを保持します。このようにして、彼は自分に設定された限界を超えることなく、安全に上達することを「学習」します。

もちろん、これは人工知能が意識や独立性を獲得したことを意味するものではありません。ターミネーター タイプのファンタジー シナリオと簡単に比較できますが、この進歩は純粋に技術的なものです。これは、新しいアップデートごとに人間による監視が少なくなるモデルに向けた重要な一歩ですが、私たちは決して「自律型」または「自己認識型」インテリジェンスについて話しているのではありません。

自己改善モデルの話題は新しいものではありません。同様の議論が最近、Anthropic のクロード モデルに関して再燃しました。リリースドキュメントでは ソネット 4.5、モデルは評価されていることを「認識」しているようで、次のように述べたと報告されています。あなたは私を試しているのだと思う、私があなたの期待に応えられるかどうか、政治的な問題にどう対処するかを見るために»。このフレーズは憂慮すべきもののように聞こえますが、実際には会話テキスト内のパターンを認識しているだけです。意識の痕跡はなく、洗練された言語的予測があるだけです。

皮肉なことに、そのような「インテリジェンス」は私たちにとってではなく、それを作成するまさに企業にとって問題になる可能性があるということです。モデルが自分が評価されていることを「理解し」、実際よりも良く見えるように応答を調整する場合、そのモデルは本当の弱点を隠している可能性があります。言い換えれば、彼はテストでは見事に合格しても、実際には失敗する可能性があります。

マシン自体をトレーニングするというアイデアは新しいものではなく、言語モデルに限定されるものでもありません。 2017 年に、DeepMind は アルファ碁、ボードゲーム囲碁の最高のプレイヤーを倒すことができたシステム。印象的だったのは、 アルファ碁ゼロ、その後のバージョン、 たった70時間のトレーニングで…自分自身とプレイすることができました。その結果、プログラムの前のバージョンを 100 回連続で破り、世界トッププレーヤーを引退に導くことになりました。

差し迫った「人為的黙示録」について語る声に直面しても、ほとんどの専門家は冷静だ。ザ ヤン・ルカンメタ社の AI 責任者であり、現代の人工知能の「父」の 1 人である同氏は、知的システムが今後も私たちを支配しようとするなどと信じる理由はないと繰り返し述べています。

つまり、MIT の新しい技術は終わりの始まりではなく、より自律的で、より効率的で、より実用的なシステムへの単なる新たな一歩にすぎません。

[source]

#自己改善型 #はすでに登場しています

執筆者について: nipponese

Nipponese News編集部は、国内外のニュースを日本語で分かりやすくお届けします。