1767831087
2026-01-07 19:00:00
最も賢い人でも 人工知能 モデルは基本的に模倣品です。彼らは、人間の仕事の例を利用するか、人間のインストラクターによって設定された問題を解決しようとすることによって学びます。
しかし、おそらく AI は、実際には、より人間らしい方法、つまり、自分自身に問いかけるべき興味深い質問を考え出し、正しい答えを見つけようとするという方法で学習できるのかもしれません。からのプロジェクト 清華大学、 北京汎用人工知能研究所 (BIGAI)、ペンシルベニア州立大学は、AI がコンピューター コードをいじることでこの方法で推論する方法を学習できることを示しました。
研究者たちは、と呼ばれるシステムを考案しました。 絶対零度のリーズナー (AZR) では、最初に大規模な言語モデルを使用して、困難だが解決可能な Python コーディング問題を生成します。次に、コードを実行して動作を確認する前に、同じモデルを使用して問題を解決します。そして最後に、AZR システムは成功と失敗を信号として使用して元のモデルを改良し、より良い問題を提起し、それらを解決する能力を強化します。
チームは、彼らのアプローチにより、パラメータ 70 億バージョンと 140 億バージョンの両方のコーディングと推論スキルが大幅に向上したことを発見しました。 オープンソース言語モデル Qwen。印象的なことに、このモデルは人間が厳選したデータを受け取った一部のモデルをも上回るパフォーマンスを示しました。
と話しました アンドリュー・チャオ、清華大学の博士課程の学生であり、「絶対零度」の最初のアイデアを思いついた人物であり、 鄭子龍、彼と一緒にプロジェクトに取り組んだBIGAIの研究員がZoomで話しました。
ザオ氏は、このアプローチは人間の学習が丸暗記や模倣を超えたものに似ていると語った。 「最初は親の真似をしたり、先生の真似をしたりしますが、その後は基本的に自分で質問する必要があります」と彼は言う。 「そして最終的には、学校で教えてくれた人たちを超えることができるのです。」
Zhao 氏と Zheng 氏は、「セルフプレイ」とも呼ばれるこの方法での AI 学習のアイデアは何年も前に遡り、以前は次のような人々によって研究されていたと指摘しました。 ユルゲン・シュミットフーバー、有名な AI パイオニア、そして ピエール=イヴ・オーデイヤー、フランスのインリア大学のコンピューター科学者。
Zheng 氏によると、プロジェクトの最もエキサイティングな要素の 1 つは、モデルの問題提起と問題解決のスキルが拡張される方法です。 「モデルが強力になるにつれて、難易度も上がります」と彼は言います。
重要な課題は、現時点ではこのシステムが数学やコーディングを伴う問題など、簡単にチェックできる問題でしか機能しないことです。プロジェクトが進むにつれて、Web の閲覧や事務作業などのエージェント AI タスクで使用できるようになる可能性があります。これには、AI モデルにエージェントのアクションが正しいかどうかを判断させることが含まれる場合があります。
絶対零度のようなアプローチの興味深い可能性の 1 つは、理論的には、モデルが人間の指導を超えられる可能性があることです。 「それを手に入れれば、それは超知性への到達方法のようなものです」と鄭氏は私に語った。
一部の大手 AI 研究所では、絶対零度のアプローチが普及しつつある初期の兆候があります。
というプロジェクト エージェント0Salesforce、スタンフォード、ノースカロライナ大学チャペルヒル校によるこの研究には、ソフトウェア ツールを使用するエージェントが関与しており、セルフプレイを通じて自身を改善します。絶対零度の場合と同様、モデルは実験的な問題解決を通じて一般的な推論が向上します。あ 最近の論文 Meta、イリノイ大学、カーネギーメロン大学の研究者によって書かれたこの論文では、ソフトウェア エンジニアリングに同様のセルフプレイを使用するシステムが紹介されています。この研究の著者らは、これが「超知能ソフトウェアエージェントの訓練パラダイムに向けた第一歩」であると示唆しています。
AIの新たな学習方法を見つけることは、今年のテクノロジー業界の大きなテーマとなるだろう。従来のデータソースが希少かつ高価になり、研究室がモデルの能力を高める新しい方法を模索する中、「Absolute Zero」のようなプロジェクトは、模倣品ではなく、より人間に近い AI システムを生み出す可能性があります。
#モデルは自分自身に質問することで学習を始めています