日本語版
最新ニュース
世界

問題を介して考えることを教えるAIモデル、人間は必要ありません

DeepSeek-R1の多段階パイプライン。クレジット: 自然 (2025)。 2:10.1038/s41586-025-09422-z 人工知能は毎日より賢くなっていますが、それでも制限があります。最大の課題の1つは、上級のAIモデルを推論することです。つまり、問題を段階的に解決することを意味します。しかし、新しい論文で 公開 ジャーナルで 自然、中国の人工知能会社であるDeepseek AIのチームは、人間の入力なしで自分自身でR1モデルを教えることができたと報告しています。 私たちの多くが問題を解決しようとするとき、私たちは通常、すぐに答えを得ることができません。解決策に到達するまで情報を収集し、メモを取ることを伴う可能性のある系統的なプロセスに従います。伝統的に、AIモデルのトレーニングは、私たちのアプローチのコピーが含まれていました。ただし、問題を解決する方法のAIモデルに数え切れないほどの例を示すのは、長く描かれたプロセスです。また、AIは与えられた例と同じくらい良いだけであり、人間のバイアスを拾うことができることを意味します。 Deepseek AIの研究者は、R1モデルをすべてのステップで表示する代わりに、Renforce Learningと呼ばれる手法を使用しました。報酬を使用して、この試行錯誤のアプローチ 正解、モデルがそれ自体を推論するように奨励しました。 「問題を解決する方法をモデルに明示的に教えるのではなく、適切なインセンティブを提供するだけで、高度な問題解決戦略を自律的に開発します」と研究者は論文に書いています。 DeepseekのR1モデルは、困難な数学、コーディング、科学の問題について訓練されました。それが受けた唯一の報酬は、その最終的な答えが正しかったという合図でした。そのトレーニング中、研究者は、独自の作業をチェックしたり、解決策を見つけるためのさまざまな戦略を調査するなどのスキルを開発したりしました。独自の思考プロセスを反映しているように、「待機」のような言葉を使い始めました。パスが正しい答えにつながった場合、その戦略は強化されました。それが間違っていた場合、モデルはそれを繰り返さないことを学びました。いくつかありました 人間の介入、しかし、その過程でR1のスキルを磨くためだけです。 トレーニングプロセス全体のDeepSeek-R1-Zeroの精度と出力の長さ。クレジット: 自然 (2025)。 2:10.1038/s41586-025-09422-z 結果は印象的でした。 R1は、人間のガイダンスで訓練された古いモデルよりも、数学、コーディング、科学のタスクで優れたパフォーマンスを発揮しました。最も注目に値する結果の1つは、アメリカの招待数学試験(AIME)2024で86.7%の精度を達成したことです。これは、最も賢い高校生のための厳しい数学競争です。 これらの顕著な結果があっても、研究者は自分のモデルには機能するためのいくつかの制限があることを認めています。たとえば、英語以外のプロンプトが与えられたときに言語を混合し、必要よりも複雑ないくつかの簡単な問題を作成しました。しかし、これらの問題が解決されると、研究者は、それ自体を推論することができるAIモデルが、より有能で自律的なモデルの新しい時代につながると信じています。 私たちの著者によってあなたのために書かれています ポール・アーノルド、編集 リサロック、および事実確認され、レビューされました ロバート・イーガン- この記事は、慎重な人間の仕事の結果です。私たちはあなたのような読者に頼って、独立した科学ジャーナリズムを生かし続けます。この報告が重要な場合は、aを検討してください 寄付 (特に毎月)。あなたは得るでしょう 広告なし 感謝としてアカウント。 詳細: Daya Guo et al、Deepseek-R1は、強化学習を通じてLLMSの推論を奨励します、…

問題を介して考えることを教えるAIモデル、人間は必要ありません

1758488557
2025-09-18 14:30:00

DeepSeek-R1の多段階パイプライン。クレジット: 自然 (2025)。 2:10.1038/s41586-025-09422-z

人工知能は毎日より賢くなっていますが、それでも制限があります。最大の課題の1つは、上級のAIモデルを推論することです。つまり、問題を段階的に解決することを意味します。しかし、新しい論文で 公開 ジャーナルで 自然、中国の人工知能会社であるDeepseek AIのチームは、人間の入力なしで自分自身でR1モデルを教えることができたと報告しています。

私たちの多くが問題を解決しようとするとき、私たちは通常、すぐに答えを得ることができません。解決策に到達するまで情報を収集し、メモを取ることを伴う可能性のある系統的なプロセスに従います。伝統的に、AIモデルのトレーニングは、私たちのアプローチのコピーが含まれていました。ただし、問題を解決する方法のAIモデルに数え切れないほどの例を示すのは、長く描かれたプロセスです。また、AIは与えられた例と同じくらい良いだけであり、人間のバイアスを拾うことができることを意味します。

Deepseek AIの研究者は、R1モデルをすべてのステップで表示する代わりに、Renforce Learningと呼ばれる手法を使用しました。報酬を使用して、この試行錯誤のアプローチ 正解、モデルがそれ自体を推論するように奨励しました。

「問題を解決する方法をモデルに明示的に教えるのではなく、適切なインセンティブを提供するだけで、高度な問題解決戦略を自律的に開発します」と研究者は論文に書いています。

DeepseekのR1モデルは、困難な数学、コーディング、科学の問題について訓練されました。それが受けた唯一の報酬は、その最終的な答えが正しかったという合図でした。そのトレーニング中、研究者は、独自の作業をチェックしたり、解決策を見つけるためのさまざまな戦略を調査するなどのスキルを開発したりしました。独自の思考プロセスを反映しているように、「待機」のような言葉を使い始めました。パスが正しい答えにつながった場合、その戦略は強化されました。それが間違っていた場合、モデルはそれを繰り返さないことを学びました。いくつかありました 人間の介入、しかし、その過程でR1のスキルを磨くためだけです。

問題を介して考えることを教えるAIモデル、人間は必要ありません

トレーニングプロセス全体のDeepSeek-R1-Zeroの精度と出力の長さ。クレジット: 自然 (2025)。 2:10.1038/s41586-025-09422-z

結果は印象的でした。 R1は、人間のガイダンスで訓練された古いモデルよりも、数学、コーディング、科学のタスクで優れたパフォーマンスを発揮しました。最も注目に値する結果の1つは、アメリカの招待数学試験(AIME)2024で86.7%の精度を達成したことです。これは、最も賢い高校生のための厳しい数学競争です。

これらの顕著な結果があっても、研究者は自分のモデルには機能するためのいくつかの制限があることを認めています。たとえば、英語以外のプロンプトが与えられたときに言語を混合し、必要よりも複雑ないくつかの簡単な問題を作成しました。しかし、これらの問題が解決されると、研究者は、それ自体を推論することができるAIモデルが、より有能で自律的なモデルの新しい時代につながると信じています。

私たちの著者によってあなたのために書かれています ポール・アーノルド、編集 リサロック、および事実確認され、レビューされました ロバート・イーガン– この記事は、慎重な人間の仕事の結果です。私たちはあなたのような読者に頼って、独立した科学ジャーナリズムを生かし続けます。この報告が重要な場合は、aを検討してください 寄付 (特に毎月)。あなたは得るでしょう 広告なし 感謝としてアカウント。

詳細:
Daya Guo et al、Deepseek-R1は、強化学習を通じてLLMSの推論を奨励します、 自然 (2025)。 2:10.1038/s41586-025-09422-z

Daphne Ippolito et al、AIは、試行錯誤を通じてその動作を示すことを学ぶことができます、 自然 (2025)。 2:10.1038/d41586-025-02703-7、 doi.org/10.1038/D41586-025-02703-7

©2025 Science X Network
お問い合わせ・広告・著作権・不具合に関するご連絡は [email protected] までメールでお願いします。

引用:問題を乗り越えることを教えるAIモデル、人間は必要ありません(2025年9月18日)2025年9月21日https://techxplore.com/news/2025-09-ai-problems-humans-required.htmlから取得

このドキュメントは著作権の対象となります。私的な研究や研究の目的のための公正な取引とは別に、書面による許可なしに再現される部分はありません。コンテンツは情報のみで提供されます。

#問題を介して考えることを教えるAIモデル人間は必要ありません

執筆者について: nipponese

Nipponese News編集部は、国内外のニュースを日本語で分かりやすくお届けします。