日本語版
最新ニュース
世界

Microsoft Research が rStar-Math を発表: 小規模言語モデルにおける数学的推論の進歩

Microsoft Researchが発表 rスターマス、OpenAI の o1-mini などのより大きなモデルと同等、場合によってはそれを超える数学的推論機能を実現する小規模言語モデル (SLM) の能力を実証するフレームワークです。これは、より高度なモデルを必要とせずに実現され、AI の推論機能を強化するための新しいアプローチを表します。 rStar-Math の中核には、モンテカルロ ツリー検索 (MCTS) として知られる手法があり、SLM が段階的に推論を反復できるようになります。 このプロセスは、同じく SLM に基づいた報酬モデルによって導かれ、中間ステップの品質を評価し、推論パスを洗練します。 rStar-Math は、自己進化のプロセスを通じて、モデルとトレーニング データの品質の両方を継続的に改善しています。 コード拡張された CoT データ合成: この方法では、MCTS ロールアウトを使用して、検証された中間ステップを含む推論軌跡を生成します。 Python コードの実行によりこれらのステップが検証され、高品質のトレーニング データが保証されます。 プロセス優先モデル (PPM): ノイズの多い報酬アノテーションに依存する代わりに、rStar-Math は MCTS ロールアウトからの Q 値を使用して、PPM をトレーニングするための優先ペアを作成します。このアプローチにより、ステップ品質を効果的に評価するモデルの機能が向上します。…

Microsoft Research が rStar-Math を発表: 小規模言語モデルにおける数学的推論の進歩

1737614299
2025-01-23 06:00:00

Microsoft Researchが発表 rスターマス、OpenAI の o1-mini などのより大きなモデルと同等、場合によってはそれを超える数学的推論機能を実現する小規模言語モデル (SLM) の能力を実証するフレームワークです。これは、より高度なモデルを必要とせずに実現され、AI の推論機能を強化するための新しいアプローチを表します。

rStar-Math の中核には、モンテカルロ ツリー検索 (MCTS) として知られる手法があり、SLM が段階的に推論を反復できるようになります。 このプロセスは、同じく SLM に基づいた報酬モデルによって導かれ、中間ステップの品質を評価し、推論パスを洗練します。 rStar-Math は、自己進化のプロセスを通じて、モデルとトレーニング データの品質の両方を継続的に改善しています。

  • コード拡張された CoT データ合成: この方法では、MCTS ロールアウトを使用して、検証された中間ステップを含む推論軌跡を生成します。 Python コードの実行によりこれらのステップが検証され、高品質のトレーニング データが保証されます。
  • プロセス優先モデル (PPM): ノイズの多い報酬アノテーションに依存する代わりに、rStar-Math は MCTS ロールアウトからの Q 値を使用して、PPM をトレーニングするための優先ペアを作成します。このアプローチにより、ステップ品質を効果的に評価するモデルの機能が向上します。
  • 自己進化フレームワーク: rStar-Math は 4 回の反復にわたって、747,000 個の数学問題のデータセットから開始して、将来のトレーニング ラウンドに向けてますます洗練されたデータを生成しながら、段階的に優れたポリシーと報酬モデルをトレーニングします。

rStar-Math は複数の数的推論ベンチマークで評価され、SLM パフォーマンスの顕著な向上が実証されています。たとえば、 Qwen2.5-数学-7B モデルは MATH ベンチマークでの精度が 58.8% から 90.0% に向上し、パフォーマンスを上回りました。 OpenAI の o1 プレビュー モデル 4.5%増加しました。で 米国数学オリンピック (AIME)rStar-Math は 53.3% の成功率を達成し、15 問題中平均 8 問題を解決しました。

このアプローチに対し、コミュニティメンバーは と述べた:

非常に印象的です。Q 値を注釈として使用するシンプルさが気に入っています。ある種の飽和限界として 64 の軌道について言及していますが、それは正しいですか、それともこのアプローチをさらに拡大しようとしていなかっただけですか?

リー・リナ・チャン、 の1つ の著者、 明確化された:

ありがとう! AIME などの難しい数学ベンチマークでは、64 の軌道でパフォーマンスがほぼ飽和します。大学数学の場合、パフォーマンスは着実に向上し続けています。ただし、検索コストが増加するため、64 を超えるスケールにはしませんでした。私たちは、追加のオリンピック レベルの数学問題を合成してポリシー モデルとプロセス報酬モデルの両方を改善することで、AIME のパフォーマンスをさらに向上できると考えています。これは今後の課題として残しておきます。

rStar-Math は、オープンソース プロジェクトとして入手できます。 GitHub MITライセンスの下で。これにより、研究者やエンジニアは、AI システムの数学的推論能力を評価および改善するためのフレームワークを探索および利用できるようになります。

#Microsoft #Research #が #rStarMath #を発表 #小規模言語モデルにおける数学的推論の進歩

執筆者について: nipponese

Nipponese News編集部は、国内外のニュースを日本語で分かりやすくお届けします。