1751601066
2025-07-03 22:00:00
日本のAIラボ サマン 複数の大規模な言語モデル(LLM)が単一のタスクに協力できるようにする新しい手法を導入し、AIエージェントの「ドリームチーム」を効果的に作成しました。呼び出された方法 Multi-llm AB-MCTS、モデルが試行錯誤を実行し、独自の強みを組み合わせて、個々のモデルには複雑すぎる問題を解決できるようにします。
企業にとって、このアプローチは、より堅牢で有能なAIシステムを開発する手段を提供します。単一のプロバイダーまたはモデルにロックされる代わりに、企業はさまざまなフロンティアモデルの最良の側面を動的に活用し、タスクの適切な部分に適切なAIを割り当てて、優れた結果を達成できます。
集合的知性の力
フロンティアAIモデルは急速に進化しています。ただし、各モデルには、独自のトレーニングデータとアーキテクチャから派生した独自の明確な長所と短所があります。コーディングで優れているかもしれませんが、別の人はクリエイティブライティングに優れています。 Sakana Aiの研究者は、これらの違いはバグではなく機能であると主張しています。
「私たちはこれらのバイアスとさまざまな適性を制限としてではなく、集合的な知性を作成するための貴重なリソースとして見ています」と研究者は彼らの中に述べています。 ブログ投稿。彼らは、人類の最大の成果が多様なチームから来るように、AIシステムも一緒に働くことでより多くを達成できると信じています。 「知性をプールすることにより、AI Systemsは、単一のモデルに乗り越えられない問題を解決できます。」
推論の時間に長く考えます
Sakana AIの新しいアルゴリズムは、「テスト時間スケーリング」と呼ばれる「推論時のスケーリング」手法であり、過去1年で非常に人気のある研究分野です。 AIの焦点の大部分は「トレーニングタイムスケーリング」(モデルを大きくし、より大きなデータセットでトレーニングする)にありますが、推論時間スケーリングは、モデルがすでにトレーニングされた後により多くの計算リソースを割り当てることでパフォーマンスを向上させます。
一般的なアプローチの1つは、強化学習を使用してモデルを促し、OpenAI O3やDeepSeek-R1などの一般的なモデルで見られるように、より長く、より詳細なチェーン(COT)シーケンスを生成することです。もう1つのよりシンプルな方法は、繰り返しサンプリングであり、モデルには同じプロンプトが複数回与えられ、ブレーンストーミングセッションと同様に、さまざまな潜在的なソリューションを生成します。 Sakana Aiの作品は、これらのアイデアを組み合わせて進めます。
「当社のフレームワークは、よりスマートでより戦略的なバージョンのBest-of-N(別名、繰り返しサンプリング)を提供します」と、Sakana AIの研究科学者であり論文の共著者であるTakuya AkibaはVentureBeatに語りました。 「RLを介した長いCOTのような推論手法を補完します。検索戦略と適切なLLMを動的に選択することにより、このアプローチは限られた数のLLMコール内でパフォーマンスを最大化し、複雑なタスクのより良い結果を提供します。」
適応分岐検索の仕組み
新しい方法のコアは、Adaptive Branching Monte Carlo Tree Search(AB-MCTS)と呼ばれるアルゴリズムです。これにより、LLMは、「より深く検索」と「より広く検索」という2つの異なる検索戦略をインテリジェントにバランスさせることにより、試行錯誤を効果的に実行できます。より深く検索するには、有望な答えを得て繰り返し改良することが含まれますが、より広いことを検索することは、まったく新しいソリューションをゼロから生成することを意味します。 AB-MCTSはこれらのアプローチを組み合わせて、システムが良いアイデアを改善するだけでなく、行き止まりにヒットしたり、別の有望な方向を発見したりした場合に新しいことを試してみることができます。
これを達成するために、システムは使用します モンテカルロツリー検索 (MCT)、DeepMindのアルファゴが有名に使用する意思決定アルゴリズム。各ステップで、AB-MCTSは確率モデルを使用して、既存のソリューションを改良するか、新しいソリューションを生成するかを決定するかどうかを決定します。
さまざまなテスト時間スケーリング戦略出典:Sakana AI
研究者は、マルチLLM AB-MCTSでこれをさらに一歩踏み出しました。これは、「何をするか」と決定するだけでなく、「どの」LLMがそれを行うべきかを決定します。タスクの開始時に、システムは問題に最適なモデルがわかりません。利用可能なLLMのバランスの取れたミックスを試してみることから始め、進行するにつれて、どのモデルがより効果的であるかを学び、時間の経過とともにより多くのワークロードを割り当てます。
ai ‘dream team’をテストにします
研究者は、マルチLLM AB-MCTSシステムをテストしました ARC-AGI-2ベンチマーク。 ARC(抽象化と推論コーパス)は、新しい視覚的推論の問題を解決する人間のような能力をテストするように設計されており、AIにとって難しいことで有名です。
チームは、O4-Mini、Gemini 2.5 Pro、Deepseek-R1などのフロンティアモデルの組み合わせを使用しました。
モデルの集団は、120のテスト問題の30%以上の正しいソリューションを見つけることができました。これは、単独で動作するモデルのいずれかを大幅に上回るスコアです。このシステムは、特定の問題に最適なモデルを動的に割り当てる能力を実証しました。ソリューションへの明確なパスが存在するタスクでは、アルゴリズムが最も効果的なLLMを迅速に識別し、より頻繁に使用しました。
AB-MCTS対個々のモデル出典:Sakana AI
AB-MTCSは、問題を解決するさまざまな段階で異なるモデルを選択できます。ソース:Sakana AI
「各モデルの個々の長所と短所に加えて、幻覚の傾向はそれらの間で大きく異なる可能性があります」とアキバは言いました。 「幻覚を起こす可能性が低いモデルでアンサンブルを作成することにより、強力な論理能力と強力な接地を両方の最高の世界を達成することが可能になる可能性があります。幻覚はビジネスの文脈における主要な問題であるため、このアプローチは緩和に役立つ可能性があります。」
研究から現実世界のアプリケーションまで
開発者と企業がこの手法を適用するのを支援するために、Sakana AIは基礎となるアルゴリズムをオープンソースのフレームワークとしてリリースしました TreeQuest、Apache 2.0ライセンス(商業目的で使用可能)で入手できます。 TreeQuestは柔軟なAPIを提供し、ユーザーがカスタムスコアリングとロジックを備えた独自のタスクにマルチLLM AB-MCTを実装できるようにします。
「私たちは特定のビジネス指向の問題にAB-MCTを適用する初期段階にいる間、私たちの研究はいくつかの分野で重要な可能性を明らかにしています」とAkibaは言いました。
ARC-AGI-2ベンチマークを超えて、チームは複雑なアルゴリズムコーディングなどのタスクにAB-MCTを正常に適用し、機械学習モデルの精度を改善することができました。
「AB-MCTは、既存のソフトウェアのパフォーマンスメトリックを最適化するなど、反復的な試行錯誤を必要とする問題に対しても非常に効果的です」とAkiba氏は述べています。 「たとえば、Webサービスの応答遅延を改善する方法を自動的に見つけるために使用できます。」
実用的でオープンソースツールのリリースは、より強力で信頼できるエンタープライズAIアプリケーションの新しいクラスへの道を開く可能性があります。
毎日VBでのビジネスユースケースに関する毎日の洞察
上司を感動させたい場合は、VB Dailyがカバーしています。規制上のシフトから実際の展開まで、企業が生成AIで行っていることについて内部のスクープを提供するので、最大のROIの洞察を共有できます。
購読してくれてありがとう。こちらのVBニュースレターをご覧ください。
エラーが発生しました。

#sakana #ais #treequest個々のLLMを30上回るマルチモデルチームを展開する