1752708817
2025-07-16 17:35:00
大規模な言語モデル(LLM)は、数秒で複雑なパズルを解決できますが、単純な会話に苦労することもあります。これらのAIツールが仮定したり、重要な詳細を見落としたり、明確な質問をすることを怠ったりすると、結果は信頼を侵食し、ニュアンスがすべてである現実世界の相互作用を脱線させることができます。
これらのモデルがこのように振る舞う主な理由は、それらがどのように訓練および評価されているかにあります。ほとんどのベンチマークは、明確な命令を備えた孤立した一枚のプロンプトを使用しています。トレーニング方法は、成功したマルチターン交換への貢献ではなく、モデルの次の応答に最適化する傾向があります。しかし、実際の相互作用は動的で共同作業です。コンテキスト、説明、共有理解に依存しています。
トレーニングへのユーザー中心のアプローチ
これに対処するために、ユーザーを念頭に置いてLLMSをトレーニングする方法を模索しています。私たちのアプローチは、実際の会話の前後の性質を反映するシミュレートされた環境にモデルを配置します。強化学習を通じて、これらのモデルは試行錯誤を通じて改善します。たとえば、質問をする時期や、さまざまな状況にトーンとコミュニケーションスタイルを適応させる方法を学習します。このユーザー中心のアプローチは、LLMが通常どのように訓練されているかと人々が実際に使用する方法との間のギャップを埋めるのに役立ちます。
これが背後にある概念です Collablm (新しいタブで開きます)、anの受信者 ICML (新しいタブで開きます) 優れた紙賞 (新しいタブで開きます)。このトレーニングフレームワークは、図1に示すように、シミュレートされたマルチターン相互作用を通じてLLMSが改善するのに役立ちます。Collllmの背後にあるコアの洞察は簡単です。建設的なコラボレーションでは、応答の価値は、その即時の有用性だけでなく、会話の全体的な成功に貢献する方法に貢献します。明確な質問は遅延のように思えるかもしれませんが、しばしばより良い結果につながります。簡単な答えは有用に見えるかもしれませんが、混乱を引き起こしたり、相互作用を脱線させたりすることがあります。

Collablmは、この共同アプローチを図2に示すシミュレーションベースのトレーニングループを使用して実践します。会話の任意の時点で、モデルはシミュレートされたユーザーとの対話を行うことにより、複数の可能な次のターンを生成します。

システムはサンプリング方法を使用して、会話ターンごとに会話ターンを拡張し、各参加者(AIエージェントまたはシミュレートされたユーザー)の可能性のある応答を選択し、レンダム性を追加して会話パスを変化させます。目標は、モデルをさまざまな会話シナリオにさらすことであり、より効果的なコラボレーション戦略を学ぶのを支援することです。
ポッドキャストシリーズ
医学におけるAI革命、再訪
MicrosoftのPeter Leeに参加して、AIがヘルスケアにどのような影響を与え、医学の将来にとって何を意味するかを発見してください。
シミュレートされた各会話に、Multiturn-Aware Reward(MR)関数を適用しました。これにより、指定されたターンでのモデルの応答が会話の軌跡全体にどのように影響するかを評価します。声明、提案、質問など、モデルからの複数の会話のフォローアップをサンプリングし、MRを使用して、後のターンで会話がどれだけうまく機能したかに基づいてそれぞれに報酬を割り当てました。これらのスコアは、目標完了、会話効率、ユーザーエンゲージメントなどの重要な要因を反映する自動化されたメトリックに基づいています。
サンプリングされた会話を獲得するために、効率的でスケーラブルな評価をサポートするLLM-A-A-Judgeフレームワークのタスク固有のメトリックとメトリックを使用しました。エンゲージメントなどの指標の場合、裁判官モデルは、サンプリングされた各会話を0から1のスケールで評価します。
各モデル応答のMRは、サンプリングされた会話のスコアを平均してモデル応答から発信することによって計算されました。スコアに基づいて、モデルは、近位ポリシー最適化(PPO)や直接選好最適化(DPO)などの確立された強化学習アルゴリズムを使用して、そのパラメーターを更新します。
自動化された評価と人間の評価の組み合わせを通じてCollabllmをテストしました。 紙。ハイライトの1つは、図3に示すドキュメントの共同創造タスクの201人の参加者が関与するユーザー調査です。コラブラインを、単一ターンの報酬で訓練されたベースラインと、明確な質問をして他の積極的な手順を実行するように促された2番目の積極的なベースラインを比較しました。 Collablmは両方を上回り、高品質のドキュメント、より良い相互作用評価、およびタスクの完了時間を速く作成しました。

現実世界のコラボレーションのための設計
今日のAIの研究の多くは、完全に自動化されたタスク、ユーザーからの入力ややり取りなしで動作するモデル、モデルに焦点を当てています。しかし、多くの現実世界のアプリケーションは、ユーザー、協力者、または意思決定者として、ループ内の人々に依存しています。ユーザーの入力を制約としてではなく、不可欠なものとして扱うAIシステムを設計すると、より正確で、より役立ち、最終的にはより信頼できるシステムにつながります。
この作業は、核となる信念によって推進されています。AIの未来は、知性だけでなく、効果的に協力する能力に依存しています。そして、それは今日のシステムのコミュニケーションの内訳に立ち向かうことを意味します。
Collabllmは、その方向へのステップとして、意味のあるマルチターン相互作用に従事するモデルをトレーニングし、質問を明確にし、コンテキストに適応することをトレーニングします。そうすることで、動作するように設計されたシステムを構築できます と 人々 – 彼らの周りではありません。
#Collablmユーザーと協力するようにLLMを教える