日本語版
最新ニュース
科学&テクノロジー

微調整とコンテキスト学習:新しい研究ガイドは、実際のタスクのためのより良いLLMカスタマイズ

業界をリードするAIカバレッジに関する最新のアップデートと排他的なコンテンツについては、毎日および毎週のニュースレターに参加してください。 もっと詳しく知る ダウンストリームタスク用の大規模な言語モデル(LLMS)をカスタマイズするための2つの一般的なアプローチは、微調整とコンテキスト内学習(ICL)です。で 最近の研究、Google DeepmindとStanford Universityの研究者は、これら2つの方法の一般化能力を調査しました。彼らは、ICLにはより大きな一般化能力があることを発見しました(ただし、推論中はより高い計算コストが発生します)。彼らはまた、両方の世界を最大限に活用するための新しいアプローチを提案しています。 調査結果は、特注のエンタープライズデータのLLMアプリケーションを構築する際に、開発者が重要な決定を下すのに役立ちます。 言語モデルが新しいトリックを学ぶ方法をテストします 微調整 事前に訓練されたLLMを採取し、小規模で専門のデータセットでさらにトレーニングすることを伴います。これにより、モデルの内部パラメーターを調整して、新しい知識やスキルを教えます。 コンテキスト学習 一方、(ICL)は、モデルの基礎となるパラメーターを変更しません。代わりに、入力プロンプト内で目的のタスクの例を直接提供することにより、LLMをガイドします。このモデルは、これらの例を使用して、新しい類似のクエリを処理する方法を把握します。 研究者は、これらの2つの方法を使用して、モデルが新しいタスクにどの程度一般化するかを厳密に比較することを目指しました。彼らは、想像上の家系図や架空の概念の階層など、複雑で自己整合的な構造を持つ「事実知識の制御された合成データセット」を構築しました。 モデルの新しい情報を学習する能力をテストするために、すべての名詞、形容詞、動詞をナンセンスな用語で置き換え、LLMがトレーニング前に遭遇したデータとの重複を回避しました。 その後、モデルはさまざまな一般化の課題でテストされました。たとえば、1つのテストが関係しています 単純な逆転。 「FEMPはGlonよりも危険である」というモデルが訓練された場合、「GlonはFEMPよりも危険ではない」と正しく推測できますか?に焦点を当てた別のテスト 単純な三段論法、論理的な控除の形態。 「すべてのグロンはヨンプ」と「すべてのトロフがグロン」と言われた場合、モデルは「すべてのトロフがヨムだ」と推測できますか?また、これらの構成された事実のより豊かな階層を備えた、より複雑な「セマンティック構造ベンチマーク」を使用して、より微妙な理解をテストしました。 「私たちの結果は、主に、モデルが新しい知識構造の微調整から控除と逆転に一般化する方法についての設定に焦点を当てています。微調整が企業固有の独自の情報に適応するために微調整された状況に明確な意味を持ち、Google Deepmindの研究科学者であり、紙の主任著者であるAndrew Lampinenは語りました。 パフォーマンスを評価するために、研究者は微調整されました ジェミニ1.5フラッシュ これらのデータセットで。 ICLの場合、彼らはテストの質問を提起する前に、命令チューニングモデルのコンテキストとしてトレーニングデータセット(または大きなサブセット)を供給しました。 結果は、データが一致する設定では、ICLが標準の微調整よりも優れた一般化につながったことを一貫して示しました。 ICLを使用したモデルは、一般に、関係の逆転や提供されたコンテキストから論理的な控除を行うなどのタスクで優れていました。微調整やICLを使用せずに、事前に訓練されたモデルのパフォーマンスが低く、テストデータの斬新さを示しました。 「考慮すべき主なトレードオフの1つは、ICLが微調整を必要としない(トレーニングコストを節約する)が、モデルに追加のコンテキストを提供する必要があるため、一般的に使用すると、一般的により計算上の高価であるということです」とLampinen氏は述べています。 「一方、ICLは、評価したデータセットとモデルの一般化を改善する傾向があります。」 ハイブリッドアプローチ:微調整の増強 ICLが柔軟な一般化に優れているという観察に基づいて、研究者は微調整を強化する新しい方法を提案しました。コアのアイデアは、LLM独自のICL機能を使用して、より多様で豊かな推測の例を生成し、これらの拡張例を微調整に使用するデータセットに追加することです。 彼らは、2つの主要なデータ増強戦略を調査しました。 a ローカル戦略:このアプローチは、個々の情報に焦点を当てています。 LLMは、トレーニングデータから単一文を言い換えるか、逆転の生成など、それらから直接的な推論を引き出すように求められています。 a グローバル戦略:LLMにはコンテキストとして完全なトレーニングデータセットが与えられ、特定のドキュメントまたは事実を提供された情報の残りの部分とリンクすることにより、推論を生成するように求められ、関連する推論の推論が長くなります。…

微調整とコンテキスト学習:新しい研究ガイドは、実際のタスクのためのより良いLLMカスタマイズ
1746899672 2025-05-10 00:23:00

業界をリードするAIカバレッジに関する最新のアップデートと排他的なコンテンツについては、毎日および毎週のニュースレターに参加してください。 もっと詳しく知る


ダウンストリームタスク用の大規模な言語モデル(LLMS)をカスタマイズするための2つの一般的なアプローチは、微調整とコンテキスト内学習(ICL)です。で 最近の研究、Google DeepmindとStanford Universityの研究者は、これら2つの方法の一般化能力を調査しました。彼らは、ICLにはより大きな一般化能力があることを発見しました(ただし、推論中はより高い計算コストが発生します)。彼らはまた、両方の世界を最大限に活用するための新しいアプローチを提案しています。

調査結果は、特注のエンタープライズデータのLLMアプリケーションを構築する際に、開発者が重要な決定を下すのに役立ちます。

言語モデルが新しいトリックを学ぶ方法をテストします

微調整 事前に訓練されたLLMを採取し、小規模で専門のデータセットでさらにトレーニングすることを伴います。これにより、モデルの内部パラメーターを調整して、新しい知識やスキルを教えます。 コンテキスト学習 一方、(ICL)は、モデルの基礎となるパラメーターを変更しません。代わりに、入力プロンプト内で目的のタスクの例を直接提供することにより、LLMをガイドします。このモデルは、これらの例を使用して、新しい類似のクエリを処理する方法を把握します。

研究者は、これらの2つの方法を使用して、モデルが新しいタスクにどの程度一般化するかを厳密に比較することを目指しました。彼らは、想像上の家系図や架空の概念の階層など、複雑で自己整合的な構造を持つ「事実知識の制御された合成データセット」を構築しました。

モデルの新しい情報を学習する能力をテストするために、すべての名詞、形容詞、動詞をナンセンスな用語で置き換え、LLMがトレーニング前に遭遇したデータとの重複を回避しました。

その後、モデルはさまざまな一般化の課題でテストされました。たとえば、1つのテストが関係しています 単純な逆転。 「FEMPはGlonよりも危険である」というモデルが訓練された場合、「GlonはFEMPよりも危険ではない」と正しく推測できますか?に焦点を当てた別のテスト 単純な三段論法、論理的な控除の形態。 「すべてのグロンはヨンプ」と「すべてのトロフがグロン」と言われた場合、モデルは「すべてのトロフがヨムだ」と推測できますか?また、これらの構成された事実のより豊かな階層を備えた、より複雑な「セマンティック構造ベンチマーク」を使用して、より微妙な理解をテストしました。

「私たちの結果は、主に、モデルが新しい知識構造の微調整から控除と逆転に一般化する方法についての設定に焦点を当てています。微調整が企業固有の独自の情報に適応するために微調整された状況に明確な意味を持ち、Google Deepmindの研究科学者であり、紙の主任著者であるAndrew Lampinenは語りました。

パフォーマンスを評価するために、研究者は微調整されました ジェミニ1.5フラッシュ これらのデータセットで。 ICLの場合、彼らはテストの質問を提起する前に、命令チューニングモデルのコンテキストとしてトレーニングデータセット(または大きなサブセット)を供給しました。

結果は、データが一致する設定では、ICLが標準の微調整よりも優れた一般化につながったことを一貫して示しました。 ICLを使用したモデルは、一般に、関係の逆転や提供されたコンテキストから論理的な控除を行うなどのタスクで優れていました。微調整やICLを使用せずに、事前に訓練されたモデルのパフォーマンスが低く、テストデータの斬新さを示しました。

「考慮すべき主なトレードオフの1つは、ICLが微調整を必要としない(トレーニングコストを節約する)が、モデルに追加のコンテキストを提供する必要があるため、一般的に使用すると、一般的により計算上の高価であるということです」とLampinen氏は述べています。 「一方、ICLは、評価したデータセットとモデルの一般化を改善する傾向があります。」

ハイブリッドアプローチ:微調整の増強

ICLが柔軟な一般化に優れているという観察に基づいて、研究者は微調整を強化する新しい方法を提案しました。コアのアイデアは、LLM独自のICL機能を使用して、より多様で豊かな推測の例を生成し、これらの拡張例を微調整に使用するデータセットに追加することです。

彼らは、2つの主要なデータ増強戦略を調査しました。

  1. a ローカル戦略:このアプローチは、個々の情報に焦点を当てています。 LLMは、トレーニングデータから単一文を言い換えるか、逆転の生成など、それらから直接的な推論を引き出すように求められています。
  2. a グローバル戦略:LLMにはコンテキストとして完全なトレーニングデータセットが与えられ、特定のドキュメントまたは事実を提供された情報の残りの部分とリンクすることにより、推論を生成するように求められ、関連する推論の推論が長くなります。

これらの拡張データセットでモデルが微調整されたとき、利益は重要でした。これにより、微調整が拡張された微調整により、一般化が大幅に改善され、標準的な微調整だけでなく、単純なICLも優れています。

「たとえば、会社の文書の1つが「XYZはデータを分析するための内部ツールである」と書かれている場合、我々の結果は、ICLと拡張されたFinetuningがモデルが「データ分析のための内部ツールが存在するもの」などの関連する質問に答えるのにより効果的であることを示唆しています」とLampinen氏は述べています。

このアプローチは、企業にとって魅力的な道を提供します。これらのICL支援データセットの作成に投資することにより、開発者はより強力な一般化能力を示す微調整モデルを構築できます。

これにより、大規模なコンテキストインプロンプトに関連する継続的な推論時間コストを発生させることなく、多様で実世界の入力により優れたパフォーマンスを発揮する、より堅牢で信頼性の高いLLMアプリケーションにつながる可能性があります。

「微調整された微調整は、一般に、データを拡張するためにICLの追加ステップが必要であり、その後微調整が必要なため、モデルの微調整プロセスをより高価にするでしょう」とLampinen氏は言います。 「その追加コストが改善された一般化によって価値があるかどうかは、特定のユースケースに依存します。ただし、モデルの多くの用途に償却すると、モデルが使用されるたびにICLを適用するよりも計算的に安価です。」

Lampinenは、研究したコンポーネントがさまざまな設定でどのように相互作用するかを確認するためにさらなる研究が必要であると指摘しましたが、彼らの調査結果は、開発者が微調整だけで不十分なパフォーマンスを見る場合に増強された微調整を検討することを検討したいと考えていると付け加えました。

「最終的に、この作業が、基礎モデルにおける学習と一般化を理解する科学と、それらを下流のタスクに適応させる実用性に貢献することを願っています」とランピネンは言いました。

#微調整とコンテキスト学習新しい研究ガイドは実際のタスクのためのより良いLLMカスタマイズ
執筆者について: nipponese

Nipponese News編集部は、国内外のニュースを日本語で分かりやすくお届けします。