日本語版
最新ニュース
世界

「微調整」とは正確には何ですか、そしてなぜAIでそんなに重要なのですか? | SIAM | 2025年7月

ご存知のように、Meta、Google、Openai、Microsoftなどの革新的な企業によってリリースされた、Llama 3、Mistral、Gemini、GPT-4O、PHIなどの多くの強力なモデルがあります。これらのいくつかはオープンソースであり、開発者がそれらを構築するように招待していますが、他の開発者は閉じたソースであり、洗練された製品のように提供されています。これらの信じられないほどのモデルは、私たちが事前に訓練を受けたものです。インターネット、書籍、その他のソースからテキスト、画像、オーディオを含む大量のデータについてトレーニングされています。このトレーニング前のプロセスは、GPT-4oのようなモデルに、あなたが考えることができるほぼすべてのトピックについて書き、推論し、会話する能力を与えるものです。それは一般的なモデルであり、すべてでうまく機能します。これが問題の上昇です。特定のタスクのモデルが必要な場合はどうなりますか?非常に具体的です。会社のカスタマーサービスを処理したり、医療X線画像を分析したりする専門家ですか? GPT-4Oのような人気モデルを展開して、完全に機能することを期待できますか?おそらくそうではありません。 GPT-4oは、製品の具体的な詳細を知りません。放射線科医になるように訓練されていることは確かです。専門的なタスクに汎用モデルに依存すると、情報が誤っていて信頼できないパフォーマンスにつながる可能性があります。それは良い出発点ですが、あなたが必要とする専門家ではありません。これは、微調整が始まる場所です。微調整とは、事前に訓練されたモデルを取得し、より小さな特定のデータセットでトレーニングするプロセスです。特定のタスクのみ。たとえば、お気に入りの著者の正確なスタイルで書いているAIが欲しいと想像してください。一般的なモデルは近づくかもしれませんが、完璧ではありません。その著者の著作のデータセットでそのモデルを微調整することで、信じられないほどの正確さで正確なスタイル、文の構造、語彙を学ぶことができます。あなたはあなたの正確なニーズに合うようにモデルの動作を形作っています。かっこいいね?(カーテンの後ろで何が起こっているのか興味がない場合は、以下のこのセクションをスキップしてください)あなたは「わかりました、それで私たちはそれをもっと多くのデータに与えているだけですか?」と考えているかもしれません。はい、しかし、このプロセスははるかに深く、技術的に魅力的です。私たちは単にそれにもっと多くのデータを与えるだけではありません。事前に訓練されたモデルは、数十億のパラメーターまたは「重み」を備えた複雑なニューラルネットワーク(多くの場合、変圧器アーキテクチャ)です。これらのウェイトは、モデルの知識を定義するノブとダイヤルと考えてください。大規模なデータセットでの事前トレーニングは、これらの重みを調整して、言語、論理、およびパターンの一般的な理解をキャプチャします。このモデルを微調整すると、新しいタスク固有のデータセットでトレーニングプロセスを継続します。モデルの既存の知識は、大規模な頭のスタートを与えます。ゼロから学ぶ代わりに、専門化するパラメーターを調整するだけです。この調整は、新しいデータで予測を行い、それらの予測がどれほど「間違っている」か(「損失」」であるかを計算し、その重みを微妙に変更して、次回の予測を改善することで発生します。 これを行うためのいくつかの一般的な方法は次のとおりです。完全な微調整:これは伝統的なアプローチです。トレーニング中、モデルのすべてのパラメーターはすべて「ロック解除」され、更新されます。この方法は、モデル全体が新しいタスクに適応できるため、非常に効果的です。しかし、それは非常に厳しいものであり、膨大な量の計算能力(複数のハイエンドGPU)とメモリが必要です。それは脳全体を再訓練するようなものです。パラメーター効率の高い微調整(PEFT):これは、より新しい、ゲームを変えるテクニックファミリです。 PEFTの中心的なアイデアは、事前に訓練されたモデルの重量のほとんどを凍結し、非常に少数の新しいパラメーターまたは既存のパラメーターのみを訓練することです。これにより、計算コストが大幅に削減されます。最も人気のあるPEFTメソッドの2つは次のとおりです。LORA(低ランクの適応):モデルの巨大な重量マトリックスを更新する代わりに、LORAはモデルのレイヤーにはるかに小さく「アダプター」マトリックスを挿入します。これらの小さなアダプターのみが訓練されています。元のウェイトは凍結されているため、モデルはすべての一般的な知識を保持し、アダプターは新しいタスクの詳細を学習します。それは、コアの知識を変えることなく、専門家に新しい専門的なツールを与えるようなものです。Qlora(量子化されたLORA):この方法は、効率がさらに一歩進んでいます。事前に訓練された大規模なモデルを使用して量子化するため、モデルの重みの精度(16ビットから4ビット数から4ビット数まで)を減らすことを意味します。これにより、モデルのメモリフットプリントが劇的に縮小します。次に、LORA技術を適用して、この小さく、量子化されたモデルを微調整します。その結果、単一の消費者グレードGPUでモデルを微調整できます。最終的に、モデルは、トレーニング前と同様に、Backpropagationと学習率オプティマイザーを介して損失関数を最小限に抑えることで学習します。しかし、スコープは非常に狭く、出発点が非常に高度であるため、このプロセスは、モデルをゼロからトレーニングするよりも桁違いに高速で安価です。さて、大きな質問:あなたはあなた自身のモデルを微調整するべきですか?答えは、技術の多くのことと同様に、次のとおりです。 *それは依存します。 *なぜそれが価値があるのか(プロ)比類のないパフォーマンス:特定のタスクの場合、微調整されたモデルはほとんどの場合、汎用モデルを上回ります。より正確で信頼性が高く、ドメインに直接関連する回答を提供します。データプライバシーと制御:機密データまたは独自のデータ(顧客情報、内部ドキュメントなど)を扱っている場合、サードパーティAPIに送信することはできません。独自のインフラストラクチャでオープンソースモデルを微調整すると、データを安全に保ちます。幻覚の削減:モデルは狭い領域の専門家であるため、「幻覚」したり、誤った情報を作ったりする可能性ははるかに低くなります。その知識は、特定のデータセットで正確に訓練されています。大規模な費用対効果:前払いコストはありますが、特に大量のアプリケーションでは、大規模な商業モデルへの数百万のAPI呼び出しに支払うよりも、独自の微調整モデルを実行することは長期的には安価になります。なぜそうでないのか(短所)複雑さとコスト:Qloraのような方法にもかかわらず、微調整にはまだ技術的な専門知識、優れたGPU、および時間が必要です。ワンクリックプロセスではありません。データは重要です。微調整の成功は、トレーニングデータの品質に完全に依存します。データセットが小さい、ノイズが大きい、またはフォーマットが不十分な場合は、結果が不十分です(「ごみ、ごみ」)。過度に適合するリスク:モデルを専門化することができ、一般的な推論能力の一部、「壊滅的な忘却」として知られる問題が失われる可能性があります。迅速なエンジニアリングで十分かもしれません。時には、タスクのために調整されたモデルを必要としない場合があります。 GPT-4Oのような強力なベースモデルは、多くの場合、巧妙で詳細なプロンプト(これは「コンテキスト学習」と呼ばれます)で優れた結果を達成できます。微調整にジャンプする前に、常にプロンプトを改善してみてください。 #微調整とは正確には何ですかそしてなぜAIでそんなに重要なのですか #SIAM #2025年7月

「微調整」とは正確には何ですか、そしてなぜAIでそんなに重要なのですか? | SIAM | 2025年7月

1753195611
2025-07-22 14:39:00

ご存知のように、Meta、Google、Openai、Microsoftなどの革新的な企業によってリリースされた、Llama 3、Mistral、Gemini、GPT-4O、PHIなどの多くの強力なモデルがあります。これらのいくつかはオープンソースであり、開発者がそれらを構築するように招待していますが、他の開発者は閉じたソースであり、洗練された製品のように提供されています。

これらの信じられないほどのモデルは、私たちが事前に訓練を受けたものです。インターネット、書籍、その他のソースからテキスト、画像、オーディオを含む大量のデータについてトレーニングされています。このトレーニング前のプロセスは、GPT-4oのようなモデルに、あなたが考えることができるほぼすべてのトピックについて書き、推論し、会話する能力を与えるものです。それは一般的なモデルであり、すべてでうまく機能します。

これが問題の上昇です。
特定のタスクのモデルが必要な場合はどうなりますか?非常に具体的です。会社のカスタマーサービスを処理したり、医療X線画像を分析したりする専門家ですか? GPT-4Oのような人気モデルを展開して、完全に機能することを期待できますか?

おそらくそうではありません。 GPT-4oは、製品の具体的な詳細を知りません。放射線科医になるように訓練されていることは確かです。専門的なタスクに汎用モデルに依存すると、情報が誤っていて信頼できないパフォーマンスにつながる可能性があります。それは良い出発点ですが、あなたが必要とする専門家ではありません。

これは、微調整が始まる場所です。

微調整とは、事前に訓練されたモデルを取得し、より小さな特定のデータセットでトレーニングするプロセスです。特定のタスクのみ。たとえば、お気に入りの著者の正確なスタイルで書いているAIが欲しいと想像してください。一般的なモデルは近づくかもしれませんが、完璧ではありません。その著者の著作のデータセットでそのモデルを微調整することで、信じられないほどの正確さで正確なスタイル、文の構造、語彙を学ぶことができます。あなたはあなたの正確なニーズに合うようにモデルの動作を形作っています。かっこいいね?

(カーテンの後ろで何が起こっているのか興味がない場合は、以下のこのセクションをスキップしてください)

あなたは「わかりました、それで私たちはそれをもっと多くのデータに与えているだけですか?」と考えているかもしれません。はい、しかし、このプロセスははるかに深く、技術的に魅力的です。私たちは単にそれにもっと多くのデータを与えるだけではありません。

事前に訓練されたモデルは、数十億のパラメーターまたは「重み」を備えた複雑なニューラルネットワーク(多くの場合、変圧器アーキテクチャ)です。これらのウェイトは、モデルの知識を定義するノブとダイヤルと考えてください。大規模なデータセットでの事前トレーニングは、これらの重みを調整して、言語、論理、およびパターンの一般的な理解をキャプチャします。

このモデルを微調整すると、新しいタスク固有のデータセットでトレーニングプロセスを継続します。モデルの既存の知識は、大規模な頭のスタートを与えます。ゼロから学ぶ代わりに、専門化するパラメーターを調整するだけです。この調整は、新しいデータで予測を行い、それらの予測がどれほど「間違っている」か(「損失」」であるかを計算し、その重みを微妙に変更して、次回の予測を改善することで発生します。
これを行うためのいくつかの一般的な方法は次のとおりです。

  • 完全な微調整:これは伝統的なアプローチです。トレーニング中、モデルのすべてのパラメーターはすべて「ロック解除」され、更新されます。この方法は、モデル全体が新しいタスクに適応できるため、非常に効果的です。しかし、それは非常に厳しいものであり、膨大な量の計算能力(複数のハイエンドGPU)とメモリが必要です。それは脳全体を再訓練するようなものです。
  • パラメーター効率の高い微調整(PEFT):これは、より新しい、ゲームを変えるテクニックファミリです。 PEFTの中心的なアイデアは、事前に訓練されたモデルの重量のほとんどを凍結し、非常に少数の新しいパラメーターまたは既存のパラメーターのみを訓練することです。これにより、計算コストが大幅に削減されます。最も人気のあるPEFTメソッドの2つは次のとおりです。
  1. LORA(低ランクの適応):モデルの巨大な重量マトリックスを更新する代わりに、LORAはモデルのレイヤーにはるかに小さく「アダプター」マトリックスを挿入します。これらの小さなアダプターのみが訓練されています。元のウェイトは凍結されているため、モデルはすべての一般的な知識を保持し、アダプターは新しいタスクの詳細を学習します。それは、コアの知識を変えることなく、専門家に新しい専門的なツールを与えるようなものです。
  2. Qlora(量子化されたLORA):この方法は、効率がさらに一歩進んでいます。事前に訓練された大規模なモデルを使用して量子化するため、モデルの重みの精度(16ビットから4ビット数から4ビット数まで)を減らすことを意味します。これにより、モデルのメモリフットプリントが劇的に縮小します。次に、LORA技術を適用して、この小さく、量子化されたモデルを微調整します。その結果、単一の消費者グレードGPUでモデルを微調整できます。

最終的に、モデルは、トレーニング前と同様に、Backpropagationと学習率オプティマイザーを介して損失関数を最小限に抑えることで学習します。しかし、スコープは非常に狭く、出発点が非常に高度であるため、このプロセスは、モデルをゼロからトレーニングするよりも桁違いに高速で安価です。

さて、大きな質問:あなたはあなた自身のモデルを微調整するべきですか?答えは、技術の多くのことと同様に、次のとおりです。 *それは依存します。 *

なぜそれが価値があるのか(プロ)

  • 比類のないパフォーマンス:特定のタスクの場合、微調整されたモデルはほとんどの場合、汎用モデルを上回ります。より正確で信頼性が高く、ドメインに直接関連する回答を提供します。
  • データプライバシーと制御:機密データまたは独自のデータ(顧客情報、内部ドキュメントなど)を扱っている場合、サードパーティAPIに送信することはできません。独自のインフラストラクチャでオープンソースモデルを微調整すると、データを安全に保ちます。
  • 幻覚の削減:モデルは狭い領域の専門家であるため、「幻覚」したり、誤った情報を作ったりする可能性ははるかに低くなります。その知識は、特定のデータセットで正確に訓練されています。
  • 大規模な費用対効果:前払いコストはありますが、特に大量のアプリケーションでは、大規模な商業モデルへの数百万のAPI呼び出しに支払うよりも、独自の微調整モデルを実行することは長期的には安価になります。

なぜそうでないのか(短所)

  • 複雑さとコスト:Qloraのような方法にもかかわらず、微調整にはまだ技術的な専門知識、優れたGPU、および時間が必要です。ワンクリックプロセスではありません。
  • データは重要です。微調整の成功は、トレーニングデータの品質に完全に依存します。データセットが小さい、ノイズが大きい、またはフォーマットが不十分な場合は、結果が不十分です(「ごみ、ごみ」)。
  • 過度に適合するリスク:モデルを専門化することができ、一般的な推論能力の一部、「壊滅的な忘却」として知られる問題が失われる可能性があります。
  • 迅速なエンジニアリングで十分かもしれません。時には、タスクのために調整されたモデルを必要としない場合があります。 GPT-4Oのような強力なベースモデルは、多くの場合、巧妙で詳細なプロンプト(これは「コンテキスト学習」と呼ばれます)で優れた結果を達成できます。微調整にジャンプする前に、常にプロンプトを改善してみてください。

#微調整とは正確には何ですかそしてなぜAIでそんなに重要なのですか #SIAM #2025年7月

執筆者について: nipponese

Nipponese News編集部は、国内外のニュースを日本語で分かりやすくお届けします。