日本語版
最新ニュース
世界

Leviathan は 10 億未満のパラメータで優れた言語モデル能力を達成

研究者は長い間、言語モデル内のパラメーターはほとんど交換可能であり、モデルのサイズとコンピューティングに基づいてパフォーマンスを予測することに成功していると想定してきました。しかし、バージニア工科大学と州立大学の Reza T Batley 氏と Sourav Saha 氏は、Reza T Batley 氏や Sourav Saha 氏らとともに、この概念に異議を唱え、小規模な言語モデルでのパラメーター割り当てが驚くほど非効率であることを実証しました。彼らの研究では、従来の離散ルックアップ テーブルの代わりに連続埋め込みジェネレーターを採用した新しいアーキテクチャである Leviathan が導入されました。 Pile データセットで Leviathan を評価したところ、チームは標準的な LLaMA スタイル モデルと比較して一貫したパフォーマンスの向上を明らかにし、重要なことに、実際よりも大幅に多くのパラメーターを所有しているかのように動作する、著しく優れた有効パラメーター容量を示しました。この研究は、より強力で効率的な小規模言語モデルを構築するための道筋を提供し、自然言語処理の状況を再構築する可能性があります。 規模に応じて減少する 23 ~ 51% という中程度のスループット オーバーヘッドが発生するにもかかわらず、サンプル効率の向上は明らかにこのコストを上回ります。特に、リヴァイアサンは実際のパラメーター数の 1.5 ~ 2.1 倍の実効能力を示します。 Leviathan は、4 億 2,100…

Leviathan は 10 億未満のパラメータで優れた言語モデル能力を達成

1769963618
2026-02-01 16:25:00

研究者は長い間、言語モデル内のパラメーターはほとんど交換可能であり、モデルのサイズとコンピューティングに基づいてパフォーマンスを予測することに成功していると想定してきました。しかし、バージニア工科大学と州立大学の Reza T Batley 氏と Sourav Saha 氏は、Reza T Batley 氏や Sourav Saha 氏らとともに、この概念に異議を唱え、小規模な言語モデルでのパラメーター割り当てが驚くほど非効率であることを実証しました。彼らの研究では、従来の離散ルックアップ テーブルの代わりに連続埋め込みジェネレーターを採用した新しいアーキテクチャである Leviathan が導入されました。 Pile データセットで Leviathan を評価したところ、チームは標準的な LLaMA スタイル モデルと比較して一貫したパフォーマンスの向上を明らかにし、重要なことに、実際よりも大幅に多くのパラメーターを所有しているかのように動作する、著しく優れた有効パラメーター容量を示しました。この研究は、より強力で効率的な小規模言語モデルを構築するための道筋を提供し、自然言語処理の状況を再構築する可能性があります。

規模に応じて減少する 23 ~ 51% という中程度のスループット オーバーヘッドが発生するにもかかわらず、サンプル効率の向上は明らかにこのコストを上回ります。特に、リヴァイアサンは実際のパラメーター数の 1.5 ~ 2.1 倍の実効能力を示します。 Leviathan は、4 億 2,100 万のスケールで、約 7 億 2,500 万のパラメータ密度モデルの検証損失を達成し、大幅に大規模なモデルと競合するパフォーマンスを発揮する能力を示しました。 L で示される深さは、アイソボディ実行では固定されるか、入力埋め込み行列を Leviathan のジェネレーター モジュールで置き換えて、アイソパラメトリックに近い状態を復元するためにアイソパラメトリック実行で増加しました。すべてのモデルは JAX/Flax で実装され、勾配クリッピングを備えた AdamW を使用して最初からトレーニングされ、シーケンス長 512、バッチ サイズ 512 でパフォーマンスを最適化しました。

データは Pile データセットから取得され、分散をランダム化するために 10,000 シーケンス シャッフル バッファーを備えたデータローダーを介してストリーミングされました。入力テキストは、tiktoken の o200k ベース トークナイザーを使用してトークン化され、基数 200,018 のボキャブラリが 200,376 にパディングされ、base-59 分解による 3 次元座標への分解が促進され、インデックス付けパラメーターが 200,376 から 177 に削減されました。重要なことに、一致する Dense-Leviathan ペアは同一のトークン ストリームを処理し、一貫性を確保しました。トレーニング中のデータ漏洩。 L(N) = AN−α + b および L(D) = BD−β + b の形式のべき乗則が、確立されたスケーリング手法と一致する 1.69 の既約損失項 b を使用して密なモデルに適合されました。ベースラインの 0.38 と比較して 0.47 であり、パラメーター数の増加に伴う利点の拡大を示唆しています。

Leviathan は優れたパラメータ効率を一貫して達成し、多くのパラメータを上回ります。

Leviathan は、1 億 900 万のスケールで、2.11 倍の有効サイズ乗数を表す 2 億 3000 万のパラメーターの密なモデルと同等の検証損失を実証しました。埋め込み税が削減される 4 億 2,100 万スケールでも、Leviathan は 7 億 2,400 万のパラメーター密度の高いモデルに相当する 1.72 倍の実質的な有効サイズの利点を維持しました。結果は、密集したベースラインと比較したリヴァイアサンの利点が、トレーニング中にトークンが見られるにつれてほぼ単調に増加することを示しています。具体的には、Leviathan-60M は 100×N トークンを処理した後でも利点が継続的に増加しました。具体的には、この研究では、高密度のベースラインと比較してパラメーターとデータ スケーリング指数が向上していることが示されており、Leviathan がモデル サイズの増加と追加のトレーニング データの両方からより多くのメリットを引き出していることが示唆されています。現在の分析は調査対象の特定のパラメーター範囲に限定されていますが、Leviathan の一貫した優れたパフォーマンスは、パラメーター効率の系統的な向上を示しています。

#Leviathan #は #億未満のパラメータで優れた言語モデル能力を達成

執筆者について: nipponese

Nipponese News編集部は、国内外のニュースを日本語で分かりやすくお届けします。