1760719034
2025-10-17 16:31:00
Wオープンソースの大規模言語モデル (LLM) に関しては、モデル名がコードに似た不可解な文字列として表示されることがよくあります。例: mixtral-8x7b-moe-exl2.gguf または ラマ-2–13b-chat.gguf.q4_0 最初は不透明に見えるかもしれませんが、これらは意図的に構造化されています。各要素はモデルに関する重要なメタデータを伝え、そして重要なことに、ハードウェアがモデルをサポートできるかどうかに関するガイダンスを提供します。
この記事では、これらの名前を理解する方法を詳しく説明します。
ネームタグのデコード
モデルを参照すると、最初に気づくのは、数字とそれに続く数字です。 「B」。これ 「B」 を表します 10億のパラメータこれはモデルのサイズとパフォーマンスの主要な指標であり、GPU が実際にモデルを実行できるかどうかを示す重要な兆候として機能します。
モデル名が「計算」で始まっている場合、または文字が含まれている場合 教育省、つまり、 専門家の混合モデル。
量子化の陰謀
パラメーターの数から元のモデルのサイズがわかる場合は、接尾辞によって、誰かがどのようにモデルを縮小したかがわかります。次のような奇妙でほとんど意味のないタグが表示されます。 GGUF、 AWQ、 EXL2、 または GPTQ。
これらのタグはランダムではありません。それらは異なるモデル形式を表すか、 量子化方法 パラメーター数が多いために通常は実行できないモデルをローカルで実行できるように設計されています。
これらのメソッドの目標は、 量子化これは本質的に、モデルが使用する数値を表すために使用されるビット数を削減し、それによって精度が低下します。歴史的には、このプロセスはモデルの「ロボトミー化」につながる可能性がありましたが、ありがたいことに、今日ではより優れたモデルで使用してもパフォーマンスの低下はそれほど顕著ではありません。
一般的なタグの簡単な翻訳は次のとおりです。
- GGUF: このファイル形式 (GGML の後継) は、さまざまな量子化スキームをサポートしており、モデルを CPU 単一のファイル内にきちんと含まれています。
- EXL2: ExLlama V2 で使用される、これは多くの場合、利用可能な最速の最適化形式です。重みあたり 2 ~ 8 ビットの量子化レベルを混合することで驚異的な速度を実現しますが、現在は Nvidia GPU でのみ利用可能です。
- AWQ: これは、残りを最も近い量子化しきい値に丸める前に、より小さい重みを戦略的にゼロに設定することにより、モデルのサイズを削減する手法です。
- 安全なテンソル: ミックス中にこれが見られた場合でも、心配しないでください。これは量子化方法ではありません。これは、不明なソースからモデルをロードするときに、悪意のある当事者が PC に「sus なもの」を追加するのを防ぐ安全なファイル形式です。
#すべての #モデル名がパスワードのように見える理由 #そして実際に何がわかるのか #アパラタス著 #年 #月