1770565434
2026-02-08 15:03:00
ローカル ハードウェアでの機械学習推論をより深く理解したい開発者は、新しい ラマ エンジンを起動できます。
ソフトウェア開発者 レオナルド・ルッソ リリースしました ラマ3ピュア、3 つのスタンドアロン推論エンジンが組み込まれています。デスクトップ用の純粋な C 実装、Node.js 用の純粋な JavaScript 実装、および WebAssembly を必要としない Web ブラウザー用の純粋な JavaScript バージョンがあります。
「すべてのバージョンは Llama および Gemma アーキテクチャと互換性があります」と Russo 氏は説明しました。 レジスター メールで。 「目標は、GGUF ファイルを読み取ってプロンプトを処理できる、依存関係のない独立した代替手段を C と JavaScript の両方で提供することです。」
GGUF は GPT 生成統一フォーマットの略です。これは、機械学習モデルを配布するための一般的な形式です。
Llama3pure は、 call.cpp、ローカル モデルを実行するために広く使用されている推論エンジンで、プロンプトへの応答が大幅に高速化されています。 Llama3pure は教育ツールです。
「特にアーキテクチャの透明性と広範なハードウェア互換性の点で、llama3pure は llama.cpp のより柔軟な代替手段であると考えています」と Russo 氏は説明しました。 「llama.cpp は高パフォーマンスの最適化の標準ですが、依存関係とビルド構成の複雑なエコシステムが関係していますが、llama3pure は異なるアプローチを採用しています。」
Russo 氏は、開発者は、ファイル解析とトークン生成のロジックを明確にする人間が読める単一のファイルに推論エンジンを組み込むことで恩恵を受けることができると考えています。
「このプロジェクトの主な目的は、純粋なコードの単一ファイル内に含まれる推論エンジンを提供することです」と彼は述べた。 「外部の依存関係と抽象化レイヤーを削除することで、開発者はファイルやライブラリ間を移動することなく、GGUF 解析から最終トークンに至る実行フロー全体を把握できるようになります。ハードウェアが何を行っているかを正確に理解する必要がある人向けに構築されています。」
Russo 氏は、開発者が従来のソフトウェアまたはハードウェアを実行していて、クライアント側の WebAssembly がオプションではなく、将来の依存関係の競合の可能性のない分離されたツールが望ましい場合にも有用であると考えています。
同氏によると、C エンジンと Node.js エンジンは、最大 80 億パラメータの Llama モデルと最大 40 億パラメータの Gemma モデルでテストされています。主な制限要因は、モデルの重みをホストするために必要な物理 RAM です。
ローカル ハードウェアで機械学習モデルを実行するために必要な RAM は、モデルが 8 ビットで量子化されている場合、10 億パラメータあたり約 1 GB です。精度が 2 倍または半分になると、必要なメモリも 2 倍または半分になります。モデルは通常 16 ビットで量子化されるため、10 億パラメータのモデルの場合、通常は 2GB が必要になります。
Russo 氏によると、GGUF の重みの計算は異なります。
「GGUF の重みは RAM に直接ロードされます。これは通常、RAM の使用量がファイル全体のサイズと一致することを意味します。」と彼は説明しました。 「特定のパラメーター (context_size) を渡すことでコンテキスト ウィンドウのサイズを縮小できます。これは、私が設計した 3 つを含むほとんどの推論エンジンでサポートされている機能です。コンテキスト ウィンドウのサイズを縮小することは、モデルをローカルで実行するときに RAM を節約するための一般的な “トリック” ですが、AI が当初の設計ほどには “記憶” しなくなることも意味します。」
また、llama3pure は現在シングルターン推論に重点を置いているとも述べました。同氏は、チャット履歴の状態管理を後日実装する予定だという。
Russo 氏は、日常業務では C ベースの推論エンジンを搭載した Gemma 3 をパーソナル アシスタントとして使用し、機密データがプライベートかつオフラインで扱われるようにしていると語ります。
「コーディングアシスタントには、Gemma 3 27Bをお勧めします」と彼は言いました。 「レイテンシーの懸念に関しては、ローカル モデルは歴史的に遅かったですが、最新のハードウェアで最適化されたバージョンを実行すると、Claude のようなクラウドベースのモデルに非常に近いエクスペリエンスが提供され、そのようなサービスに料金を支払う必要はありません。」
Russo 氏は、AI 支援の一般的な一般的なユースケースは引き続きクラウドホスト型モデルに依存すると予想していますが、開発者や企業はローカル AI にますます注目していると予想しています。 32 GB または 48 GB の RAM を搭載した開発者マシンには、クラウド ホスト型モデルで利用できるコンテキスト ウィンドウが欠けている場合がありますが、サービス プロバイダーに依存することなくセキュリティとプライバシーが提供されます。
AIへの移行について開発者としてどう感じているかとの質問に対し、ルッソ氏は開発者が最終的にはAIスーパーバイザーに移行することを期待していると述べた。
「AI モデルは、たとえ間違っていたとしても、高い信頼性で答えを提示するため、人間の専門家が常にループに参加して出力を検証する必要があります」と同氏は述べています。 「技術的な知識は時代遅れになるのではなく、AI によって生成された作業を監査する上でますます重要になるでしょう。
#つの #エンジンが #列になってバーに入ります.. #Register