日本語版
最新ニュース
世界

Mozilla のポータブル LLM ランナーである Llamafile が GPU サポートと再構築されたコアを取得

クラウド アクセスやコンテナ ランタイムを使用せずに、単一マシン上で大規模な言語モデルを実行することは、エアギャップ環境やリソースに制約のある環境で作業する実務者にとって依然として優先事項です。 Llamafile は、LLM を自己完結型の実行可能ファイルとしてパッケージ化して実行するための Mozilla-AI のプロジェクトであり、このバージョンでこれまでで最も重要なアーキテクチャの見直しが行われました。 0.10.0。 ゼロからの再構築 0.10.0 リリースは、Llamafile のコアを最初から再構築するという慎重な決定の結果です。定められた目標は、プロジェクトの中心となる 2 つのプロパティ、つまりオペレーティング システムとハードウェア アーキテクチャ間での移植性、および Llamafile 実行可能ファイル内にモデルの重みを直接バンドルする機能を保持する国際的な llama.cpp ビルドを作成することでした。この再構築により、プロジェクトの llama.cpp 依存関係も最新のものになり、古いビルドには欠けていた最新のモデルのサポートが組み込まれました。 GPU アクセラレーションが回復 0.10.0 での最も重要な変更の 1 つは、再構築されたコードベースの以前のイテレーションには存在しなかった GPU サポートの復活です。 Linux の CUDA サポートは 2026 年 2…

Mozilla のポータブル LLM ランナーである Llamafile が GPU サポートと再構築されたコアを取得

1773983968
2026-03-20 05:00:00

クラウド アクセスやコンテナ ランタイムを使用せずに、単一マシン上で大規模な言語モデルを実行することは、エアギャップ環境やリソースに制約のある環境で作業する実務者にとって依然として優先事項です。 Llamafile は、LLM を自己完結型の実行可能ファイルとしてパッケージ化して実行するための Mozilla-AI のプロジェクトであり、このバージョンでこれまでで最も重要なアーキテクチャの見直しが行われました。 0.10.0

ゼロからの再構築

0.10.0 リリースは、Llamafile のコアを最初から再構築するという慎重な決定の結果です。定められた目標は、プロジェクトの中心となる 2 つのプロパティ、つまりオペレーティング システムとハードウェア アーキテクチャ間での移植性、および Llamafile 実行可能ファイル内にモデルの重みを直接バンドルする機能を保持する国際的な llama.cpp ビルドを作成することでした。この再構築により、プロジェクトの llama.cpp 依存関係も最新のものになり、古いビルドには欠けていた最新のモデルのサポートが組み込まれました。

GPU アクセラレーションが回復

0.10.0 での最も重要な変更の 1 つは、再構築されたコードベースの以前のイテレーションには存在しなかった GPU サポートの復活です。 Linux の CUDA サポートは 2026 年 2 月に再導入されました。macOS ARM64 の Metal サポートは 2025 年 12 月に到着し、Xcode コマンド ライン ツールを使用して小さなモジュールをコンパイルすることで実装されました。 Metal は、端末インターフェイスとサーバー モードの両方で動作します。

Windows の GPU サポートは、現在のリリースではまだサポートされていないと記載されています。

ターミナルインターフェイスとサーバーモード

バージョン 0.10.0 では、ユーザーがコマンド ラインからロードされたモデルを直接操作できるようにするターミナル ユーザー インターフェイス (TUI) が追加されています。サーバー モードには、–server フラグを介してアクセスできます。このリリースでは、チャット、CLI、サーバーという 3 つの異なる動作モードのサポートも追加されています。

マルチモーダルおよび音声機能

mtmd API に TUI 経由でアクセスできるようになり、ターミナルから直接マルチモーダル モデルにアクセスできるようになりました。この機能でテストされたモデルには、llava 1.6、Qwen3-VL、および Ministral 3 が含まれます。 –image フラグを介した画像入力のサポートが CLI モードに追加されました。

音声認識モデルである Whisper は、最新の更新サイクル (2026 年 3 月) で追加され、テキストのみの推論を超えてプロジェクトを拡張しました。

モデルのサポートと llamafile の例

Mozilla-AI は、バージョン 0.10.0 にバンドルされた、事前に構築されたサンプル llamafile のセットを配布します。これらの範囲は、GPU なしの Raspberry Pi 5 で 1 秒あたり約 8 トークンを生成するとプロジェクトが報告している 1.6 GB Qwen3.5 0.8B Q8 量子化から、最大 19 GB Qwen3.5 27B Q5 量子化までの範囲です。その他の含まれるモデルは、Ministral 3 3B Instruct、llava v1.6 misstral 7b、Apertus 8B Instruct、gpt-oss 20b、および LFM2 24B A2B です。

llama.cpp の依存関係が 7f5ee54 をコミットするように更新され、Qwen3.5 モデルのサポートが追加されました。

Windows ユーザーは、実際的な制約に直面しています。オペレーティング システムでは、実行可能ファイルの最大サイズが 4 GB に制限されており、現在のサンプル llamafile のほとんどはこのサイズを超えています。プロジェクトでは、回避策として外部ウェイトの使用をサポートしています。

ビルドシステムと依存関係

ビルド システムは 0.10.0 開発サイクルの初期に簡素化されました。 CMake は廃止され、カスタム BUILD.mk ファイルが使用されました。依存関係は、llama.cpp ベンダー ディレクトリから取得されます。このプロジェクトは現在、cosmocc 4.0.2 をターゲットとしています。 zipalign ユーティリティは、メンテナからのアップストリームの更新を追跡するために、GitHub サブモジュールとして追加されました。

保留中のもの

このプロジェクトには、新しいビルド形式にまだ引き継がれていないいくつかの機能がリストされています。安定した拡散コードはリポジトリに存在しますが、新しいビルドには移植されていません。 pledge() および SECCOMP サンドボックス機能はありません。埋め込み用の Llamafiler は、llama.cpp の組み込み埋め込みエンドポイントにロールバックされました。以前のバージョンで機能していた一部の CLI 引数はまだ機能していません。

統合テストは 2026 年 3 月に追加され、AI アシスタントでの使用を目的とした「スキル ドキュメント」も追加されました。

設計による安全性: 最初にセキュリティを組み込む

#Mozilla #のポータブル #LLM #ランナーである #Llamafile #が #GPU #サポートと再構築されたコアを取得

執筆者について: nipponese

Nipponese News編集部は、国内外のニュースを日本語で分かりやすくお届けします。