日本語版
最新ニュース
科学&テクノロジー

Ollama はプレビュー版で Apple Silicon 上の MLX を利用しています · Ollama ブログ

本日、Apple の機械学習フレームワークである MLX を利用して、Apple シリコン上で Ollama を実行する最速の方法をプレビューしています。 これにより、新たなパフォーマンスが解放されます。 macOS 上で最も要求の厳しい作業を加速します。 MLX を搭載した Apple シリコン上で最速のパフォーマンス Apple シリコン上の Ollama は、ユニファイド メモリ アーキテクチャを活用するために、Apple の機械学習フレームワーク MLX 上に構築されています。 これにより、すべての Apple Silicon デバイスで Ollama が大幅に高速化されます。 Apple の M5、M5 Pro、および M5 Max チップ上で、Ollama は新しい GPU…

Ollama はプレビュー版で Apple Silicon 上の MLX を利用しています · Ollama ブログ

1774938987
2026-03-31 03:40:00

本日、Apple の機械学習フレームワークである MLX を利用して、Apple シリコン上で Ollama を実行する最速の方法をプレビューしています。

これにより、新たなパフォーマンスが解放されます。 macOS 上で最も要求の厳しい作業を加速します。

MLX を搭載した Apple シリコン上で最速のパフォーマンス

Apple シリコン上の Ollama は、ユニファイド メモリ アーキテクチャを活用するために、Apple の機械学習フレームワーク MLX 上に構築されています。

これにより、すべての Apple Silicon デバイスで Ollama が大幅に高速化されます。 Apple の M5、M5 Pro、および M5 Max チップ上で、Ollama は新しい GPU ニューラル アクセラレータを利用して、最初のトークンまでの時間 (TTFT) と生成速度 (1 秒あたりのトークン) の両方を高速化します。

プレフィル性能

0 500 1000 1500 2000年 トークン/秒 1810年 0.19になる 1154 0.18になる

デコードパフォーマンス

0 40 80 120 160 トークン/秒 112 0.19になる 58 0.18になる

テストは、「NVFP4」に量子化された Alibaba の Qwen3.5-35B-A3B モデルと、Ollama 0.18 を使用して「Q4_K_M」に量子化された Ollama の以前の実装を使用して、2026 年 3 月 29 日に実施されました。 Ollama 0.19 ではさらに高いパフォーマンスが見られます (「int4」で実行すると、プリフィルが 1851 トークン/秒、デコードが 134 トークン/秒)。

NVFP4 サポート: より高品質な応答と本番環境の同等性

Ollama は現在、NVIDIA の NVFP4 形式を使用してモデルの精度を維持しながら、推論ワークロードのメモリ帯域幅とストレージ要件を削減します。

NVFP4 形式を使用して推論をスケールする推論プロバイダーが増えるにつれ、Ollama ユーザーは運用環境と同じ結果を共有できるようになります。

Ollama はさらに、NVIDIA によって最適化されたモデルを実行できるようになります。 モデルオプティマイザー。その他の精度は、Ollama の研究およびハードウェア パートナーからの設計と使用目的に基づいて提供されます。

キャッシュの改善により応答性が向上

Ollama のキャッシュがアップグレードされ、コーディングとエージェント タスクがより効率的になりました。

  • メモリ使用率の低下: Ollama は会話全体でキャッシュを再利用するようになりました。これは、Claude Code などのツールで共有システム プロンプトを使用する場合、メモリ使用量が減少し、分岐時のキャッシュ ヒットが増加することを意味します。

  • インテリジェントなチェックポイント: Ollama は、プロンプト内のインテリジェントな場所にキャッシュのスナップショットを保存するようになり、その結果、プロンプト処理が減り、応答が高速化されます。

  • よりスマートなエビクション: 共有プレフィックスは、古いブランチが削除された場合でも、より長く存続します。

始めましょう

オラマ 0.19 をダウンロード

Ollama のこのプレビュー リリースは、新しい機能を加速します。 クウェン3.5-35B-A3B コーディングタスク用に調整されたサンプリングパラメータを備えたモデル。

32 GB を超えるユニファイド メモリを搭載した Mac を使用していることを確認してください。

クロードコード:

ollama launch claude --model qwen3.5:35b-a3b-coding-nvfp4

オープンクロー:

ollama launch openclaw --model qwen3.5:35b-a3b-coding-nvfp4

モデルとチャット:

ollama run qwen3.5:35b-a3b-coding-nvfp4

将来のモデル

今後のモデルのサポートにも積極的に取り組んでいます。サポートされているアーキテクチャに合わせてカスタム モデルを微調整しているユーザー向けに、モデルを Ollama にインポートする簡単な方法を紹介します。それまでの間、サポートされるアーキテクチャのリストを拡大する予定です。

謝辞

ありがとうございます:

  • 驚異的な高速化フレームワークを構築した MLX 貢献者チーム
  • NVIDIA は、NVFP4 量子化、NVFP4 モデル オプティマイザー、MLX CUDA サポート、Ollama の最適化とテストに貢献しました。
  • 活発なローカル フレームワークとコミュニティを構築した GGML および llama.cpp チーム
  • 優れたモデルとそのコラボレーションをオープンソース化する Alibaba Qwen チーム

#Ollama #はプレビュー版で #Apple #Silicon #上の #MLX #を利用しています #Ollama #ブログ

執筆者について: nipponese

Nipponese News編集部は、国内外のニュースを日本語で分かりやすくお届けします。