1772589994
2026-03-04 01:20:00
スペインの AI 企業 Multiverse Computing は、OpenAI の gpt-oss-120B の圧縮バージョンである HyperNova 60B 2602 をリリースし、以下で無料で公開しました。 ハグフェイス。
新しいバージョンでは、元のモデルのメモリ必要量が 61 GB から 32 GB に削減され、Multiverse によれば、サイズが 50% 削減されたにもかかわらず、ほぼ同等のツール呼び出しパフォーマンスが維持されています。
理論的には、これは、かつては大規模なインフラストラクチャが必要だったモデルが、はるかに少ないハードウェアで実行できることを意味します。予算やエネルギーの制約が厳しい開発者にとって、これは潜在的に大きな利点となります。
CompactifAI テクノロジー
Multiverse は、以前の圧縮リリースと比較して、エージェントに重点を置いたベンチマークが向上していると主張しています。 HyperNova 60B 2602 は、Tau2-Bench で 5 倍、ターミナル ベンチ ハードで 2 倍の向上を実現すると述べています。
これらのテストでは、単純なテキスト応答ではなく、ツールの使用とコーディングのワークフローが測定されます。
同社の CompactifAI テクノロジーは、量子にインスピレーションを得たテンソル ネットワークを使用してトランスの重み行列を再構築します。
Multiverse は、効果的な圧縮が、単純に大規模なモデルを構築することに代わる手段を提供し、主権 AI、インフラストラクチャの制限、エネルギー使用に関する欧州での進行中の議論にリンクすると考えています。そこで、さらに詳しく知るために、私は同社の圧縮テクノロジーについて話を聞きました。
- LLM を圧縮するにはどうすればよいでしょうか?
Multiverse Computing は、量子にインスピレーションを得たテンソル ネットワークに基づいた独自の CompactifAI テクノロジーを使用して、大規模な言語モデルを圧縮します。
CompactifAI は、単にパラメーターを削除するのではなく、トランスフォーマー モデルの内部重み行列を高効率のテンソル ネットワーク表現に再構築します。この数学的再定式化によりパラメータ間の相関関係が把握され、構造的な冗長性が排除されます。
このプロセスはトレーニング後に適用されます。つまり、元のモデルを再トレーニングする必要がなく、元のトレーニング データへのアクセスも必要ありません。
このアプローチを使用すると、CompactifAI はタスク全体で強力なパフォーマンスを維持しながら、メモリ使用量を最大約 93% 削減し、パラメータ数を大幅に削減できます。
結果として得られる圧縮モデルは、より小さく、より高速で、よりエネルギー効率が高く、クラウド、オンプレミス、エッジ環境全体に展開しやすくなります。
- すべての LLM に適用できますか?
モデルの重みへのアクセスが利用可能な場合、高密度基盤モデルを含むトランスフォーマーベースの大規模言語モデルで動作します。
このテクノロジーはトランス ファミリ内のアーキテクチャに依存せず、モデルの外部動作や API を変更する必要はありません。
圧縮の有効性は、モデルの冗長性のレベルによって異なります。通常、大規模で過剰にパラメータ化されたモデルは、最大の圧縮可能性を提供します。
主な技術的課題は、高い圧縮率を達成しながらモデルの精度を維持することです。これは、テンソル分解パラメータを慎重に制御してサイズの削減とパフォーマンスの安定性のバランスをとることで解決されます。
もう 1 つの課題は、推論、多言語パフォーマンス、ドメイン固有のユースケースなど、さまざまなタスクにわたって圧縮モデルの堅牢性を維持することです。
最後に、展開環境は大きく異なります。圧縮は、さまざまなハードウェア ターゲット、遅延要件、および運用上の制約に合わせて最適化する必要があります。
- 良い例えは何でしょうか?
レンガを削除するのではなく、ブループリントを書き直す: CompactifAI は、モデルの一部を単に削除するだけではありません。代わりに、同じ構造がより効率的に表現されるように数学的設計図が書き換えられます。
これは、強度と機能を維持しながら使用する材料を大幅に削減するために、建物の内部フレームワークを再設計するようなものです。
もう 1 つの例えは、大規模なアーカイブを、重複を排除した高度に構造化されたシステムに再編成することです。知識はそのまま残りますが、はるかに効率的にエンコードされます。
- 精度の低下をどのように判断しますか?
精度の低下は、同じタスクで元のモデルに対して圧縮モデルをベンチマークし、メトリクスをスコアリングし、その変化を測定することによって決定されます。
実際には、これにはツール呼び出しの評価も含まれます。ここでの機能の損失を減らすことで、より高度なエージェント ワークフローとアプリケーションのコーディングが可能になります。
- 他の企業(おそらくライバル)が同じ技術に取り組んでいることは何ですか
Multiverse Computing の圧縮技術は完全にユニークで、共同創設者兼 CEO の Roman Orus による量子にインスピレーションを得たテンソル ネットワークの研究に基づいています。
AI モデルの圧縮に利用できる手法は他にもありますが、その代わりに精度が大幅に低下します。
- LLM が時間の経過とともに有機的に進化するという事実を考えると、圧縮 (ハードウェア実装でしょうか?) またはその他の将来はどうなるでしょうか?
この圧縮技術は今後の LLM にも適用できます。つまり、将来的には、自動車、電話、ラップトップなどのデバイスが、ハードウェアにプレインストールされた小型またはナノ AI モデルを実行できるようになります。
- ハードウェアに依存しないのでしょうか?一部のハードウェア (ASIC) では他のハードウェアよりもうまく動作しますか?
はい、モデル レベルではハードウェアに依存しません。CompactifAI はトレーニング後にモデルの重みを圧縮するため、結果として得られるモデルは、モデルの外部インターフェイスを変更せずにクラウド、オンプレミス、エッジ全体にデプロイできます。
推論の高速化は、以前に何が制限されていたかによって異なります。メモリに制約がある場合は、同じハードウェア上でより小さいモデルの方が大幅に高速かつ安価に実行されることがよくあります。
ASIC は必要ありませんが、モデルがメモリに適切に収まれば、GPU/AI アクセラレータは通常、トランスフォーマー推論で最高のスループットを提供します。
- 圧縮は何に依存していますか?
CompactifAI は、トレーニングされたトランスフォーマーの重み行列の冗長性に依存しています。大規模なモデルはパラメータが過剰に設定されていることが多いため、より少ない有効パラメータで同じ動作を表現できます。
一般的な「zip スタイル」圧縮の代わりに、モデルを意識した因数分解 (量子にヒントを得たテンソル ネットワーク) を使用して、精度のトレードオフを軽減しながら、大きな行列を構造化されたより小さい形式に書き換えます。
- 他の人があなたのテクニックやプロセスをコピーするのを妨げるものは何ですか?利用可能なさまざまな圧縮技術 (zip、rar、7z など) に似ています。
Multiverse Computing 独自の CompactifAI テクノロジーは、共同創設者兼 CEO の Roman Orus と同社独自の研究チームによる量子にインスピレーションを得たテンソル ネットワークの研究に基づいた、AI モデル圧縮への独自のアプローチです。
模倣技術を防ぐのは、精度を犠牲にすることなくこのような高い圧縮率を達成するために必要な技術的ノウハウです。
CompactifAI は、わずか 50 ~ 60% の圧縮で 20 ~ 30% の精度が低下する業界標準と比較して、わずか 2 ~ 3% の精度の低下でモデル サイズを最大 95% 削減できます。
Google ニュースで TechRadar をフォローしてください そして 私たちを優先情報源として追加してください 専門的なニュース、レビュー、意見をフィードで入手できます。ぜひフォローボタンをクリックしてください!
もちろん、次のこともできます TikTokでTechRadarをフォローしてください ニュース、レビュー、開封をビデオ形式で確認し、定期的に最新情報を入手してください。 ワッツアップ あまりにも。
#Multiverse #がメモリ需要を削減しAI #インフラストラクチャのコストを削減するように設計された圧縮 #OpenAI #言語モデルを発表