1752969091
2025-07-18 09:48:00
マドリッド、18年7月18日(ポータルティック/EP) –
IntelとWeizmann Institute of Sciencesは、Great Languageモデル(LLM)の推論を2.8で増やすことを可能にする人工知能アルゴリズム(AI)の新しい管理方法である投機的デコードの進歩を提示しました。
投機的デコードは、精度を損なうことなく、アプリケーションを解くときにディープラーニングモデル(LMR)がより速く、より効率的になるように設計された推論最適化手法です。
この手法は、回答を生成する小さくて高速なモデルを組み合わせて、それをチェックして検証するより大きく、より正確なモデルを組み合わせることで機能します。ただし、異なる語彙で使用すると、困難を引き起こす可能性があります。
この枠組みの中で、Intelの研究者とWeizmann Institute of Sciencesは、LLMの推論速度の最大2.8倍増加を可能にする新しい手順を発見し、異種モデルでの投機的解読を促進しました。
テクノロジーは、バンクーバー(カナダ)で開催された自動学習に関する国際会議(ICML)の枠組みの中でこの進展を発表しました。
したがって、この斬新さは、Intelが詳述したように、「生成AIの基本的な非効率性」を解決します。 声明、 彼は、さらに、さまざまな開発者やエコシステムのモデル、およびオープンソースのモデルでも機能し、「サプライヤーから独立している」と強調していることを強調しています。
具体的には、新しい方法は3つの新しいアルゴリズムに基づいており、「語彙アライメントの投機的コーディングを切り離す」。このようにして、LLMの柔軟な実装が促進され、大きなモデルを備えた小さなモデルドラフトが推論の速度とコストを最適化できるようにします。
「AIの断片化されたパノラマでは、投機的デコードのこの進歩は、クラウドから端への開口部、相互運用性、有益な実装を促進します」と技術のものは語りましたが、開発者、企業、研究者は「モデルを組み合わせてパフォーマンスのニーズとハードウェアの制限に適応できる」と微妙にしています。
これらすべてで、Intelは、オープンハグFace Transformers Sourceライブラリでアルゴリズムがすでに利用可能であることを共有しています。
#IntelはLLMの推論が2.8増加する加速アルゴリズムを管理する方法を提示します