1759854207
2025-10-07 16:21:00
なぜロングコンテキストAIがお金のピットのように感じるのか
これを想像してください:あなたは、法的契約や完全な研究論文など、大規模な文書をふるいにかける必要があるAIアプリを構築しています。あなたのモデルは、スマートな応答を生成するために、そのテキスト内のすべての単語に注意を払う必要があります。簡単に聞こえますよね?しかし、ここにこすりがあります。トランスと呼ばれるものに基づいて構築された従来のAIモデル、すべての単語、または「トークン」、Tech Speak、同様に重要なものです。各トークンは、人々でいっぱいの部屋のように、お互いに同時に叫ぶ部屋のように、他のすべてのトークンと一緒にチェックインします。
短いチャットには問題ありません。しかし、数千のトークンとブームの計算を拡大します。それは二次スケーリングです。つまり、テキストの長さを2倍にすると、作業を4倍にします。サーバーのうめき、メモリ風船、およびAPI請求書が急増します。財務レポートのためにデータ分析ツールをプロトタイピングしている間、私はこれを直接見ました。 1つの長い収益成績証明書は、悪い取引がポートフォリオを一掃するよりも早くクレジットを介して食べることができます。
によると >、これはまさに、新しいV3.2-EXPモデルで修正することを目的とした頭痛です。そこで研究者は、長いコンテキストOPSに正面から取り組むことに取り組む実験的リリースを削除し、品質をスキップせずに推論コストを削減しました。それはただではありません…
#DeepSeeksスパースアテンションはJITインベントリ効率を反映していますヴィクラムリンガム #2025年10月