日本語版
最新ニュース
世界

効率的で解釈可能な AI システムのための神経科学と LLM の橋渡し

NSLLM は LLM と神経科学の橋渡しをします 大規模言語モデル (LLM) は、汎用人工知能 (AGI) を追求する上で重要なツールとなっています。しかし、ユーザーベースが拡大し、使用頻度が増加するにつれて、これらのモデルの導入には多大な計算コストとメモリコストが発生し、人間社会の基礎インフラとして機能する可能性が制限されます。さらに、現在の LLM は一般に解釈可能性に欠けています。意思決定と最適化のプロセスが不透明であるため、医療や金融などの高リスク領域で信頼性と公平性を確保することが困難になっています。対照的に、人間の脳は、その認知プロセスにおいて驚くべき透明性を示しながら、20 ワット未満の電力で複雑なタスクを実行します。この明らかなコントラストは、LLM と人間の認知との間のギャップを強調しており、二重の課題を提示しています。一方で、LLM の計算効率を向上させることは、エネルギー効率を高めてリソースを節約するために不可欠です。一方で、大規模システムにおけるコンポーネントの相互作用や機能をより深く理解するには、解釈可能性を高めることが重要です。 学際的なボトルネックを克服するために、この研究では、スパイクベースの線形アテンションメカニズムを組み込みながら、整数スパイクカウントとバイナリスパイク変換を実行することにより、従来のLLMをNSLLMに変換する統一フレームワークを提案します。このフレームワークは、神経科学と大規模言語モデルの橋渡しをし、神経科学ツールを LLM に適用するためのプラットフォームを提供します。バイナリ推論による整数トレーニングを導入することにより、標準 LLM の出力がスパイク表現に変換され、神経科学ツールが情報処理を分析できるようになります。 超低消費電力のソフトウェアとハードウェアが共同設計された MatMul フリー LLM このアプローチのエネルギー効率を検証するために、この研究では、FPGA プラットフォーム上で 10 億パラメータ規模のモデル用の MatMul を使用しないカスタム コンピューティング アーキテクチャを実装しています。具体的には、層ごとの量子化戦略と階層的感度メトリクスを使用して、量子化損失に対する各層の影響を評価し、低ビット量子化下で競争力のあるパフォーマンスを達成する最適な混合タイムステップ スパイク モデルの構成を可能にします。さらに、膜電位分布を再形成し、量子化マッピング確率をより低い整数値にシフトするために、量子化支援のスパース化戦略が導入され、スパイクの発火率が大幅に減少し、モデル効率がさらに向上します。 VCK190 FPGA では、MatMul フリーのハードウェア コアが設計されており、NSLLM…

効率的で解釈可能な AI システムのための神経科学と LLM の橋渡し

1766759443
2025-12-26 14:20:00

NSLLM は LLM と神経科学の橋渡しをします

大規模言語モデル (LLM) は、汎用人工知能 (AGI) を追求する上で重要なツールとなっています。しかし、ユーザーベースが拡大し、使用頻度が増加するにつれて、これらのモデルの導入には多大な計算コストとメモリコストが発生し、人間社会の基礎インフラとして機能する可能性が制限されます。さらに、現在の LLM は一般に解釈可能性に欠けています。意思決定と最適化のプロセスが不透明であるため、医療や金融などの高リスク領域で信頼性と公平性を確保することが困難になっています。対照的に、人間の脳は、その認知プロセスにおいて驚くべき透明性を示しながら、20 ワット未満の電力で複雑なタスクを実行します。この明らかなコントラストは、LLM と人間の認知との間のギャップを強調しており、二重の課題を提示しています。一方で、LLM の計算効率を向上させることは、エネルギー効率を高めてリソースを節約するために不可欠です。一方で、大規模システムにおけるコンポーネントの相互作用や機能をより深く理解するには、解釈可能性を高めることが重要です。
学際的なボトルネックを克服するために、この研究では、スパイクベースの線形アテンションメカニズムを組み込みながら、整数スパイクカウントとバイナリスパイク変換を実行することにより、従来のLLMをNSLLMに変換する統一フレームワークを提案します。このフレームワークは、神経科学と大規模言語モデルの橋渡しをし、神経科学ツールを LLM に適用するためのプラットフォームを提供します。バイナリ推論による整数トレーニングを導入することにより、標準 LLM の出力がスパイク表現に変換され、神経科学ツールが情報処理を分析できるようになります。

超低消費電力のソフトウェアとハードウェアが共同設計された MatMul フリー LLM

このアプローチのエネルギー効率を検証するために、この研究では、FPGA プラットフォーム上で 10 億パラメータ規模のモデル用の MatMul を使用しないカスタム コンピューティング アーキテクチャを実装しています。具体的には、層ごとの量子化戦略と階層的感度メトリクスを使用して、量子化損失に対する各層の影響を評価し、低ビット量子化下で競争力のあるパフォーマンスを達成する最適な混合タイムステップ スパイク モデルの構成を可能にします。さらに、膜電位分布を再形成し、量子化マッピング確率をより低い整数値にシフトするために、量子化支援のスパース化戦略が導入され、スパイクの発火率が大幅に減少し、モデル効率がさらに向上します。 VCK190 FPGA では、MatMul フリーのハードウェア コアが設計されており、NSLLM での行列乗算演算が完全に排除され、動的消費電力が 13.849 W に削減され、スループットが 161.8 トークン/秒に増加します。 A800 GPU と比較して、このアプローチは 19.8 倍のエネルギー効率、21.3 倍のメモリ節約、2.2 倍の推論スループットを達成します。

スパイク神経集団による解釈可能性の向上

NSLLM フレームワークを通じて LLM の動作をスパイク列などのニューラル動的表現に変換することにより、ニューロンの動的特性 (コルモゴロフ・シナイ エントロピーによって定量化されるランダム性など) とその情報処理特性 (シャノン エントロピーや相互情報量など) の両方を分析できます。これにより、NSLLM が果たす計算上の役割をより明確に解釈できるようになります。実験結果は、曖昧でないテキストを処理する際にモデルがより効果的に情報をエンコードし、あいまいな入力と曖昧でない入力を区別できることを示しています(たとえば、中間層はあいまいな文に対してより高い正規化された相互情報量を示します。AS 層はスパース情報処理における役割を反映する明確な動的署名を示します。また、FS 層はより高いシャノン エントロピーを持ち、より強い情報伝達能力を示します。さらに、相互情報量とシャノン エントロピーの間の正の相関は、より高い情報容量を持つ層の方が優れていることを示唆しています)キー入力機能の保持)。このフレームワークは、ニューラルダイナミクスと情報理論的尺度を統合することにより、データ要件を大幅に削減しながら、生物学にインスピレーションを得た LLM メカニズムの解釈可能性を提供します。

神経科学の研究では、人間の脳はスパースでイベント駆動型の計算を通じてエネルギー効率の高い情報処理を実現し、通信効率とシステムの解釈可能性の両方を向上させることが示されています。この原則に基づいて、チームは、従来の LLM にニューロモーフィックな代替手段を導入する学際的な統一フレームワークを開発しました。同時に、常識的な推論や、読解、世界知識の質問応答、数学などのより複雑な大規模モデルのタスク全体にわたって、同様の規模の主流モデルと同等のパフォーマンスを実現しました。このフレームワークは、エネルギー効率の高い AI の最前線を前進させるだけでなく、大規模な言語モデルの解釈可能性に関する新しい視点を提供し、将来のニューロモーフィック チップの設計に貴重な洞察を提供します。

ソース:

参考雑誌:

#効率的で解釈可能な #システムのための神経科学と #LLM #の橋渡し

執筆者について: nipponese

Nipponese News編集部は、国内外のニュースを日本語で分かりやすくお届けします。