米ワシントン大学やメタ・スーパーインテリジェンス・ラボなどの研究チームは、AIが作業中の記憶(コンテキスト)をファイルとして自ら書き換え管理する新手法「Context Language Models(CLM)」を発表した。従来の人手による管理手法を上回る精度と効率を両立している。
コンテキストをファイルとして扱うCLMの仕組み
米ワシントン大学、メタ・スーパーインテリジェンス・ラボ、米マサチューセッツ工科大学の研究チームは9月29日、AIモデルが自身の作業領域を自律的に管理する「Context Language Models(CLM)」に関する論文を公開した。従来、AIのコンテキスト管理は人間が設計した枠組み(ハーネス)を用いて、情報の要約や退避、検索を行うのが一般的だった。これに対し、CLMはコンテキストを一つの「ファイル」として扱う。モデルは新たに生成した文章を追記できるほか、Bashコマンドを用いてファイルを直接編集可能だ。この編集内容は、次のターンのコンテキストに即座に反映される。研究チームは、モデル自身に管理を任せることで、より高いパフォーマンスが得られることを実証した。

深層調査ベンチマークで高い精度を実証
研究チームは、Qwen3.6-27BやGPT5.6-Solといった既存モデルにCLMをゼロショットで適用し、その性能を評価した。ビジネス+ITによると、深層調査ベンチマーク「BrowseComp-Plus」では、最も強力なベースラインと比較して精度が11.4%向上し、計算量の指標であるprefix-reuse FLOPsは21.5%削減された。また、端末操作を評価する「TerminalBench 2.1」においても、精度を維持したまま計算量を29.5%削減することに成功している。さらに、12時間規模の「EdgeBench」でも、Codex型の要約手法と比較してスコアが5%高く、計算量は59%少ないという結果が出た。
強化学習とキャッシュ再利用による効率化
CLMの導入による効率化は、強化学習や計算資源の最適化においても確認されている。Qwen3.5-9BをBrowseComp-Plusで強化学習させたケースでは、成績が47.6%向上し、計算量も12%減った。加えて、研究チームは「Suffix Cache Reuse」という技術も開発した。これはキャッシュ済みの計算結果を再利用し、再計算を減らす仕組みだ。推論サーバのSGLangを標準で使用する場合と比較して、モデルの成績を保ったままサーバ側の計算量を35%削減できるとしている。これらの技術は、長時間のタスクや複雑なエージェント群の処理において、顕著な高速化を実現する。
数理最適化における従来手法との比較
CLMの有効性は、数理最適化の分野でも示されている。研究チームの報告によれば、進化型のハーネスである「OpenEvolve」と比較した場合、Heilbronn問題で最大16.8%、円詰め込み問題で3.0%のスコア向上を達成した。6つのリポジトリを扱う24時間のエージェント群のタスクでは、同じ計算量でありながら、高速化の幅が65%大きかったという。これらの数値は、AIが自律的にコンテキストを管理する手法が、特定のタスクにおいて既存の設計手法を上回る潜在能力を持っていることを示している。
AIの自己管理がもたらす新たな課題
AIが自身の「記憶」を自由に書き換えられるようになることは、技術的な進歩と同時に新たな懸念も生じさせている。ビジネス+ITは、この技術の背景には「論文自身が認める新たな攻撃面」が存在すると指摘する。AIが人間によって設計されていない独自の「記憶術」を勝手に編み出すことで、プロンプトインジェクションの抜け穴が生じるリスクなどが指摘されている。AIによる自律的な文脈管理が、今後のAI開発においてどのようにセキュリティと利便性のバランスを保っていくのかが、今後の重要な焦点となる。
AIによる自律的な記憶管理の展望
今回のCLMに関する研究は、AIが作業中の情報をどのように保持・編集すべきかという課題に対し、モデル自身の判断を介在させる新たな方向性を示した。現時点では、長時間のタスクや複雑なリポジトリ操作において従来手法を凌駕する効率性が確認されている。一方で、モデルが自律的に記憶を操作するプロセスは、従来の枠組みに依存しない新たな挙動を誘発する可能性も否定できない。今後、この技術が実運用環境でどのように展開され、どのようなリスク対策が講じられるのかが注目される。