1750344336
2025-06-18 16:00:00
現代の大きな言語 モデル(LLM)は美しいソネットとエレガントなコードを書くかもしれませんが、経験から学ぶ初歩的な能力さえありません。
マサチューセッツ工科大学(MIT)の研究者は、有用な新しい情報に応じて独自のパラメーターを微調整することにより、LLMが改善し続ける方法を考案しました。
作業は建物への一歩です 人工知能 継続的に学習するモデル – フィールドの長年の目標と、マシンがより忠実に人間の知性を模倣する場合に重要なもの。それまでの間、ユーザーの興味や好みを含む新しい情報をよりよく組み込むことができるチャットボットやその他のAIツールを提供することができます。
自己適応言語モデル(SEAL)と呼ばれるMITスキームでは、LLMに独自の合成トレーニングデータを生成し、受信した入力に基づいて更新手順を学習させることが含まれます。
「最初のアイデアは、トークンかどうかを探ることでした [units of text fed to LLMs and generated by them] モデルの強力な更新を引き起こす可能性があります」と、SEALの開発に関与するMITの博士課程学生であるJyothish Pari氏は言います。パリは、モデルの出力を使用してトレーニングできるかどうかを確認することであると言います。
SEALの構築に関与するMIT学部の研究者であるAdam Zweigerは、新しいモデルがより複雑な推論を実行することでより良い解決策に「推論」できるが、モデル自体は長期的にこの推論から利益を得ることはないと付け加えています。
対照的に、シールは新しい洞察を生成し、それを独自の重みまたはパラメーターに折ります。たとえば、アポロ宇宙プログラムが直面している課題に関する声明を考慮して、モデルは声明の意味を説明しようとする新しい文章を生成しました。研究者は、これを人間の学生が学習を支援するためにメモを書いてレビューする方法と比較しました。
次に、システムはこのデータを使用してモデルを更新し、新しいモデルが一連の質問にどれだけうまく回答できるかをテストしました。そして最後に、これはaを提供します 強化学習 モデルをその全体的な能力を向上させ、学習を続けるのに役立つ更新に向けてモデルを導くのに役立つシグナル。
研究者は、2つのオープンソースモデルの中小サイズのバージョンであるMetaのアプローチをテストしました ラマ そしてアリババの Qwen。彼らは、このアプローチは、はるかに大きなフロンティアモデルでも機能するはずだと言います。
研究者たちは、テキストのシールアプローチと、ARCと呼ばれるベンチマークをテストし、抽象的な推論の問題を解決するAIモデルの能力を測定しました。どちらの場合も、シールにより、モデルが初期トレーニングを超えて学習を続けることができることがわかりました。
作品を監督したMITの教授であるPulkit Agrawalは、SEALプロジェクトはAIの重要なテーマに触れていると言います。彼は、AIモデルをよりパーソナライズするのに役立つために使用できると言います。 「LLMは強力ですが、彼らの知識を止めたくありません」と彼は言います。
シールは、AIが無期限に改善する方法ではありません。一つには、Agrawalが指摘しているように、テストされたLLMSは「壊滅的な忘却」として知られるものに苦しんでいます。新しい情報を摂取すると、古い知識が単純に消えてしまう厄介な効果があります。これは、人工ニューラルネットワークと生物学的ネットワークの根本的な違いを示している可能性があります。 PariとZweiglerはまた、Sealは計算的に集中的であり、新しい学習期間を最も効果的にスケジュールするために最善の方法がまだ明確ではないことに注意してください。楽しいアイデアの1つは、人間のように、おそらくLLMが新しい情報が統合されている「睡眠」の期間を経験できるということです。
それでも、そのすべての制限については、SEALはさらなるAI研究のためのエキサイティングな新しい道です。それは、将来のフロンティアAIモデルへの道を見つけるものかもしれません。
学習を続けることができるAIについてどう思いますか? [email protected]にメールを送信してください。
#このAIモデルは学習を停止することはありません