1732279640
2024-11-22 05:00:00
ロボット工学から医学、政治学に至るまでの分野で、あらゆる種類の有意義な決定を下せるように AI システムを訓練しようとしています。たとえば、AI システムを使用して渋滞した都市の交通をインテリジェントに制御することで、安全性や持続可能性を向上させながら、ドライバーがより速く目的地に到着できるようにすることができます。
残念ながら、AI システムに適切な決定を下すように教えるのは簡単な作業ではありません。
これらの AI 意思決定システムの基礎となる強化学習モデルは、実行するように訓練されたタスクのわずかな違いに直面すると、依然として失敗することがよくあります。交通の場合、モデルは制限速度、車線数、交通パターンが異なる一連の交差点を制御するのに苦労する可能性があります。
変動性のある複雑なタスクに対する強化学習モデルの信頼性を高めるために、MIT の研究者は、強化学習モデルをトレーニングするためのより効率的なアルゴリズムを導入しました。
このアルゴリズムは、AI エージェントのトレーニングに最適なタスクを戦略的に選択し、関連するタスクの集合内のすべてのタスクを効果的に実行できるようにします。交通信号制御の場合、各タスクは、市内のすべての交差点を含むタスク スペース内の 1 つの交差点になります。
この方法では、アルゴリズムの全体的な有効性に最も寄与する少数の交差に焦点を当てることで、トレーニング コストを低く抑えながらパフォーマンスを最大化します。
研究者らは、一連のシミュレートされたタスクにおいて、彼らの手法が標準的なアプローチよりも 5 ~ 50 倍効率的であることを発見しました。この効率の向上により、アルゴリズムがより良いソリューションをより迅速に学習することができ、最終的に AI エージェントのパフォーマンスが向上します。
「既成概念にとらわれずに考えることで、非常にシンプルなアルゴリズムで驚くべきパフォーマンスの向上を確認することができました。それほど複雑ではないアルゴリズムは、実装が簡単で他の人にとっても理解しやすいため、コミュニティに採用される可能性が高くなります」と、主著者であるトーマス D. アンド バージニア W. カボットのキャリア開発准教授、キャシー ウー氏は述べています。土木環境工学 (CEE) およびデータ・システム・社会研究所 (IDSS) で博士号を取得し、情報意思決定システム研究所 (LIDS) のメンバー。
彼女はに参加しています 紙 筆頭著者であるCEE大学院生Jung-Hoon Choによる。 Vindula Jayawardana 氏、電気工学およびコンピュータ サイエンス学科 (EECS) の大学院生。そしてIDSS大学院生のシルイ・リーさん。この研究は神経情報処理システム会議で発表される予定です。
妥協点を見つける
都市内の多くの交差点で信号機を制御するアルゴリズムをトレーニングするには、エンジニアは通常、2 つの主要なアプローチのいずれかを選択します。彼女は、その交差点のデータのみを使用して交差点ごとに 1 つのアルゴリズムを個別にトレーニングすることも、すべての交差点のデータを使用してより大きなアルゴリズムをトレーニングして、それをそれぞれの交差点に適用することもできます。
しかし、それぞれのアプローチには欠点もあります。タスク (特定の交差点など) ごとに個別のアルゴリズムをトレーニングすることは、膨大な量のデータと計算を必要とする時間のかかるプロセスですが、すべてのタスクに対して 1 つのアルゴリズムをトレーニングすると、パフォーマンスが標準以下になることがよくあります。
ウー氏とその共同研究者らは、これら 2 つのアプローチの間で最適な点を探しました。
彼らの手法では、タスクのサブセットを選択し、タスクごとに 1 つのアルゴリズムを個別にトレーニングします。重要なのは、すべてのタスクに対するアルゴリズムの全体的なパフォーマンスを向上させる可能性が最も高い個々のタスクを戦略的に選択することです。
これらは、ゼロショット転移学習と呼ばれる強化学習分野の一般的なトリックを活用しており、すでにトレーニングされたモデルがさらにトレーニングされることなく新しいタスクに適用されます。転移学習を使用すると、モデルは多くの場合、新しい隣接タスクで非常に優れたパフォーマンスを発揮します。
「すべてのタスクについてトレーニングするのが理想的であることはわかっていますが、それらのタスクのサブセットについてトレーニングを行って、その結果をすべてのタスクに適用してもパフォーマンスの向上が見られるのではないかと考えました」とウー氏は言います。
期待されるパフォーマンスを最大化するにはどのタスクを選択すべきかを特定するために、研究者らはモデルベース転移学習 (MBTL) と呼ばれるアルゴリズムを開発しました。
MBTL アルゴリズムには 2 つの部分があります。 1 つは、各アルゴリズムが 1 つのタスクで独立してトレーニングされた場合にどの程度うまく機能するかをモデル化することです。次に、各アルゴリズムが他のタスクに転送された場合にどの程度パフォーマンスが低下するかをモデル化します。これは汎化パフォーマンスとして知られる概念です。
汎化パフォーマンスを明示的にモデル化することで、MBTL は新しいタスクのトレーニングの価値を推定できます。
MBTL はこれを順番に実行し、最初に最高のパフォーマンス向上につながるタスクを選択し、次に全体的なパフォーマンスに最大の限界改善をもたらす追加のタスクを選択します。
MBTL は最も有望なタスクのみに焦点を当てるため、トレーニング プロセスの効率を大幅に向上させることができます。
トレーニングコストの削減
研究者らがこの技術を、交通信号の制御、リアルタイムの速度勧告の管理、いくつかの古典的な制御タスクの実行などのシミュレートされたタスクでテストしたところ、他の方法よりも 5 ~ 50 倍効率的でした。
これは、はるかに少ないデータでトレーニングするだけで同じ解決策に到達できることを意味します。たとえば、効率が 50 倍向上すると、MBTL アルゴリズムはわずか 2 つのタスクでトレーニングし、100 のタスクからのデータを使用する標準メソッドと同じパフォーマンスを達成できます。
「2 つの主要なアプローチの観点からすると、これは、他の 98 タスクからのデータが必要なかったか、100 タスクすべてのトレーニングがアルゴリズムを混乱させるため、最終的にパフォーマンスが私たちのものよりも悪くなるということを意味します」とウー氏は言います。
MBTL では、トレーニング時間を少しでも追加するだけで、パフォーマンスが大幅に向上する可能性があります。
研究者らは将来的に、高次元のタスク空間など、より複雑な問題に拡張できる MBTL アルゴリズムを設計する予定です。彼らはまた、自分たちのアプローチを現実世界の問題、特に次世代モビリティ システムに適用することにも興味を持っています。
この研究の資金の一部は、国立科学財団キャリア賞、関井教育財団博士奨学金プログラム、およびアマゾン ロボティクス博士フェローシップによって提供されています。
#MIT #の研究者がより信頼性の高い #エージェントをトレーニングする効率的な方法を開発 #マサチューセッツ工科大学ニュース