1714802198
2024-05-04 05:53:16
- NLBAC: 安定かつ安全な強化学習のための神経常微分方程式ベースのフレームワーク(arXiv)
著者: リクン・ジャオ、 柯岩ミャオ、 コンスタンティノス・ガツィス、 アントニス・パパクリストドゥロウ
要約: 強化学習 (RL) はビデオ ゲームやロボット工学などのアプリケーションで優れていますが、サンプル効率が低いためモデルフリー アルゴリズムの使用が法外な可能性がある現実世界のシステムを制御するために RL を使用する場合、安全性と安定性を確保することは依然として課題です。 この論文では、まず RL システムの安全性と安定性の定義を示し、次に神経常微分方程式 (NODE) を利用してシステム ダイナミクスを近似し、制御を統合する神経常微分方程式ベースのリアプノフ バリア アクター クリティカル (NLBAC) フレームワークを紹介します。システムの安全性と安定性の維持を支援するアクタークリティカル手法を備えたバリア関数 (CBF) およびコントロール リアプノフ関数 (CLF) フレームワーク。 このフレームワーク内で、拡張ラグランジュ法を使用して RL ベースのコントローラー パラメーターを更新します。 さらに、安全性のための CBF 制約と安定性のための CLF 制約を同時に満たすことができない状況では、追加のバックアップ コントローラーを導入します。 シミュレーション結果は、このフレームワークがシステムを望ましい状態に導き、他の方法と比較してより良いサンプル効率で安全制約の違反を少なくできることを示しています。
#機械学習研究における常微分方程式の使用パート4 #Monodeep #Mukherjee #著 #2024年5月