日本語版
最新ニュース
世界

メタ強化学習に関する新研究 その3(機械学習) | Monodeep Mukherjee 著 | 2024年3月

微分可能な凸計画法による適応可能な安全性保証のための制約付きメタ強化学習(arXiv)著者 : チョ・ミンジェ、 孫荘荘要約 : 人工知能における目覚ましい成果にもかかわらず、一か八かの現実世界環境における学習対応システムの導入可能性は依然として根強い課題に直面しています。 たとえば、自動運転、ロボット操作、ヘルスケアなどの安全性が重要な領域では、高いパフォーマンスを達成するだけでなく、所定の制約に準拠することが重要です。 さらに、環境パラメータが変化する可能性がある非定常領域では、適応性が最も重要になります。 安全性と適応性は新世代 AI の重要な資質として認識されていますが、現在のアプローチでは、制約された設定において効果的な適応性のあるパフォーマンスは実証されていません。 したがって、この論文は、メタ学習アプローチ (学習から学習) のレンズを通して制約付き問題を解決することにより、非定常環境における安全性を確保するという独自の課題を研究することにより、新境地を開拓します。 制約のないメタ学習は、バイレベルの性質により損失のエンドツーエンドの微分においてすでに複雑さに直面していますが、その制約付きメタ学習では、タスクレベルの更新に課せられた制約が微分を複雑にするため、さらなる困難が生じます。プロセス。 この問題に対処するために、まず、微分可能な凸プログラミングを使用して複数のタスクにわたって凸制約ポリシーの連続更新を採用します。これにより、エンドツーエンドの微分を可能にすることで、制約のあるシナリオでのメタ学習が可能になります。 このアプローチにより、エージェントは安全上の制約を確実に遵守しながら、非定常性下での新しいタスクに迅速に適応できるようになります。 #メタ強化学習に関する新研究 #その3機械学習 #Monodeep #Mukherjee #著 #2024年3月

メタ強化学習に関する新研究 その3(機械学習) |  Monodeep Mukherjee 著 |  2024年3月

1709753458
2024-03-06 19:18:32

  1. 微分可能な凸計画法による適応可能な安全性保証のための制約付きメタ強化学習(arXiv)

著者 : チョ・ミンジェ孫荘荘

要約 : 人工知能における目覚ましい成果にもかかわらず、一か八かの現実世界環境における学習対応システムの導入可能性は依然として根強い課題に直面しています。 たとえば、自動運転、ロボット操作、ヘルスケアなどの安全性が重要な領域では、高いパフォーマンスを達成するだけでなく、所定の制約に準拠することが重要です。 さらに、環境パラメータが変化する可能性がある非定常領域では、適応性が最も重要になります。 安全性と適応性は新世代 AI の重要な資質として認識されていますが、現在のアプローチでは、制約された設定において効果的な適応性のあるパフォーマンスは実証されていません。 したがって、この論文は、メタ学習アプローチ (学習から学習) のレンズを通して制約付き問題を解決することにより、非定常環境における安全性を確保するという独自の課題を研究することにより、新境地を開拓します。 制約のないメタ学習は、バイレベルの性質により損失のエンドツーエンドの微分においてすでに複雑さに直面していますが、その制約付きメタ学習では、タスクレベルの更新に課せられた制約が微分を複雑にするため、さらなる困難が生じます。プロセス。 この問題に対処するために、まず、微分可能な凸プログラミングを使用して複数のタスクにわたって凸制約ポリシーの連続更新を採用します。これにより、エンドツーエンドの微分を可能にすることで、制約のあるシナリオでのメタ学習が可能になります。 このアプローチにより、エージェントは安全上の制約を確実に遵守しながら、非定常性下での新しいタスクに迅速に適応できるようになります。

#メタ強化学習に関する新研究 #その3機械学習 #Monodeep #Mukherjee #著 #2024年3月

執筆者について: nipponese

Nipponese News編集部は、国内外のニュースを日本語で分かりやすくお届けします。