複数のエキスパートポリシーによるResidual Reinforcement Learningを用いた整列動作の学習

柳沼 和樹

15:40 〜 16:00

[1Q4-GS-11-02] 複数のエキスパートポリシーによるResidual Reinforcement Learningを用いた整列動作の学習

〇柳沼和樹¹、中村友昭¹、嘉藤佑亮^2,3、長井隆行^1,4、小澤順^2,3 (1. 電気通信大学、2. 産業技術総合研究所、3. パナソニック、4. 大阪大学)

キーワード：Residual Reinforcement Learning、強化学習、Gaussian process-hidden semi-Markov model (GP-HSMM)

ロボットが効率的にタスクを達成するため，エキスパートによるデモンストレーションから得られた軌道を強化学習によって補正する手法が提案されている．
しかし，従来手法のエキスパートの軌道は一つを想定しており，複雑なタスクではエキスパートが複数のポリシーを利用する場合が考えられる．
本稿では，エキスパートのデモンストレーションから複数のエキスパートポリシーを学習し，
強化学習によって補正を行うResidual Reinforcement Learningを提案する．
実験では物体の整列タスクにより，複数のエキスパートポリシーを活用することで，エキスパートによる軌道のみを用いた場合よりも高精度な整列が可能となることを示す．

講演PDFパスワード認証
論文PDFの閲覧にはログインが必要です。参加登録者の方は「参加者用ログイン」画面からログインしてください。あるいは論文PDF閲覧用のパスワードを以下にご入力ください。

講演情報

[1Q4-GS-11] ロボットと実世界: 機械学習

[1Q4-GS-11-02] 複数のエキスパートポリシーによるResidual Reinforcement Learningを用いた整列動作の学習

パスワード