
계층형 강화학습은 전략 수립과 원시 행동 실행을 나누어 긴 시간축 과제를 다루지만, 고수준 정책은 환경으로부터 성긴 지연 피드백만 받는다는 약점이 있다. arXiv에 공개된 첫 원고인 이 논문은 그 고수준 서브골 선택을 더 신중하게 만들기 위해, 저수준 정책이 실제로 수행할 수 있는지에 초점을 둔 동역학 인센티브를 설계했다.
핵심은 원시 전이 대신 여러 스텝을 묶은 coarse dynamics, 즉 고수준이 작동하는 시간 척도에서의 환경 전이를 사용하는 점이다. 연구진은 𝑐-step terminal-state distribution의 분산을 줄이는 방향으로 고수준 보상을 만들고, 이를 potential-based reward shaping 형태로 정의했다. 본문에서는 분산 지표로 공분산의 trace를 썼고, 이를 Mixture Density Network(MDN)으로 근사했다.
검증은 MuJoCo 환경에서 진행됐으며, 각 방법을 5M environment steps와 5개 random seed로 학습했다. 비교 대상으로는 HRAC 같은 기존 계층형 방법이 포함됐다. 평가 그림과 본문 설명에 따르면, S3는 manager horizon c=10에서 평균 step 수를 최소화하는 경향을 보였고, 이 c=10을 “stability region”으로 해석했다.
제안 방식은 고수준의 intrinsic reward를 매 temporally abstracted step마다 주어, 고수준이 위험을 덜 지는 서브골을 고르게 만드는 쪽으로 작동한다. 본문은 그 결과가 non-stationary long-horizon environments에서 state-of-the-art HRL methods보다 나았다고 기술한다. 그러나 이 결론은 논문 내 제시된 MuJoCo 벤치마크와 내부 평가 범위에 한정된다.
그림 5에서는 Ant Fall, Ant Push, Ant Maze에서 S3와 HRAC의 manager-guided trajectories를 50회 평가로 비교했다. 세 환경 모두에서 consecutive subgoals로 만든 경로를 시각화했으며, S3 쪽 경로는 고수준 제안이 worker의 실행 가능 범위 안에서 이어지도록 유도되는 양상을 보여준다. 논문은 이 점을 불확실성을 제약한 coarse dynamics 기반 설계가 작동했다는 근거로 제시한다.
| 항목 | 값 | 근거 |
|---|---|---|
| 검증 환경 | MuJoCo environments | p.1 source_excerpt / p.6 source_excerpt |
| 학습 규모 | 각 방법 5M environment steps, five random seeds | p.6 source_excerpt |
| 고수준 시간 간격 | manager horizon interval c* = 10 | p.6 source_excerpt / p.7 source_excerpt |
| 비교 대상 | HRAC [33] | p.2 source_excerpt / p.3 source_excerpt |
| 평가 그림 범위 | Ant Fall, Ant Push, Ant Maze에서 50 evaluation runs | p.8 source_excerpt |
자료: STORIUM 정리
연구의 요지는 고수준 정책이 단순히 도달 가능한 상태를 고르는 데서 나아가, 저수준이 신뢰성 있게 수행할 수 있는 서브골만 선택하도록 만드는 데 있다. 그 수단으로는 MDN이 추정한 coarse predictive uncertainty가 쓰였고, 본문은 within-mode와 between-mode 분해까지 제시해 예측 분산의 구조를 설명했다.
저작권자 © STORIUM 무단전재 및 재배포 금지












