강화학습은 로봇 제어에서 성능을 내는 대신, 표본 효율이 낮고 새로운 조건으로의 일반화가 약하다는 한계를 자주 드러낸다. 이 논문은 이러한 문제를 줄이기 위해 기구학적 대칭성과 Koopman 선형화를 함께 쓰는 SKooP를 제안한다. 논문은 동료검토 전 arXiv 프리프린트 상태이며, Cyberdog 2 4족 로봇의 두발 보행을 시뮬레이션에서 검증했다.
핵심은 정책과 함께 시스템 동역학의 Koopman 모델을 학습하고, 그 예측된 잠재 상태를 critic의 특권적 관측으로 넣는 데 있다. 여기에 actor, critic, encoder, decoder 전반에 군 대칭 제약을 걸어, 반사 대칭을 지닌 보행에서 더 일관된 정책을 유도한다. 저자들은 이를 통해 critic이 더 부드럽고 정보량이 큰 특징을 바탕으로 가치함수를 학습할 수 있다고 설명한다.

실험은 stand dance, walk slope, push door의 세 과제에서 이뤄졌다. 모두 로봇이 두발 자세로 일어난 뒤 걷는 문제이며, 훈련은 Isaac Gym에서 8192개 병렬 환경과 5개 무작위 시드로 수행됐다. stand dance와 walk slope는 30000 iterations, push door는 18000 iterations를 사용했고, 잠재 상태 차원은 상태 차원의 3배로 설정했다. 평균 기준 단일 학습 반복 시간은 stand dance에서 PPO 1.978 s, PPOeqic 2.245 s, SKooP 2.651 s였다.
결과는 대칭 제약의 유무와 Koopman 예측의 유무를 나눠 비교한 표에서 분명했다. push door에서 PPO는 오른쪽 문에서는 성공률 70.01 ± 6.65%, 왼쪽 미러 과제에서는 0.00 ± 0.00%였다. 반면 SKooP는 오른쪽 82.77 ± 2.96%, 왼쪽 77.70 ± 6.66%를 기록했고, 대칭 지수 SI는 8.49 ± 4.26%였다. OOD 초기 자세에서도 SKooP의 오른쪽/왼쪽 성공률은 47.65 ± 2.59%와 46.18 ± 4.37%로 거의 대칭적이었다.
행동 궤적 분석도 같은 방향을 가리켰다. stand dance에서 SKooP의 뒤다리 관절은 좌우가 비슷한 범위로 진동했고, phase MAE는 0.170 ± 0.015 rad로 PPO의 0.216 ± 0.006 rad보다 낮았다. 좌우 진폭 차이 ∆θdiff도 SKooP가 0.137 ± 0.054 rad로 PPO의 0.100 ± 0.042 rad와 같은 수준의 안정적 대칭성을 보였다. 학습 곡선에서는 대칭을 쓰는 방법들, 특히 SKooP와 SKooP-NoPred가 초반 수렴이 더 가팔랐고, push door처럼 비대칭성이 강한 과제에서 SKooP가 보상과 수렴 속도 모두에서 우세했다.
| 비교 항목 | 수치 | 근거 |
|---|---|---|
| push door 성공률/대칭성 | PPO: Right SR 70.01 ± 6.65%, Left SR 0.00 ± 0.00%, SI 199.99 ± 0.02% / SKooP: Right SR 82.77 ± 2.96%, Left SR 77.70 ± 6.66%, SI 8.49 ± 4.26% | Table I, push door ablation study (% mean ± std) |
| stand dance 관절 대칭 | SKooP phase MAE 0.170 ± 0.015 rad, ∆θ 0.813 ± 0.049 rad, ∆θdiff 0.137 ± 0.054 rad | Table II, stand dance steady-state gait metrics averaged over 5 seeds |
| Koopman 모델 안정성 | push door ecDAE |λ(A)|max 1.000 ± 0.003, cDAE 0.572 ± 0.017 | Table III, summary of learned Koopman model stability and controllability metrics |
| sim-to-sim 추적 오차 | Mujoco에서 ωz MSE 0.2904~0.6017, vxy MSE 0.0227~0.0257 | Table V, SKooP sim-to-sim robustness on stand dance |
자료: STORIUM 정리
Koopman 모델 자체에 대한 점검도 포함됐다. push door에서 ecDAE는 cDAE보다 5-step state prediction MSE가 오른쪽 1.778 ± 0.153, 왼쪽 1.848 ± 0.196으로 더 낮았고, cDAE는 각각 2.144 ± 0.078, 3.150 ± 0.143이었다. 시뮬레이터 간 전이도 확인했는데, stand dance 정책을 Isaac Gym에서 Mujoco로 옮겨도 모든 rollout이 실패하지 않았고, 입력 조건별 vxy MSE는 0.0227~0.0406, ωz MSE는 0.1494~0.6017 범위였다. 저자들은 대칭성과 Koopman 예측을 함께 쓰는 구성이 학습 속도, 보상, 일반화, 그리고 시뮬레이터 이동성까지 동시에 개선했다고 정리한다.
1차 출처: https://arxiv.org/abs/2607.11624
저작권자 © STORIUM 무단전재 및 재배포 금지














