스탠퍼드대 연구진은 양손 이동 로봇의 행동을 한 좌표계에만 담을 때 학습 난이도가 달라지는 문제를 다룬 Mixture of Frames Policy(MoF)를 제안했다. 컵 손잡이에 접근하는 동작은 그리퍼 기준에서 단순하지만, 물체를 세운 채 운반하는 동작은 로봇 몸체 기준이 더 자연스럽다. 이번 결과는 2026년 7월 13일 공개된 arXiv:2607.11884v1 프리프린트로, 동료평가를 거친 확정 연구가 아니다.
MoF는 하나의 정규 확산 상태를 왼손·오른손·몸체·상대궤적 좌표계로 각각 바꾼 뒤 프레임별 전문가가 예측한 노이즈를 다시 공통 좌표계에 모은다. 학습 라우터가 전문가 가중치를 정하는 MoF-MoE와 동일 가중치로 합치는 MoF-Ensemble을 함께 시험했다. 연구진은 중간 노이즈 상태를 직교화하지 않고도 정확히 변환할 수 있도록 SE(3) 행동에 열 벡터 기반 6차원 회전 표현을 사용했다.

시뮬레이션은 BiGym 5개와 DexMimicGen 4개를 합친 양손 조작 과제 9개에서 진행됐다. 각 정책은 과제당 시연 100개로 500에폭 학습했으며, 무작위 시드 3개마다 460~500에폭의 체크포인트 5개를 50에피소드씩 평가했다. 논문은 이 조건의 평균 성공률과 표준오차를 보고했다.
MoF-MoE의 9개 과제 평균 성공률은 66.8%였다. 일반 MoE 확산 정책인 MoE-DP의 55.1%보다 11.7%포인트, 표준 Diffusion Policy의 50.3%보다 16.5%포인트 높았다. 과제별 최적 단일 프레임을 사후 선택한 Oracle Frame은 63.8%였고, 최악 프레임은 이 기준보다 평균 15%포인트 낮아 프레임 선택에 따른 차이를 보였다.
| 정책·좌표계 | 붓기 성공률 | 서빙 성공률 |
|---|---|---|
| MoF-MoE | 85% | 70% |
| 왼손 단일 프레임 | 15% | 55% |
| 오른손 단일 프레임 | 70% | 0% |
| 상대궤적 단일 프레임 | 5% | 60% |
실기 붓기 과제는 시연 257개로 학습한 뒤 컵 색상 5조합과 위치 4종을 섞어 20회 평가했다. MoF-MoE는 17회 성공해 85%를 기록했다. 서빙 과제는 시연 177개와 접시 색상 3종, 서로 다른 테이블 거리 조건에서 20회 평가해 14회인 70%에 성공했다. 다만 HoMMI 수집 환경에는 몸체 프레임 추적이 없어 실기 MoF-MoE는 왼손·오른손·상대궤적 전문가 3개만 사용했다.
검증 범위는 작은 확산 정책, 시뮬레이션 9개 과제, 실제 로봇 과제 2개에 머문다. 후보 좌표계도 설계자가 미리 정해야 하고 정확한 로봇 자세 변환에 의존한다. 라우터는 실행 성공률이 아니라 노이즈 제거 손실로 학습됐다. 대형 비전·언어·행동 모델이나 좌표 추정 오차가 큰 현장에서도 같은 결과가 재현되는지는 확인되지 않았다.
저작권자 © STORIUM 무단전재 및 재배포 금지














