시뮬레이션 Contour 과제에서 PAC-ACT는 성공률 100.0%를 기록했다. ACT와 Diffusion Policy는 각각 60.0%, π0.5는 79.0%였다. Square Assembly에서는 PAC-ACT 98.2%, ACT 51.2%, Diffusion Policy 77.8%, π0.5 62.6%로 보고됐다. Contour 완료 스텝은 평균 485.4에서 170.6으로, 에피소드 시간은 48.5초에서 17.1초로 줄었다.

PAC-ACT는 ACT의 행동 청크와 PPO의 의사결정 단위를 맞춘 후훈련법이다. Actor는 사전학습 ACT의 시각 인코더·Transformer 인코더·행동 디코더를 유지하고 CVAE 잠재 모듈을 제거했으며, Critic은 같은 인코더에 값 헤드를 붙였다. 사전 정책에서 멀어지는 정도를 제어하는 하이브리드 KL 제약과 행동-사전 기반 보상 보정도 결합했다.
평가는 Metal Touch의 Diamond·Cross·Contour와 robomimic Square Assembly에서 진행됐다. LeRobot으로 모은 성공 시연을 50·100·200·400·800개 규모로 구성했고, ACT는 800개 궤적으로 20만 스텝 사전학습했다. PPO에는 청크 c=8, γ=0.99, GAE λ=0.95, clip 0.2, Actor 학습률 1×10^-6, Critic 학습률 1×10^-5, entropy 0.001, β1=3.0, β2=2.0, epoch 8, minibatch 32, 병렬 환경 16개를 사용했다.
Contour의 50개 평가 에피소드와 에피소드당 300스텝 조건에서 ACT의 피크 힘 중앙값은 105.40N, 최대 피크는 8452.5N, 60N 초과 판독 비율은 4.6%였다. PAC-ACT는 중앙값 20.74N, 평균 3.92±4.31N, 최대 120.9N, 초과 비율 0.1%였다. 논문이 제시한 환산으로 초과 판독은 46배, 최대 피크는 70배 감소했다.
| 과제 | ACT 성공률 | Diffusion Policy | π0.5 | PAC-ACT |
|---|---|---|---|---|
| Contour | 60.0% | 60.0% | 79.0% | 100.0% |
| Square Assembly | 51.2% | 77.8% | 62.6% | 98.2% |
자료: STORIUM 정리
결과는 실제 로봇이 아닌 시뮬레이션 중심이다. 시점·조명·동역학 파라미터 변화도 시험하지 않았다. Actor만 불러온 A100-SXM4-80GB 추론은 평균 88.1±23.4ms, P95 125.6ms, P99 172.5ms, 메모리 2.30GB였지만 배치형 장치에서의 실시간 동작과 sim-to-real 전이는 남아 있다. PAC-ACT는 남부과학기술대 Yujie Pang과 Zudong Li가 공개한 arXiv:2607.09590v1 프리프린트다.
저작권자 © STORIUM 무단전재 및 재배포 금지














