이 논문은 2026년 7월 14일 공개된 arXiv v1 프리프린트다. Vision-Language-Action(VLA) 강화미세조정에서 환경 상호작용 비용이 크고, 표준 확률적 탐색에만 기대면 궤적이 비슷해지며 탐색이 정체될 수 있다고 본다. 저자들은 이 문제를 탐색 붕괴라 부르기보다, 궤적 다양성이 샘플 효율에 더 직접적이라는 점을 실험으로 확인하려고 한다.
제안한 ExToken은 오프라인 시연에서 추출한 행동 표현을 K-means로 군집화해 이산 탐색 토큰으로 만든다. 학습 초기에는 토큰 조건 SFT로 각 토큰과 행동 모드를 맞추고, RL 단계에서는 초기 상태마다 토큰을 샘플링해 정책 입력에 붙여 구조화된 다양 탐색을 유도한다. 배포 단계에서는 초기 관측을 받아 가장 적절한 토큰을 예측하는 state-conditioned Token Selector를 함께 학습한다.

시뮬레이션 평가는 LIBERO의 네 개 태스크 스위트 Spatial, Object, Goal, Long에서 수행했다. 각 스위트는 10개 태스크로 이루어졌고, 기본 정책은 OpenVLA-OFT, RL 최적화는 RLinf 프레임워크의 GRPO를 사용했다. 비교선은 GRAPE, VLA-RL, TGRPO, SimpleVLA-RL, RLinf-GRPO였고, 상호작용 예산은 RL 스텝마다 512개 롤아웃, 총 100개 RL 스텝으로 고정했다.
| 항목 | 값 | 출처 |
|---|---|---|
| 논문 상태 | arXiv 2607.12931v1, 2026-07-14 | paper header |
| LIBERO 스위트 수 | 4개 | Simulation Experiment Settings |
| 각 LIBERO 스위트 태스크 수 | 10개 | Simulation Experiment Settings |
| RL 상호작용 예산 | 스텝당 512개 롤아웃, 총 100 RL 스텝 | Simulation Experiment Settings |
| LIBERO 평균 성공률 | ExToken 98.2%, RLinf-GRPO 96.8% | Table 1 |
자료: STORIUM 정리
Table 1에서 ExToken은 LIBERO 평균 성공률 98.2%를 기록해 같은 설정의 RLinf-GRPO 96.8%보다 높았다. LIBERO-Long에서는 97.8%로 95.2%보다 높았고, Figure 1의 분석에서는 512개 다양화 롤아웃이 1024개 표준 롤아웃과 비슷한 성능을 보였다. 다만 이 관찰은 LIBERO-Object의 특정 분석에 대한 것이며, 모든 설정에 일반화된다고 말할 수는 없다.
실제 로봇 평가는 Cobot Magic 플랫폼의 AgileX Piper 팔 4대로 수행했다. 과제는 clothes 접기, towel로 테이블 닦기, 물 따르기, 펜 꽂기 네 가지이며, 각 과제의 평가에는 20개 롤아웃을 사용했다. Table 2에서 ExToken은 네 원래 과제 평균이 Evo-RL보다 6.25%포인트 높았다. ExToken의 일반화 조건별 하락 폭은 과제에 따라 5~15%포인트였다. 저자들은 토큰을 단순한 검증용 구성으로 두었고, 토큰 표현과 정책의 공동 최적화, 확률적 토큰 드롭아웃, 더 구조적인 잠재모델, 시간적으로 변하는 토큰이 후속 과제라고 정리한다.
저작권자 © STORIUM 무단전재 및 재배포 금지














