DenseReward는 로봇 조작에서 에피소드 종료의 이진 성공 신호에만 의존하던 보상 모델의 한계를 다룬다. 저자들은 성공 시연만이 아니라 충돌, 미스그랩, 낙하, 복구 같은 실패 궤적을 자동으로 합성해 프레임 단위 보상을 학습한다. 입력은 언어 지시와 현재 프레임, 최근 과거 프레임이며, 출력은 현재 시점의 task progress를 나타내는 0.000~1.000 스칼라 보상이다.
방법은 Reach, Grasp, Lift, Move, Place의 다섯 단계로 조작을 분해하고, 단계별 교란으로 물리적으로 그럴듯한 실패를 만드는 파이프라인에 있다. GraspNet은 최대 50개의 grasp 후보를 제안하고 CuRobo는 충돌을 고려한 경로를 잡는다. DenseReward는 Qwen3-VL-4B-Instruct 위에 LoRA로 미세조정하며, 최근 관측과 최대 두 개의 과거 프레임을 함께 보게 한다.

데이터셋은 26,579개 에피소드와 7,560,942개 프레임 수준 샘플로 이뤄지며, DROID, Isaac, RoboSuite, LIBERO를 포함한다. Appendix의 분류는 DROID 2,986, Isaac 12,481, RoboSuite 9,287, LIBERO 1,825 에피소드다. 실패 유형은 collision, miss, fall, smooth, recover로 나뉘며, validity filtering으로 물리적으로 맞지 않는 궤적을 걸러낸다.
| 비교 항목 | DenseReward | 대표 baseline | 수치/설명 |
|---|---|---|---|
| 보상 예측 MAE Overall | 0.081 | RoboReward-8B 0.230 | 낮을수록 좋음 |
| 보상 예측 MAE DROID | 0.259 | Qwen3-VL-4B 0.532 | 낮을수록 좋음 |
| MPC 평균 최소거리 | 0.229 | VLAC-8B 0.358 | can·cup·lemon, 과제당 10회, 낮을수록 좋음 |
| 컵 쌓기 성공률 | 40%→80% | DSRL+고정 π0 | 10회 |
| 공을 바구니에 넣기 성공률 | 30%→70% | DSRL+고정 π0 | 10회 |
자료: STORIUM 정리
보상 예측 MAE에서 DenseReward는 overall 0.081로 가장 낮았다. 소스별로는 DROID 0.259, Isaac 0.081, RoboSuite 0.051, LIBERO 0.044다. 비교 대상은 Qwen3-VL-4B/8B, Molmo2-4B/8B, RoboReward-4B/8B, Robometer였고, RoboReward-8B의 overall MAE는 0.230이었다. MPC에서는 can, cup, lemon 세 작업의 평균 최소 end-effector-to-object 3D 거리로 평가했고, 10개 평가 에피소드의 평균에서 DenseReward가 0.229로 RoboReward-4B 0.267, RoboReward-8B 0.300, VLAC-2B 0.347, VLAC-8B 0.358보다 낮았다.
실세계 실험에서는 DSRL로 고정된 π0 정책을 fine-tuning했다. 대상 과제는 stack the cups와 put ball in basket이며, 각 정책은 10 trials로 평가했다. DenseReward를 더하면 성공률이 stack the cups에서 40%에서 80%로, put ball in basket에서 30%에서 70%로 올랐다. 저자들은 도구 사용과 긴 시간축 과제, 인간 선호 피드백을 후속 과제로 남겼다.
저작권자 © STORIUM 무단전재 및 재배포 금지










