
환경 동역학을 알 수 없고 적절한 보상함수도 없는 안전 중요 과제에서, 전통적 강화학습은 비현실적이라는 문제의식에서 출발한 연구가 나왔다. arXiv 프리프린트에서 연구진은 인간 입력을 중심에 둔 DROPJ를 제안하며, 학습과 배포를 하나의 흐름으로 묶었다. 핵심은 실제 세계의 과거 궤적으로 세계모형을 학습한 뒤, 그 모형 안에서 사용자가 직접 시뮬레이터에서 행동하며 유의미한 시뮬레이션 궤적을 만들고, 그 조각쌍에 대한 선호와 안전 사유를 함께 받아 보상모형을 훈련하는 방식이다.
절차는 네 단계로 정리된다. 먼저 실제 궤적으로 세계모형을 학습하고, 다음으로 학습된 시뮬레이터에서 사용자가 한 번에 다수의 꿈 궤적을 생성한다. 이후 그 궤적의 구간쌍을 샘플링해 인간의 선호와 선택 이유를 수집하고, 마지막으로 이렇게 얻은 정당화된 선호로 보상모형을 만든 뒤 모델예측제어(MPC)로 에이전트를 직접 배포한다. 이 설계는 보상 없는 환경에서도 배포용 정책을 바로 구성하려는 목적에 맞춰져 있다.
실험에서는 실제 사용자와의 상호작용을 통해 두 축을 봤다. 하나는 학습 단계의 계산비용과 인간 부담, 다른 하나는 배포 단계의 성능과 안전이다. 논문은 사용자가 유의미한 시뮬레이션 궤적을 생성하면, 다른 전략보다 학습 중 계산비용이 크게 줄고 배포 성능도 개선될 수 있다고 보고한다. 또 학습된 시뮬레이터 안에서 선호 피드백을 쓰는 방식은 다른 유형의 피드백보다 배포 성능을 뚜렷하게 끌어올렸다고 정리했다.
안전 사유의 효과도 별도로 확인했다. 선호에 안전 정당화가 붙으면, 배포 중 안전성을 유의하게 높이거나 사용자가 미리 정한 안전 관련 요소를 더 우선하도록 만들 수 있다는 결과가 제시됐다. 안전 평가에는 grass, chuckholes, cars에 대한 충돌·통과 비율이 쓰였고, 성능은 배포 중 return으로 측정했다. 계산비용은 학습 단계의 시간집약적 계산 부담으로 보고됐다.
분포 이동과 세계모형 품질에 대한 절제된 분석도 포함됐다. real-world trajectories가 25개일 때는 DROPJ의 보상과 grass rate 저하가 제한적이었지만, 단순 선호 방식보다 정당화가 있는 방법의 이점이 유지됐다고 보고한다. 반면 real-world trajectories가 10개로 줄면 세계모형이 계획을 성공적으로 수행하지 못해 두 지표가 크게 악화됐다고 적었다. 논문은 학습된 세계모형이 정확하지 않으면 MPC 계획 자체가 흔들릴 수 있음을 이 대목에서 드러낸다.
| 구분 | 원문 수치 | 의미/조건 | 근거 위치 |
|---|---|---|---|
| 실제 궤적 수 M | 25일 때 정당화 이점이 유지됨 | world model quality ablation, DROPJ vs plain preferences 비교 | p.24 | source_excerpt |
| 실제 궤적 수 M | 10일 때 return과 grass rate가 크게 악화 | world model cannot plan successfully | p.24 | source_excerpt |
| 질의 총계 | 600 queries | 정당화 이유 분석의 전체 표본 | p.27 | source_excerpt |
| critical queries | 325개 중 287개 합의, 6개 불일치 | 건너뛴 답변 제외 시 disagreement rate 약 2% | p.27 | source_excerpt |
| non-critical queries | 103개 중 75개 합의, 22개 불일치 | 건너뛴 답변 제외 시 disagreement rate 약 23% | p.27 | source_excerpt |
자료: STORIUM 정리
정당화 데이터의 일관성도 별도로 집계했다. 600개 질의의 정당화 이유를 분석한 결과, critical queries는 325개였고 이 중 287개가 합의, 6개가 불일치였으며 비율은 약 2%로 정리됐다. non-critical queries는 103개였고 합의 75개, 불일치 22개로 약 23%였다. 이 수치는 건너뛴 답변을 제외한 값이며, hallucinations나 ambiguous/debatable cases 같은 이유로 생략된 항목도 함께 언급됐다. 전체적으로 이 연구는 인간 선호와 안전 이유를 세계모형 안에서 엮어, 학습 비용과 배포 안전을 동시에 다루려는 접근을 실제 사용자 실험으로 검증한 사례로 읽힌다.
저작권자 © STORIUM 무단전재 및 재배포 금지














