
오프라인 강화학습은 고정 데이터만으로 정책을 학습하는 방식이지만, 데이터 분포의 범위를 벗어나면 성능이 쉽게 흔들린다. 이 연구는 동료검토 전 arXiv 프리프린트로, 환경과 추가 상호작용 없이 전문가의 행동 선호 질의를 활용해 정책을 개선하는 틀을 제안한다. 핵심은 두 가지다. 어떤 행동을 물어볼지 더 정보성 있게 고르고, 모은 피드백을 정책 최적화에 맞게 더 유연하게 반영하는 일이다.
기존 방식은 대체로 정책 행동과 데이터 행동 사이의 거리를 기준으로 질의 대상을 고르고, 질의로 얻은 선호를 고정 제약으로 다루는 데 그쳤다. 논문은 이런 방식이 불안정한 업데이트를 낳고 가치 정규화와도 잘 맞지 않는다고 본다. 이에 Morse 신경망으로 정책 행동이 오프라인 데이터에서 얼마나 벗어났는지, 즉 불확실성을 추정하고 그 값을 바탕으로 보수적 질의 전략과 불확실성 인지 적응형 정규화를 함께 구성했다.
질의 단계에서는 데이터 근처의 행동을 우선적으로 선택해 Bellman 업데이트의 안정성을 지키려는 방향을 취한다. 최적화 단계에서는 Morse 점수의 평균과 표준편차를 활용해 데이터 수준 제약을 동적으로 조정한다. 식 자체는 선형 관계를 비선형 스케일 함수로 바꿔, 점수가 평균보다 크게 낮을 때는 더 강한 제약을 주고, 상대적으로 높을 때는 완화하도록 설계했다. 이런 구성은 기존 CQL에 결합되는 형태이며, 연구진은 이를 CQ2L이라고 부른다.
평가는 D4RL 벤치마크에서 이뤄졌다. MuJoCo locomotion과 AntMaze navigation 두 영역의 9개 과제에서 5개 시드로 평균 정규화 점수를 비교했다. CQL과의 비교에서 CQ2L은 MuJoCo 평균 91.4점을 기록해 CQL의 79.1점보다 높았고, AntMaze 평균도 75.8점으로 CQL의 67.56점을 웃돌았다. 또 별도 표에서는 90,000개의 선호 질의만으로, 100,000개 질의를 쓰는 OAP와 250,000단계 추가 환경 상호작용을 사용하는 다른 방법들에 견줘 우수하거나 비슷한 성능을 보였다고 정리했다.
세부 과제별로는 편차가 남아 있다. 예를 들어 MuJoCo의 halfcheetah-medium-v2에서 CQ2L은 67.8±0.6, hopper-medium-v2에서 90.2±6.1, walker2d-medium-expert-v2에서 114.6±3.8을 보였다. AntMaze에서는 antmaze-umaze-v2가 97.4±1.5, antmaze-large-diverse-v2가 73.2±3.4였다. 또 소거 실험은 불확실성 기반 보수적 질의(CQ)와 적응형 정규화(AR)가 모두 기여하며, 둘 중 하나를 빼면 성능이 떨어진다는 점을 확인했다.
| 비교 대상 | 주요 수치 | 근거 위치 |
|---|---|---|
| CQL 대비 CQ2L 평균 점수 | MuJoCo 평균 79.1 → 91.4, AntMaze 평균 67.56 → 75.8 | p.6 Table 1 / p.6 Table 2 |
| 선호 질의 수와 상호작용 조건 | CQ2L: 90,000 preference queries; OAP: 100,000 queries; other methods: additional 250,000 environment steps | p.6 | source_excerpt |
| 소거 실험 구성 | Ours, w/o AR, w/o CQ, w/o AR + CQ | p.7 Figure 3 |
자료: STORIUM 정리
정리하면 이 방법은 오프라인 데이터만으로 학습할 때 생기는 분포 이동 문제를, 불확실성 추정으로 질의 선택과 규제를 함께 조정해 완화하려는 접근이다. 그러나 제시된 결과는 D4RL의 제한된 태스크와 내부 평가에 해당하며, 다른 환경 일반화나 실제 시스템 적용은 이 카드에 없다. 수치 역시 표에 제시된 평균 정규화 점수와 표준편차 범위를 넘어 해석할 근거는 부족하다.
저작권자 © STORIUM 무단전재 및 재배포 금지










