Virginia Commonwealth University와 University of Virginia 연구진은 제한된 온라인 상호작용 예산에서 오프라인으로 학습한 후보 정책을 다시 고르고 미세조정하는 Active Offline-to-Online Reinforcement Learning을 제시했다.
이 연구는 오프라인 강화학습으로 미리 학습한 정책의 성능이 알고리즘과 하이퍼파라미터, 환경, 난수 시드에 따라 크게 흔들릴 수 있다는 점에서 출발한다. 기존 O2O-RL 절차가 가장 높은 추정값의 정책 하나를 택해 튜닝하는 데 비해, 이 방법은 평가와 미세조정 사이의 예산 배분 문제를 함께 다룬다.
방법의 핵심은 각 후보 정책의 미래 성능을 국소 선형 회귀로 예측하고, 그 예측값에 신뢰구간을 더한 UCB로 다음에 미세조정할 정책을 고르는 것이다. 온라인 에피소드마다 선택된 정책을 미세조정한 뒤 평가하고, 최근 값들로 선형 모델을 다시 맞추며, 다른 후보의 UCB가 더 커지면 정책을 바꾼다.

실험에서는 AWAC, IQL, CalQL, ReBRAC 4개 알고리즘과 두 배치 크기·두 학습률의 조합을 사용해 환경마다 16개 후보 정책을 만들었다. 각 정책은 200 K 단계 오프라인 사전학습을 거쳤고, 온라인 단계에서는 반복마다 4 K 전이로 학습하고 1 K 전이로 평가해 총 5 K 전이를 썼다. 주요 실험의 전체 온라인 예산은 데이터셋당 1,000 K 전이였다.
평가는 Minari의 연속제어 환경에서 이뤄졌으며, MAZE, PENDULUM, SWIMMER, REACHER, PUSHER, HOPPER, CHEETAH, WALKER, ANT를 포함했다. Table 1에서 ACTIVE의 전체 평균은 82.3 ± 1.9로, RANDOM 16.3 ± 2.1, BEST 28.6 ± 2.4, FTS 64.3 ± 2.0, FTA 63.1 ± 0.7보다 높았다. MAZE 전체 평균은 97.3 ± 2.0, HOPPER는 87.2 ± 9.0, ANT는 53.6 ± 10.9였다.
연구진은 750 K 전이의 더 작은 예산에서도 Table 2를 제시했다. 이때 ACTIVE의 전체 평균은 76.6 ± 1.5였고, WINDOW SIZE ablation(Table 3)에서는 w=3, 5, 6, 7을 비교했다. 전체 평균은 w=3에서 -5.6 ± 1.9, w=5에서 -1.3 ± 1.4, w=6에서 -1.9 ± 2.6, w=7에서 -1.5 ± 3.5였다.
| 항목 | 조건/값 | 결과 | source_locator |
|---|---|---|---|
| 주요 실험 전체 평균 | ACTIVE / 1,000 K 전이 | 82.3 ± 1.9 | 5.4 Main Results, Table 1, Overall Average |
| MAZE 전체 평균 | ACTIVE | 97.3 ± 2.0 | 5.4 Main Results, Table 1, MAZE Average |
| 더 작은 예산 전체 평균 | ACTIVE / 750 K 전이 | 76.6 ± 1.5 | 5.5 Smaller Budget, Table 2, Overall Average |
| 윈도 크기 비교 | w=3 / w=5 / w=6 / w=7 | -5.6 ± 1.9 / -1.3 ± 1.4 / -1.9 ± 2.6 / -1.5 ± 3.5 | 5.6 Ablation Study of Window Size, Table 3, Overall Average |
자료: STORIUM 정리
Fig. 1은 데이터 수집, 오프라인 학습, 후보 선택과 튜닝이 이어지는 흐름을 도식화하며, Fig. 3은 SWIMMER에서 보상 곡선이 증가·정체·하락을 반복할 수 있음을 보여준다. 논문은 동료검토 전 상태의 arXiv 원고이며, SWIMMER와 ANT처럼 초기 단계에서 개선 신호가 약한 환경에서는 전체 예산을 소진할 수 있다는 한계도 함께 제시했다.
저작권자 © STORIUM 무단전재 및 재배포 금지














