
법률 문서 번역에서 강화학습 기반 정렬이 어디까지 품질을 끌어올리고, 그 대가로 얼마를 치르는지 묻는 arXiv 프리프린트가 나왔다. 이 연구는 검증 가능한 보상을 쓰는 RLVR을 Qwen3.5 4B와 9B에 적용해, 학습과 추론 단계에서 모델의 reasoning trace를 넣거나 빼는 방식으로 효과를 갈라 보았다.
핵심은 추론의 유무를 하나의 단계에서만 조절해 품질 변화의 원인을 좁혀 본 점이다. 연구진은 legal translation에서 RLVR이 유력하다는 최근 흐름이 실제로는 reasoning 자체의 효과인지, 아니면 훈련 방식 전반의 효과인지 질문을 던진 뒤, SwiLTra-Bench 데이터셋에서 이를 시험했다.
실험 설정은 비교적 분명하다. Qwen3.5 4B·9B를 GRPO로 미세조정했고, 각 입력 문장마다 4개의 응답을 샘플링했다. 학습 데이터는 100개 단위로 중간 체크포인트를 저장했으며, 평가에는 약 18.1k 문장쌍으로 이뤄진 테스트셋과 4,000개 검증 샘플의 일부 구간이 사용됐다. 성능 평가는 chrF, METEOR, COMET, MetricX 네 지표로 진행됐고, 특히 COMET에 가장 큰 비중을 뒀다.
결과는 추론 단계에서 생각을 켠 설정이 가장 유리하다는 쪽으로 모였다. 표 1에서 Qwen3.5 9B는 학습과 추론 모두 thinking을 켠 조합[T:✓, I:✓]에서 COMET 82.50, chrF 57.51, METEOR 54.61, MetricX 3.78을 기록했다. 같은 9B라도 학습은 thinking을 쓰고 추론은 끈 경우[T:✓, I:✗] COMET은 80.80으로 낮아졌고, 학습도 추론도 끈 기준[✗, ✗]은 81.66이었다. 4B에서도 [T:✓, I:✓]는 COMET 82.05로 가장 높았고, [✗, ✗]은 79.09였다.
비용 측면에서는 반대의 그림이 분명하다. 4B의 [T:✓, I:✓]는 추론 토큰 8.08M, [T:✗, I:✗]는 1.08M이었고, 9B의 경우 각각 6.27M과 1.05M이었다. 학습 없이 추론만 thinking을 켠 [✗, I:✓]는 4B에서 19.85M, 9B에서 20.67M 토큰으로 늘어나며, 본문은 이 설정이 추론 비용을 3배로 키운다고 적었다. 반대로 reasoning을 학습에 포함하면 출력이 더 간결해져 Qwen3.5에서 토큰 수가 최대 70% 줄었다고 정리했다.
| 모델·설정 | COMET / 비용 / 토큰 | 비고 |
|---|---|---|
| Qwen3.5 4B [T:✓, I:✓] | 82.05 ± 0.06 / $0.24 / 8.08M | 표 1, SwiLTra-Bench test set |
| Qwen3.5 4B [T:✗, I:✗] | 79.09 ± 0.07 / $0.07 / 1.08M | 표 1, SwiLTra-Bench test set |
| Qwen3.5 9B [T:✓, I:✓] | 82.50 ± 0.06 / $0.28 / 6.27M | 표 1, SwiLTra-Bench test set |
| Qwen3.5 9B [T:✗, I:✗] | 81.66 ± 0.06 / $0.09 / 1.05M | 표 1, SwiLTra-Bench test set |
자료: STORIUM 정리
이 프리프린트의 결론은 법률 번역 맥락에서 일정 규모의 데이터만으로도 수익이 줄어드는 지점을 확인했다는 데 있다. SwiLTra-Bench에서는 약 1,500개 훈련 샘플 부근에서 성능이 평형에 도달했고, 그 이후의 미세한 향상은 더 큰 비용을 요구했다. 즉, reasoning은 품질을 높이지만 항상 그 비용을 상쇄하는 것은 아니며, 특히 추론 단계에서의 사용 여부가 비용·품질 균형을 가르는 핵심 변수로 제시됐다.
저작권자 © STORIUM 무단전재 및 재배포 금지














