대형 언어모델의 응답을 평가하거나 보상 신호로 쓰려면 무엇을 좋은 답으로 볼지 정한 rubric이 필요하다. 하지만 질의별로 믿을 만한 rubric을 만드는 일은 쉽지 않다. 이 arXiv 프리프린트는 외부 주석이나 모델 학습 없이, 질의 하나만으로 빈 집합에서 rubric set을 진화시키는 틀을 제안한다.
핵심은 후보 rubric을 바로 채택하지 않고, 합성한 rubric-conditioned response pairs로 먼저 검증하는 데 있다. 하나는 기존 rubric은 유지한 채 후보 rubric만 만족·불만족이 갈리도록 만든 local pair이고, 다른 하나는 처음부터 다른 전략으로 쓴 alternative-answer pair다. 두 비교가 모두 만족 쪽을 더 낫다고 가리킬 때만 후보를 넣는다.

연구진은 이를 Rubrics on Trial이라 부르며, ADD와 SPLIT 패치로 이루어진 나무 구조의 진화 과정을 설계했다. 제안자는 현재 rubric set과 과거 피드백을 보고 새 원자 rubric을 추가하거나 묶인 rubric을 나누는 패치를 낸다. 각 단계의 판단 결과와 이유는 evolution memory에 쌓여 다음 제안을 돕는다.
실험은 다섯 preference benchmark suite의 일곱 평가 세트, 즉 JudgeBench, RM-Bench Chat, RewardBench Chat, RewardBench Chat-Hard, RewardBench 2 Precise-IF, RewardBench 2 Focus, RubricBench에서 진행됐다. 비교군은 Direct-Generate, TICK, RocketEval, Rubric-RM-8B, Rubric-ARM-8B, Rubric-ARROW-8B였다. API 기반 query-only 방법들은 rubric 생성에 Gemini 3.5 Flash를, 공통 verifier에는 Gemini 3.1 Pro를 사용했고, proposer와 alternative-pair 생성의 온도는 각각 0.7과 0.2였다.
평균 정확도는 본 방법이 80.36%로 가장 높았고, 일곱 세트 중 여섯 세트에서 최고 성능을 기록했다. 세부적으로는 JudgeBench All 88.55%, RM-Bench Chat 74.16%, RewardBench Chat 92.18%, RewardBench Chat-Hard 80.48%, RewardBench 2 Precise-IF 76.88%, RewardBench 2 Focus 89.09%, RubricBench All 61.20%였다. 평균 기준으로는 가장 좋은 query-only baseline인 RocketEval의 76.48%보다 3.88%p 높았고, trained open-weight baselines보다도 모든 세트에서 앞섰다. 유일하게 JudgeBench에서는 TICK의 91.21%가 더 높았다.
| 평가 세트 | 본 방법 정확도(%) | 비교 기준 |
|---|---|---|
| JudgeBench All | 88.55 | TICK 91.21% |
| RM-Bench Chat | 74.16 | RocketEval 69.77% |
| RewardBench Chat | 92.18 | RocketEval 87.99% |
| RubricBench All | 61.20 | 다른 모든 비교군보다 높음 |
자료: STORIUM 정리
논문은 이 방식이 후보 rubric을 문장 수준의 인상만으로 고르는 대신 실제 응답 쌍에서 차이를 확인해 non-discriminative, over-specific, style-only 기준을 걸러낸다고 설명한다. 한편 현재 평가는 preference benchmark에 한정되며, downstream reinforcement learning이나 policy performance는 아직 평가하지 않았다. local pair, alternative-answer pair, tree-structured evolution, evolution memory에 대한 절제 실험과 민감도 분석도 아직 수행하지 않았다.
연구 원문은 arXiv:2607.15092에서 확인할 수 있다. 프리프린트 결과는 동료평가와 후속 재현을 거치며 달라질 수 있다.
저작권자 © STORIUM 무단전재 및 재배포 금지














