이 논문은 참조 정답이 없는 질문응답 평가에서 LLM 심판이 얼마나 신뢰할 만한지 살핀다. arXiv:2607.12885v1 [cs.CL] 2026년 7월 14일 프리프린트이며, 저자들은 no-reference 환경에서 심판이 오답을 정답으로 너무 쉽게 받아들일 수 있다고 본다.
저자들은 두 단계 절차를 쓴다. 먼저 심판이 생성 답변에서 핵심 답을 추출하고, 그다음 CORRECT/INCORRECT를 매긴다. 보정 실험은 심판이 과제를 제대로 아는지 보고, 민감도 실험은 참조 정답의 제시 여부와 위치가 판정에 미치는 변화를 본다.

데이터는 TyDi QA의 영어 445개, 아랍어 951개, 텔루구어 669개와 MATA의 텔루구어 open-ended 540개다. 응답 생성기는 Gemini 3.1-Pro, Qwen3-32B, Sarvam-105B, Fanar-C-2-27B이고, 심판은 Gemini3.1-Flash-Lite-Preview, Gemma3-27B, Qwen3-32B다. 각 데이터셋·언어 조합에서 응답 생성기 4개와 심판 3개의 조합으로 12개 평가를 수행했다.
| 항목 | 값 | 범위 | 의미 |
|---|---|---|---|
| TyDi QA 영어 유효 표본 | 445 | – | 평가 질문 수 |
| TyDi QA 아랍어 유효 표본 | 951 | – | 평가 질문 수 |
| TyDi QA 텔루구어 유효 표본 | 669 | – | 평가 질문 수 |
| MATA 텔루구어 open-ended | 540 | – | 평가 질문 수 |
| 인간 평가 표본 | 100개 질문 | 400개 질문-응답 쌍 | MATA 하위 표본 |
자료: STORIUM 정리
보정 실험에서 영어와 아랍어는 대체로 잘 구분했지만, 텔루구어에서는 틀린 답을 맞다고 보는 경우가 남았다. 예를 들어 MATA의 텔루구어에서 Gemma3-27B는 C2가 66%였고, TyDi QA 텔루구어에서도 여러 심판의 C2가 60% 안팎까지 올라갔다. C1과 C2의 차이도 텔루구어에서 더 작아, 언어에 따라 신뢰성이 달랐다.
민감도 실험에서는 NR을 기준으로 RV와 RC를 비교했을 때 정답률이 전반적으로 낮아졌고, NR→RV 뒤집힘이 RV→RC보다 더 컸다. 범위는 NR→RV가 0.09에서 0.85, RV→RC가 0.01에서 0.24였다. 인간 주석과의 일치도는 참조가 있을 때 대체로 높아졌으며, 저자들은 제한된 데이터셋·생성기·심판 조합 안에서 참조 인식 보정과 표본 기반 점검이 필요하다고 주장한다.
저작권자 © STORIUM 무단전재 및 재배포 금지











