종합 0.402와 1위는 고정된 최종 순위가 아니라 평가 시점 리더보드의 기록이다. 가장 가까운 시스템은 0.370이었다. QANTA 2026 제출작은 새 모델 구조보다 토스업과 보너스에 서로 다른 추론 정책과 신뢰도 보정을 적용해 이 점수를 얻었다고 분석했다.
QANTA 2026은 텍스트 단서를 점진적으로 공개하고 경우에 따라 이미지도 주는 퀴즈볼형 멀티모달 QA 과제다. 토스업은 언제 버즈할지를, 보너스는 정확한 답과 인간 캡틴의 채택을 함께 고려해야 한다. Nirjhar Das와 Md. Al-Mamun Provath는 이를 한 모델이 아닌 과제별 두 에이전트로 나눴다.
토스업 에이전트는 경쟁 로그에서 GPT-4.1-mini로 불린 GPT-4o-mini-class 모델을 썼다. 단서가 늘 때마다 답을 갱신하고 모델 추정 P(correct)가 0.90 이상일 때만 버즈한다. Numeric Firewall은 명명된 개체, 명시적 수식 맥락, 서로 독립적이며 일치하는 여러 단서가 있을 때만 정량 단서에 따른 신뢰도 상승을 허용한다.
보너스 에이전트는 경쟁 로그에서 GPT-4.1로 불린 GPT-4o-class 모델을 썼다. 리드인-aware reasoning, 구조화된 관계 추론, 멀티모달 증거 통합을 결합한다. 텍스트로 초기 가설을 세우고 이미지는 OCR 텍스트·도표·예술 양식·맥락처럼 새 증거를 줄 때만 support, refine, contradict에 반영하는 late-fusion 방식이다.

공식 평가 기간의 hosted API 운영에서 토스업은 E[Score] 0.238, Buzz Precision 72.5%, Buzz Frequency 94.2%, Buzz Position 60.558, Win Rate 71.1%, 총 평가비용 0.14달러를 기록했다. 보너스는 Bonus Effect 0.164, Part Accuracy 89.1%, Question Accuracy 72.7%, Calibration 88.2%, Adoption 33.8%였다.
| 평가 축 | 핵심 값 | 보조 값 |
|---|---|---|
| Tossup | E[Score] 0.238 | Buzz precision 72.5%·frequency 94.2%·win rate 71.1%·cost $0.14 |
| Bonus | Bonus Effect 0.164 | Part accuracy 89.1%·question accuracy 72.7%·calibration 88.2%·adoption 33.8% |
| 종합 | Overall Score 0.402·Rank 1 | 최근접 시스템 0.370·격차 0.032 |
자료: STORIUM 정리
개발 중 반복된 오류는 일반적 단서에서의 조기 버즈, 가까운 개체의 혼동, 정량 증거에 대한 과신이었다. 논문은 선택적 멀티모달 결합과 보정 정책이 성과를 이끌었다고 해석한다. arXiv:2607.09623v1은 ICML 2026 EMM-QA 워크숍 수용 및 non-archival 게시를 명시한 프리프린트이며, 보고된 순위는 평가 시점에 한정된다.
저작권자 © STORIUM 무단전재 및 재배포 금지














