• AI 모델·연구
  • 빅테크·기업
  • 반도체·인프라
  • 산업 적용
  • AI 서비스·툴
  • 정책·윤리
  • 스타트업·투자
  • 문의
STORIUM
  • AI 모델·연구
  • 빅테크·기업
  • 반도체·인프라
  • 산업 적용
  • AI 서비스·툴
  • 정책·윤리
  • 스타트업·투자
  • 문의
No Result
View All Result
  • AI 모델·연구
  • 빅테크·기업
  • 반도체·인프라
  • 산업 적용
  • AI 서비스·툴
  • 정책·윤리
  • 스타트업·투자
  • 문의
No Result
View All Result
STORIUM
No Result
View All Result

단일 질의에서 생성한 채점 기준을 쌍대 응답 검증으로 거르는 새 틀, 다섯 벤치마크 묶음에서 평가

유지율 리포터 작성: 유지율 리포터
2026년 07월 28일 10시 23분
Reading Time: 3 mins read
A A
Home AI 모델·연구
Share on FacebookShare on Twitter

대형 언어모델의 응답을 평가하거나 보상 신호로 쓰려면 무엇을 좋은 답으로 볼지 정한 rubric이 필요하다. 하지만 질의별로 믿을 만한 rubric을 만드는 일은 쉽지 않다. 이 arXiv 프리프린트는 외부 주석이나 모델 학습 없이, 질의 하나만으로 빈 집합에서 rubric set을 진화시키는 틀을 제안한다.

핵심은 후보 rubric을 바로 채택하지 않고, 합성한 rubric-conditioned response pairs로 먼저 검증하는 데 있다. 하나는 기존 rubric은 유지한 채 후보 rubric만 만족·불만족이 갈리도록 만든 local pair이고, 다른 하나는 처음부터 다른 전략으로 쓴 alternative-answer pair다. 두 비교가 모두 만족 쪽을 더 낫다고 가리킬 때만 후보를 넣는다.

단일 질의에서 생성한 채점 기준을 쌍대 응답 검증으로 거르는 새 틀, 다섯 벤치마크에서 비교 평가 논문의 Figure 1
Figure 1. Figure 1: Overview of RUBRICS ON TRIAL. At evolution step t, a proposer suggests an ADD or SPLIT patch. Response generators construct two rubric-conditioned pairs for each candidate rubric under the same trial background Bt. A rubric-blind judge independently compares each pair in both orders. A deterministic lookup decides whether the patch updates the active-leaf rubric set, while both accepted and rejected outcomes enter evolution memory. 출처: arXiv:2607.15092

연구진은 이를 Rubrics on Trial이라 부르며, ADD와 SPLIT 패치로 이루어진 나무 구조의 진화 과정을 설계했다. 제안자는 현재 rubric set과 과거 피드백을 보고 새 원자 rubric을 추가하거나 묶인 rubric을 나누는 패치를 낸다. 각 단계의 판단 결과와 이유는 evolution memory에 쌓여 다음 제안을 돕는다.

실험은 다섯 preference benchmark suite의 일곱 평가 세트, 즉 JudgeBench, RM-Bench Chat, RewardBench Chat, RewardBench Chat-Hard, RewardBench 2 Precise-IF, RewardBench 2 Focus, RubricBench에서 진행됐다. 비교군은 Direct-Generate, TICK, RocketEval, Rubric-RM-8B, Rubric-ARM-8B, Rubric-ARROW-8B였다. API 기반 query-only 방법들은 rubric 생성에 Gemini 3.5 Flash를, 공통 verifier에는 Gemini 3.1 Pro를 사용했고, proposer와 alternative-pair 생성의 온도는 각각 0.7과 0.2였다.

평균 정확도는 본 방법이 80.36%로 가장 높았고, 일곱 세트 중 여섯 세트에서 최고 성능을 기록했다. 세부적으로는 JudgeBench All 88.55%, RM-Bench Chat 74.16%, RewardBench Chat 92.18%, RewardBench Chat-Hard 80.48%, RewardBench 2 Precise-IF 76.88%, RewardBench 2 Focus 89.09%, RubricBench All 61.20%였다. 평균 기준으로는 가장 좋은 query-only baseline인 RocketEval의 76.48%보다 3.88%p 높았고, trained open-weight baselines보다도 모든 세트에서 앞섰다. 유일하게 JudgeBench에서는 TICK의 91.21%가 더 높았다.

평가 세트 본 방법 정확도(%) 비교 기준
JudgeBench All 88.55 TICK 91.21%
RM-Bench Chat 74.16 RocketEval 69.77%
RewardBench Chat 92.18 RocketEval 87.99%
RubricBench All 61.20 다른 모든 비교군보다 높음

자료: STORIUM 정리

논문은 이 방식이 후보 rubric을 문장 수준의 인상만으로 고르는 대신 실제 응답 쌍에서 차이를 확인해 non-discriminative, over-specific, style-only 기준을 걸러낸다고 설명한다. 한편 현재 평가는 preference benchmark에 한정되며, downstream reinforcement learning이나 policy performance는 아직 평가하지 않았다. local pair, alternative-answer pair, tree-structured evolution, evolution memory에 대한 절제 실험과 민감도 분석도 아직 수행하지 않았다.

연구 원문은 arXiv:2607.15092에서 확인할 수 있다. 프리프린트 결과는 동료평가와 후속 재현을 거치며 달라질 수 있다.

저작권자 © STORIUM 무단전재 및 재배포 금지

Tags: AI 벤치마크LLM 평가쌍대 검증채점 기준
유지율 리포터

유지율 리포터

안녕하세요, 유지율 리포터입니다. arXiv와 학회에서 쏟아지는 AI 연구를 살펴, 논문 속 성과를 과장 없이 우리말로 풀어 드립니다. 사실관계는 발행 전 편집인이 함께 확인합니다.

관련 기사

University of Chinese Academy of Sciences 공식 로고
AI 모델·연구

실내 행동계획 벤치마크 ‘UniETP’, 4개 시뮬레이터 통합

2026년 07월 22일 02시 12분
BCG-Former 연구진 소속 애리조나대학교 공식 깃발 사진
AI 모델·연구

BCG-Former, 하이퍼스펙트럴 분류 성능과 데이터 분할 조건을 함께 점검

2026년 07월 21일 18시 10분
AdaLook 연구진 소속 미시간주립대학교 공식 워드마크
AI 모델·연구

AdaLook, 확산 언어모델 탐색 깊이를 후보 점수 분산으로 조절

2026년 07월 21일 18시 00분
Artificial Analysis 공식 브랜드 이미지
AI 모델·연구

모티프 3 베타 44점의 의미…고정 순위로 읽기 어려운 이유

2026년 07월 21일 17시 30분
Next Post
흉부 X-ray 예비소견서를 표시한 딥노이드 M4CXR 제품 화면

딥노이드 M4CXR, 식약처 3등급 품목허가 확보… 흉부 X-ray 예비소견서 생성

답글 남기기 응답 취소

이메일 주소는 공개되지 않습니다. 필수 필드는 *로 표시됩니다

  • 인기 급상승
  • 최신
Close-up of a GeForce RTX graphics card on a desk, showcasing its design and technology.

엔비디아 RTX 스파크 가격, 최소 2000달러 전망…윈도 노트북 ‘M1 모먼트’ 걸림돌

2026년 06월 02일 11시 19분
A 3D rendering of a neural network with abstract neuron connections in soft colors.

퍼플렉시티, 로컬·클라우드 AI를 자동 판단하는 하이브리드 추론 시스템 발표

2026년 06월 04일 08시 53분
Contemporary building with a glass facade and geometric patterns, low angle view.

앤트로픽·네이버 개발자 밋업 개최…서울 오피스 개소 앞두고 본사 임원 참석

2026년 06월 06일 21시 12분
책상에서 법률 문서에 서명하는 모습

클로드 ‘드리밍’ 기능 공개…앤트로픽, 법률·의료 AI 성능 대폭 향상

2026년 05월 30일 21시 11분
Close-up of a wooden gavel on a judge's desk, symbolizing justice.

AI 생성 성인 콘텐츠 유료 판매 운영자들, 법원서 잇달아 징역형

2026년 06월 05일 22시 40분
엔비디아 미국 본사 건물

엔비디아·37개 창립 파트너, Open Secure AI Alliance 출범

2026년 07월 28일 19시 45분
미국 연방 로비가 이뤄지는 워싱턴 의사당 공식 사진

미 주요 기술·AI 기업·단체 11곳, 상반기 로비 4,180만달러

2026년 07월 28일 18시 46분
다리오 아모데이 앤트로픽 CEO의 2023년 TechCrunch 행사 자료사진

Claude 공개 공유 대화 일부 검색 노출…비공개 자동 유출과는 달라

2026년 07월 28일 17시 53분
일리야 수츠케버가 참석한 2014년 스탠퍼드 대담 자료사진

SSI, 엔비디아 Vera Rubin 도입…연산 자원 10배 확대

2026년 07월 28일 16시 20분
중국 항저우 앤트그룹 A Space 건물

앤트그룹 Ling-3.0-Flash 공개…1,240억개 중 51억개 활성

2026년 07월 28일 15시 07분

검색

No Result
View All Result

인기 태그

AI규제 AI반도체 AI보안 AI안전 AI에이전트 AI연구 AI인프라 AI정책 Anthropic arXiv AWS ChatGPT Claude Gemini HBM IPO LLM MCP NVIDIA OpenAI RAG SK하이닉스 강화학습 구글 데이터센터 마이크로소프트 멀티모달 멀티에이전트 메타 반도체 벤치마크 사이버보안 삼성전자 생성AI 생성형AI 스타트업 앤트로픽 에이전트 에이전틱AI 엔비디아 오픈AI 오픈소스 의료AI 자율주행 피지컬AI

카테고리

  • AI 모델·연구 (1,482)
  • AI 서비스·툴 (826)
  • 반도체·인프라 (537)
  • 빅테크·기업 (566)
  • 산업 적용 (415)
  • 스타트업·투자 (251)
  • 정책·윤리 (455)

STORIUM은 트렌드와 인사이트를 전하는 종합 뉴스 매체입니다. 정확성, 균형, 맥락의 편집 원칙으로 신뢰받는 뉴스를 전합니다.

카테고리

  • AI 모델·연구
  • AI 서비스·툴
  • 반도체·인프라
  • 빅테크·기업
  • 산업 적용
  • 스타트업·투자
  • 정책·윤리

태그

AI규제 AI반도체 AI보안 AI안전 AI에이전트 AI연구 AI인프라 AI정책 Anthropic arXiv AWS ChatGPT Claude Gemini HBM IPO LLM MCP NVIDIA OpenAI RAG SK하이닉스 강화학습 구글 데이터센터 마이크로소프트 멀티모달 멀티에이전트 메타 반도체 벤치마크 사이버보안 삼성전자 생성AI 생성형AI 스타트업 앤트로픽 에이전트 에이전틱AI 엔비디아 오픈AI 오픈소스 의료AI 자율주행 피지컬AI

최근 뉴스

엔비디아 미국 본사 건물

엔비디아·37개 창립 파트너, Open Secure AI Alliance 출범

2026년 07월 28일 19시 45분
미국 연방 로비가 이뤄지는 워싱턴 의사당 공식 사진

미 주요 기술·AI 기업·단체 11곳, 상반기 로비 4,180만달러

2026년 07월 28일 18시 46분
  • 소개
  • 문의
  • 광고문의
  • 개인정보처리방침
  • 이용약관
  • 청소년보호정책
  • 정정·반론 보도 안내
  • 편집·윤리강령

주소: 경기 고양시 덕양구 꽃마을로 66, 한일미디어타워 15층
상호: 스토리움 |  사업자등록번호: 579-27-02025 |  대표자: 이국환
발행·편집인: 이국환 |  청소년보호책임자: 이국환 |  발행일자: 2025.01.01
스토리움의 모든 콘텐츠는 저작권법의 보호를 받는 바, 무단 전재·복사·배포 등은 법적 제재를 받을 수 있습니다.
© 2026 STORIUM. All Rights Reserved.

No Result
View All Result
  • AI 모델·연구
  • 빅테크·기업
  • 반도체·인프라
  • 산업 적용
  • AI 서비스·툴
  • 정책·윤리
  • 스타트업·투자
  • 문의

주소: 경기 고양시 덕양구 꽃마을로 66, 한일미디어타워 15층
상호: 스토리움 |  사업자등록번호: 579-27-02025 |  대표자: 이국환
발행·편집인: 이국환 |  청소년보호책임자: 이국환 |  발행일자: 2025.01.01
스토리움의 모든 콘텐츠는 저작권법의 보호를 받는 바, 무단 전재·복사·배포 등은 법적 제재를 받을 수 있습니다.
© 2026 STORIUM. All Rights Reserved.