• AI 모델·연구
  • 빅테크·기업
  • 반도체·인프라
  • 산업 적용
  • AI 서비스·툴
  • 정책·윤리
  • 스타트업·투자
  • 문의
STORIUM
  • AI 모델·연구
  • 빅테크·기업
  • 반도체·인프라
  • 산업 적용
  • AI 서비스·툴
  • 정책·윤리
  • 스타트업·투자
  • 문의
No Result
View All Result
  • AI 모델·연구
  • 빅테크·기업
  • 반도체·인프라
  • 산업 적용
  • AI 서비스·툴
  • 정책·윤리
  • 스타트업·투자
  • 문의
No Result
View All Result
STORIUM
No Result
View All Result

LLM 자체 검증 프레임워크 등장…SWE-Bench 78% 정확도

유지율 리포터 작성: 유지율 리포터
2026년 07월 08일 12시 40분
Reading Time: 1 min read
A A
Home AI 모델·연구
Share on FacebookShare on Twitter

재키 콱(Jacky Kwok), 첼시 핀(Chelsea Finn), 마르코 파본(Marco Pavone), 이온 스토이카(Ion Stoica) 등 연구진이 대규모 언어 모델(LLM)의 답변이 맞는지 스스로 판별하게 하는 범용 검증 프레임워크 ‘LLM-as-a-Verifier’를 공개했다. 이번 연구는 사전학습·후속학습·추론 시점 연산 확장에 이어 ‘검증’ 자체를 새로운 성능 확장 축으로 제시했다는 점에서 주목된다. 연구팀은 별도의 추가 학습 없이도 에이전트형 작업에 세밀한 피드백을 제공할 수 있는 검증 체계를 구현했다고 밝혔다.

기존의 LM 심사 방식은 후보 답변에 대해 이산적인 점수를 산출하도록 프롬프트를 구성하는 데 그쳤다. 반면 LLM-as-a-Verifier는 점수를 나타내는 토큰의 로짓(logit) 분포 전체에 대한 기댓값을 계산해 연속적인 점수를 생성한다. 이 확률적 접근 방식은 점수의 세밀도, 반복 평가, 평가 기준의 세분화라는 세 방향으로 검증 성능을 함께 확장할 수 있다는 게 연구팀의 설명이다. 특히 점수 세밀도를 높일수록 정답과 오답 후보 간 구분이 명확해져 더 정교한 비교가 가능해졌다고 밝혔다.

연구팀은 이 프레임워크가 터미널 작업 평가인 Terminal-Bench V2에서 86.5%, 소프트웨어 엔지니어링 벤치마크 SWE-Bench Verified에서 78.2%, 로봇 보상 평가인 RoboRewardBench에서 87.4%, 의료 에이전트 벤치마크 MedAgentBench에서 73.3%의 정확도를 기록해 해당 분야 최고 수준(state-of-the-art) 성능을 달성했다고 밝혔다. 아울러 후보 해답 중 최적안을 고르는 비용 효율적인 순위 결정 알고리즘도 함께 제안했다.

연구팀은 검증 신호가 단순 판별을 넘어 작업 진행도를 추정하는 프록시로도 쓰일 수 있다고 설명하며, 개발자가 자신의 에이전트 시스템을 모니터링하고 개선할 수 있도록 앤트로픽(Anthropic)의 코딩 도구 클로드 코드(Claude Code)용 확장 기능도 구축했다고 밝혔다. 또한 이 검증기가 강화학습에서 밀도 높은 피드백을 제공해 로보틱스와 수학적 추론 벤치마크에서 SAC·GRPO 알고리즘의 표본 효율성을 높이는 데도 기여했다고 덧붙였다. 이러한 접근은 시나의 소형 모델 VibeThinker-3B가 큰 모델을 넘어선 사례처럼, 모델 규모보다 학습·평가 방식의 정교화가 성능 향상의 새 동력이 되고 있다는 최근 흐름과 궤를 같이한다.

저작권자 © STORIUM 무단전재 및 재배포 금지

Tags: AI연구arXivLLM강화학습검증
유지율 리포터

유지율 리포터

안녕하세요, 유지율 리포터입니다. arXiv와 학회에서 쏟아지는 AI 연구를 살펴, 논문 속 성과를 과장 없이 우리말로 풀어 드립니다. 사실관계는 발행 전 편집인이 함께 확인합니다.

관련 기사

두 모델을 서로 채점시켜 추론력 키운다…경쟁 강화학습 기법 'Agon' 공개 논문 원문에 수록된 연구 도식
AI 모델·연구

두 모델을 서로 채점시켜 추론력 키운다…경쟁 강화학습 기법 ‘Agon’ 공개

2026년 07월 10일 11시 31분
추상 네트워크 노드 데이터 시각화
AI 모델·연구

LLM, 답변 끝나기 전부터 ‘남은 길이’ 내부적으로 안다

2026년 07월 08일 16시 41분
From above of decorative cardboard appliques of human hand with magnifying glass above diagram on green background
AI 모델·연구

오프라인 강화학습 평가법 FORE, 벨만완전성 조건 없이도 성립

2026년 07월 08일 11시 19분
Vibrant northern lights create a mesmerizing display in the dark night sky.
AI 모델·연구

생성형 월드 모델 환각, 데이터 커버리지 문제로 규명…50개 궤적으로 미탐지 환경 적응

2026년 06월 26일 18시 36분
Next Post
NVIDIA and Hugging Face Bring New Models and Frameworks to LeRobot for the Open Robotics Community

엔비디아·허깅페이스, 로봇 오픈소스 플랫폼 르로봇에 신규 모델 추가

답글 남기기 응답 취소

이메일 주소는 공개되지 않습니다. 필수 필드는 *로 표시됩니다

  • 인기 급상승
  • 최신
Close-up of a GeForce RTX graphics card on a desk, showcasing its design and technology.

엔비디아 RTX 스파크 가격, 최소 2000달러 전망…윈도 노트북 ‘M1 모먼트’ 걸림돌

2026년 06월 02일 11시 19분
A 3D rendering of a neural network with abstract neuron connections in soft colors.

퍼플렉시티, 로컬·클라우드 AI를 자동 판단하는 하이브리드 추론 시스템 발표

2026년 06월 04일 08시 53분
Contemporary building with a glass facade and geometric patterns, low angle view.

앤트로픽·네이버 개발자 밋업 개최…서울 오피스 개소 앞두고 본사 임원 참석

2026년 06월 06일 21시 12분
Close-up of a wooden gavel on a judge's desk, symbolizing justice.

AI 생성 성인 콘텐츠 유료 판매 운영자들, 법원서 잇달아 징역형

2026년 06월 05일 22시 40분
책상에서 법률 문서에 서명하는 모습

클로드 ‘드리밍’ 기능 공개…앤트로픽, 법률·의료 AI 성능 대폭 향상

2026년 05월 30일 21시 11분
최찬욱 오토앤 대표 공식 인물 사진

오토앤 AX 바우처 선정, AI 커머스 운영 방식과 한계

2026년 08월 24일 20시 43분
아틀라시안 Team 24 무대에서 로보와 AI 협업을 설명하는 발표자

아틀라시안 로보, PDF 지시문 유출 시연과 대응 한계

2026년 08월 24일 19시 53분
노스 마이크로 비전 기술 글 공동 저자 데이비드 라우

코히어 North Micro Vision, 문서 이해 활용과 배포 한계

2026년 08월 24일 19시 38분
ACE 로보틱스 체화지능 시연에서 로봇 그리퍼가 신발을 집는 장면

ACE 로보틱스, 2027년 체화지능 전환점과 상용화 한계

2026년 08월 24일 19시 08분
대한민국 인공지능 윤리원칙 대토론회 참석자 단체사진

대한민국 AI 윤리원칙 확정, 153건 의견과 실천 기준

2026년 08월 24일 18시 33분

검색

No Result
View All Result

인기 태그

AI규제 AI반도체 AI보안 AI안전 AI에이전트 AI연구 AI인프라 AI정책 Anthropic arXiv AWS ChatGPT Claude Gemini HBM IPO LLM MCP NVIDIA OpenAI RAG SK하이닉스 강화학습 구글 데이터센터 마이크로소프트 멀티모달 메타 반도체 벤치마크 사이버보안 삼성전자 생성AI 생성형AI 스타트업 앤트로픽 에이전트 에이전틱AI 엔비디아 오픈AI 오픈소스 의료AI 자율주행 피지컬AI 피지컬 AI

카테고리

  • AI 모델·연구 (1,554)
  • AI 서비스·툴 (884)
  • 반도체·인프라 (623)
  • 빅테크·기업 (631)
  • 산업 적용 (529)
  • 스타트업·투자 (273)
  • 정책·윤리 (514)

STORIUM은 트렌드와 인사이트를 전하는 종합 뉴스 매체입니다. 정확성, 균형, 맥락의 편집 원칙으로 신뢰받는 뉴스를 전합니다.

카테고리

  • AI 모델·연구
  • AI 서비스·툴
  • 반도체·인프라
  • 빅테크·기업
  • 산업 적용
  • 스타트업·투자
  • 정책·윤리

태그

AI규제 AI반도체 AI보안 AI안전 AI에이전트 AI연구 AI인프라 AI정책 Anthropic arXiv AWS ChatGPT Claude Gemini HBM IPO LLM MCP NVIDIA OpenAI RAG SK하이닉스 강화학습 구글 데이터센터 마이크로소프트 멀티모달 메타 반도체 벤치마크 사이버보안 삼성전자 생성AI 생성형AI 스타트업 앤트로픽 에이전트 에이전틱AI 엔비디아 오픈AI 오픈소스 의료AI 자율주행 피지컬AI 피지컬 AI

최근 뉴스

최찬욱 오토앤 대표 공식 인물 사진

오토앤 AX 바우처 선정, AI 커머스 운영 방식과 한계

2026년 08월 24일 20시 43분
아틀라시안 Team 24 무대에서 로보와 AI 협업을 설명하는 발표자

아틀라시안 로보, PDF 지시문 유출 시연과 대응 한계

2026년 08월 24일 19시 53분
  • 소개
  • 문의
  • 광고문의
  • 개인정보처리방침
  • 이용약관
  • 청소년보호정책
  • 정정·반론 보도 안내
  • 편집·윤리강령

주소: 경기 고양시 덕양구 꽃마을로 66, 한일미디어타워 15층
상호: 스토리움 |  사업자등록번호: 579-27-02025 |  대표자: 이국환
발행·편집인: 이국환 |  청소년보호책임자: 이국환 |  발행일자: 2025.01.01
스토리움의 모든 콘텐츠는 저작권법의 보호를 받는 바, 무단 전재·복사·배포 등은 법적 제재를 받을 수 있습니다.
© 2026 STORIUM. All Rights Reserved.

No Result
View All Result
  • AI 모델·연구
  • 빅테크·기업
  • 반도체·인프라
  • 산업 적용
  • AI 서비스·툴
  • 정책·윤리
  • 스타트업·투자
  • 문의

주소: 경기 고양시 덕양구 꽃마을로 66, 한일미디어타워 15층
상호: 스토리움 |  사업자등록번호: 579-27-02025 |  대표자: 이국환
발행·편집인: 이국환 |  청소년보호책임자: 이국환 |  발행일자: 2025.01.01
스토리움의 모든 콘텐츠는 저작권법의 보호를 받는 바, 무단 전재·복사·배포 등은 법적 제재를 받을 수 있습니다.
© 2026 STORIUM. All Rights Reserved.