• AI 모델·연구
  • 빅테크·기업
  • 반도체·인프라
  • 산업 적용
  • AI 서비스·툴
  • 정책·윤리
  • 스타트업·투자
  • 문의
STORIUM
  • AI 모델·연구
  • 빅테크·기업
  • 반도체·인프라
  • 산업 적용
  • AI 서비스·툴
  • 정책·윤리
  • 스타트업·투자
  • 문의
No Result
View All Result
  • AI 모델·연구
  • 빅테크·기업
  • 반도체·인프라
  • 산업 적용
  • AI 서비스·툴
  • 정책·윤리
  • 스타트업·투자
  • 문의
No Result
View All Result
STORIUM
No Result
View All Result

법률 번역에서 ‘생각’의 비용: Qwen3.5에 대한 RLVR 실험이 보여준 정확도·지연의 맞교환

유지율 리포터 작성: 유지율 리포터
2026년 07월 26일 20시 18분
Reading Time: 3 mins read
A A
Home AI 모델·연구
Share on FacebookShare on Twitter
법률 번역에서 ‘생각’의 비용: Qwen3.5에 대한 RLVR 실험이 보여준 정확도·지연의 맞교환 논문의 Figure 1
Figure 1: Translation quality across number of training samples. The COMET score for the models evaluated on a subset of 4 000 validation samples in intervals of 100 seen training samples. (left) models trained with thinking, marked as [T:✓], and (right) trained without thinking [T:✗]. Solid lines correspond to performing inference with thinking enabled [I:✓], whereas dashed lines indicate that thinking has been disable during the inference [I:✗]. 출처: arXiv:2607.19226

법률 문서 번역에서 강화학습 기반 정렬이 어디까지 품질을 끌어올리고, 그 대가로 얼마를 치르는지 묻는 arXiv 프리프린트가 나왔다. 이 연구는 검증 가능한 보상을 쓰는 RLVR을 Qwen3.5 4B와 9B에 적용해, 학습과 추론 단계에서 모델의 reasoning trace를 넣거나 빼는 방식으로 효과를 갈라 보았다.

핵심은 추론의 유무를 하나의 단계에서만 조절해 품질 변화의 원인을 좁혀 본 점이다. 연구진은 legal translation에서 RLVR이 유력하다는 최근 흐름이 실제로는 reasoning 자체의 효과인지, 아니면 훈련 방식 전반의 효과인지 질문을 던진 뒤, SwiLTra-Bench 데이터셋에서 이를 시험했다.

실험 설정은 비교적 분명하다. Qwen3.5 4B·9B를 GRPO로 미세조정했고, 각 입력 문장마다 4개의 응답을 샘플링했다. 학습 데이터는 100개 단위로 중간 체크포인트를 저장했으며, 평가에는 약 18.1k 문장쌍으로 이뤄진 테스트셋과 4,000개 검증 샘플의 일부 구간이 사용됐다. 성능 평가는 chrF, METEOR, COMET, MetricX 네 지표로 진행됐고, 특히 COMET에 가장 큰 비중을 뒀다.

결과는 추론 단계에서 생각을 켠 설정이 가장 유리하다는 쪽으로 모였다. 표 1에서 Qwen3.5 9B는 학습과 추론 모두 thinking을 켠 조합[T:✓, I:✓]에서 COMET 82.50, chrF 57.51, METEOR 54.61, MetricX 3.78을 기록했다. 같은 9B라도 학습은 thinking을 쓰고 추론은 끈 경우[T:✓, I:✗] COMET은 80.80으로 낮아졌고, 학습도 추론도 끈 기준[✗, ✗]은 81.66이었다. 4B에서도 [T:✓, I:✓]는 COMET 82.05로 가장 높았고, [✗, ✗]은 79.09였다.

비용 측면에서는 반대의 그림이 분명하다. 4B의 [T:✓, I:✓]는 추론 토큰 8.08M, [T:✗, I:✗]는 1.08M이었고, 9B의 경우 각각 6.27M과 1.05M이었다. 학습 없이 추론만 thinking을 켠 [✗, I:✓]는 4B에서 19.85M, 9B에서 20.67M 토큰으로 늘어나며, 본문은 이 설정이 추론 비용을 3배로 키운다고 적었다. 반대로 reasoning을 학습에 포함하면 출력이 더 간결해져 Qwen3.5에서 토큰 수가 최대 70% 줄었다고 정리했다.

모델·설정 COMET / 비용 / 토큰 비고
Qwen3.5 4B [T:✓, I:✓] 82.05 ± 0.06 / $0.24 / 8.08M 표 1, SwiLTra-Bench test set
Qwen3.5 4B [T:✗, I:✗] 79.09 ± 0.07 / $0.07 / 1.08M 표 1, SwiLTra-Bench test set
Qwen3.5 9B [T:✓, I:✓] 82.50 ± 0.06 / $0.28 / 6.27M 표 1, SwiLTra-Bench test set
Qwen3.5 9B [T:✗, I:✗] 81.66 ± 0.06 / $0.09 / 1.05M 표 1, SwiLTra-Bench test set

자료: STORIUM 정리

이 프리프린트의 결론은 법률 번역 맥락에서 일정 규모의 데이터만으로도 수익이 줄어드는 지점을 확인했다는 데 있다. SwiLTra-Bench에서는 약 1,500개 훈련 샘플 부근에서 성능이 평형에 도달했고, 그 이후의 미세한 향상은 더 큰 비용을 요구했다. 즉, reasoning은 품질을 높이지만 항상 그 비용을 상쇄하는 것은 아니며, 특히 추론 단계에서의 사용 여부가 비용·품질 균형을 가르는 핵심 변수로 제시됐다.

저작권자 © STORIUM 무단전재 및 재배포 금지

Tags: CometRLVR기계번역법률번역추론비용
유지율 리포터

유지율 리포터

안녕하세요, 유지율 리포터입니다. arXiv와 학회에서 쏟아지는 AI 연구를 살펴, 논문 속 성과를 과장 없이 우리말로 풀어 드립니다. 사실관계는 발행 전 편집인이 함께 확인합니다.

관련 기사

University of Fribourg 공식 로고
AI 모델·연구

스위스 법률 번역에서 소형 모델과 강화학습, 추론형 거대모델을 40,000쌍 데이터로 비교한 arXiv 프리프린트

2026년 07월 24일 01시 32분
Open MacBook Air with apps and web browser on screen, placed on a wooden table indoors.
AI 서비스·툴

브라우저 전쟁, 검색 아닌 AI 에이전트 싸움으로 바뀌었다

2026년 07월 04일 13시 15분
Tranquil stream flowing over moss-covered boulders in a lush forest setting, capturing nature's peaceful essence.
AI 모델·연구

COMET, 객체 단위 인과 구조로 몬테카를로 트리 탐색 강화학습 성능 높여

2026년 06월 16일 10시 17분
Close-up of hands holding speech bubbles, symbolizing communication and dialogue against a blue sky.
AI 모델·연구

기계번역 정확도의 이면, 이용자 4개 집단이 느끼는 불만은 다르다

2026년 06월 09일 22시 58분
Next Post
10스텝 동역학 불확실성을 보상에 반영한 S3, MuJoCo 계층형 강화학습 평가 논문의 Figure 1

10스텝 동역학 불확실성을 보상에 반영한 S3, MuJoCo 계층형 강화학습 평가

답글 남기기 응답 취소

이메일 주소는 공개되지 않습니다. 필수 필드는 *로 표시됩니다

  • 인기 급상승
  • 최신
Close-up of a GeForce RTX graphics card on a desk, showcasing its design and technology.

엔비디아 RTX 스파크 가격, 최소 2000달러 전망…윈도 노트북 ‘M1 모먼트’ 걸림돌

2026년 06월 02일 11시 19분
A 3D rendering of a neural network with abstract neuron connections in soft colors.

퍼플렉시티, 로컬·클라우드 AI를 자동 판단하는 하이브리드 추론 시스템 발표

2026년 06월 04일 08시 53분
Contemporary building with a glass facade and geometric patterns, low angle view.

앤트로픽·네이버 개발자 밋업 개최…서울 오피스 개소 앞두고 본사 임원 참석

2026년 06월 06일 21시 12분
책상에서 법률 문서에 서명하는 모습

클로드 ‘드리밍’ 기능 공개…앤트로픽, 법률·의료 AI 성능 대폭 향상

2026년 05월 30일 21시 11분
Close-up of a wooden gavel on a judge's desk, symbolizing justice.

AI 생성 성인 콘텐츠 유료 판매 운영자들, 법원서 잇달아 징역형

2026년 06월 05일 22시 40분
엔비디아 미국 본사 건물

엔비디아·37개 창립 파트너, Open Secure AI Alliance 출범

2026년 07월 28일 19시 45분
미국 연방 로비가 이뤄지는 워싱턴 의사당 공식 사진

미 주요 기술·AI 기업·단체 11곳, 상반기 로비 4,180만달러

2026년 07월 28일 18시 46분
다리오 아모데이 앤트로픽 CEO의 2023년 TechCrunch 행사 자료사진

Claude 공개 공유 대화 일부 검색 노출…비공개 자동 유출과는 달라

2026년 07월 28일 17시 53분
일리야 수츠케버가 참석한 2014년 스탠퍼드 대담 자료사진

SSI, 엔비디아 Vera Rubin 도입…연산 자원 10배 확대

2026년 07월 28일 16시 20분
중국 항저우 앤트그룹 A Space 건물

앤트그룹 Ling-3.0-Flash 공개…1,240억개 중 51억개 활성

2026년 07월 28일 15시 07분

검색

No Result
View All Result

인기 태그

AI규제 AI반도체 AI보안 AI안전 AI에이전트 AI연구 AI인프라 AI정책 Anthropic arXiv AWS ChatGPT Claude Gemini HBM IPO LLM MCP NVIDIA OpenAI RAG SK하이닉스 강화학습 구글 데이터센터 마이크로소프트 멀티모달 멀티에이전트 메타 반도체 벤치마크 사이버보안 삼성전자 생성AI 생성형AI 스타트업 앤트로픽 에이전트 에이전틱AI 엔비디아 오픈AI 오픈소스 의료AI 자율주행 피지컬AI

카테고리

  • AI 모델·연구 (1,482)
  • AI 서비스·툴 (826)
  • 반도체·인프라 (537)
  • 빅테크·기업 (566)
  • 산업 적용 (415)
  • 스타트업·투자 (251)
  • 정책·윤리 (455)

STORIUM은 트렌드와 인사이트를 전하는 종합 뉴스 매체입니다. 정확성, 균형, 맥락의 편집 원칙으로 신뢰받는 뉴스를 전합니다.

카테고리

  • AI 모델·연구
  • AI 서비스·툴
  • 반도체·인프라
  • 빅테크·기업
  • 산업 적용
  • 스타트업·투자
  • 정책·윤리

태그

AI규제 AI반도체 AI보안 AI안전 AI에이전트 AI연구 AI인프라 AI정책 Anthropic arXiv AWS ChatGPT Claude Gemini HBM IPO LLM MCP NVIDIA OpenAI RAG SK하이닉스 강화학습 구글 데이터센터 마이크로소프트 멀티모달 멀티에이전트 메타 반도체 벤치마크 사이버보안 삼성전자 생성AI 생성형AI 스타트업 앤트로픽 에이전트 에이전틱AI 엔비디아 오픈AI 오픈소스 의료AI 자율주행 피지컬AI

최근 뉴스

엔비디아 미국 본사 건물

엔비디아·37개 창립 파트너, Open Secure AI Alliance 출범

2026년 07월 28일 19시 45분
미국 연방 로비가 이뤄지는 워싱턴 의사당 공식 사진

미 주요 기술·AI 기업·단체 11곳, 상반기 로비 4,180만달러

2026년 07월 28일 18시 46분
  • 소개
  • 문의
  • 광고문의
  • 개인정보처리방침
  • 이용약관
  • 청소년보호정책
  • 정정·반론 보도 안내
  • 편집·윤리강령

주소: 경기 고양시 덕양구 꽃마을로 66, 한일미디어타워 15층
상호: 스토리움 |  사업자등록번호: 579-27-02025 |  대표자: 이국환
발행·편집인: 이국환 |  청소년보호책임자: 이국환 |  발행일자: 2025.01.01
스토리움의 모든 콘텐츠는 저작권법의 보호를 받는 바, 무단 전재·복사·배포 등은 법적 제재를 받을 수 있습니다.
© 2026 STORIUM. All Rights Reserved.

No Result
View All Result
  • AI 모델·연구
  • 빅테크·기업
  • 반도체·인프라
  • 산업 적용
  • AI 서비스·툴
  • 정책·윤리
  • 스타트업·투자
  • 문의

주소: 경기 고양시 덕양구 꽃마을로 66, 한일미디어타워 15층
상호: 스토리움 |  사업자등록번호: 579-27-02025 |  대표자: 이국환
발행·편집인: 이국환 |  청소년보호책임자: 이국환 |  발행일자: 2025.01.01
스토리움의 모든 콘텐츠는 저작권법의 보호를 받는 바, 무단 전재·복사·배포 등은 법적 제재를 받을 수 있습니다.
© 2026 STORIUM. All Rights Reserved.