영어 윤리 문항을 번역해 다국어 모델을 평가하면 문화별 규범과 모국어 추론의 차이를 놓칠 수 있다. COLM 2026에 발표된 연구는 6개 언어의 장문 시나리오 1,852개로 MCLASH를 구성하고, 문화·상황에 맞는 이론 근거를 고른 뒤 사용자 언어로 추론하는 MET를 제안했다.
MET-D는 두 번째인 이론 기반 추론 단계를 모델 자체 출력으로 증류한다. 강한 외부 교사나 추가 인간 라벨 없이 거절 샘플링 자가지식증류를 쓰며, Qwen3-4B·Qwen3-8B·Gemma3-4B에서 기본 모델과 비교했다.
세 모델 평균으로 기본 모델 대비 macro-F1은 MCLASH에서 3.71점, MMoralExceptQA에서 4.23점 높았다. MCLASH의 최대 단일 개선은 Qwen3-8B 말레이어의 12.94점이었다. Qwen3-4B에서는 모국어 추론 비율이 평균 62.13%포인트 늘었다.

| 보고 항목 | 비교 범위 | 개선 |
|---|---|---|
| MCLASH macro-F1 | 세 모델 평균·기본 모델 대비 | +3.71점 |
| MMoralExceptQA macro-F1 | 세 모델 평균·기본 모델 대비 | +4.23점 |
| MCLASH 최대 단일 향상 | Qwen3-8B·말레이어 | +12.94점 |
| 모국어 추론 비율 | Qwen3-4B 평균 | +62.13%포인트 |
요약 수치마다 범위가 다르다. 3.71점과 4.23점은 세 모델 평균, 12.94점은 특정 모델·언어의 최대값, 62.13%포인트는 Qwen3-4B의 언어 사용 변화다. 이를 같은 종류의 전체 평균으로 합쳐 읽어서는 안 된다.
학습은 근거를 고르는 1단계보다 선택된 근거를 따르는 2단계에 집중했다. 실제로 절제 실험에서는 학습된 선택기를 쓰는 것보다 기본 모델이 근거를 고르고 학습 모델이 추론하는 구성이 나았다. 여러 근거가 충돌할 때의 조정, 제한된 언어·전문가 이론 목록 밖의 가치관, 고위험 결정의 정당성은 해결되지 않았다. 벤치마크 개선은 인간 감독을 대체할 근거가 아니다. 이 글은 동료검토 전 공개본 arXiv:2607.11736 원문을 기준으로 했다.
저작권자 © STORIUM 무단전재 및 재배포 금지










