독일 AI 단체와 연구기관 컨소시엄이 독일어·영어 기반모델 ‘Soofi S 30B-A3B’의 사전학습 보고서를 공개했다. 독일 연방경제에너지부 지원으로 뮌헨의 독일 산업 AI 클라우드에서 학습했으며, 모델 가중치와 일부 중간 체크포인트, 학습·평가 코드, 출처별 데이터 통계를 공개할 계획이다.
Soofi S는 Nemotron 3 Nano의 하이브리드 Mamba-Transformer 혼합전문가 구조를 채택했다. 전체 약 316억개 파라미터 가운데 토큰마다 약 32억개만 활성화된다. 52개 층 중 23개는 Mamba-2, 23개는 희소 전문가 층, 6개만 그룹질의 어텐션을 사용해 긴 문맥에서 커지는 KV 캐시를 줄였다.

학습량은 세 단계 합계 26.68조토큰이다. 영어 중심 웹 말뭉치에 독일어, 코드, 수학, 추론 데이터를 가중해 배치했고 출처별 원시 토큰과 반복 배수, 실제 소비량을 구분해 기록했다. 평가는 영어·독일어, 코드, 수학, 지식과 추론 영역에서 16개 공개 모델과 비교했다. 보고서 기준 독일어 종합점수는 79.1로 Qwen3.5 35B-A3B의 81.6보다 낮고 Gemma 3 27B의 78.4보다 높았다.
코드에서는 HumanEval 73.8, MBPP 70.2, 독일어 MBPP 84.2를 기록했지만 오염을 줄인 LBPP는 31.0으로 Nemotron 3 Nano의 38.1보다 낮았다. 단일 B200 GPU, 배치 32, 4만토큰 문맥의 vLLM 측정에서는 초당 4,820토큰으로 Ministral 3 14B보다 9.2배 높았다고 연구진은 보고했다. 이 수치는 프리필 비용을 빼기 위한 지연시간 차감 방식의 집계 처리량이다.
| 벤치마크 | Soofi S | Nemotron 3 Nano | Qwen3.5 35B-A3B | Gemma 3 27B |
|---|---|---|---|---|
| NaturalQuestions 정확도 | 79.0 | 80.3 | 81.0 | 83.5 |
| PIQA | 85.7 | 84.8 | 84.9 | 84.9 |
| 독일어 종합 | 79.1 | 74.9 | 81.6 | 78.4 |
| LBPP pass@1 | 31.0 | 38.1 | 32.4 | 22.4 |
한계도 뚜렷하다. 독일어 경시수학 Minerva MATH-DE는 56.0으로 Qwen3.5 35B-A3B의 76.5에 못 미쳤고, Natural Questions는 79.0으로 Gemma 3 27B의 83.5보다 낮았다. 수학 평가는 처음에 생성 한도 설정 오류로 점수가 크게 낮아져 조건을 수정한 뒤 전 모델을 다시 측정했다. 처리량 결과도 특정 B200·vLLM 프로토콜에 한정된다. 공개 계획이 실제로 모두 이행됐는지와 벤치마크의 독립 재현은 별도 확인이 필요하며, 문서는 2026년 7월 arXiv 사전학습 보고서다.
저작권자 © STORIUM 무단전재 및 재배포 금지














