알리바바 큐웬팀은 8월 3일 장기 과제를 겨냥한 LLM(대규모 언어 모델) Qwen3.8-Max를 공개했다. 이 모델은 Qwen3.5 구조를 바탕으로 전체 2조4000억 개 파라미터 가운데 요청마다 950억 개를 활성화한다. 현재 QwenCloud에서 이용할 수 있으며, 모델 가중치는 다음 주 허깅페이스와 모델스코프에 공개할 계획이다. 즉시 쓸 수 있는 클라우드 서비스와 아직 공개 전인 가중치를 구분해 볼 필요가 있다.
큐웬팀이 공개한 장기 작업 사례는 단발성 문답보다 프로젝트 실행에 초점을 맞춘다. Qwen3.8-Max는 16일 동안 명령줄 도구를 만들면서 265개 커밋과 127개 풀리퀘스트, 151개 이슈를 처리했다. 또 시작 코드 없이 논문 결과를 재현하는 과제에서는 약 5일간 7600줄의 코드를 작성하고 33개 GPU 학습 작업을 수행했다. 다른 실험에서는 24시간 동안 멀티모달 대화 의도 인식 대회 과제를 수행해 45차례 제출 끝에 정확도를 0.60에서 0.853으로 높였으며, 참가한 526개 인간 팀 가운데 458개 팀보다 높은 결과를 냈다. 이 수치는 모두 회사가 제시한 사례이므로 실제 업무 도입 전에는 조직별 재현 시험이 필요하다.

| 항목 | 확인된 내용 | 이용 상태 |
|---|---|---|
| 모델 규모 | 전체 2조4000억 개, 요청당 950억 개 활성화 | QwenCloud 제공 중 |
| 개발 도구 연동 | OpenAI Chat Completions 형식과 앤트로픽 API 규격 지원 | 코딩 도구 연결 가능 |
| 오픈 가중치 | 허깅페이스·모델스코프 공개 계획 | 다음 주 예정 |
기존 개발 환경과의 연결성은 실사용에서 가장 직접적인 변화다. Qwen3.8-Max는 OpenAI Chat Completions 형식과 앤트로픽 API 규격을 지원해 Claude Code, Codex, Qoder CLI, Qwen Code, OpenClaw에 연결할 수 있다. 추론 강도를 세 단계로 조절하는 reasoning_effort 매개변수도 제공해 처리 속도와 검토 깊이 사이의 균형을 선택할 수 있다. 멀티모달 입력은 200쪽이 넘는 문서와 100시간이 넘는 영상을 처리하도록 설계됐고, 함께 공개된 Qwen-MM-Plugins는 이미지·영상 처리와 시각 도구 사용, 멀티모달 기억 기능을 에이전트 시스템에 더한다.
업무 도입의 한계도 분명하다. 개발 사례와 벤치마크는 큐웬팀이 수행한 내부 평가이며 독립 검증은 아직 끝나지 않았다. 회사 자료에서 PaperBench 점수는 93, TerminalBench 2.1 점수는 86.6으로 제시됐지만, 동일한 환경에서 외부 기관이 재현한 결과는 아니다. 모델 가중치 공개 역시 발표 시점에는 완료된 일이 아니라 다음 주 계획이다. 따라서 장기 코딩과 대용량 문서·영상 분석이 필요한 개발팀은 먼저 QwenCloud에서 기존 도구와의 호환성, 작업 중단 조건, 비용을 자체 점검한 뒤 오픈 가중치의 실제 배포 조건을 확인해야 한다.
저작권자 © STORIUM 무단전재 및 재배포 금지














