앤트로픽이 2026년 8월 14일 공개한 위험 보고서에서 비공개 내부 모델 ‘모델2(Model 2)’의 성능과 운영 범위를 밝혔다. 보고서의 기준일은 7월 15일이다. 앤트로픽은 모델2를 미토스5보다 전반적으로 조금 더 유능한 모델로 평가하면서도 외부 출시 계획은 현재 없다고 명시했다. 또 통상적인 출시 전 평가 항목을 모두 수행하지 않아 성능 판단의 확신도는 공개 모델보다 낮다고 설명했다.
모델2는 소비자용 제품이 아니라 앤트로픽의 연구·엔지니어링 업무에 투입된 내부 도구다. 회사는 모델2와 미토스5를 대화형 작업과 지속형 에이전트 배포에 활용하며, 코딩과 데이터 생성 등에도 폭넓게 쓰고 있다고 밝혔다. 실제 연구개발 문제 해결력을 재는 내부 평가 CoBench v2에서 모델2는 62.8%를 기록했다. 미토스5는 50.3%, 미토스 프리뷰는 54.8%였다. 평가에는 앤트로픽의 과거 코드베이스와 로그, 내부 메시지, 문서를 바탕으로 실제 엔지니어가 해결했던 원인을 찾아내는 449개 문제가 포함됐다.

| 비교 대상 | CoBench v2 | 공개·이용 상태 |
|---|---|---|
| 모델2 | 62.8% | 내부 사용, 외부 출시 계획 없음 |
| 미토스5 | 50.3% | 검증된 일부 파트너 대상 |
| 미토스 프리뷰 | 54.8% | 비교 기준 모델 |
이 차이는 앤트로픽 연구원과 엔지니어에게 직접적인 실사용 가치가 있다. 회사는 AI 지원으로 내부 연구개발이 이전보다 상당히 빨라졌지만 전체 진전 속도가 두 배가 된 수준은 아니라고 판단했다. CoBench v2 역시 전체 연구 업무를 대표하는 시험이 아니다. 데이터는 미토스 프리뷰가 세 번의 시도 중 한 번 이상 실패한 문제를 중심으로 난도를 걸러 구성됐고, 앤트로픽은 연구 인력을 완전히 대체할 수 있는 시스템이라면 이 평가에서 최소 85%를 기록해야 할 것으로 추정했다.
외부 이용자에게는 성능 수치보다 접근 조건이 핵심 한계다. 모델2는 구매하거나 API로 연결할 수 없으며 가격도 제시되지 않았다. 비교 대상인 미토스5는 검증된 일부 파트너에게 제공되고, 공식 가격은 입력 100만 토큰당 10달러, 출력 100만 토큰당 50달러부터다. 따라서 모델2의 12.5%포인트 우위는 곧바로 더 나은 상용 선택지를 뜻하지 않는다. 평가 범위가 내부 연구개발 문제로 제한되고 출시 전 안전성 검토도 완료되지 않은 만큼, 공개 일정이 확인되기 전에는 내부 연구 역량을 보여주는 지표로 읽는 편이 타당하다.
저작권자 © STORIUM 무단전재 및 재배포 금지














