문샷AI의 공식 논문 ‘Attention Residuals’는 저자를 ‘Kimi Team, Guangyu Chen’ 순으로 표기하고 Yu Zhang, Jianlin Su 등 공동 연구진을 함께 명시한다. 여기서 확인할 수 있는 인재 활용의 증거는 특정 연구자가 실명으로 결과물에 참여했다는 사실이다. 논문과 공식 저장소에는 Guangyu Chen의 나이, 영입 경위, 고용 형태가 적혀 있지 않다. 따라서 공식 자료가 뒷받침하지 않는 개인 이력과 채용 서사는 사실로 다루지 않는다.
연구가 다루는 문제는 트랜스포머의 잔차 연결이다. 일반적인 PreNorm 구조는 모든 층의 출력을 같은 가중치로 누적해 모델이 깊어질수록 각 층의 기여가 희석될 수 있다. 연구진은 앞선 층의 표현을 입력에 따라 선택적으로 모으는 Attention Residuals를 제안했다. 모든 이전 출력을 보는 Full AttnRes와 층을 블록으로 묶어 메모리를 줄이는 Block AttnRes를 구분했고, Kimi Linear 48B 모델에서 토큰마다 3B 파라미터를 활성화해 1.4조 토큰으로 사전학습한 실험을 보고했다.

젊은 연구 인재를 활용한다는 말도 나이 자체보다 검증 가능한 산출물로 평가해야 한다. 이 사례에서 조직이 확인할 수 있는 항목은 저자 기여, 공개 논문, 재현 가능한 공식 코드, 비교 실험의 조건과 한계다. 경력 연차나 파격 채용 서사를 성과의 대리 지표로 삼기보다, 문제 정의부터 구현과 검증까지 어떤 책임을 맡았는지 기록하는 편이 낫다. 초기 경력 연구자에게도 같은 기준과 공개 가능한 기여 경로를 적용하면 인재 발굴 속도와 연구 신뢰성을 함께 높일 수 있다.
| 검증 항목 | 공식 자료에서 확인 | 확인 불가·제외 |
|---|---|---|
| 연구 참여 | Guangyu Chen이 저자 목록에 포함됨 | 나이·고용 형태·채용 경위 |
| 방법 | 층 깊이 방향의 선택적 어텐션 집계 | 모든 모델에 같은 효과라는 일반화 |
| 대규모 실험 | 48B/3B 활성, 1.4조 토큰 | 정률 향상이라는 단일 결론 |
핵심은 한 사람을 영웅화하는 것이 아니라 공개된 기여를 읽는 방식이다. 논문은 AttnRes가 숨은 상태의 과도한 증가와 층별 기여 희석을 완화하고, 여러 하위 벤치마크에서 기준 모델보다 나은 결과를 냈다고 보고한다. 다만 이는 논문에 적힌 구조와 학습 조건 안의 결과다. 근거는 arXiv 공식 논문과 MoonshotAI 공식 저장소다. 사진은 문샷AI가 제공한 2026 중관촌포럼 현장 사진으로, 대표 사진은 National Business Daily(每日经济新闻) 보도, 본문 사진은 Beijing Daily 보도에서 출처와 행사 맥락을 확인했다.
저작권자 © STORIUM 무단전재 및 재배포 금지













