같은 과학 PDF를 파싱 텍스트로 읽힐 때와 페이지 이미지로 읽힐 때 무엇이 달라지는지를 비교한 실험이다. Text Pretraining(TP)과 Visual Pretraining(VP)은 비-PDF 텍스트 코퍼스, 시작 체크포인트, 최적화 절차, SFT 단계를 같게 두고 PDF 표현만 바꿨다. TP는 MinerU2.5가 파싱한 텍스트를, VP는 렌더링한 페이지 이미지를 사용했다.
VP는 고정된 ViT형 vision tower와 spatial merger의 특징을 이용한다. 패치 분산과 밝기로 빈 배경을 제거하고 전경 토큰을 raster 순서로 배치한 뒤 LLM hidden space에 투영한다. 다음 전경 시각 latent를 맞히는 contrastive loss를 쓰는 decoder-free 구성이며, vision tower는 고정하고 LLM, visual input projection, prediction head만 갱신했다.

토큰 사용량은 Qwen 계열에서 TP가 과학 PDF의 파싱 텍스트 약 80B 토큰, VP가 시각 토큰 약 20B였다. 총 CPT 예산은 TP 180B와 VP 120B다. Qwen 3.5의 CoT 평가에서 MMLU-Pro는 83.91→85.09, GPQA Diamond는 76.24→79.29, AIME 2025는 89.58→90.21, HLE는 15.70→16.67로 변했다. Llama 3.1도 같은 순서로 60.64→62.77, 43.88→47.10, 23.65→24.27, 6.79→7.17을 기록했다.
그러나 개선 폭은 과제마다 달랐다. HLE 최대 상승은 0.97점이었고, 멀티모달 표의 Qwen 3.5 ChartQAPro처럼 TP에서 57.99가 56.42로 낮아진 항목도 있다. 반면 과학 문서 이미지-텍스트 100쌍의 교차모달 정렬은 centroid separation 1.665→0.661, cosine similarity 0.631→0.907, Linear CKA 0.657→0.745로 바뀌었다. mutual k-NN도 @1 0.140→0.310, @5 0.288→0.420, @10 0.395→0.496으로 보고됐다.
| 백본 | 조건 | MMLU-Pro | GPQA | AIME | HLE |
|---|---|---|---|---|---|
| Qwen 3.5 | Text Pretraining | 83.91 | 76.24 | 89.58 | 15.70 |
| Qwen 3.5 | VP | 85.09 | 79.29 | 90.21 | 16.67 |
| Llama 3.1 | Text Pretraining | 60.64 | 43.88 | 23.65 | 6.79 |
| Llama 3.1 | VP | 62.77 | 47.10 | 24.27 | 7.17 |
자료: STORIUM 정리
Yiming Zhang 등의 arXiv:2607.09657v1 프리프린트는 VP를 텍스트 사전학습의 대체재가 아니라 보완재로 규정한다. 결과의 적용 범위도 지식 밀도가 높은 과학 PDF에 한정했다. 자연 이미지와 비디오에서도 같은 효과가 나는지는 아직 확인되지 않았다.
저작권자 © STORIUM 무단전재 및 재배포 금지














