512px 입력만 쓰는 SigLIP-HD가 같은 추론 예산의 SigLIP 2보다 DocVQA, ChartQA, HRBench에서 높은 점수를 냈다. LLaVA-NeXT 데이터로 학습하고 비전 인코더를 미동결한 Vicuna-1.5-7B 설정에서 점수는 각각 56.0→59.6, 61.6→65.2, 43.5→48.3이었다. 원문은 arXiv:2607.09488v1이며 첫 페이지에 ICLR 2026 게재 논문이라고 명시돼 있다.
성능 차이는 고해상도를 추론 때 직접 처리한 결과가 아니다. 고정된 SigLIP 2-So400m/16 인코더로 같은 이미지를 512px와 1024px에서 처리하고, 1024px 특징을 bilinear interpolation으로 줄여 512px 특징과 평균낸 값이 교사 표적이다. 학생 인코더는 512px 입력에서 이 표적을 패치 단위 L1 손실로 모사한다.

설계 탐색에서는 512px+1024px 조합이 512px 단독보다 12개 벤치마크 중 10개에서 앞섰고, 2048px 추가 효과는 포화되거나 사라졌다. 고해상도 교사 특징을 만들 때는 비중첩 sliding window가 half-overlap이나 위치임베딩 보간보다 나았으며, 특징 결합은 interpolate+average가 concat과 pixel unshuffle보다 높았다.
학습 자료는 Cambrian-1에서 모은 원시 이미지 450만 장이다. AdamW, 초기 학습률 5e-5, weight decay 0.04, 90K iteration, 총 배치 512를 사용했고 32장 A100에서 BF16으로 34시간 학습했다. AnyRes 조건에서도 DocVQA 67.6→69.7, ChartQA 63.9→67.4, TextVQA 66.9→68.4로 올랐다.
| 실험 조건: LLaVA-NeXT SFT 데이터, vision encoder 미동결, Vicuna-1.5-7B | |||
|---|---|---|---|
| 비전 인코더 | DocVQA | ChartQA | HRBench |
| SigLIP 2 | 56.0 | 61.6 | 43.5 |
| SigLIP-HD | 59.6 | 65.2 | 48.3 |
자료: STORIUM 정리
LLM을 바꾼 실험에서도 방향은 같았지만 개선 폭은 달랐다. Llama-3.2-3B에서는 DocVQA 47.3→49.9, ChartQA 45.2→49.8, TextVQA 59.2→60.8이었고, Qwen2.5-7B에서는 62.5→64.2, 66.1→66.8, 66.1→66.3이었다. 다운샘플링 과정에서 사라진 세부 정보는 복구할 수 없으므로 native-resolution 처리를 대체한다는 결론까지는 뒷받침하지 않는다.
저작권자 © STORIUM 무단전재 및 재배포 금지














