ALICE는 21개 평가 설정, 96개 downstream task, 48개 데이터 소스에서 비교 대상 중 가장 높은 평균 순위를 기록했다. vision-only, vision-language, slide-level 세 묶음에서 2위 모델보다 각각 1.79, 6.39, 3.04퍼센트포인트 앞섰다는 것이 arXiv:2607.09526v1의 집계다. 개별 모든 지표에서 1위였다는 뜻은 아니며 일부 과제에서는 다른 모델이 더 높았다.
하나의 백본에 서로 다른 병리 모델의 역량을 순차적으로 옮기는 agglomerative distillation이 방법의 중심이다. UNI-2·Virchow-2·H-Opt-1에서 형태 표현을, CONCH·MUSK·KEEP에서 언어 정렬을, TITAN·CARE에서 전체 슬라이드 문맥을 차례로 증류했다.

평가 범위에는 ROI 분류·검색·세그멘테이션·8-shot 분류, 19개 WSI 진단 분류, 21개 슬라이드 간 검색, 7개 바이오마커 예측, 6개 생존 분석이 포함됐다. 선형 프로빙과 미세조정 비교에서는 미세조정이 대체로 높았고 ER 상태 0.8900, PBRM1 변이 0.8225, BAP1 변이 0.8997이 보고됐다. 이 수치들은 논문이 선택한 비교 모델과 후향적 병리 벤치마크 안에서 나온 결과다. 외부 전향 평가나 실제 임상 의사결정 성능을 확인한 연구가 아니며, arXiv v1 단계라는 점도 남아 있다.
| 평가 설정 | 2위 모델 대비 ALICE 우위 |
|---|---|
| Vision-only | 1.79%p |
| Vision-language multimodal | 6.39%p |
| Slide-level | 3.04%p |
자료: STORIUM 정리
저작권자 © STORIUM 무단전재 및 재배포 금지














