
의료영상 분할은 서로 다른 모달리티가 보완 정보를 준다는 점에서 다중 모달 접근이 강점을 보이지만, 실제 임상에서는 짝지은 데이터 확보가 쉽지 않다. arXiv에 올라온 이 프리프린트는 그런 제약 아래에서 모달리티 간 지식을 옮기는 UnDA를 제안한다. 핵심은 앵커 도메인에서 구조적 표현을 먼저 학습한 뒤, 목표 도메인에는 그 정보를 정합시키는 방식이다.
이 프레임워크는 두 단계로 동작한다. 먼저 앵커 네트워크가 라벨이 있는 데이터로 클래스 토큰을 학습하고, 이어서 앵커를 고정한 채 목표 네트워크를 최적화한다. 여기서 backbone-agnostic Alignment Module은 attention 기반 pooling으로 의미 구조가 담긴 클래스 토큰을 뽑아내고, 목표 쪽 토큰은 잔차 MLP adapter로 모달리티 차이를 보정한다.
정렬 단계에서는 Uncertainty-Weighted Optimal Transport(UCT-OT)가 쓰인다. 예측 엔트로피로 토큰 불확실성을 계산해 신뢰도가 낮은 샘플의 가중치를 낮추고, Sinkhorn 반복으로 토큰 분포를 맞춘다. 여기에 클래스별 ProtoNCE가 더해져 배치가 달라도 프로토타입 기억을 안정적으로 유지하도록 설계됐다. 논문은 이 조합이 잡음이 섞인 지도 신호의 전파를 줄이고, 큰 모달리티 간격에서도 전역적 구분성을 유지한다고 설명한다.
검증은 BraTS 2023의 T2-FLAIR에서 T1-native로의 뇌종양 분할과 MM-WHS의 MRI에서 CT로의 심장 구조 분할에서 이뤄졌다. BraTS 2023에서는 UnDA의 Dice가 WT 80.9%, TC 67.7%, ET 51.5%, 평균 66.7%로, 타깃 모델의 평균 59.0%보다 높았다. 같은 설정의 HD95 평균은 11.80 mm로, 타깃 모델의 23.92 mm보다 낮았다. 특히 Tumor Core HD95는 29.1 mm에서 12.4 mm로 줄어들었다고 본문은 적었다.
MM-WHS에서는 UnDA가 평균 Dice 82.71%, 평균 HD95 13.94 mm를 기록했다. 비교 대상으로 제시된 CT-only supervised baseline보다 Dice는 11.12포인트 높고 HD95는 7.47 mm 낮았다. 또 공동저자 구현을 같은 경량 3D CNN 인코더로 맞춘 비교에서는, UnDA가 평균 Dice 82.71%로 UMMKD 85.99%에는 못 미쳤지만, 평균 HD95 13.94 mm로는 가장 좋았다. 세부 ablation에서는 단순 LpNCE만으로는 일부 구조에서 성능이 오르내렸고, 가중 없는 OT는 전체 평균 Dice가 0.92포인트 떨어졌지만, UCT-OT를 쓰면 LV와 PA에서 큰 개선이 나타났다고 보고했다.
| 검증 설정 | 주요 수치 | 비교군/비고 |
|---|---|---|
| BraTS 2023 T2-FLAIR→T1-native | UnDA: Dice WT 80.9 / TC 67.7 / ET 51.5, Mean 66.7%; HD95 WT 9.10 / TC 10.10 / ET 16.19, Mean 11.80 mm | Target (T1-native): Mean Dice 59.0%, Mean HD95 23.92 mm; Anchor (T2-FLAIR): Mean Dice 72.2%, Mean HD95 14.99 mm |
| MM-WHS MRI→CT | UnDA: Mean Dice 82.71%, Mean HD95 13.94 mm | CT-only supervised baseline: +11.12 Dice points, -7.47 mm HD95; Anchor MR mean Dice 72.96%, Target CT mean Dice 71.59% |
| MM-WHS 비교 백본 통일 설정 | UnDA: Mean Dice 82.71%, Mean HD95 13.94 mm | UMMKD Mean Dice 85.99%, Mean HD95 23.13 mm; SIFA v2 Mean Dice 71.33%, Mean HD95 21.92 mm |
| Ablation, MM-WHS | 가중 없는 OT는 no-alignment baseline 대비 mean Dice -0.92; UCT-OT는 LV +5.81, PA +28.84 | LpNCE 단독은 RA +3.99, PA +24.66이지만 LV Myo -1.51, LA -1.80 |
자료: STORIUM 정리
결과적으로 이 방법은 짝지은 임상 데이터 없이도 구조적 정보를 옮길 수 있음을 두 개의 분할 과제에서 보였다. 다만 본문 수치는 특정 데이터셋과 설정에 한정된 것으로, 백본과 모달리티 조합, 그리고 두 단계 학습 절차가 결과에 어떤 영향을 주는지는 추가 검증이 필요하다.
저작권자 © STORIUM 무단전재 및 재배포 금지














