텍스트 유도 의료 영상 분할 모듈을 비전·텍스트 백본이 바뀌어도 재사용할 수 있는지가 이 연구의 질문이다. arXiv v1 프리프린트 「Decoupling Language Guidance from Backbones for Text-Guided Medical Segmentation」는 이를 위해 백본 전이형 계층 어댑터 BTHA를 제안한다.
백본에 요구하는 것은 다중 해상도 시각 특징과 텍스트 표현을 내놓는 최소한의 feature-level interface다. SAGSG 어댑터는 특징의 형태를 유지하면서 텍스트 의미를 주입해 기존 디코더와 스킵 경로의 텐서 계약을 보존한다. 보조 예측 헤드와 projection layer는 학습에만 쓰이고 추론 때 제거되거나 무시된다.
학습 감독은 전역 image-text contrastive alignment, 1/32·1/16·1/8 해상도의 multi-scale auxiliary localization, 경계 인지 최종 마스크 정련으로 나뉜다. main loss에는 Dice, Focal, Edge, Lovasz 항이 들어가고 ITC와 보조 헤드 손실을 더한다.

실험 대상은 MosMedData+ CT slice 2,729개, QaTa-COV19 X-ray 9,258개, SIIM-ACR X-ray 12,047개, Kvasir-SEG 내시경 이미지 1,000개다. Dice와 mIoU를 같은 데이터 분할과 절차에서 평가했다. LanGuideMedSeg, TeViA, FMISeg, U-Net, SAM3 등을 비교했고, 강한 직접 비교에는 ConvNeXt-Tiny와 CXR-BERT 조합을 공유한 모델들이 포함됐다.
QaTa-COV19의 여덟 백본 조합에서 BTHA는 여섯 번 최고, 두 번 차선을 기록했다. ConvNeXt-Tiny에 BioViL, CLIP, CXR-BERT를 각각 붙였을 때 Dice/mIoU는 91.45/84.25, 91.68/84.64, 91.88/84.97이었고 BioClinicalBERT는 88.96/80.11로 차선이었다. 시각 백본을 바꾼 경우 Swin-Transformer 91.02/83.51, ViT-Tiny 91.43/84.21, ConvNeXt-Tiny 91.88/84.97이 최고였고 ResNet50은 88.50/79.37로 차선이었다.
네 데이터셋 평균은 Dice 81.97, mIoU 70.74로 보고됐다. 평균 Dice는 가장 강한 경쟁 모델들보다 1.54%p, SAM3보다 2.03%p 높았다. BTHA의 규모는 159.6M 파라미터와 12.5G FLOPs이고 LanGuideMedSeg와 TeViA보다 파라미터가 6.0M 많다. 소거 실험의 Dice는 baseline 90.89, hierarchical only 91.45, SAGSG only 88.12, full 91.88이었다. 외부 임상 검증과 추론 속도 수치는 제시되지 않았다.
| 방법 | 평균 Dice(%)↑ | 평균 mIoU(%)↑ | 파라미터(M) | FLOPs(G) |
|---|---|---|---|---|
| LanGuideMedSeg | 80.25 | 68.42 | 153.6 | 11.2 |
| SAM3(FT, 3 epochs) | 79.94 | 67.70 | 840.6 | 3271.4 |
| BTHA | 81.97 | 70.74 | 159.6 | 12.5 |
자료: STORIUM 정리
저작권자 © STORIUM 무단전재 및 재배포 금지














