라벨이 적은 의료영상 분류에서는 확산모델로 합성 데이터를 보태는 방식이 자주 쓰이지만, 모든 생성 샘플이 같은 도움을 주지는 않는다. Purdue University의 Jeeyung Kim, Erfan Esmaeili, Qiang Qiu는 arXiv v1 프리프린트에서 이미지의 사실감이나 다양성 대신, 분류에 얼마나 유용한지를 기울기 기반 영향도로 재고 그 값으로 생성기를 조정하는 방법을 제안했다. 이 논문의 핵심은 Class-Contrastive Influence, C2I다. 생성 샘플의 손실 기울기가 같은 클래스의 검증 샘플 기울기와는 정렬되고 다른 클래스와는 어긋날수록 C2I가 커지도록 정의한다. 연구팀은 이런 샘플이 대체로 결정경계에 가까운 어려운 예시라고 해석하며, 분류기가 경계를 다듬는 데 더 유용하다고 본다. 반면 이 해석은 로지스틱 회귀 분석에 근거한 직관이며, 딥 분류기에 대한 보장은 아니라고 적었다.

방법은 plug-and-play 형태다. 사전학습된 Stable Diffusion 2.1을 쓰고, 분류기와 생성기의 구조는 바꾸지 않은 채 RL로 미세조정한다. 보상은 검증셋의 기울기 신호로 계산하며, 생성기는 검증 데이터 전체가 아니라 분류기용 보상 계산에 쓰는 검증 분할만 이용한다. 이때 다중 클래스에서는 클래스별 평균 영향도를 softmax로 묶어 C2I를 확장한다.
실험은 세 가지 MedMNIST 벤치마크, BreastMNIST, DermaMNIST-binary, PneumoniaMNIST에서 진행됐다. 학습은 클래스당 16개 라벨 예시를 썼고, BreastMNIST만 클래스당 32개를 사용했다. 평가는 clean test images와 salt-and-pepper noise(amount 0.01), Gaussian blur(radius 2), JPEG compression(quality 25%)을 준 noisy test images에서 AUC로 이뤄졌다. 분류기는 ViT-B/16과 RL에 쓰지 않은 ResNet-18을 썼다.
Table 1에서 C2I 기반 방법은 ViT-B/16에서 BreastMNIST 0.885, DermaMNIST-binary 0.853, PneumoniaMNIST 0.945, 평균 AUC 0.894를 기록했다. 같은 표의 Original only는 0.828, 0.846, 0.941, 평균 0.873이었고, RandAugment 0.879, RandomErasing 0.885, Mixup 0.867, DataDream 0.866, Dataset Expansion 0.880, DistDiff 0.784였다. ResNet-18에서도 Ours는 평균 0.882로 Original only 0.842, DataDream 0.865, Dataset Expansion 0.864보다 높았다.
강건성 평가는 결과를 조금 더 나눠 보여준다. Table 2에서 DermaMNIST-binary의 평균 AUC는 Original only 0.800, Dataset Expansion 0.820, DataDream 0.820, Ours 0.834였고, BreastMNIST는 각각 0.761, 0.768, 0.799, 0.819였다. PneumoniaMNIST에서는 Original only 0.907, Dataset Expansion 0.883, DataDream 0.910, Ours 0.893으로, Ours가 모든 경우에 가장 높지는 않았다. 연구팀은 RL 미세조정이 30 epochs에 약 5 GPU hours가 걸렸고, 분류기 학습은 약 10분이었다고 밝혔다.
| 항목 | 값 | 원문 위치 |
|---|---|---|
| 평가 데이터셋 | BreastMNIST, DermaMNIST-binary, PneumoniaMNIST | |
| 학습 샘플 수 | 클래스당 16개, BreastMNIST는 클래스당 32개 | |
| RL 성능 | 30 epochs, 약 5 GPU hours | |
| BreastMNIST AUC | Original only 0.828, Ours 0.885 | |
| DermaMNIST-binary 노이즈 평균 AUC | Original only 0.800, Dataset Expansion 0.820, DataDream 0.820, Ours 0.834 |
자료: STORIUM 정리
논문은 또 DermaMNIST-all 7클래스에서 정확도 0.683으로 Original 0.648, R-E 0.664, R-A 0.669, DataDream 0.660보다 높다고 보고했다. 반면 PneumoniaMNIST의 노이즈 평균 AUC처럼 모든 조건에서 최고는 아니어서, 이 방법은 합성 데이터의 ‘보기 좋은 정도’보다 분류기와 검증셋 사이의 기울기 정렬을 더 잘 맞추는 쪽에 강점이 있다고 보는 편이 원문에 가깝다.
저작권자 © STORIUM 무단전재 및 재배포 금지














