흉부 X선 다중영상 분류를 다룬 arXiv:2607.13800 v2 프리프린트는 판독 전에 적힌 검사 의뢰 사유의 예측력과, 판독 뒤 작성된 보고서가 라벨 정보를 얼마나 직접 담는지를 함께 분석했다. 연구진은 ReXGradient-160K에서 추린 1만5천 건을 사용했다. 각 검사에는 읽을 수 있는 영상 2장이 있었고, 표적은 독립적인 영상 판독 정답이 아니라 보고서에서 CheXbert로 추출한 5개 관찰값이었다. 첫 두 개 순차 이미지 아카이브에서 고른 표본이어서 전체 데이터셋이나 외부 병원으로 결과를 일반화하기 어렵다는 조건도 붙는다.
주 분석인 U-Ones는 positive와 uncertain을 양성으로 묶고, U-Zeros는 명시적 positive만 양성으로 처리한 민감도 분석이다. U-Ones에서 첫 번째 영상만 넣은 모델의 macro AUROC는 0.643, 두 장 영상은 0.694였다. 의뢰 사유만 넣은 모델은 0.749로 더 높은 점추정치를 보였지만, 두 입력을 직접 맞대응한 사전지정 유의성 검정은 없었다. 두 장 영상과 의뢰 사유를 함께 넣은 ordinary fusion은 0.780이었고 SectionGuard-MI는 AUROC 0.783, AUPRC 0.260을 기록했다. SectionGuard-MI와 ordinary fusion의 paired AUROC 차이는 0.0031, 95% 신뢰구간은 -0.0042~0.0104, FDR 조정 p값은 0.3738로 우위가 확인되지 않았다. AUPRC 차이는 0.0289, 95% 신뢰구간은 0.0095~0.0413, 조정 p값은 0.0040으로 유의했다.

보고서 유출 점검에서는 Findings와 Impression을 넣은 full report only가 macro AUROC 0.979, macro AUPRC 0.836, macro F1 0.753을 기록했다. 정확한 표적명만 지운 뒤에도 AUROC는 0.974였고, 더 넓게 마스킹한 뒤에는 0.973이었다. 이 입력은 CheXbert 표적을 만든 바로 그 보고서이므로 독립적인 진단 성능이 아니라 report-label circularity를 보여주는 통제 실험이다. 고정된 파일 순서 의미에 의존하지 않는 random-swap은 AUROC 0.785·AUPRC 0.265, DeepSets는 0.787·0.261을 기록했다. 신뢰구간이 겹치고 모든 방법 사이의 직접 paired 비교가 제시된 것은 아니다. 연구는 frozen DenseNet-121과 Bio+ClinicalBERT 특징, 5개 시드 앙상블, 2,000회 환자 클러스터 부트스트랩을 사용했다.
| 비교 대상 | macro AUROC / AUPRC | 조건 |
|---|---|---|
| 첫 번째 영상 | 0.643 / 0.117 | U-Ones |
| 두 장 영상 | 0.694 / 0.131 | U-Ones |
| 검사 의뢰 사유 | 0.749 / 0.223 | U-Ones |
| Ordinary fusion | 0.780 / 0.231 | U-Ones |
| SectionGuard-MI | 0.783 / 0.260 | U-Ones |
자료: STORIUM 정리
라벨별로 SectionGuard-MI의 AUROC는 atelectasis 0.716에서 pleural effusion 0.855까지, AUPRC는 consolidation 0.067에서 pleural effusion 0.415까지였다. U-Ones 공개 테스트에서 consolidation 양성은 36건에 그쳤다. 이 논문은 2026년 7월 16일 수정된 arXiv v2 프리프린트이며 공식 메타데이터에서 학술지 게재나 동료평가 완료는 확인되지 않는다. 결과는 보고서 유래 약한 라벨, 선택 표본, 단일 데이터 자원, 외부 검증 부재라는 한계 안에서 해석해야 한다.
저작권자 © STORIUM 무단전재 및 재배포 금지














