알츠하이머병 예측에서는 정확도만으로는 부족하다는 점이 다시 확인됐다. 이 arXiv 프리프린트는 결측 보간을 쓰지 않는 트랜스포머 NITROGEN을 ADNI에서 학습한 뒤, OASIS-3와 AIBL 두 독립 코호트에 추가 재학습 없이 적용해 진단 분류, 인지 점수 회귀, 불확실성 보정을 함께 검증했다. 핵심은 부분 관측 기록에서 환자 내부의 특징 의존성과 환자 간 관계를 동시에 다루는 것이다.
분석에 사용된 규모는 ADNI 7,858 scans, OASIS-3 2,675 scans, AIBL 1,286 scans였다. 내부 분할은 ADNI에서 60%/20%/20% 학습·검증·시험으로 구성됐고, 외부 평가는 OASIS-3와 AIBL로 수행됐다. CN vs AD 이진 분류에서 ADNI 시험 AUC는 모든 모델이 0.913~0.935 범위였고, AIBL은 0.901~0.918로 유지됐으나 OASIS-3에서는 0.689~0.719로 떨어졌다. 같은 조건에서 NITROGEN과 NAIM 같은 attention 기반 모델은 tree 기반 앙상블보다 감도 측면에서 더 균형적인 운영점을 보였다.

세 집단 CN·MCI·AD를 구분하는 다중 분류에서는 MCI가 가장 어려웠다. ADNI 시험에서 MCI의 per-class AUC는 0.547~0.654였고, OASIS-3에서는 0.361~0.441까지 더 낮아졌다. 반면 AD 구분은 가장 안정적이어서 ADNI 시험에서 0.830~0.863, AIBL에서는 NITROGEN이 0.907의 per-class AUC를 기록했다. 저자들은 이 패턴이 MCI의 이행적·이질적 성격과 코호트 차이를 반영한다고 해석했다.
보정(calibration) 평가에서는 이야기의 초점이 달라졌다. tree 기반 모델 일부는 분별력은 높아도 과신 경향을 보였고, NAIM과 NITROGEN은 데이터셋 전반에서 더 나은 확률 보정을 보였다. 그림 3의 ADNI 검증에서 NITROGEN은 정답과 오답 사이 예측 확률 차이가 가장 크게 나타났고, OASIS-3로 가면 모든 모델의 보정이 악화됐다. 같은 성능이라도 신뢰 가능한 확률을 내놓는지가 별도 과제라는 점을 이 부분이 보여준다.
설명 가능성 분석에서는 temporal pole의 피질 두께, 나이, APOE 유전형이 중요한 특징으로 반복해서 선택됐다. 표 A7의 sufficiency 분석은 이 신호가 단독으로는 충분하지 않지만, 조합하면 분류에 기여함을 확인했다. ADNI 시험에서 Base 조건의 NITROGEN AUC는 0.91이었고, MRI만 남긴 조건은 0.77, 선택된 MRI 하나와 나머지를 모두 가린 ALL 조건은 0.77이었다. AIBL과 OASIS-3에서도 같은 표의 조건별 비교가 제시돼, 특징 하나의 기여와 전체 다중모달 입력의 차이를 함께 드러냈다.
| 항목 | 수치/결과 | 근거 |
|---|---|---|
| 학습 코호트 | ADNI 7,858 scans | Abstract |
| 외부 평가 코호트 | OASIS-3 2,675 scans; AIBL 1,286 scans | Abstract |
| CN vs AD AUC 범위 | ADNI test 0.913–0.935; AIBL 0.901–0.918; OASIS-3 0.689–0.719 | 2.2 Binary Disease Group Classification / Table A2, Fig. 3a |
| 다중 분류 AD per-class AUC | ADNI test 0.830–0.863; NITROGEN 0.863, AIBL 0.907 | 2.3 Multi-class Diagnostic Classification / Table A5 |
| 불확실성 조정 최적 설정 | β*=0.400, τ=0.900; 756/882(85.7%) 유지, 정확도 0.8617→0.8995 | Fig. A6 |
자료: STORIUM 정리
마지막으로 모달리티가 빠졌을 때의 신뢰도 조정도 제안됐다. 결측 모달리티의 중요도에 비례해 예측 불확실성을 높이는 방식이며, 그림 A6에서는 고정 임계값 τ=0.900에서 β*=0.400이 선택됐다. 이때 검증 샘플 882개 중 756개, 즉 85.7%를 유지했고, 유지 샘플 정확도는 0.8617에서 0.8995로 상승했다. 반대로 거절된 샘플의 정확도는 0.6349였다. 결론적으로 이 연구는 결측을 메우는 대신 결측을 그대로 다루는 학습이 외부 코호트에서도 의미 있는 구분력을 유지하면서, 보정과 불확실성 표현을 따로 점검해야 함을 보여준다.
1차 출처: https://arxiv.org/abs/2607.11656
저작권자 © STORIUM 무단전재 및 재배포 금지














