
수술 중 절제연 판정에 Rapid Evaporative Ionization Mass Spectrometry(REIMS)를 쓰는 연구는 많지만, 실제 수술실의 잡음 많은 비표지 데이터에 얼마나 견디는지는 늘 과제였다. 2026년 7월 23일 공개된 동료검토 전 arXiv 프리프린트는 이런 간극을 줄이기 위해, 사전에 정의한 개념 라벨 없이도 데이터에서 의미 있는 개념을 찾는 Agent-Guided Concept Discovery를 제안한다. 핵심은 스펙트럼을 곧바로 진단으로 보내지 않고, 사람이 이해할 수 있는 중간 개념으로 바꿔 해석 가능성과 일반화를 함께 노린 점이다.
이 틀에서는 학습 중 추론 에이전트가 발견된 개념의 의미 설명을 다듬고, 진단적 관련성에 따라 가중치를 조정한다. 이어 biochemical knowledge graph를 사용해 개념을 알려진 대사 관계와 맞물리게 한다. 논문은 이러한 설계를 통해 복잡한 질량분석 워크플로에서 얻기 어려운 개념 주석 없이도 개념을 발견할 수 있다고 설명한다. 다만 근거는 ex vivo 데이터와 대표적 수술 중 사례에 한정되어 있다.
데이터는 두 종양외과 코호트의 REIMS 스펙트럼으로 구성됐다. 피부 기저세포암(BCC) 데이터셋은 91명 환자에서 얻은 693개 annotated burns, 즉 252개 종양과 441개 양성 표본으로 이뤄졌고, 유방암 데이터셋은 11명 환자에서 얻은 144개 ex vivo burns, 즉 41개 종양과 103개 양성 표본을 포함한다. 또 27분 절차 동안 1 Hz로 1,616개의 스펙트럼을 기록했고, 이는 수술 중 주석으로 라벨링됐다고 적었다.
성능 평가는 30회 반복의 평균과 표준편차로 제시됐다. 피부암 데이터셋에서 제안법의 AUROC는 0.76±0.026으로 Transformer의 0.74±0.027, DreaMS 기반 분류기의 0.71±0.034보다 높았다. balanced accuracy는 0.70±0.043, sensitivity는 0.82±0.031, specificity는 0.86±0.013이었다. 유방암 데이터셋에서는 balanced accuracy가 0.87±0.018, sensitivity 0.81±0.044, specificity 0.93±0.024, AUROC 0.98±0.013으로 보고됐다. 같은 표에서 Transformer와 DreaMS는 각각 0.82±0.035, 0.84±0.028의 balanced accuracy를 보였다.
저자들은 또 수술 중 유방암 사례에서 false positive가 더 적었다고 제시했다. 설명 가능성 측면에서는 Fig. 2에서 m/z 범위와 대사체·경로를 연결한 지식그래프 일부와, PR 상태에 따른 개념 활성화를 함께 보여준다. 예시로 130–135, 211–222, 892–894의 m/z 하위 대역이 아미노산 및 글루타민 관련 경로와 연결됐고, PR-negative 샘플에서 해당 대역의 활성화가 더 높게 나타났다고 적었다. 해석의 실험 범위는 모델 내부 평가와 대표적 intraoperative case에 머문다.
| 항목 | 수치/구성 | 근거 위치 |
|---|---|---|
| BCC 데이터셋 | 693 annotated burns / 91 patients (252 tumors, 441 benign) | p.3 | Materials and Methods 2.1 Data |
| Breast cancer 데이터셋 | 144 ex vivo burns / 11 patients (41 tumors, 103 benign) | p.3 | Materials and Methods 2.1 Data |
| 수술 중 기록 | 27분 동안 1,616 spectra, 1 Hz, intraoperative surgical annotations | p.3 | Materials and Methods 2.1 Data |
| 반복 학습/평가 | 30 runs 평균±표준편차, K=8 concepts, Adam lr 10−3, batch size 32, up to 40 epochs | p.6 | 2.3 Experiments |
자료: STORIUM 정리
실험 설정은 DreaMS foundation model을 고정한 채 feature extractor로 쓰고, K=8개 개념을 학습하는 방식이었다. 에이전트는 Qwen2.5-7B-Instruct 모델을 사용했고, Adam 학습률 10−3, batch size 32, 최대 40 epoch로 훈련했다. 학습·검증·테스트 분할 뒤 검증셋에서 하이퍼파라미터를 고르고, 모든 실험을 30회 반복해 평균과 표준편차를 제시했다. 이런 구성은 개념 주석이 없는 질량분석 환경에서 설명 가능한 절제연 판정을 탐색하려는 시도로 읽힌다.
저작권자 © STORIUM 무단전재 및 재배포 금지











