중국의 전국 단위 인터넷 병원에서 수집한 실제 비식별 환자·의사 상담을 바탕으로 멀티모달 의료 벤치마크 MedRealMM이 제안됐다. 합성 대화나 객관식 문항 중심의 기존 평가가 실제 온라인 진료의 긴 대화와 환자 업로드 이미지를 충분히 반영하지 못한다는 문제를 겨냥했다.
연구진은 상담 흐름에서 임상적으로 어려운 순간을 찾는 ‘멀티모달 임상 도전 지점’ 추출 절차를 사용했다. 해당 시점까지의 텍스트와 이미지 문맥을 보존하고 다음 응답 생성 과제로 바꿨으며, 의사가 다듬은 사례별 루브릭으로 바람직한 행동은 보상하고 위험하거나 근거 없고 모순된 답변은 감점하도록 했다.

논문이 설명한 데이터셋은 64개 임상 진료과의 실제 멀티모달 사례 5,620건이며, 일반·의료 특화 모델 19개를 텍스트 전용과 멀티모달 조건에서 평가했다. 전체 벤치마크에서 연구진은 이미지 정보가 성능에 중요했고 최전선 모델도 온라인 의사 응답보다 낮았다고 보고했다. 별도 200건 하위평가에서는 Claude-Opus-4.7이 일반 온라인 의사 응답보다 근소하게 높았지만, 숙고한 의사 응답에는 미치지 못했다. 일부 모델은 긍정 기준을 의사만큼 충족했지만 부정 기준을 더 자주 건드렸다.
이 결과는 평균적인 도움 항목 수보다 위험한 오류 회피가 의료 모델 평가에서 핵심이라는 점을 보여준다. 다만 중국 온라인 병원 자료의 진료 절차·언어·환자 구성은 다른 국가와 다를 수 있다. 비식별화와 사례 추출이 남긴 선택 편향과 실제 환자 결과의 관계는 추가 확인이 필요하다. 논문은 200건·1,797개 기준에서 판정자 일치도를 검증했지만, 중국어·단일 플랫폼이며 응답은 모델별 사례당 한 번만 샘플링했다.
MedRealMM은 2026년 7월 arXiv 프리프린트로 공개됐으며 동료검토 전이다. 연구진은 데이터셋을 허깅페이스에 공개할 계획이라고 밝혔지만, 실제 의료 배치의 안전성이나 진단 능력을 입증한 연구는 아니다. 지역과 의료 체계가 달라질 때의 일반화 성능도 검증해야 한다.
저작권자 © STORIUM 무단전재 및 재배포 금지














