아크릴의 보건의료 특화 AI 모델 ‘아름.H2 프랭크’와 연세대 의과대학의 음성 기반 모의 진료 플랫폼 CPX-MATE가 의사국가시험 대비용 AI의 쓰임새를 넓히고 있다. 아름.H2 프랭크는 KorMedMCQA에서 의사시험 435문항을 모두 맞혔고, 의사·치과의사·약사·간호사 4개 직역 3009문항 전체에서는 99% 정답률을 기록했다.
평가 방식도 눈여겨볼 대목이다. 같은 3009개 문항에 같은 프롬프트와 채점 기준을 적용했고, 각 문항은 5회 응답 뒤 다수결로 최종 답을 정했다. 의사시험 부문은 독립 측정 3회 중 두 차례 만점, 한 차례 434문항 정답이었다. 아크릴은 이 모델이 제미나이 3.1 프로, 클로드 오퍼스 5, GPT-5보다 높은 점수를 받았다고 밝혔다. 같은 벤치마크에서 제미나이는 2959문항, 클로드 오퍼스는 2952문항, GPT-5는 2871문항을 맞혔다.

의료 교육 현장에서는 시험 점수 못지않게 실제 사용량이 의미를 갖는다. 연세의대 조사에서는 학생 43명 중 42명이 CPX-MATE를 사용했고, 누적 사용량은 3042회와 745.1시간으로 집계됐다. 모의시험 평균 점수도 1.67점 올랐다. 삼성서울병원 연구팀과 제로원에이아이가 만든 지오메드 2가 KMLE 97.7점, MedQA-USMLE 94.8점을 기록한 사례까지 보면, 의료 AI가 시험 대비와 반복 학습에 어떻게 쓰이는지 윤곽이 더 분명해진다.
다만 이 결과는 시험 문항과 모의 진료 환경에서 확인된 성과다. 실제 진료 보조와는 적용 범위가 다르고, 환자 안전과 임상 책임이 걸린 영역에는 별도의 검증이 필요하다. CPX-MATE를 2026년 92차 의사 국가고시를 앞둔 전국 수험생에게 무료 제공하겠다는 계획도 있어, 의료 교육 현장의 실험은 더 넓어질 전망이다.
저작권자 © STORIUM 무단전재 및 재배포 금지










