머신러닝 힘장(MLFF)은 학습 분포 밖에서 성능이 흔들리기 쉬워, 어떤 데이터를 더 찍어내느냐가 핵심 과제로 남아 있다. Sheng Bi, Yi-Ze Wang, Jun Cheng이 2026년 7월 16일 공개한 arXiv v1 프리프린트는 이런 병목을 줄이기 위한 활성학습 흐름으로 last-layer-projection regression(LLPR)을 제안하고, 물 분자·응축상·전해질 세 체계에서 검증했다.
핵심은 매 구성마다 추가 추론이 거의 들지 않는 불확실성 신호를 써서, DFT 라벨을 붙일 후보를 더 똑똑하게 고르는 데 있다. 기존 모델 위원회 방식은 파인튜닝 시 각 위원마다 별도 실행이 필요해 foundation MLFF에는 비효율적이라고 본다. 반면 LLPR은 단일 모델에서 계산하는 전방패스 기반 추정치로, 표본 선택 비용을 낮추는 방향으로 설계됐다.

물/얼음의 from-scratch 학습에서는 7241개 RPBE-D3 구성으로 만든 데이터셋 중 1140개 얼음 파티션을 후보 풀로 쓰고, 990개 다상 테스트셋으로 평가했다. 비교 기준인 전체 데이터 ceiling은 3955프레임으로 학습했으며, worst-1% 평균 에너지 오차 5.4 meV/atom과 force 오차 0.102 eV/Å를 기록했다. 이때 K=100의 LLPR 기반 선택은 300프레임 학습셋만으로 평균 테스트 에너지 약 1.7 meV/atom, force 약 0.047 eV/Å에 도달했고, 논문은 이를 해당 full-data ceiling 대비 에너지 오차 31%, 힘 오차 9% 이내라고 표현했다.
같은 물/얼음 대상의 foundation 파인튜닝에서도 LLPR의 선택 성능이 확인됐다. MACE-MP-0 small을 주력 foundation으로 두고, MACE-MP-0 medium을 크기 비교로 포함했다. K=50에서 에너지-LLPR 선택은 평균 테스트 에너지 5.4 meV/atom을 냈고, 논문은 이 에너지 오차가 같은 K의 랜덤 기준보다 세 자릿수 낮다고 보고했다. K=100에서는 1.17 meV/atom으로 올라가 small foundation의 full-pool ceiling 0.89 meV/atom에 가까워졌다. 논문은 또 2027프레임 풀에서 예측 분산과 실제 제곱오차의 bin-mean 곡선이 y=x 대각선에 놓여, 불확실성이 정량적으로 맞물린다고 설명한다.
가장 흥미로운 대목은 전해질 반복 파인튜닝이다. 21 molal LiTFSI water-in-salt 전해질에서 초기 OMAT-small foundation은 분자 동역학은 안정적이지만 구조적으로는 환각을 보였고, LLPR는 DFT 라벨링 전에 비물리적 국소 배위를 감지했다. 이어 절대 force-error threshold를 제공해 학습 루프의 자동 종료까지 가능하게 했다. 최종 모델은 기준 밀도와 이온 배위 구조를 재현했다고 보고됐다.
| 검증 체계 | 핵심 수치 | source_locator |
|---|---|---|
| 물/얼음 from-scratch 학습 | 7241개 RPBE-D3 구성; 후보 풀 1140프레임 얼음 파티션; 테스트셋 990프레임; full-data ceiling 3955프레임; ceiling 오차: 에너지 5.4 meV/atom, force 0.102 eV/Å | |
| 물/얼음 파인튜닝 | K=50에서 에너지-LLPR 평균 테스트 에너지 5.4 meV/atom; K=100에서 1.17 meV/atom; small foundation full-pool ceiling 0.89 meV/atom | |
| 전해질 반복 파인튜닝 | 21 molal LiTFSI water-in-salt 전해질; 300프레임 생성 궤적; 비물리적 국소 배위 감지; 절대 force-error threshold와 자동 종료 |
자료: STORIUM 정리
이 결과는 MLFF 데이터 생성에서 표본 수뿐 아니라 선택 기준이 중요하다는 논문의 주장을 뒷받침한다. 다만 full-data 수준에 근접했다는 평가는 논문 내부의 각 데이터셋·지표·비교 ceiling에 한정되며, 다른 화학계나 실제 배포 성능으로 일반화할 수 없다. 연구진은 LLPR이 단일 학습 모델에서 결정적 불확실성을 제공해, 모델 위원회보다 적은 계산량으로 비슷한 선택 성능을 낸다고 정리했다.
저작권자 © STORIUM 무단전재 및 재배포 금지














