장기 대화 에이전트의 기억을 최종 답변 정확도만으로 평가하지 않고, 기억이 생성·수정·삭제되는 과정을 따로 추적하는 MemOps가 공개됐다. MemTensor 연구진은 기억하기, 잊기, 갱신하기, 성찰하기, 여러 연산의 순서를 복원하는 궤적 연산 등 5개 유형을 정의했다. 논문은 2026년 7월 14일 공개된 arXiv 프리프린트다.
MemOps는 100개 주제와 403개 증거 대화, 9672개 대화 턴을 담는다. 고유 QA 쌍은 2006개이며 인접 증거와 장문 맥락 두 조건을 합쳐 4012개 평가 인스턴스를 만든다. 장문 조건은 평균 약 6만821토큰, 최대 약 6만8309토큰이다. 생성된 대화 727개 가운데 품질관리 뒤 403개가 남아 유지율은 55.4%였다.

각 기억 사건에는 촉발 조건, 대상, 범위, 상태 전이, 근거를 구조화한 정답 궤적이 붙는다. 평가는 연산 추적, 대상 연결, 상태 전이, 후보 구분, 연산 적용, 상태 궤적 등 6개 프로브로 나뉜다. 최종 답이 맞더라도 이미 폐기된 값을 참조했거나 잊어야 할 정보를 노출한 경우를 별도 실패로 잡기 위한 설계다.
전체 정확도에서 인접 증거 조건 최고치는 Claude-Sonnet-4.5의 0.916이었다. 장문 조건에서는 GLM-4.6이 0.808로 가장 높았고, Gemini-3-Flash는 0.663이었다. GPT-4.1-mini 기반 RAG는 턴 단위 검색 0.618에서 세션 단위 검색 0.845로 상승했다. 같은 모델의 상태 궤적 점수도 턴 단위 0.073, 세션 단위 0.549로 차이가 났다.
| 시스템·조건 | 전체 정확도 | 연산 F1 | 근거 점수 | 상태 궤적 정확도 |
|---|---|---|---|---|
| Claude-Sonnet-4.5 인접 | 0.916 | 0.887 | 0.941 | 0.927 |
| GLM-4.6 장문 | 0.808 | 0.772 | 0.792 | 0.415 |
| RAG 턴 단위 | 0.618 | 0.629 | 0.694 | 0.073 |
| RAG 세션 단위 | 0.845 | 0.845 | 0.859 | 0.549 |
자료: STORIUM 정리
데이터는 통제된 생성 파이프라인으로 만든 과업 중심 대화이며 실제 사용자 대화의 모호함과 개인정보 위험을 모두 대변하지 않는다. 모델 버전과 메모리 구현에 따라 결과도 달라질 수 있다. 그래도 기억의 최종 산출물과 내부 연산을 분리해, 검색 단위 선택과 오래된 값·정보 누출·연산 순서 오류를 각각 진단할 수 있는 평가 틀을 제안했다.
저작권자 © STORIUM 무단전재 및 재배포 금지














