• AI 모델·연구
  • 빅테크·기업
  • 반도체·인프라
  • 산업 적용
  • AI 서비스·툴
  • 정책·윤리
  • 스타트업·투자
  • 문의
STORIUM
  • AI 모델·연구
  • 빅테크·기업
  • 반도체·인프라
  • 산업 적용
  • AI 서비스·툴
  • 정책·윤리
  • 스타트업·투자
  • 문의
No Result
View All Result
  • AI 모델·연구
  • 빅테크·기업
  • 반도체·인프라
  • 산업 적용
  • AI 서비스·툴
  • 정책·윤리
  • 스타트업·투자
  • 문의
No Result
View All Result
STORIUM
No Result
View All Result

토큰 기여도를 보상으로 쓰는 AttriMem, 장기 대화 메모리 학습에서 RL 병목을 줄이다

유지율 리포터 작성: 유지율 리포터
2026년 07월 26일 12시 44분
Reading Time: 3 mins read
A A
Home AI 모델·연구
Share on FacebookShare on Twitter
토큰 기여도를 보상으로 쓰는 AttriMem, 장기 대화 메모리 학습에서 RL 병목을 줄이다 논문의 Figure 1
Figure 1. Figure 1: Overview of AttriMem. AttriMem constructs a structured memory bank from long-term dialogue through extraction, compression, and update, then answers questions via memory retrieval. During RL training, token-level attribution produce local process rewards, which complement the global outcome reward for fine-grained memory learning. 출처: arXiv:2607.21106

LLM 에이전트의 장기 기억을 어떻게 만들고 갱신할지 정하는 문제는 여전히 까다롭다. 2026년 7월 23일 공개된 arXiv 프리프린트에서 제안한 AttriMem은, 메모리 구성 과정에 토큰 수준 기여도를 반영한 과정 보상을 붙여 강화학습을 안정화하는 틀을 다뤘다. 핵심은 무엇을 추출·저장·갱신·압축·삭제할지에 대한 결정을, 최종 정답만 보는 거친 신호가 아니라 중간 기억 내용의 공헌도까지 보며 학습시키는 데 있다.

기존 휴리스틱 방식은 사람이 정한 규칙에 기대는 탓에 다운스트림 목표와 어긋나기 쉽고, 과제별 적응성도 좁다. 반면 RL 기반 방식은 과제 피드백으로 메모리를 배우지만 주로 결과 보상이나 모듈 수준 보상에 머문다. 원문은 이런 신호가 과업 성공 여부는 알려도, 어떤 중간 메모리 내용이 최종 답에 도움이 됐는지는 가르치지 못해 세밀한 신용 할당 병목이 생긴다고 설명한다.

AttriMem은 여기에 토큰 수준 attribution을 이용한 지역 보상을 더한다. 전체 구조는 장기 대화 QA를 위한 메모리 구성 단계와 질의응답 단계를 분리해 두고, 핵심 메모리·삽화 메모리·의미 메모리·절차 메모리의 네 유형을 사용한다. 학습식은 KL 제약이 걸린 보상 최대화로 제시되며, outcome reward에 process rewards를 결합하는 형태다. Table 1에서는 기존 휴리스틱, task-performance RL, outcome-redistribute rewards, QA-derived action rewards와의 차이를 비교하면서 AttriMem이 task feedback, outcome beyond, operation-level, token-level guidance를 모두 갖춘 유일한 범주라고 정리한다.

검증은 장기 대화 기반 질문응답에서 이뤄졌다. 학습 데이터는 LongMemEval이고, 평가는 LoCoMo와 PerLTQA에서 진행됐다. Table 2의 결과에 따르면 Qwen3-4B 기반 설정에서 AttriMem은 기본형 67.88, 55.75, 78.32에서 SFT 후 78.40, 80.25, 81.52로, 그리고 SFT+RLT ok 후 82.48, 83.25, 84.49로 올라갔다. 같은 표에서 MemBuilder(Qwen3-4B)는 SFT+RL 후 80.01, 81.75, 83.74를 기록했다. 또 다른 비교에서는 LongMemEval만으로 학습했어도 LoCoMo 82.48, PerLTQA 84.49를 달성해 강한 비-RL 기준선을 넘겼다고 적었다.

답변 모델 일반화도 따로 확인했다. Table 3에서 Claude 4.5 Sonnet을 GPT-4.1로 바꾸면 LoCoMo, LongMemEval, PerLTQA 성능이 각각 2.07, 1.25, 2.31포인트만 하락했다고 적시해, 메모리 효용이 특정 답변 모델에 묶이지 않음을 보였다. Table 4의 보상 granularity 절제 실험에서는 Ours가 67.88, 55.75, 78.32였고, RLOut는 70.19, 58.25, 79.61, RLAct는 71.10, 59.75, 79.98, RLT ok는 72.05, 61.25, 80.58이었다. SFT를 붙이면 각각 79.46, 81.50, 83.69; 81.32, 82.00, 84.05; 82.48, 83.25, 84.49로 올라갔다. 원문은 이처럼 더 세밀한 보상이 RL 최적화를 안정시키는 경향을 보였다고 해석한다.

구분 원문 수치/특징 source_locator
메모리 학습 패러다임 비교 AttriMem: task feedback, feedback beyond outcomes, operation-level guidance, token-level guidance 모두 ✓ p.2 | Table 1
주요 성능(Qwen3-4B, SFT+RLT ok) LoCoMo 82.48 / LongMemEval 83.25 / PerLTQA 84.49 p.7 | Table 2; p.9 | Table 4
답변 모델 변경 시 하락 Claude 4.5 Sonnet → GPT-4.1: LoCoMo -2.07, LongMemEval -1.25, PerLTQA -2.31 p.8 | source_excerpt, Table 3
효율-성능 절충 Figure 4는 평균 추론 토큰 소비량과 답변 정확도의 관계를 제시 p.10 | Figure 4

자료: STORIUM 정리

보조 분석으로는 중간 단계의 추론 타당성과 효율-성능 절충도 다뤘다. Table 5는 OursAct의 중간 단계 rationality 평가를 58.97, 61.76, 61.80으로 제시했다. Figure 4에서는 LoCoMo 기준 평균 추론 토큰 소비량과 답변 정확도의 관계를 그렸고, ContextCite 관련 설명에서는 32개 ablated variants를 병렬 처리할 수 있어 추가 지연이 대략 배치 한 번의 forward pass 수준이라고 적었다. 전체적으로 이 연구는 결과 보상만으로는 보이지 않던 메모리 내용의 공헌을 토큰 단위로 끌어와, 장기 대화 메모리 학습의 미세한 보상 할당 문제를 푸는 방향을 제시한다.

저작권자 © STORIUM 무단전재 및 재배포 금지

Tags: LLM 에이전트강화학습메모리 학습장기 대화 QA토큰 수준 attribution
유지율 리포터

유지율 리포터

안녕하세요, 유지율 리포터입니다. arXiv와 학회에서 쏟아지는 AI 연구를 살펴, 논문 속 성과를 과장 없이 우리말로 풀어 드립니다. 사실관계는 발행 전 편집인이 함께 확인합니다.

관련 기사

안전 정당화가 평균 수익과 grass rate에 미치는 영향
AI 모델·연구

학습된 세계모형에 인간 선호·안전 이유를 결합한 DROPJ, 실제 사용자 실험에서 배포 성능과 계산비용 평가

2026년 07월 26일 21시 30분
TU 도르트문트 공식 캠퍼스 학생 사진
AI 모델·연구

상태가 아니라 차이를 학습하는 강화학습 비평가: RV와 PPO의 Atari 49개 게임 검증

2026년 07월 26일 17시 50분
University of Fribourg 공식 로고
AI 모델·연구

스위스 법률 번역에서 소형 모델과 강화학습, 추론형 거대모델을 40,000쌍 데이터로 비교한 arXiv 프리프린트

2026년 07월 24일 01시 32분
University of Sussex 공식 로고
AI 모델·연구

벨만 재귀의 세 조건과 세 가지 쌍대성

2026년 07월 22일 03시 08분
Next Post
CEA-Leti의 저전력 임베디드 AI 회로와 테스트 보드

RISC-V 단일 코어에서 float16 온디바이스 학습을 뒷받침한 AIfES 확장 프리프린트

답글 남기기 응답 취소

이메일 주소는 공개되지 않습니다. 필수 필드는 *로 표시됩니다

  • 인기 급상승
  • 최신
Close-up of a GeForce RTX graphics card on a desk, showcasing its design and technology.

엔비디아 RTX 스파크 가격, 최소 2000달러 전망…윈도 노트북 ‘M1 모먼트’ 걸림돌

2026년 06월 02일 11시 19분
A 3D rendering of a neural network with abstract neuron connections in soft colors.

퍼플렉시티, 로컬·클라우드 AI를 자동 판단하는 하이브리드 추론 시스템 발표

2026년 06월 04일 08시 53분
Contemporary building with a glass facade and geometric patterns, low angle view.

앤트로픽·네이버 개발자 밋업 개최…서울 오피스 개소 앞두고 본사 임원 참석

2026년 06월 06일 21시 12분
책상에서 법률 문서에 서명하는 모습

클로드 ‘드리밍’ 기능 공개…앤트로픽, 법률·의료 AI 성능 대폭 향상

2026년 05월 30일 21시 11분
Close-up of a wooden gavel on a judge's desk, symbolizing justice.

AI 생성 성인 콘텐츠 유료 판매 운영자들, 법원서 잇달아 징역형

2026년 06월 05일 22시 40분
엔비디아 미국 본사 건물

엔비디아·37개 창립 파트너, Open Secure AI Alliance 출범

2026년 07월 28일 19시 45분
미국 연방 로비가 이뤄지는 워싱턴 의사당 공식 사진

미 주요 기술·AI 기업·단체 11곳, 상반기 로비 4,180만달러

2026년 07월 28일 18시 46분
다리오 아모데이 앤트로픽 CEO의 2023년 TechCrunch 행사 자료사진

Claude 공개 공유 대화 일부 검색 노출…비공개 자동 유출과는 달라

2026년 07월 28일 17시 53분
일리야 수츠케버가 참석한 2014년 스탠퍼드 대담 자료사진

SSI, 엔비디아 Vera Rubin 도입…연산 자원 10배 확대

2026년 07월 28일 16시 20분
중국 항저우 앤트그룹 A Space 건물

앤트그룹 Ling-3.0-Flash 공개…1,240억개 중 51억개 활성

2026년 07월 28일 15시 07분

검색

No Result
View All Result

인기 태그

AI규제 AI반도체 AI보안 AI안전 AI에이전트 AI연구 AI인프라 AI정책 Anthropic arXiv AWS ChatGPT Claude Gemini HBM IPO LLM MCP NVIDIA OpenAI RAG SK하이닉스 강화학습 구글 데이터센터 마이크로소프트 멀티모달 멀티에이전트 메타 반도체 벤치마크 사이버보안 삼성전자 생성AI 생성형AI 스타트업 앤트로픽 에이전트 에이전틱AI 엔비디아 오픈AI 오픈소스 의료AI 자율주행 피지컬AI

카테고리

  • AI 모델·연구 (1,482)
  • AI 서비스·툴 (826)
  • 반도체·인프라 (537)
  • 빅테크·기업 (566)
  • 산업 적용 (415)
  • 스타트업·투자 (251)
  • 정책·윤리 (455)

STORIUM은 트렌드와 인사이트를 전하는 종합 뉴스 매체입니다. 정확성, 균형, 맥락의 편집 원칙으로 신뢰받는 뉴스를 전합니다.

카테고리

  • AI 모델·연구
  • AI 서비스·툴
  • 반도체·인프라
  • 빅테크·기업
  • 산업 적용
  • 스타트업·투자
  • 정책·윤리

태그

AI규제 AI반도체 AI보안 AI안전 AI에이전트 AI연구 AI인프라 AI정책 Anthropic arXiv AWS ChatGPT Claude Gemini HBM IPO LLM MCP NVIDIA OpenAI RAG SK하이닉스 강화학습 구글 데이터센터 마이크로소프트 멀티모달 멀티에이전트 메타 반도체 벤치마크 사이버보안 삼성전자 생성AI 생성형AI 스타트업 앤트로픽 에이전트 에이전틱AI 엔비디아 오픈AI 오픈소스 의료AI 자율주행 피지컬AI

최근 뉴스

엔비디아 미국 본사 건물

엔비디아·37개 창립 파트너, Open Secure AI Alliance 출범

2026년 07월 28일 19시 45분
미국 연방 로비가 이뤄지는 워싱턴 의사당 공식 사진

미 주요 기술·AI 기업·단체 11곳, 상반기 로비 4,180만달러

2026년 07월 28일 18시 46분
  • 소개
  • 문의
  • 광고문의
  • 개인정보처리방침
  • 이용약관
  • 청소년보호정책
  • 정정·반론 보도 안내
  • 편집·윤리강령

주소: 경기 고양시 덕양구 꽃마을로 66, 한일미디어타워 15층
상호: 스토리움 |  사업자등록번호: 579-27-02025 |  대표자: 이국환
발행·편집인: 이국환 |  청소년보호책임자: 이국환 |  발행일자: 2025.01.01
스토리움의 모든 콘텐츠는 저작권법의 보호를 받는 바, 무단 전재·복사·배포 등은 법적 제재를 받을 수 있습니다.
© 2026 STORIUM. All Rights Reserved.

No Result
View All Result
  • AI 모델·연구
  • 빅테크·기업
  • 반도체·인프라
  • 산업 적용
  • AI 서비스·툴
  • 정책·윤리
  • 스타트업·투자
  • 문의

주소: 경기 고양시 덕양구 꽃마을로 66, 한일미디어타워 15층
상호: 스토리움 |  사업자등록번호: 579-27-02025 |  대표자: 이국환
발행·편집인: 이국환 |  청소년보호책임자: 이국환 |  발행일자: 2025.01.01
스토리움의 모든 콘텐츠는 저작권법의 보호를 받는 바, 무단 전재·복사·배포 등은 법적 제재를 받을 수 있습니다.
© 2026 STORIUM. All Rights Reserved.