다중 에이전트의 긴 추론 궤적을 매번 텍스트로 다시 읽지 않고, 생성 과정에서 만들어진 KV 캐시를 직접 이용해 단계별 보상을 계산하는 KV-PRM이 제안됐다. 기존 과정 보상 모델은 전체 궤적을 재인코딩해 문맥 길이가 늘수록 채점 비용이 제곱 수준으로 커지는 문제가 있다.
KV-PRM은 이미 존재하는 KV 캐시에 단일 ‘검증 토큰’을 적용해 현재 과정의 품질을 판정한다. 연구진은 이 방식으로 채점 복잡도를 문맥 길이 L의 제곱에서 L에 비례하는 수준으로 줄였다고 설명했다. KV 캐시가 텍스트보다 더 많은 정보 용량을 가진다는 이론적 주장도 함께 제시했다.

MATH, GSM8K, AIME 2024·2025에서 빔 탐색, 몬테카를로 트리 탐색, 가중 투표를 평가했다. KV-PRM은 전체 평균과 다수 설정에서 텍스트 PRM과 비슷하거나 높았지만 일부 순차 조합에서는 낮았다. 최대 약 5,000배는 긴 궤적의 채점 FLOPs 감소이며, 지연 37배와 시퀀스당 메모리 34.2배 감소는 NVIDIA GH200·Qwen3-8B·길이 4,096 조건의 최대값이다.
개선 폭은 특정 모델·하드웨어·구현과 수학 추론 벤치마크에 의존한다. 논문이 제시한 이론 경계는 선형 표현 가설에 의존하며, 생성기와 검증기가 같은 아키텍처를 공유해야 한다. KV Steering도 개념증명 단계다. 폐쇄형 API나 서로 다른 모델 사이의 재사용과 캐시 저장 비용은 별도 운영 검증이 필요하다. 계산 절감이 보상 모델의 오류나 편향을 제거하는 것은 아니다.
| 지표 | 최대 보고값 | 조건 |
|---|---|---|
| 채점 FLOPs 감소 | 약 5,000배 | 약 5,000-token 궤적, Text-PRM 대비 |
| 지연 감소 | 37배 | GH200·Qwen3-8B·L=4,096 |
| 시퀀스당 메모리 감소 | 34.2배 | GH200·Qwen3-8B·L=4,096 |
KV-PRM은 2026년 7월 arXiv에 공개된 프리프린트로 동료검토 전이다. 최대 수치는 모든 조건의 평균이 아니므로, 긴 실제 에이전트 작업과 다양한 가속기에서의 독립 재현이 필요하다. 실제 운영 비용과 품질의 균형은 독립 평가가 필요하다. 보상 품질과 실제 정답률 사이의 관계도 별도로 검증해야 한다.
저작권자 © STORIUM 무단전재 및 재배포 금지














