벨만 방정식은 왜 재귀 형태를 띠는가. 이론 연구진은 최적 가치함수의 재귀성이 세 조건의 결합에서 나온다고 설명한다. 동역학이 충분통계량을 통해 분해되고, 반환이 단계적으로 재귀 분해되며, 불확실성 집계가 두 구성과 양립할 때 벨만 재귀가 성립한다는 주장이다. 이 연구는 동료검토 전 arXiv 프리프린트다.
논문은 정책이 이력에서 행동 분포를 만들고, 정책에 따른 경로 분포와 경로별 반환, 집계 함수로 최적화 문제를 정의하는 일반 틀에서 출발한다. 조건 D는 동역학이 이력의 충분통계량을 통해 요약되는 경우, 조건 R은 반환이 현재 상태·행동·다음 상태를 이용해 재귀적으로 이어지는 경우를 뜻한다. 조건 A는 집계 함수가 커널 합성과 비확률적 반환항의 결합 규칙에 맞아야 한다는 요구다.

세 조건이 공통 상태에서 동시에 성립하면 일반화된 벨만 재귀가 도출된다. 집계를 기대값으로, 두 결합 연산을 덧셈으로, 상태를 현재 상태와 할인계수로 두면 익숙한 벨만 식으로 환원된다. 논문은 단조 집계 연산에서도 최적 정책을 정의할 수 있도록 최적성 연산자를 일반화한다. 다만 수치 실험이나 벤치마크는 없고 결과는 수식 전개와 정리 증명에 기반한다.
이 틀에서는 확률과 반환, 반환과 집계, 집계와 확률 사이의 세 가지 쌍대성이 함께 나온다. 로그-합-지수 계열 집계의 매개변수를 달리하면 위험민감·소프트·강인 벨만 식을 같은 구성 안에서 해석할 수 있다. 부분관측 환경의 믿음 상태, 위험민감 제어, 강인 제어 등 서로 다른 분야의 도구도 충분통계량과 변형된 반환·확률이라는 공통 언어로 비교한다.
연구의 의미는 벨만 방정식을 특정 분야의 공식이 아니라 동역학·반환·불확실성 집계의 일관성에서 생기는 일반 원리로 재구성한 데 있다. 조건 하나가 깨질 때도 상태를 확장하거나 반환·동역학을 변형해 계산 가능성을 회복할 수 있다고 제안한다. 실제 적용의 계산 효율과 범용성은 후속 검증이 필요하다. 출처: arXiv 논문 페이지
저작권자 © STORIUM 무단전재 및 재배포 금지














