CoDiMAD는 전역 상태를 보는 MAPPO oracle의 행동을 통신 없이 지역 관측만 받는 학생에게 옮긴다. oracle을 먼저 학습해 고정하고, 배치 시 학생이 볼 지역 관측과 oracle 행동의 쌍을 오프라인으로 모은 뒤 조건부 denoising diffusion probabilistic model을 훈련한다. 동일한 지역 관측이 여러 전역 배치와 대응해 행동 분포가 다봉형이 될 때 결정적 회귀가 평균 행동으로 무너지는 문제를 피하려는 설계다.
200×200 연속 공간, 에이전트 3대, 에피소드 200스텝으로 Cooperative Coverage·Pursuit-Evasion·Box Pushing을 구성했다. 평가는 무작위 시드 3개에서 시드당 200개 에피소드로 진행했고 MAPPO-Oracle, MAPPO-Local, BC-RNN, CoDiMAD w/o RNN과 비교했다. Oracle은 배포 가능한 기준선이 아니라 전역 정보를 쓰는 상한선이다.
CoDiMAD는 Coverage 95.7±0.7%, Pursuit-Evasion 포획 90.6±1.8%, Box Pushing 성공 72.2±0.5%를 기록했다. MAPPO-Local은 각각 83.7±1.0%, 14.2±1.0%, 18.0±4.3%였고 BC-RNN은 80.9±0.9%, 90.3±1.7%, 6.5±2.5%였다. 충돌은 Coverage에서 CoDiMAD 0.55±0.08회와 BC-RNN 10.37±1.15회, Pursuit-Evasion에서 0.80±0.06회와 3.41±0.48회로 비교됐다.

| 과제 | MAPPO-Local | BC-RNN | CoDiMAD |
|---|---|---|---|
| Coverage | 83.7±1.0% | 80.9±0.9% | 95.7±0.7% |
| Pursuit-Evasion | 14.2±1.0% | 90.3±1.7% | 90.6±1.8% |
| Box Pushing | 18.0±4.3% | 6.5±2.5% | 72.2±0.5% |
자료: STORIUM 정리
GRU를 뺀 변형과의 차이는 시간 문맥의 기여로 해석됐다. 그러나 오프라인 증류는 oracle 궤적 분포 밖 상태의 복구에 취약할 수 있고, 에이전트 3대를 넘는 확장성은 평가하지 않았다. 물리적 해양 로봇 배치는 향후 방향일 뿐 실제 로봇 결과는 없다. Jiyue Tao, Shunheng Xin, Tongsheng Shen, Dexin Zhao, Feitian Zhang 등이 2026년 7월 10일 공개한 arXiv:2607.09587v1 프리프린트다.
저작권자 © STORIUM 무단전재 및 재배포 금지














