이미지 이해와 생성을 따로 처리하지 않고 같은 단계에서 함께 갱신하는 방법이 나왔다. 이 arXiv 프리프린트는 마스크 확산 모델의 한계를 겨냥해, 한 모달리티의 전이율이 다른 모달리티의 신뢰도에 따라 바뀌는 Self-Correcting Coupled Markov Jump Processes(SC-CMJP)를 제안한다. 핵심은 cross-modal attention으로 가중된 신뢰도와, 근거가 바뀌면 이미 확정한 결정을 되돌리는 remasking jump다.
구현체인 CO2Jump는 훈련 없이 single-pass로 동작하는 공동 멀티모달 샘플러다. 설명에 따르면 텍스트와 이미지를 번갈아 읽고 쓰는 방식이 아니라, 같은 단계 안에서 서로의 최신 판단을 반영해 한 번에 답을 만든다. 기존 병렬 샘플러가 직전 단계의 공동 상태만 공유하는 데 그쳤다는 점과, 표준 masked diffusion이 한 번 공개한 토큰을 다시 마스킹하지 못한다는 점을 동시에 겨냥했다.

평가를 위해 연구진은 JEdit-1M, JMaze-200K, JNono-200K라는 세 대규모 공동 생성 코퍼스를 만들고, 대응하는 in-distribution과 out-of-distribution 벤치마크를 붙였다. 헤드라인 지표는 joint accuracy로, 텍스트 정답이 관대한 Gemini 추출기로 알고리즘적 정답과 일치하고 생성 이미지가 Gemini 3 Flash의 비교에서 정답 이미지와 나란히 맞아야만 정답으로 센다. 비교는 Lumina-DiMOO를 시작점으로 미세조정한 뒤 추론기만 바꿔 공정하게 진행했다.
표 1과 그림 5의 수치에 따르면 CO2Jump는 image understanding, image editing, visual reasoning에서 가장 좋은 공동 성능을 보였다. 예를 들어 Text Generation과 Image Generation을 함께 본 표에서 CO2Jump는 GPT-2L PPL 8.5649, entropy 1.93, ImgEditBench 0.392, source 0.346, target 0.369을 기록했다. 같은 표의 MDM은 GPT-2L PPL 8.5780, entropy 1.78, ImgEditBench 0.386, source 0.322, target 0.354였고, MMaDA-Parallel은 8.8363, 1.44, 0.366, 0.304, 0.335였다. 또 8에서 512 NFE로 스윕했을 때 CO2Jump는 ImgEditBench가 1.72에서 1.93으로, overall mAP는 0.074에서 0.369로 단조 증가했다.
논리 퍼즐에서도 결과는 비슷하다. JMaze-Test500에서 CO2Jump는 in-distribution 0.469, OOD 0.320, total 0.432였고, JNono-Test500에서는 in-distribution 0.167, OOD 0.175, total 0.168이었다. 같은 표에서 MDM은 각각 0.461/0.312/0.424와 0.110/0.050/0.100, ReMDM은 0.229/0.032/0.180과 0.002/0.000/0.002, MMaDA-Parallel은 0.419/0.304/0.390과 0.143/0.113/0.138로 제시됐다. 연구진은 NFE가 늘수록 성능이 좋아지는 단조 추세를 근거로, 교차모달 결합의 이득이 trajectory 전체에 누적된다고 해석했다.
| 과제/비교 | 주요 수치 | 출처 |
|---|---|---|
| CO2Jump (Text Generation / Image Generation / Image Understanding) | GPT-2L PPL 8.5649; entropy 1.93; ImgEditBench 0.392; source 0.346; target 0.369 | 표 1, p.12 |
| MDM (Text Generation / Image Generation / Image Understanding) | GPT-2L PPL 8.5780; entropy 1.78; ImgEditBench 0.386; source 0.322; target 0.354 | 표 1, p.12 |
| CO2Jump vs. MDM / MMaDA-Parallel | 8 NFE→512 NFE에서 ImgEditBench 1.72→1.93, overall mAP 0.074→0.369 | 그림 5, p.12 |
| JMaze-Test500 / JNono-Test500 | JMaze: 0.469/0.320/0.432; JNono: 0.167/0.175/0.168 | 표 2, p.13 |
자료: STORIUM 정리
한편 ablation에서는 Self-Correction 제거가 이해 성능에 가장 큰 손실을 줬고 overall mAP가 3.2 낮아졌으며, 편집 성능도 0.01 하락했다. 설명은 remasking이 없으면 늦게 드러난 cross-modal contradiction을 되돌릴 수 없기 때문이라고 적는다. 즉 이 방법의 차별점은 단순한 병렬화가 아니라, 서로의 최신 판단을 보며 잘못된 결정을 철회하는 동적 갱신 절차에 있다.
저작권자 © STORIUM 무단전재 및 재배포 금지














