이산 확산 전문가를 합칠 때 샘플 전체에 하나의 혼합 가중치를 주면, 영역마다 다른 규칙을 아는 전문가의 강점을 잃을 수 있다. FactorDiff는 ARC-AGI 격자를 픽셀 단위 요인으로 나누고 각 위치에서 확신이 가장 높은 전문가의 예측을 선택한다.
실험에는 2차원 구조를 보존하는 마스크 확산 모델과 변환기 기반 Trans-IR, 합성곱 기반 Conv-IR 전문가가 쓰였다. 평가는 RE-ARC가 만든 미보유 예제로 구성된 ARC-AGI-1의 120개 과제에서 진행됐으며, 픽셀 정확도와 격자 전체가 맞은 정확도를 함께 봤다.
전문가가 모두 강한 Full+Full 조건에서 픽셀 라우팅은 정확히 맞힌 격자 비율 95.2%로 가장 좋은 샘플 단위 방식 FKC와 같았다. Occ+Full에서는 94.0%로 SuperDiff의 93.2%를 넘었고, 약한 전문 모델 둘을 합친 Col+Occ에서는 90.5%로 최고 샘플 단위 방식 FKC의 78.4%보다 12%포인트 이상 높았다.

| 라우팅 방식 | Full + Full 정확도 | Occ + Full 정확도 | Col + Occ 정확도 |
|---|---|---|---|
| 샘플 단위 PoE 평균 | 95.1% | 91.0% | 73.2% |
| 샘플 단위 SuperDiff | 95.1% | 93.2% | 77.7% |
| 샘플 단위 FKC | 95.2% | 90.2% | 78.4% |
| 샘플 단위 RNE | 94.1% | 85.2% | 76.5% |
| 픽셀 단위 FactorDiff | 95.2% | 94.0% | 90.5% |
주요 조합 결과를 보면 전문가의 역할이 보완적일수록 위치별 선택의 이득이 커진다. 전역 혼합은 한 격자 안에서 “경계는 점유 전문가, 색은 색상 전문가”처럼 역할을 나눌 수 없기 때문이다.
별도 겹침 절제 실험은 120개 과제마다 200개, 총 2만4,000개 격자를 조정 없이 평가했다. 이 조건에서 FactorDiff는 Trans-IR 대비 99개, Conv-IR 대비 118개 과제에서 같거나 높았고, 과제별 더 나은 단일 전문가와 비교해도 97개에서 같거나 앞섰다.
성과는 공간 분해가 분명한 RE-ARC의 IID 평가에 묶여 있다. 확신도가 실제 전문성과 어긋나면 잘못된 영역을 붙일 수 있고 픽셀 선택만으로 전역 제약이 보장되지는 않는다. 자연어·분자처럼 요인 정의가 어려운 데이터에 대한 검증과 최적성 증명도 남아 있다. arXiv:2607.11758은 동료검토 전 원고다.
저작권자 © STORIUM 무단전재 및 재배포 금지











