ARC-AGI-2의 격자 변환 문제를 네 역할로 나눠 푸는 ARCANA가 제안됐다. 지각, 프로그램 후보 생성, 기호 실행, 실패 반영을 한 에이전트에 몰아넣지 않고 공유 블랙보드에서 순환시키는 구조다. 논문은 ARC Prize 2026의 4개 L4 GPU, 12시간, 오프라인 제약을 평가 조건으로 적었다.
지각 에이전트는 입력 격자를 객체 중심 장면 그래프로 바꾸고, 가설 생성 에이전트는 47개 형식화 연산으로 된 프로그램 후보를 만든다. 기호 실행기는 시범 입출력에 후보를 적용해 정확 일치와 셀 정확도, SSIM을 함께 확인한다. 반성 에이전트는 실패한 연산 단계의 책임을 추정해 다음 후보 분포를 조정한다.

논문 Table I에서 ARCANA는 semi-private 120개 과제 정확도 32.5%, 셀 정확도 67.4%, 과제당 비용 0.16달러를 보고했다. 같은 표의 EPS-Grok은 26.0%, NVARC는 24.0%였다. 공개 120개 과제의 구성요소 제거 실험에서는 전체 모델 정확도가 35.8%였고, 반성 에이전트를 빼면 25.0%로 낮아졌다.
| 방법 | 평가 세트 | 정확도 | 셀 정확도 | 과제당 비용 |
|---|---|---|---|---|
| ARCANA | semi-private 120개 | 32.5% | 67.4% | $0.16 |
| EPS-Grok | semi-private 120개 | 26.0% | 58.2% | $0.19 |
| NVARC | semi-private 120개 | 24.0% | 56.8% | $0.20 |
이 결과는 논문 저자들이 구성해 보고한 단일 프리프린트 실험이다. semi-private 세트의 과제별 출력과 평가 코드는 본문만으로 독립 재현할 수 없고, 인간 수준과의 격차를 좁혔다는 서술도 공식 ARC Prize 순위 검증과 구분해야 한다. 과제당 비용 역시 논문에 적힌 하드웨어와 시간 제한에 묶인 값이다.
ARCANA는 컬럼비아대, UCLA, 노스이스턴대 연구자와 독립 연구자가 참여한 2026년 7월 arXiv 프리프린트다. 동료검토와 공식 대회 검증은 아직 확인되지 않았다. 다른 ARC-AGI-2 분할, 동일 예산의 강한 기준선, 반복 실행 분산을 공개해야 구조의 일반화와 비용 효율을 판단할 수 있다.
저작권자 © STORIUM 무단전재 및 재배포 금지














