코딩 에이전트가 실행 가능한 환경에서 작동할수록, 한 번의 실패는 단순 오답이 아니라 다음 행동을 고를 수 있는 피드백이 된다. 이 arXiv 프리프린트는 그런 실패 이후의 선택을 복구 라우팅으로 정식화하고, 실행 롤아웃으로 학습한 지도형 라우터 위에 Conformal Risk Control(CRC) 층을 얹어 예산이 달라져도 재학습 없이 배치 시점의 비용 페널티를 조정하는 방식을 제안한다.
핵심 질문은 “더 싼 계산을 한 번 더 쓸지, 더 강한 모델로 넘길지”다. 기존 비용 인식 시스템이 대체로 저가 모델→고가 모델의 계단식 에스컬레이션으로 다뤘다면, 이 연구는 실행 피드백이 다시 저가 복구를 시도할 가치도 만든다고 본다. 따라서 가능한 행동은 반영(reflect), 재계획(replan), 에스컬레이션(escalate)처럼 이질적이며, 같은 실패 뒤에도 입력별로 최적 경로가 달라질 수 있다.

방법은 두 단계다. 먼저 훈련 롤아웃에서 각 입력에 대해 비용이 가장 낮은 성공 행동을 정답으로 두고 라우터를 교차엔트로피로 학습한다. 다음으로 calibration split에서 미리 계산한 임계값 그리드를 사용해, 선택된 페널티가 기대 비용 한도를 만족하는지 확인하며 배치 시점 예산에 맞는 operating point를 고른다. 원문은 이 재조정이 새로운 예산 B가 바뀌어도 저장된 표를 다시 훑는 방식이라, 라우터 θ를 다시 학습할 필요가 없다고 적는다.
검증은 다섯 개 코딩 벤치마크에서 떼어낸 보류 실패 사례를 대상으로 진행됐다. 전체 데이터 구성은 학습 4,656개, 보정 360개, 테스트 360개로 나뉘었다. Figure 2에서는 실패 사례의 성공 행동 구조가 세 갈래로 나뉘어, 28%는 저가 복구만으로, 45%는 에스컬레이션만으로, 27%는 둘 다로 해결 가능하다고 보고한다. 벤치마크별로도 BigCodeBench는 저가 복구 중심, TACO(med-hard)는 에스컬레이션 중심으로 달랐다.
성능 비교에서는 고정 행동, prompt-only 라우터, 이진 cascade baseline보다 보정된 frontier가 더 나은 경계를 보였다. Table 1의 GPT-5.4-nano holdout test split(n=360)에서 항상 에스컬레이션은 solve rate 68.6%, mean cost 7.22 m$였고, Ours(Qwen3.5-4B FT)는 81.7%, 5.51 m$였다. 또 본문은 약 2.56 m$ 부근의 세 행동 라우터가 solve rate 0.717을 기록해, 같은 비용대의 binary cascade 0.636과 always-escalate 0.686을 넘기면서 always-escalate 비용의 35%만 사용했다고 적는다.
| 항목 | 값 | 근거 위치 |
|---|---|---|
| 학습 split | 4,656 examples | p.8 | source_excerpt |
| 보정 split | 360 problems | p.8 | source_excerpt |
| 테스트 split | 360 problems | p.8 | source_excerpt |
| Always-escalate | solve rate 68.6%, mean cost 7.22 m$ | p.8 | source_excerpt / Table 1 |
| Ours (Qwen3.5-4B FT) | solve rate 81.7%, mean cost 5.51 m$ | p.8 | source_excerpt / Table 1 |
자료: STORIUM 정리
해당 결과는 GPT-5.4-nano/GPT-5.4 조합의 main setting과 holdout test split에서 확인된 프리프린트 결과다. 원문은 코드 저장소 공개 주소도 제공한다. 원문은 비단조적 cost-quality 곡선이 나올 수 있어 운영점은 경험적으로 선택해야 한다고 설명하고, 향후 다단계 에이전트 궤적과 더 풍부한 배치 제약으로 확장할 필요가 있다고 덧붙인다.
저작권자 © STORIUM 무단전재 및 재배포 금지














