로컬에 배포되는 고정 소형 코드 대형언어모델에서 실패한 프로그램을 다시 시도할 때 무엇이 성능을 바꾸는지 따진 arXiv:2607.12962v1 프리프린트다. Mehmet İşcan은 실패한 프로그램을 가설, 실행 반례를 반증으로 보고, LLM이 만든 코드의 오류 증거를 같은 모델이 운영적으로 쓰는지 측정하는 방법으로 PoPE(Popperian Placebo-controlled Evaluation)를 제안한다. 평가 대상은 0.5~1.5B frozen small code models이며, 프롬프트 채널과 가중치 채널을 나눠 사전등록 규칙으로 비교했다.
핵심은 오류 내용을 준 조건과, predeclared scaffold는 유지하되 과제 관련 내용을 지우거나 과제-오류 배정을 뒤섞은 채널별 위약을 나란히 두는 데 있다. 두 채널 모두 arm–unit pair당 생성 예산은 4회(R=4)로 맞췄다. 프롬프트 채널에서는 공개 단계 선별에서 content-ablated form placebo가 12개 유닛, live error-pattern arm이 10개 유닛에서 unlock을 기록했고, 결과는 mechanism-null로 적혔다. 숨은 단계 확인은 설계상 미뤄졌다.

가중치 채널에서는 error-content adapter와 intervention-free baseline이 8대 8로 비겼고 p=1.0이었다. SHA-deranged placebo adapter는 10개 공개 단계 unlock으로 수치상 앞섰지만, 내용에 의한 우위는 확인되지 않았다고 적는다. 이 비교 역시 공개 단계(screening)만 포함하며 hidden-tier confirmation은 열리지 않았다. 논문은 이 결과를 동등성이나 비열등성의 증거로 보지 않으며, 그런 검정도 따로 하지 않았다고 명시한다.
수치가 더 나아 보인 대목도 있다. program cycle logs의 두 점 비교에서 0.5B에서 1.5B로 갈 때 any-portfolio public-tier unlock rate가 27.5%에서 60%로 올랐다. 그러나 이 관찰은 프로그램 안의 서술적 방향성 결과로 남았고, controller superiority의 증거로 해석되지 않았다. self-audit chain에서는 superseded record의 +6.0 percentage-point delta와 같은 기록의 +0.001 adaptive–random control이 보존됐지만, valid draw-budget-matched record에서는 효과가 null로 기록됐다.
| 비교 축 | 수치 | 검증 범위 | 원문 위치 |
|---|---|---|---|
| 프롬프트 채널: content-ablated form placebo vs live error-pattern arm | 12개 unlock vs 10개 unlock, 40-unit resistant band | public-tier screening only; hidden-tier confirmation deferred | Abstract; Results; Figure 6 |
| 가중치 채널: error-content adapter vs intervention-free baseline | 8대8 tie, p=1.0 | public-tier screening only; hidden-tier confirmation deferred | Abstract; Table 1; Appendix E |
| SHA-deranged placebo adapter | 10개 unlock | public-tier screening only | Abstract; Figure 6; Table 1 |
| 생성 예산 | arm–unit pair당 4회 생성 | E-UNLOCK 비교 전반; 입력 길이·연산량은 비대칭 | Methods §2.1.1; Figure 1 caption |
자료: STORIUM 정리
저자 Mehmet İşcan은 PythaLab, Yıldız Technical University, Istanbul, Turkey 소속으로 표기된다. 논문은 동료검토 전 arXiv 프리프린트이며, 본문은 작동하는 JEPA-RL controller를 주장하지 않는다. 요지는 오류 내용을 그대로 전달하는 것보다 재시도의 형식, 채널, 그리고 생성기 규모가 관측 결과를 좌우할 수 있는지를 위약 대조와 사전등록으로 다시 재는 데 있다.
저작권자 © STORIUM 무단전재 및 재배포 금지














