언어모델이 만든 코드는 개별 파일에서 컴파일되고 테스트를 통과해도 저장소 전체 구조와 맞지 않을 수 있다는 연구가 나왔다. 연구진은 선언되지 않은 설정 키, 존재하지 않는 패키지, 누락된 인증 미들웨어처럼 국소적으로는 그럴듯하지만 전체 프로젝트 계약을 깨는 현상을 ‘패치워크 문제’로 정의했다.
논문은 저장소를 임포트·호출·의존성·설정·스키마·자원·제어 흐름·라우팅 등 8개 그래프로 표현한다. 이어 심볼 해석 실패, 가짜 내부 API, 빌드·설정 불일치, 파일 간 계약 위반, 보안 구조 누락 등을 포함한 8개 실패 범주를 일관성 불변식으로 정식화했다.

검증 체계는 mypy, tsc, pylint, ESLint처럼 이미 성숙한 정적 분석 도구가 잘 처리하는 항목은 기존 도구에 맡기고, 파일과 그래프를 가로지르는 제약은 전용 탐지기로 검사한다. 단순 패턴 점수 대신 어떤 파일과 줄에서 어떤 불변식이 깨졌는지 추적 가능한 증거를 내도록 설계했다.
실험은 최전선 모델 2종, 프롬프트 전략 4종에서 생성한 코드 336건을 대상으로 했다. 연구진은 구조 실패의 대다수가 타입 검사, 테스트, 정적 애플리케이션 보안 테스트를 모두 피했다고 보고했다. 추가로 AI 생성 코드가 포함된 실제 공개 저장소 43개를 분석해 통제 실험 밖에서도 같은 유형의 문제가 나타나는지 확인했다.
다만 336개 생성물과 43개 저장소는 모든 언어, 프레임워크, 에이전트형 개발 환경을 대표하지 않는다. 정적 그래프 불변식은 구조적 모순을 찾는 데 유용하지만 실행 시점의 데이터 오류나 성능 문제까지 포괄하지 않는다. 모델별 실패 양상이 달랐다는 결과도 하나의 공통 규칙만으로 모든 생성 코드를 검증하기 어렵다는 뜻이다.
| 평가 범위 | 규모 | 조건 |
|---|---|---|
| 통제 생성물 | 336개 | 최전선 모델 2종·프롬프트 4종 |
| 실제 공개 저장소 | 43개 | AI 생성 코드 포함 |
| 구조 실패 분류 | 8개 범주 | 8개 저장소 그래프 기반 |
이 논문은 2026년 7월 9일 제출된 동료 검토 전 arXiv v1 프리프린트다. 실제 CI에 적용했을 때 오탐률, 탐지 비용, 수정 성공률이 얼마나 되는지는 추가 평가가 필요하며, 현재 결과는 저장소 단위 구조 검증이 기존 테스트를 보완할 수 있다는 근거로 해석해야 한다.
저작권자 © STORIUM 무단전재 및 재배포 금지














