에이전트가 계획을 세울 때 매 단계 대규모언어모델을 다시 호출하지 않고, 실행 경험을 축적한 세계 모델과 트리 탐색을 결합하는 GATS가 제안됐다. 논문은 GATS를 UCB1 기반 Graph-Augmented Tree Search로 정의한다. 평가는 실제 서비스 로그가 아니라 연구진이 만든 합성 다단계 과제 100개와 12종 스트레스 과제 120개에서 진행됐다.
세계 모델은 세 층으로 작동한다. L1은 명세가 알려진 행동의 결과를 기호적으로 계산하고, L2는 실행 로그에서 얻은 전이 통계를 사용하며, L3는 낯선 행동을 LLM으로 예측한다. 논문의 합성 벤치마크에는 완전한 행동 명세가 제공돼 L1이 계획 단계 전이를 모두 처리했다. 따라서 계획 중 LLM 호출 0회는 일반 환경의 무호출 보장이 아니라 이 실험 조건의 결과다.

Table 1에서 GATS는 합성 과제 100개에서 성공률 100%를 기록했고 LATS는 92%, ReAct는 64%였다. Table 6의 12종 스트레스 테스트 120개에서는 GATS 100%, LATS 88.9%, ReAct 23.9%로 보고됐다. 스트레스 테스트는 코딩 워크플로와 웹 탐색을 본뜬 범주를 포함하지만 실제 웹사이트나 실제 소프트웨어 운영을 평가한 것은 아니다.
| 평가 | 과제 수 | GATS | LATS | ReAct | 조건 |
|---|---|---|---|---|---|
| 합성 다단계 계획 | 100 | 100% | 92% | 64% | 분기·막다른 길, 3개 seed |
| 12종 스트레스 테스트 | 120 | 100% | 88.9% | 23.9% | 범주당 10개, 3개 seed |
비교에는 중요한 비대칭이 있다. GATS는 제공된 행동 명세를 L1에서 직접 사용했지만 LATS와 ReAct는 행동 효과를 LLM으로 추론했다. 저자들도 이 설정이 GATS에 유리하며, 불완전한 명세에서는 L3 호출이 늘어 LATS와의 비용 격차가 줄 수 있다고 적었다. 약 50회의 L3 부트스트랩 호출도 일회성 비용으로 별도 계산됐다.
GATS는 2026년 7월 공개된 arXiv 프리프린트로 동료검토 전이다. 결과는 고정된 합성 환경과 저자 구현, 제한된 seed에서 보고됐고 실제 도구 오류, 인증 실패, 동적 페이지, 불완전 관측은 검증 범위 밖이다. 공개 구현을 이용한 독립 재현과 실제 행동 명세가 불완전한 환경의 비용·성공률 비교가 필요하다.
저작권자 © STORIUM 무단전재 및 재배포 금지












