• AI 모델·연구
  • 빅테크·기업
  • 반도체·인프라
  • 산업 적용
  • AI 서비스·툴
  • 정책·윤리
  • 스타트업·투자
  • 문의
STORIUM
  • AI 모델·연구
  • 빅테크·기업
  • 반도체·인프라
  • 산업 적용
  • AI 서비스·툴
  • 정책·윤리
  • 스타트업·투자
  • 문의
No Result
View All Result
  • AI 모델·연구
  • 빅테크·기업
  • 반도체·인프라
  • 산업 적용
  • AI 서비스·툴
  • 정책·윤리
  • 스타트업·투자
  • 문의
No Result
View All Result
STORIUM
No Result
View All Result

GATS, 합성 계획 220개 과제서 성공률 100% 보고…알려진 행동 명세 조건

유지율 리포터 작성: 유지율 리포터
2026년 07월 14일 17시 05분
Reading Time: 2 mins read
A A
Home AI 모델·연구
Share on FacebookShare on Twitter

에이전트가 계획을 세울 때 매 단계 대규모언어모델을 다시 호출하지 않고, 실행 경험을 축적한 세계 모델과 트리 탐색을 결합하는 GATS가 제안됐다. 논문은 GATS를 UCB1 기반 Graph-Augmented Tree Search로 정의한다. 평가는 실제 서비스 로그가 아니라 연구진이 만든 합성 다단계 과제 100개와 12종 스트레스 과제 120개에서 진행됐다.

세계 모델은 세 층으로 작동한다. L1은 명세가 알려진 행동의 결과를 기호적으로 계산하고, L2는 실행 로그에서 얻은 전이 통계를 사용하며, L3는 낯선 행동을 LLM으로 예측한다. 논문의 합성 벤치마크에는 완전한 행동 명세가 제공돼 L1이 계획 단계 전이를 모두 처리했다. 따라서 계획 중 LLM 호출 0회는 일반 환경의 무호출 보장이 아니라 이 실험 조건의 결과다.

GATS와 LATS·ReAct의 12개 계획 스트레스 시나리오 성공률 비교표
12개 합성 계획 스트레스 시나리오 비교. 출처: GATS 논문 Table 6

Table 1에서 GATS는 합성 과제 100개에서 성공률 100%를 기록했고 LATS는 92%, ReAct는 64%였다. Table 6의 12종 스트레스 테스트 120개에서는 GATS 100%, LATS 88.9%, ReAct 23.9%로 보고됐다. 스트레스 테스트는 코딩 워크플로와 웹 탐색을 본뜬 범주를 포함하지만 실제 웹사이트나 실제 소프트웨어 운영을 평가한 것은 아니다.

평가 과제 수 GATS LATS ReAct 조건
합성 다단계 계획 100 100% 92% 64% 분기·막다른 길, 3개 seed
12종 스트레스 테스트 120 100% 88.9% 23.9% 범주당 10개, 3개 seed
자료: GATS 논문 Table 1·6, STORIUM 정리

비교에는 중요한 비대칭이 있다. GATS는 제공된 행동 명세를 L1에서 직접 사용했지만 LATS와 ReAct는 행동 효과를 LLM으로 추론했다. 저자들도 이 설정이 GATS에 유리하며, 불완전한 명세에서는 L3 호출이 늘어 LATS와의 비용 격차가 줄 수 있다고 적었다. 약 50회의 L3 부트스트랩 호출도 일회성 비용으로 별도 계산됐다.

GATS는 2026년 7월 공개된 arXiv 프리프린트로 동료검토 전이다. 결과는 고정된 합성 환경과 저자 구현, 제한된 seed에서 보고됐고 실제 도구 오류, 인증 실패, 동적 페이지, 불완전 관측은 검증 범위 밖이다. 공개 구현을 이용한 독립 재현과 실제 행동 명세가 불완전한 환경의 비용·성공률 비교가 필요하다.

저작권자 © STORIUM 무단전재 및 재배포 금지

Tags: GATS세계 모델에이전트 계획트리 탐색
유지율 리포터

유지율 리포터

안녕하세요, 유지율 리포터입니다. arXiv와 학회에서 쏟아지는 AI 연구를 살펴, 논문 속 성과를 과장 없이 우리말로 풀어 드립니다. 사실관계는 발행 전 편집인이 함께 확인합니다.

관련 기사

Top-down view of a city intersection with traffic and infrastructure at night.
AI 모델·연구

공급망 AI 에이전트의 인식론적 불확실성 분리 프레임워크 ReflectiChain

2026년 06월 12일 14시 20분
Futuristic abstract digital render depicting geometric shapes in vibrant colors.
AI 모델·연구

잠재 공간에 3D 기억 저장…영상 세계 모델 효율 끌어올린 Mirage

2026년 06월 09일 21시 20분
Next Post
알리바바그룹 AMAP 공식 로고

LLM 심사자의 편향은 숨은 상태의 저차원 방향으로 나타나고 조절할 수 있다

답글 남기기 응답 취소

이메일 주소는 공개되지 않습니다. 필수 필드는 *로 표시됩니다

  • 인기 급상승
  • 최신
Close-up of a GeForce RTX graphics card on a desk, showcasing its design and technology.

엔비디아 RTX 스파크 가격, 최소 2000달러 전망…윈도 노트북 ‘M1 모먼트’ 걸림돌

2026년 06월 02일 11시 19분
A 3D rendering of a neural network with abstract neuron connections in soft colors.

퍼플렉시티, 로컬·클라우드 AI를 자동 판단하는 하이브리드 추론 시스템 발표

2026년 06월 04일 08시 53분
Contemporary building with a glass facade and geometric patterns, low angle view.

앤트로픽·네이버 개발자 밋업 개최…서울 오피스 개소 앞두고 본사 임원 참석

2026년 06월 06일 21시 12분
책상에서 법률 문서에 서명하는 모습

클로드 ‘드리밍’ 기능 공개…앤트로픽, 법률·의료 AI 성능 대폭 향상

2026년 05월 30일 21시 11분
Close-up of a wooden gavel on a judge's desk, symbolizing justice.

AI 생성 성인 콘텐츠 유료 판매 운영자들, 법원서 잇달아 징역형

2026년 06월 05일 22시 40분
엔비디아 미국 본사 건물

엔비디아·37개 창립 파트너, Open Secure AI Alliance 출범

2026년 07월 28일 19시 45분
미국 연방 로비가 이뤄지는 워싱턴 의사당 공식 사진

미 주요 기술·AI 기업·단체 11곳, 상반기 로비 4,180만달러

2026년 07월 28일 18시 46분
다리오 아모데이 앤트로픽 CEO의 2023년 TechCrunch 행사 자료사진

Claude 공개 공유 대화 일부 검색 노출…비공개 자동 유출과는 달라

2026년 07월 28일 17시 53분
일리야 수츠케버가 참석한 2014년 스탠퍼드 대담 자료사진

SSI, 엔비디아 Vera Rubin 도입…연산 자원 10배 확대

2026년 07월 28일 16시 20분
중국 항저우 앤트그룹 A Space 건물

앤트그룹 Ling-3.0-Flash 공개…1,240억개 중 51억개 활성

2026년 07월 28일 15시 07분

검색

No Result
View All Result

인기 태그

AI규제 AI반도체 AI보안 AI안전 AI에이전트 AI연구 AI인프라 AI정책 Anthropic arXiv AWS ChatGPT Claude Gemini HBM IPO LLM MCP NVIDIA OpenAI RAG SK하이닉스 강화학습 구글 데이터센터 마이크로소프트 멀티모달 멀티에이전트 메타 반도체 벤치마크 사이버보안 삼성전자 생성AI 생성형AI 스타트업 앤트로픽 에이전트 에이전틱AI 엔비디아 오픈AI 오픈소스 의료AI 자율주행 피지컬AI

카테고리

  • AI 모델·연구 (1,482)
  • AI 서비스·툴 (826)
  • 반도체·인프라 (537)
  • 빅테크·기업 (566)
  • 산업 적용 (415)
  • 스타트업·투자 (251)
  • 정책·윤리 (455)

STORIUM은 트렌드와 인사이트를 전하는 종합 뉴스 매체입니다. 정확성, 균형, 맥락의 편집 원칙으로 신뢰받는 뉴스를 전합니다.

카테고리

  • AI 모델·연구
  • AI 서비스·툴
  • 반도체·인프라
  • 빅테크·기업
  • 산업 적용
  • 스타트업·투자
  • 정책·윤리

태그

AI규제 AI반도체 AI보안 AI안전 AI에이전트 AI연구 AI인프라 AI정책 Anthropic arXiv AWS ChatGPT Claude Gemini HBM IPO LLM MCP NVIDIA OpenAI RAG SK하이닉스 강화학습 구글 데이터센터 마이크로소프트 멀티모달 멀티에이전트 메타 반도체 벤치마크 사이버보안 삼성전자 생성AI 생성형AI 스타트업 앤트로픽 에이전트 에이전틱AI 엔비디아 오픈AI 오픈소스 의료AI 자율주행 피지컬AI

최근 뉴스

엔비디아 미국 본사 건물

엔비디아·37개 창립 파트너, Open Secure AI Alliance 출범

2026년 07월 28일 19시 45분
미국 연방 로비가 이뤄지는 워싱턴 의사당 공식 사진

미 주요 기술·AI 기업·단체 11곳, 상반기 로비 4,180만달러

2026년 07월 28일 18시 46분
  • 소개
  • 문의
  • 광고문의
  • 개인정보처리방침
  • 이용약관
  • 청소년보호정책
  • 정정·반론 보도 안내
  • 편집·윤리강령

주소: 경기 고양시 덕양구 꽃마을로 66, 한일미디어타워 15층
상호: 스토리움 |  사업자등록번호: 579-27-02025 |  대표자: 이국환
발행·편집인: 이국환 |  청소년보호책임자: 이국환 |  발행일자: 2025.01.01
스토리움의 모든 콘텐츠는 저작권법의 보호를 받는 바, 무단 전재·복사·배포 등은 법적 제재를 받을 수 있습니다.
© 2026 STORIUM. All Rights Reserved.

No Result
View All Result
  • AI 모델·연구
  • 빅테크·기업
  • 반도체·인프라
  • 산업 적용
  • AI 서비스·툴
  • 정책·윤리
  • 스타트업·투자
  • 문의

주소: 경기 고양시 덕양구 꽃마을로 66, 한일미디어타워 15층
상호: 스토리움 |  사업자등록번호: 579-27-02025 |  대표자: 이국환
발행·편집인: 이국환 |  청소년보호책임자: 이국환 |  발행일자: 2025.01.01
스토리움의 모든 콘텐츠는 저작권법의 보호를 받는 바, 무단 전재·복사·배포 등은 법적 제재를 받을 수 있습니다.
© 2026 STORIUM. All Rights Reserved.