위성영상 분석에서 핵심은 무엇을 보느냐를 넘어, 보이는 장면을 어떤 규칙과 맥락으로 해석하느냐에 있다. arXiv 프리프린트로 공개된 이 연구는 그 공백을 겨냥해 TerraLogic라는 벤치마크를 제시한다. 대상은 광학, 합성개구레이더(SAR), 적외선(IR) 영상이며, 과제는 재난 취약성 평가, 도시 열섬 분석, 산림 파편화 동태처럼 실제 의사결정과 맞닿은 시나리오로 짜였다. TerraLogic는 총 545개 과제로 구성된다. 각 과제는 시나리오 의도, 종속 관계를 가진 하위 목표, 그리고 버퍼 거리·인접 규칙·비율 임계치·위상 제약 같은 표준화된 공간 조건을 함께 담도록 설계됐다. 단순한 분류나 위치 찾기와 달리, 인식 결과를 중간 산출물로 삼아 다시 분석을 이어가는 계층적 지리 추론을 평가하는 구조다. 비교표에서는 이전 벤치마크들이 검증 가능한 실행이나 단계별 평가는 일부 지원했지만, 이런 계층적 장면 맥락은 거의 다루지 못했다고 정리한다.
구성 방식도 두 단계다. 먼저 저자는 모달리티별 예시와 도메인 지식을 넣은 프롬프트로 후보 과제와 도구 체인을 생성하고, 그다음 여덟 명의 원격탐사 전문가가 세 차례 검토한다. 의미가 분명한지, 연산자 선택과 순서·인자가 모달리티 제약과 GSD 단위에 맞는지, 중간 공간 객체가 다음 단계에 쓸 수 있을 만큼 지리적으로 타당한지를 확인한 뒤에만 수록한다. 실행까지 통과해야 공개되는 방식이라, 최종 답은 도구 출력에서 직접 계산된 경우만 인정된다.

데이터 출처는 LoveDA, ISPRS Potsdam, ISPRS Vaihingen, DeepGlobe Land Cover, HRSCD, OGSOD, DMIST 등이다. 표 3에 따르면 전체 545문항 가운데 광학이 386개, SAR 116개, IR 43개이며, 도구 호출은 총 1,649회였다. 질문 길이 평균은 전체 158.24자, 광학 160.13자, SAR 143.49자, IR 181.05자였다. 도구 사용은 2단계/3단계/4단계가 전체에서 72/387/86건으로 집계됐다.
평가용 에이전트 HieraPlan은 도구를 Perception, Spatial-Relations, Spatial-Statistics, SAR, IR의 계층적 라이브러리로 묶어 필요한 부분만 꺼내 쓴다. 한 단계가 실패하면 같은 묶음 안에서 대체 도구를 찾고, 필요할 때는 검증된 앞부분을 보존한 채 남은 구간만 다시 계획한다. 양적 결과는 도구로 계산하고, 언어모델은 검증된 중간 결과를 자연어로 정리하는 역할에 제한된다.
| 구분 | 값 | 근거 |
|---|---|---|
| 전체 과제 수 | 545 | Table 3 / Abstract |
| 도구 호출 총합 | 1649 | Table 3 |
| 모달리티별 과제 수 | 광학 386, SAR 116, IR 43 | Table 3 |
| GPT-4o 최종 답 정확도(AnsAcc) | 25.70% | Table 4 |
| 광학 하위집합에서 HieraPlan(GPT-4o) 정확도 | 29.29% | Table 6 |
자료: STORIUM 정리
실험은 OpenCompass 환경의 NVIDIA A5000 GPU에서 GPT-4o, Gemini-2.5-Flash, GPT-3.5, DeepSeek-V3, Qwen2.5-32B-Instruct, Llama-3-70B-Instruct, Qwen2.5-7B-Instruct 등과 비교해 진행됐다. 표 4에서 GPT-4o는 단계별 InstAcc 79.40%, ToolAcc 72.01%, ArgAcc 23.57%, SummAcc 82.83%를 보였고, end-to-end에서는 P 72.73%, O 88.38%, L 77.95%였다. 반면 최종 답 정확도 AnsAcc는 25.70%에 그쳤다. 표 5는 오류의 큰 축이 형식 오류와 지각 grounding 문제이며, 도구 사용 오류보다 구조화된 출력 생성이 더 큰 병목임을 보여준다. 광학 하위집합 비교에서도 HieraPlan(GPT-4o)의 정확도는 29.29%로 EarthDial 9.38%, GeoChat 6.70%, GeoPix 6.17%보다 높았지만, 절대 수준은 여전히 낮았다.
연구 원문은 arXiv:2607.12497에서 확인할 수 있다. 프리프린트 결과는 동료평가와 후속 재현을 거치며 달라질 수 있다.
저작권자 © STORIUM 무단전재 및 재배포 금지














