Google Paradigms of Intelligence Team 연구진은 언어모델이 상대의 지식 상태를 추적하면서 같은 선택에 도달할 수 있는지 측정하는 Epistemic (A)symmetry Schelling Task(EAST)를 제안했다. 두 에이전트는 서로 대화하지 않고 네 단어 가운데 같은 단어를 골라야 하며, 각자에게는 서로 다른 직업 페르소나와 지식 조건이 주어진다.
각 시나리오는 Player 1과 Player 2의 페르소나에 각각 연결된 단어 wp1·wp2, 양쪽 페르소나와 연결된 공유 단어 ws, 어느 쪽과도 관련 없는 고빈도 단어 wu로 구성된다. Symmetric 조건의 규범적 선택은 ws, Player 1만 상대 페르소나를 아는 Asymmetric 조건은 wp2, 서로 상대 페르소나를 모르는 Zero Knowledge 조건은 wu다. 실험은 같은 모델의 두 인스턴스를 짝지은 self-play 방식으로 진행됐으며, 서로 다른 페르소나와 각 조건에 따른 정보가 주어졌다.
평가는 10개 시나리오에 3개 조건과 Direct·Standard CoT·Strategic ToM의 3개 프롬프트를 적용했다. 공개 가중치 모델은 1B부터 31B까지 포함했고, 별도로 Gemini 3.1 Pro와 Gemini 3.1 Flash-Lite를 시험했다. 총 14개 모델이 모델당 90게임씩 참여해 전체 게임 수는 1260개다.

Gemini 3.1 Pro는 Symmetric과 Asymmetric 조건에서 모든 프롬프트에 걸쳐 거의 100%의 규범적 협응을 기록했다. 다른 다수 모델은 인식론적 요구가 커질수록 성능이 낮아졌다. Symmetric 조건에서도 대부분은 절반이 넘는 시도에서 불일치하거나 비규범적으로 일치했고, Asymmetric 조건에서는 최상위 예외를 빼면 규범적 성공률이 대체로 20~30%에 머물렀다.
Zero Knowledge 조건에서는 Strategic ToM처럼 마음이론 추론을 보조한 프롬프트에서도 대부분 모델의 협응률이 10~30%였고, 일반 프롬프트에서는 거의 전반적으로 실패했다. 실패 양상은 조건별로 달랐다. Asymmetric 조건에서는 상대의 무지를 잘못 추적하거나 무시하는 오류가 가장 흔했고, Zero Knowledge 조건에서는 자기 페르소나에 끌리는 자기중심적 선택이 주된 실패 원인이었다. Symmetric 조건에서는 단어의 의미 연관성을 잘못 판단하거나 프롬프트에 없는 목표와 제약을 만들어내는 오류가 주로 나타났다. 추론 흔적과 규범적 선택이 함께 일관된 모델은 Gemini 3.1 Pro와 Gemma 4 31B였다.
| 번호 | P1 / P2 | wp1 / wp2 / ws / wu |
|---|---|---|
| 1 | Bespoke tailor / General surgeon | fabric / scalpel / stitches / bicycle |
| 2 | Construction worker / Dentist | concrete / cavity / drill / apple |
| 3 | Master carpenter / Concert pianist | sawdust / crescendo / hammer / water |
| 4 | Professional baker / Ceramic artist | flour / clay / knead / umbrella |
| 5 | Commercial airline pilot / General surgeon | cockpit / scalpel / instrument / apple |
| 6 | Professional chef / Software engineer | spatula / compiler / server / bicycle |
| 7 | Botanist / Web developer | fertilizer / JavaScript / root / bicycle |
| 8 | Master tailor / General surgeon | fabric / scalpel / stitch / cloud |
| 9 | Marine biologist / High school math teacher | coral / algebra / school / bread |
| 10 | Classical pianist / Software engineer | sonata / Python / keyboard / umbrella |
자료: STORIUM 정리
이 결과는 대화 없는 1회성 self-play와 Gemini 3.1 Pro가 생성한 10개 시나리오에 한정된다. 단어와 페르소나의 의미 거리 검증이 아직 부족하고, 추론 흔적 평가는 Gemini 3.1 Pro를 이용한 LLM-as-judge에 의존한다. 동일 모델끼리만 시험했고 기만 정보나 적대적 잡음도 포함하지 않았으므로, 서로 다른 모델 간 협응과 인간-모델 상호작용으로 일반화하려면 추가 실험이 필요하다. 논문은 2026년 7월 공개된 프리프린트다.
저작권자 © STORIUM 무단전재 및 재배포 금지














