arXiv에 공개된 이 프리프린트는 레트로 Space Invaders형 아케이드 게임을 플레이 중 음성 명령으로 바꾸는 편집 방식을 제안한다. 말로 지시하면 LLM이 이를 내부 설정값의 구조화된 갱신으로 바꾸고, 사용자는 게임을 멈추지 않은 채 고치고 다시 해보는 순환을 반복한다.
시스템이 다루는 대상은 기계 동작, 시각 요소, 상호작용 패턴, 오디오 동작을 포함한 약 100개의 편집 가능한 구성 필드다. 외부 코드를 드러내지 않고도 파라미터를 조금씩 바꿔 게임성을 변형하도록 설계됐으며, 구현은 수정한 Arcade1Up 캐비닛과 Raspberry Pi 5, Whisper, GPT-4o를 사용했다.

검증은 도쿄가 아닌 츠쿠바대 윤리심사 승인 아래 진행된 사용자 연구로 이뤄졌다. 측정 항목은 인구통계와 배경, 반복형 5문항 trial 설문, 사후 UEQ, NASA-TLX, 그리고 8개 자체 항목이었다. 프로그래밍 경험은 Pro 6명, Amateur 8명, None-EX 7명으로 나뉘어 사후 지표를 비교했다.
결과적으로 참가자들은 전반적으로 긍정적인 경험과 중간 수준의 작업부하를 보였고, 프로그래밍 경험에 따른 상호작용 결과 차이는 뚜렷하지 않았다. 사후 평정에서는 NASA-TLX, Post Survey, UEQ 모두에서 보정 후 유의한 집단 차이가 나타나지 않았으며, 상관 효과 크기 |r|은 0.02~0.17 범위로 보고됐다.
편집 로그 분석은 다른 결을 보여준다. TF-IDF 뒤 PCA와 선형 혼합효과모형을 적용한 결과, 즉시 인지되는 파라미터를 조정한 편집은 사용성과 더 관련됐고, 핵심 게임 구조를 건드리는 편집은 즐거움과 더 가까운 경향을 보였다. PC2는 사용성 β=0.442, 즐거움 β=-0.475로 추정됐고, 둘 다 표준편차당 작은~중간 크기 효과로 해석됐다.
| 항목 | 값 | 근거 위치 |
|---|---|---|
| 편집 가능한 설정 필드 수 | 약 100개 | p.1, abstract / p.2, introduction |
| 사용자 연구 표본 | Pro 6명, Amateur 8명, None-EX 7명 | p.6, measures |
| 로그 처리 성공률 | 694건 중 97.1% 성공 | p.6, result system reliability |
| 집단 비교 결과 | NASA-TLX, Post Survey, UEQ 모두 보정 후 유의한 차이 없음; |r| 0.02~0.17 | p.7, subjective evaluation results |
| 편집 로그 관련 추정치 | PC2와 사용성 β=0.442, 즐거움 β=-0.475 | p.8, editing-log analysis |
자료: STORIUM 정리
세션 뒤 반성에서는 탐색적 실험, 목표지향적 구조 수정, 반복적 미세 조정 같은 서로 다른 편집 전략이 확인됐다. 전체 로그 694건 중 97.1%가 성공적으로 처리됐고, 문서 열람률은 비경험자 28.6%, 아마추어 50%, 프로그래밍 경험자 83.3%로 나타났다. 이 작업은 사람이 말로 플레이 경험을 고치며 AI와 공동 제작하는 방식을 구조화된 아케이드 환경에서 시험한 사례다.
저작권자 © STORIUM 무단전재 및 재배포 금지














