이 논문은 arXiv v1 프리프린트로, PalmClaw라는 오픈소스 에이전트 프레임워크를 제안한다. 저자들은 에이전트의 세션, 메모리, 스킬, 도구, 루프를 휴대폰 내부에서 직접 돌리도록 설계해, 서버나 데스크톱에 의존하던 기존 구성과 구분한다. 핵심은 모바일 자원을 GUI 조작만으로 다루지 않고, 명시적 인자와 구조화된 결과, 그리고 도구별 실행 경계로 다루게 하는 데 있다.
구조는 세션, 장기 메모리, 스킬, 도구로 나뉜다. 입력은 세션에 배정되고, 시스템 지시문, 런타임 정보, 공유 메모리, 활성 스킬, 최근 대화와 도구 추적, 도구 사양을 모아 문맥을 구성한다. 추론은 원격 LLM API가 맡지만, 문맥 관리와 세션 상태, 도구 실행은 기기에서 처리한다. 도구 호출은 스키마, 권한·확인, 작업공간 경계를 거친 뒤 실행되며, 실패하면 구조화된 오류가 반환된다.

평가는 MobileTask와 AssistantBench에서 했다. MobileTask는 AndroidWorld, MobileAgentBench, Mobile-Bench에서 가져와 재작성한 70개 과제이며, 성공률로 평가한다. AssistantBench는 33개 개발셋에서 19개 과제를 남긴 하위셋을 썼고, 공식 정확도를 사용했다. 비교 기준선은 MobileClaw, ClawMobile, ApkClaw이며, 배포·운영 비교에는 OpenClaw도 포함했다. 모든 모바일 실험은 Android 13의 Xiaomi Redmi 2312DRAABC에서 수행했고, 공통 LLM 백본은 DeepSeek-V4-Flash, MobileClaw에는 화면 정합용 qwen3.7-plus를 추가했다.
| 항목 | 값 | 범위/비교 |
|---|---|---|
| MobileTask 규모 | 70 | 재작성된 모바일 과제 |
| AssistantBench 사용 범위 | 33개 dev 중 19개 | 채점 가능한 dev 하위셋 |
| PalmClaw 성공률 | 97.1% | MobileTask |
| 강한 기준선 성공률 | 87.1% | ApkClaw on MobileTask |
| PalmClaw 완료 시간 | 17.7초 | MobileTask 평균/과제 |
자료: STORIUM 정리
MobileTask에서 PalmClaw는 성공률 97.1%, 평균 행동 수 2.8, 토큰 50.4K, 평균 완료 시간 17.7초를 기록했다. 가장 강한 기준선인 ApkClaw는 성공률 87.1%, 행동 수 103.9, 토큰 2.06M, 시간 348.8초였다. 따라서 논문이 요약한 11.5% 상대 향상은 MobileTask 성공률에서 가장 강한 기준선 대비 수치이고, 94.9% 감소는 MobileTask 평균 완료 시간에서의 감소다. AssistantBench에서는 PalmClaw가 36.85% 정확도로 가장 높았다.
배포·운영 비교에서 PalmClaw는 별도 컴퓨터, CLI, 브리지 없이 시작할 수 있었고, 2단계와 약 2분이 걸렸다. 논문의 배포 비교표에서 OpenClaw는 컴퓨터와 명령줄 환경을 사용하고 브리지는 선택 사항이며, 4단계와 약 5분이 제시됐다. MobileClaw는 별도 컴퓨터와 CLI, 브리지가 모두 필요했고, 8단계와 약 15분이 걸렸다. ClawMobile은 별도 컴퓨터는 필요 없지만 CLI가 필요했고, 6단계와 약 25분이 걸렸다. 이 결과는 휴대폰 내부에서 에이전트 프레임워크를 호스팅하는 설계가 외부 설정 부담을 줄일 수 있음을 보여준다.
저작권자 © STORIUM 무단전재 및 재배포 금지













