AI 인프라 기업 Runware가 모듈형 추론 설비 ‘Sonic Inference Pod’를 공개했다. 20피트 운송용 컨테이너 한 대에 최대 1,200개의 GPU와 직접 액체 냉각 장치를 넣어, 고정형 데이터센터를 새로 짓지 않고 필요한 지역에 연산 용량을 배치하는 제품이다. Runware는 전통적인 데이터센터 대비 추론 단가를 최대 10분의 1 수준으로 낮출 수 있다고 주장한다. 다만 이는 회사가 제시한 목표이며, 고객별 실제 요금과 독립적인 성능 비교 결과는 공개하지 않았다.
이용 기업은 자체 컨테이너·서비스·스크립트를 포드의 GPU에서 실행하는 서버리스 컴퓨팅 방식과, 자체 모델을 전용 응용프로그램 인터페이스로 제공하는 관리형 방식 가운데 선택할 수 있다. 서버리스 컴퓨팅은 실행 시간을 초 단위로 과금하고 예약 용량에는 최대 50% 절감 혜택을 제시한다. 관리형 방식은 결과물이나 토큰 단위로 비용을 매긴다. 여러 포드에 작업을 분산하는 소프트웨어가 각 장치의 부하와 지연시간을 살펴 요청을 보낼 곳을 정하는 구조다.

영상·이미지·음성·텍스트 모델을 운영하면서 수요 변화가 큰 기업에는 필요한 만큼만 실행하고 증설 단위를 작게 가져갈 수 있다는 점이 장점이다. 포드의 폐쇄형 냉각 회로는 1.5㎥의 물을 계속 순환시키며, Runware는 평균 제작 기간을 3주, 현장 배치 기간을 수일로 설명한다. 고정형 시설보다 빠른 증설을 원하는 사업자에게 선택지가 될 수 있지만, 공식 페이지는 첫 배치가 진행 중이라고만 밝혀 모든 지역에서 즉시 이용할 수 있는 상태는 아니다.
비용 판단에는 주의가 필요하다. Runware가 내세운 최대 10배 낮은 가격과 30~90% 낮은 추론 요금은 자사 설계에 근거한 주장으로, 비교 대상의 장비 구성과 지역별 전력비가 함께 공개된 검증 결과는 아니다. 재생에너지 전력 사용도 제품 설계 방향으로 제시됐을 뿐 개별 배치 장소의 전원 구성을 보장하지 않는다. 도입 기업은 이용 가능 지역, GPU 종류, 처리량, 지연시간, 데이터 이동 경로, 장애 대응 조건과 총비용을 계약 전에 확인해야 한다.
저작권자 © STORIUM 무단전재 및 재배포 금지













