• AI 모델·연구
  • 빅테크·기업
  • 반도체·인프라
  • 산업 적용
  • AI 서비스·툴
  • 정책·윤리
  • 스타트업·투자
  • 문의
STORIUM
  • AI 모델·연구
  • 빅테크·기업
  • 반도체·인프라
  • 산업 적용
  • AI 서비스·툴
  • 정책·윤리
  • 스타트업·투자
  • 문의
No Result
View All Result
  • AI 모델·연구
  • 빅테크·기업
  • 반도체·인프라
  • 산업 적용
  • AI 서비스·툴
  • 정책·윤리
  • 스타트업·투자
  • 문의
No Result
View All Result
STORIUM
No Result
View All Result

VLM 엣지 추론 에너지, 출력 디코드가 86~97% 차지

유지율 리포터 작성: 유지율 리포터
2026년 07월 14일 12시 31분
Reading Time: 2 mins read
A A
Home AI 모델·연구
Share on FacebookShare on Twitter

엣지 VLM 추론에서 전체 에너지의 86~97%는 이미지 입력이 아니라 자기회귀 디코드에 쓰였다. RTX 3070의 448×448 조건에서 출력 토큰 하나의 벽시계 비용은 입력 토큰 하나보다 11~39배 길었다. 5개 모델과 RTX 3070 랩톱 GPU·Jetson Orin NX를 비교한 arXiv:2607.09520v1의 측정 결과다. PDF는 ACM MM ’26 원고 형식과 ACM 출판권 문구를 싣고 있지만 ISBN·DOI가 placeholder여서, 최종 프로시딩 확정 여부는 이 PDF만으로 단정할 수 없다.

RTX 3070에서 VLM 추론 시간 중 디코드 비중과 입력·출력 토큰당 시간 비용 비교
Figure 1 — RTX 3070에서 VLM 추론 시간 중 디코드 비중과 입력·출력 토큰당 시간 비용 비교. 출처: arXiv:2607.09520 연구진 · 원문

평균 전력 자체는 입력 해상도, 이미지 복잡도, 프롬프트 유형을 바꿔도 모델별로 거의 일정했고 전체 조건의 변동이 5% 미만이었다. RTX에서는 HWiNFO64 Pro로 시스템 전력을 100 ms 간격으로, Jetson에서는 INA3221의 VDD_IN 레일을 측정했다. llama.cpp의 llama-server와 탐욕적 디코딩(T=0)을 사용했다.

Qwen2.5-VL-3B의 시각 토큰은 224×224에서 896×896으로 갈 때 73개에서 1033개로 늘었지만 평균 전력 증가는 관찰되지 않았다. RTX 해상도 실험은 COCO 2017 검증 이미지에서 설정별 12회 실행하고 처음 2회를 워밍업으로 제외했다. 에너지 차이는 주로 전력보다 실행시간에서 생겼다는 해석이다.

출력 길이 효과는 프롬프트 비교에서 직접 드러났다. Jetson의 InternVL3-1B는 “Describe this image”에 평균 398토큰과 디코드 18.0초를 썼지만 한 단어로 답하게 하면 EOS를 포함해 평균 3토큰, 0.07초였다. 객체 수로 나눈 COCO 이미지 40장에서도 장면이 복잡할수록 답이 길어져 에너지가 최대 4.1배 달라졌다.

InternVL3-1B 프롬프트 평균 출력 토큰 디코드 시간
Describe this image 398 18.0 s
What is the main object? Answer in one word 3 (EOS 포함) 0.07 s

자료: STORIUM 정리

고정 토큰 모델에서 시각 토큰을 전부 제거해도 절감 상한은 총에너지의 10%인 반면 출력 길이 제어의 계산상 절감 폭은 최대 97%였다. 다만 프로파일링은 주로 1B~4B 모델, batch size 1에 집중됐고 논문의 규모 분석은 1B~8B에 한정된다. 배치 처리와 동시 서빙에서도 같은 비율이 유지되는지는 검증되지 않았다.

저작권자 © STORIUM 무단전재 및 재배포 금지

Tags: COCO 2017VLM에너지 프로파일링엣지 추론출력 토큰프리프린트
유지율 리포터

유지율 리포터

안녕하세요, 유지율 리포터입니다. arXiv와 학회에서 쏟아지는 AI 연구를 살펴, 논문 속 성과를 과장 없이 우리말로 풀어 드립니다. 사실관계는 발행 전 편집인이 함께 확인합니다.

관련 기사

Mohamed bin Zayed University of Artificial Intelligence, DataBayt.AI Labs, Imperial College London 공식 로고 — VLM은 물체 수를 알지만 답을 비껴 쓴다: 카운팅 실패의 내부 신호를 찾다 연구진 소속기관
AI 모델·연구

VLM 카운팅 오류, 내부 정답 신호와 최종 출력의 어긋남 분석

2026년 07월 14일 12시 07분
Agentic Context Management 저자 가우라브 다디치
AI 모델·연구

Agentic Context Management가 대화·도구·기억을 아키텍처로 묶어 비용과 망각을 줄이는 법

2026년 07월 26일 18시 34분
칭화대학교 AI대학 연구자 류먀오
AI 모델·연구

청화대 연구진, 확산모델 비디오 편집의 ‘원본 붕괴’ 막는 테스트타임 튜닝 제안

2026년 07월 26일 14시 58분
다중 에이전트 토론형 AI 연구진이 소속된 카렐대학교 경제연구소 시설
AI 모델·연구

경제 메타분석 44편 실험에서, 두 다중 에이전트 토론형 AI보다 단일 응답이 더 유용했다

2026년 07월 25일 08시 50분
Next Post
KU Leuven; Toyota Motor Europe; Toyota Research Institute 공식 캠퍼스 사진 — 단일 시점 인간 손 시연을 물리 검증 로봇 팔 궤적으로 바꾸는 DemoBridge 연구진 소속기관

DemoBridge, 단일 시점 손 시연을 충돌 없는 로봇 궤적으로 변환

답글 남기기 응답 취소

이메일 주소는 공개되지 않습니다. 필수 필드는 *로 표시됩니다

  • 인기 급상승
  • 최신
Close-up of a GeForce RTX graphics card on a desk, showcasing its design and technology.

엔비디아 RTX 스파크 가격, 최소 2000달러 전망…윈도 노트북 ‘M1 모먼트’ 걸림돌

2026년 06월 02일 11시 19분
A 3D rendering of a neural network with abstract neuron connections in soft colors.

퍼플렉시티, 로컬·클라우드 AI를 자동 판단하는 하이브리드 추론 시스템 발표

2026년 06월 04일 08시 53분
Contemporary building with a glass facade and geometric patterns, low angle view.

앤트로픽·네이버 개발자 밋업 개최…서울 오피스 개소 앞두고 본사 임원 참석

2026년 06월 06일 21시 12분
책상에서 법률 문서에 서명하는 모습

클로드 ‘드리밍’ 기능 공개…앤트로픽, 법률·의료 AI 성능 대폭 향상

2026년 05월 30일 21시 11분
Close-up of a wooden gavel on a judge's desk, symbolizing justice.

AI 생성 성인 콘텐츠 유료 판매 운영자들, 법원서 잇달아 징역형

2026년 06월 05일 22시 40분
엔비디아 품질 인증을 받은 LG전자 600kW급 냉각수 분배 장치 CDU의 외관과 내부

LG전자, 600kW급 CDU로 국내 첫 엔비디아 품질 인증

2026년 07월 29일 11시 44분
미국 오리건 AWS 데이터센터 단지 자료사진

AWS 주간 업데이트…Claude Opus 5와 장기 실행 Lambda 추가

2026년 07월 29일 11시 34분
김동훈 NHN클라우드 대표가 NHN FactoryX 론칭 쇼케이스에서 발표하는 모습

NHN클라우드, AI 풀스택 ‘FactoryX’ 공개…AI 매출 비중 50% 목표

2026년 07월 29일 11시 33분
아모레퍼시픽 연구개발 과정에서 샘플을 집게로 선별하는 모습

아모레퍼시픽, 연구 특화 AI ‘LEMON’ 구축…내부 베타서 검토 12일→5분

2026년 07월 29일 11시 28분
미국 멘로파크 메타 본사 단지 자료사진

메타, EU AI 생성 콘텐츠 투명성 행동강령 서명

2026년 07월 29일 10시 29분

검색

No Result
View All Result

인기 태그

AI규제 AI반도체 AI보안 AI안전 AI에이전트 AI연구 AI인프라 AI정책 Anthropic arXiv AWS ChatGPT Claude Gemini HBM IPO LLM MCP NVIDIA OpenAI RAG SK하이닉스 강화학습 구글 데이터센터 마이크로소프트 멀티모달 멀티에이전트 메타 반도체 벤치마크 사이버보안 삼성전자 생성AI 생성형AI 스타트업 앤트로픽 에이전트 에이전틱AI 엔비디아 오픈AI 오픈소스 의료AI 자율주행 피지컬AI

카테고리

  • AI 모델·연구 (1,484)
  • AI 서비스·툴 (828)
  • 반도체·인프라 (538)
  • 빅테크·기업 (566)
  • 산업 적용 (417)
  • 스타트업·투자 (251)
  • 정책·윤리 (457)

STORIUM은 트렌드와 인사이트를 전하는 종합 뉴스 매체입니다. 정확성, 균형, 맥락의 편집 원칙으로 신뢰받는 뉴스를 전합니다.

카테고리

  • AI 모델·연구
  • AI 서비스·툴
  • 반도체·인프라
  • 빅테크·기업
  • 산업 적용
  • 스타트업·투자
  • 정책·윤리

태그

AI규제 AI반도체 AI보안 AI안전 AI에이전트 AI연구 AI인프라 AI정책 Anthropic arXiv AWS ChatGPT Claude Gemini HBM IPO LLM MCP NVIDIA OpenAI RAG SK하이닉스 강화학습 구글 데이터센터 마이크로소프트 멀티모달 멀티에이전트 메타 반도체 벤치마크 사이버보안 삼성전자 생성AI 생성형AI 스타트업 앤트로픽 에이전트 에이전틱AI 엔비디아 오픈AI 오픈소스 의료AI 자율주행 피지컬AI

최근 뉴스

엔비디아 품질 인증을 받은 LG전자 600kW급 냉각수 분배 장치 CDU의 외관과 내부

LG전자, 600kW급 CDU로 국내 첫 엔비디아 품질 인증

2026년 07월 29일 11시 44분
미국 오리건 AWS 데이터센터 단지 자료사진

AWS 주간 업데이트…Claude Opus 5와 장기 실행 Lambda 추가

2026년 07월 29일 11시 34분
  • 소개
  • 문의
  • 광고문의
  • 개인정보처리방침
  • 이용약관
  • 청소년보호정책
  • 정정·반론 보도 안내
  • 편집·윤리강령

주소: 경기 고양시 덕양구 꽃마을로 66, 한일미디어타워 15층
상호: 스토리움 |  사업자등록번호: 579-27-02025 |  대표자: 이국환
발행·편집인: 이국환 |  청소년보호책임자: 이국환 |  발행일자: 2025.01.01
스토리움의 모든 콘텐츠는 저작권법의 보호를 받는 바, 무단 전재·복사·배포 등은 법적 제재를 받을 수 있습니다.
© 2026 STORIUM. All Rights Reserved.

No Result
View All Result
  • AI 모델·연구
  • 빅테크·기업
  • 반도체·인프라
  • 산업 적용
  • AI 서비스·툴
  • 정책·윤리
  • 스타트업·투자
  • 문의

주소: 경기 고양시 덕양구 꽃마을로 66, 한일미디어타워 15층
상호: 스토리움 |  사업자등록번호: 579-27-02025 |  대표자: 이국환
발행·편집인: 이국환 |  청소년보호책임자: 이국환 |  발행일자: 2025.01.01
스토리움의 모든 콘텐츠는 저작권법의 보호를 받는 바, 무단 전재·복사·배포 등은 법적 제재를 받을 수 있습니다.
© 2026 STORIUM. All Rights Reserved.