• AI 모델·연구
  • 빅테크·기업
  • 반도체·인프라
  • 산업 적용
  • AI 서비스·툴
  • 정책·윤리
  • 스타트업·투자
  • 문의
STORIUM
  • AI 모델·연구
  • 빅테크·기업
  • 반도체·인프라
  • 산업 적용
  • AI 서비스·툴
  • 정책·윤리
  • 스타트업·투자
  • 문의
No Result
View All Result
  • AI 모델·연구
  • 빅테크·기업
  • 반도체·인프라
  • 산업 적용
  • AI 서비스·툴
  • 정책·윤리
  • 스타트업·투자
  • 문의
No Result
View All Result
STORIUM
No Result
View All Result

실패 합성으로 학습한 로봇 조작용 밀집 보상 모델 DenseReward

유지율 리포터 작성: 유지율 리포터
2026년 07월 15일 22시 08분
Reading Time: 3 mins read
A A
Home AI 모델·연구
Share on FacebookShare on Twitter

DenseReward는 로봇 조작에서 에피소드 종료의 이진 성공 신호에만 의존하던 보상 모델의 한계를 다룬다. 저자들은 성공 시연만이 아니라 충돌, 미스그랩, 낙하, 복구 같은 실패 궤적을 자동으로 합성해 프레임 단위 보상을 학습한다. 입력은 언어 지시와 현재 프레임, 최근 과거 프레임이며, 출력은 현재 시점의 task progress를 나타내는 0.000~1.000 스칼라 보상이다.

방법은 Reach, Grasp, Lift, Move, Place의 다섯 단계로 조작을 분해하고, 단계별 교란으로 물리적으로 그럴듯한 실패를 만드는 파이프라인에 있다. GraspNet은 최대 50개의 grasp 후보를 제안하고 CuRobo는 충돌을 고려한 경로를 잡는다. DenseReward는 Qwen3-VL-4B-Instruct 위에 LoRA로 미세조정하며, 최근 관측과 최대 두 개의 과거 프레임을 함께 보게 한다.

조작 실패 합성으로 27k 에피소드를 만들고 프레임 단위 보상을 예측하는 전체 흐름도
자동 실패 합성, 프레임 단위 밀집 보상 예측, 하위 제어·RL 활용을 한눈에 보여준다. 출처: arXiv:2607.13033

데이터셋은 26,579개 에피소드와 7,560,942개 프레임 수준 샘플로 이뤄지며, DROID, Isaac, RoboSuite, LIBERO를 포함한다. Appendix의 분류는 DROID 2,986, Isaac 12,481, RoboSuite 9,287, LIBERO 1,825 에피소드다. 실패 유형은 collision, miss, fall, smooth, recover로 나뉘며, validity filtering으로 물리적으로 맞지 않는 궤적을 걸러낸다.

비교 항목 DenseReward 대표 baseline 수치/설명
보상 예측 MAE Overall 0.081 RoboReward-8B 0.230 낮을수록 좋음
보상 예측 MAE DROID 0.259 Qwen3-VL-4B 0.532 낮을수록 좋음
MPC 평균 최소거리 0.229 VLAC-8B 0.358 can·cup·lemon, 과제당 10회, 낮을수록 좋음
컵 쌓기 성공률 40%→80% DSRL+고정 π0 10회
공을 바구니에 넣기 성공률 30%→70% DSRL+고정 π0 10회

자료: STORIUM 정리

보상 예측 MAE에서 DenseReward는 overall 0.081로 가장 낮았다. 소스별로는 DROID 0.259, Isaac 0.081, RoboSuite 0.051, LIBERO 0.044다. 비교 대상은 Qwen3-VL-4B/8B, Molmo2-4B/8B, RoboReward-4B/8B, Robometer였고, RoboReward-8B의 overall MAE는 0.230이었다. MPC에서는 can, cup, lemon 세 작업의 평균 최소 end-effector-to-object 3D 거리로 평가했고, 10개 평가 에피소드의 평균에서 DenseReward가 0.229로 RoboReward-4B 0.267, RoboReward-8B 0.300, VLAC-2B 0.347, VLAC-8B 0.358보다 낮았다.

실세계 실험에서는 DSRL로 고정된 π0 정책을 fine-tuning했다. 대상 과제는 stack the cups와 put ball in basket이며, 각 정책은 10 trials로 평가했다. DenseReward를 더하면 성공률이 stack the cups에서 40%에서 80%로, put ball in basket에서 30%에서 70%로 올랐다. 저자들은 도구 사용과 긴 시간축 과제, 인간 선호 피드백을 후속 과제로 남겼다.

저작권자 © STORIUM 무단전재 및 재배포 금지

Tags: Dense rewardFailure synthesisReinforcement learningRobotic manipulation로봇 보상모델
유지율 리포터

유지율 리포터

안녕하세요, 유지율 리포터입니다. arXiv와 학회에서 쏟아지는 AI 연구를 살펴, 논문 속 성과를 과장 없이 우리말로 풀어 드립니다. 사실관계는 발행 전 편집인이 함께 확인합니다.

관련 기사

표시할 내용이 없습니다
Next Post
Google Chrome 공식 로고

구글, 영국 데스크톱 Chrome에 Gemini 확장…iOS는 8월 순차 적용

답글 남기기 응답 취소

이메일 주소는 공개되지 않습니다. 필수 필드는 *로 표시됩니다

  • 인기 급상승
  • 최신
Close-up of a GeForce RTX graphics card on a desk, showcasing its design and technology.

엔비디아 RTX 스파크 가격, 최소 2000달러 전망…윈도 노트북 ‘M1 모먼트’ 걸림돌

2026년 06월 02일 11시 19분
A 3D rendering of a neural network with abstract neuron connections in soft colors.

퍼플렉시티, 로컬·클라우드 AI를 자동 판단하는 하이브리드 추론 시스템 발표

2026년 06월 04일 08시 53분
Contemporary building with a glass facade and geometric patterns, low angle view.

앤트로픽·네이버 개발자 밋업 개최…서울 오피스 개소 앞두고 본사 임원 참석

2026년 06월 06일 21시 12분
책상에서 법률 문서에 서명하는 모습

클로드 ‘드리밍’ 기능 공개…앤트로픽, 법률·의료 AI 성능 대폭 향상

2026년 05월 30일 21시 11분
Close-up of a wooden gavel on a judge's desk, symbolizing justice.

AI 생성 성인 콘텐츠 유료 판매 운영자들, 법원서 잇달아 징역형

2026년 06월 05일 22시 40분
LG유플러스 통합관제센터 앞에서 정보보호백서 2025를 소개하는 정보보안센터 임직원

LG유플러스, 2028년 에이전틱 SOC 전환 추진…7000억원은 정보보호 전반

2026년 07월 29일 12시 06분
엔비디아 품질 인증을 받은 LG전자 600kW급 냉각수 분배 장치 CDU의 외관과 내부

LG전자, 600kW급 CDU로 국내 첫 엔비디아 품질 인증

2026년 07월 29일 11시 44분
미국 오리건 AWS 데이터센터 단지 자료사진

AWS 주간 업데이트…Claude Opus 5와 장기 실행 Lambda 추가

2026년 07월 29일 11시 34분
김동훈 NHN클라우드 대표가 NHN FactoryX 론칭 쇼케이스에서 발표하는 모습

NHN클라우드, AI 풀스택 ‘FactoryX’ 공개…AI 매출 비중 50% 목표

2026년 07월 29일 11시 33분
아모레퍼시픽 연구개발 과정에서 샘플을 집게로 선별하는 모습

아모레퍼시픽, 연구 특화 AI ‘LEMON’ 구축…내부 베타서 검토 12일→5분

2026년 07월 29일 11시 28분

검색

No Result
View All Result

인기 태그

AI규제 AI반도체 AI보안 AI안전 AI에이전트 AI연구 AI인프라 AI정책 Anthropic arXiv AWS ChatGPT Claude Gemini HBM IPO LLM MCP NVIDIA OpenAI RAG SK하이닉스 강화학습 구글 데이터센터 마이크로소프트 멀티모달 멀티에이전트 메타 반도체 벤치마크 사이버보안 삼성전자 생성AI 생성형AI 스타트업 앤트로픽 에이전트 에이전틱AI 엔비디아 오픈AI 오픈소스 의료AI 자율주행 피지컬AI

카테고리

  • AI 모델·연구 (1,484)
  • AI 서비스·툴 (828)
  • 반도체·인프라 (538)
  • 빅테크·기업 (566)
  • 산업 적용 (418)
  • 스타트업·투자 (251)
  • 정책·윤리 (457)

STORIUM은 트렌드와 인사이트를 전하는 종합 뉴스 매체입니다. 정확성, 균형, 맥락의 편집 원칙으로 신뢰받는 뉴스를 전합니다.

카테고리

  • AI 모델·연구
  • AI 서비스·툴
  • 반도체·인프라
  • 빅테크·기업
  • 산업 적용
  • 스타트업·투자
  • 정책·윤리

태그

AI규제 AI반도체 AI보안 AI안전 AI에이전트 AI연구 AI인프라 AI정책 Anthropic arXiv AWS ChatGPT Claude Gemini HBM IPO LLM MCP NVIDIA OpenAI RAG SK하이닉스 강화학습 구글 데이터센터 마이크로소프트 멀티모달 멀티에이전트 메타 반도체 벤치마크 사이버보안 삼성전자 생성AI 생성형AI 스타트업 앤트로픽 에이전트 에이전틱AI 엔비디아 오픈AI 오픈소스 의료AI 자율주행 피지컬AI

최근 뉴스

LG유플러스 통합관제센터 앞에서 정보보호백서 2025를 소개하는 정보보안센터 임직원

LG유플러스, 2028년 에이전틱 SOC 전환 추진…7000억원은 정보보호 전반

2026년 07월 29일 12시 06분
엔비디아 품질 인증을 받은 LG전자 600kW급 냉각수 분배 장치 CDU의 외관과 내부

LG전자, 600kW급 CDU로 국내 첫 엔비디아 품질 인증

2026년 07월 29일 11시 44분
  • 소개
  • 문의
  • 광고문의
  • 개인정보처리방침
  • 이용약관
  • 청소년보호정책
  • 정정·반론 보도 안내
  • 편집·윤리강령

주소: 경기 고양시 덕양구 꽃마을로 66, 한일미디어타워 15층
상호: 스토리움 |  사업자등록번호: 579-27-02025 |  대표자: 이국환
발행·편집인: 이국환 |  청소년보호책임자: 이국환 |  발행일자: 2025.01.01
스토리움의 모든 콘텐츠는 저작권법의 보호를 받는 바, 무단 전재·복사·배포 등은 법적 제재를 받을 수 있습니다.
© 2026 STORIUM. All Rights Reserved.

No Result
View All Result
  • AI 모델·연구
  • 빅테크·기업
  • 반도체·인프라
  • 산업 적용
  • AI 서비스·툴
  • 정책·윤리
  • 스타트업·투자
  • 문의

주소: 경기 고양시 덕양구 꽃마을로 66, 한일미디어타워 15층
상호: 스토리움 |  사업자등록번호: 579-27-02025 |  대표자: 이국환
발행·편집인: 이국환 |  청소년보호책임자: 이국환 |  발행일자: 2025.01.01
스토리움의 모든 콘텐츠는 저작권법의 보호를 받는 바, 무단 전재·복사·배포 등은 법적 제재를 받을 수 있습니다.
© 2026 STORIUM. All Rights Reserved.