• AI 모델·연구
  • 빅테크·기업
  • 반도체·인프라
  • 산업 적용
  • AI 서비스·툴
  • 정책·윤리
  • 스타트업·투자
  • 문의
STORIUM
  • AI 모델·연구
  • 빅테크·기업
  • 반도체·인프라
  • 산업 적용
  • AI 서비스·툴
  • 정책·윤리
  • 스타트업·투자
  • 문의
No Result
View All Result
  • AI 모델·연구
  • 빅테크·기업
  • 반도체·인프라
  • 산업 적용
  • AI 서비스·툴
  • 정책·윤리
  • 스타트업·투자
  • 문의
No Result
View All Result
STORIUM
No Result
View All Result

큐원 전 총괄 “하이브리드 씽킹은 틀렸다”…이제는 에이전트를 지지하는 이유

한이준 리포터 작성: 한이준 리포터
2026년 07월 06일 13시 04분
Reading Time: 1 min read
A A
Home 빅테크·기업
Share on FacebookShare on Twitter

알리바바 큐원(Qwen) 프로젝트의 기술 총괄을 맡았던 린쥔양이 지난 3월 3일 사임을 발표한 뒤, 자신을 독립 연구자로 소개하며 내놓은 강연과 후속 글이 업계에서 다시 주목받고 있다. ‘큐원: 제너럴리스트 모델·에이전트를 향하여’라는 제목의 강연에서 그는 큐원 모델군의 발전 과정을 짚은 뒤 “모델 훈련에서 에이전트 훈련으로”라는 한 문장으로 마무리했으며, 이후 독립 연구자 신분으로 이 주장을 상세히 풀어낸 글을 발표했다.

강연은 QwQ-32B부터 큐원2.5-맥스, 큐원3, 큐원2.5-VL, 큐원2.5-옴니까지 큐원 모델군 전체를 훑는다. 특히 큐원3 대목에서는 단계적 추론을 수행하는 씽킹 모드와 즉각 응답하는 논씽킹 모드를 오가는 하이브리드 씽킹, 그리고 추론량에 상한을 둘 수 있는 동적 사고 예산 기능이 강조됐다. 큐원3는 다국어 지원 범위를 29개에서 119개 언어·방언으로 확장했으며, 0.6B부터 235B까지 다양한 파라미터 규모와 GGUF·GPTQ·AWQ·MLX 등 양자화 포맷을 아파치2.0 라이선스로 공개했다.

후속 글에서 린쥔양은 하이브리드 씽킹을 매끈한 기능처럼 소개한 강연과 달리, 이를 구현하는 과정이 실제로는 매우 어려웠다고 밝혔다. 직관적인 지시 응답 모델은 간결함과 신속함으로 보상받는 반면, 씽킹 모델은 어려운 문제에 더 많은 토큰을 쓰도록 보상받아 두 방향이 서로 충돌한다는 것이다. 큐원3는 장문의 사고사슬 콜드스타트와 추론 강화학습, ‘씽킹 모드 퓨전’ 단계로 구성된 4단계 후속 훈련 파이프라인으로 두 모드의 통합을 시도했지만, 2025년 하반기 2507 라인에서는 결국 인스트럭트와 씽킹 변형을 별도로 내놓았다. 그는 이를 모델의 문제라기보다 데이터의 문제로 규정했고, 앤트로픽이 클로드3.7 소네트에서 사용자가 사고 예산을 직접 설정하는 하이브리드 모델을, 클로드4에서는 추론과 도구 사용을 교차시키는 방식을 택한 것을 유용한 반례로 꼽았다.

린쥔양은 o1과 딥시크-R1으로 대표되는 ‘추론 사고’의 시대가 검증 가능한 보상이 있는 수학·코드·논리 중심의 강화학습을 정착시켰다면, 다음 시대는 ‘에이전틱 사고’라고 진단했다. 이는 계획을 세우고 언제 행동할지 판단하며 도구를 쓰고 환경 피드백을 읽어 계획을 수정하는, 환경과의 폐쇄 루프 상호작용으로 정의된다. 그는 에이전틱 사고가 다뤄야 할 과제로 언제 사고를 멈추고 행동할지 판단, 어떤 도구를 어떤 순서로 쓸지 선택, 노이즈 섞인 관측 정보 통합, 실패 후 계획 수정, 다수의 턴과 도구 호출에 걸친 일관성 유지를 꼽았다.

린쥔양은 에이전틱 강화학습의 인프라가 훨씬 어렵다고도 강조했다. 추론 강화학습의 롤아웃은 대체로 독립적이고 평가자가 명확하지만, 에이전틱 강화학습에서는 정책이 도구 서버·브라우저·터미널·샌드박스로 이뤄진 하네스 안에서 작동해 훈련과 추론의 깔끔한 분리가 필수적이며, 그렇지 않으면 롤아웃 처리량이 무너진다는 것이다. 그는 지도학습 미세조정(SFT) 시대에는 데이터 다양성을 최적화했다면, 에이전트 시대에는 안정성·현실성·커버리지·악용 저항성을 갖춘 환경 품질을 최적화해야 한다고 주장하며, 도구 접근권이 공격 표면을 넓히는 보상 해킹을 가장 어려운 과제로 지목했다.

저작권자 © STORIUM 무단전재 및 재배포 금지

Tags: Qwen강화학습알리바바에이전트하이브리드씽킹
한이준 리포터

한이준 리포터

안녕하세요, 한이준 리포터입니다. 구글·마이크로소프트·메타 같은 글로벌 빅테크의 AI 전략과 플랫폼 경쟁을 좇으며, 발표 뒤에 숨은 셈법을 읽어 드립니다. 모든 기사는 발행 전 편집인의 검수를 통과합니다.

관련 기사

black laptop computer turned on displaying facebook
AI 모델·연구

AI 슬라이드 제작, ‘역계획’으로 사용자 숨은 디자인 의도 학습

2026년 07월 03일 16시 14분
Close-up of hands coding on a laptop, showcasing software development in action.
AI 서비스·툴

허깅페이스, 로컬 Gemma·Qwen으로 GitHub PR 자동 분류 구현

2026년 06월 24일 13시 45분
Close-up of a robotic arm in a modern industrial environment, highlighting technology.
AI 모델·연구

알리바바 Qwen-RobotSuite 공개, 로봇 조작·내비게이션·세계모델 AI 3종 세트

2026년 06월 17일 11시 38분
Blue smoke swirls creating abstract forms on a dark background, evoking a mysterious and dreamy atmosphere.
AI 모델·연구

LLM 대화 시스템, 사용자 특성 실시간 반영하는 적응형 정책 프레임워크 UP-NRPA 제안

2026년 06월 15일 11시 09분
Next Post
DS1 spectrogram: Risk Architecture for AI-Native Engineering Teams: An Organizational Framework for Agentic System Governance

AI 네이티브 조직의 리스크 관리, 기존 소프트웨어 프레임워크로는 한계

답글 남기기 응답 취소

이메일 주소는 공개되지 않습니다. 필수 필드는 *로 표시됩니다

  • 인기 급상승
  • 최신
Close-up of a GeForce RTX graphics card on a desk, showcasing its design and technology.

엔비디아 RTX 스파크 가격, 최소 2000달러 전망…윈도 노트북 ‘M1 모먼트’ 걸림돌

2026년 06월 02일 11시 19분
A 3D rendering of a neural network with abstract neuron connections in soft colors.

퍼플렉시티, 로컬·클라우드 AI를 자동 판단하는 하이브리드 추론 시스템 발표

2026년 06월 04일 08시 53분
Contemporary building with a glass facade and geometric patterns, low angle view.

앤트로픽·네이버 개발자 밋업 개최…서울 오피스 개소 앞두고 본사 임원 참석

2026년 06월 06일 21시 12분
Close-up of a wooden gavel on a judge's desk, symbolizing justice.

AI 생성 성인 콘텐츠 유료 판매 운영자들, 법원서 잇달아 징역형

2026년 06월 05일 22시 40분
책상에서 법률 문서에 서명하는 모습

클로드 ‘드리밍’ 기능 공개…앤트로픽, 법률·의료 AI 성능 대폭 향상

2026년 05월 30일 21시 11분
최찬욱 오토앤 대표 공식 인물 사진

오토앤 AX 바우처 선정, AI 커머스 운영 방식과 한계

2026년 08월 24일 20시 43분
아틀라시안 Team 24 무대에서 로보와 AI 협업을 설명하는 발표자

아틀라시안 로보, PDF 지시문 유출 시연과 대응 한계

2026년 08월 24일 19시 53분
노스 마이크로 비전 기술 글 공동 저자 데이비드 라우

코히어 North Micro Vision, 문서 이해 활용과 배포 한계

2026년 08월 24일 19시 38분
ACE 로보틱스 체화지능 시연에서 로봇 그리퍼가 신발을 집는 장면

ACE 로보틱스, 2027년 체화지능 전환점과 상용화 한계

2026년 08월 24일 19시 08분
대한민국 인공지능 윤리원칙 대토론회 참석자 단체사진

대한민국 AI 윤리원칙 확정, 153건 의견과 실천 기준

2026년 08월 24일 18시 33분

검색

No Result
View All Result

인기 태그

AI규제 AI반도체 AI보안 AI안전 AI에이전트 AI연구 AI인프라 AI정책 Anthropic arXiv AWS ChatGPT Claude Gemini HBM IPO LLM MCP NVIDIA OpenAI RAG SK하이닉스 강화학습 구글 데이터센터 마이크로소프트 멀티모달 메타 반도체 벤치마크 사이버보안 삼성전자 생성AI 생성형AI 스타트업 앤트로픽 에이전트 에이전틱AI 엔비디아 오픈AI 오픈소스 의료AI 자율주행 피지컬AI 피지컬 AI

카테고리

  • AI 모델·연구 (1,554)
  • AI 서비스·툴 (884)
  • 반도체·인프라 (623)
  • 빅테크·기업 (631)
  • 산업 적용 (529)
  • 스타트업·투자 (273)
  • 정책·윤리 (514)

STORIUM은 트렌드와 인사이트를 전하는 종합 뉴스 매체입니다. 정확성, 균형, 맥락의 편집 원칙으로 신뢰받는 뉴스를 전합니다.

카테고리

  • AI 모델·연구
  • AI 서비스·툴
  • 반도체·인프라
  • 빅테크·기업
  • 산업 적용
  • 스타트업·투자
  • 정책·윤리

태그

AI규제 AI반도체 AI보안 AI안전 AI에이전트 AI연구 AI인프라 AI정책 Anthropic arXiv AWS ChatGPT Claude Gemini HBM IPO LLM MCP NVIDIA OpenAI RAG SK하이닉스 강화학습 구글 데이터센터 마이크로소프트 멀티모달 메타 반도체 벤치마크 사이버보안 삼성전자 생성AI 생성형AI 스타트업 앤트로픽 에이전트 에이전틱AI 엔비디아 오픈AI 오픈소스 의료AI 자율주행 피지컬AI 피지컬 AI

최근 뉴스

최찬욱 오토앤 대표 공식 인물 사진

오토앤 AX 바우처 선정, AI 커머스 운영 방식과 한계

2026년 08월 24일 20시 43분
아틀라시안 Team 24 무대에서 로보와 AI 협업을 설명하는 발표자

아틀라시안 로보, PDF 지시문 유출 시연과 대응 한계

2026년 08월 24일 19시 53분
  • 소개
  • 문의
  • 광고문의
  • 개인정보처리방침
  • 이용약관
  • 청소년보호정책
  • 정정·반론 보도 안내
  • 편집·윤리강령

주소: 경기 고양시 덕양구 꽃마을로 66, 한일미디어타워 15층
상호: 스토리움 |  사업자등록번호: 579-27-02025 |  대표자: 이국환
발행·편집인: 이국환 |  청소년보호책임자: 이국환 |  발행일자: 2025.01.01
스토리움의 모든 콘텐츠는 저작권법의 보호를 받는 바, 무단 전재·복사·배포 등은 법적 제재를 받을 수 있습니다.
© 2026 STORIUM. All Rights Reserved.

No Result
View All Result
  • AI 모델·연구
  • 빅테크·기업
  • 반도체·인프라
  • 산업 적용
  • AI 서비스·툴
  • 정책·윤리
  • 스타트업·투자
  • 문의

주소: 경기 고양시 덕양구 꽃마을로 66, 한일미디어타워 15층
상호: 스토리움 |  사업자등록번호: 579-27-02025 |  대표자: 이국환
발행·편집인: 이국환 |  청소년보호책임자: 이국환 |  발행일자: 2025.01.01
스토리움의 모든 콘텐츠는 저작권법의 보호를 받는 바, 무단 전재·복사·배포 등은 법적 제재를 받을 수 있습니다.
© 2026 STORIUM. All Rights Reserved.