Hugging Face가 7월 8일 Transformers 모델 코드를 vLLM에서 실행하는 모델링 백엔드의 성능 개선을 공개했다. 호환되는 모델은 별도 vLLM 전용 구현을 작성하지 않아도 –model-impl transformers 플래그로 실행할 수 있다. Hugging Face는 이번 버전이 여러 LLM 구조에서 수작업 네이티브 구현과 같은 수준 또는 더 높은 처리량을 냈다고 밝혔다.
비교에는 Qwen3 계열 3종이 쓰였다. 4B 밀집 모델은 단일 GPU, 32B 밀집 모델은 GPU 2장의 텐서 병렬, 235B 파라미터 FP8 혼합전문가 모델은 H100 8장 노드의 데이터·전문가 병렬 조건에서 측정됐다. 세 조건 모두 Transformers 백엔드가 vLLM 네이티브 구현의 처리량을 충족하거나 상회했다는 것이 회사 측 결과다.

새 백엔드는 torch.fx로 모델 그래프를 정적 분석해 알려진 패턴을 찾고, 추상 구문 트리로 일부 연산을 바꾼다. 전문가 병렬화에 쓰는 융합 연산과 MergedColumnParallelLinear, QKVParallelLinear 같은 vLLM 커널에 연결한다. 디코더 블록 구조를 식별할 수 있으면 텐서 병렬과 파이프라인 병렬 계획도 추론한다.
변경된 모델은 전용 vLLM 구현처럼 torch.compile과 CUDA Graphs를 사용할 수 있다. Transformers 모델 코드는 학습, 평가, 강화학습 롤아웃에도 재사용할 수 있어 학습과 서빙 사이의 별도 포팅 작업을 줄이는 방향이다. 실제 실행에는 최신 vLLM 패키지와 호환되는 Transformers 모델 구현이 필요하다.
| 시험 모델 | 하드웨어·병렬 조건 | 발표 결과 | 제한 |
|---|---|---|---|
| Qwen3-4B | 단일 GPU | 네이티브 처리량 충족·상회 | 공개 시험 조건 |
| Qwen3-32B | GPU 2장 텐서 병렬 | 네이티브 처리량 충족·상회 | 공개 시험 조건 |
| Qwen3-235B-A22B FP8 | H100 8장·데이터+전문가 병렬 | 네이티브 처리량 충족·상회 | 공개 시험 조건 |
| 지원 구조 | Transformers 450+ 구조 | 모두 자동 지원 의미 아님 | 선형 어텐션 미지원 |
자료: STORIUM 정리
지원에는 분명한 제한이 있다. 선형 어텐션을 쓰는 모델은 현재 지원되지 않으며, 코드가 Hub 저장소에만 있는 사용자 정의 모델은 요구 형식에 맞지 않아 작동하지 않을 가능성이 크다. 성능 주장도 공개된 세 Qwen3 구성과 회사가 제공한 재현 스크립트에 따른 결과로, 모든 모델과 하드웨어의 속도를 보장하지 않는다.
Transformers는 450개가 넘는 구조를 지원하지만 그 수가 곧바로 vLLM 최적화 호환 모델 수를 뜻하지는 않는다. 도입자는 같은 배치 크기, 입력·출력 길이, 병렬화 설정과 하드웨어에서 처리량과 메모리를 다시 측정해야 한다. 이번 발표는 호환 모델의 포팅 비용을 줄이면서 네이티브 속도에 접근한 기술 업데이트로 범위를 한정해 볼 필요가 있다.
저작권자 © STORIUM 무단전재 및 재배포 금지














