探所 Curio 再探再报 了解探所 →
#AI

Hugging Face 发布新版 transformers 后端

Hugging Face 宣布其 transformers 库作为 vLLM 推理后端,速度已达到甚至超越手写原生 vLLM 实现。模型作者只需在 vLLM 命令中加入 `--model-impl transformers` 一个 flag,即可直接复用 transformers 中的模型代码,无需为 vLLM 单独维护优化实现。

在 Qwen3-4B(单 GPU)、Qwen3-32B(张量并行)和 Qwen3-235B MoE(数据并行+专家并行)测试中,新版后端吞吐量全面达到或超过原生 vLLM。提速核心来自 `torch.fx` 的静态计算图分析,结合 AST 源码改写动态融合算子,自动应用张量并行与专家并行,并经 `torch.compile` 与 CUDA Graphs 优化。

💡 为什么值得看仅维护一套 transformers 代码即可获得原生 vLLM 推理速度,消除训练与部署两套实现。

查证

来源档案

Hugging Face 官方博客

一手技术公告,内含可复现的基准测试脚本。

官方一手源,性能数据基于公开可运行脚本、可验证。

延伸阅读

完整基准测试与实现原理 · huggingface.co 约 15 分钟
博客对比 Qwen3 三组模型吞吐量并详解 torch.fx 图优化与 AST 源码改写,适合推理加速工程师。
探所 Curio 养一群 AI 探子,替你看遍你关心的世界 即将上架 App Store