2025年8月2日,腾讯北京总部举办了一场大模型推理领域的盛会——vLLM 北京聚会。共有 260 名开发者、工程师和行业专家齐聚一堂,共同见证了 vLLM 生态的快速成长及其在实际应用中的强大能力。
本次聚会内容丰富。来自 vLLM 核心团队的专家,携手腾讯、华为、蚂蚁集团、字节跳动、月之暗面(Moonshot AI)和小米等领先科技公司的代表,分享了前沿实践和突破性进展。他们的演讲清晰而深刻地展示了 vLLM 的核心优势:高效、灵活和可扩展性。

聚会亮点
1. vLLM 概览与最新进展

vLLM 核心维护者游凯超全面概述了该项目的发展历程,重点介绍了其核心技术和最新进展。他展示了 vLLM 在大规模分布式推理、多模态支持、更精细的调度策略以及扩展性方面的突破。他还规划了未来的路线图,重点关注极致性能优化、更广泛的硬件支持以及更丰富的生态工具链,为活动开启了深入的技术探讨。
2. vLLM 的 PD 分离:腾讯推理框架中的实践与探索
腾讯专家张超分享了基于 vLLM 构建的深度定制化 PD(预填充-解码,Prefill-Decode)分离框架。通过解耦计算关键路径,该方案显著提升了推理效率。它已在腾讯的多个业务场景中实现大规模部署,为高并发大模型服务提供了可复用的企业级推理框架。
3. vLLM Ascend:昇腾在大规模分布式推理和强化学习中的实践

vLLM Ascend 项目组的专家王希元和温杰分享了他们在 vLLM 适配昇腾(Ascend)AI 硬件平台方面的深入工作。他们首先介绍了 vLLM Ascend 项目过去几个月取得的成就——包括在功能支持、版本发布、软件质量和推理性能方面的重大改进。

随后,他们展示了如何利用昇腾芯片的独特能力来优化 vLLM 以进行大规模分布式推理,并以 DeepSeek 大规模 EP 场景为例进行了分析。得益于 vLLM 强大的跨平台适应性,vLLM Ascend 为在昇腾硬件上部署大模型提供了一种高效的解决方案。
4. 10 倍性能飞跃:DeepSeek 推理的关键优化路径


蚂蚁集团基础设施团队的工程师陈文刚和郑守坚深入探讨了提升 DeepSeek 推理性能 10 倍的关键优化策略,详细拆解了他们的方法。从 GPU 显存优化策略到延迟降低技术,从单机多模型部署实践到 PD 分离架构的应用。此次演讲是一份极具实用价值的性能调优指南,为社区提供了宝贵的见解。
5. AIBrix v0.4.0 预览:更高效、更具成本效益的大规模推理控制平面

字节跳动 GPU 基础设施工程师谭建南基于字节跳动丰富的线上工作负载实践,深入剖析了 AIBrix 如何解决大规模模型推理中平衡效率与成本的核心难题。他强调了 AIBrix 与高性能 vLLM 推理引擎之间的紧密集成,这不仅提高了推理效率,还显著降低了资源成本,为行业高效部署大模型服务提供了创新且实用的方法。
6. Kimi K2 训练与推理最佳实践

来自月之暗面(Moonshot AI)的何伟然分享了 Kimi K2 模型在严格的服务等级目标(SLO)要求下运行的实战经验,平衡了高并发在线推理与强化学习(RL)训练的需求。他重点介绍了针对不同硬件资源和工作负载限制进行优化的协同架构和关键部署策略。
7. vLLM 中通过点对点 NCCL 实现的原生 PD 分离

小米 AI 基础设施工程师邓中华深入介绍了利用点对点(P2P)NCCL 通信实现的本地 PD(预填充-解码)分离方案。他详尽解释了该架构在 vLLM 中的设计原则和关键突破。结合实际部署案例,他详细说明了所实现的显著性能提升,为 vLLM 开源生态系统的协作提供了宝贵思路。
随着核心功能的持续增强、硬件生态的不断扩大,以及控制平面和部署方案的日益成熟,vLLM 正成为推动大模型落地应用、赋能各行各业的坚实基石。我们期待在下一次聚会上,见证 vLLM 生态更加耀眼的增长!
