博客社区

PyTorch Day China 回顾

作者 2025年8月12日2025年9月4日暂无评论

2025年6月7日,PyTorch中国日(PyTorch Day China)在北京举行,由PyTorch基金会与北京智源人工智能研究院(BAAI)共同主办。本次会议为期一天,共包含16场演讲,平均每场参会人数达160人。欢迎点击查看YouTube完整播放列表,探索您感兴趣的议题。

PyTorch基金会执行董事Matt White发表了演讲,分享了PyTorch基金会在加速开源AI方面的承诺。自两年前成立以来,该基金会已发展至30个成员单位,并演变为一个能够托管PyTorch核心之外开源项目的伞形基金会。vLLM和DeepSpeed成为了首批加入该基金会的项目,智源研究院的开源项目FlagGems也加入了PyTorch生态系统。旨在支持本地社区发展的PyTorch大使计划(PyTorch Ambassador Program)在一个月内收到了超过200份申请。Matt还介绍了全新的PyTorch网站,以及PyTorch大会和开源AI周(Open Source AI Week)的日程安排。他提到了基金会即将推出的举措,包括讲师团(Speaker Bureau)、大学合作和培训认证等,并对与会者表示感谢,同时也对当天的演讲充满期待。

2. 在多样化AI芯片上运行大模型:PyTorch + 开源堆栈(FlagOS)实现架构无关部署

北京智源人工智能研究院副院长林咏华讨论了在大模型在多样化AI芯片上运行的现状。她解释了构建统一开源系统软件堆栈的原因:大模型面临着高成本、海量资源需求以及昂贵的训练/推理等挑战,而全球碎片化的AI加速器生态系统则带来了额外的问题。随后,她介绍了由智源研究院联合多家合作伙伴共同开发的FlagOS,包括其核心组件和关键工具,支持多种底层芯片和系统部署架构,以及多种大模型。该系统已获得多种架构的支持,并在算子效率和兼容性方面表现出色。最后,她呼吁更多团队参与到这一开源生态系统的建设中来。

3. 深入探索Hugging Face Hub:在第一大AI中心分享您的模型权重(拥有超过70万个PyTorch模型)

来自HuggingFace的王铁震介绍了Hugging Face Hub,这是一个常被称为“AI领域的GitHub”的开源AI社区。它托管了大量的开源模型和数据集,并拥有多样的功能:用于轻松测试模型的Spaces、内核、API提供商网关、社交沟通功能以及与开源相关的指标。其模型库提供便捷的流行度和任务筛选功能,并设有展示各类热门模型的趋势页面。每个模型都有专门的页面,展示模型卡片、代码和结构化数据。对于数据集,它支持git仓库、提供可视化和SQL查询功能,并提供强大的编程接口。

4. verl:用于智能体任务的开源大规模大语言模型强化学习框架

来自字节跳动的仝宇轩介绍了verl,这是一个开源的大规模大语言模型强化学习框架。他首先强调了大规模强化学习的重要性,它显著提升了语言模型的性能,并在现实任务中具有广泛应用。然而,它面临着复杂数据流(涉及多个模型、阶段和工作负载)、分布式工作负载以及平衡数据依赖与资源限制等挑战。Verl的优势在于平衡了灵活性与效率:它通过单控制器范式实现了编程的灵活性,使得核心逻辑可以用最少的代码来描述并支持多种算法,同时它还具有一个混合引擎来优化资源利用率。该框架拥有一个活跃的开源社区,已构建了多个受欢迎的项目。最后,他分享了社区的未来路线图,并欢迎新成员的加入。

5. 中国的PyTorch:社区成长、本地化与互动

来自华为的宗泽胜讨论了PyTorch社区在中国的现状。作为全球流行的框架,PyTorch在中国拥有大量贡献者,数量位居全球前列。为了解决初学者缺乏本地化资源的问题,他们翻译了PyTorch官方网站,建立了社区主页,并翻译了从入门到进阶的教程。他们还通过聊天频道(去年底建立)积极与用户互动,发布了60多篇技术博客,并拥有了2,500名订阅者。未来的计划包括进一步实现翻译自动化,提供更多高质量资源和活动,并邀请用户参与其中。

6. AI开源的发展及其对AI生态系统的影响

CSDN高级副总裁兼Boulon技术专家李建忠分享了对AI开源发展及其对AI生态系统影响的见解。他对比了全球与中国的AI技术生态,指出中国AI开源在全球的影响力正日益提升,并将AI的发展与地球生物智能的进化进行了类比。随后,他讨论了推理模型的发展,这些模型使大模型能够“慢思考”,减少对训练语料中弱推理信号的依赖,而强化学习中机器合成的数据发挥了关键作用。他分析了开源对生态系统的影响,包括大幅降低模型训练和推理成本,并推动AI应用向具备规划、协作和行动能力的智能体方向演进。

7. torch.accelerator:面向流式加速器的统一、设备无关的运行时API

来自英特尔的于广业介绍了PyTorch 2.6中推出的torch.accelerator API,这是一个用于流式加速器的统一、设备无关的运行时API。虽然广泛使用的机器学习框架PyTorch支持各种加速硬件,但现有的运行时与特定的设备模块耦合(例如,`torch.cuda.current_device`仅适用于CUDA设备),这限制了代码的可移植性,并为集成新后端的硬件供应商带来了挑战。PyTorch 2.5引入了加速器的概念,2.6提出了统一的设备无关运行时API,其功能与现有的设备特定API紧密映射,以最大限度地减少代码迁移带来的变更。未来的计划包括增加与内存相关的API和通用单元测试。他最后感谢了社区和贡献者所做的改进。

8. vLLM:为每个人提供简单、快速且低成本的大语言模型服务

来自清华大学的尤开超介绍了vLLM,旨在为每个人提供可访问、快速且负担得起的大语言模型推理服务。该项目于2023年6月开源,备受关注,GitHub星标近4.83万。它使用简便,支持离线批量推理和与OpenAI兼容的API服务器,并适用于多种模型类型。作为大型语言模型公司的官方合作伙伴,它支持模型发布后的即刻部署。vLLM支持多种硬件,探索基于插件的集成,并被用于日常生活和企业应用中。它通过安装包、Docker镜像、预编译的wheel和健全的持续集成系统优先考虑用户体验。最后,他感谢了vLLM社区的1,100多名贡献者。

9. 基于torch.fx的torch_musa赋能压缩工具包

来自摩尔线程的莫凡介绍了torch_musa,这是一个PyTorch插件,使PyTorch能够在摩尔线程平台上原生运行,并提供高度优化的特性和算子。随后,他详细介绍了压缩工具包,解释了选择FX的原因(可调试、易于修改图、易于集成)。其工作流程包括输入模型和配置文件,在追踪阶段捕获完整的模型图,并通过后端进行优化/精简。他还涵盖了定制化优化和对多种数据类型的支持。未来的工作包括使大型语言模型和视觉模型可追踪,加速推理并构建容错系统。

10. 字节跳动视频生成基础模型的高效训练

来自字节跳动的张恒分享了字节跳动在视频生成基础模型的大规模、高性能训练方面的经验,包括在广告、电影和动画中的应用。他介绍了视频生成模型的结构(VE编码、MMDIT扩散、VE解码)和训练过程(分阶段训练,通过VE编码离线以优化存储和预处理)。他还讨论了视频生成模型中负载不均衡的挑战及相应的解决方案。

11. torch.compile在不同场景下的实践与优化

来自阿里云的严亦晨分享了团队在`torch.compile`实践和优化方面的经验。`torch.compile`通过图捕获、fallback处理和优化内核生成等组件,仅需一行代码即可加速模型,但在生产环境中面临挑战。为了应对这些挑战,团队解决了Dynamo与DeepSpeed ZeRO/梯度检查点之间的兼容性问题,并向相关库提交了集成方案;通过模式匹配识别并重写了注意力计算模式,以实现更好的融合和性能;并优化了输入对齐以减少不必要的重编译。他还提到了尚未解决的问题和未来方向:动态形状的编译策略、启动延迟优化、降低开销以及改进内核缓存机制。

12. PyTorch生产环境:在昇腾NPU上加速LLM训练与推理

来自华为的李佳威和李晶介绍了昇腾NPU(torch_npu)在PyTorch生态系统中的进展。他们重点介绍了PyTorch的上游多样性支持,解释了第三方设备集成机制:使用基于CPU的模拟后端OpenRag作为测试后端来监控接口功能,并为下游硬件供应商建立机制,在社区PR合并前识别风险。

李晶分享了昇腾NPU的性能和生态支持。他介绍了torch_npu的高性能和高可靠性架构。目前已支持包括vLLM、torchtune、torchtitan等在内的20多个热门库。他还解释了torch_npu与NPUGraph和torch.compile协同工作的机制,以提供高性能计算。最后,他邀请大家加入社区并参加定期会议。

13. Hetu-Galvatron:用于高效大规模基础模型训练的自动分布式系统

来自北京大学的刘新毅和王玉洁详细介绍了Hetu-Galvatron,这是一个基于PyTorch的创新系统,具有自动优化、通用性和用户友好等关键特性。在模型转换方面,它构建于原生PyTorch之上,通过替换支持张量和同步比较的层,将单GPU训练模型转换为支持多并行的模型。在自动优化方面,它拥有基于成本模型和搜索算法的引擎。它支持多种模型架构和硬件后端,确保通过PyTorch与GPU和NPU集成。它在不同的集群和模型上展示了卓越的效率,并经受住了性能和准确性的验证。未来的计划包括集成torch FSDP2,支持更多的并行策略、更多的模型和注意力类型,以及优化训练后工作流。

14. 英特尔的PyTorch之旅:提升AI性能与优化开源软件

来自英特尔PyTorch团队的马明飞介绍了英特尔在PyTorch方面的工作。针对PyTorch在英特尔GPU上的优化,英特尔提供了对Linux和Windows的支持,涵盖运行时、算子支持、`torch.compile`和分布式训练。在`torch.compile`的CPU后端优化方面,团队参与了架构设计,扩展了数据类型支持,实现了gemm模板的自动调优,支持Windows,并持续提升性能加速比。针对DeepSeek 671B全量性能优化,团队完成了CPU后端开发并实现了显著的加速(预填充阶段性能提升14倍,解码阶段提升2.9倍),支持多种数据类型,以低成本满足实时性要求。

15. FlagTree:面向多样化AI芯片的统一AI编译器

来自北京智源人工智能研究院的门春雷介绍了FlagTree,这是一个支持多种AI芯片的统一AI编译器,也是FlagOS开源堆栈的关键组件。由智源研究院联合多家合作伙伴开发的FlagOS包含FlagGems(通用大模型算子库)、FlagCX(多芯片通信)以及并行训练/推理框架,支持大模型训练和推理。他还介绍了FlagTree用于多后端集成的架构,以及开发中的特性:基于注释的编程范式、重构的Triton编译器运行时等,相关优化带来了显著的性能提升。

16. KTransformers:释放MoE模型CPU/GPU混合推理的全部潜能

来自清华大学的张明星博士介绍了KTransformers(Quick Transformers),这是一个基于HuggingFace Transformers的库,旨在通过优化的算子集成和数据布局策略,释放MoE模型在CPU/GPU混合推理上的潜能。最初作为集成各种算子优化的灵活框架而设计,它解决了因模型规模增大和上下文加长而导致的推理成本上升问题。针对低吞吐量和并发场景,它通过将计算密集部分卸载到GPU,将稀疏部分卸载到CPU(针对DeepSeek等模型定制),实现了灵活的配置,降低了模型运行的门槛。未来重点包括注意力层稀疏化、增加本地微调以及维护用于分布式推理的Mooncake项目,欢迎社区交流。

17. SGLang:一种高效的大规模大语言模型推理开源框架

来自上海交通大学的研究生尹良胜介绍了SGLang,这是一种高效的大规模LLM推理开源框架。作为一款性能领先、设计优雅、轻量且可定制的开源引擎,它已被学术界以及微软、AMD等公司采用,并提供高性能RL解决方案。其核心是PD解耦设计,解决了非解耦模式下存在的延迟、计算-通信不平衡以及调度不兼容的问题。它通过负载均衡器路由请求,实现了预取实例与解码实例之间的KV缓存传输。未来的计划包括延迟优化、支持更长序列以及集成数据并行注意力机制。该项目目前已有超过400名贡献者,并被多家企业使用。