
欢迎阅读 PyTorch 基金会五月通讯。本月,我们将回顾“2026年 PyTorch 欧洲大会”的盛况,重点介绍来自成员单位的一些热门会议议题。我们还将关注 2.12 版本发布、近期活动、在线研讨会以及最新的技术博客。
公告
PyTorch 基金会大使项目现已开放提名。我们的大使项目旨在支持那些富有热情的社区领导者,通过教育、倡导和使用 PyTorch 进行构建,推动项目发展。大使们通过组织活动、创作教育内容、指导贡献者以及加强本地社区联系,帮助全球 PyTorch 基金会项目实现增长。我们特别鼓励来自非洲、拉丁美洲、中东、大洋洲、东南亚和东欧的贡献者申请,以持续扩大大使在更多地区和本地社区的代表性。有兴趣加入该项目吗?请在 6 月 18 日前提交申请。
近期活动

PyTorch 2.12 版本在编译、分布式系统、导出、图捕获以及加速器支持方面进行了重大更新。
加入 Andrey Talman、Alban Desmaison、Joe Spisak 以及主持人 Chris Gottbrath 的行列,时间为太平洋时间 5 月 20 日周三上午 10 点,参加版本技术概览及实时问答环节。立即注册 >>

5 月 18 日至 22 日,欢迎莅临 PyTorch 基金会 20 号展位,并参加 Matt White 的闪电演讲,了解 PyTorch 如何加速开源 AI。ExecuTorch 团队也在周二上午的“最佳论文会议”中展示了他们的获奖论文。🏆

在“通过 Helion 简化高性能便携式内核的编写”主题中,与会者将现场编写、自动调优并运行真实的 Helion 内核。活动将于 6 月 15 日至 19 日在科罗拉多州博尔德举行。

KubeCon + CloudNativeCon + OpenInfra Summit + 2026 PyTorch 中国大会
2026 PyTorch 中国大会将于 9 月 8 日至 9 日在上海举行,作为 KubeCon + CloudNativeCon + OpenInfra Summit + 2026 PyTorch 中国大会的一部分。
此次活动将汇集 OpenInfra、云原生和 AI 社区,旨在共同推进开源基础设施、机器学习以及跨行业场景的下一代 AI 发展。现已开放注册,完整日程将于 6 月公布。

2026 PyTorch 北美大会将于 10 月 20 日至 21 日在圣何塞举行。由 PyTorch 基金会主办的 #PyTorchCon 将汇集研究人员、开发者和工程师,通过涵盖完整 AI 堆栈的技术演讲、实操研讨会和主题演讲,共同探讨包括 PyTorch、vLLM、DeepSpeed 和 Ray 在内的 PyTorch 基金会项目。
请于太平洋夏令时间 6 月 7 日周日晚上 11:59 之前提交会议提案,并在 7 月 31 日前注册以获取早鸟优惠。
近期活动回顾
过去两周,我们举办了一场黑客松形式的社区活动,专注于完善 PyTorch 文档。我们很高兴看到如此高的参与度,因为优秀的文档是生产力的倍增器:它们能帮助新用户更快上手,帮助资深从业者正确使用高级功能,并缩短机器学习从研究到生产的路径。👉敬请关注后续的优胜者名单公布,在此期间,您可以查看排行榜。

我们在 2026 PyTorch 欧洲大会上举办了一些非常棒的会议,这证明了 PyTorch 基金会项目的强劲发展势头。请在下方查看 PyTorch 成员带来的部分精彩内容,并📹在会议播放列表中观看所有会议录像。
- Arm: 在 PyTorch 中优化 CPU 大语言模型推理:来自 vLLM 的经验教训 – Crefeda Rodrigues & Fadi Arafeh
- AMD: Brevitas 量化库 – Pablo Monteagudo Lago
- AWS: 闪电演讲:跨区域模型服务:PyTorch 推理、可观测性与 LLMOps – Suraj Muraleedharan
- Google: 闪电演讲:将 Google Colossus 引入 PyTorch:通过 fsspec 实现快速存储以保持 GPU 高负载 – Ankita Luthra & Trinadh Kotturu
- Hugging Face: torch.compile 与 Diffusers:性能峰值实操指南 – Sayak Paul
- IBM: 闪电演讲:TerraKit:标准化 AI 就绪的地理空间数据准备,服务于 TorchGeo 生态系统 – Rosie Lickorish & Romeo Kienzler
- Lightning AI: 利用 Torch.compile 进行模型变换 – Thomas Viehmann
- Meta: 在 Torch.compile 中通过 CUDA 流实现最先进的异步执行 – Michael Lazos
- Microsoft: 力作演示:大语言模型推理优化:从简单到复杂 – Christin Pohl
- NVIDIA: 开放且可扩展的大语言模型评估的科学与实践 – Grzegorz Chlebus
新闻报道
- PyTorch 基金会面临日益增长的压力,新任执行董事 Mark Collier 向我们讲述了他的工作重点, The Stack
- PyTorch 基金会扩展其 AI 技术栈,加入 Safetensors、ExecuTorch 和 Helion, The New Stack
最新博客

Meta: 使用 ExecuTorch MLX 委托在 Apple Silicon GPU 上运行 PyTorch 模型
ExecuTorch 新推出的 MLX 委托(Delegate)利用 Apple 的 MLX 框架,实现了在 Apple Silicon Mac 上进行 PyTorch 模型 GPU 加速推理。该实验性后端与 PyTorch 2 导出栈集成,在 macOS 上的吞吐量比现有的 ExecuTorch 委托提高了 3-6 倍。阅读更多 >>

vLLM, Meta, Inferact: vLLM 与 PyTorch 携手优化 aarch64 架构下的开发者体验
从 PyTorch 2.11 开始,在 aarch64 Linux 上执行 pip install torch 现可直接从 PyPI 安装支持 CUDA 的 wheel 包。此项更改消除了以往在 GH200、GB200 和 GB300 系统上所需的自定义索引和变通方案。阅读此处 >>

Arm: Arm CPU 和 NPU 上的高效边缘 AI:通过实操实验理解 ExecuTorch
这篇文章及配套实验介绍了跨 Cortex-A 和 Cortex-M + Ethos-U 平台的 CPU 和 NPU 推理,并展示了如何使用 Arm 开发的 Model Explorer 适配器,以直观查看 ExecuTorch 的模型部署情况。阅读更多 >>

IBM: IBM Research 在其 RITS 平台的核心中使用 vLLM
本博客探讨了研究推理与调优服务 (RITS) 平台,该平台提供模型推理端点和“辅助”调优服务端点的集中式部署与共享访问功能。阅读更多 >>

SSAIL 实验室 (伊利诺伊大学厄巴纳-香槟分校), Anyscale, Snowflake: AutoSP 介绍
了解 AutoSP 如何自动将标准 Transformer 训练代码转换为序列并行 (Sequence-Parallel) 代码,从而实现跨多 GPU 的长上下文大语言模型训练。阅读更多 >>

Lightseek 基金会: SMG —— 大语言模型服务中 CPU 与 GPU 解耦的案例
了解 Shepherd Model Gateway (SMG) 的设计初衷:GPU 应专注于张量数学运算,其余任务均应归于专用的服务层。阅读更多 >>

Meta: 内核内广播优化:针对推荐系统推理的内核协同设计
传统的推荐系统推理会显式地为每个候选者复制共享的用户嵌入/序列。内核内广播优化 (IKBO) 通过一种内核-模型-系统协同设计,将广播逻辑直接融合到用户-候选者交互内核中,从而消除了此类开销。阅读此处 >>
订阅PyTorch通讯
直接接收更新到您的收件箱:https://pytorch.ac.cn/newsletter/


