摘要
- ExecuTorch 实现了 PyTorch 模型向边缘设备(移动端、嵌入式、桌面端)的无缝、生产级部署,无需进行格式转换或重写,并支持广泛的硬件后端和模型类型。
- ExecuTorch 1.0 版本提供了更广泛的硬件支持(涵盖 CPU、GPU 和 NPU)、更高的生产环境稳定性以及强大的模型兼容性。
- ExecuTorch 完全开源,已在社区的实际应用中落地,加速了数十亿用户端侧 AI 的创新与采用。
端侧 AI 部署将机器学习能力直接引入用户设备,无需依赖云端即可实现快速、实时的响应。这种方法通过将数据保留在本地提高了隐私性,并支持在离线状态下运行的个性化体验和功能。传统的端侧 AI 示例包括在移动设备上运行计算机视觉算法进行照片编辑和处理。然而,近期得益于硬件和 AI 模型的进步,新的应用场景迅速增长,例如由智能大语言模型(LLM)驱动的本地代理,以及可穿戴设备和智能眼镜中的环境 AI 应用。
然而,在将这些新颖模型部署到移动、桌面和嵌入式等端侧生产环境时,模型通常需要转换为其他格式和运行时。目前,这些转换可以通过针对 ONNX 或 TFLite 等格式的转换脚本来完成,或者使用 C++(如 llama.cpp)或 MLX 等不同语言彻底重写模型。这些转换对于机器学习工程师来说既耗时,又往往因转换过程中的数值偏差和调试信息丢失而成为生产部署过程中的瓶颈。随着模型复杂度的增加,使用 C++ 等语言重写模型也带来了挑战。起初,当 LLM 架构主要是标准的文本 Transformer 时,这样做相对可行;但如今,随着多模态和推理模型的出现,模型变得越来越复杂。对于多模态 LLM 而言,能够轻松替换和集成图像、音频及其他模态的编码器等通用解决方案和组合模块化骨干组件的能力,在今天显得尤为重要。
我们推出了 ExecuTorch 1.0,这是一个旨在帮助开发者构建针对边缘设备优化的新型 AI 应用的框架。ExecuTorch 完全开源,已做好准备迎接下一代端侧 AI 应用场景日益增长的需求,在边缘侧实现更智能、更快速、更注重隐私的体验。
ExecuTorch 是一款通用的、完全开源的 PyTorch 原生解决方案,专为移动端、嵌入式和桌面设备设计,支持 iOS、Android、嵌入式设备及笔记本电脑(即 AI PC)等平台。它使开发者能够获取来自任何领域的 PyTorch 模型——无论是大语言模型(LLM)、视觉语言模型(VLM)、图像分割、检测、音频等——并将其直接部署到边缘设备,无需转换为其他格式或重写模型。
在部署过程中,ExecuTorch 使用 PyTorch 原生方式将模型转换为稳定且紧凑的表示形式,从而实现高效的端侧部署,确保原始模型与部署模型之间的偏差降至最低,保持准确性和性能。同时,它保持了灵活性和模块化,允许开发者根据需要组合和自定义骨干组件,这对于多模态 LLM 尤为重要。此外,开发者可以在 ExecuTorch 中使用相同的工作流程,使模型能够在各种后端(DSP、CPU、GPU 和 NPU)和多种硬件形态(如微控制器、手机、笔记本电脑)上运行。
简而言之,ExecuTorch 显著降低了生产部署所需的时间和复杂性,消除了常见的瓶颈和调试挑战。
ExecuTorch 1.0 版本
目前,PyTorch 被研究人员广泛用于开发新模型。我们在 2024 年 10 月发布了 ExecuTorch Beta 版本,在开发者 API 和运行时特性方面提供了稳定性。从那时起,我们一直致力于提升可靠性、稳定性和性能。以下是 1.0 版本带来的更新:
- 加速器覆盖范围:在覆盖范围方面,我们增加了新的后端——Arm VGF、恩智浦(NXP)的 eIQ® Neutron NPU、三星 Exynos NPU、Exynos GPU 以及 英特尔 OpenVINO,进一步扩充了后端阵容。这些后端加入了我们现有的 alpha 和 beta 阶段后端,如 Cadence DSP、联发科 NPU 和 Apple Metal Performance Shaders (MPS)。
- 加速器稳定性:由于在稳定性和可靠性方面的改进,以下后端已从 beta 阶段晋升为生产就绪状态,您可以放心地在生产环境中使用它们。
- 带有 Arm Kleidi 的 XNNPACK(用于 CPU 加速)
- 用于 Apple 芯片的 Apple Core ML
- 带有 ExecuTorch 代理的 Qualcomm® AI Engine(用于 Qualcomm® Hexagon™ NPU)
- Arm Ethos-U NPU
- Vulkan GPU
- 模型覆盖。我们已经在传统的 AI 用例(如目标检测、深度感知、OCR、语音识别 (ASR)、图像分割等)以及端侧文本 LLM 和多模态 LLM(如用于音频-文本输入的 Voxtral 和图像-文本输入的 Gemma3)上验证了 ExecuTorch(及相关后端)。我们与 Hugging Face 合作,使其能够轻松导出并运行 HF transformers 上的各种模型。
有关 ExecuTorch 的完整功能列表,请参阅我们的 1.0 版本发布说明,技术文档请查看 后端概览。
最后,对于希望探索我们 主分支最新功能 的开发者,我们很高兴地分享,ExecuTorch 现在可以嵌入到原生的 C++ 桌面和笔记本应用程序中,并利用计算机上的 CPU、GPU 和 NPU。虽然仍处于早期阶段,但得益于 ExecuTorch 的灵活性及其对模型和硬件后端的广泛支持,这对那些为消费级桌面和笔记本电脑构建应用(如生产力工具和保护隐私的个人助理)的开发者来说,尤为令人兴奋。
ExecuTorch 成功案例
如今,ExecuTorch 已被多家公司应用于生产,并集成到主流的开源框架和生态系统中。Meta 的技术博客最近重点介绍了由 ExecuTorch 驱动的一些端侧 AI 功能,这些功能正在为 Instagram、WhatsApp、Messenger 和 Facebook 的数十亿用户提供服务。查看以下关于 ExecuTorch 如何为当今 AI 社区创造实实在在价值的一手感言:
“Meta 的 Reality Labs 已将 ExecuTorch 应用于我们的可穿戴设备生产线——包括最新的带有肌电(EMG)带的 Meta Ray-Ban 智能眼镜。通过利用尖端硬件,语音识别、动作感测和计算机视觉等高级 AI 功能得以在这些设备上运行。ExecuTorch 帮助我们突破了可能性的边界,并通过 PyTorch 的标准化加快了从研究到生产的进程。其开源基础加速了创新,使得集成来自硬件合作伙伴和研究社区的贡献变得轻而易举。因此,我们正在为数百万用户提供更智能、更快速、更个性化的体验。”
- Anuj Kumar,Meta Reality Labs 总监
“如今 Hugging Face 上有超过 75 万个 Transformer 模型。这为将创新引入边缘侧并推动环境智能革命带来了巨大机遇。我们很高兴看到托管在 Hugging Face transformers 上的模型现在可以轻松导出到 ExecuTorch。目前,Hugging Face 上超过 80% 下载量最高的、适合边缘侧的大语言模型都可以直接在 ExecuTorch 上运行。对于多模态应用,支持范围正在迅速扩大,包括多个流行的视觉模型(如 Gemma3、SmolVLM 和 LLaVA)和音频模型(Voxtral、Granite 等)。这极大地拓展了端侧创新的可能性!”
- Lysandre Debut,Hugging Face 首席开源官
“在 PyTorch 中直接进行微调和量化,在 Python 中进行实验和评估,并将确切的量化模型导出到设备上运行,这对开发者来说具有革命性意义。它允许 Unsloth 团队在技术和方案上进行更多创造。对于 Unsloth 用户来说,ExecuTorch 是边缘部署的绝佳途径!”
- Daniel Han,Unsloth AI 联合创始人
“为什么我们在 LFM2 模型系列中使用 ExecuTorch?原因有二:1)灵活性。无论是支持 Liquid AI 的自定义模型架构还是前/后处理代码,它都允许我们的研究团队自由实验新模型,而无需给推理运行时增加额外负担。2)性能。ExecuTorch 提供的 PyTorch 图状态跟踪和缓存功能减少了推理时的 Token 生成时间,并降低了延迟。“
- Mathias Lechner,Liquid AI 首席技术官
“Voxtral 将音频和文本处理统一在一个多模态架构中,而要在设备上高效部署它,需要对执行过程和硬件利用率进行精确控制。ExecuTorch 的 PyTorch 原生运行时使我们能够直接运行 Voxtral——无需格式转换——同时有效地定位 GPU、NPU 和 CPU 后端,以实现低延迟、高保真的端侧推理。“
- Timothée Lacroix,Mistral AI 首席技术官
更多生态集成和采用案例,请参阅 ExecuTorch 成功案例页面。
行动号召
我们诚邀各地的开发者深入体验 ExecuTorch,尝试代码并分享您的反馈,以帮助塑造其未来!请通过 ExecuTorch 代码库 开始探索,并阅读我们详尽的 文档。
致谢
ExecuTorch 是众人拾柴的成果,其中包括(按字母顺序排列):
[PyTorch Edge] Cagatay Bilgin, Manuel Candales, Gregory Comer, Digant Desai, Tanvir Islam, Songhao Jia, Stephen Jia, Abhinay Kukkadapu, Chen Lai, Mengwei Liu, Mergen Nachin, Kimish Patel, Siddartha Pothapragada, Lucy Qiu, Scott Roy, Anthony Shoumikhin, Jacob Szwejbka, Scott Wolchok, Jack Zhang, Hansong Zhang
[编译器] Yanan Cao, Avik Chaudhuri, Zhengxu Chen, Tugsuu Manlaibaatar, Yidi Wu, Angela Yi, Shangdi Yu
[AO] Andrew Or, Supriya Rao, Jerry Zhang
[开发基础设施] Huy Do, Andrey Talman, Eli Uriegas
[其他]: Stefano Cadario, Andrew Caples, Matthias Cremon, Alban Desmaison, Soumyadeep Ghosh, Chris Gottbrath, Min Guo, Harshit Khaitan, Svetlana Karslioglu, Ji Li, Dulin Riley, Nikita Shulga, Joe Spisak, Jake Stevens, Vivek Trivedi, Shen Xu
[校友]: Raziel Alvarez, Dave Bort, Xingying Cheng, Salil Desai, Michael Gschwind, Lunwen He, Tarun Karuturi, Jack Khuu, Ali Khosh, Olivia Liu, Max Ren, Orion Reblitz-Richardson, Varun Puri, Jathu Satkunarajah, Jesse White, Martin Yuan, Guang Yang, Chakri Uddaraju
[合作伙伴]: Apple, Arm, Cadence, Intel, MediaTek, NXP, Qualcomm, Samsung