Daily Technical Tracking

每周科技追踪 · 2026-9-28

2026年9月28日(周一) · 技术 / 产品 / 公司

每日追踪
← 返回首页

昇腾成PyTorch官方首个中国硬件

PyTorch Conference China 2026 现场,昇腾成为 PyTorch 官方支持的首个中国硬件,中国算力正式深度融入 PyTorch 全球主流生态。更早的 7 月,PyTorch 官网已上线 Ascend NPU,开发者可以直接在官方渠道获取适配版本,这条路也从“第三方适配”走到“原生共治”、再走到“生态共建”。十天后的 9 月 17—19 日,PyTorch 基金会亚洲区总监李昊阳出席华为全联接大会 2026,昇腾与 PyTorch 再度同框——一边是旗舰大会上的技术成果集中亮相,一边是自有产业峰会展示规模化落地能力。

这场合作并非一次简单的技术适配。早在 2020 年昇腾两岁时,团队就开始向社区提交代码持续积累威望,同年正式加入 PyTorch 基金会。基金会当时的使命是孵化开源项目、实现技术普惠、推动多元硬件兼容,而让 PyTorch 跑在任何云、任何加速器正是其三大核心策略之一,与昇腾长期坚持的多架构适配路线高度吻合。华为多年参与国际开源社区的方法论被完整复制到 PyTorch 生态建设上:昇腾团队主动承担 AI 加速器集成工作组的推进,培养出一批社区核心 Reviewer 与核心成员,深度参与技术讨论,减少软件生态碎片化。2025 年起昇腾以 Out-of-Tree 形式提交插件完成硬件适配,2026 年拿到董事会席位与投票权,完整走完“代码贡献者—工作组参与者—董事会决策成员”的成长路径。

原生支持只解决“框架可以跑在硬件之上”,生态共建意味着厂商不再是被动适配者,而是深度参与技术定义、性能创新与标准共建,把经过大规模生产验证的能力回馈上游。最能说明这一跨越的是 PyTorch Conference China 2026 上演示的 HyperParallel:这套面向超节点设计的分布式加速库不再只是让 PyTorch 跑在昇腾上,而是深挖超节点统一内存编址、超大带宽、超低时延等硬件特性,通过超节点亲和 Module、FSDP2 零拷贝通信等技术,在训练 Qwen3-30B-A3B 模型的测试中把训练吞吐相较原生 PyTorch-FSDP2 提升超 200%,同时保证 loss 收敛一致,相关创新后续还将回馈上游社区。

开发者体验的改变来自 CI/CD。此前上游主干版本一更新就可能破坏硬件适配逻辑,科研人员与算法工程师要花大量时间定位底层 Bug;如今昇腾向社区贡献 2000 多张算力卡并接入官方开放流水线,7×24 小时对上游每一个 PR 做昇腾硬件自动化校验,兼容性问题在合并前就被提前识别解决,昇腾 CI 也从 L3 向 L4 持续演进,保证硬件特性跟随 PyTorch 大版本长期可用。Ascend for PyTorch 社区自 2026 年 5 月成立至今已汇聚超 1000 名贡献者,被定位为上游社区与本土落地之间的“缓冲带”:只在特定硬件与客户生产环境复现的问题、审核周期漫长的本土特性先在此快速响应,其中具备通用性的部分再抽象成通用 Patch 回流全球上游,形成“缓冲—抽象—回流”的机制。

生态规模上,昇腾已汇聚 462 万开发者、赋能 8.3 万个行业模型、与 90 余个主流开源社区建立合作,同时需要与 vLLM、SGLang、verl 等训练与推理框架协同,带动完整 AI 软件栈走向成熟。面向下一代场景,华为全联接大会 2026 发布了基于第三代光互连架构 NPO 的百万卡超级集群 Atlas 960 SuperPoD,昇腾 Atlas 950 SuperPoD 液冷超节点已正式商用,依托超大带宽、超低时延与统一内存编址为万亿模型训推提供算力底座,基金会也期待围绕超节点与超并行扩展开展更深协同。从 2020 年零星提交代码,到 2026 年成为 PyTorch 官方首个支持的中国硬件,靠持续贡献换话语权、以社区共治定义未来的路径,给其他中国 AI 加速硬件厂商提供了一份可参考的范本。