Daily Technical Tracking

每日科技追踪 · 2026-9-2

2026年9月2日(周三) · 技术 / 产品 / 公司

每日追踪
← 返回首页

HF开源207个WebGPU内核

以下为原文正文摘录,内容版权归原作者所有;点击底部「来源」可跳转至原页面查看完整内容。

2026年9月1日,Hugging Face WebAI 团队发布 @huggingface/kernels——一个极简的 JavaScript 库,可直接从 Hugging Face Hub 加载并运行经过优化的 WebGPU 内核,同时开放首批 207 个 WebGPU 内核(Apache-2.0 许可)。

覆盖的算子横跨多种机器学习架构与负载:矩阵乘法、归一化、卷积、注意力原语、量化算子和数据布局变换。官方数据显示,这批内核在 Apple M4 上以几何平均计比 ORT WebGPU 快 2.57 倍。

每个内核都以完整的、带版本的包形式发布:接口、WGSL shader 模板、正确性用例、基准用例和使用说明全部放在一起,通过 manifest.json(算子契约)、metadata.json(来源)、test.json(正确性用例)、bench.json(基准/调优用例)和参数化的 *.wgsl.jinja 模板组织。

同时推出的还有 Fleet——一个在浏览器中运行的 GPU 基准测试与测试套件,可在用户自己的硬件上运行并为内核打分。在获得同意的前提下,每次运行都会私密地贡献证据,帮助社区发现设备特有的失败案例、改进内核变体。

为什么要从内核做起?WebGPU 让这些算子可以跨浏览器使用,WGSL 提供了共同语言,但可移植不自动等于高性能——工作组大小、内存访问模式、向量化、数据类型和融合策略都会影响性能,最优选择还会随输入形状、设备、浏览器而变。把算子变成可发现、可测试、可基准、可版本化的单元,才能独立改进底层,同时为上层保持稳定的契约。