Daily Technical Tracking

每日科技追踪 · 2026-9-2

2026年9月2日(周三) · 技术 / 产品 / 公司

每日追踪
← 返回首页

腾讯混元开源Hy4轻量版

以下为原文正文摘录,内容版权归原作者所有;点击底部「来源」可跳转至原页面查看完整内容。

腾讯混元把 Hy4 preview 的权重从接近 1.5TB 压缩到约 214GB,大幅降低运行这一模型的硬件门槛。

压缩依托两项核心技术:其一是自研 Sherry 稀疏三值量化——四个权重一组编码为 5 比特、平均 1.25 比特;其二是 MIX-STQ1_0 混合精度策略,依据校准数据按各层敏感度逐层分配量化位宽,敏感层保留较高精度(2.06 比特 IQ2_XXS),不敏感层采用更激进的 STQ1_0(1.31 比特)。

效果上,主流评测与 BF16 原版差距在一两分以内、检索类基本不掉点;MCPAtlas 得分从 83.7 微降至 83.2,SWE-Bench multi 从 82.9 降至 81.3。

在异构设备联合推理方面,腾讯混元与 prima.cpp 合作验证:在一台配备单张 4090 的笔记本与一台四卡 A4000 服务器(合计 80GB 显存、64GB 内存、分属两个局域网)上,通过异构调度将 MoE 层拆分分配,使 214GB 的轻量版模型达到 1.02 token/s 的推理速度,比笔记本单机 offload 快约 6 倍。

轻量版模型已上线 Hugging Face 和 GitHub 平台,支持 llama.cpp、vLLM、SGLang 等主流推理框架。参考:量化 GGUF 在 huggingface.co/AngelSlim/Hy4-preview-GGUF,原模型在 huggingface.co/tencent/Hy4-preview,代码仓库在 github.com/Tencent/AngelSlim。