当前位置: 首页 » 资讯 » 新科技 » 正文

1.5TB压到214GB:腾讯混元Hy4 preview轻量版发布开源

IP属地 中国·北京 编辑:顾雨柔 IT之家 时间:2026-09-01 20:04:21

IT之家 9 月 1 日消息,腾讯混元团队今日宣布推出 Hy4 preview 轻量版,将 Hy4 preview 的模型权重从接近 1.5TB 压缩至约 214GB。

IT之家注:Hy4 preview 是腾讯于 8 月 28 日发布并开源的新一代 MoE(混合专家)大语言模型,总参数量 770B(7700 亿),激活参数 49B,上下文长度达 100 万 Token。

此次压缩依托两项核心技术:其一是 Sherry 稀疏三值量化算法,将路由专家层权重压缩至平均 1.25 比特;其二是 MIX-STQ1_0 混合精度策略,依据校准数据逐层决定每层的量化位宽,敏感层保留较高精度(2.06 比特 IQ2_XXS),不敏感层采用更激进的 STQ1_0(1.31 比特)。

两种技术结合,使模型在主流任务上表现稳定 —— 长文理解几乎与原始 BF16 模型持平,多轮长上下文检索基本在同一水平,数学能力仅小幅回落。MCP Atlas 得分从 83.7 微降至 83.2,SWE-Bench multi 从 82.9 降至 81.3。

BF16 即 bfloat16 浮点格式,是 AI 训练中常用的低精度数值格式;bpw(bits per weight)指每个权重参数平均占用的比特数,数值越低压缩率越高。

在异构设备联合推理方面,腾讯混元与 prima.cpp合作验证了一项新方案:在一台配备单张 4090 的笔记本与一台四卡 A4000 服务器(合计 80GB 显存、64GB 内存、分属两个局域网)上,通过 prima.cpp的异构调度将 MoE 层拆分分配,使 214GB 的轻量版模型达到 1.02 token/s 的推理速度,比笔记本单机 offload 快约 6 倍。

轻量版模型已上线 Hugging Face 和 GitHub 平台,支持 llama.cpp、vLLM、SGLang 等主流推理框架。

参考资料:

量化 GGUF:huggingface.co/AngelSlim / Hy4-preview-GGUF 原模型:huggingface.co/tencent / Hy4-preview 代码仓库:github.com/Tencent / AngelSlim

免责声明:本网信息来自于互联网,目的在于传递更多信息,并不代表本网赞同其观点。其内容真实性、完整性不作任何保证或承诺。如若本网有任何内容侵犯您的权益,请及时联系我们,本站将会在24小时内处理完毕。