压缩后模型在多个主流评测集和原版持平。
作者 | 程茜
编辑 | 心缘
智东西9月1日报道,今日中午,腾讯发布了其最新一代旗舰模型预览版本Hy4 preview的轻量版模型,将模型权重从1.5TB压缩到214GB。
腾讯混元的测试结果显示,压缩后的模型与Hy4 preview原始模型相比,长文理解、多轮长上下文检索和原版基本在同一水平,数学有小幅回落。压缩后模型能覆盖日常编程辅助、工具调用、长文档处理和常规问答。
8月28日,腾讯发布并开源了Hy4 preview,腾讯公开的Hy4 preview基准测试结果显示,在多个编程、智能体和科研基准测试中,Hy4 preview的得分超过了DeepSeek-V4-Pro-0824等模型,排名位居开源模型第一梯队。
▲BF16原版(左)和MIX-STQ1_0量化版(右)生成效果MIX-STQ1_0量化版在多个主流评测集上和BF16原版的差距都在一两分以内,长上下文评测集MRCR、真实工具调用Agent评测MCP‑Atlas等任务中分差不到1分,整体领先UD-IQ1_M量化版本。
此外,研究人员还验证,即使不是整套同构硬件,开发者通过手边现有的异构设备拼接,也能跑通旗舰大模型。
腾讯混元团队基于分布式集群推理框架prima.cpp进行了验证,在一台4090笔记本和一台四卡A4000服务器上,两端显存合计80GB、内存合计64GB,分处两个局域网,靠prima.cpp的异构调度把MoE层拆开分配,让计算和权重读取彼此重叠,最终将214GB的Hy4 preview轻量版模型协同跑到了1.02 token/s,比笔记本单机offload快了约6倍。
腾讯混元称,其通过Sherry稀疏三值量化算法和MIX-STQ1_0混合精度策略两大技术,实现了压缩模型权重且性能没有大幅降低。
1、Sherry稀疏三值量化算法:把最激进一档权重压到平均1.25比特
腾讯混元自研了Sherry稀疏量化算法,以优化路由专家部分。
Sherry是一种三值量化方法,每四个权重为一组,一起量化成{-1、0、+1},并强制每组里恰好1个为0。
这样每组有32种组合,可以用5bit索引编码,摊到每个权重平均1.25bit,计入分块共享的缩放系数等额外开销,落到文件里的实际开销约1.31bpw。
基于Sherry,腾讯混元在llama.cpp里实现了STQ1_0推理内核,打通了量化、推理到评测。
其将STQ1_0和几种常见低比特格式放在同一算子上比,STQ1_0在比特数最低的同时,速度和IQ1_M基本持平,比IQ1_S更快。
▲各个算子速度展示2、MIX-STQ1_0混合精度策略:按校准数据逐层决定每层比特压到多低
直接把全部层统一到同一量化档位,操作简单,但模型各层对压缩的耐受能力差异很大。社区主流UD‑IQ1_M方案,对绝大多数路由专家层统一采用IQ1_M(1.75bpw)。
腾讯混元团队在校准集上发现,与其让这些层统一用IQ1_M,不如按敏感度逐层分档:敏感的层留IQ2_XXS(2.06bpw),不敏感的层用压缩更强的STQ1_0(1.31bpw)。
这套逐层混合精度方案,就是MIX-STQ1_0。
在不增加平均比特预算的前提下,这样逐层分档,整体量化误差更低。落到最终模型,MIX-STQ1_0的路由专家权重不光评测表现更好,还比UD-IQ1_M少占了超5GiB。
结语:腾讯混元给出MoE部署新思路
不再一刀切压缩模型
长期以来,MoE模型凭借专家混合架构获得更强能力,但庞大权重带来更高显存门槛,很多高性能开源模型只能跑在高端集群,普通开发者与中小企业难以本地部署。
腾讯混元此次针对MoE模型专家层参数分布特点做定制化压缩,不再简单对全模型统一降比特,按照各层敏感度差异化分配精度,将模型压缩带来的性能损耗见效,或能为超大MoE模型实现轻量化落地提供参考。