
1.5TB 变 214GB:腾讯为 Hy4 preview 推出极限量化版
Hy4 preview 开源后,腾讯混元发布了一个极限量化版本。原始模型权重接近 1.5TB,新版 GGUF 文件约 214GB,显著降低了这款 770B MoE 模型的本地部署门槛。
该版本并不是将整个模型统一压缩到 1.25-bit。腾讯根据不同层对精度的敏感程度分别量化:部分可承受更低精度的层最低压到约 1.31-bit,敏感层则保留 2-bit 甚至更高精度。最终整个文件平均约为 2.38 bpw。腾讯公布的四项评测显示,相比 BF16 原版,分数仅下降 0.2 到 1.6 分。
压缩后,腾讯还与 prima.cpp 测试了异构设备联合推理。一台 RTX 4090 笔记本加一台四卡 A4000 服务器,总计 80GB 显存和 64GB 内存,最终实现 1.02 token/s 的推理速度,比笔记本单机 offload 快约 6 倍。不同配置的多台设备也可以共同分担模型推理。
© 版权声明
文章版权归作者所有,未经允许请勿转载。
THE END










暂无评论内容