FreeToken 开源:单张 RTX 5090 运行 DeepSeek-V4-Flash,最高 25 Token/s

FreeToken 开源:单张 RTX 5090 运行 DeepSeek-V4-Flash,最高 25 Token/s
FreeToken 开源:单张 RTX 5090 运行 DeepSeek-V4-Flash,最高 25 Token/s

伯克利、MIT 等研究者开源了 FreeToken。这是一款面向本地设备的 MoE(混合专家模型)推理引擎,主要用于缓解超大模型显存不足的问题。它会将部分权重放在系统内存中,并让 CPU 与 GPU 协同参与推理。

FreeToken 会把大量专家权重存放在系统内存,只将一部分缓存在显存中。当推理过程中需要调用显存中没有的专家时,系统会根据 PCIe 和 CPU 内存带宽,动态决定是将权重搬运到 GPU,还是直接交由 CPU 计算,从而让 CPU、GPU、系统内存和 PCIe 共同参与推理流程。

论文实测显示,一台配备 RTX 5090 的游戏台式机运行 284B 参数的 DeepSeek-V4-Flash 时,可达到 22–25 Token/s。该模型每生成一个 Token 实际只激活约 13B 参数,因此较适合 CPU、GPU 混合推理。

FreeToken 还在 8GB 显存的 RTX 4060 笔记本上将 35B 模型跑到 39.3 Token/s;在单张 96GB RTX PRO 6000 上运行 753B 参数的 GLM-5.2,速度达到 llama.cpp 的约两倍。

目前,FreeToken 支持超过 20 款 MoE 模型,并已采用 Apache 2.0 许可证开源。

© 版权声明
THE END
喜欢就支持一下吧
点赞13 分享
评论 抢沙发

请登录后发表评论

    暂无评论内容