DeepSeek 打破大模型“更强、更快、更便宜”的不可能三角

DeepSeek 打破大模型“更强、更快、更便宜”的不可能三角
DeepSeek 打破大模型“更强、更快、更便宜”的不可能三角

DeepSeek V4.1 Flash 对整体架构进行了大幅重构,试图同时提升模型能力、推理速度并降低使用成本。

更强

模型拥有 5520 亿主干参数,并外挂 1960 亿参数的 Engram 条件记忆。预训练使用了超过 45T 多模态 Token;后训练则大量加入真实 Agent 任务、工具环境和失败案例。

在 DeepSWE v1.1 评测中,模型得分达到 74.2%,超过 Claude Opus 5 和 GPT-5.6 Sol。

更快

新的 CED 架构将 40 层模型拆分为前后两部分。读取 Prompt 时,每个 Token 仅激活 80 亿参数;生成时则激活 160 亿参数。

此外,模型还引入 CSA2 跨层复用和 DSpark 投机解码,将上下文长度从 4K 扩展至 1M,提升 256 倍;在此基础上,单 Token 解码计算量仅增加约四分之一。

更便宜

DeepSeek 进一步压缩 KV Cache:主缓存采用 FP4,并结合跨层复用,使每个 Token 的全局 KV Cache 仅剩 890 字节,约为 V4 Flash 的四分之一;长期存放在 SSD 或内存中的缓存则进一步降至约八分之一。

V4.1 Flash 并没有将“更强”简单等同于“计算更多”。模型规模继续扩大,但每次只激活一小部分参数;上下文长度持续增加,缓存规模却被进一步压缩。在提升能力的同时,模型也尽量控制了速度和成本。

© 版权声明
THE END
喜欢就支持一下吧
点赞8 分享
评论 抢沙发

请登录后发表评论

    暂无评论内容