
DeepSeek 打破大模型“更强、更快、更便宜”的不可能三角
DeepSeek V4.1 Flash 对整体架构进行了大幅重构,试图同时提升模型能力、推理速度并降低使用成本。
更强
模型拥有 5520 亿主干参数,并外挂 1960 亿参数的 Engram 条件记忆。预训练使用了超过 45T 多模态 Token;后训练则大量加入真实 Agent 任务、工具环境和失败案例。
在 DeepSWE v1.1 评测中,模型得分达到 74.2%,超过 Claude Opus 5 和 GPT-5.6 Sol。
更快
新的 CED 架构将 40 层模型拆分为前后两部分。读取 Prompt 时,每个 Token 仅激活 80 亿参数;生成时则激活 160 亿参数。
此外,模型还引入 CSA2 跨层复用和 DSpark 投机解码,将上下文长度从 4K 扩展至 1M,提升 256 倍;在此基础上,单 Token 解码计算量仅增加约四分之一。
更便宜
DeepSeek 进一步压缩 KV Cache:主缓存采用 FP4,并结合跨层复用,使每个 Token 的全局 KV Cache 仅剩 890 字节,约为 V4 Flash 的四分之一;长期存放在 SSD 或内存中的缓存则进一步降至约八分之一。
V4.1 Flash 并没有将“更强”简单等同于“计算更多”。模型规模继续扩大,但每次只激活一小部分参数;上下文长度持续增加,缓存规模却被进一步压缩。在提升能力的同时,模型也尽量控制了速度和成本。
© 版权声明
文章版权归作者所有,未经允许请勿转载。
THE END










暂无评论内容