DeepSeek V4.1 Flash 正式发布:总参数 552B,输入仅激活 8B

DeepSeek V4.1 Flash 正式发布:总参数 552B,输入仅激活 8B
DeepSeek V4.1 Flash 正式发布:总参数 552B,输入仅激活 8B

DeepSeek 正式发布 V4.1 Flash。新模型总参数量为 552B(5520 亿),采用全新的 Causal-Encoder-Decoder 架构,并原生支持图片理解,是 DeepSeek 新架构系列中目前规模最小的模型。

该架构将输入与输出分开处理:读取输入时仅激活 8B(80 亿)参数,生成回答时激活 16B(160 亿)参数。DeepSeek 表示,这一设计有助于降低大模型的推理成本。

经过新的预训练和更大规模的强化学习后,V4.1 Flash 在官方基准测试中的表现已超过 V4 Pro。

此外,模型缓存也得到大幅压缩。相比上一代,V4.1 Flash 对 HBM 显存的需求降至四分之一,SSD 存储需求降至八分之一,主要用于降低长上下文处理和 Agent 反复调用时的成本。

V4.1 Flash 已同步上线 API,调用时将模型名称改为 deepseek-flash 即可。

© 版权声明
THE END
喜欢就支持一下吧
点赞7 分享
评论 抢沙发

请登录后发表评论

    暂无评论内容