Magic 称 50 万美元算力可接近 DeepSeek V4 Pro 底模预训练效果

Magic 称 50 万美元算力可接近 DeepSeek V4 Pro 底模预训练效果
Magic 称 50 万美元算力可接近 DeepSeek V4 Pro 底模预训练效果

AI 编程公司 Magic 发布预训练研究称,一套新的训练方案仅需约 50 万美元的 GB200 算力,就能达到接近 DeepSeek V4 Pro Base 的预训练效果,所需计算量约为后者的 1/50。

Base 指只完成预训练、尚未经过强化学习等后训练的底模。Magic 使用未见过的代码、数学题和研究论文测试模型,比较其对后续内容的预测准确性。因此,这一对比仅涉及底模预训练效果,并不代表聊天、编程或 Agent 能力已经追平 DeepSeek V4 Pro 成品版。

Magic 随后将训练规模扩大 10 倍,投入约 400 万美元的 GB200 算力。该版本在同一套自测中,超过了其测试的 DeepSeek、Kimi 和 NVIDIA 最新公开 Base 模型。Magic 估算,若按 DeepSeek V4 Pro 的训练效率达到同等水平,算力成本将超过 1 亿美元。

Magic 尚未公布完整训练配方,仅透露效率提升来自模型架构、优化器、训练目标和数据处理等数十项改动。目前模型权重也尚未发布,因此其“50 倍效率”说法仍无法由外界独立复现。

© 版权声明
THE END
喜欢就支持一下吧
点赞9 分享
评论 抢沙发

请登录后发表评论

    暂无评论内容