DeepSeek发布V4.1 Flash:推理成本再降
导语
9月10日,DeepSeek正式发布DeepSeek V4.1 Flash——这是其全新模型结构系列中尺寸最小的成员,却带着”以小博大”的野心而来:原生多模态、100万Token上下文、API定价大幅下调,部分场景的调用成本降至此前的零头。更耐人寻味的是,官方宣布性能、费用、速度已全面超越上一代旗舰V4 Pro,并计划有序下线后者。轻量模型开始”吃掉”旗舰,大模型的价格战打出了新维度。
事件详情:新架构、新定价、新老交替
552B参数里的”不对称”设计
V4.1 Flash采用552B参数的MoE(混合专家)架构,并引入全新的Causal-Encoder-Decoder结构。最特别的是它的”非对称激活”设计:输入端每Token仅激活约8B参数,输出端激活约16B——”读取”用小力气,”生成”才加码,使得整体成本显著低于同尺寸的已知模型。
效率优化同样激进:新一代注意力机制将KV Cache压缩至每Token 890字节,相比上一代模型,对高带宽内存(HBM)的需求降至四分之一,对固态硬盘(SSD)的需求降至八分之一。尤其在Agent使用场景中,上下文存储与缓存命中的费用占比较高,这一压缩直接拉低了长时任务的实际成本。据统计,相对于初代模型,其KV Cache已缩减至原来的437分之一。
能力上,新模型原生支持多模态视觉理解,支持100万Token上下文和最高384K Token输出。设计初衷很明确:能力上限更高、推理速度更快、吞吐更大,并可扩展到更大参数的模型。
API大降价与峰谷定价
得益于架构创新带来的成本下降,DeepSeek同步下调了V4.1 Flash的API定价。据国金证券研报测算,缓存命中、输入与输出价格较V4 Pro分别下降约86.4%、77.3%和69.7%,降幅堪称”骨折级”。定价延续了峰谷机制:闲时价格为高峰时段的一半,鼓励用户错峰调用、合理调配算力资源。新价格已于9月10日12:00正式生效。
调用方式上,V4.1 Flash已同步上线DeepSeek API,模型名称为deepseek-flash;旧版本的V4 Flash与V4 Flash Vision Exp正式下线,旧模型名暂时被路由到V4.1 Flash。腾讯旗下的WorkBuddy、CodeBuddy以及OpenCode等合作伙伴已全量接入。
V4 Pro的谢幕
最具象征意义的动作,是官方宣布V4 Pro的下线计划:鉴于V4.1 Flash在性能、费用、速度和总用时上已全面超越V4 Pro,官方计划有序下线后者——在2026年9月14日12:00之后、V4.1 Pro上线之前,所有访问deepseek-v4-pro的请求将被全部路由至V4.1 Flash并按其单价计费。一个轻量模型”接管”旗舰型号的调用入口,这在行业内尚属罕见。
背景分析:为什么轻量模型能超越旗舰
这背后是模型架构的一次代际变化。传统的”大力出奇迹”路线靠堆参数、堆算力提升能力,边际收益递减且成本高企;而V4.1 Flash代表的新路线是”结构创新换效率”:通过非对称激活、KV Cache极致压缩等手段,用更少的实际计算量达到相近甚至更好的效果。
第三方评测佐证了这一点:国金证券选取科学知识与推理、代码生成、智能体任务三类共七项公开测试进行对比,V4.1 Flash七项全部超越上一代Flash,其中代码生成与智能体类的五项还超过了参数规模更大的V4 Pro,仅科学知识与推理两项仍低于Pro版本。换句话说,这一轮提升精准地打在了”代码+智能体”这个开发者最在乎的方向上。
值得注意的是硬币的另一面:模型权重增至约510GB,本地部署门槛从两张卡升至一个8卡节点,自部署用户的总拥有成本反而上升。DeepSeek显然在引导用户走向API调用——对API用户是降价红利,对自部署用户则是更高的门槛,一升一降之间,是商业模式的清晰选择。
影响展望:价格战进入”架构战”阶段
V4.1 Flash的发布,把2026年下半年的大模型竞争推向了一个新阶段:此前的价格战更多是”补贴换市场”,而这一轮是”架构创新带来的真实成本下降”。当每百万Token的调用成本降到此前的零头,智能体长时运行、多智能体协作这类”烧token”的场景,第一次在经济上变得可行——这会直接重塑开发者的预算方式和应用形态。
对竞争对手而言,压力是双重的:一边是OpenAI的GPT-6 Astra、Anthropic新模型在”能力代差”上继续拉开距离,一边是DeepSeek用”性能够用+价格极低”挤压中间层厂商的生存空间。月之暗面、MiniMax、智谱等厂商的模型价格同样在不断下探,整个行业的定价中枢正在下移。
而对DeepSeek自己来说,让Flash”吃掉”Pro是一次自信的表态:它赌的是,未来大模型的竞争不在参数规模,而在”单位智能的成本”。如果这个判断正确,V4.1 Flash可能不只是一款新模型,而是一个新时代的开端——在这个时代,最贵的模型,未必是最好的模型。