DeepSeek V4.1 Flash正式发布:性能全面超越V4 Pro 成本更低

青青百科 百科资讯 1

9月10日消息,今日,深度求索正式发布DeepSeek V4.1 Flash模型,这是其全新模型结构系列中尺寸最小的一款模型,并原生支持多模态视觉理解。

据介绍,新一代模型结构的设计目标是进一步提升能力上限,同时实现更快推理速度、更高吞吐,并为后续扩展至更大参数规模模型打下基础。

DeepSeek V4.1 Flash采用552B参数MoE架构,并引入全新的Causal-Encoder-Decoder结构。

该结构采用输入、输出不对称设计,其中输入侧仅激活8B参数,输出侧激活16B参数,因此在保持大参数规模的同时,推理成本显著低于已知同尺寸模型。

与此同时,V4.1 Flash采用新的预训练方式,并经过更大规模的强化学习后训练。

根据官方公布的基准测试结果,DeepSeek V4.1 Flash在多项测试中已经超过包括DeepSeek V4 Pro在内的一众旗舰模型。

在推理效率方面,新一代模型还大幅压缩了KV Cache缓存规模,相比上一代模型,其对HBM的需求降低至1/4,对SSD的需求降低至1/8。

对于Agent应用而言,缓存命中往往占据较高成本,因此KV Cache的大幅压缩,也将进一步降低Agent类任务的实际使用成本。

目前,DeepSeek V4.1 Flash已同步上线DeepSeek API,并原生支持多模态能力。开发者只需将模型名称更改为“deepseek-flash”,即可调用最新的V4.1 Flash模型。

与此同时,旧版本V4 Flash与V4 Flash Vision Exp已经下线。

出于兼容考虑,deepseek-v4-flash和deepseek-v4-flash-vision-exp两个模型名称目前将暂时路由至V4.1 Flash。

官方表示,经多方测试,V4.1 Flash在性能、费用、速度以及任务总用时等指标上均已全面超过V4 Pro,因此DeepSeek计划有序下线V4 Pro。

根据安排,北京时间2026年9月14日12:00之后,直至未来V4.1 Pro上线之前,用户访问deepseek-v4-pro的请求都将自动路由至V4.1 Flash,并按照V4.1 Flash价格计费。

目前,腾讯WorkBuddy、CodeBuddy以及OpenCode作为官方合作伙伴,也已经全量接入DeepSeek V4.1 Flash。

API价格方面,得益于新模型架构带来的成本下降,DeepSeek此次同步下调了V4.1 Flash的API价格。

同时,官方继续采用峰谷定价机制,其中闲时价格为高峰时段的一半,鼓励用户根据实际需求调整任务执行时间。

新价格已于2026年9月10日12:00正式生效。