DeepSeek V4 Pro正式版反转:真的很强 满血性能被束缚了

青青百科 百科资讯 2

8月15日消息,DeepSeek V4 Pro正式版发布已经三天了,目前的争议依然很多,尤其是官方测试性能直追Fable 5,但网友实测没有那么强,尽管比预览版确实提升了。

再加上DeepSeek的API大涨价,缓存命中价格最多涨了11倍,整体使用成本大增,一时间口碑严重下滑,梁圣之名已经没了。

但是这两天又出现了新的研究,显示DeepSeek V4 Pro正式版的真实性能确实是很强的,不仅能达到官方所说的水平,甚至可以复现7月份灰度测试中那种让人惊艳的能力,可以说满血回归了。

DeepSeek V4 Pro正式版的性能之所以有很大差异,是跟它的思维链有重要关系,网上测试出现了we need、let me等几种情况,不同思维链的性能波动很大。

开源社区验证之后表示V4 Pro正式版严重依赖首轮工具瞄定,所以解决办法也是有的,开源社区做了个dsh-anchored-standard插件,该方案采用“首轮锚定 + 动态晋升”策略——首次请求仅暴露 2 项核心工具以锚定优质推理轨迹,一旦模型发起首次 Tool Call,立即在后续轮次解锁全部 25 项标准工具。

经过验证,在 Windows原生Project2测试中,该方案连续跑出98、99的高分,成功进入 Fable等前沿模型分数带。

该实验表明V4 Pro的核心能力并未丢失,但可能在强化学习(RL)后训练阶段对特定的 Harness脚手架与工具暴露环境存在显著过拟合。


目前这个插件已经开源,地址在这里,详细的说明也可以参考开源社区的记录,里面的分析很全面,感兴趣的可以了解下。

此外,V4 Pro正式版的表现跟他们自研的DeepSeek Harness似乎也有关系,在后者的极简模式下性能也可以很强,这似乎又跟系统提示词干扰有关,提示词反而越少越好。

回顾这几天的情况,大部分人对DeepSeek的感觉是他们原来也有可能草台班子,因为这次的V4 Pro正式版发布太混乱了,0812当晚发的版本跟0813当天新发的版本确实是不同的,模型指纹都不一样,甚至抱抱脸上的权重也换过,显得很匆忙,忙中出错。

考虑到DeepSeek这一年来面临的融资、算力紧缺、国产适配及人才融合等问题,他们的压力显然很大,已经成为国产甚至全球都瞩目的大模型公司,还有7月中旬的正式版跳票问题,所以这次出错也是情有可原。

DeepSeek已经在V4 Flash正式版上证明了自己的能力,2840亿的参数量就做到了前沿性能,所以大家对V4 Pro正式版的预期值也拉的很高,也导致了现在的口碑反转。

V4 Pro正式版1.6万亿的规模已经很强大,对比智谱在7440亿参数的GLM-5.0上训练出了GLM-5.2及GLM-5.3,性能都可以追到Fable级别,因此V4 Pro正式版的潜力还没有彻底挖掘出来呢,现在只能希望V4.1正式版几个月后满血回归了。