首页 > 商业 > 正文

价格碾压,解码DeepSeek V4新版真实优劣

2026-08-05 21:30:22 21世纪经济报道 21财经APP 陈归辞,邓浩

21世纪经济报道记者 陈归辞 邓浩

7月31日,就在OpenAI对其旗舰GPT-5.6系列API进行大规模降价数小时后,DeepSeek推出了DeepSeek-V4-Flash正式版API,又一次以“极致性价比”与大幅跃升的Agent能力引发市场震动。

记者从产业端获悉,已有头部金融机构紧急启动内部技术评估,同行反馈“效果很好”。不过,也有企业技术人员反馈,V4-Flash在Agent任务里“基本没法用”,但在非Agent任务里“价格是真的便宜”。

业内人士认为,V4-Flash正式版并非与顶尖闭源模型在同维度竞争,而是以近乎“智力批发价”的低成本,进入那些有较高试错空间、允许低成本重来的任务场景。比如在整库检索、财报分析和卷宗处理等任务中,模型即使偶尔出错,也可以通过重新运行、程序校验或人工抽查来纠正。由于使用成本足够低,多试几次仍可能比使用高价模型更划算。

不过,对于需要连续规划、调用工具并自主执行几百轮操作的长流程Agent任务,V4-Flash仍存在短板。此类任务中的小错误容易逐步累积,最终影响整体结果。因此,企业在实际应用中仍需配套检查机制、结果验证器和必要的人工审核来提升可靠性。

低价碾压

DeepSeek-V4系列模型瞄准的是“百万上下文普惠时代”。相较上一代模型,V4系列进一步降低调用成本,并提升Agent任务表现。其中,DeepSeek-V4-Pro定位性能比肩闭源模型,V4-Flash则提供更加高效、经济的API服务。

此次V4-Flash正式版受到关注的一大原因在于,在保持4月发布的预览版模型架构和参数规模不变的情况下,仅通过后训练优化,便实现了Agent能力的大幅提升。

V4-Flash采用MoE(混合专家)架构,总参数规模2840亿,激活参数130亿,支持100万Token上下文窗口。在官方DeepSWE基准测试中,其表现较此前V4-Pro预览版本提升超过6倍。

不过,新加坡无限对齐创始人、Codex生态合作伙伴宋斐在接受21世纪经济报道记者采访时提示,这类分数需要区分口径。“同一个模型,换一套评测脚手架,可能就是另一张成绩单。官方分数出自它自家的评测环境,独立的Agent榜单还没更新到它——跃迁是真的,登顶有待商榷。”

与此同时,V4-Flash正式版API延续了此前极低的定价策略,输入命中缓存价格仅为0.02元/百万Token,未命中输入价格为1元/百万Token,输出价格为2元/百万Token。

需要指出的是,DeepSeek API服务即将采用峰谷定价策略,高峰时段价格为平时价格2倍,适用所有计费项。

美国研究机构Artificial Analysis的独立评测显示,DeepSeek-V4-Flash每项智能指数任务的加权平均成本为3美分,不到Anthropic旗舰模型Claude Fable 5的1/100。其他主流模型中,Kimi K3的成本为86美分,OpenAI GPT-5.6 Sol为1.86美元。

在该机构的“智能指数”评估中,DeepSeek-V4-Flash得分为50分,与谷歌Gemini 3.6 Flash持平,比智谱的GLM-5.2低1分。其他主流模型中,Kimi K3得分为57分,GPT-5.6 Sol为59分,Claude Opus 5为61分,Fable 5为60分。

与智能水平相近的GPT-5.6 Luna相较,即便OpenAI已将该模型价格下调80%,根据该评测,DeepSeek-V4-Flash的单任务加权平均成本仍仅约为前者的60%。

对此,宋斐表示,Artificial Analysis计算出的3美分,是基于其自家智能指数测算出的加权任务成本,并不代表任何业务任务都是这个价格。不过,即便V4-Flash跑完整套评测输出的token量约为其他模型中位数的两倍,相关成本仍只要3美分,可见其单位价格压得有多低。

这背后,V4-Flash的输入缓存定价受到业内关注。V4-Flash的缓存命中输入价格仅为未命中价格的2%,远低于主流模型约10%的水平,相当于在行业常见一折水平的基础上,将降价幅度扩大至98%。

据阿里技术官方号陈威特的分析,当前主流大模型都是自回归(autoregressive)生成:每次只预测下一个token,把它接到已有文本后面,再预测再下一个。在真实场景中,同一个AI助手,每个请求都带着同一份几千token的系统提示词(system prompt);同一段多轮对话,第5轮请求的开头就是第4轮的全部内容。而一次典型的Agent编码会话往往要跑十几到几十轮工具调用。

缓存命中意味着模型记得自己已经处理过哪些内容,不必每一轮重新从头计算。某种程度来说,超长上下文只有被反复使用才有规模化价值。

“注意是价格打到2%,不是98%的请求都能命中。做Agent的人知道这意味着什么——系统提示、工具定义、代码仓这些东西每一轮都在重复发送,占掉的往往是大头,现在这部分几乎不要钱了。”宋斐表示。

有业内人士认为,DeepSeek-V4-Flash的发布,或将推动国内AI大模型行业迎来“平价革命”。其他大模型厂商要么选择跟进,要么面临被DeepSeek抢份额的局面。

对于V4-Flash的生态位,宋斐认为,闭源模型在卖智力的峰值,而V4-Flash在卖智力的批发价。“复杂系统里让它干草稿、检索、初筛这些量大的粗活,关键决策留给更强的模型。”这也意味着,V4-Flash与顶尖模型竞争的并非同一市场。

“失败了能便宜重来的场景,它的价格优势是碾压性的;失败一次损失很大的场景,成功率差一点,什么价格优势都没了。V4-Flash真正冲击的不是哪个榜单的排名,而是闭源Agent的那套成本结构。”宋斐表示。

“自己部署的社区已经有人踩到坑,并发一上显存吃紧”

对于产业应用端而言,DeepSeek-V4-Flash的极低调用成本,将进一步降低AI进入各行业业务的门槛。

记者从某头部金融科技厂商后端负责人处获悉,DeepSeek V4 Flash发布后,公司已紧急启动内部技术评估,产业同行反馈“效果很好”。

但需要看到,从能够“高效、经济地调用”,到实际进入企业的业务流,还隔着距离。

“能不能跑起来是硬件的事,企业敢不敢把活交给它是另一回事。私有化不是把权重下载到自己机房就完了,得接进你的权限管控、操作留痕、回滚这套机制,接不进去就是个昂贵的本地演示。”宋斐表示。

从部署效果看,V4-Flash已经显著降低了运行门槛,但稳定支撑企业级服务仍需进一步验证。宋斐表示,官方API的实际表现、官方在自家评测环境里的成绩、第三方实际部署后的效果,是三回事。目前已有第三方部署和吞吐方面的报告,但在统一评测环境下对官方整套Agent成绩的系统性复现,还没有公开数据。

“四张海外高端算力卡确实能把它架起来,但社区已经有人踩到坑,并发一上来显存就吃紧,超长文本的预填充慢得很。跑起来容易,稳定服务是另一回事。”他指出。

对于V4-Flash能否成为百万上下文环境下可规模化落地的模型,宋斐认为,其百万上下文下“装进去”的成本确实下降得厉害,1M长度下它的计算量只有上一代V3.2的十分之一左右,缓存开销不到十分之一。但官方技术报告也显示,其最高推理档位(Max)在1M上下文下MRCR为78.7,CorpusQA为60.5,模型在超过128K上下文后的性能表现就开始下掉。塞进去一百万token,不等于都能找回来。

“所以整库检索、读财报、读卷宗这类活可以开始规模化试了;跑几百轮的长Agent还不行,得靠外面的检查点和验证器兜着。”宋斐表示,“我自己的用法是拿128K到256K当工作区,那个1M当可寻址的仓库用。”

AI降本的产业应用红利多少?

开源证券研报认为,2026年上半年成为AI应用产业的关键转折点,大模型商业化从技术验证阶段正式迈入收入兑现阶段,“模型能力提升—Token调用增长—企业付费转化”的正向循环正逐步形成。

在开源证券看来,经过过去两年的技术积累与场景探索,AI不再停留在概念层面,而是深度嵌入客户服务、市场营销、软件开发、数据分析等核心工作流,B端付费意愿显著增强,C端订阅模式也得到验证。编程开发、视频内容生成等先行赛道已率先实现商业闭环,证明AI应用的付费价值与盈利潜力。

事实上,在产业端,AI降本增效正在为部分企业带来真金白银。

以AI应用龙头中文在线为例,其正快速推动AI短剧出海,旗舰平台FlareFlow目前已上线超500部精品AI短剧。今年第一季度,得益于出海短剧业务的提质增效,以及AI短剧业务的快速发展,中文在线实现营业收入3.1亿元,同比增长33.1%。

在文本生成与剧本创作端,中文在线自研了“逍遥AI”。2025年初DeepSeek推出后,“逍遥AI”进一步结合DeepSeek的深度推理能力快速迭代,目前已能够实现高质量的IP剧本拆解、设定生成与多语言创作;视频生成环节,其推出全栈AI内容创作平台——“次元神笔”,依托Seedance等领先模型卓越的多模态视频生成能力,实现了内容创作效率的跨越式提升。

7月中旬,中文在线管理层在机构调研中透露,2026年是其走向价值重估的转折点。依托“逍遥AI”,“我们在核心生产环节已实现显著降本,相较传统3D动画,AI短剧单分钟制作成本下降超过75%。预计到2026年末,公司AI短剧年化产能有望达3000部,实现数倍增长,有望对公司未来业务表现带来积极作用。”

对于V4-Flash正式版带来的影响,宋斐认为算账方式会改变,“以后没人关心一百万token多少钱,只关心做成一件事全程花多少钱”。

同时,宋斐认为私有化市场确实被打开了:能拿到Artificial Analysis 50分的模型版本、原生1M上下文、约167GB的DSpark融合权重,这样的组合过去很难同时具备——同级的开源模型权重要么上TB,要么没有原生1M——现在一个可下载模型里已经有了。“数据出不了域的行业以前只能凑合,现在有得选了。”

21财经客户端下载