8月13日凌晨,DeepSeek官方API文档更新,DeepSeek-V4-Pro对应模型版本切换为DeepSeek-V4-Pro-0813,调用模型名保持不变。
同期,DeepSeek官方客服对外公告DeepSeek-V4-Pro正式版发布,透露新版本增强了智能体能力,支持Responses API、Codex等智能体工具接入。
架构上,DeepSeek-V4-Pro正式版与预览版几乎完全一致,但在其性能上已经逼近全球顶尖大模型。官方基准测试显示,在9项智能体基准中,DeepSeek-V4-Pro正式版的得分已与全球最顶尖的Anthropic Fable模型几乎持平。其中CyberGym基准甚至略超0.2分(83.3分对83.1分)。
对于完全开源模型而言,这无疑是一个创举。
值得注意的是,本次V4两个版本全部完成上线,同时也伴随峰谷价差的落地。根据API官方文档,DeepSeek将采用峰谷定价,闲时价格为高峰时段价格的一半,鼓励用户根据实际使用情况调整任务时间。新价格将于北京时间 2026 年 8 月 17 日 0 时开始生效。
“直接对硅谷贴脸开大”,猎豹创始人傅盛表示:“DeepSeek-V4-Pro性能接近顶尖模型,价格却只有Fable 5的57分之一,我们内部早就在用V4-Flash,便宜又好用,就冲Flash的底子,V4-Pro至少能摸到顶流中端。”
“模型性价比的斩杀线,又被拉高了。硅谷越来越多公司都开始用国产开源模型,这回压力给到OpenAI和Anthropic了。”
聚焦智能体能力
从API文档披露的参数看,DeepSeek-V4-Pro正式版上下文窗口上限为100万词元,单次最大输出长度为38.4万词元,支持非思考模式和思考模式(思考模式默认开启),完整兼容JSON结构化输出、工具调用、Anthropic API格式等原有功能,但并发限制为500,低于同系列V4-Flash-0731版本的2500并发上限,其定位更偏向复杂推理、长链路任务场景。
接口层面的变化是此次更新的另一核心。V4-Pro正式版原生支持Responses API,意味着其将同时兼容OpenAI与Anthropic两套API生态。而这意味着更多智能体工具能够无缝接入DeepSeek-V4-Pro进行测试。
从基准得分来看,DeepSeek-V4-Pro再度展现出智能体能力大幅改善的趋势,这与Flash正式版发布时的情况类似。
据DeepSeek官方公布的评测对比,V4-Pro在DeepSWE基准上的得分从预览版12.8%飙升至62.7%,提升近50个百分点;Terminal Bench 2.1从72.1提升至87.9;CyberGym从52.7提升至83.3;AutomationBench从12.8提升至31.8;HLE(带工具)从48.2提升至60.0。
与此同时,V4-Pro正式版首次支持原生图像推理,其展现出一定的多模态能力。
回滚争议
“在我理解看来,V4-Pro的水平更接近OpenAI GPT Sol 5.6(全球顶尖模型之一)左右的性能,在处理复杂任务时还比不上Fable 5,但我们还是会在工作流中同时使用它们来处理不同的任务。”一位海外开发者在海外社交平台上指出。
记者注意到,与V4-Flash正式版发布时的一片赞美相比,此次发布后用户感受更为分化。
比如,一些开发者发现,V4-Pro在北京时间8月13日凌晨发布之后不久,在面对复杂任务时,输出思考时间极短,输出效果也不佳。但几个小时后,V4-Pro又恢复了复杂任务长程思考的模式。
与此同时,部分开发者在使用Anthropic API接入DeepSeek V4 Pro时发现模型“降智”,但在Codex等工具上使用效果较佳。
鉴于此,开发者社区流传着V4-Pro可能在凌晨经历了一轮模型版本回滚的说法。
“我觉得可能是版本在上线时的工程(infra)没做好,否则以Flash数倍的参数做出来的模型不该是这样。”一位华裔开发者指出。
一位中国程序员则表示:“相比V4-Pro,我们更期待DeepSeek Harness。”
模型厂商开始贴身肉搏
V4-Pro正式版上线的时间窗口,恰逢全球大模型又一次密集发布期。
8月12日至13日,AI圈上演头部模型的“多箭齐发”:阿里千问、DeepSeek、xAI三家在同一窗口发布新模型或重要更新。
其中,阿里巴巴于8月12日深夜通过魔搭ModelScope社区正式开放Qwen3.8-Max模型权重。
而同一时间,马斯克旗下的SpaceXAI于8月12日发布Grok 4.6。马斯克表示Grok 4.6“智能、快速且性价比超高”。
SpaceXAI公布的数据则预示Grok模型已经开始挑战Fable 5在模型世界的铁王座——其官方文档显示,Grok 4.6在真实世界专业任务评测GDPVal-AA v2中取得1753 Elo,高于Claude Fable 5 Max的1741分与GPT-5.6 Sol Max的1728分。
把视野拉长到整个夏季,全球模型发布的密度更为惊人。
根据AI模型发布追踪器统计,从6月30日Anthropic发布Claude Sonnet 5开始,七款前沿或开放权重模型集中上线,涵盖Grok 4.5、GPT-5.6家族(Luna/Terra/Sol)、Gemini 3.6 Flash、Claude Opus 5、DeepSeek V4正式版、Kimi K3,以及GLM-5.2、Qwen3.7等开放权重版本。
此次模型博弈的焦点,已经从逻辑、文本、数学等基础能力,转向更易产生实际价值的智能体工具链与总持有成本等要素。