• 最近访问:
发表于 2026-08-13 21:35:10 股吧网页版
DeepSeek重大更新却引争议,顶尖模型开启“肉搏”
来源:21世纪经济报道 作者:赵云帆

  8月13日凌晨,DeepSeek官方API文档更新,DeepSeek-V4-Pro对应模型版本切换为DeepSeek-V4-Pro-0813,调用模型名保持不变。

  同期,DeepSeek官方客服对外公告DeepSeek-V4-Pro正式版发布,透露新版本增强了智能体能力,支持Responses API、Codex等智能体工具接入。

  架构上,DeepSeek-V4-Pro正式版与预览版几乎完全一致,但在其性能上已经逼近全球顶尖大模型。官方基准测试显示,在9项智能体基准中,DeepSeek-V4-Pro正式版的得分已与全球最顶尖的Anthropic Fable模型几乎持平。其中CyberGym基准甚至略超0.2分(83.3分对83.1分)。

  对于完全开源模型而言,这无疑是一个创举。

  值得注意的是,本次V4两个版本全部完成上线,同时也伴随峰谷价差的落地。根据API官方文档,DeepSeek将采用峰谷定价,闲时价格为高峰时段价格的一半,鼓励用户根据实际使用情况调整任务时间。新价格将于北京时间 2026 年 8 月 17 日 0 时开始生效。

  “直接对硅谷贴脸开大”,猎豹创始人傅盛表示:“DeepSeek-V4-Pro性能接近顶尖模型,价格却只有Fable 5的57分之一,我们内部早就在用V4-Flash,便宜又好用,就冲Flash的底子,V4-Pro至少能摸到顶流中端。”

  “模型性价比的斩杀线,又被拉高了。硅谷越来越多公司都开始用国产开源模型,这回压力给到OpenAI和Anthropic了。”

  聚焦智能体能力

  从API文档披露的参数看,DeepSeek-V4-Pro正式版上下文窗口上限为100万词元,单次最大输出长度为38.4万词元,支持非思考模式和思考模式(思考模式默认开启),完整兼容JSON结构化输出、工具调用、Anthropic API格式等原有功能,但并发限制为500,低于同系列V4-Flash-0731版本的2500并发上限,其定位更偏向复杂推理、长链路任务场景。

  接口层面的变化是此次更新的另一核心。V4-Pro正式版原生支持Responses API,意味着其将同时兼容OpenAI与Anthropic两套API生态。而这意味着更多智能体工具能够无缝接入DeepSeek-V4-Pro进行测试。

  从基准得分来看,DeepSeek-V4-Pro再度展现出智能体能力大幅改善的趋势,这与Flash正式版发布时的情况类似。

  据DeepSeek官方公布的评测对比,V4-Pro在DeepSWE基准上的得分从预览版12.8%飙升至62.7%,提升近50个百分点;Terminal Bench 2.1从72.1提升至87.9;CyberGym从52.7提升至83.3;AutomationBench从12.8提升至31.8;HLE(带工具)从48.2提升至60.0。

  与此同时,V4-Pro正式版首次支持原生图像推理,其展现出一定的多模态能力。

  回滚争议

  “在我理解看来,V4-Pro的水平更接近OpenAI GPT Sol 5.6(全球顶尖模型之一)左右的性能,在处理复杂任务时还比不上Fable 5,但我们还是会在工作流中同时使用它们来处理不同的任务。”一位海外开发者在海外社交平台上指出。

  记者注意到,与V4-Flash正式版发布时的一片赞美相比,此次发布后用户感受更为分化。

  比如,一些开发者发现,V4-Pro在北京时间8月13日凌晨发布之后不久,在面对复杂任务时,输出思考时间极短,输出效果也不佳。但几个小时后,V4-Pro又恢复了复杂任务长程思考的模式。

  与此同时,部分开发者在使用Anthropic API接入DeepSeek V4 Pro时发现模型“降智”,但在Codex等工具上使用效果较佳。

  鉴于此,开发者社区流传着V4-Pro可能在凌晨经历了一轮模型版本回滚的说法。

  “我觉得可能是版本在上线时的工程(infra)没做好,否则以Flash数倍的参数做出来的模型不该是这样。”一位华裔开发者指出。

  一位中国程序员则表示:“相比V4-Pro,我们更期待DeepSeek Harness。”

  模型厂商开始贴身肉搏

  V4-Pro正式版上线的时间窗口,恰逢全球大模型又一次密集发布期。

  8月12日至13日,AI圈上演头部模型的“多箭齐发”:阿里千问、DeepSeek、xAI三家在同一窗口发布新模型或重要更新。

  其中,阿里巴巴于8月12日深夜通过魔搭ModelScope社区正式开放Qwen3.8-Max模型权重。

  而同一时间,马斯克旗下的SpaceXAI于8月12日发布Grok 4.6。马斯克表示Grok 4.6“智能、快速且性价比超高”。

  SpaceXAI公布的数据则预示Grok模型已经开始挑战Fable 5在模型世界的铁王座——其官方文档显示,Grok 4.6在真实世界专业任务评测GDPVal-AA v2中取得1753 Elo,高于Claude Fable 5 Max的1741分与GPT-5.6 Sol Max的1728分。

  把视野拉长到整个夏季,全球模型发布的密度更为惊人。

  根据AI模型发布追踪器统计,从6月30日Anthropic发布Claude Sonnet 5开始,七款前沿或开放权重模型集中上线,涵盖Grok 4.5、GPT-5.6家族(Luna/Terra/Sol)、Gemini 3.6 Flash、Claude Opus 5、DeepSeek V4正式版、Kimi K3,以及GLM-5.2、Qwen3.7等开放权重版本。

  此次模型博弈的焦点,已经从逻辑、文本、数学等基础能力,转向更易产生实际价值的智能体工具链与总持有成本等要素。

郑重声明:用户在财富号/股吧/博客等社区发表的所有信息(包括但不限于文字、视频、音频、数据及图表)仅代表个人观点,与本网站立场无关,不对您构成任何投资建议,据此操作风险自担。请勿相信代客理财、免费荐股和炒股培训等宣传内容,远离非法证券活动。请勿添加发言用户的手机号码、公众号、微博、微信及QQ等信息,谨防上当受骗!
作者:您目前是匿名发表   登录 | 5秒注册 作者:,欢迎留言 退出发表新主题
温馨提示: 1.根据《证券法》规定,禁止编造、传播虚假信息或者误导性信息,扰乱证券市场;2.用户在本社区发表的所有资料、言论等仅代表个人观点,与本网站立场无关,不对您构成任何投资建议。用户应基于自己的独立判断,自行决定证券投资并承担相应风险。《东方财富社区管理规定》

扫一扫下载APP

扫一扫下载APP
信息网络传播视听节目许可证:0908328号 经营证券期货业务许可证编号:913101046312860336 违法和不良信息举报:021-61278686 举报邮箱:jubao@eastmoney.com
沪ICP证:沪B2-20070217 网站备案号:沪ICP备05006054号-11 沪公网安备 31010402000120号 版权所有:东方财富网 意见与建议:4000300059/952500