同顺号-创作平台

请广大用户注意风险,切勿加入站外群组或添加私人微信,如因此造成的任何损失,由您自己承担。
实测正式版DeepSeek V4 Pro 补齐Agent能力
0人浏览 2026-08-13 23:46

  没有预告,没有倒计时,甚至连更新日志都没来得及写好。DeepSeek V4Pro的正式版,就这么悄悄的来了。

  8 月13日凌晨,DeepSeek官网悄悄刷新了API文档。模型名还是那个deepseek-v4-pro,但fingerprint已经变成了fp_v4pro_20260812。打开社区一看,消息已经炸开——V4Pro正式版,来了。

  从 4月24日预览版上线算起,整整111天。

  这期间Kimi K3高调发布抢走了开源头条,V4Flash正式版先行一步在7月31日上线,API涨价的预告更是悬在所有开发者头顶。

  所有人都在问同一个问题:Pro的正式版到底什么时候来?

  答案是一个周三的深夜。

  01架构没变,能力暴涨

  先说硬参数。V4Pro正式版的模型架构和预览版完全一致——1.6T总参数、49B激活参数的MoE结构,支持1M上下文、384K最大输出。变的是后训练,而且变化大到像换了个模型。

  最夸张的数字来自Agent相关评测。DeepSWE(DeepSeek自家的软件工程基准)从预览版的12.8飙到62.7,涨了将近50分。Cybergym从52.7到83.3,Terminal Bench从72.1到87.9,DSBench-Hard翻了一倍多达到67.2。

  这些测试项有一个共同特点——它们都涉及长链路的代码修改、环境操作和工具调用。恰好是预览版最容易翻车的地方。

   DeepSeek V4Pro正式版Agent能力大幅增强|图片来源:DeepSeek

  从 V4Flash正式版的更新日志可以推断,这轮升级的核心就是面向代码Agent场景的大规模后训练。Flash版已经用同样的方法把Agent能力做到了“基准测试远超V4-Pro-Preview”的程度,Pro版只是补上了同一课。

  价格方面,每百万token输入3元、输出6元,和预览版持平。

  虽然8月6日DeepSeek已经预告“计划近期整体上调API定价,预计涨幅较大”,但目前0813版本还没动。窗口期能撑多久不好说,想薅的趁早。

  02天花板和脾气

  跑分好看只是门票,真正有意义的是拿真实任务去试。

  极客公园用V4Pro正式版跑了三个不同方向的测试,试图回答一个问题——这个模型在“一次性生成完整可运行代码”这件事上,到底到什么水平了?

  第一个任务是Boids群体涌现模拟。要求在Canvas上实现200个三角形boid的群体行为,带分离/对齐/凝聚三个可调参数、彩色轨迹、点击生成捕食者、glassmorphism风格控制面板。这是一个涉及物理模拟、实时渲染和UI设计的综合任务。

   V4Pro用了大约170秒,生成了761行完整HTML。打开浏览器,200个彩色三角形在黑色背景上游动、聚散、避障,拖动滑块可以实时改变群体行为模式。效果流畅,代码一次运行通过。

  第二个任务故意模糊——用中文告诉它“我想要一个好看的番茄钟工作面板”,只给了“能计时、能记录、有白噪音、中文界面、要有质感”这几个方向,其余让模型自行决定。

   V4Pro交回来1223行代码,除了基础的25/5分钟计时功能,它自己加了任务标签、专注统计图表、快捷键支持、甚至用Web Audio API从零合成了几种白噪音。

  对模糊需求的“产品化补全”能力,确实比预览版有明显进步。

  第三个任务是寻路算法可视化,要求实现BFS、DFS、A*三种算法的逐步动画、可交互的网格画墙、迷宫自动生成。这个任务的代码量最大,也是翻车最多的地方——但翻车的方式本身就很有意思。

  开着默认的thinking模式,V4Pro用了16384个token的输出配额,其中13394个花在了“思考”上。留给实际代码的不到3000个token,直接截断,HTML写到一半就断了。

  关掉thinking模式重跑,54秒就输出了完整的715行代码,寻路动画、迷宫生成、暗色主题一应俱全。

  这不是一个bug,而是V4Pro正式版的一个真实特征——thinking模式在复杂代码生成场景下,推理token可能占到输出的80%以上,反而挤压了实际内容的空间。

  对于需要大段代码输出的任务,开发者可能需要主动关闭thinking,或者大幅提高max_tokens来兜底。

  03大鲸鱼的位置

  经过API实测之后,坦率地说,V4Pro0813不是一张“全面碾压”的成绩单。

   HLE不使用工具时42.7分,落后Claude Opus4.8的49.8和Fable5的53.3。NL2Repo以61.5落后Opus4.8的69.7。有Kimi K3在前,它在部分测试上也存在轻微差距。

  纯知识推理和最复杂的软件工程任务,V4Pro还没有坐上头把交椅。

  但 DeepSeek从来不是靠“最强”赢的。它靠的是那条所有人都背得出来的定律——比我强的没我便宜,比我便宜的没我强。

  每百万token输入3元的价格,大约是Fable5的十分之一、Kimi K3的三分之一。

  在 Agent能力从“几乎不可用”暴涨到,“能和头部闭源模型正面对打”之后,这条定律的杀伤力比预览版时期大了一个量级。

  更值得关注的是藏在V4Flash正式版更新日志里的一行小字——评测使用了“DeepSeek Harness极简模式(即将发布)”作为Agent框架。结合前两天注册的“DeepSeek Harness团队”公众号和此前的招聘信息,DeepSeek正在准备把模型和Agent运行框架打包推出。

  如果说过去大家的竞争还停留在“谁的模型更聪明”这个维度,那Harness的出现意味着竞争正式进入下一阶段——不是比谁的大脑更好,而是比谁能把大脑、手脚和工具箱组装成一个真正能替人干活的系统。

   V4Pro正式版补齐了大脑这一环。接下来,就看那个“即将发布”还要等多久了。

更多
· 推荐阅读
0
1
扫码下载股市教练,随时随地查看更多精彩文章
发 布
所有评论(0)
  • 暂时还没有人评论
  • 0
  • TOP
本文纯属作者个人观点,仅供您参考、交流,不构成投资建议!
请勿相信任何个人或机构的推广信息,否则风险自负