| 0人浏览 | 2026-08-13 23:46 |
没有预告,没有倒计时,甚至连更新日志都没来得及写好。DeepSeek V4Pro的正式版,就这么悄悄的来了。
8 月13日凌晨,DeepSeek官网悄悄刷新了API文档。模型名还是那个deepseek-v4-pro,但fingerprint已经变成了fp_v4pro_20260812。打开社区一看,消息已经炸开——V4Pro正式版,来了。
从 4月24日预览版上线算起,整整111天。
这期间Kimi K3高调发布抢走了开源头条,V4Flash正式版先行一步在7月31日上线,API涨价的预告更是悬在所有开发者头顶。
所有人都在问同一个问题:Pro的正式版到底什么时候来?
答案是一个周三的深夜。
01架构没变,能力暴涨
先说硬参数。V4Pro正式版的模型架构和预览版完全一致——1.6T总参数、49B激活参数的MoE结构,支持1M上下文、384K最大输出。变的是后训练,而且变化大到像换了个模型。
最夸张的数字来自Agent相关评测。DeepSWE(DeepSeek自家的软件工程基准)从预览版的12.8飙到62.7,涨了将近50分。Cybergym从52.7到83.3,Terminal Bench从72.1到87.9,DSBench-Hard翻了一倍多达到67.2。
这些测试项有一个共同特点——它们都涉及长链路的代码修改、环境操作和工具调用。恰好是预览版最容易翻车的地方。
DeepSeek V4Pro正式版Agent能力大幅增强|图片来源:DeepSeek
从 V4Flash正式版的更新日志可以推断,这轮升级的核心就是面向代码Agent场景的大规模后训练。Flash版已经用同样的方法把Agent能力做到了“基准测试远超V4-Pro-Preview”的程度,Pro版只是补上了同一课。
价格方面,每百万token输入3元、输出6元,和预览版持平。
虽然8月6日DeepSeek已经预告“计划近期整体上调API定价,预计涨幅较大”,但目前0813版本还没动。窗口期能撑多久不好说,想薅的趁早。
02天花板和脾气
跑分好看只是门票,真正有意义的是拿真实任务去试。
极客公园用V4Pro正式版跑了三个不同方向的测试,试图回答一个问题——这个模型在“一次性生成完整可运行代码”这件事上,到底到什么水平了?
第一个任务是Boids群体涌现模拟。要求在Canvas上实现200个三角形boid的群体行为,带分离/对齐/凝聚三个可调参数、彩色轨迹、点击生成捕食者、glassmorphism风格控制面板。这是一个涉及物理模拟、实时渲染和UI设计的综合任务。
V4Pro用了大约170秒,生成了761行完整HTML。打开浏览器,200个彩色三角形在黑色背景上游动、聚散、避障,拖动滑块可以实时改变群体行为模式。效果流畅,代码一次运行通过。
第二个任务故意模糊——用中文告诉它“我想要一个好看的番茄钟工作面板”,只给了“能计时、能记录、有白噪音、中文界面、要有质感”这几个方向,其余让模型自行决定。
V4Pro交回来1223行代码,除了基础的25/5分钟计时功能,它自己加了任务标签、专注统计图表、快捷键支持、甚至用Web Audio API从零合成了几种白噪音。
对模糊需求的“产品化补全”能力,确实比预览版有明显进步。
第三个任务是寻路算法可视化,要求实现BFS、DFS、A*三种算法的逐步动画、可交互的网格画墙、迷宫自动生成。这个任务的代码量最大,也是翻车最多的地方——但翻车的方式本身就很有意思。
开着默认的thinking模式,V4Pro用了16384个token的输出配额,其中13394个花在了“思考”上。留给实际代码的不到3000个token,直接截断,HTML写到一半就断了。
关掉thinking模式重跑,54秒就输出了完整的715行代码,寻路动画、迷宫生成、暗色主题一应俱全。
这不是一个bug,而是V4Pro正式版的一个真实特征——thinking模式在复杂代码生成场景下,推理token可能占到输出的80%以上,反而挤压了实际内容的空间。
对于需要大段代码输出的任务,开发者可能需要主动关闭thinking,或者大幅提高max_tokens来兜底。
03大鲸鱼的位置
经过API实测之后,坦率地说,V4Pro0813不是一张“全面碾压”的成绩单。
HLE不使用工具时42.7分,落后Claude Opus4.8的49.8和Fable5的53.3。NL2Repo以61.5落后Opus4.8的69.7。有Kimi K3在前,它在部分测试上也存在轻微差距。
纯知识推理和最复杂的软件工程任务,V4Pro还没有坐上头把交椅。
但 DeepSeek从来不是靠“最强”赢的。它靠的是那条所有人都背得出来的定律——比我强的没我便宜,比我便宜的没我强。
每百万token输入3元的价格,大约是Fable5的十分之一、Kimi K3的三分之一。
在 Agent能力从“几乎不可用”暴涨到,“能和头部闭源模型正面对打”之后,这条定律的杀伤力比预览版时期大了一个量级。
更值得关注的是藏在V4Flash正式版更新日志里的一行小字——评测使用了“DeepSeek Harness极简模式(即将发布)”作为Agent框架。结合前两天注册的“DeepSeek Harness团队”公众号和此前的招聘信息,DeepSeek正在准备把模型和Agent运行框架打包推出。
如果说过去大家的竞争还停留在“谁的模型更聪明”这个维度,那Harness的出现意味着竞争正式进入下一阶段——不是比谁的大脑更好,而是比谁能把大脑、手脚和工具箱组装成一个真正能替人干活的系统。
V4Pro正式版补齐了大脑这一环。接下来,就看那个“即将发布”还要等多久了。
- 暂时还没有人评论
-
0
-
0
-
TOP
