DeepSeek V4 Flash 公开测试上线,Agent 基准全面超越 V4 Pro 预览版
DeepSeek 于 7 月 31 日发布 V4 Flash API 公开测试版,模型名不变(deepseek-v4-flash),架构与预览版一致、仅重新后训练,Agent 能力却大幅跃升:Terminal Bench 2.1 达 82.7,DeepSWE 达 54.4,Cybergym 76.7,全面超越 V4 Pro 预览版。同时原生支持 Responses API,并专门针对 Codex 做了适配。
社区反馈比分数更有说服力:有开发者晒出 30 天 3467 次请求、3.2 亿 token 仅花费 4.55 美元,把 Flash 当作日常 90% 任务的驱动模型;多人表示它在多数 Agent 任务上与旗舰模型几乎没有体感差距。这个更小、更便宜的模型在 Agent 基准上逼近甚至反超更大、更贵的对手,配合 DeepSeek 一贯的低价缓存策略,正在把“够用”的门槛大幅拉低。
对 Agent 经济而言,成本曲线的下移比旗舰军备竞赛更值得关注:当小模型在工具调用、编码和终端任务上足够可靠,开发者选择默认模型的逻辑会从“最强”转向“够用且便宜”。