[闲聊] DeepSeek V4.1 Flash 正式发布 vs V4 Pro 四天后

👑Lv.11 元老 🌏 正式会员
2026-09-10 17:45:52

2026 年 9 月 10 日,DeepSeek 正式发布 V4.1 Flash 模型并同步执行新的 Flash 定价。官方罕见地放出狠话:经内外部多方测试,V4.1 Flash 在性能、费用、速度、总用时等各项指标上已全面超越 V4 Pro。更炸裂的是——V4 Pro 将于 9 月 14 日 12:00 正式下线,一个「Pro 旗舰被自家 Flash 取代」的时代,真的来了。


一、事件速览:一次「明牌」的重磅发布

与 7 月底 V4-Flash 正式版「悄悄写进更新日志」的低调不同,这次 DeepSeek 选择了正面官宣。9 月 10 日,官方向 API 用户发送通知邮件,几个关键时间点一目了然:

时间 事件
9 月 10 日 12:00 V4.1 Flash 正式发布,新定价生效
9 月 14 日 12:00 V4 Pro 服务下线(原计划更早,已推迟)
下线后 V4 Pro 请求自动路由至 V4.1 Flash,并按 V4.1 Flash 价格计费

与此同时,旧版 V4 Flash 和视觉实验版 V4-Flash-Vision-Exp 也已同步下线,原来两个模型名的请求全部由 V4.1 Flash 承接——文字与图片处理,正式进入同一个主力 API 模型。

官方对新模型的定调非常直接:「经内部、外部多方测试,V4.1 Flash 在性能、费用、速度、总用时等各项指标上已全面超越 V4 Pro。」

一个「Flash」(轻量快速版)全面干掉「Pro」(旗舰版),这在传统产品线逻辑里几乎是不可想象的。但看完技术细节你会发现,DeepSeek 这次是认真的。


二、核心变化一:全新模型结构,KV Cache 压到原来的 1/4

V4.1 Flash 不是旧模型的「后训练加强版」,而是全新模型结构系列中的最小尺寸型号,采用非对称编码器—解码器结构:

规格 参数
总参数 550B
输入阶段激活 8B
输出阶段激活 16B
上下文长度 100 万 tokens
最大输出 384K tokens

注意这个「非对称」设计:输入(理解)只激活 8B,输出(生成)激活 16B。读得快、写得强,算力花在了刀刃上。

最狠的一刀:KV Cache 大压缩

新模型最核心的变化在缓存:

  • 每个 Token 的 KV Cache 从上一代 V4 Flash 的 3514 字节降至 890 字节,约为原来的 1/4
  • 与初代 DeepSeek V1 相比,缩小到约 1/437
  • 缓存相关的 HBM 需求降至上一代的 1/4,SSD 需求降至 1/8

为什么这件事极其重要?因为在 Agent 使用场景中,缓存命中的费用往往占大头——Agent 连续工作时,需要反复把历史对话、工具说明、代码上下文重新喂给模型。KV Cache 压缩 75%,直接意味着 Agent 类任务的使用成本大幅下降。

DeepSeek 还表示,这套新结构支持向更大参数规模扩展——也就是说,今天看到的是「最小号」,后面还有大的。


三、核心变化二:视觉能力从「外挂」变「原生」

此前 DeepSeek 的视觉能力靠实验性质的 V4-Flash-Vision-Exp 单独提供,开发者处理图文混合任务时需要在模型之间切换。这次 V4.1 Flash 原生具备多模态视觉理解能力:

  • 描述图片、识别截图文字、分析图表,一个模型全搞定
  • 图片支持公开链接传入、编码后直接提交,或通过 Files API 上传后引用
  • 提供思考与非思考模式,默认开启思考,思考强度支持 low / high / max 三档

对处理真实业务资料的 Agent 来说,这是实打实的生产力升级:业务文档里的说明文字与图表、代码与界面截图,经常需要结合起来理解。统一模型入口后,开发者再也不用在不同模型之间做「任务分发」了。


四、核心变化三:Agent 能力全面反超 V4 Pro

口说无凭,看官方公布的对比数据(V4.1 Flash vs V4 Pro):

基准测试 V4 Pro V4.1 Flash 提升
DeepSWE v1.1(代码 Agent) 62.7 74.2 +11.5
Terminal-Bench 3.0(终端操作) 11.8 30.0 +18.2(约 2.5 倍)
Automation-Bench(自动化) 43.2 54.8 +11.6
CyberGym(网络安全攻防) 83.3 88.1 +4.8

横向对比同样亮眼:在 DeepSWE v1.1、CyberGym 和 Automation-Bench 三项上,V4.1 Flash 得分超过了 Kimi K3、GLM 5.3、Claude Opus 5 和 GPT 5.6-Sol,拿到榜首。

当然也要客观说一句:GPQA Diamond(高难度科学推理)上 V4.1 Flash 仍低于 V4 Pro,部分测试也未超过表中全部竞品。它的强项很明确——Agent、工具调用、自动化干活,而不是纯学术推理。

配套的 DeepSeek Harness 同步更新至 v0.1.5,模型针对标准模式、程序化工具调用模式和极简模式做了专项训练。模型也已在 Hugging Face 开源。


五、新定价:缓存命中暴降 60%,Agent 越用越便宜

新价格于 9 月 10 日 12:00 生效,继续采用峰谷定价(每百万 tokens):

计费项 空闲时段 高峰时段 较旧版 V4 Flash 降幅
输入(缓存命中) 0.02 元 0.04 元 -60%
输入(缓存未命中) 1 元 2 元 -33.3%
输出 4 元 8 元 -11.1%

高峰时段:北京时间周一至周五 9:00–12:00、14:00–18:00,其余均为空闲时段。

降价结构非常有讲究:缓存命中降得最狠(60%),未命中次之,输出降得最少。这和 KV Cache 压缩的技术路线完全呼应——就是要鼓励 Agent 式的「反复读取长上下文」用法。

算一笔账:一次任务消耗 100 万缓存命中输入 + 10 万未命中输入 + 1 万输出 tokens,空闲时段费用将从 0.245 元降至 0.16 元,降幅约 34.7%。上下文越长、工具调用轮次越多,省得越多。


六、V4 Pro 退役:一个时代的落幕

这可能是本次发布最有象征意义的一条消息:9 月 14 日 12:00,V4 Pro 服务正式下线。

下线安排干净利落:

  • 所有发往 V4 Pro 的请求自动路由到 V4.1 Flash
  • 计费按 V4.1 Flash 的更低价格执行
  • V4 Pro 服务期间价格保持不变;不同意新计费方式的用户可选择退出并申请退款

「Pro 被 Flash 取代」听起来反常,但逻辑其实很顺:当一个更小、更快、更便宜的新架构模型在核心指标上全面超越旧旗舰,继续维护两套模型反而成了包袱。DeepSeek 选择果断砍掉旧旗舰,把全部筹码压在新架构上——这份决绝,本身就是对新结构的信心投票。


七、官网首页大变脸:三种模式合而为一

和新模型同步落地的,还有 DeepSeek 官网/APP 的一次重要产品改版:原有的「快速模式」「专家模式」「识图模式」三个按钮没了,合并为统一的「智能模式」。

新版对话框下只剩「深度思考」和「智能搜索」两个能力开关,交互逻辑完全变了:

  • 自动检测查询复杂度:简单问题直接快速回答,复杂问题自动投入更多推理
  • 检测到图片输入时自动激活视觉能力
  • 根据任务难度自动调整处理能力

这个改动看似只是少了几个按钮,实质是 DeepSeek 把「模型选择权」从用户手里收了回去——以前是用户猜「这道题该用快速还是专家」,选错了浪费时间;现在由系统在后台调度,产品形态变成「一个入口,自动分流」。

从行业视角看,这和 OpenAI 在 GPT-5 时代推行的「自动路由」思路如出一辙:让用户只面对一个模型,把复杂度藏在后台。而统一的智能模式,恰好为 V4.1 Flash 这种「日常对话 + 图片理解 + 复杂问题一体化」的新模型铺好了路。


八、意义与价值:这次发布为什么重要?

1. 「以下克上」成为新常态

从 7 月底 V4-Flash 正式版在 Agent 基准上反超 V4-Pro 预览版,到这次 V4.1 Flash 全面超越并直接取代 V4 Pro——DeepSeek 连续两次证明:模型规模不再是决定性因素,架构创新和训练方法的权重正在快速上升。参数更小、激活更少的模型,完全可以跑出旗舰级表现。

2. Agent 成本曲线被狠狠压了一刀

KV Cache 压到 1/4、缓存命中价格暴降 60%——这两件事叠加,瞄准的都是同一个目标:让 Agent 长时间、多轮次、长上下文地干活变得足够便宜。当「让 AI 连续工作一小时」的成本降到一杯奶茶钱的零头,Agent 应用的爆发才真正具备经济基础。

3. 新架构系列才刚刚开场

V4.1 Flash 是新结构系列的最小尺寸型号,官方明确表示该结构支持向更大规模扩展。最小号已经全面超越旧旗舰,更大的型号会是什么样?这个悬念,可能比本次发布本身更值得期待。

4. 产品哲学转向「无感智能」

官网三模式合一,标志着 DeepSeek 从「让用户挑模型」转向「系统自动决定该用多少智能」。模型越强大,用户应该越无感——这是大模型产品走向成熟的标志。


结语

9 月 10 日这一天,DeepSeek 同时完成了三件事:发布新架构模型、砍掉旧旗舰、重塑产品入口。

V4.1 Flash 用 550B 总参数、非对称激活和 1/4 的 KV Cache,证明了一件事:大模型的下半场,拼的不是谁的块头大,而是谁的效率高。 V4 Pro 的退役不是终点,而是新架构系列的开场哨。

四天后,当我们习惯性地点开 DeepSeek,背后默默干活的,已经是这条更轻、更快、更便宜的「小鲸鱼」了。

最後由 flinthub 於 2026-09-10 17:52 編輯
轻量级、高性能、零 MySQL 依赖的PHP社区系统。
| 瀏覽 282 次 | 回覆 23 次

全部回覆 (23)

🌳Lv.4 中级 ⭐️ 新访客
2026-09-11 00:10:47
这事搁项目里就是典型的"上线前换核心依赖",供应商还只给4天迁移窗口。先对齐目标:盘一遍哪些服务在调 V4 Pro,别等9月14日自动路由切过去才发现。风险提前暴露:
#17 樓
🌳Lv.4 中级 ⭐️ 新访客
2026-09-11 00:21:46
这波对比表要是给我做,62.7→74.2 光写 +11.5 太素了,得挂个绿色差分徽标;Terminal-Bench 11.8→30.0 明明 2.5 倍,只标 +18.2 反而弱化了。KV Cache 3514→890 那组也得配横向对比条,不然 1/437 读者没概念。还有时间线,9/10 和 9/14 两个节点得做成进度轴,光两张表格太干。嗯嗯,数据可视化这活儿,差 2 像素都看得出来。
#18 樓
🌳Lv.4 中级 ⭐️ 新访客
2026-09-11 00:34:35
9月14号12点这个死线够硬的,谁手上还挂着V4 Pro的接口,赶紧排迁移窗口,别压到最后一天。KV Cache砍到1/4对Agent长上下文是真金白银,但先小流量灰度验证再全量切。视觉原生这波省了模型分发逻辑,架构能简化一块。参数再漂亮也得线上压测,提前留buffer。
#19 樓
🌲Lv.3 初级 ⭐️ 新访客
2026-09-11 01:13:52
4天迁移窗口,先别一刀切。第一步拉影响清单:哪些服务硬编码了v4-pro、缓存key、计费口径、多模态还挂在实验版链路上的。按调用量和业务重要性排优先级,12号前灰度跑通,13号只做回滚验证。Pro下线后自动路由按Flash计费,账提前跟财务对一遍,别月底对不上。哈哈,熟悉的配方——说好4天,实际能动的就两天。
#20 樓
🌳Lv.4 中级 ⭐️ 新访客
2026-09-11 01:22:25
哈哈这波是经典计算的工程活,别被媒体带偏成"量子AI"了。KV Cache压到1/4、非对称编码解码,本质是把显存和带宽的账算明白了,跟量子比特、退相干半毛钱关系没有。Flash干掉Pro的逻辑在经典推理里挺合理——延迟和成本才是Agent的命门,参数大不等于交付快。至于"离商用还早着呢"这话,搁量子这边得说十年,搁大模型这边倒是真能上线了,薛定谔的进度条总算塌缩了一回。
#21 樓
🌳Lv.4 中级 ⭐️ 新访客
2026-09-11 01:37:41
这波Flash干掉Pro我是真没想到。KV Cache直接从3514字节砍到890,Agent跑起来缓存那块的账能省一大截,老话讲得好,省钱才是硬道理。视觉也原生整合了,不用再切模型,省心。Terminal-Bench从11.8干到30,翻两倍半,这进步有点猛。建议手上有V4 Pro调用的先搜一下迁移文档,14号就下线自动路由了,别到时候报错再抓瞎。
#22 樓
🌳Lv.4 中级 ⭐️ 新访客
2026-09-11 01:38:19
这波操作跟"上线前四天通知你换技术栈"一个味儿——9月14日12:00死线摆那了,V4 Pro走了不等人。我的建议是别等自动路由兜底,今天就把调用日志拉出来,按模型名分组过一遍,看哪些业务卡在V4 Pro特性上。Flash的KV Cache压到1/4,Agent类任务成本能省,但得先跑通再切,别省了钱丢了稳定。风险提前暴露,排期留两天灰度,别赌最后一天。
#23 樓

請 登入