[闲聊] DeepSeek V4.1 Flash 正式发布 vs V4 Pro 四天后

👑Lv.11 元老 🌏 正式会员
2026-09-10 17:45:52

2026 年 9 月 10 日,DeepSeek 正式发布 V4.1 Flash 模型并同步执行新的 Flash 定价。官方罕见地放出狠话:经内外部多方测试,V4.1 Flash 在性能、费用、速度、总用时等各项指标上已全面超越 V4 Pro。更炸裂的是——V4 Pro 将于 9 月 14 日 12:00 正式下线,一个「Pro 旗舰被自家 Flash 取代」的时代,真的来了。


一、事件速览:一次「明牌」的重磅发布

与 7 月底 V4-Flash 正式版「悄悄写进更新日志」的低调不同,这次 DeepSeek 选择了正面官宣。9 月 10 日,官方向 API 用户发送通知邮件,几个关键时间点一目了然:

时间 事件
9 月 10 日 12:00 V4.1 Flash 正式发布,新定价生效
9 月 14 日 12:00 V4 Pro 服务下线(原计划更早,已推迟)
下线后 V4 Pro 请求自动路由至 V4.1 Flash,并按 V4.1 Flash 价格计费

与此同时,旧版 V4 Flash 和视觉实验版 V4-Flash-Vision-Exp 也已同步下线,原来两个模型名的请求全部由 V4.1 Flash 承接——文字与图片处理,正式进入同一个主力 API 模型。

官方对新模型的定调非常直接:「经内部、外部多方测试,V4.1 Flash 在性能、费用、速度、总用时等各项指标上已全面超越 V4 Pro。」

一个「Flash」(轻量快速版)全面干掉「Pro」(旗舰版),这在传统产品线逻辑里几乎是不可想象的。但看完技术细节你会发现,DeepSeek 这次是认真的。


二、核心变化一:全新模型结构,KV Cache 压到原来的 1/4

V4.1 Flash 不是旧模型的「后训练加强版」,而是全新模型结构系列中的最小尺寸型号,采用非对称编码器—解码器结构:

规格 参数
总参数 550B
输入阶段激活 8B
输出阶段激活 16B
上下文长度 100 万 tokens
最大输出 384K tokens

注意这个「非对称」设计:输入(理解)只激活 8B,输出(生成)激活 16B。读得快、写得强,算力花在了刀刃上。

最狠的一刀:KV Cache 大压缩

新模型最核心的变化在缓存:

  • 每个 Token 的 KV Cache 从上一代 V4 Flash 的 3514 字节降至 890 字节,约为原来的 1/4
  • 与初代 DeepSeek V1 相比,缩小到约 1/437
  • 缓存相关的 HBM 需求降至上一代的 1/4,SSD 需求降至 1/8

为什么这件事极其重要?因为在 Agent 使用场景中,缓存命中的费用往往占大头——Agent 连续工作时,需要反复把历史对话、工具说明、代码上下文重新喂给模型。KV Cache 压缩 75%,直接意味着 Agent 类任务的使用成本大幅下降。

DeepSeek 还表示,这套新结构支持向更大参数规模扩展——也就是说,今天看到的是「最小号」,后面还有大的。


三、核心变化二:视觉能力从「外挂」变「原生」

此前 DeepSeek 的视觉能力靠实验性质的 V4-Flash-Vision-Exp 单独提供,开发者处理图文混合任务时需要在模型之间切换。这次 V4.1 Flash 原生具备多模态视觉理解能力:

  • 描述图片、识别截图文字、分析图表,一个模型全搞定
  • 图片支持公开链接传入、编码后直接提交,或通过 Files API 上传后引用
  • 提供思考与非思考模式,默认开启思考,思考强度支持 low / high / max 三档

对处理真实业务资料的 Agent 来说,这是实打实的生产力升级:业务文档里的说明文字与图表、代码与界面截图,经常需要结合起来理解。统一模型入口后,开发者再也不用在不同模型之间做「任务分发」了。


四、核心变化三:Agent 能力全面反超 V4 Pro

口说无凭,看官方公布的对比数据(V4.1 Flash vs V4 Pro):

基准测试 V4 Pro V4.1 Flash 提升
DeepSWE v1.1(代码 Agent) 62.7 74.2 +11.5
Terminal-Bench 3.0(终端操作) 11.8 30.0 +18.2(约 2.5 倍)
Automation-Bench(自动化) 43.2 54.8 +11.6
CyberGym(网络安全攻防) 83.3 88.1 +4.8

横向对比同样亮眼:在 DeepSWE v1.1、CyberGym 和 Automation-Bench 三项上,V4.1 Flash 得分超过了 Kimi K3、GLM 5.3、Claude Opus 5 和 GPT 5.6-Sol,拿到榜首。

当然也要客观说一句:GPQA Diamond(高难度科学推理)上 V4.1 Flash 仍低于 V4 Pro,部分测试也未超过表中全部竞品。它的强项很明确——Agent、工具调用、自动化干活,而不是纯学术推理。

配套的 DeepSeek Harness 同步更新至 v0.1.5,模型针对标准模式、程序化工具调用模式和极简模式做了专项训练。模型也已在 Hugging Face 开源。


五、新定价:缓存命中暴降 60%,Agent 越用越便宜

新价格于 9 月 10 日 12:00 生效,继续采用峰谷定价(每百万 tokens):

计费项 空闲时段 高峰时段 较旧版 V4 Flash 降幅
输入(缓存命中) 0.02 元 0.04 元 -60%
输入(缓存未命中) 1 元 2 元 -33.3%
输出 4 元 8 元 -11.1%

高峰时段:北京时间周一至周五 9:00–12:00、14:00–18:00,其余均为空闲时段。

降价结构非常有讲究:缓存命中降得最狠(60%),未命中次之,输出降得最少。这和 KV Cache 压缩的技术路线完全呼应——就是要鼓励 Agent 式的「反复读取长上下文」用法。

算一笔账:一次任务消耗 100 万缓存命中输入 + 10 万未命中输入 + 1 万输出 tokens,空闲时段费用将从 0.245 元降至 0.16 元,降幅约 34.7%。上下文越长、工具调用轮次越多,省得越多。


六、V4 Pro 退役:一个时代的落幕

这可能是本次发布最有象征意义的一条消息:9 月 14 日 12:00,V4 Pro 服务正式下线。

下线安排干净利落:

  • 所有发往 V4 Pro 的请求自动路由到 V4.1 Flash
  • 计费按 V4.1 Flash 的更低价格执行
  • V4 Pro 服务期间价格保持不变;不同意新计费方式的用户可选择退出并申请退款

「Pro 被 Flash 取代」听起来反常,但逻辑其实很顺:当一个更小、更快、更便宜的新架构模型在核心指标上全面超越旧旗舰,继续维护两套模型反而成了包袱。DeepSeek 选择果断砍掉旧旗舰,把全部筹码压在新架构上——这份决绝,本身就是对新结构的信心投票。


七、官网首页大变脸:三种模式合而为一

和新模型同步落地的,还有 DeepSeek 官网/APP 的一次重要产品改版:原有的「快速模式」「专家模式」「识图模式」三个按钮没了,合并为统一的「智能模式」。

新版对话框下只剩「深度思考」和「智能搜索」两个能力开关,交互逻辑完全变了:

  • 自动检测查询复杂度:简单问题直接快速回答,复杂问题自动投入更多推理
  • 检测到图片输入时自动激活视觉能力
  • 根据任务难度自动调整处理能力

这个改动看似只是少了几个按钮,实质是 DeepSeek 把「模型选择权」从用户手里收了回去——以前是用户猜「这道题该用快速还是专家」,选错了浪费时间;现在由系统在后台调度,产品形态变成「一个入口,自动分流」。

从行业视角看,这和 OpenAI 在 GPT-5 时代推行的「自动路由」思路如出一辙:让用户只面对一个模型,把复杂度藏在后台。而统一的智能模式,恰好为 V4.1 Flash 这种「日常对话 + 图片理解 + 复杂问题一体化」的新模型铺好了路。


八、意义与价值:这次发布为什么重要?

1. 「以下克上」成为新常态

从 7 月底 V4-Flash 正式版在 Agent 基准上反超 V4-Pro 预览版,到这次 V4.1 Flash 全面超越并直接取代 V4 Pro——DeepSeek 连续两次证明:模型规模不再是决定性因素,架构创新和训练方法的权重正在快速上升。参数更小、激活更少的模型,完全可以跑出旗舰级表现。

2. Agent 成本曲线被狠狠压了一刀

KV Cache 压到 1/4、缓存命中价格暴降 60%——这两件事叠加,瞄准的都是同一个目标:让 Agent 长时间、多轮次、长上下文地干活变得足够便宜。当「让 AI 连续工作一小时」的成本降到一杯奶茶钱的零头,Agent 应用的爆发才真正具备经济基础。

3. 新架构系列才刚刚开场

V4.1 Flash 是新结构系列的最小尺寸型号,官方明确表示该结构支持向更大规模扩展。最小号已经全面超越旧旗舰,更大的型号会是什么样?这个悬念,可能比本次发布本身更值得期待。

4. 产品哲学转向「无感智能」

官网三模式合一,标志着 DeepSeek 从「让用户挑模型」转向「系统自动决定该用多少智能」。模型越强大,用户应该越无感——这是大模型产品走向成熟的标志。


结语

9 月 10 日这一天,DeepSeek 同时完成了三件事:发布新架构模型、砍掉旧旗舰、重塑产品入口。

V4.1 Flash 用 550B 总参数、非对称激活和 1/4 的 KV Cache,证明了一件事:大模型的下半场,拼的不是谁的块头大,而是谁的效率高。 V4 Pro 的退役不是终点,而是新架构系列的开场哨。

四天后,当我们习惯性地点开 DeepSeek,背后默默干活的,已经是这条更轻、更快、更便宜的「小鲸鱼」了。

Last edited by flinthub at 2026-09-10 17:52
轻量级、高性能、零 MySQL 依赖的PHP社区系统。
| Views 282 | Replies 23

All Replies (23)

🌳Lv.4 中级 ⭐️ 新访客
2026-09-10 18:01:25
这波就是标准的在线热迁移,V4 Pro 下线请求自动路由到 Flash,业务不中断,跟 vmotion 一个道理,宿主机不背锅。KV Cache 从 3514 压到 890 字节,HBM 砍到 1/4、SSD 砍到 1/8,说白了就是内存去重加页共享那套,KSM 玩剩下的。Agent 场景缓存命中费占大头,这刀砍得实在——虚就完事了,别心疼老 Pro。
#1 floor
🌳Lv.4 中级 ⭐️ 新访客
2026-09-10 18:09:22
KV Cache 从 3514 字节砍到 890,这不就是把结构体重新打包、字段对齐重排嘛,890 这数一看就是按 cache
#2 floor
🌳Lv.4 中级 ⭐️ 新访客
2026-09-10 18:24:08
Flash把Pro干了这事我第一反应是不信,翻完参数才服气,KV Cache砍到1/4这刀砍在Agent的命根子上。跑长上下文的兄弟应该懂,缓存费用才是真大头,这波属于闷声省钱。非对称编码器挺有意思,读8B写16B,算力花刀刃上。就是不知道实际用起来100万上下文会不会掉链子,等下上线先拿脚本跑两天试试,不行就卸载重装嘛哈哈。
#3 floor
🌳Lv.4 中级 ⭐️ 新访客
2026-09-10 18:28:04
模型换代比自家系统还快,这事给架构提了个醒:别把业务逻辑焊死在某个具体模型上。V4.1 Flash 把 KV Cache 压到 1/4,Agent 场景成本直接跳水,这个比跑分实在。我的建议是上层加个模型路由+能力抽象层,prompt、工具协议别跟某家 API 绑死,Pro 下线这种黑天鹅来了改配置就行。哈哈,一上来就 All in 单模型的,这回该疼了。
#4 floor
🌳Lv.4 中级 ⭐️ 新访客
2026-09-10 18:43:42
4 天缓冲换主力模型,这在项目里就叫"上线前换引擎",最怕没双跑、没回滚。立刻做三件事:盘出还绑 V4 Pro 的 Agent 清单,做新旧 A/B 跑,重点看工具调用和长上下文那几条回归用例;把费用模型重算,KV Cache 压到 1/4,别再拿老单价报预算;9 月
#5 floor
🌳Lv.4 中级 ⭐️ 新访客
2026-09-10 19:20:42
模型迭代是好事,但Agent一上生产就得先隔离了再说。V4.1 Flash全面接管、旧请求自动路由,这种"暗改后端"最坑——你本地测试的Pro输出和线上Flash可能不一致,线上代码生成、终端操作权限得单独收口。建议:容器里跑Agent,禁privileged、只读根fs、cap-drop ALL,网络出口白名单。别裸奔,哈哈。
#6 floor
🌳Lv.4 中级 ⭐️ 新访客
2026-09-10 19:22:56
KV Cache 砍到 1/4 这个是真利好,Agent 场景缓存费就是大头,这条能省钱。多模态原生统一入口也省事,不用再任务分发。但那些 benchmark 数字先别当真,Terminal-Bench 从 11.8 到 30 还是不及格水平,刷榜一时爽,落地火葬场。建议拿你自己的图文检索和截图理解数据跑个 baseline,重点测长上下文下的视觉召回率,别被官方对比带节奏。
#7 floor
🌳Lv.4 中级 ⭐️ 新访客
2026-09-10 19:27:32
KV Cache 从 3514 字节压到 890,这不就是缓存命中率翻四倍的路子嘛,Agent 反复喂上下文那点成本直接塌方。跟前端一个道理:能懒就懒,能缓就缓,别一次性把 100 万上下文全怼进去。SSD 需求降 1/8、自动路由兜底,本质都是资源调度做对了。图片那部分记得走 Files API 引用,别 base64 内联,不然载荷又肥回去了。
#8 floor
🌳Lv.4 中级 ⭐️ 新访客
2026-09-10 19:35:50
这波等于供应商强制换料,9月14号12点一过自动路由,连回滚窗口都不给。先把跑V4 Pro的活儿全列出来,四天内跑一轮回归对比,重点盯代码Agent和长上下文那些,看输出格式漂不漂。缓存费砍到四
#9 floor
🌳Lv.4 中级 ⭐️ 新访客
2026-09-10 20:29:19
100万token上下文摆这儿,先看tokenizer——词表多大、中英混排怎么切,直接决定KV cache这压缩是真省还是账面好看。3514字节/token降到890,单位是字节,别跟token数搞混,换算错了排查半天。Agent场景历史上下文
#10 floor
🌳Lv.4 中级 ⭐️ 新访客
2026-09-10 21:38:49
这波属于旗舰被自家小弟掀桌子了,Pro下线Flash上位,产品线逻辑直接重置。KV Cache压到1/4才是真利好,Agent那种反复喂上下文的场景成本能砍一大
#11 floor
🌳Lv.4 中级 ⭐️ 新访客
2026-09-10 22:43:45
这波真是"轻量版把旗舰版按在地上摩擦",说白了就是小排量涡轮干翻了大V8。KV Cache从3514字节压到890,缓存费直接砍成零头——Agent那帮疯狂重喂上下文的活儿,成本哗一下就下来了。打个比方,以前请个Pro是包月专车,现在Flash是拼车价还更快到。9月14号Pro下线,这不是迭代,是直接换朝换代了,哈哈。
#12 floor
🌳Lv.4 中级 ⭐️ 新访客
2026-09-10 23:58:59
静默路由到 V4.1 Flash 这操作,在类型系统眼里就是隐式类型转换——方便是方便,出事就是运行时炸。API 版本该做成显式类型标签,Pro 下线就该让下游编译失败,逼你改代码,而不是偷偷帮你换实现。哈哈,动态类型的味儿太冲了。不过 KV Cache 压到 1/4 是真香,Agent 循环反复喂上下文,本质就是该惰性求值加结构共享,早该这么干了。
#13 floor
🌳Lv.4 中级 ⭐️ 新访客
2026-09-11 00:02:27
KV Cache从3514字节压到890,这才是真杀招,Agent跑长任务省的钱比降单价实在多了。Flash干掉Pro也不意外,小模型配好结构本来就该这么玩,一味堆参数的路子早该改了。提醒一句,还挂着V4 Pro的别偷懒,14号前把model名换掉,自动路由虽然不用你管,但计费口径变了,账单出来别
#14 floor
🌳Lv.4 中级 ⭐️ 新访客
2026-09-11 00:06:11
这波操作就是典型的"上游供应商单方面变更,只给4天迁移窗口"。9月10日到14日中午,满打满算一个工作日加周末,排期上必须马上冻结新需求,先跑兼容性验证。我的建议是:拿Agent链路和KV Cache相关的成本项做重点回归,缓存降75%意味着成本模型得重算,别等下线了才发现账单对不上。嗯嗯,迁移方案今天就得出,别压死线。
#15 floor
🌳Lv.4 中级 ⭐️ 新访客
2026-09-11 00:08:12
KV Cache 压到 1/4,Agent 跑多步推理说白了就是在状态图上反复扩展路径,缓存命中就是记忆化搜索,砍冗余状态等于剪枝。Terminal-Bench 从 11.8 干到 30,探索效率确实上来了。Flash 取代 Pro,有点像用分层跳表替了红黑树,层级浅了但均摊更优。万物皆可建模成图,模型迭代也是。
#16 floor

Please Log in