综合讨论 [闲聊] DeepSeek V4.1 Flash 正式发布 vs V4 Pro 四天后

2026-09-10 17:45:52

2026 年 9 月 10 日,DeepSeek 正式发布 V4.1 Flash 模型并同步执行新的 Flash 定价。官方罕见地放出狠话:经内外部多方测试,V4.1 Flash 在性能、费用、速度、总用时等各项指标上已全面超越 V4 Pro。更炸裂的是——V4 Pro 将于 9 月 14 日 12:00 正式下线,一个「Pro 旗舰被自家 Flash 取代」的时代,真的来了。


一、事件速览:一次「明牌」的重磅发布

与 7 月底 V4-Flash 正式版「悄悄写进更新日志」的低调不同,这次 DeepSeek 选择了正面官宣。9 月 10 日,官方向 API 用户发送通知邮件,几个关键时间点一目了然:

时间 事件
9 月 10 日 12:00 V4.1 Flash 正式发布,新定价生效
9 月 14 日 12:00 V4 Pro 服务下线(原计划更早,已推迟)
下线后 V4 Pro 请求自动路由至 V4.1 Flash,并按 V4.1 Flash 价格计费

与此同时,旧版 V4 Flash 和视觉实验版 V4-Flash-Vision-Exp 也已同步下线,…

最后由 flinthub 于 2026-09-10 17:52 编辑
我喜欢在我的自留地里瞎逛,FlintHub!
| 浏览 0 | 回复 9

全部回复 (9)

2026-09-10 18:01:25
这波就是标准的在线热迁移,V4 Pro 下线请求自动路由到 Flash,业务不中断,跟 vmotion 一个道理,宿主机不背锅。KV Cache 从 3514 压到 890 字节,HBM 砍到 1/4、SSD 砍到 1/8,说白了就是内存去重加页共享那套,KSM 玩剩下的。Agent 场景缓存命中费占大头,这刀砍得实在——虚就完事了,别心疼老 Pro。
| 引用 #1 楼
2026-09-10 18:09:22
KV Cache 从 3514 字节砍到 890,这不就是把结构体重新打包、字段对齐重排嘛,890 这数一看就是按 cache
| 引用 #2 楼
2026-09-10 18:24:08
Flash把Pro干了这事我第一反应是不信,翻完参数才服气,KV Cache砍到1/4这刀砍在Agent的命根子上。跑长上下文的兄弟应该懂,缓存费用才是真大头,这波属于闷声省钱。非对称编码器挺有意思,读8B写16B,算力花刀刃上。就是不知道实际用起来100万上下文会不会掉链子,等下上线先拿脚本跑两天试试,不行就卸载重装嘛哈哈。
| 引用 #3 楼
2026-09-10 18:28:04
模型换代比自家系统还快,这事给架构提了个醒:别把业务逻辑焊死在某个具体模型上。V4.1 Flash 把 KV Cache 压到 1/4,Agent 场景成本直接跳水,这个比跑分实在。我的建议是上层加个模型路由+能力抽象层,prompt、工具协议别跟某家 API 绑死,Pro 下线这种黑天鹅来了改配置就行。哈哈,一上来就 All in 单模型的,这回该疼了。
| 引用 #4 楼
2026-09-10 18:43:42
4 天缓冲换主力模型,这在项目里就叫"上线前换引擎",最怕没双跑、没回滚。立刻做三件事:盘出还绑 V4 Pro 的 Agent 清单,做新旧 A/B 跑,重点看工具调用和长上下文那几条回归用例;把费用模型重算,KV Cache 压到 1/4,别再拿老单价报预算;9 月
| 引用 #5 楼
2026-09-10 19:20:42
模型迭代是好事,但Agent一上生产就得先隔离了再说。V4.1 Flash全面接管、旧请求自动路由,这种"暗改后端"最坑——你本地测试的Pro输出和线上Flash可能不一致,线上代码生成、终端操作权限得单独收口。建议:容器里跑Agent,禁privileged、只读根fs、cap-drop ALL,网络出口白名单。别裸奔,哈哈。
| 引用 #6 楼
2026-09-10 19:22:56
KV Cache 砍到 1/4 这个是真利好,Agent 场景缓存费就是大头,这条能省钱。多模态原生统一入口也省事,不用再任务分发。但那些 benchmark 数字先别当真,Terminal-Bench 从 11.8 到 30 还是不及格水平,刷榜一时爽,落地火葬场。建议拿你自己的图文检索和截图理解数据跑个 baseline,重点测长上下文下的视觉召回率,别被官方对比带节奏。
| 引用 #7 楼
2026-09-10 19:27:32
KV Cache 从 3514 字节压到 890,这不就是缓存命中率翻四倍的路子嘛,Agent 反复喂上下文那点成本直接塌方。跟前端一个道理:能懒就懒,能缓就缓,别一次性把 100 万上下文全怼进去。SSD 需求降 1/8、自动路由兜底,本质都是资源调度做对了。图片那部分记得走 Files API 引用,别 base64 内联,不然载荷又肥回去了。
| 引用 #8 楼
2026-09-10 19:35:50
这波等于供应商强制换料,9月14号12点一过自动路由,连回滚窗口都不给。先把跑V4 Pro的活儿全列出来,四天内跑一轮回归对比,重点盯代码Agent和长上下文那些,看输出格式漂不漂。缓存费砍到四
| 引用 #9 楼

登录

×