先说结论:DeepSeek V4.1 Flash 是 2026 年 9 月 10 日发布的”全新结构小尺寸模型”,官方称它在基准测试中超过了自家旗舰 V4 Pro,价格还更低。但它上线不到两周,官方就经历了三次政策反转——先是宣布 V4 Pro 全部路由到 Flash,随后推迟下线,最后又宣布继续提供 V4 Pro 且计费不变。至今官方文档里那则”9 月 14 日路由”的公告仍未同步更新,很多人照着旧公告做技术选型,直接踩坑。这篇把你需要知道的版本、价格、入口和选型依据一次讲清,凡是可核实的数字我都标了出处。
一、V4.1 Flash 到底是什么?三个关键数字
官方 API 文档(api-docs.deepseek.com,2026 年 9 月 10 日公告)给出的定义是:DeepSeek V4.1 Flash 是”全新模型结构系列中的最小尺寸模型”,具备原生多模态视觉理解能力。三个数字值得记牢:
- 552B 总参数,MoE 架构——但采用了新的 Causal-Encoder-Decoder 非对称结构,输入激活只有 8B、输出激活 16B。这是它能把成本压下来的根本原因:能力靠总参数撑,成本只看激活参数。
- 1M 上下文 + 最大 384K 输出——和 V4 Pro 同级,长文档、长代码库场景不用降级。
- KV Cache 需求降到上一代的 1/4——官方原文是”对 HBM 的需求减少到 1/4,对 SSD 的需求减少到 1/8″。对 Agent 这类反复读长上下文的场景,缓存费往往是账单大头,这一项压缩比降价本身更值钱。
另外两个容易被忽略的能力点:支持思考模式与非思考模式切换,也支持 reasoning_effort 分级调节思考强度(low / high / max);官方兼容 OpenAI ChatCompletions、Anthropic 和 Responses 三种接口格式。
二、★ 三次政策反转:别照着旧公告做选型
这是本文最想提醒你的一段。V4.1 Flash 上线前后,DeepSeek 对 V4 Pro 的去留改过三次口,我按公开报道把时间线捋直了:
| 时间 | 官方口径 | 出处 |
|---|---|---|
| 9 月 9 日 | 宣布在 V4.1 Pro 上线前,把对 V4 Pro 的请求全部路由到 V4.1 Flash,按 Flash 单价计费 | IT之家(9-11 报道回溯) |
| 9 月 10 日 | 正式发布 V4.1 Flash;推迟到 9 月 14 日 12:00 下线 V4 Pro | 官方邮件 + IT之家 |
| 9 月 11 日 | 改口:为响应用户需求,9 月 14 日之后继续提供 V4 Pro API 调用服务,计费方式保持不变 | 新浪科技/科创板日报,9-11 20:25 |
问题出在哪?到今天(9 月 21 日)为止,官方文档站上 9 月 10 日那则《DeepSeek V4.1 Flash:更强、更快、更普惠》公告里,依然白纸黑字写着”北京时间 2026 年 9 月 14 日 12:00 之后……请求将全部路由到 V4.1 Flash”,更新日志页也保留着同一段话,没有补上 9-11 的反转说明。
我的判断:以 9-11 的官方改口为准——V4 Pro 继续可用、计费不变。文档页那段话属于”发布时公告未回滚”,不是现行政策。如果你正在做技术选型,最稳的做法是二选一:一是直接用自己的账号发一次 deepseek-v4-pro 的测试请求,看返回的计费与响应是否正常;二是等 V4.1 Pro 上线公告,届时牌面才会重新洗。别只信文档页上那段静态文字。
三、价格表:Flash 与 Pro 到底差多少
V4.1 Flash 的新定价于 2026 年 9 月 10 日 12:00 生效,仍然是峰谷双价——闲时价格为高峰价的一半。高峰时段为北京时间周一至周五 9:00–12:00 与 14:00–18:00,其余全部算闲时(含周末全天)。
| 项目(每百万 tokens) | deepseek-flash 闲时 | deepseek-flash 高峰 | deepseek-v4-pro 闲时 | deepseek-v4-pro 高峰 |
|---|---|---|---|---|
| 输入 · 缓存命中 | 0.02 元 | 0.04 元 | 0.15 元 | 0.30 元 |
| 输入 · 缓存未命中 | 1 元 | 2 元 | 4.5 元 | 9.0 元 |
| 输出 | 4 元 | 8 元 | 13.5 元 | 27.0 元 |
| 并发限制 | 2500 | 500 | ||
数据来源:DeepSeek API 官方”模型 & 价格”页(2026-09-21 核对)。
几个值得留意的对比:缓存命中那一档,Flash 是 Pro 的约 1/7.5(闲时 0.02 元 vs 0.15 元);同时 Flash 的并发上限是 Pro 的 5 倍。也就是说,在”反复携带同一段长上下文”的 Agent 工作流里,Flash 的成本优势不是一点点,而是量级差别。想系统了解计费口径本身,可以配合我之前写的那篇 DeepSeek API 计费规则拆解一起看,那篇讲的是”钱怎么算”,这篇讲的是”模型怎么选”。
四、普通用户怎么体验到 V4.1 Flash?三个入口
4.1 网页版 / 官方 App(零门槛)
打开 DeepSeek 官网或官方 App 直接用即可,普通用户不需要关心模型名。官网入口与免费使用方式见我此前整理的 DeepSeek 网页版完全指南;想装手机端的,官方 App 下载安装教程那篇有 iOS/Android 分平台步骤。需要注意的是:App 端有时会灰度到不同模型版本,如果你发现回答风格变了,看一眼版本说明,别急着怀疑自己。
4.2 API 调用(开发者)
调新模型的完整模型名是 deepseek-flash,base_url 不变。旧的两个模型名 deepseek-v4-flash 与 deepseek-v4-flash-vision-exp 因为旧版本已下线,官方出于兼容考虑把它们暂时路由到 V4.1 Flash——所以老代码不改也能跑,但建议尽早显式改成 deepseek-flash,免得将来路由策略再变。
如果你还没申请过 API Key,从零开始的五步流程(注册、实名、建 Key、配额、首次调用)我写在 DeepSeek API Key 获取教程里,照着走一遍大概十分钟。
4.3 第三方平台
官方公告提到腾讯(WorkBuddy、CodeBuddy)与 OpenCode 已作为官方合作伙伴全量接入 V4.1 Flash。用这类集成工具的话,通常更新到最新版就能用上。
五、能力到底怎么样?给你一个可复核的判断框架
官方说法是”经内部、外部多方测试,V4.1 Flash 在性能、费用、速度、总用时上全面超越 V4 Pro”。但厂商自评只能当参考,我建议你分三层看:
- 看公开基准,但只当筛选器。第三方对比页(DataCamp,2026-09)列出的成绩是 Terminal-Bench 2.1 得 90.6%、DeepSWE v1.1 得 74.2%。同页还提到它是 MIT 许可开源、权重可自托管(检查点约 511 GB,对个人机器不现实)。注意:基准高不等于你的业务一定更好。
- 看真实场景的社区反馈。开发者社区里比较集中的正反馈是”长上下文 + 缓存命中”场景下的账单下降;比较集中的提醒是结构化输出、工具调用在换底座时最容易出岔子——这一点几乎所有”同规模换模型”的迁移都成立。
- 自己跑回归用例,这是唯一算数的一层。固定 10~20 条你自己的真实任务(含 2~3 条工具调用、2~3 条 JSON 输出),新旧模型各跑一遍,对比成功率、耗时和单据成本。半小时的事,比看十篇评测都准。
顺带提醒一句:换底座不是免费的。即使 API 别名没变、代码一行不改,底层模型变了,你的 prompt 适配度、输出格式稳定性都会重新洗牌。生产环境务必先做灰度。
六、V4.1 Flash 还是 V4 Pro?一张表给你答案
| 你的情况 | 建议 | 原因 |
|---|---|---|
| 个人尝鲜、日常问答、写文案 | 网页版/App 直接用,不用纠结 | 普通用户端感知差异有限,免费可用最省事 |
| Agent / 长上下文 / 反复读同一份资料 | 优先 Flash | 缓存命中 0.02 元档 + 并发 2500,成本与吞吐双优 |
| 对输出格式极度敏感(严格 JSON、复杂工具调用) | 先灰度,别一键全切 | 换底座最容易在这类任务上出问题,回归用例必做 |
| 已经跑通 V4 Pro 且账单可接受 | 不必急着迁,但保持关注 | 官方已明确 V4 Pro 继续提供、计费不变;等 V4.1 Pro 上线再统一评估 |
| 想本地跑 | 暂时不现实,先看量化方案 | 检查点约 511 GB,vLLM 配方 VRAM 下限约 614 GB;个人部署可先参考 本地方案盘点 |
如果你正在 Flash 和 ChatGPT 之间纠结,我做过的横向实测在 DeepSeek vs ChatGPT 对比 那篇,结论是两者更接近”分工”而不是”替代”。DeepSeek 这一整条产品线(网页版、App、API、本地部署)的入口我都归在 DeepSeek 学习资源大全里,需要时可以按图索骥。
七、三个立刻能用的省钱动作
① 把批处理任务挪到闲时。闲时价格是高峰的 5 折,高峰只占工作日白天那 7 小时。夜间跑批量任务,等于账单直接砍半。
② 把重复的上下文放在提示词前缀。缓存命中与未命中之间差 50 倍(0.02 元 vs 1 元)。同一份长文档、同一套系统提示词,固定在前面别乱改,命中率上去了成本才会真的掉下来。
③ 用合适的 reasoning_effort。简单任务用 low、复杂任务再上 max,别所有请求都拉满思考强度——思考 Token 也是按输出价计费的。
顺带说一句,做 AI 工具相关的付费服务(API 充值、会员代充这类)时,尽量走正规渠道并保留订单凭证;市面上一些第三方”低价 API 中转”看起来便宜,但存在限流、封号和额度不稳的风险,长期算下来未必划算。如果你需要的是稳定额度、能开发票的正规开通渠道,可以对比一下 2233.ai 当前的方案与价格,再和自己直接充值的成本做一次对照——关键是别只看单价,要把限流、失败重试、发票这些隐性成本一起算进来。
八、常见问题 FAQ
DeepSeek V4.1 Flash 是免费的吗?
分两种用法:普通用户在官网网页版和官方 App 上使用是免费的,不涉及按量计费;开发者通过 API 调用才按 token 计费(闲时缓存命中 0.02 元/百万 tokens 起)。免费额度和产品形态可能调整,以官方页面为准。
V4.1 Flash 和 V4 Pro 哪个更强?
按官方公告的说法,V4.1 Flash 在基准测试中超过了 V4 Pro,官方因此一度计划下线 Pro。但要注意两点:一是厂商自评需第三方验证;二是”纸面更强”不等于”你的业务零改动也更好”,结构化输出与工具调用这类任务在换底座时最容易出现波动,务必先跑自己的回归用例。
V4 Pro 现在还能用吗?会不会突然被停掉?
能继续用。2026 年 9 月 11 日官方已明确:为响应用户需求,9 月 14 日之后继续提供 V4 Pro 的 API 调用服务,计费方式保持不变。需要注意的是官方文档站上 9 月 10 日那则”9 月 14 日 12:00 路由到 Flash”的公告至今未同步更新,别被旧文字误导。
调用 V4.1 Flash 要改代码吗?模型名怎么填?
完整模型名是 deepseek-flash,base_url 保持不变,接口格式兼容 OpenAI ChatCompletions、Anthropic 与 Responses 三种。旧的 deepseek-v4-flash、deepseek-v4-flash-vision-exp 目前会被路由到 V4.1 Flash,所以老代码不改也能跑,但建议尽早显式改为新模型名。
V4.1 Flash 支持图片输入吗?
支持。官方公告明确 V4.1 Flash 具备原生多模态视觉理解能力,这也是它区别于上一代 Flash 的一个变化点。
什么时候调用最便宜?
闲时最便宜,价格是高峰的一半。高峰时段为北京时间周一至周五 9:00–12:00 与 14:00–18:00,其余时间(含周末全天、工作日晚间与凌晨)均属闲时。把批量任务排到闲时,成本直接减半。
缓存命中价为什么能低到 0.02 元?
两个原因叠加:一是 V4.1 Flash 通过新架构把 KV Cache 缩小,官方称对 HBM 的需求降到上一代的 1/4、SSD 需求降到 1/8;二是缓存命中本身只做前缀复用、不重复计算。所以同一条长上下文反复使用时,命中率越高越省——这也是 Agent 场景成本差异最大的地方。
普通用户能感知到换了模型吗?
多数日常问答场景下感知不明显。如果你发现回答风格、幻觉倾向或代码质量出现变化,先确认当前使用的版本,再用几组固定问题做前后对比,比凭感觉判断可靠得多。
延伸阅读
想按顺序把这套知识补齐,建议这个路径:先用 API Key 获取教程把账号跑通,再读 计费规则拆解搞懂钱怎么算,然后回来看本篇做模型选型;如果你更关心客户端体验,网页版指南与 App 教程足够用。
小提示:如果你需要的是”能直接开票、长期稳定”的账号与额度,可以看看 2233.ai 这类服务的当前方案,下单前先核对官网口径与发票支持情况,避免买完才发现不支持企业报销。另有一个常被问到的问题是”有没有更省的开通路径”,我的建议是:先算清楚自己每月实际消耗,再决定要不要走第三方,而不是先买再说——具体算法可以回看 计费拆解里那套预估方法。
📦 附:夸克网盘资源库 · 持续更新
我做资源库的标准很苛刻:分类清晰、链接有效、持续更新——这份夸克网盘资源导航表三点都占:直到这篇发布前都还在更新,失效链接会被及时清理,新资源持续入库,找资源不用再到处碰运气。
- 📚 资源库入口:夸克网盘资源导航表(在线表格,收藏即用)
- 💾 建议先收藏本文或保存表格,需要时随时回来取用;表格会持续更新,值得定期逛一逛。
- 📢 觉得有用,欢迎转载分享给需要的朋友(转载注明出处即可)。
本文时效标记:2026 年 9 月 21 日核对。文中版本信息、价格与政策时间线均以当日官方公开信息为准;模型厂商政策变动频繁,涉及采购决策请以官网最新页面为准。






