DeepSeek API 怎么收费?一句话说清:按 token 计费,输入分「缓存命中 / 缓存未命中」两档,输出单独计价,整体再叠加「高峰 / 闲时」两套价格。2026 年 9 月 10 日 12:00 起 Flash 系列新价生效——闲时输入缓存命中 0.02 元/百万 token、未命中 1 元、输出 4 元,最高降幅 60%,高峰时段是闲时的 2 倍。还有一条更值得留意的变化:官方原定 9 月 14 日 12:00 起把 deepseek-v4-pro 的请求全部路由到 V4.1 Flash,9 月 11 日又宣布取消这一安排——9 月 14 日之后继续提供 V4 Pro 的 API 调用服务,计费方式保持不变。这篇把我自己调 DeepSeek API 的完整路径写出来:Key 与控制台入口、余额用量查询、最新计费规则拆解,以及我实测有效的 5 个省钱动作。

快速结论(3 条先记住)

  • 9 月 10 日起 Flash 新价,缓存命中降了 60%:闲时输入缓存命中 0.02 元/百万 token、未命中 1 元、输出 4 元;高峰(工作日 9:00-12:00、14:00-18:00)翻倍。这一档恰好是长上下文、Agent 类任务账单里占比最大的部分。
  • V4 Pro 经历了 48 小时「反转」,最终没下线:9 月 9 日宣布要路由到 Flash、9 月 10 日推迟到 14 日执行、9 月 11 日直接取消——9 月 14 日之后仍可正常调用 deepseek-v4-pro,价格照旧(闲时输出 13.5 元/百万 token)。急着改代码迁移的人,可以先停一停了。
  • 省钱的杠杆顺序是「缓存命中率 > 峰谷调度 > 输出长度」:同样的用量,把命中率从 30% 提到 90%、再挪到闲时跑,账单可以差 4 倍以上(第六节有完整算账)。

一、DeepSeek API 的计费项,其实只有 3 个

很多人第一次看 DeepSeek 的账单会懵,是因为它把「输入」拆成了两档。拆开看就很简单:

  • 输入 · 缓存命中:你的请求前缀(系统提示词、长文档、历史对话)和之前某次请求的开头完全一样,这部分直接读缓存,不用重新计算,所以最便宜——闲时 0.02 元/百万 token。
  • 输入 · 缓存未命中:新内容、首次出现的前缀,模型要真正跑一遍,闲时 1 元/百万 token,是命中价的 50 倍。
  • 输出:模型生成的内容,闲时 4 元/百万 token。输出没有「缓存」这一说,所以它永远是账单里单价最高的那一档。

再把时段叠加上去:高峰时段价格为闲时的 2 倍。高峰的定义是北京时间 周一至周五 9:00-12:00、14:00-18:00,其余时间(含周末全天)都算闲时。

2026 年 9 月最新价格表(人民币 / 百万 token)

计费项 deepseek-flash 闲时 deepseek-flash 高峰
输入 · 缓存命中 0.02 元 0.04 元
输入 · 缓存未命中 1.0 元 2.0 元
输出 4.0 元 8.0 元

保留的 deepseek-v4-pro 则是另一套价:闲时输入缓存命中 0.15 元、未命中 4.5 元、输出 13.5 元,高峰同样翻倍。也就是说,同样的输出量,Flash 的成本大约只有 Pro 的 30%——记住这个比例,后面算账要用到。

顺带说一句 deepseek-flash 背后是什么:它是 2026 年 9 月 10 日发布的 DeepSeek-V4.1-Flash,552B 参数的 MoE 模型,采用非对称的 Causal-Encoder-Decoder 结构(输入激活 8B、输出激活 16B),1M 上下文、并发上限 2500、原生支持图像理解,并以 MIT 许可开源。日常问答、写作、翻译、批量整理,用它就够了。

和 8 月旧价比,到底降了多少

计费项 8 月旧价(闲时) 9 月新价(闲时) 变化
输入 · 缓存命中 0.05 元 0.02 元 ↓ 60%
输入 · 缓存未命中 1.5 元 1.0 元 ↓ 33%
输出 4.5 元 4.0 元 ↓ 11%

注意这里的不对称:降得最狠的是缓存命中,降得最少的是输出。这不是巧合——长上下文和 Agent 场景里,命中缓存的输入往往占账单九成以上,厂商降价当然先降这一档。反过来讲,如果你是「短输入、长输出」的写作类用法,这波降价对你的体感会弱很多,别指望账单腰斩。

二、2026 年 9 月必须核对的两件事

如果你 8 月之后就再没看过 DeepSeek 的计费页,那这两条变化一定要核对,否则你以为在省钱、其实白算。

1. 模型名换了,旧名字还能用但要留意

新模型的正式调用名是 deepseek-flash。旧模型名 deepseek-v4-flashdeepseek-v4-flash-vision-exp 目前仍可调用,但对应的旧模型已经下线,请求会被路由到 V4.1 Flash,按 Flash 价格计费。也就是说:现在改不改代码,跑的都是新模型,区别只在于你以后要不要跟上官方命名。

2. V4 Pro 的 48 小时反转:最后没下线

这件事值得单独说,因为前后三份公告的结论完全相反,很多人的迁移方案白做了。时间线是这样的:

  • 9 月 9 日:官方宣布,在 V4.1 Pro 上线之前,会把所有 deepseek-v4-pro 请求路由到 V4.1 Flash,并按 Flash 单价计费。
  • 9 月 10 日:调整为「推迟到北京时间 9 月 14 日 12:00 执行」。
  • 9 月 11 日:再次调整——为响应用户需求,决定 9 月 14 日之后继续提供 V4 Pro 的 API 调用服务,计费方式保持不变,此前计划的自动切换一并取消。

结果是:V4 Pro 和 V4.1 Flash 短期会继续同时存在。官方给出的下线理由依然成立(V4.1 Flash 在性能、费用、速度、总用时上经多方测试已全面超越 V4 Pro),但既然 Pro 保住了,你就不必为了「9 月 14 日大限」去连夜改配置。

我的建议是:把 Pro 当成「兼容保留项」而不是「首选」。新项目直接上 deepseek-flash;已经在用 Pro、且 Prompt 和 Agent 流程都调好了的生产环境,继续跑 Pro 也完全没问题——毕竟官方明确说了计费不变。等未来 V4.1 Pro 正式上线,再重新评估分工。

想了解官方 App 下载、网页版入口这些周边用法,可以看我的这几篇:DeepSeek 官方 App 下载安装 2026DeepSeek 网页版完全指南 2026

迁移自检清单(4 条,5 分钟能过一遍)

  • 全项目搜一遍 deepseek-v4-prodeepseek-v4-flash,标出每个出现位置的用途(主力 / 降级备用 / 写死在配置里)。
  • 确认你的批处理窗口有没有撞在高峰时段上——撞了就挪到 18:00 之后或周末。
  • 重新跑一次自家任务的评测,重点看代码生成和长上下文两类,别只信官方基准。
  • 核对缓存命中率。新架构下命中价更低,但命中率的波动对账单的影响比单价变化更大。

三、API Key 获取与控制台入口(5 分钟)

Key 的申请流程我在另一篇里写过完整五步,这里只给最短路径:打开开放平台 platform.deepseek.com(别走错成 chat.deepseek.com,那是聊天页),用手机号或邮箱注册并完成实名认证,然后在左侧菜单的 「API Keys」 里点「创建 API Key」即可。Key 只在创建时完整显示一次,务必当场复制保存好;详细步骤和 Python、curl 两种调用示例见《DeepSeek API Key 获取教程》

拿到 Key 之后,控制台里有四个页面我建议立刻看一眼,它们直接决定你后面能不能把钱花明白:

  • API Keys:按项目建不同的 Key,别全项目共用一把。某个 Key 泄露或额度异常时,删掉重发就行,不用动其他服务。
  • 用量信息:能看到按天、按模型拆分的 token 消耗,也能看到缓存命中情况。这是所有省钱动作的体检报告。
  • 充值:国内手机号注册的账号支持支付宝等国内方式,不需要海外信用卡,这点比不少海外 API 省事。
  • 账单 / 明细:调价、优惠、扣费记录都在这里,对不上账时先查它。

四、余额和用量怎么查(附一条命令)

控制台要看,但如果你在做自动化,更省事的是直接调官方接口。DeepSeek 提供了一个查余额的接口 /user/balance,一行命令就能拿到:

curl https://api.deepseek.com/user/balance 
  -H "Authorization: Bearer sk-你的Key"

返回长这样:

{
  "is_available": true,
  "balance_infos": [
    {
      "currency": "CNY",
      "total_balance": "110.00",
      "granted_balance": "10.00",
      "topped_up_balance": "100.00"
    }
  ]
}

字段含义很直白:is_available 是账户还能不能调用,total_balance 是可用总额,granted_balance 是未过期的赠金,topped_up_balance 是你自己充的钱。

顺便记一条扣费规则:当充值余额和赠送余额同时存在时,优先扣赠送余额。所以别急着把赠金花掉,它会先被消耗——这也是为什么有时候你觉得「我没充多少却一直在跑」。

五、省钱实测:我常用的 5 个动作

以下五条按性价比排序,前两条是真正的大头,后三条属于顺手就能做。

① 把缓存前缀「焊死」——最有效的一条

缓存命中价 0.02 元,未命中 1 元,差 50 倍。而缓存能否命中只有一个判断标准:这次请求和上次请求,从第 0 个 token 开始的前缀是否完全一致。中间才开始重复的部分,一个字都不算命中。

所以写法只有一条铁律:固定不变的内容全部放最前面,会变的内容全部往后放。反面例子是把时间戳、用户名、随机 ID 塞在系统提示词开头——这会让你后面所有内容全部失去命中资格,等于天天按 50 倍的价付输入费。

messages = [
    {"role": "system", "content": LONG_FIXED_PROMPT},  # 固定不变,永远放最前
    *HISTORY_TAIL,                                     # 多轮历史,前缀保持稳定
    {"role": "user", "content": user_question},        # 会变的部分,放最后
]

还有个细节:缓存以 64 个 token 为一个存储单元,不足 64 token 的片段不会被缓存;缓存属于「尽力而为」,不保证 100% 命中,且不再使用后会自动清空。所以别把一次性内容硬塞进前缀里假装省钱了。

② 重任务挪到闲时——成本直接砍半

闲时价格是高峰的一半,而高峰只有工作日 9:00-12:00 和 14:00-18:00 两段,其他时间含周末全天都是闲时。批量处理、定时任务、离线生成这些不着急的活,全部挪出高峰即可。下面这段判断逻辑可以直接抄:

from datetime import datetime, time as dtime
import zoneinfo

BJ = zoneinfo.ZoneInfo("Asia/Shanghai")

def is_peak(now=None):
    """高峰 = 周一至周五 9:00-12:00、14:00-18:00(北京时间)"""
    now = now or datetime.now(BJ)
    if now.weekday() >= 5:          # 周六、周日全天算闲时
        return False
    t = now.time()
    return (dtime(9, 0) <= t < dtime(12, 0)) or (dtime(14, 0) <= t < dtime(18, 0))

if is_peak():
    print("现在是高峰,重任务排队到闲时再跑")
else:
    print("闲时,可以放心跑批量")

我自己的习惯是:白天交互式的轻量调用照常跑,所有批处理、数据整理、内容生成的定时任务统一排到 18:00 之后或周末。这一条不需要改任何业务逻辑,收益却是确定的 50%。

③ 管住输出长度,别让它自由发挥

输出是单价最高的一档,而且它不受缓存优惠。做法很朴素:能给约束就给约束。设 max_tokens、在提示词里明确「用 200 字以内回答」「只输出 JSON,不要解释」,都能实打实少花钱。我做过对比,同一批整理任务加一句长度约束,输出 token 大概能压掉三成。

④ Pro 还是 Flash?先算成本再决定

V4 Pro 保住了,所以这道选择题重新回到桌面上。我的判断依据很简单:同一份输出量,Flash 的成本约为 Pro 的 30%(闲时输出 4 元 vs 13.5 元),而官方明确表示 V4.1 Flash 在多项测试中已超越 V4 Pro。所以对新项目,默认用 deepseek-flash;只有当你的生产环境已经围绕 Pro 调好了 Prompt、Behavior 也验证稳定,才值得继续保留 Pro——反正计费不变,迁移不急。

硬要一句话总结:成本敏感看 Flash,行为稳定看现状,别为了「最新」去动一个跑得好好的线上服务。

⑤ 盯住缓存命中率这个数

每次调用的返回里都有 usage.prompt_cache_hit_tokensusage.prompt_cache_miss_tokens 两个字段:

u = resp.usage
hit, miss = u.prompt_cache_hit_tokens, u.prompt_cache_miss_tokens
print(f"命中率 {hit / (hit + miss):.1%}")

把它打到日志里,每天扫一眼。命中率掉下来的那天,通常意味着有人动了提示词前缀的拼装顺序——这条告警比看账单更快。

顺带一提:不想写代码的人怎么办

如果你只是个人用、调用量也不大,其实没必要为了省几十块钱去搭一套 API 工程。我更推荐的思路是:日常问答直接用2233.ai 这类聚合入口,把 GPT、Claude 等主流模型放在一个地方用,省掉自己充值、写代码、维护 Key 的成本;真要落地到自己的产品里,再回到 API 这条路。工具是拿来省事的,别为了省钱反而多花时间。

六、算一笔账:同样的用量,差距能有多大

下面两个场景我都按官方 9 月新价手算了一遍,用同一个业务量、只改策略,你就能看出省钱空间在哪。前提统一为:每月输入 2 亿 token、输出 2000 万 token

场景 缓存命中率 运行时段 每月成本
A:前缀混乱 + 全高峰跑 30% 高峰 约 442 元
B:前缀稳定 + 全闲时跑 90% 闲时 约 104 元

算账过程(人民币):

  • 场景 A:命中输入 6000 万 × 0.04 = 2.4 元;未命中输入 1.4 亿 × 2.0 = 280 元;输出 2000 万 × 8.0 = 160 元。合计约 442.4 元
  • 场景 B:命中输入 1.8 亿 × 0.02 = 3.6 元;未命中输入 2000 万 × 1.0 = 20 元;输出 2000 万 × 4.0 = 80 元。合计约 103.6 元

同样的业务量,成本差 4.3 倍。而且注意一个反直觉的结果:场景 A 里 280 元花在「未命中输入」上,比整个场景 B 的总花费还多一倍多。真正的成本杀手不是单价,是命中率。单价你控制不了,命中率和调度你完全控制得了。

七、我踩过的 4 个坑

  • 把动态内容写进系统提示词开头:为了「让模型知道现在几点」,我在 system 里插了时间戳,结果整条前缀每天都不一样,缓存命中率直接归零,当月账单翻了将近三倍。后来把时间放到用户消息里就正常了。
  • 以为思考模式的 token 不要钱:思考模式会先生成一段推理内容,这段同样按输出计价。推理类任务确实值这个钱,但别在批量任务里默认开着,尤其是那些「答案就一个词」的活。
  • 沿用旧模型名还以为是旧价:8 月的价格表在 9 月 10 日之后就已经不是最新了。记账用的成本模型如果还锚着旧单价,预算和实际支出会对不上。
  • 跟着公告连夜改代码:9 月 9 日看到「V4 Pro 要路由到 Flash」就去改配置,结果 9 月 11 日官方又说不下线了。经验是:涉及计费和模型路由的公告,先看清楚生效时间,别抢在生效日之前动手——这次幸好有两天缓冲。

常见问题 FAQ

DeepSeek API 怎么收费?是按调用次数还是按量?

按 token 用量计费,不按调用次数。分三档:输入缓存命中、输入缓存未命中、输出,各自有单价,再叠加高峰 / 闲时两套价格。高峰时段(工作日 9:00-12:00、14:00-18:00)价格是闲时的 2 倍。

V4 Pro 现在还能用吗?会不会自动切到 Flash?

能正常使用。官方在 9 月 11 日宣布取消原定的路由安排,2026 年 9 月 14 日之后继续提供 DeepSeek V4 Pro 的 API 调用服务,计费方式保持不变。此前「9 月 14 日 12:00 起请求全部路由到 V4.1 Flash」的计划已不再执行。价格仍为闲时输入缓存命中 0.15 元、未命中 4.5 元、输出 13.5 元,高峰翻倍。

缓存命中到底怎样才能触发?

只有两个请求从第 0 个 token 开始的前缀完全相同才算命中,中途才开始重复的部分不算。所以要把固定不变的提示词、长文档、历史对话放在请求最前面,把会变化的内容放到最后。另外缓存以 64 token 为一个存储单元,不足 64 token 的片段不会被缓存,且官方明确说是「尽力而为」,不保证 100% 命中。

高峰时段具体是几点?周末算高峰吗?

高峰是北京时间周一至周五 9:00-12:00 和 14:00-18:00,其余时段均为闲时。周六、周日全天都按闲时计价,所以把批量任务放到周末跑,是成本最低的选择。

充值和赠送余额是怎么扣的?

两者同时存在时优先扣赠送余额,赠金先用完,再扣你充的钱。赠金有有效期,过期不能用,可以在控制台的余额页看到 granted_balance(未过期赠金)和 topped_up_balance(充值余额)的分别余额。

个人开发者一个月大概要花多少钱?

做个小工具、偶尔问答,输入每月几百万 token 的话,通常一个月也就几块钱。真正花钱的是长上下文批量场景——每月 2 亿输入 token 量级,策略做得好大约一百元出头,前缀混乱又全在高峰跑,可能到四百多元。差距不在单价,在命中率和调度。

延伸阅读

另外,如果你是个人使用、不想维护 API 工程,可以看看 2233.ai 这类聚合入口,把主流模型放在一个地方用,省去充值和写代码的成本。

价格与服务条款可能随官方政策调整,调用前请以 DeepSeek 官方定价页为准。本文数据核对时间:2026 年 9 月 17 日。

📦 附:夸克网盘资源库 · 持续更新

我做资源库的标准很苛刻:分类清晰、链接有效、持续更新——这份夸克网盘资源导航表三点都占:直到这篇发布前都还在更新,失效链接会被及时清理,新资源持续入库,找资源不用再到处碰运气。

极客
关于作者:极客

极客灵境站长。专注 AI 工具实操与网络性价比方案实测,亲自部署、亲自测试,把最划算的做法分享给你。

发布于 2026-09-18 · 了解更多 →
声明:本站所有文章,如无特殊说明或标注,均为本站原创发布。任何个人或组织,在未征得本站同意时,禁止复制、盗用、采集、发布本站内容到任何网站、书籍等各类媒体平台。如若本站内容侵犯了原著者的合法权益,可联系我们进行处理。