单日消耗 8 万亿 Token。
这是 DeepSeek V4 Flash 在一个 AI 编程工具里的用量记录。
开源 AI Agent 工具 OpenCode 发布数据称,DeepSeek V4 Flash 正式版通过其平台总共消耗了 8 万亿 Token。其中,5 万亿来自免费额度,另外 3 万亿来自付费套餐 OpenCode Go。
作为参照,大模型路由平台 OpenRouter 接入了 400 多款模型,每月处理约 200 万亿 Token,平均每天约 6.6 万亿。
这意味着,DeepSeek 旗下仅一款模型,单在 OpenCode 这一个入口里,一天消耗的 Token 量就超过了 OpenRouter 全平台的日均规模。
OpenRouter 上 DeepSeek V4 Flash 是本周最热门模型
这与 DeepSeek V4 Flash 的低价策略紧密相关。能力提升了,价格却没变,原本被压抑的使用需求瞬间释放。但在 8 万亿 Token 的背后,更深层的变化在于人们使用 AI 的方式发生了改变。
过去,我们向模型提问,得到回答,任务便告结束。如今的 Agent 会自行读取文件、修改代码、运行程序并检查结果,若失败则重新尝试。一次任务可能持续数小时,调用几十次工具,甚至让多个 Agent 协同工作。
模型生成的代码量未必比过去多出多少,但消耗的 Token 却可能翻上几十倍乃至几百倍。
有人利用 Claude Opus 5 制作一个单页 3D 游戏。模型需不断生成页面、截图检查、继续修改。最终只是一个 HTML 文件,一句提示词却消耗了 6.9 亿 Token,费用接近 3000 元。
Agent 任务的爆发,迫使模型证明自身价值。除了智能程度,性价比成为关键考量;衡量模型的单位,从「单次回答有多聪明」转变为「完成一项长任务要花多少钱、多久、失败几次」。
基于这套标准,DeepSeek V4 Flash 成了所有模型的斩杀线。
每百万输出 Token,DeepSeek 收取 2 元人民币。Anthropic 的 Claude Opus 4.8,标准价格为 25 美元,约合 170 元。仅看输出单价,二者相差约 85 倍。
7 月底,DeepSeek 推出 V4 Flash 正式版,保留模型架构与规模,仅重新进行后训练,重点强化编码和 Agent 任务。
次日,大模型竞技场 Arena 公布前端编码评测榜单,将 V4 Flash 列入「价格—性能」前沿模型。截至 Arena 8 月 2 日的页面快照,V4 Flash 初步排名暂列 Opus 4.8 Thinking 之前。
在 Artificial Analysis 的 Intelligence Index v4.1 中,V4 Flash Max 获得 50 分,Claude Opus 4.8 Max 获得 56 分。前者跑完整套评测产生的模型调用费约为 72.02 美元,后者则高达 3752.55 美元。
换言之,Opus 多拿了 6 分,但跑完同一套评测的调用费高出约 52 倍。
V4 Flash 尚无法证明自己全面超越 Opus,但只要两者能被纳入同一轮候选名单,85 倍的价差就足以改变默认选择。
当一款模型价格高出几十倍,性能领先却仅几个百分点时,这笔账越来越难算平。
最先受冲击的,或许并非最弱的小模型。便宜、快速的小模型仍适合分类、提取和路由等简单工作。最强的旗舰模型也会继续用于处理疑难任务,或作为高失败成本场景里的保险。
真正尴尬的是中间一批模型:它们比 V4 Flash 强一些,却贵几十倍;又未强到能稳定解决 V4 Flash 做不了的问题。
这就是 DeepSeek 的斩杀线。它无需成为最强模型,只要达到「大多数时候可以做完」,就能利用近两个数量级的价格差,把更贵的模型挤出默认调用位。
V4 Flash 为何能把茅台当矿泉水卖
长久以来,人们认为模型价格与其「聪明程度」挂钩,模型越聪明,售价自然越高。
目前主流几款大模型中,Anthropic 家的 Opus 4.8 和 Opus 5 输出均为 25 美元/百万 Token,Fable 5 输出为 50 美元/百万 Token;OpenAI 的 GPT-5.6 在前几天降价后,Luna 输出由 6 美元降至 1.2 美元,Terra 由 15 美元降至 12 美元,Sol 保持不变,仍为 30 美元。
几款国产大模型依旧按每百万输出价格讨论,DeepSeek V4 Flash 为 2 元,刚发布的 Qwen 3.8 Max 为 36 元,Kimi K3 为 100 元,GLM 5.2 为 28 元。
DeepSeek 几乎以免费价格提供大模型
无论是国产模型间的对比,还是与国外旗舰模型的对比,DeepSeek 的价格似乎都是一股「清流」。究竟是什么造就了模型价格的差异?
最直观的是每生成一个 Token 的直接推理成本。
该成本受激活参数量、数字精度、注意力机制、KV Cache 大小、输出长度、硬件利用率和并发量影响。同一款模型,若能以更少计算完成推理,或让更多请求共享缓存,成本便会下降。
V4 Flash 总参数量为 2840 亿,但每个 Token 仅激活约 130 亿参数。它同时采用混合注意力结构、低精度权重及针对长上下文的缓存优化。
V4 系列模型架构图
根据 DeepSeek 四月公开的 Preview 技术报告估算,在一百万 Token 上下文下,V4 Flash 的单 Token 推理计算量约为 DeepSeek V3.2 的 10%,KV Cache 约为后者的 7%。
这是与 V3.2 的内部架构对比,不代表其只需其他所有模型十分之一的综合成本,但足以解释 DeepSeek 为何能将长任务价格压低。
DeepSeek V4 系列结构改造了 Transformer 模块里的三个关键部分,将注意力层改为先压缩再找重点的 CSA 机制和更极致压缩但全部浏览的 HCA 机制,两种交错排列以平衡成本。
V4 的前馈层沿用 DeepSeekMoE:模型包含大量细分专家和少量共享专家,每个 Token 仅被路由到其中一小部分专家。
因此,V4 Flash 虽共有 2840 亿参数,每个 Token 实际激活的仅约 130 亿;V4 Pro 总参数达 1.6 万亿,实际激活约 490 亿。它获得了大模型的知识和容量,却无需每生成一个 Token 都运行全部参数。
其次是完成的服务成本,涵盖模型训练、后训练、评测、安全以及推理基础设施、空闲算力等服务。这些成本虽不出现在 Token 账单里,却必须由模型厂商承担。
最后是商业定价,API 价格并非简单的成本加成,厂商还需考虑市场份额、用户迁移成本、品牌溢价、服务能力,以及客户愿意为可靠性支付多少钱。
因此,模型价格绝非一张纯粹的成本表。它既反映模型所需的算力,也反映厂商对自身能力、品牌和可靠性的估值。
OpenAI 和 Anthropic 的高价格,可能同时包含更高的推理成本、产品生态、安全和服务溢价,以及它们在高难度任务上的定价权。
架构未变,Agent 能力为何大涨
目前,V4 Flash 正式版尚未发布新的技术报告。DeepSeek 在 7 月 31 日的更新日志中写道:正式版 V4 Flash 与 Preview 的结构和尺寸相同,仅重新进行了后训练。
此前预览版报告披露的后训练流程,已将重点放在代码和 Agent 上:DeepSeek 分别训练数学、代码、Agent 和指令遵循专家,使用 SFT 和 GRPO 强化各自能力,再通过十多个教师模型的 On-Policy Distillation 合并回同一个模型。
工具调用也被视为单独的问题处理。
DeepSeek 设计了专门的调用格式,减少参数转义和格式错误;Interleaved Thinking 让模型在工具返回结果后继续保留前面的推理;DSec 则提供数十万个并发沙箱,让模型反复练习运行代码、读取报错和继续修改。
这些后训练并未给模型增加新参数,却能减少 Agent 最常见的失败:选错工具、填错参数、忘记前面的状态,或在任务未完成时停下。
正式版在 Terminal Bench 2.1 上取得 82.7 分,还使用了尚未发布的 DeepSeek Harness 极简模式和 max 推理档。此外,DeepSeek 为 V4 Flash 加入原生 Responses API,并针对 Codex 做了适配。
预训练决定模型的能力底座,后训练主要改变模型如何调用这些能力。
当 V4 Flash 可部署在「消费级」电脑上
V4 Flash 的另一变化,是让前沿 Agent 模型离本地设备更近了一步。
虽然每次推理仅激活 130 亿参数,但完整的 2840 亿参数仍需存储和调度,官方仓库中的权重文件合计约 167 GB。
DeepSeek 给出的 vLLM 服务示例使用一台配备 4 张 GB300 的服务器。
社区项目 DwarfStar 则通过低比特量化,把 V4 Flash 的 q2 版本放进了 96GB 或 128GB 统一内存设备,q4 版本建议使用至少 256GB 内存。在部分 128GB Mac 测试中,短上下文速度可达每秒二十多 Token。
q2 版本能运行,不代表能复现官方 API 的 Agent 成绩。极低比特量化可能损伤代码、长上下文和工具调用能力,社区运行时本身也仍处于早期阶段。
换个角度看 V4 Flash 的出现,这似乎是 DeepSeek 斩杀线里的关键一刀。在本地部署上,DeepSeek 又斩掉了「高水平模型只能待在机房」的一部分门槛,将门槛降到了高内存工作站。
一台高配 Mac 或 DGX Spark,已可用可交互的速度运行经过激进压缩的完整 V4 Flash。
最强模型也开始谈性价比
更低的价格不一定意味着少赚钱。
单价下降,Token 总量却可能涨得更快。
Sam Altman 在 7 月底的播客节目中曾提到,OpenAI 预计模型会产生极大使用量,因此无需依靠「极高毛利」来承担训练成本。他们和 DeepSeek 的梁文锋一样,相信 AI 的需求几乎无上限,AI 智能使用量将持续爆发。
即使每次调用赚得不多,只要调用量足够大,累计利润依然可以覆盖下一代模型的训练成本。
这也是 V4 Flash 更值得注意之处。
它未用绝对领先的榜单成绩证明自己是最聪明的模型;它做的,是把过去只有旗舰模型才能承担的任务,压进一个可被反复调用、持续试错,甚至允许浪费一些 Token 的价格区间。
在聊天机器人的时代,用户愿为更好的回答多付几倍价格。但进入 Agent 时代,模型不再只回答一次。它要浏览文件、搜索资料、执行代码、截图检查,再根据结果重新开始。
一次任务中,智力上几分的能力差距,可能只影响模型是否要多试两轮;但几十倍的价格差距,却会决定这个任务是否有资格真正跑起来。
运行 AA 所有测试花费的钱和智能得分对比显示,DeepSeek 拿下 50 分仅花 72 美元,而 Fable 5 得到 60 分,花费 5600 美元。
未来模型间的竞争,很难再用一张能力榜单解释。
用户需要计算的,是完成率、调用次数、响应速度和最终账单;模型厂商出售的,也不再只是每一个 Token 的智能,而是每一美元最终能完成多少工作。
从这个角度看,V4 Flash 真正斩掉的,是调用旗舰模型前那种无需计算成本的习惯。
当一个便宜 50 倍甚至 80 倍的模型,已能完成大多数编码和 Agent 任务,昂贵模型就必须反过来证明:剩下那几分能力,究竟值不值得多付几十倍的钱。
我们正在招募伙伴
📮 简历投递邮箱[email protected]
