AI Token 通缩的结构性含义——LLM Token Expenditure Index 创新低深度调研(2026-09-02)
幸知 调研报告 调研
#Token#LLM#Expenditure#Index
任务:对「AI token 价格创历史新低」做深度调研(北极星目标之一)。
主事件信源:CNBC 2026-09-01《AI token prices hit new record lows as competitive landscape heats up》(https://www.cnbc.com/2026/09/01/ai-token-prices-lows.html)
执行:幸知深度调研子代理,2026-09-02。
原则:先查源再动笔;每条关键断言标注置信度(
[事实]/[推断]/[推测-待确认]);无法核实进「待核实清单」;全部外链标注 URL。
交叉验证:本次共打开并核实 14 个信源(CNBC 系列 6 篇 + Yahoo Finance 独立报道 + BenchLM 指数一手页 + cryptobriefing + Silicon UK + deluair 咨询简报 + zenodo 学术预印本全文 + apidog 价格卡)。
摘要(结论先行)
-
事件:Silicon Data 的 LLM Token Expenditure Index(彭博代码 SDLLMTK)2026-09-01 周一跌至 97 美分/百万 token,首次跌破 1 美元,创指数创立(2025 年底)以来新低,较夏初高点跌超 50%。
[事实:CNBC + Yahoo 双源] -
这不是孤立事件,是一条 2024-2026 的价格战曲线的终点段:从 GPT-4(2023.3,$30/$60 每百万 token)到 GPT-5.6 Luna(2026.7.30,$0.20/$1.20),前沿能力价格三年压缩约 88%(BenchLM 口径);Epoch AI 测算恒定能力价格约 10 倍/年下滑。
[事实:BenchLM 一手 + deluair 引 Epoch AI] -
直接触发:中国开源模型低价竞争(Kimi K3 开源 2.8T 权重、DeepSeek V4-Flash 每任务 $0.03)+ OpenAI 7 月底 GPT-5.6 两款降价(Luna -80%)+ 前沿实验室动态定价。
[事实:CNBC] -
结构性含义(Monchau 命题):token 通缩压缩收入线而算力承诺固定,护城河必须从原始模型能力(开源差距现在按月计)转向分发、记忆与上下文。本报告找到支持该命题的 5 组证据,也找到 4 组反例——前沿推理溢价、编码代理生态、全栈整合仍在抵抗通缩。
[推断:多源证据支持,但方向性判断] -
关键悖论:单位价格崩跌的同时,超大规模厂 FY2025 资本开支指引合计超 $3250 亿、企业 AI 总支出继续膨胀——量增(agent 化、推理时间缩放)抵消了价跌,这是理解本轮”通缩”的枢纽。
[事实:deluair 引财报;推断:机制解释]
一、事件概况
1.1 核心事实(双源交叉验证)
| 指标 | 数值 | 信源 |
|---|---|---|
| SDLLMTK 指数(2026-09-01 周一) | 97 美分/百万 token,首次跌破 $1 | CNBC(https://www.cnbc.com/2026/09/01/ai-token-prices-lows.html)+ Yahoo Finance(https://finance.yahoo.com/technology/ai/articles/ai-token-prices-hit-record-171552542.html) |
| 与夏初高点 | 跌超 50% | CNBC |
| 前 7 天跌幅 | 8.6% | Yahoo Finance |
| 指数口径 | 用量加权有效价格(usage-weighted effective price),混合供应商定价与实际消费量,跨多供应商路由网关 | Yahoo Finance |
| 指数创立时间 | 2025 年底 | CNBC |
| 当日市场 | 纳指 -1%、标普 -0.4%(周二) | CNBC |
口径提示:两个常用指数口径不同,容易混读
- Silicon Data / SDLLMTK(97 美分):用量加权的全市场有效均价——便宜模型(DeepSeek、Flash 层)消费量大,把指数拉低。
[事实:Yahoo 口径说明]
- BenchLM Token Price Index(2026-09 = 12,基准 2023.3=100):前沿旗舰中位混合价,当前 $4.50/百万 token——只算旗舰,不反映廉价层。
[事实:benchlm.ai 一手页]
二者并不矛盾:一个测”市场实际支出均价”,一个测”旗舰能力挂牌价”。
1.2 三个直接驱动因素(CNBC 归因)
-
中国开源模型低价竞争:Moonshot Kimi K3(2026-07-17 发布,2.8T 参数、开放权重)等以低于前沿实验室的价格供给能力。
[事实:CNBC] -
OpenAI 7 月底降价:GPT-5.6 Terra -20%、Luna -80%($0.20/$1.20 每百万 token)。
[事实:CNBC + apidog 交叉] -
动态定价:Monchau 称其他前沿实验室推出”动态定价”能力,费率随需求浮动,加大下行压力。
[事实:CNBC 引述 Monchau;具体厂商名单未点名——见待核实清单]
1.3 关键人物原话(CNBC 直接引述)
-
Charles-Henry Monchau(Syz Group 首席投资官):“Foundation model labs are the most directly exposed. Token deflation compresses the revenue line while compute commitments stay fixed. The strategic response is visible: the moat must shift away from raw model capability — where the open-weight gap is now measured in months — toward distribution, memory and context.”(基础模型实验室首当其冲;token 通缩压缩收入线而算力承诺固定;护城河必须从原始模型能力——开源差距现在按月计——转向分发、记忆与上下文。)
[事实:CNBC 原文] -
Steve Hou(Silicon Data 研究主管):价格下跌或预示供给已足以满足大多数任务(“provide sufficient capabilities for most tasks”)。
[事实:CNBC 原文]
二、纵向脉络:一条 2020-2026 的价格战曲线
数据源说明:本节价格锚点来自 deluair 咨询简报《AI inference economics in 2026》(https://deluair.com/consultancy/insights/ai-inference-economics-2026),该简报声明逐条对照 OpenAI/Anthropic/Google/DeepSeek 官方定价页 + Internet Archive 快照;部分与 BenchLM 指数成分表(https://benchlm.ai/token-price-index)交叉。`[事实-以两源并读为准]`
2.1 定价崩塌曲线(前沿通用能力,输出价美元/百万 token)
| 时间 | 模型 | 输入 $/1M | 输出 $/1M | 意义 |
|---|---|---|---|---|
| 2020.6 | GPT-3 text-davinci-001 | 60 | 60 | 起点锚 |
| 2023.3 | GPT-4 8K | 30 | 60 | BenchLM 基线(=100) |
| 2023.11 | GPT-4 Turbo | 10 | 30 | 首次显著降价 |
| 2024.3 | Claude 3 Opus | 15 | 75 | 闭源推理高水位 |
| 2024.5 | GPT-4o / Gemini 1.5 Pro | 5 | 15 | 进入个位数输入价 |
| 2024.6 | Claude 3.5 Sonnet | 3 | 15 | 性能超 Opus 而价减 5 倍 |
| 2024.7 | GPT-4o mini | 0.15 | 0.60 | 廉价层出现 |
| 2024.12 | DeepSeek V3 | 0.27 | 1.10 | 开源地板砸穿 |
| 2025.1 | DeepSeek R1 | 0.55 | 2.19 | 推理平价化(对标 o1 级) |
| 2026.7.9 | GPT-5.6 Sol/Terra/Luna 发布 | 1.00-5.00 | 6.00-30.00 | 三档分层 |
| 2026.7.30 | GPT-5.6 Luna 降价 | 0.20 | 1.20 | Luna -80% |
(deluair 表 + apidog 卡 https://apidog.com/blog/gpt-5-6-price-cut/ 交叉)[事实]
总量判断:前沿输出价从 $60(2023)压到 $1-3(2026),约 20-60 倍压缩;BenchLM 指数较 2023.3 基线 -88%(https://benchlm.ai/token-price-index);Epoch AI 测算”恒定能力下价格约 10 倍/年下滑”(deluair 引 https://epochai.org/blog/how-much-does-it-cost-to-query-frontier-llms)。zenodo 学术预印本《The Inference Cost Collapse》(2026-07-14,https://zenodo.org/records/21351758)独立测算 2023 年以来年降 70-80%,并引 IEEE 数据:GPT-4-Turbo 定价 2023Q4→2025Q2 降 75%。[事实:三源独立方向一致]
2.2 2025.1 DeepSeek R1:价格战的”珍珠港时刻”
-
DeepSeek V3(2024.12)与 R1(2025.1)以 $0.27-0.55/$1.10-2.19 的价格提供对标 o1 的推理质量,训练成本披露约 $560 万(H800 集群,V3 技术报告)。
[事实:deluair 引 arXiv 2412.19437 / 2501.12948;训练成本数字未直接打开 arXiv 原文——见待核实] -
2025-01-27 英伟达单日跌约 17%、市值损失约 $6000 亿,当时美股史上最大单日市值损失(Reuters 报道,deluair 转引 https://www.reuters.com/technology/artificial-intelligence/nvidia-sheds-almost-600-billion-market-value-deepseek-rattles-ai-darlings-2025-01-27/)。`[事实-二手引述,Reuters 原文未直接打开]`
-
商用层数周内跟进:Together AI、Fireworks、Deepinfra、Lambda、Cerebras、Groq 等一个月内开始托管 V3/R1,价格围绕 DeepSeek 官价收敛;推理能力开源地板由此固定在 $3/百万输出 token 以下。
[事实:deluair] -
历史意义:边际前沿能力提供者变成”受出口管制的中国开源实验室”,闭源实验室的溢价基础从”结构性成本优势”退化为”能力领先、安全姿态、生态与合同条款”。
[推断:deluair 分析]
2.3 2025:GPT-5 时代的定价特征
-
GPT-5 于 2025 年发布时,前沿通用输出价已进入个位数美元区间,缓存输入价进入美分档(deluair)。
[事实:deluair] -
BenchLM 成分表显示 GPT-5.1($1.25/$10)、GPT-5.2($1.75/$14)、GPT-5.4($2.5/$15)逐代发布(https://benchlm.ai/token-price-index)。`[事实:BenchLM]`
-
推理模型(o 系列)成为价格新锚:o1 一度 $15/$60,GPT-5.4 Pro $30/$180——推理深度(thinking tokens)成为独立于通用档的溢价轴。
[事实:BenchLM 成分表]
2.4 2026 夏:三国杀 + 中国开源两连击
| 日期 | 事件 | 信源 |
|---|---|---|
| 2026.6.1 | Anthropic 机密递交 S-1(SEC) | CNBC https://www.cnbc.com/2026/06/01/anthropic-ipo-s1-prospectus.html |
| 2026.6.8 | OpenAI 机密递交 S-1 | CNBC https://www.cnbc.com/2026/06/08/openai-confidentially-files-for-ipo-prepping-wall-street-for-ai-debut.html |
| 2026.6 | Anthropic 发布旗舰 Claude Fable 5 | CNBC(7/30 报道回述) |
| 2026.7.9 | GPT-5.6 全球发布(政府审查放行),Sol/Terra/Luna 三档 | Yahoo tech(https://tech.yahoo.com/ai/chatgpt/articles/openai-gets-permission-roll-gpt-090416512.html)+ apidog |
| 2026.7.17 | Kimi K3 发布:2.8T 参数、开放权重、中国最大模型;当日 Z.ai -28%、MiniMax -16% | CNBC https://www.cnbc.com/2026/07/17/moonshot-ai-kimi-k3-model-openai-anthropic-china.html |
| 2026.7.21 | Google 发布 Gemini 3.5 Flash Cyber / 3.6 Flash / 3.5 Flash-Lite;3.6 Flash 声称每任务成本低于 Kimi K3、Qwen 3.7 Max、GPT-5.6 Terra Max | CNBC https://www.cnbc.com/2026/07/21/google-gemini-flash-ai-mythos-rival.html |
| 2026.7 底 | Anthropic 发布 Claude Opus 5:半价于 Fable 5,性能相当 | CNBC(7/30 报道) |
| 2026.7.30 | OpenAI 降价:Terra -20%($2/$12)、Luna -80%($0.20/$1.20)、Sol 不变 + Fast mode(2.5x 速度 @2x 价) | CNBC https://www.cnbc.com/2026/07/30/open-ai-price-cut-gpt.html + apidog |
| 2026.8 | DeepSeek V4-Flash-0731:$0.03/任务;OpenRouter 处理量占比 27%(vs Google 25%),上周处理 8.22 万亿 token | Silicon UK(https://www.silicon.co.uk/ai-2/ai-token-prices-631109/amp,引 Jefferies) |
| 2026.8.6-8 | 市场平均推理价 $1.16-1.18/百万 token,年内新低(Jefferies 引 Silicon Data) | Silicon UK + cryptobriefing 双源 |
| 2026.9.1 | SDLLMTK 跌破 $1(97 美分) | CNBC + Yahoo |
三、横向对比:四类玩家的定价策略
数据源:BenchLM 指数成分表(一手)+ CNBC 系列 + apidog 卡。均为 2026 年 9 月视角。
3.1 定价策略对比表
| 玩家 | 代表模型($ 输入/输出每百万 token) | 定价策略 | 竞争定位 |
|---|---|---|---|
| OpenAI | GPT-5.6 Sol $5/$30(不变);Terra $2/$12(-20%);Luna $0.20/$1.20(-80%) | 三档分层 + 低端主动打价格战(Luna 组合价 $1.40 < Gemini 3.5 Flash-Lite $2.80 与 3.6 Flash $9);高端保留溢价 + Sol Fast mode 按延迟加价 | “便宜端抢量、旗舰端守价”;靠推理深度栈(o 系列)、Azure 分发、9 亿周活 ChatGPT |
| Anthropic | Claude Fable 5(旗舰,~$10/1M 输入[转述]);Claude Opus 5(半价于 Fable 5) | “平价旗舰”策略:Opus 5 以一半价格提供接近旗舰性能;不跟 Luna 式血拼 | 编码代理(Claude Code)生态声誉、Mythos 网络安全线、企业收入高速增长(运行率 $47B→$65B) |
| Google | Gemini 3.6 Flash / 3.5 Flash-Lite / 3.1 Pro $2/$12 | Flash 系列做价格地板(低于中国模型);Gemini 3.6 Flash 少用 17% token;全栈(TPU+云+模型)协同压成本;专研 Gemini 专用芯片(宣称 10x 效率) | “成本效率 + 生态整合”;用便宜层拉 Vertex 消费,旗舰层打推理 |
| 中国开源阵营 | DeepSeek V3/R1($0.27-0.55/$1.10-2.19);V4-Flash-0731($0.03/任务);Kimi K3($3/1M 输入[转述]);Qwen、腾讯 Hy3 | 开源权重 + 极限低价;权重可自托管削弱 API 粘性 | 全球定价地板制定者;OpenRouter 份额(DeepSeek 27% vs Google 25%) |
(OpenAI/Anthropic/Google 价格:CNBC + apidog + BenchLM;中国厂商:deluair + Silicon UK + Yahoo-Eisman)[事实;Kimi K3 与 Fable 5 价格为二手转述,见待核实]
3.2 关键观察
-
低端收敛于”每任务计价”:DeepSeek V4-Flash $0.03/任务、Google “每任务成本”话术——价格战正从”每百万 token”演进到”每任务/每单位产出”叙事,token 单价本身在快速失去作为商业契约锚的意义。
[推断:Silicon UK + CNBC 话术观察] -
高端分化出”延迟溢价”:Sol Fast mode(2.5x 速度 @2x 价)显示旗舰层开始按延迟而非按能力收费。
[事实:apidog] -
分层定价成为标准动作:OpenAI 三档、Google Flash 分层、BenchLM 的 Frontier/Mid/Budget 三层结构(Frontier 中位 $4.50、Mid $1.93、Budget $0.50)——市场已不是单一价格,而是”价格分层 + 路由”。
[事实:BenchLM] -
BenchLM 分层 YoY 的异常值:Frontier 层 YoY +71.4%(因 GPT-5.4 Pro 等高价推理旗舰进入成分),而 Mid 层 -40.8%——前沿推理溢价不降反升,被压缩的是通用层。这是”护城河转移”叙事最重要的数据反证。
[事实:BenchLM 数据;推断:解读]
四、影响分析
4.1 对 IPO 叙事:定价权故事正在被改写
-
时间窗口:Anthropic 6/1、OpenAI 6/8 机密递交 S-1,SpaceX 6 月上市($1.77 万亿,史上最大);三家公司可能占据史上最大 IPO 前三席。
[事实:CNBC 两篇] -
估值锚:OpenAI $852B(3 月底后轮)、Anthropic $965B(5 月 Series H);媒体/市场流传上市目标 $1T(Altman “硬底”)与 $2T+(Anthropic)。
[事实:CNBC;目标价为 Yahoo 转述市场传闻] -
通缩对 IPO 的直接冲击:CNBC 明确指出指数下滑”可能给 Anthropic、OpenAI 在考虑上市时带来新的利润压力”;低价会训练消费者预期更低费率 → 侵蚀供应商定价权。
[事实:CNBC 原话] -
Eisman 警告(反方声音):7/29 播客称中国开源模型触发”价格战”;8/13 CNBC Fast Money 称 OpenAI+Anthropic 约占微软/亚马逊/Alphabet/Oracle 的 AI 相关收入 70%、云收入 25-35%——“这些巨头公司的未来,某种程度上是押注 OpenAI、Anthropic 成功”。
[事实:Yahoo Finance 转述 https://finance.yahoo.com/technology/ai/articles/d-petrified-steve-eisman-says-100820154.html] -
Polymarket 定价:7/29 时 Anthropic 年内上市概率约 69%,OpenAI 约 19%(OpenAI 有传闻推迟到 2027)。
[事实:Yahoo 转述市场数据] -
Altman 的回应叙事:发布”第三阶段”宣言——“让先进 AI 丰裕、可负担、安全、有用”;主动拥抱通缩,把”降价”讲成”使命”。
[事实:CNBC 引 OpenAI 博客] -
判断:token 通缩与 IPO 的时间窗高度重合,意味着 S-1 的财务披露将首次让市场看到”营收增长 vs 定价权流失”的真实比率;通缩叙事(量增抵价跌)能否成立,是两家 IPO 估值能否站住的试金石。
[推断]
4.2 对应用层成本结构:通缩的受益者
-
需求弹性显著:cryptobriefing 引 ARK 数据——agent 驱动应用 token 处理量”暴涨至 10 倍”;价格腰斩后开发者把调用量翻倍去解原本不经济的自动化问题;$2/百万 token 时经济性边缘的用例,在 $1.16 时成为明显投资。
[事实:cryptobriefing 引 ARK https://cryptobriefing.com/ai-token-prices-record-lows/] -
学术量化(zenodo 预印本):年降 70% 使 AI 推荐引擎回收期从 36 个月压到 12 个月以内;实时欺诈检测从亏损翻转为盈利;200 个被访项目中 68% 称当前成本趋势会改变其上市决策、42% 会提前发布;约 15% 的 AI 预算从模型采购转向数据管道与集成;57% 的参与者认为锁定风险主要来自数据所有权与集成约束而非定价。
[事实:zenodo 全文 https://zenodo.org/records/21351758] -
成本结构新变量——推理深度:o 系列/R1/Claude thinking 的 thinking tokens 使单个难题可消耗 1 万-10 万思考 token;推理档挂牌 $8-20/百万输出。应用层的成本控制从”选便宜模型”转向”控制 effort 档位 + 缓存命中率 + 路由”。
[事实:deluair;推断:架构含义] -
企业总支出不降反升的悖论:Silicon UK 引 EY 研究——企业 AI 总成本螺旋上升(agent 可独立工作数小时/数天、消耗大量且不可预测的 token、企业缺乏可靠监控手段)。
[事实:Silicon UK 引 EY] -
判断:“token 通缩”对企业是总账单通缩还是通胀,取决于 agent 用量弹性。证据(ARK 10 倍、zenodo 弹性系数)指向”价跌量增、总账仍涨”——通缩的是单价,不是总盘子。
[推断]
4.3 对算力资本开支:单价崩跌 vs $3250 亿 capex 的”双轨世界”
-
capex 数据:Meta 指引 FY2025 资本开支 $60-65B、微软 $80B、亚马逊约 $105B、Alphabet 约 $75B——合计 >$3250 亿,几乎全是 AI 基建(deluair 引各家财报与 10-K)。
[事实:deluair 引财报] -
调和机制:① 用量增长快于单价下跌(每个用户/agent/工作流的 token 消耗上升,单次 agent 编码会话可达数千万 token);② 推理时间缩放(inference-time scaling)创造了 2023 年不存在的支出轴;③ 定制芯片(TPU v6 Trillium、Trainium 2、Maia、Gemini 专用芯片)从英伟达手里夺回推理毛利。
[事实:deluair + CNBC;推断:机制解释] -
英伟达链条的风险:Hopper 转售价值压缩快于 4 年折旧表;GPU 转售/租赁商被建议缩短租期(<24 个月)、转短周期多租户推理。
[推断:deluair 建议] -
判断:算力资本开支不是”通缩受害者”而是”量增受益者”——只要需求弹性成立,超大规模厂以更低的单位成本卖更多 token,总营收与总 capex 同步上行;真正的风险是弹性证伪(价跌后量不涨)。
[推断]
五、行业研判:护城河真的在转移吗?
5.1 Monchau 命题拆解
命题:开源能力差距已按月计 → 护城河从”原始模型能力”转向”分发、记忆与上下文”。
5.2 支持证据(5 组)
-
“模型不再是产品”论:Perplexity CEO Aravind Srinivas 对 CNBC 说”The model alone is no longer the product. It is the harness, the orchestration system…”——今年流行的开源 OpenClaw harness 让开发者随意替换底层模型,正是”模型商品化”的直接证据。
[事实:CNBC Kimi K3 报道] -
开源权重削弱粘性:Eisman 指出 Kimi K3 开放全部权重,“开发者可在自有 GPU 上以远低于前沿 API 的价格自托管,支撑溢价订阅的切换成本每个季度都在缩水”。
[事实:Yahoo 转述] -
锁定源迁移:zenodo 调研——57% 企业认为锁定主因是数据与集成而非定价;未来优势取决于专有数据资产与集成专长,“而非排他性模型访问”。
[事实:zenodo 全文] -
利润池迁移:deluair 认为可防御利润池移向四处——前沿推理(按答案价值收费)、领域/任务专精 agent(捆绑工具+评估+记忆+工作流)、分发与集成(云厂收栈外利润)、推理服务栈本身(vLLM/TensorRT-LLM/SGLang)。
[推断:deluair 分析] -
开发者行为:Fusion Fund Lu Zhang——开发者常在更强大/更便宜的新模型出现时直接换模型(Kimi K3 报道);OpenRouter 上 DeepSeek 以 27% 处理量超过 Google 的 25%。
[事实:CNBC + Silicon UK]
5.3 反例与制衡(4 组)
-
前沿推理溢价不降反升:BenchLM Frontier 层 YoY +71.4%(高价推理旗舰进成分);GPT-5.6 Sol 定价纹丝不动($5/$30)还加收延迟溢价;o1/GPT-5.4 Pro 档 $15-180。能力层的”高端尾”仍是利润池。
[事实:BenchLM + apidog] -
Kimi K3 并未真正封顶:Moonshot 自认整体仍落后 Claude Fable 5 与 GPT-5.6 Sol;MIT 教授 Ethan Mollick 称 K3”强但不均”,非 DeepSeek 级突破。
[事实:CNBC + Yahoo 转述] -
生态壁垒仍厚:Anthropic 的 Claude Code 编码代理生态与 Mythos 网络安全线、Google 的 TPU+云+模型全栈协同——这些是”分发/集成”的具体形态,恰恰说明能力之外的护城河已经有人先建起来了,且建在闭源生态里。
[事实:CNBC;推断:解读] -
“按月计”本身是双刃剑:开源差距按月计意味着差距存在但缩小快——闭源实验室必须在每个”月”里用产品化速度变现;而 K3 发布引发 Z.ai -28%、MiniMax -16%,说明中国阵营内部也在互相颠覆,“开源能力红利”会扩散到中国竞争对手之间。
[事实:CNBC]
5.4 综合判断
Monchau 命题方向成立,但需修正:不是”模型能力不再重要”,而是”通用能力溢价消失、能力分层仍在”。准确表述应为——[推断]
-
通用/廉价层:完全商品化,护城河 = 分发 + 集成 + 成本结构(Google 模式、中国开源模式);
-
前沿推理层:仍靠能力 + 生态(编码、安全、记忆)溢价(OpenAI Sol / Anthropic Fable 5 模式);
-
记忆与上下文:正在成为介于两层之间的新战场——它既是产品特性(agent 记忆、长上下文工程),也是锁定机制(数据资产)。这恰好是 Monchau 点出的方向,也是 zenodo “锁定来自数据”的呼应。
[推断]
5.5 谁受益谁受损
| 群体 | 方向 | 机制 |
|---|---|---|
| 应用层开发者 / 企业 | 受益 | 单价 20-60 倍压缩、ROI 改善(zenodo);但需管理 agent 总账膨胀(EY) |
| 中国开源阵营(DeepSeek/Moonshot/Qwen) | 受益 | 开源权重 + 低价定义全球地板;OpenRouter 份额反超(DeepSeek 27% vs Google 25%) |
| 云厂 / 超大规模厂 | 中性偏受益 | 单位毛利被压,但量增 + 定制芯片 + 平台锁定补回(>$3250 亿 capex 指引不变) |
| 推理服务栈(vLLM 等)/ 专用推理芯片 | 受益 | 通缩曲线的加速者与捕获者 |
| OpenAI / Anthropic(上市前夜) | 受损(定价权) | 收入线受压、S-1 将暴露定价权流失、IPO 估值叙事承压(Eisman 70% 依赖论) |
| 英伟达 / GPU 转售租赁链 | 受损(边际) | 推理单位毛利被定制芯片与软件栈分走;Hopper 转售价值加速折旧;但训练/量增仍是增量 |
| 纯 API 中间商(无权重、无生态) | 受损 | 与 DeepSeek 官价无差异竞争,毛利归零(deluair 建议短周期运营) |
5.6 三个剧本(推演纪律:全部为推测,标注触发条件)
| 剧本 | 概率表述 | 触发条件 / 证伪信号 |
|---|---|---|
| 乐观:量增碾压价跌 | [推测-待确认] | ARK”良性循环”持续:单价跌破 $1 后 agent 需求弹性继续放大(token 量增速 > 单价跌幅),应用层盈利潮出现,云厂与推理栈共赢,IPO 以量增故事高价完成 |
| 基准:分层稳态 | [推断] | 通用层维持地板价($0.2-1/1M),前沿推理保持溢价($8-30 档),价格战烈度随 IPO 季降温;OpenAI/Anthropic 以略低于市场传闻目标的估值上市;记忆/上下文成为新的产品卖点与并购热点 |
| 悲观:通缩吞噬营收 | [推测-待确认] | 弹性证伪信号:价跌后 token 总量增速放缓、企业 agent 预算见顶(EY 监控缺失 + 企业收紧);Eisman 式系统性担忧兑现(云厂 AI 收入依赖被市场重定价);IPO 推迟或砍估值——可观测指标:SDLLMTK 继续下探但 OpenRouter 总量增速转平、超大规模厂 capex 指引下调 |
六、断言清单
标注规则:[事实]=多源/一手源直接核实;[推断]=多条间接证据;[推测-待确认]=单源或未经一手验证。
| # | 断言 | 置信度 | 是否有信源 | 信源 URL |
|---|---|---|---|---|
| 1 | SDLLMTK 指数 2026-09-01 跌至 97 美分/百万 token,首次破 $1,创指数创立以来新低 | [事实] | 是(双源) | https://www.cnbc.com/2026/09/01/ai-token-prices-lows.html ;https://finance.yahoo.com/technology/ai/articles/ai-token-prices-hit-record-171552542.html |
| 2 | 指数较夏初高点跌超 50%;前 7 天 -8.6% | [事实] | 是 | 同上 |
| 3 | 指数口径 = 用量加权有效价格,混合供应商定价与实际消费量 | [事实] | 是 | https://finance.yahoo.com/technology/ai/articles/ai-token-prices-hit-record-171552542.html |
| 4 | 驱动因素含 Kimi K3 等中国开源模型低价、OpenAI 7 月底 GPT-5.6 降价、动态定价 | [事实] | 是 | https://www.cnbc.com/2026/09/01/ai-token-prices-lows.html |
| 5 | Monchau 命题原文:护城河须从模型能力转向分发、记忆与上下文 | [事实] | 是 | 同上(CNBC 引述) |
| 6 | Steve Hou:供给已足以满足大多数任务 | [事实] | 是 | 同上(CNBC 引述) |
| 7 | OpenAI、Anthropic 均机密递交 IPO(2026.6.1 / 6.8) | [事实] | 是 | https://www.cnbc.com/2026/06/01/anthropic-ipo-s1-prospectus.html ;https://www.cnbc.com/2026/06/08/openai-confidentially-files-for-ipo-prepping-wall-street-for-ai-debut.html |
| 8 | GPT-5.6 Luna -80%($0.20/$1.20)、Terra -20%($2/$12)、Sol 不变($5/$30)+ Fast mode;2026-07-30 生效 | [事实] | 是(双源交叉) | https://www.cnbc.com/2026/07/30/open-ai-price-cut-gpt.html ;https://apidog.com/blog/gpt-5-6-price-cut/ |
| 9 | Kimi K3 2026-07-17 发布:2.8T 参数、开放权重、中国最大模型;Z.ai -28%、MiniMax -16% | [事实] | 是 | https://www.cnbc.com/2026/07/17/moonshot-ai-kimi-k3-model-openai-anthropic-china.html |
| 10 | K3 整体仍落后 Claude Fable 5 与 GPT-5.6 Sol | [事实] | 是 | 同上 |
| 11 | Srinivas:“模型不再是产品,harness/编排才是”;OpenClaw 开源 harness 流行 | [事实] | 是 | 同上 |
| 12 | Anthropic Claude Opus 5 半价于 Fable 5、性能相当 | [事实] | 是 | https://www.cnbc.com/2026/07/30/open-ai-price-cut-gpt.html |
| 13 | Google Gemini 3.6 Flash 每任务成本低于 Kimi K3、Qwen 3.7 Max、GPT-5.6 Terra Max;3.6 Flash 少用 17% token | [事实] | 是 | https://www.cnbc.com/2026/07/21/google-gemini-flash-ai-mythos-rival.html |
| 14 | 2026.8 初市场平均推理价 $1.16-1.18/百万 token(8/6-8/8),较 5/31 的 $2.04 降 43% | [事实] | 是(双源交叉) | https://www.silicon.co.uk/ai-2/ai-token-prices-631109/amp ;https://cryptobriefing.com/ai-token-prices-record-lows/ |
| 15 | BenchLM 指数 2026-09 = 12(2023.3=100),前沿价 -88%;Frontier 中位 $4.50/1M;Frontier YoY +71.4%、Mid -40.8% | [事实] | 是(一手页) | https://benchlm.ai/token-price-index |
| 16 | 前沿输出价从 2023 年 $60 压至 2026 年 $1-3(20-60 倍);Epoch AI 恒定能力 10x/年 | [事实] | 是 | https://deluair.com/consultancy/insights/ai-inference-economics-2026 |
| 17 | 2023 年以来推理价年降 70-80%;GPT-4-Turbo 2023Q4→2025Q2 降 75% | [事实] | 是 | https://zenodo.org/records/21351758 |
| 18 | DeepSeek V3(2024.12)$0.27/$1.10、R1(2025.1)$0.55/$2.19;V4-Flash-0731 $0.03/任务;OpenRouter 份额 DeepSeek 27% vs Google 25% | [事实] | 是 | https://deluair.com/consultancy/insights/ai-inference-economics-2026 ;https://www.silicon.co.uk/ai-2/ai-token-prices-631109/amp |
| 19 | 2025-01-27 英伟达 -17%、市值损失约 $6000 亿 | [事实-二手引述] | 是(deluair 转引 Reuters,原文未直接打开) | https://deluair.com/consultancy/insights/ai-inference-economics-2026 → https://www.reuters.com/technology/artificial-intelligence/nvidia-sheds-almost-600-billion-market-value-deepseek-rattles-ai-darlings-2025-01-27/ |
| 20 | 四大超大规模厂 FY2025 capex 指引合计 >$3250 亿 | [事实] | 是(deluair 引财报) | https://deluair.com/consultancy/insights/ai-inference-economics-2026 |
| 21 | agent 应用 token 量增 10 倍(ARK);企业 AI 总成本仍螺旋上升(EY) | [事实] | 是 | https://cryptobriefing.com/ai-token-prices-record-lows/ ;https://www.silicon.co.uk/ai-2/ai-token-prices-631109/amp |
| 22 | 年降 70% 使 AI 项目回收期 36→12 个月;15% AI 预算从模型转向数据/集成;57% 认为锁定来自数据/集成 | [事实] | 是 | https://zenodo.org/records/21351758 |
| 23 | OpenAI $852B、Anthropic $965B 估值;Anthropic 收入运行率 $47B(5 月)→$65B(7 月底) | [事实] | 是 | https://www.cnbc.com/2026/06/08/openai-confidentially-files-for-ipo-prepping-wall-street-for-ai-debut.html ;https://finance.yahoo.com/technology/ai/articles/d-petrified-steve-eisman-says-100820154.html |
| 24 | Eisman:OpenAI+Anthropic 约占云厂 AI 相关收入 70%、云收入 25-35%;Polymarket:Anthropic 年内上市 69% vs OpenAI 19% | [事实] | 是(Yahoo 转述) | https://finance.yahoo.com/technology/ai/articles/d-petrified-steve-eisman-says-100820154.html |
| 25 | 前沿推理溢价不降反升(BenchLM Frontier YoY +71.4%),Sol 定价不变 | [事实] | 是 | https://benchlm.ai/token-price-index ;https://apidog.com/blog/gpt-5-6-price-cut/ |
| 26 | 护城河从能力转向分发/记忆/上下文(Monchau 命题)方向成立但需修正:通用层商品化、前沿推理仍溢价 | [推断] | 部分(支持证据 5 组 / 反例 4 组) | 见 5.2/5.3 各链接 |
| 27 | token 通缩对 IPO 估值叙事构成实质压力 | [推断] | 部分(CNBC 指出风险 + Eisman 警告) | https://www.cnbc.com/2026/09/01/ai-token-prices-lows.html |
| 28 | 算力资本开支是”量增受益者”而非”通缩受害者”,前提是需求弹性成立 | [推断] | 部分 | https://deluair.com/consultancy/insights/ai-inference-economics-2026 |
| 29 | 三个未来剧本(乐观/基准/悲观) | [推测-待确认] | 推理产物 | 触发条件见 5.6 |
七、⚠️ 待核实清单(含追踪过程)
| # | 条目 | 现状 | 追踪过程 |
|---|---|---|---|
| 1 | “动态定价”(dynamic pricing)具体是哪些前沿实验室、机制如何 | 未核实 | CNBC 仅转述 Monchau 未点名;已搜 “dynamic pricing LLM API 2026” 未见直接点名报道,留待后续:直接查 OpenAI/Anthropic/Google 官方定价页的容量/动态费率说明 |
| 2 | Kimi K3 官方 API 定价($3/1M 输入) | 待核实 | 仅 Yahoo-Eisman 二手转述;Moonshot 官方定价页未打开;且 K3 因容量限制限新订阅/API(CNBC 引 Kimi X 账号),官方价目可能不稳定 |
| 3 | Claude Fable 5 官方定价(~$10/1M 输入) | 待核实 | 同上,二手转述(Eisman 对比口径);Anthropic 定价页未打开 |
| 4 | DeepSeek V3 训练成本 $5.6M(H800 集群) | 待核实 | deluair 引 arXiv 2412.19437,本次未直接打开 arXiv 原文核对数字 |
| 5 | 英伟达 2025-01-27 市值损失 $6000 亿 | 待核实(低风险) | deluair 转引 Reuters;Reuters 原文未直接打开(历史知名事件,风险低) |
| 6 | Eisman “70% AI 相关收入”的具体计算口径与原始出处 | 待核实 | Yahoo 转述其 8/13 CNBC Fast Money 言论;未看节目原始录像/文字稿;该数字为 Eisman 估算,非财报数据 |
| 7 | 腾讯 Hy3 模型(OpenRouter 7.13 万亿 token/周)的定位与定价 | 待核实 | 仅 Silicon UK 提到处理量,未深挖 Hy3 是什么模型 |
| 8 | CNBC 6/10《Wall Street needs crash course in tokens ahead OpenAI, Anthropic IPOs》全文 | 未读取 | 主报道中链接提及(https://www.cnbc.com/2026/06/10/wall-street-needs-crash-course-in-tokens-ahead-openai-anthropic-ipos.html),本次未打开;与 IPO 叙事强相关,建议日报后续补充 |
| 9 | OpenAI/Anthropic 各自 token 相关营收占其总营收比例 | 无法核实 | 上市前不披露(机密 S-1 不公开);Eisman 的 70% 是云厂侧依赖度,非两公司自身收入结构 |
| 10 | Silicon Data 指数的具体模型池与权重明细 | 未核实 | Yahoo 给了口径(用量加权),但成分明细未公开;如需可查 Silicon Data 产品页 https://www.silicondata.com/products/silicon-index/llm-token-expenditure-index |
八、信源清单
一手/官方(已打开验证)
-
CNBC 主报道:AI token prices hit new record lows(2026-09-01)— https://www.cnbc.com/2026/09/01/ai-token-prices-lows.html
-
CNBC:Moonshot’s Kimi K3(2026-07-17)— https://www.cnbc.com/2026/07/17/moonshot-ai-kimi-k3-model-openai-anthropic-china.html
-
CNBC:OpenAI slashes GPT-5.6 prices(2026-07-30)— https://www.cnbc.com/2026/07/30/open-ai-price-cut-gpt.html
-
CNBC:OpenAI confidentially files for IPO(2026-06-08)— https://www.cnbc.com/2026/06/08/openai-confidentially-files-for-ipo-prepping-wall-street-for-ai-debut.html
-
CNBC:Anthropic confidentially files(2026-06-01)— https://www.cnbc.com/2026/06/01/anthropic-ipo-s1-prospectus.html
-
CNBC:Google Gemini Flash 三模型(2026-07-21)— https://www.cnbc.com/2026/07/21/google-gemini-flash-ai-mythos-rival.html
-
BenchLM Token Price Index(2026-09 快照,一手指数)— https://benchlm.ai/token-price-index
-
zenodo 预印本《The Inference Cost Collapse》全文(2026-07-14)— https://zenodo.org/records/21351758
独立媒体/研究(已打开验证)
-
Yahoo Finance(对主事件的独立报道,含 SDLLMTK 口径)— https://finance.yahoo.com/technology/ai/articles/ai-token-prices-hit-record-171552542.html
-
Yahoo Finance(Eisman 言论与 IPO 细节)— https://finance.yahoo.com/technology/ai/articles/d-petrified-steve-eisman-says-100820154.html
-
cryptobriefing(ARK/Jefferies 数据)— https://cryptobriefing.com/ai-token-prices-record-lows/
-
Silicon UK(Jefferies 引 Silicon Data;DeepSeek V4-Flash/OpenRouter)— https://www.silicon.co.uk/ai-2/ai-token-prices-631109/amp
-
deluair 咨询简报《AI inference economics in 2026》— https://deluair.com/consultancy/insights/ai-inference-economics-2026
-
apidog《GPT-5.6 price cut》价格卡 — https://apidog.com/blog/gpt-5-6-price-cut/
搜索定位但未直接打开的引用源
-
Reuters:Nvidia $600B 市值损失(deluair 转引)— https://www.reuters.com/technology/artificial-intelligence/nvidia-sheds-almost-600-billion-market-value-deepseek-rattles-ai-darlings-2025-01-27/
-
Epoch AI:querying frontier LLMs 成本(deluair 转引)— https://epochai.org/blog/how-much-does-it-cost-to-query-frontier-llms
-
Yahoo tech:GPT-5.6 7/9 发布获批(GPT-5.6 发布日期多源佐证)— https://tech.yahoo.com/ai/chatgpt/articles/openai-gets-permission-roll-gpt-090416512.html
-
Silicon Data 官方指数页 — https://www.silicondata.com/products/silicon-index/llm-token-expenditure-index
报告完成时间:2026-09-02 09:30(UTC+8)。价格类数据为 2026-09-01 视角,属高频变动项,引用时注意时效。