AI 日报hiw3c.com

深度|中美大模型定价暗战:OpenAI向右收紧利润,国产大模型向左狂卷补贴 - 搜狐

Google News AI m.sohu.com 网页快照

深度|中美大模型定价暗战:OpenAI向右收紧利润,国产大模型向左狂卷补贴

测试结果很快把这种变化变成了一个醒目的数字:在日常主力模型层级, Claude Opus 5.5 的 API 等值使用额度约为 GPT-6.1 Sol 的五倍。每月同样支付 200 美元,前者对应约 11,726 美元,后者约为 2,084 美元。

调整前购买的 200 美元套餐可暂时保留原额度至 10 月 29 日,新购用户则立即适用较低额度。新推出的 500 美元套餐在 Astra 用量上,仅比此前旧版 200 美元套餐高约 21%;但其主打的 300 tokens/s Ultrafast 推理速度也具有独立价值。

Anthropic 的策略不同:它通过模型分层控制昂贵推理资源。按照测试结果,在同一 200 美元 Claude 套餐中,Sonnet 5.5、Opus 5.5、Fable 5.1 的 API 等值额度分别约为 12,529、11,726 和 2,485 美元。Fable 还有独立的额度约束,不能简单把不同模型额度相加。

把最顶级模型摆在一起,情况却不一样:在 200 美元档位,二者 API 等值分别约 2,897 美元与 2,485 美元,差距并不大。但 Fable 的独立额度只允许使用套餐总额度的特定部分,因此不能直接把这两个数理解为“谁提供更多整体服务”。真正的悬殊出现在日常主力模型:Claude Opus 5.5 为 11,726 美元,GPT-6.1 Sol 为 2,084 美元。

如果干脆绕开 API 标价,直接比较 Token 数量,差距仍然存在:同为 200 美元档位,Claude Opus 5.5 约 286 亿 Token,GPT-6.1 Sol 约 102 亿 Token,约为 2.8 倍差距。这一比较比 API 等值更接近资源使用量,但仍然不能等同于同样数量的有效任务,因为不同模型在任务成功率、思考 Token、工具调用次数及上下文压缩策略上存在差异。

还有一个容易忽略的细节: OpenAI Pro 套餐没有与 Claude 同样的五小时限额,这让高峰期集中执行任务的用户更容易充分使用月度额度。反过来,拥有更高理论月度额度的套餐,如果受到较严格的短周期限制,用户未必能把全部额度消耗完。因此套餐价值需要同时比较“理论总量”“窗口约束”和“任务效率”。

这意味着厂商拥有两层定价权:一是公开的美元月费,二是内部计算额度与 Token 之间的隐性汇率。即使月费不变,厂商也能通过改变内部消耗率影响实际服务量。

为了看清这套不透明的规则,研究者做了一件相当笨、却有效的事:不断发起经过设计的请求,分别放大输入、缓存写入、缓存读取和输出的消耗,再盯着使用进度条什么时候跳动。一次请求看不出什么,成百上千次请求累积起来,隐藏的扣费比例就逐渐浮出水面。团队剔除不完整的计量区间,并将估计误差收敛到约 ±5%。更意外的是,三个相同套餐账户里有一个额度低约 20%;与厂商核实后才发现,它被纳入了一场小规模 A/B 测试。

测试团队通过设计不同提示词,让每组实验尽量集中消耗某一种 Token;输入实验每次加入随机标签以避免命中缓存,缓存写入实验强制创建新缓存,缓存读取实验使用固定标签重复请求,输出实验则使用技术文章诱导较长回答。研究者记录每次调用后的计量条位置,在多个完整进度跳变区间中计算 Token 与百分比的对应关系,并修正其他 Token 类型的干扰。

这种测量当然也有边界。比如缓存读取量累积到 5 亿 Token、进度条仍未变化时,研究者会在估算中暂时将其视为免费;这只是测量口径,并不意味着底层计算成本真的为零。因此,脱离具体模型、任务结构和套餐去谈一个统一的“性价比”,很容易得到误导性的结论。

API 等值额度并不是推理成本。模型厂商的 API 定价与其实际服务成本之间存在差距,因此更高的 API 等值额度不必然代表更大的真实亏损。

当单次推理成本下降,用户可能不仅会执行原有任务,还会尝试此前不值得自动化的新任务,例如持续运行代码审查、重复搜索、自动测试和多方案验证。由此,单位成本下降与总推理需求上升可以同时发生。这是对行业的延伸判断,而非 SemiAnalysis 对未来需求作出的定量预测。

MiniMax 的 Token Plus、Max、Ultra 月费分别为 22、55、132 美元。以 MiniMax-M3 计算,三个套餐的 API 等值分别约为 423、1,187、3,168 美元,达到月费的 19.2、21.6、24 倍。档位越高,单位月费换来的额度越多。

OpenAI 调整后的部分 Pro 套餐,每美元对应约 12 美元 API 等值;MiniMax-M3 的对应数值约为 19—24 美元。不过,API 等值取决于模型公开定价,并不代表真实推理成本或用户节省的金额。

智谱 GLM Coding Lite、Pro、Max 月费分别为 18、80、168 美元。使用 GLM-5.3 时,API 等值约为 139、830、1,942 美元,相当于月费的 7.7、10.4、11.6 倍。

换成 GLM-5.3-Flash,同档套餐的 API 等值降至约 24、143、336 美元,分别为月费的 1.3、1.8、2 倍。差异部分来自两款模型的 API 标价,并不能简单解读为 Flash 的实际成本更高。

月之暗面 Kimi Code 的 Plus、Pro、Max、Ultra 月费为 19、39、99、199 美元;以 Kimi K3 测算,API 等值约为 47、209、647、1,490 美元,对应月费的 2.5、5.4、6.5、7.5 倍。其高档套餐的单位价值提升尤为明显。

三家的策略差异清晰: MiniMax 用高额度吸引重度开发者,智谱通过模型定价拉开不同使用场景的价值,Kimi 则让更高档位获得更高单位额度。它们都在争夺开发者的日常工作流,但补贴方式不同。

这些比较基于偏向 Agent 的工作负载:缓存读取约占 Token 总量的 96.6%,新输入约占 0.4%,缓存写入约占 2.6%,输出约占 0.3%。因此结果尤其受缓存定价影响,不宜直接套用于普通聊天用户。

不过, Token 额度并不是软件价值的全部。如果 Cursor、Devin 能够以更少 Token、更短时间、更高成功率完成任务,仍然可能创造超出推理资源差异的价值。第三方 AI 应用必须证明其编排、协作、治理与执行能力具有独立的经济价值。

如果一个 Agent 产品能够自动处理仓库环境、降低失败重试、管理多模型路由,并把工程师从繁琐流程中解放出来,其收费基础就不再是转售 Token,而是交付成果。企业客户还会为权限控制、审计日志、合规、私有数据连接和可靠性付费。这些软件层能力有机会形成独立壁垒,但不能从其中的额度比较直接推导某家公司未来的胜负。

未来市场可能分为三个层次:普通消费者继续使用固定月费套餐;专业用户通过高价套餐购买更明确的速度、并发和模型额度;企业与复杂 Agent 工作流则更多按 Token、任务、执行时间或业务结果计费。

OpenAI 通过削减额度降低重度用户补贴,Anthropic 则利用模型分层逐渐改善利润率。两家公司最终可能走向相似的经济结构,只是节奏和路径不同。

AI 行业正在从争夺谁能提供最多 Token,转向争夺谁能以最低成本交付最多有价值的工作。当 AI 成为数字经济的基础生产力,这份生产力应该如何定价,或许比下一代模型在榜单上提高多少分,更能决定行业未来的利润分配。

比较两家模型公司,除了每百万 Token 的 API 价格,还应考察真实任务成功率、平均调用次数、缓存复用、工具执行成本、延迟、并发限制以及任务失败后的重试费用。最终能够持续盈利的 AI 公司,可能不是补贴力度最大的一家,而是能让每单位计算资源完成最多有价值工作的那一家。

资料来源: Andrew Megalaa、Max Kan、Dylan Patel,SemiAnalysis,Anthropic Subions Offer 5x+ More Value Than OpenAI,2026 年 10 月 5 日。