AI3Radar
AI3Radar 官方AI3Radar 动态

主流 LLM API 定价对比:GPT-5.5、Claude Sonnet 5、Opus 5 与 Gemini 3.6 Flash

每百万 token 的价格看起来很小,直到你开始乘。输出每百万 token 30 美元听起来很抽象,但一次长智能体会话就能消耗数万 token 输出,一个上线一个月的集成可以跑几百万。本文列出各提供商今天发布的官方标价,然后说明如何估算真实工作负载的实际成本——因为定价页上的数字只是计算的起点。

2026-08-05 每百万 token 官方标价:OpenAI GPT-5.5 输入 5.00 美元、输出 30.00 美元,缓存输入 0.50 美元;GPT-5.4 输入 2.50 美元、输出 15.00 美元,缓存输入 0.25 美元;GPT-5.4 mini 输入 0.75 美元、输出 4.50 美元,缓存输入 0.075 美元。Anthropic Claude Sonnet 5 输入 2.00 美元、输出 10.00 美元,官方公告说明入门价持续到 2026 年 8 月 31 日;Claude Opus 5 输入 5.00 美元、输出 25.00 美元。Google Gemini 3.6 Flash 输入 1.50 美元、输出 7.50 美元。下表把完整集合放在一处。

真实账单是三个数字,不是两个。输入 token 通常数量最大但单价最低;输出 token 数量少但贵得多;缓存输入可以在前缀重复时大幅降低输入成本。批处理 API 用延迟换取输入和输出各 50% 的折扣。只读一次长提示并生成短回复的工作负载很便宜;循环重新生成长输出的工作负载很贵,与模型标价无关。

实用的估算方法:统计一天的请求数、平均输入 token 大小、平均输出大小、以及有多少输入在多次调用间重复;然后用上面的标价做算术,再乘以月度量。局限在于标价会变、入门价会到期、企业或按量折扣不在其中——把结果当作上限估计,而不是报价。

一个具体示例能让标价变得可感。假设一个小型集成每月在 GPT-5.5 上跑 500 万输入 token 和 50 万输出 token:输入是 5 乘以 5.00 美元(25.00 美元),输出是 0.5 乘以 30.00 美元(15.00 美元),未计缓存与批处理折扣前每月合计 40.00 美元。同样负载用 GPT-5.4 mini 是 3.75 加 2.25 美元,约 6.00 美元。决定你最终数字的,是输入与输出的数量比,而不是标价本身。下表按标价演算三种典型负载。

降低账单的三个杠杆是缓存、批处理和模型分层。当长系统提示或文档前缀在多次调用间重复时,缓存输入会把这些 token 转入便宜得多的缓存价格。批处理 API 以延迟换取输入和输出各 50% 的成本折扣,适合报表类任务,不适合交互功能。模型分层是指把常规抽取和摘要交给更便宜的主力模型,把旗舰模型留给质量差异可衡量的任务。三者叠加可以把同一负载的账单降低一半以上,而不必更换模型家族。

每百万 token 官方 API 标价(2026-08-05)
提供商模型输入输出备注
OpenAIGPT-5.5$5.00$30.00缓存输入 $0.50
OpenAIGPT-5.4$2.50$15.00缓存输入 $0.25
OpenAIGPT-5.4 mini$0.75$4.50缓存输入 $0.075
AnthropicClaude Sonnet 5$2.00$10.002026-08-31 前入门价
AnthropicClaude Opus 5$5.00$25.00批处理 API 省 50%
GoogleGemini 3.6 Flash$1.50$7.50批处理 API 省 50%

官方 API 标价采集于 2026-08-05;入门价、地区价与企业价可能不同,预算前请核对提供商定价页。

官方标价下三种示例 API 负载(估算,2026-08-05)
负载模型每月输入 token每月输出 token估算月成本
轻量聊天机器人GPT-5.4 mini5M0.5M约 $6
文档摘要GPT-5.430M3M约 $120
智能体研究循环GPT-5.580M12M约 $760

基于 2026-08-05 官方标价的算术,未计缓存与批处理折扣;真实账单取决于实际 token 量与折扣条款。