语音 AI API 成本按 token 类型拆分:GPT-Realtime-2 音频与文本费率解析
实时语音模型把音频和文本 token 分开计价,而音频费率主导任何语音产品的预算。OpenAI 的 GPT-Realtime-2 标价为每百万音频输入 token $32.00、每百万音频输出 token $64.00,文本则是 $4.00 和 $24.00。每次听起来很便宜的会话会快速累积,因为每一次语音往返的两端都按音频费率计费。
缓存输入费率是语音产品唯一的真实杠杆:GPT-Realtime-2 对音频和文本都标价每百万缓存输入 token $0.40。一个包含大型固定系统提示、并在多轮间复用的会话,会把大部分输入成本从全额费率转移到缓存费率。
语音助手的实用预算方法:估算每会话的平均音频输入秒数、音频输出秒数、以及被复用的系统提示大小;按提供商公布的比率或抽样真实会话把秒数换算成 token;然后按标价分别计算全额费率与缓存费率两条路径。
局限:token 与秒的换算没有公布为固定比率,实时会话差异很大,这些是 2026-08-05 采集的标价。扩容前测量真实会话,预算前重新核对定价页。
一个会话级示例能让音频费率变得可感。GPT-Realtime-2 上的一次五分钟支持通话,大约产生 90 秒客户音频输入和 80 秒助手音频输出;按每百万输入 32.00 美元、输出 64.00 美元的音频费率,在典型 token 数量下,一次短通话只花几美分。更大的成本驱动是系统提示:一个在轮次间复用的长固定提示会转入每百万 0.40 美元的缓存费率——这正是能规模化与不能规模化的产品之间的差别。
实时语音不一定总是正确工具。如果交互不需要逐轮打断和低延迟,用更便宜文本模型的先转写再完成的流水线,可以把昂贵的音频部分压缩成一段简短的转写任务。实时 API 买到的是交互性,预算应该由对话中真正需要交互性的部分决定。下表按标价对比三种产品形态。
| Token 类型 | 输入 | 缓存输入 | 输出 |
|---|---|---|---|
| Audio | $32.00 | $0.40 | $64.00 |
| Text | $4.00 | $0.40 | $24.00 |
官方标价来自 openai.com/api/pricing(2026-08-05)。实时会话同时消耗音频与文本 token。
| 产品形态 | 音频输入 | 音频输出 | 成本驱动 |
|---|---|---|---|
| 短指令助手 | 每会话约 10 秒 | 每会话约 8 秒 | 缓存系统提示;每轮 token 少 |
| 五分钟支持通话 | 每会话约 90 秒 | 每会话约 80 秒 | 对话两端均为全额音频费率 |
| 会议转写流水线 | 非实时 | 非实时 | 更便宜的文本流水线;音频仅按转写计费 |
估算基于 2026-08-05 官方标价的算术;token 与秒的换算没有公布的固定比率,扩容前请测量真实会话。