AI3Radar
AI3Radar 官方AI3Radar 动态

语音 AI API 成本按 token 类型拆分:GPT-Realtime-2 音频与文本费率解析

实时语音模型把音频和文本 token 分开计价,而音频费率主导任何语音产品的预算。OpenAI 的 GPT-Realtime-2 标价为每百万音频输入 token $32.00、每百万音频输出 token $64.00,文本则是 $4.00 和 $24.00。每次听起来很便宜的会话会快速累积,因为每一次语音往返的两端都按音频费率计费。

缓存输入费率是语音产品唯一的真实杠杆:GPT-Realtime-2 对音频和文本都标价每百万缓存输入 token $0.40。一个包含大型固定系统提示、并在多轮间复用的会话,会把大部分输入成本从全额费率转移到缓存费率。

语音助手的实用预算方法:估算每会话的平均音频输入秒数、音频输出秒数、以及被复用的系统提示大小;按提供商公布的比率或抽样真实会话把秒数换算成 token;然后按标价分别计算全额费率与缓存费率两条路径。

局限:token 与秒的换算没有公布为固定比率,实时会话差异很大,这些是 2026-08-05 采集的标价。扩容前测量真实会话,预算前重新核对定价页。

一个会话级示例能让音频费率变得可感。GPT-Realtime-2 上的一次五分钟支持通话,大约产生 90 秒客户音频输入和 80 秒助手音频输出;按每百万输入 32.00 美元、输出 64.00 美元的音频费率,在典型 token 数量下,一次短通话只花几美分。更大的成本驱动是系统提示:一个在轮次间复用的长固定提示会转入每百万 0.40 美元的缓存费率——这正是能规模化与不能规模化的产品之间的差别。

实时语音不一定总是正确工具。如果交互不需要逐轮打断和低延迟,用更便宜文本模型的先转写再完成的流水线,可以把昂贵的音频部分压缩成一段简短的转写任务。实时 API 买到的是交互性,预算应该由对话中真正需要交互性的部分决定。下表按标价对比三种产品形态。

GPT-Realtime-2 每百万 token API 标价(2026-08-05)
Token 类型输入缓存输入输出
Audio$32.00$0.40$64.00
Text$4.00$0.40$24.00

官方标价来自 openai.com/api/pricing(2026-08-05)。实时会话同时消耗音频与文本 token。

GPT-Realtime-2 标价下三种语音产品形态(估算,2026-08-05)
产品形态音频输入音频输出成本驱动
短指令助手每会话约 10 秒每会话约 8 秒缓存系统提示;每轮 token 少
五分钟支持通话每会话约 90 秒每会话约 80 秒对话两端均为全额音频费率
会议转写流水线非实时非实时更便宜的文本流水线;音频仅按转写计费

估算基于 2026-08-05 官方标价的算术;token 与秒的换算没有公布的固定比率,扩容前请测量真实会话。