AI3Radar
AI3Radar 官方AI3Radar 动态

如何为你的工作负载选 LLM:能力分层、token 成本与三步方法

按基准排名选模型在实践中会失败,因为你的工作负载由三个排名从不展示的数字决定:你读多少输入、生成多少输出、输入多久重复一次。本指南用官方标价把当前旗舰与主力模型映射到这三个数字,然后给出一个能扛住模型更新的选型方法。

截至 2026-08-05 的官方每百万 token 标价:OpenAI GPT-5.5 输入 $5.00、输出 $30.00,缓存输入 $0.50;GPT-5.4 mini 输入 $0.75、输出 $4.50,缓存输入 $0.075。Anthropic Claude Sonnet 5 输入 $2.00、输出 $10.00,入门价持续到 2026 年 8 月 31 日;Claude Opus 5 输入 $5.00、输出 $25.00。Google Gemini 3.6 Flash 输入 $1.50、输出 $7.50。缓存输入是最便宜的杠杆:一个从不变化、反复使用的系统提示,会按缓存价计费。

三步方法:第一步把任务分成快速生成(聊天、草稿、抽取)与深度推理(编程、分析、多步工作);第二步把快速层放在主力模型上,旗舰模型只留给推理层;第三步用一个典型日测量输入 token、输出 token 和重复前缀大小,然后在扩容前按标价对两层分别计算。

局限:标价和能力排名变化很快,企业或按量折扣不在其中。每月重新测量,把结果当作预算的上限估计,而不是永久答案。

任务到分层的映射能扛住版本更新,因为它锚定在工作本身,而不是模型。快速生成——聊天、草稿、抽取、格式化——属于主力层,GPT-5.4 mini、Claude Sonnet 5 和 Gemini 3.6 Flash 比各自旗舰便宜一到十倍。深度推理——编程、分析、多步研究——属于旗舰层,GPT-5.5 和 Opus 5 在真正提升的任务上物有所值。下表按 2026-08-05 标价把常见任务族映射到分层和代表模型。

上下文窗口和工具调用会以排名不展示的方式改变选择。如果你的负载把长文档或仓库流式送入提示,有效成本由输入 token 主导,那么缓存输入价格和便宜的输入比输出质量更重要。如果你的负载是工具调用或智能体,结构化输出和工具结果的可靠性比原始质量更重要;主力模型通常已经够用,只有当最终输出质量能在产品中可衡量时,旗舰才值得。在选型之前测量你的输入输出比,而不是之后。

旗舰与主力模型每百万 token API 价格(2026-08-05)
提供商模型输入输出缓存输入
OpenAIGPT-5.5$5.00$30.00$0.50
OpenAIGPT-5.4 mini$0.75$4.50$0.075
AnthropicClaude Sonnet 5$2.00$10.00
AnthropicClaude Opus 5$5.00$25.00
GoogleGemini 3.6 Flash$1.50$7.50

官方标价采集于 2026-08-05。Claude Sonnet 5 入门价($2/$10)持续到 2026-08-31。缓存输入价格适用于提供商支持的重复前缀。

任务族到模型分层映射(标价 2026-08-05)
任务族分层代表模型原因
聊天、草稿、抽取主力GPT-5.4 mini输入输出最便宜,$0.75/$4.50
文档摘要主力+Gemini 3.6 Flash$1.50/$7.50,支持缓存输入
编程与分析旗舰GPT-5.5$5.00/$30.00;多步推理最强
硬研究与智能体旗舰Claude Opus 5$5.00/$25.00;复杂任务更优

该映射是基于 2026-08-05 官方标价的决策辅助;每月重新测量。