如何为你的工作负载选 LLM:能力分层、token 成本与三步方法
按基准排名选模型在实践中会失败,因为你的工作负载由三个排名从不展示的数字决定:你读多少输入、生成多少输出、输入多久重复一次。本指南用官方标价把当前旗舰与主力模型映射到这三个数字,然后给出一个能扛住模型更新的选型方法。
截至 2026-08-05 的官方每百万 token 标价:OpenAI GPT-5.5 输入 $5.00、输出 $30.00,缓存输入 $0.50;GPT-5.4 mini 输入 $0.75、输出 $4.50,缓存输入 $0.075。Anthropic Claude Sonnet 5 输入 $2.00、输出 $10.00,入门价持续到 2026 年 8 月 31 日;Claude Opus 5 输入 $5.00、输出 $25.00。Google Gemini 3.6 Flash 输入 $1.50、输出 $7.50。缓存输入是最便宜的杠杆:一个从不变化、反复使用的系统提示,会按缓存价计费。
三步方法:第一步把任务分成快速生成(聊天、草稿、抽取)与深度推理(编程、分析、多步工作);第二步把快速层放在主力模型上,旗舰模型只留给推理层;第三步用一个典型日测量输入 token、输出 token 和重复前缀大小,然后在扩容前按标价对两层分别计算。
局限:标价和能力排名变化很快,企业或按量折扣不在其中。每月重新测量,把结果当作预算的上限估计,而不是永久答案。
任务到分层的映射能扛住版本更新,因为它锚定在工作本身,而不是模型。快速生成——聊天、草稿、抽取、格式化——属于主力层,GPT-5.4 mini、Claude Sonnet 5 和 Gemini 3.6 Flash 比各自旗舰便宜一到十倍。深度推理——编程、分析、多步研究——属于旗舰层,GPT-5.5 和 Opus 5 在真正提升的任务上物有所值。下表按 2026-08-05 标价把常见任务族映射到分层和代表模型。
上下文窗口和工具调用会以排名不展示的方式改变选择。如果你的负载把长文档或仓库流式送入提示,有效成本由输入 token 主导,那么缓存输入价格和便宜的输入比输出质量更重要。如果你的负载是工具调用或智能体,结构化输出和工具结果的可靠性比原始质量更重要;主力模型通常已经够用,只有当最终输出质量能在产品中可衡量时,旗舰才值得。在选型之前测量你的输入输出比,而不是之后。
| 提供商 | 模型 | 输入 | 输出 | 缓存输入 |
|---|---|---|---|---|
| OpenAI | GPT-5.5 | $5.00 | $30.00 | $0.50 |
| OpenAI | GPT-5.4 mini | $0.75 | $4.50 | $0.075 |
| Anthropic | Claude Sonnet 5 | $2.00 | $10.00 | 无 |
| Anthropic | Claude Opus 5 | $5.00 | $25.00 | 无 |
| Gemini 3.6 Flash | $1.50 | $7.50 | 无 |
官方标价采集于 2026-08-05。Claude Sonnet 5 入门价($2/$10)持续到 2026-08-31。缓存输入价格适用于提供商支持的重复前缀。
| 任务族 | 分层 | 代表模型 | 原因 |
|---|---|---|---|
| 聊天、草稿、抽取 | 主力 | GPT-5.4 mini | 输入输出最便宜,$0.75/$4.50 |
| 文档摘要 | 主力+ | Gemini 3.6 Flash | $1.50/$7.50,支持缓存输入 |
| 编程与分析 | 旗舰 | GPT-5.5 | $5.00/$30.00;多步推理最强 |
| 硬研究与智能体 | 旗舰 | Claude Opus 5 | $5.00/$25.00;复杂任务更优 |
该映射是基于 2026-08-05 官方标价的决策辅助;每月重新测量。