把单次输入是否超过 272K tokens、是否高频调用工具和是否需要终端执行作为路由条件,才能避免 Terra 的低标价在超长请求上失真。
适合的任务:为终端 Agent、工具密集型流水线和大文档检索建立初始路由规则与成本预算。
不适合的任务:把 DataCamp 汇总的跨厂商分数当成同一 harness 下的严格胜负,或把示例价格当成长期报价。
适用的模型版本:GPT-5.6 Terra;文中的 Sonnet 5 仅作为对照路由。
适用的客户端、Agent 或 API:OpenAI Responses API、终端/代码 Agent 或自建网关。
推荐的推理档位和参数:先用 Terra 默认/medium;工具调用和输出很长时按真实 trace 计费,复杂任务再比较更高档位。
将文章的成本比较改写成可执行的预算规则:
输入成本 = 输入 tokens / 1,000,000 × 输入单价
输出成本 = 输出 tokens / 1,000,000 × 输出单价
总成本 = 输入成本 + 输出成本
如果单次 input > 272,000:
Terra 输入成本按 2×,输出成本按 1.5×(整次请求)
路由初始规则:
shell/terminal/tool-heavy -> Terra
repository bug fixing -> Terra 与同档模型做小样本 A/B
单次上下文 > 272K -> 先比较分块 Terra 与平价长上下文模型
需要 custom temperature/top_p/top_k -> 选支持这些参数的模型从日志中统计每个请求的 input/output tokens、单次输入长度、工具调用数、模型轮数和失败重试数。
将任务分成“单次输入不超过 272K”和“超过 272K”两组,不要只按总月度 token 量比较。
对终端和工具密集任务先跑 Terra,记录每个工具调用前后的 token 和模型轮数;必要时比较 Programmatic Tool Calling 的真实收益。
对超长文档分别测试“一次性 Terra”和“按章节分块 Terra”,再与没有长上下文 surcharge 的备选模型比较总成本与质量。
对仓库修复任务固定相同输入、测试集和停止条件;DataCamp 明确提示 SWE-Bench Pro 的厂商分数来自不同 harness,只能作为方向性证据。
用实际计费账单回填预算。文章中的价格、缓存规则和 introductory pricing 都可能随日期变化。
DataCamp 给出的 Terra 参数:1,050,000 context、128K max output;2026-07-30 后价格为 $2/$12(输入/输出每 1M)。
Terminal-Bench 2.1:Terra 87.4%,Sonnet 5 80.4%;SWE-Bench Pro:Terra 63.4%,Sonnet 5 63.2%,文章将后者视为近似持平。
文章给出的 3 个计算样例:
1M input / 4M output:Terra $50,Sonnet 5 $63。
10M input / 1M output,拆成每次低于 272K:Terra $32,Sonnet 5 $45。
同样总量但每次超过 272K:Terra $58,Sonnet 5 $45。
文章称 Terra 的 Programmatic Tool Calling 在 Clio 的多步文档分析中减少 38% prompt tokens;该数字是合作方报告,不是 DataCamp 独立重跑。
文章给出的长上下文 MRCR v2 8-needle:Terra 在 256K–512K 为 89.6%,512K–1M 为 72.5%;文章没有给出 Sonnet 5 的同口径数字。
DataCamp 是比较型二手整理,不能替代 OpenAI 官方价格页或原始 benchmark 运行。
SWE-Bench、Terminal-Bench 的 Terra/Sonnet 数字来自不同厂商报告和 harness;“7 分领先”不能理解为完全受控的同场实验。
价格样例未纳入每个团队的缓存命中、重试、工具调用费、并发和折扣;预算必须用真实 trace 校准。
合作方的 token 减少结论(Notion、Clio、PlayCo 等)不是独立复现,适合作为待验证假设。
文章的核心判断是 “Terra is the stronger pick for terminal-driven coding agents”,但作者同时强调超 272K 请求会改变成本结论。
GPT-5.6 Terra