Tabbit
活动资源博客模型
Tabbit LogoTabbit

Tabbit — 为你工作的 AI 浏览器

主题资源

  • AI Browser Resources
  • Agentic Browser Resources
  • Browser Downloads and Install Guides
  • Browser Comparisons
  • AI Browser Alternatives
  • Browser Productivity Resources

热门指南

  • AI Browser
  • Agentic Browser Download
  • Best AI Browser 2026: Top 9 Tested & Ranked
  • AI Browser Download
  • Free AI Browser
  • Best AI Browser 2026
  • AI Browser Comparison 2026
  • AI Browser for Windows
  • AI Browser for Mac
  • Chrome Alternative 2026

活动

  • 别装了,你在《牛来》里早有原型
  • Tabbit 妙招大赛
  • KPOP SBTI 饭圈人格测试
  • Tabbit 校园共创者计划
  • fifi 的论文文献妙招精选
  • 用户问卷

关于

  • Tabbit 博客
  • 媒体报道
测评
社区GPT-5.6 Terra

GPT-5.6 Terra Reddit LLMDevs 按角色小样本路由基准

原始来源

Reddit r/LLMDevs

作者petburiraja

原文日期2026-08-18

Tabbit 整理2026-08-19

查看原文

一句话结论

这个小样本本地基准没有证明 Terra 是通用最优,但显示 Terra max 在一个主输出角色中拿到 4.86/5、在一项植入 bug 修复中 4/4 正确却耗时 102.20 秒,适合把它当候选路由而非默认结论。

测试环境

  • 任务:3 个战略决策 memo、1 个基于仓库的执行 brief、2 个植入 bug 的修复任务并带直接测试。

  • 对照:GPT-5.6 Sol/Luna/Terra,并含 Fable、GPT-5.5、GPT-5.4 mini 等路线。

  • 控制:每个比较内使用相同 prompt 或 fixture;战略任务使用固定 rubric,覆盖判断、依据、风险、边界、可执行性和效率。

  • 评估方式:模型身份对评估者可见;作者明确称这是本地 workflow 分数,不是通用智能分数。

输入/配置

作者公开了任务类型、路线、观测时间、推理 tokens 和部分结果,但没有发布完整 prompt、仓库 fixture、测试代码或可下载 trace。该来源适合复刻“按角色小样本路由”的方法,不足以复算所有分数。

结果数据

战略任务

  • Multi-layer productization:Fable reference 95;Sol max 94、xhigh 90、high 87、GPT-5.5 high 81。

  • Decision-method / wrong-object review:Fable reference 92;Sol max 91、xhigh 90、Opus-class 87。

  • Bounded opportunity comparison:Fable reference 95;Sol high 94、Sol max 90、Luna max 88、Terra max 88。

  • Sol high 与 reference 相差不超过 1 分时,耗时 81.5 秒、推理 tokens 369;Sol max 为 216.9 秒、5,178 tokens,未改变决策。

仓库 brief 与植入 bug

  • Repository-grounded brief:Sol high 93、80.73 秒、1,818 reasoning tokens;Sol medium 91、70.66 秒、779 tokens。作者计算 medium 约快 12.5%,少用 57% reasoning tokens。

  • Planted-bug repair:Terra max 1 个 fixture,直接测试 4/4,通过首轮,观测时间 102.20 秒;同表中的 Sol low 为 2 fixtures、10/10、约 37.2 秒平均。

  • 另一个 frozen role-specific suite:Terra max 在 primary-output role 得分 4.86/5;Sol xhigh 在 quality-control 和 adversarial-review roles 得分 4.70 与 4.93。

结论

  • Terra max 在该作者的某个“主输出”角色中表现突出,但在公开的植入 bug 任务中正确而慢,不能据此替换所有 Sol 路由。

  • 更有价值的可复用结论是按任务角色分档,并把“一点以内差异”当作噪声;作者建议下一步做 blinded holdout。

  • 对 Terra 的复测应优先关注:同一 fixture 的首轮通过率、耗时、推理 tokens 和是否需要人工纠正,而不是只比较最终文本观感。

局限

  • 样本极小:战略 3 个 memo、仓库 brief 1 个、bug fixture 1–2 个;统计不确定性很大。

  • 评估者知道模型身份,存在确认偏差;作者自己也把结果定位为 local workflow scores。

  • 本地 CLI 延迟包含环境开销,订阅消耗不能直接等同 API token 成本。

  • 不同模型的 Chat、CLI、Agent harness 和多智能体表面不同;横向结果不是完全同配置。

复现步骤

  1. 为“战略决策、仓库 brief、植入 bug 修复、主输出”各准备最小但固定的任务集和验收 rubric。

  2. 在相同工作树、工具版本、超时与测试命令下运行 Terra max,并保存完整 prompt、输出、工具轨迹、tokens、耗时。

  3. 把模型身份从评估表中隐藏,至少让第二位评估者按同一 rubric 评分。

  4. 对每个角色至少重复多轮,报告均值、首轮通过率、人工纠正次数和失败类型。

  5. 再与 Sol high/medium、GPT-5.4 mini low 等候选路线比较,只有稳定差异才固化路由。

来源摘录或观察(仅做合规短引)

作者明确写道 “These are local workflow scores, not general intelligence scores.” 这是解释本结果的关键边界。

Tabbit 小编提醒

本文是第三方资料导航。测试环境、模型版本和主观体验可能不同,请以原文为准。

GPT-5.6 Terra

在 Tabbit 中使用并对比模型

GPT-5.6 Terra

相关测评

官方OpenAI Deployment Safety Hub2026-07-09

GPT-5.6 Terra System Card 安全防护与 Agent 边界

官方SonarSource2026-08-06

GPT-5.6 Terra SonarSource 4,444 Java 任务代码质量与安全复测

官方OpenAI 官方发布页2026-07-10

OpenAI 官方 GPT-5.6 Terra 基准、定价与任务边界

媒体Artificial Analysis2026-07-09

GPT-5.6 Terra Artificial Analysis 智能、成本与编码 Agent 指数

GPT-5.6 Terra

相关提示词

官方OpenAI Developers

GPT-5.6 Terra API 模型参数与工具配置

官方OpenAI 官方发布2026-07-09

GPT-5.6 Terra 前端交互原型提示词与验证工作流

媒体DataCamp2026-08-04

GPT-5.6 Terra 长上下文成本阈值与路由工作流

社区X2026-08-01

Framer Agent 用 GPT-5.6 Terra 生成入场动画与布局变体