Tabbit
活动资源博客模型
Tabbit LogoTabbit

Tabbit — 为你工作的 AI 浏览器

主题资源

  • AI Browser Resources
  • Agentic Browser Resources
  • Browser Downloads and Install Guides
  • Browser Comparisons
  • AI Browser Alternatives
  • Browser Productivity Resources

热门指南

  • AI Browser
  • Agentic Browser Download
  • Best AI Browser 2026: Top 9 Tested & Ranked
  • AI Browser Download
  • Free AI Browser
  • Best AI Browser 2026
  • AI Browser Comparison 2026
  • AI Browser for Windows
  • AI Browser for Mac
  • Chrome Alternative 2026

活动

  • 别装了,你在《牛来》里早有原型
  • Tabbit 妙招大赛
  • KPOP SBTI 饭圈人格测试
  • Tabbit 校园共创者计划
  • fifi 的论文文献妙招精选
  • 用户问卷

关于

  • Tabbit 博客
  • 媒体报道
简体中文
简体中文English
测评与证据

GPT-5.6 Terra · 社区来源 · 个人体验

GPT-5.6 Terra Reddit LLMDevs 按角色小样本路由基准

这条证据记录“GPT-5.6 Terra Reddit LLMDevs 按角色小样本路由基准”在来源公布的模型、平台、日期和样本条件下的观察;不能外推为统一排名或生产保证。

待验证:本次未能重新核实原文。下方历史数字不代表已核实的当前结果。

社区来源个人体验编辑日期 2026-09-20

测试条件速查

模型/版本
GPT-5.6 Terra;来源日期 2026-08-18;不混用其他快照或推理档位。
平台/评测环境
Reddit r/LLMDevs;以该来源公布的平台与 harness 为观察单位。
样本/日期边界
采集日期 2026-08-20;“GPT-5.6 Terra Reddit LLMDevs 按角色小样本路由基准”不能在其公开样本之外推出统一通过率。

关键数据与适用场景

一句话结论

这个小样本本地基准没有证明 Terra 是通用最优,但显示 Terra max 在一个主输出角色中拿到 4.86/5、在一项植入 bug 修复中 4/4 正确却耗时 102.20 秒,适合把它当候选路由而非默认结论。

测试环境

  • 任务:3 个战略决策 memo、1 个基于仓库的执行 brief、2 个植入 bug 的修复任务并带直接测试。

  • 对照:GPT-5.6 Sol/Luna/Terra,并含 Fable、GPT-5.5、GPT-5.4 mini 等路线。

  • 控制:每个比较内使用相同 prompt 或 fixture;战略任务使用固定 rubric,覆盖判断、依据、风险、边界、可执行性和效率。

  • 评估方式:模型身份对评估者可见;作者明确称这是本地 workflow 分数,不是通用智能分数。

输入/配置

作者公开了任务类型、路线、观测时间、推理 tokens 和部分结果,但没有发布完整 prompt、仓库 fixture、测试代码或可下载 trace。该来源适合复刻“按角色小样本路由”的方法,不足以复算所有分数。

结果数据

战略任务

  • Multi-layer productization:Fable reference 95;Sol max 94、xhigh 90、high 87、GPT-5.5 high 81。

  • Decision-method / wrong-object review:Fable reference 92;Sol max 91、xhigh 90、Opus-class 87。

  • Bounded opportunity comparison:Fable reference 95;Sol high 94、Sol max 90、Luna max 88、Terra max 88。

  • Sol high 与 reference 相差不超过 1 分时,耗时 81.5 秒、推理 tokens 369;Sol max 为 216.9 秒、5,178 tokens,未改变决策。

仓库 brief 与植入 bug

  • Repository-grounded brief:Sol high 93、80.73 秒、1,818 reasoning tokens;Sol medium 91、70.66 秒、779 tokens。作者计算 medium 约快 12.5%,少用 57% reasoning tokens。

  • Planted-bug repair:Terra max 1 个 fixture,直接测试 4/4,通过首轮,观测时间 102.20 秒;同表中的 Sol low 为 2 fixtures、10/10、约 37.2 秒平均。

  • 另一个 frozen role-specific suite:Terra max 在 primary-output role 得分 4.86/5;Sol xhigh 在 quality-control 和 adversarial-review roles 得分 4.70 与 4.93。

结论

  • Terra max 在该作者的某个“主输出”角色中表现突出,但在公开的植入 bug 任务中正确而慢,不能据此替换所有 Sol 路由。

  • 更有价值的可复用结论是按任务角色分档,并把“一点以内差异”当作噪声;作者建议下一步做 blinded holdout。

  • 对 Terra 的复测应优先关注:同一 fixture 的首轮通过率、耗时、推理 tokens 和是否需要人工纠正,而不是只比较最终文本观感。

局限

  • 样本极小:战略 3 个 memo、仓库 brief 1 个、bug fixture 1–2 个;统计不确定性很大。

  • 评估者知道模型身份,存在确认偏差;作者自己也把结果定位为 local workflow scores。

  • 本地 CLI 延迟包含环境开销,订阅消耗不能直接等同 API token 成本。

  • 不同模型的 Chat、CLI、Agent harness 和多智能体表面不同;横向结果不是完全同配置。

复现步骤

  1. 为“战略决策、仓库 brief、植入 bug 修复、主输出”各准备最小但固定的任务集和验收 rubric。

  2. 在相同工作树、工具版本、超时与测试命令下运行 Terra max,并保存完整 prompt、输出、工具轨迹、tokens、耗时。

  3. 把模型身份从评估表中隐藏,至少让第二位评估者按同一 rubric 评分。

  4. 对每个角色至少重复多轮,报告均值、首轮通过率、人工纠正次数和失败类型。

  5. 再与 Sol high/medium、GPT-5.4 mini low 等候选路线比较,只有稳定差异才固化路由。

来源摘录或观察(仅做合规短引)

作者明确写道 “These are local workflow scores, not general intelligence scores.” 这是解释本结果的关键边界。

能支持的判断

  • 这条证据记录“GPT-5.6 Terra Reddit LLMDevs 按角色小样本路由基准”在来源公布的模型、平台、日期和样本条件下的观察;不能外推为统一排名或生产保证。

不能支持的判断

  • 不支持把 4.86/5、4/4 或 102.20 秒外推为 Terra 的通用排名;仅有 3 个 memo、1 个 brief 和 1–2 个 bug fixture,完整 prompt 与 trace 未公开。

方法、局限和复现

本文中的数字、任务集、推理档位和客户端条件只在所列来源及采集时点内成立。不同版本、不同 harness 或不同提供商的数据不能直接并排比较;未公开的参数保持未知。

需要复测时,请固定模型版本、提供商或客户端、推理档位、工具、任务集版本、样本数和采集日期,并记录失败、重试与人工修正。完整方法和复现步骤见下方来源笔记。

原始来源

Reddit r/LLMDevs · petburiraja · 原文发布日期 2026-08-18 · 本站编辑日期 2026-09-20

打开原始来源

GPT-5.6 Terra

在 Tabbit 中比较 GPT-5.6 Terra

下载 Tabbit 客户端后检查模型可用性

模型深度阅读

总览 · 简体中文

GPT-5.6 Terra:模型定位、获取方式与适用边界

从 API 规格、Sol 与 Luna 的差异、访问入口、价格边界和评测风险,判断 GPT-5.6 Terra 是否适合你的工作流。

相关评测

GPT-5.6 Terra System Card 安全防护与 Agent 边界OpenAI System Card 将 Terra 的安全能力放在具体工具、沙箱和提示注入测试中;结果支持安全边界评估,不等于生产防护保证。OpenAI 官方 GPT-5.6 Terra 基准、定价与任务边界OpenAI GPT-5.6 发布页把 Terra 放在 Sol 与 Luna 的系列定位中,并将基准、价格和任务类型分开呈现;没有公开 Terra 的业务成功率。GPT-5.6 Terra Artificial Analysis 智能、成本与编码 Agent 指数Artificial Analysis 的 GPT-5.6 Terra 页面把 Intelligence Index、Coding Agent Index 与成本位置放在同一比较框架,适合做成本—能力初筛。Artificial Analysis:GPT-5.6 Terra 在智能—成本曲线上的位置这条证据记录“Artificial Analysis:GPT-5.6 Terra 在智能—成本曲线上的位置”在来源公布的模型、平台、日期和样本条件下的观察;不能外推为统一排名或生产保证。Framer Agent 用 GPT-5.6 Terra 生成入场动画与布局变体Till Janek 的 Framer 案例把少量选择题、设计系统约束和页面级动画变体组合成 Terra 的视觉探索流程。GPT-5.6 Terra API 模型参数与工具配置OpenAI 模型页给出 Terra 的模型 ID、推理档位、上下文与输出上限及工具能力,可用于接入前的参数核对。GPT-5.6 Terra 前端交互原型提示词与验证工作流OpenAI 发布页展示用 GPT-5.6 系列生成可运行前端原型的短提示,并把浏览器渲染检查纳入后续迭代。GPT-5.6 Terra 长上下文成本阈值与路由工作流DataCamp 的 Terra 路由案例用输入长度、工具调用频率和终端需求划分长上下文任务,并提醒按完整请求成本预算。