Tabbit
活动资源博客模型
Tabbit LogoTabbit

Tabbit — 为你工作的 AI 浏览器

主题资源

  • AI Browser Resources
  • Agentic Browser Resources
  • Browser Downloads and Install Guides
  • Browser Comparisons
  • AI Browser Alternatives
  • Browser Productivity Resources

热门指南

  • AI Browser
  • Agentic Browser Download
  • Best AI Browser 2026: Top 9 Tested & Ranked
  • AI Browser Download
  • Free AI Browser
  • Best AI Browser 2026
  • AI Browser Comparison 2026
  • AI Browser for Windows
  • AI Browser for Mac
  • Chrome Alternative 2026

活动

  • 别装了,你在《牛来》里早有原型
  • Tabbit 妙招大赛
  • KPOP SBTI 饭圈人格测试
  • Tabbit 校园共创者计划
  • fifi 的论文文献妙招精选
  • 用户问卷

关于

  • Tabbit 博客
  • 媒体报道
简体中文
简体中文English
测评与证据

GPT-5.6 Terra · 官方来源 · 厂商自报

GPT-5.6 Terra SonarSource 4,444 Java 任务代码质量与安全复测

SonarSource 在 4,444 个 Java 任务上复测 Sol 与 Terra,能说明静态代码质量和安全检测样本中的差异,不能替代真实仓库验证。

待验证:本次未能重新核实原文。下方历史数字不代表已核实的当前结果。

官方来源厂商自报编辑日期 2026-09-20

测试条件速查

来源具体观察
2026-07-11 SonarSource 复测;4,444 个 Java 任务,使用 SonarQube 规则检测代码质量与安全问题,并比较 Sol/Terra 结果。
已公布条件
该评测是 SonarSource 的任务集与分析流水线,不是通用端到端 Agent;完整 prompt、重复次数和每个 snapshot 未全部公开。

关键数据与适用场景

一句话结论

在同一组 4,444 个 Java 任务和 medium 推理配置下,Terra 生成的代码更短、缺失完成更少,但认知复杂度、bug/vulnerability 和 code smell 密度更高,必须接入静态分析与测试。

测试环境

  • 模型:GPT-5.6 Sol、GPT-5.6 Terra、GPT-5.5。

  • 语言:Java。

  • 任务数:4,444;来源为 HumanEval、MBPP、ComplexCodeEval。

  • 推理设置:三种模型均为 medium。

  • 分析器:SonarQube algorithmic code analysis。

  • 指标单位:complexity/code smell 按 kLOC;bug/vulnerability 和分类明细按 mLOC。

输入/配置

SonarSource 说明三种模型使用同一任务、同一质量分析和同一推理档位,并把 GPT-5.5 重新跑在同一框架中。文章没有公开每题 prompt、快照、采样参数、完整生成输出或任务级失败清单。

结果数据

指标GPT-5.5GPT-5.6 SolGPT-5.6 Terra
总代码行数702,720750,198617,132
函数数92,20682,16470,378
注释占比2.0%1.5%0.9%
Cognitive complexity / kLOC151.27143.23161.53
Functional skill pass rate78.66%81.99%79.96%
Missing completions0.27%0.25%0.18%
Bug density / mLOC504724763
Vulnerability density / mLOC68197203
Code smell density / kLOC17.0517.6023.31

补充数据:Terra 输出约 8.37M tokens、推理 tokens 约 3.66M;输入约 1.32M tokens。Terra 的 blocker-level smell 为 62/mLOC,低于 Sol 的 72 和 GPT-5.5 的 78,但 collection/generics 类问题升至 11,843/mLOC。并发/线程 bug 是 Terra 最大 bug 类别,约 350/mLOC。

结论

  • Terra 的 79.96% pass rate 略高于 GPT-5.5,但低于 Sol 的 81.99%;不能只按模型价格判断生产可靠性。

  • Terra 以 617,132 行代码完成同一任务,代码量显著少于 GPT-5.5 和 Sol;这有利于减少审阅体积,但每 kLOC 的问题密度更高。

  • 认知复杂度 161.53/kLOC、bug 763/mLOC、漏洞 203/mLOC 和 smell 23.31/kLOC,说明“短”不等于“更易维护”。

  • 并发/线程、密码学配置和资源处理是应优先自动化检查的风险面;人工通读不应是唯一门禁。

局限

  • 任务全部为 Java 合成/标准化任务,不能代表多语言真实仓库。

  • SonarQube 静态分析反映可检测的代码问题,不等于真实线上缺陷率,也不能衡量完整系统的业务正确性。

  • 同一 medium 设置有利于受控比较,但没有告诉我们 Terra 在 low/high/max 下的质量-成本曲线。

  • 文章由 SonarSource 发布,分析器和指标定义由其控制;应保留原始输出并用第二种测试框架交叉验证。

复现步骤

  1. 固定 Java 版本、HumanEval/MBPP/ComplexCodeEval 任务版本、模型别名和 medium 推理档位。

  2. 对每题保存 prompt、响应、编译/测试日志、生成代码行数和 tokens;不要只保存总分。

  3. 用同一 SonarQube 版本和规则集分析三组输出,按文章的 kLOC/mLOC 单位计算密度。

  4. 把 pass rate、missing completion、bug/vulnerability/smell 分开报告,并按严重级别展开。

  5. 对并发、密码学和资源处理问题做人工抽样复核,确认静态规则命中是否构成真实缺陷。

来源摘录或观察(仅做合规短引)

作者对 Terra 的概括是 “Terra is the concise one”,但同一段数据同时显示其 cognitive complexity 和问题密度最高。

能支持的判断

  • 支持讨论规则命中、缺陷修复和安全检查在该 Java 样本上的表现

不能支持的判断

  • 支持讨论规则命中、缺陷修复和安全检查在该 Java 样本上的表现;不支持泛化到非 Java 仓库、工具权限或生产缺陷率。

方法、局限和复现

本文中的数字、任务集、推理档位和客户端条件只在所列来源及采集时点内成立。不同版本、不同 harness 或不同提供商的数据不能直接并排比较;未公开的参数保持未知。

需要复测时,请固定模型版本、提供商或客户端、推理档位、工具、任务集版本、样本数和采集日期,并记录失败、重试与人工修正。完整方法和复现步骤见下方来源笔记。

原始来源

SonarSource · Killian Carlsen-Phelan、Prasenjit Sarkar · 原文发布日期 2026-08-06 · 本站编辑日期 2026-09-20

打开原始来源

GPT-5.6 Terra

在 Tabbit 中比较 GPT-5.6 Terra

下载 Tabbit 客户端后检查模型可用性

模型深度阅读

总览 · 简体中文

GPT-5.6 Terra:模型定位、获取方式与适用边界

从 API 规格、Sol 与 Luna 的差异、访问入口、价格边界和评测风险,判断 GPT-5.6 Terra 是否适合你的工作流。

相关评测

GPT-5.6 Terra System Card 安全防护与 Agent 边界OpenAI System Card 将 Terra 的安全能力放在具体工具、沙箱和提示注入测试中;结果支持安全边界评估,不等于生产防护保证。OpenAI 官方 GPT-5.6 Terra 基准、定价与任务边界OpenAI GPT-5.6 发布页把 Terra 放在 Sol 与 Luna 的系列定位中,并将基准、价格和任务类型分开呈现;没有公开 Terra 的业务成功率。GPT-5.6 Terra Artificial Analysis 智能、成本与编码 Agent 指数Artificial Analysis 的 GPT-5.6 Terra 页面把 Intelligence Index、Coding Agent Index 与成本位置放在同一比较框架,适合做成本—能力初筛。GPT-5.6 Terra Reddit LLMDevs 按角色小样本路由基准这条证据记录“GPT-5.6 Terra Reddit LLMDevs 按角色小样本路由基准”在来源公布的模型、平台、日期和样本条件下的观察;不能外推为统一排名或生产保证。Codex Agent.md 的 GPT-5.6 多代理路由规则该 Codex 配置案例按任务复杂度路由 Sol、Terra 与 Luna,并为可拆分任务保留人工或自动验收点。Codex Multi-Agent V2 的 Terra 子代理默认配置LPK 的案例把 Terra high 作为 Codex Multi-Agent V2 的有界子代理默认,并限制并发与深度以控制容量。GPT-5.6 Terra API 模型参数与工具配置OpenAI 模型页给出 Terra 的模型 ID、推理档位、上下文与输出上限及工具能力,可用于接入前的参数核对。GPT-5.6 Terra 前端交互原型提示词与验证工作流OpenAI 发布页展示用 GPT-5.6 系列生成可运行前端原型的短提示,并把浏览器渲染检查纳入后续迭代。