Tabbit
活动资源博客模型
Tabbit LogoTabbit

Tabbit — 为你工作的 AI 浏览器

主题资源

  • AI Browser Resources
  • Agentic Browser Resources
  • Browser Downloads and Install Guides
  • Browser Comparisons
  • AI Browser Alternatives
  • Browser Productivity Resources

热门指南

  • AI Browser
  • Agentic Browser Download
  • Best AI Browser 2026: Top 9 Tested & Ranked
  • AI Browser Download
  • Free AI Browser
  • Best AI Browser 2026
  • AI Browser Comparison 2026
  • AI Browser for Windows
  • AI Browser for Mac
  • Chrome Alternative 2026

活动

  • 别装了,你在《牛来》里早有原型
  • Tabbit 妙招大赛
  • KPOP SBTI 饭圈人格测试
  • Tabbit 校园共创者计划
  • fifi 的论文文献妙招精选
  • 用户问卷

关于

  • Tabbit 博客
  • 媒体报道
测评
官方GPT-5.6 Terra

GPT-5.6 Terra SonarSource 4,444 Java 任务代码质量与安全复测

原始来源

SonarSource

作者Killian Carlsen-Phelan、Prasenjit Sarkar

原文日期2026-08-06

Tabbit 整理2026-08-19

查看原文

一句话结论

在同一组 4,444 个 Java 任务和 medium 推理配置下,Terra 生成的代码更短、缺失完成更少,但认知复杂度、bug/vulnerability 和 code smell 密度更高,必须接入静态分析与测试。

测试环境

  • 模型:GPT-5.6 Sol、GPT-5.6 Terra、GPT-5.5。

  • 语言:Java。

  • 任务数:4,444;来源为 HumanEval、MBPP、ComplexCodeEval。

  • 推理设置:三种模型均为 medium。

  • 分析器:SonarQube algorithmic code analysis。

  • 指标单位:complexity/code smell 按 kLOC;bug/vulnerability 和分类明细按 mLOC。

输入/配置

SonarSource 说明三种模型使用同一任务、同一质量分析和同一推理档位,并把 GPT-5.5 重新跑在同一框架中。文章没有公开每题 prompt、快照、采样参数、完整生成输出或任务级失败清单。

结果数据

指标GPT-5.5GPT-5.6 SolGPT-5.6 Terra
总代码行数702,720750,198617,132
函数数92,20682,16470,378
注释占比2.0%1.5%0.9%
Cognitive complexity / kLOC151.27143.23161.53
Functional skill pass rate78.66%81.99%79.96%
Missing completions0.27%0.25%0.18%
Bug density / mLOC504724763
Vulnerability density / mLOC68197203
Code smell density / kLOC17.0517.6023.31

补充数据:Terra 输出约 8.37M tokens、推理 tokens 约 3.66M;输入约 1.32M tokens。Terra 的 blocker-level smell 为 62/mLOC,低于 Sol 的 72 和 GPT-5.5 的 78,但 collection/generics 类问题升至 11,843/mLOC。并发/线程 bug 是 Terra 最大 bug 类别,约 350/mLOC。

结论

  • Terra 的 79.96% pass rate 略高于 GPT-5.5,但低于 Sol 的 81.99%;不能只按模型价格判断生产可靠性。

  • Terra 以 617,132 行代码完成同一任务,代码量显著少于 GPT-5.5 和 Sol;这有利于减少审阅体积,但每 kLOC 的问题密度更高。

  • 认知复杂度 161.53/kLOC、bug 763/mLOC、漏洞 203/mLOC 和 smell 23.31/kLOC,说明“短”不等于“更易维护”。

  • 并发/线程、密码学配置和资源处理是应优先自动化检查的风险面;人工通读不应是唯一门禁。

局限

  • 任务全部为 Java 合成/标准化任务,不能代表多语言真实仓库。

  • SonarQube 静态分析反映可检测的代码问题,不等于真实线上缺陷率,也不能衡量完整系统的业务正确性。

  • 同一 medium 设置有利于受控比较,但没有告诉我们 Terra 在 low/high/max 下的质量-成本曲线。

  • 文章由 SonarSource 发布,分析器和指标定义由其控制;应保留原始输出并用第二种测试框架交叉验证。

复现步骤

  1. 固定 Java 版本、HumanEval/MBPP/ComplexCodeEval 任务版本、模型别名和 medium 推理档位。

  2. 对每题保存 prompt、响应、编译/测试日志、生成代码行数和 tokens;不要只保存总分。

  3. 用同一 SonarQube 版本和规则集分析三组输出,按文章的 kLOC/mLOC 单位计算密度。

  4. 把 pass rate、missing completion、bug/vulnerability/smell 分开报告,并按严重级别展开。

  5. 对并发、密码学和资源处理问题做人工抽样复核,确认静态规则命中是否构成真实缺陷。

来源摘录或观察(仅做合规短引)

作者对 Terra 的概括是 “Terra is the concise one”,但同一段数据同时显示其 cognitive complexity 和问题密度最高。

Tabbit 小编提醒

本文是第三方资料导航。测试环境、模型版本和主观体验可能不同,请以原文为准。

GPT-5.6 Terra

在 Tabbit 中使用并对比模型

GPT-5.6 Terra

相关测评

官方OpenAI Deployment Safety Hub2026-07-09

GPT-5.6 Terra System Card 安全防护与 Agent 边界

官方OpenAI 官方发布页2026-07-10

OpenAI 官方 GPT-5.6 Terra 基准、定价与任务边界

媒体Artificial Analysis2026-07-09

GPT-5.6 Terra Artificial Analysis 智能、成本与编码 Agent 指数

社区Reddit r/LLMDevs2026-08-18

GPT-5.6 Terra Reddit LLMDevs 按角色小样本路由基准

GPT-5.6 Terra

相关提示词

官方OpenAI Developers

GPT-5.6 Terra API 模型参数与工具配置

官方OpenAI 官方发布2026-07-09

GPT-5.6 Terra 前端交互原型提示词与验证工作流

媒体DataCamp2026-08-04

GPT-5.6 Terra 长上下文成本阈值与路由工作流

社区X2026-08-01

Framer Agent 用 GPT-5.6 Terra 生成入场动画与布局变体