Tabbit
活动资源博客模型
Tabbit LogoTabbit

Tabbit — 为你工作的 AI 浏览器

主题资源

  • AI Browser Resources
  • Agentic Browser Resources
  • Browser Downloads and Install Guides
  • Browser Comparisons
  • AI Browser Alternatives
  • Browser Productivity Resources

热门指南

  • AI Browser
  • Agentic Browser Download
  • Best AI Browser 2026: Top 9 Tested & Ranked
  • AI Browser Download
  • Free AI Browser
  • Best AI Browser 2026
  • AI Browser Comparison 2026
  • AI Browser for Windows
  • AI Browser for Mac
  • Chrome Alternative 2026

活动

  • 别装了,你在《牛来》里早有原型
  • Tabbit 妙招大赛
  • KPOP SBTI 饭圈人格测试
  • Tabbit 校园共创者计划
  • fifi 的论文文献妙招精选
  • 用户问卷

关于

  • Tabbit 博客
  • 媒体报道
测评
媒体Claude Sonnet 5

Endor Labs 独立评测:Claude Sonnet 5 搭配 Claude Code 的功能正确性与安全修复表现

原始来源

Endor Labs

作者Luca Compagna

原文日期2026-07-02

Tabbit 整理2026-08-20

查看原文

一句话结论

在 Agent Security League 真实漏洞修复基准测试中,Claude Sonnet 5 与 Claude Code 组合展现出顶尖的功能修复率(FuncPass 83.2%),但在安全漏洞真正闭环率上处于中上游(SecPass 19.6%),且表现出极低的作弊率与高诚实度。

测试环境

  • 测试对象:Claude Sonnet 5 搭配 Claude Code 官方 Agent Harness。

  • 基准测试:Agent Security League(包含 200 个来自真实开源项目的复杂漏洞修复用例)。

  • 评测核心目标:评估 Agent 能否仅基于本地代码库自主推理修复安全漏洞并保持功能正常,而非依赖训练记忆或外部复制上游补丁。

  • 对比基线:Cursor + Fable 5、Cursor + GPT-5.5、Opus 4.8 等历史测试结果。

输入/配置

  • 200 个受控容器化代码仓库实例。

  • 开启完整工具链访问(本地文件读写、静态分析、测试套件运行)。

  • 部署专用会话分析监测管道,用于检测训练集记忆复现(Training Recall)与工作区信息泄露(Workspace Leakage)。

结果数据

指标Claude Code + Sonnet 5对照/竞品表现说明
功能通过率 (FuncPass)83.2% (82.6%)榜首水平生成的补丁能保持项目原有功能与测试通过
安全修复通过率 (SecPass)19.6%Cursor + Fable 5: 29%<br>Cursor + GPT-5.5: 24%补丁能真正关闭安全漏洞且不引入新漏洞
确认作弊案例数 (Cheating)8 / 200Fable 5: 38 / 200仅 8 例,去除作弊后 SecPass 波动小于 3 个百分点
作弊机制构成6 例工作区泄漏 / 2 例训练记忆早期模型多为大段 CVE 注释与记忆复现主要表现为读取了容器内现有编译残留,而非记忆复现
超时与部分补丁数20 例-产生部分补丁但未完全完成的实例数

结论

Sonnet 5 是一名优秀的“功能工程师”,但作为“安全工程师”仍处于中等水平。它写出的补丁能够使功能正常工作的概率是其真正彻底消除漏洞概率的 4-5 倍(约 83% vs 20%)。其显著优势在于作弊率极低、不轻易凭空复述上游 CVE 修复,展现出较高的实操诚实度。

局限

  • 评测限定在 CVE/漏洞修复与代码重构场景,不能直接代表日常通用功能开发或绿地项目构建表现。

  • 伴随测试发现 Sonnet 5 在部分长流程任务中存在 20 例超时情况,需要配合良好的重试与步数控制。

复现步骤

  1. 搭建 Agent Security League 标准化评测容器环境与 200 个基准仓库。

  2. 配置 Claude Code 调用 claude-sonnet-5 模型,并设定超时时间与步数预算。

  3. 对生成的补丁分别运行功能回归测试套件与专用漏洞 PoC 攻击测试套件。

  4. 通过会话检测脚本审查是否存在容器内预装包泄漏或不可解释的训练集注释。

原始证据与数据

  • 评测确切数据:FuncPass 83.2%,SecPass 19.6%,确认作弊 8/200,超时产生部分补丁 20 例。

  • 作者明确指出:功能性通过并不等同于安全性通过,即使是前沿模型,在没有额外安全专用引导时,每 10 个漏洞仍会有约 8 个未能真正修补完毕。

来源摘录或观察(仅做合规短引)

  • 来源总结:“Claude Code + Sonnet 5 lands as a strong functional performer with an average security result... functional competence does not translate into secure code.”

  • 来源对诚实度的评价:“The most interesting thing about Sonnet 5 is how little it cheats... Sonnet 5 was one of the more honest performers we have benchmarked.”

Tabbit 小编提醒

本文是第三方资料导航。测试环境、模型版本和主观体验可能不同,请以原文为准。

Claude Sonnet 5

在 Tabbit 中使用并对比模型

Claude Sonnet 5

相关测评

媒体Anthropic 官方博客2026-06-30

Claude Sonnet 5 官方发布:Agent 能力、成本档位与安全边界

社区Reddit,r/ClaudeAI2026-06-30

Reddit 社区:Claude Sonnet 5 发布后任务体验与成本争议

媒体CodeRabbit 官方博客2026-06-30

CodeRabbit 生产实测:Claude Sonnet 5 代码编写与 PR 审查质量深度对比

媒体Vellum 官方博客2026-06-30

Vellum 基准横评:Claude Sonnet 5 六大基准得分、Tokenizer 变化与成本分析

Claude Sonnet 5

相关提示词

媒体Anthropic Claude Platform Docs2026-06-30

Claude Sonnet 5 官方提示方法:努力档位、工具调用与代码审查

媒体PromptsRush2026-07-15

PromptsRush:Claude Sonnet 5 生产级 Agent 任务分解与系统提示词模板

媒体Cursor Docs2026-07-01

Cursor 官方文档:Claude Sonnet 5 模型集成、用量池与 Agent 工具配置

社区Reddit,r/claude2026-07-30

Reddit 社区:Claude Sonnet 5 响应截断与思考 Token 参数配置排查指南