Tabbit
活动资源博客模型
Tabbit LogoTabbit

Tabbit — 为你工作的 AI 浏览器

主题资源

  • AI Browser Resources
  • Agentic Browser Resources
  • Browser Downloads and Install Guides
  • Browser Comparisons
  • AI Browser Alternatives
  • Browser Productivity Resources

热门指南

  • AI Browser
  • Agentic Browser Download
  • Best AI Browser 2026: Top 9 Tested & Ranked
  • AI Browser Download
  • Free AI Browser
  • Best AI Browser 2026
  • AI Browser Comparison 2026
  • AI Browser for Windows
  • AI Browser for Mac
  • Chrome Alternative 2026

活动

  • 别装了,你在《牛来》里早有原型
  • Tabbit 妙招大赛
  • KPOP SBTI 饭圈人格测试
  • Tabbit 校园共创者计划
  • fifi 的论文文献妙招精选
  • 用户问卷

关于

  • Tabbit 博客
  • 媒体报道
简体中文
简体中文English
测评
社区GPT-6 Sol

GPT-6 Sol:KillSwitch-Bench 对抗语言编码代理基准

原始来源

KillSwitch-Bench

作者KillSwitch 项目(GitHub 用户 dom96)

Tabbit 整理1970-01-01

查看原文

一句话结论

KillSwitch-Bench 榜单列出 GPT-6 Sol(Codex harness)综合分 28.0%、每任务 $0.42、耗时 2m15s;28.0% 是由通过率、成本和代码规模组成的复合分,不能解读成准确率或任务通过率。

测试环境与方法

  • 任务:编码代理实现或理解 KillSwitch 程序。KillSwitch 是刻意对抗性的 esolang,源代码会把真实逻辑嵌在易误导的文字中。

  • 输入材料:每个代理收到任务提示和 KillSwitch 语言规范;部分任务还提供待实现程序的脚本文件。规范仓库公开了 SPEC.md 与 AI_SPEC.md。

  • 评测方式:任务有已知答案,以程序确定性判分,不使用 LLM 评分。

  • 隔离与限制:每次运行使用独立容器;单任务预算上限为 $5,硬超时为 30 分钟;代理不能访问互联网,仅能通过受限代理访问模型 API。

  • 重复次数:每个模型在每道任务上至少运行两次。页面未给出 GPT-6 Sol 的实际总运行次数、聚合方式或离散程度。

  • Harness:榜单将模型与编码代理一起评测。GPT-6 Sol 使用 Codex;排名也受 harness、工具配置和实现影响。

  • 评分口径:页面称综合分结合通过率、成本和代码规模,以奖励低成本、短实现且通过任务的方案;未公开完整公式或可复算的分项数据。

输入/配置

  • 榜单模型标签为 gpt-6-sol,提供方 OpenAI;代理为 Codex。

  • 榜单显示 GPT-6 Sol 的综合分为 28.0%、成本为 $0.42/任务、时间为 2m15s。页面未说明推理档位、模型快照、具体 API 参数或这些值的统计方式。

  • 页面提供了 KillSwitch 项目仓库和语言规范链接,但没有在榜单中展示 GPT-6 Sol 对应的任务提示、逐题代码、运行日志或失败案例。仓库 README 指向 benchmark 子模块;当前可见子模块链接无法打开(返回 404),因此不能据此复核题目清单和原始运行材料。

结果数据

榜单项GPT-6 Sol
榜单名次(采集时)7
综合分28.0%
每任务成本$0.42
每任务时间2m15s
HarnessCodex · OpenAI

榜单标注“Score combines pass rate, cost, and code size”。因此 28.0% 的百分号是该复合分的显示形式,不代表 GPT-6 Sol 通过了 28.0% 的任务。页面没有给出单独通过率,不能从综合分反推出通过题数。

对比观察

  • 榜单同列 GPT-5.6 Sol(Codex)27.4%、$0.24/任务、3m24s。此处能比较的是该榜单上的复合分、成本和时间;综合分只高 0.6 个百分点,不能表述为通过率提升 0.6 个百分点。

  • GPT-6 Astra(Codex)列为 57.8%、$1.45/任务、1m37s。它与 Sol 共用 Codex 名称,但公开页面未给出足够配置细节证明运行设置完全相同。

  • 其他榜首使用 Claude Code、OpenCode 等不同 harness。榜单明确把编码代理与模型作为组合系统测试,因此跨模型名次同时包含代理和工具链差异。

结论

  • 在该对抗语言任务集和 Codex 配置下,GPT-6 Sol 榜单综合分为 28.0%,页面报告每任务成本 $0.42、耗时 2m15s。

  • 该结果说明 GPT-6 Sol 在此特定代理编码基准上的综合表现;它不等于一般代码准确率,也不能直接代表常见语言、真实仓库维护或其他 Agent 配置的效果。

  • 对比 GPT-5.6 Sol 时,复合分略高、单任务成本较高、耗时较短;因未公开分项通过率及逐题结果,不能据此断言通过率变化或成本效益显著改善。

局限与复核

  • 网页未注明榜单发布日期或运行日期。该表是 2026-09-23 的采集快照,后续榜单可能变化。

  • 网站只公开“通过率、成本、代码规模”的评分组成,没有完整公式、权重、原始分项、逐题结果或实际重复次数;复合分无法独立重算。

  • “每题至少重复两次”是基准的最低重复规则,不等于仅运行两次,也不能证明榜单分数是均值、最好值或其他聚合值。

  • 单任务 $5 和 30 分钟是预算上限,不是 GPT-6 Sol 的实测成本与耗时;实测榜单值分别为 $0.42 和 2m15s。

  • 榜单未显示可直接打开的逐题任务或 GPT-6 Sol 代码链接。KillSwitch 仓库公开语言规范;其 README 指向的 benchmark 子模块链接在本次查看时返回 404。

  • 复核时应保存榜单版本、题目与规范、模型快照、Codex/harness 版本、预算、超时及每次运行的通过状态、成本、时间和代码规模;按公开公式重算前,需先取得基准方提供的完整计分规则。

来源摘录或观察(仅做合规短引)

方法页称任务会进行“Deterministic evaluation”,并说明分数结合通过率、成本和代码规模。对本条 GPT-6 Sol 结果,应保留其复合指标属性。

Tabbit 小编提醒

本文是第三方资料导航。测试环境、模型版本和主观体验可能不同,请以原文为准。

GPT-6 Sol

在 Tabbit 中使用并对比模型

GPT-6 Sol

相关测评

官方OpenAI2026-09-22

GPT-6 Sol 官方发布基准与评测边界

媒体Artificial Analysis2026-09-22

GPT-6 Sol:Artificial Analysis 成本效率与幻觉测量

媒体AI IQ2026-09-22

GPT-6 Sol AIIQ 模型档案与基准覆盖率

媒体Artificial Analysis2026-09

GPT-6 Sol:Artificial Analysis 六档配置横向数据

GPT-6 Sol

相关提示词

官方OpenAI Developers

GPT-6 Sol 官方 API 模型配置

官方OpenAI Developers

GPT-6 Sol 自主推进提示

官方OpenAI 官方发布说明2026-09-22

GPT-6 提示缓存优化工作流

官方OpenAI Developers

OpenAI 官方 GPT-6 异步工具调用工作流