KillSwitch-Bench 榜单列出 GPT-6 Sol(Codex harness)综合分 28.0%、每任务 $0.42、耗时 2m15s;28.0% 是由通过率、成本和代码规模组成的复合分,不能解读成准确率或任务通过率。
任务:编码代理实现或理解 KillSwitch 程序。KillSwitch 是刻意对抗性的 esolang,源代码会把真实逻辑嵌在易误导的文字中。
输入材料:每个代理收到任务提示和 KillSwitch 语言规范;部分任务还提供待实现程序的脚本文件。规范仓库公开了 SPEC.md 与 AI_SPEC.md。
评测方式:任务有已知答案,以程序确定性判分,不使用 LLM 评分。
隔离与限制:每次运行使用独立容器;单任务预算上限为 $5,硬超时为 30 分钟;代理不能访问互联网,仅能通过受限代理访问模型 API。
重复次数:每个模型在每道任务上至少运行两次。页面未给出 GPT-6 Sol 的实际总运行次数、聚合方式或离散程度。
Harness:榜单将模型与编码代理一起评测。GPT-6 Sol 使用 Codex;排名也受 harness、工具配置和实现影响。
评分口径:页面称综合分结合通过率、成本和代码规模,以奖励低成本、短实现且通过任务的方案;未公开完整公式或可复算的分项数据。
榜单模型标签为 gpt-6-sol,提供方 OpenAI;代理为 Codex。
榜单显示 GPT-6 Sol 的综合分为 28.0%、成本为 $0.42/任务、时间为 2m15s。页面未说明推理档位、模型快照、具体 API 参数或这些值的统计方式。
页面提供了 KillSwitch 项目仓库和语言规范链接,但没有在榜单中展示 GPT-6 Sol 对应的任务提示、逐题代码、运行日志或失败案例。仓库 README 指向 benchmark 子模块;当前可见子模块链接无法打开(返回 404),因此不能据此复核题目清单和原始运行材料。
| 榜单项 | GPT-6 Sol |
|---|---|
| 榜单名次(采集时) | 7 |
| 综合分 | 28.0% |
| 每任务成本 | $0.42 |
| 每任务时间 | 2m15s |
| Harness | Codex · OpenAI |
榜单标注“Score combines pass rate, cost, and code size”。因此 28.0% 的百分号是该复合分的显示形式,不代表 GPT-6 Sol 通过了 28.0% 的任务。页面没有给出单独通过率,不能从综合分反推出通过题数。
榜单同列 GPT-5.6 Sol(Codex)27.4%、$0.24/任务、3m24s。此处能比较的是该榜单上的复合分、成本和时间;综合分只高 0.6 个百分点,不能表述为通过率提升 0.6 个百分点。
GPT-6 Astra(Codex)列为 57.8%、$1.45/任务、1m37s。它与 Sol 共用 Codex 名称,但公开页面未给出足够配置细节证明运行设置完全相同。
其他榜首使用 Claude Code、OpenCode 等不同 harness。榜单明确把编码代理与模型作为组合系统测试,因此跨模型名次同时包含代理和工具链差异。
在该对抗语言任务集和 Codex 配置下,GPT-6 Sol 榜单综合分为 28.0%,页面报告每任务成本 $0.42、耗时 2m15s。
该结果说明 GPT-6 Sol 在此特定代理编码基准上的综合表现;它不等于一般代码准确率,也不能直接代表常见语言、真实仓库维护或其他 Agent 配置的效果。
对比 GPT-5.6 Sol 时,复合分略高、单任务成本较高、耗时较短;因未公开分项通过率及逐题结果,不能据此断言通过率变化或成本效益显著改善。
网页未注明榜单发布日期或运行日期。该表是 2026-09-23 的采集快照,后续榜单可能变化。
网站只公开“通过率、成本、代码规模”的评分组成,没有完整公式、权重、原始分项、逐题结果或实际重复次数;复合分无法独立重算。
“每题至少重复两次”是基准的最低重复规则,不等于仅运行两次,也不能证明榜单分数是均值、最好值或其他聚合值。
单任务 $5 和 30 分钟是预算上限,不是 GPT-6 Sol 的实测成本与耗时;实测榜单值分别为 $0.42 和 2m15s。
榜单未显示可直接打开的逐题任务或 GPT-6 Sol 代码链接。KillSwitch 仓库公开语言规范;其 README 指向的 benchmark 子模块链接在本次查看时返回 404。
复核时应保存榜单版本、题目与规范、模型快照、Codex/harness 版本、预算、超时及每次运行的通过状态、成本、时间和代码规模;按公开公式重算前,需先取得基准方提供的完整计分规则。
方法页称任务会进行“Deterministic evaluation”,并说明分数结合通过率、成本和代码规模。对本条 GPT-6 Sol 结果,应保留其复合指标属性。
GPT-6 Sol