GPT-5.6 Luna · 媒体来源 · 独立测量
这条证据围绕“GPT-5.6 Luna Benchmarks & Pricing(公开基准与定价)”记录特定条件下的观察;版本、样本与运行环境不能外推为统一排名或当前生产保证。
待验证:本次未能重新核实原文。下方历史数字不代表已核实的当前结果。
BenchLM 将 GPT-5.6 Luna 评为 67.3/100,在 218 个模型中排名第 23。它的公开证据最强项是 Coding:73.0 分、#6/135;Agentic 为 #43/130。页面同时列出 $0.20/百万输入 token、$1.20/百万输出 token、缓存输入 $0.020/百万 token。BenchLM 特别提醒:速度尚未独立测量,部分类别没有足够的公开证据,排名不应脱离证据覆盖率理解。
| 项目 | 页面结果 |
|---|---|
| 综合分数 | 67.3/100 |
| 公共排名 | #23/218 |
| Coding | 73.0,#6/135,96th percentile |
| Agentic | 53.3,#43/130 |
| Knowledge | 81.6,#12/57 |
| Multimodal | 66.1,#17/32 |
| SWE-bench Pro | 62.7% |
| Terminal-Bench 2.0 | 84.7% |
| deepSWE | 67.2% |
| FrontierCode 1.1 Extended | 55.1% |
| cursorBench32 | 61.1% |
| API 价格 | $0.20 输入 / $1.20 输出,每百万 token |
| 缓存输入 | $0.020/百万 token |
| 上下文 | 1.05M token |
| 独立速度 | 未测量 |
适合优先验证的场景是代码生成、软件开发和高体量推理工作。
不能只看综合排名:页面称 24 个公开 benchmark 行有来源,但仍有多项跟踪指标为空。
Coding 结果并非所有项目都领先:SWE-bench Pro 比页面记录的最佳验证结果低 17.6 个百分点,Terminal-Bench 2.0 比 GPT-5.6 Sol 低 7.2 个百分点。
这是第三方公开资料整理,不等同于在 Tabbit 真实工作流中的复测;落地前应使用自己的任务集验证接受率、延迟和总成本。
本站仅展示 Tabbit 编辑摘要和必要节选;完整内容、上下文与最新版本请查看原始来源。
本文中的数字、任务集、推理档位和客户端条件只在所列来源及采集时点内成立。不同版本、不同 harness 或不同提供商的数据不能直接并排比较;未公开的参数保持未知。
需要复测时,请固定模型版本、提供商或客户端、推理档位、工具、任务集版本、样本数和采集日期,并记录失败、重试与人工修正。完整方法和复现步骤见下方来源笔记。
BenchLM.ai · BenchLM.ai · 原文发布日期 2026-08-15 · 本站编辑日期 2026-09-20
打开原始来源GPT-5.6 Luna
下载 Tabbit 客户端后检查模型可用性