Sansa Bench 当前总榜把 Claude-Sonnet-4.6 Reasoning High 记为 0.733,并列/紧随 Gemini-3.1-Pro-Preview Reasoning Low,低于 Opus 5 / 4.8 高推理;它适合看“开推理后的综合能力”,不适合直接引用 6 个月前 Reddit 帖里的旧分数。
规模:页面写 103 models tested,Updated Aug 19, 2026。
总体分:各 capability 等权平均;评分含 exact match、numeric match、code execution、LLM judges。
当前 Top 5(Overall):
Claude-Opus-5 Reasoning High 0.798
Claude-Opus-4.8 Reasoning High 0.785
Gemini-3.1-Pro-Preview Reasoning High 0.747
Claude-Sonnet-4.6 Reasoning High 0.733
Gemini-3.1-Pro-Preview Reasoning Low 0.733
方法入口:Inspiration & Acknowledgments、Compare Models、Model Analysis。
总榜展示的是 Reasoning High 变体。首页未在首屏列出 Sonnet 4.6 Reasoning None 的当前分。私有题库会轮换,模型不易刷题;这也意味着不同日期的 Overall 不能当同一测验。
当前页面可直接引用:
Claude Sonnet 4.6 Reasoning High:Overall 0.733。
历史快照(不得与上表混用):2026-02 左右 r/LLMDevs 帖称其私有基准(后链到同一 Sansa 方法页)当时为:
Sonnet 4.6 reasoning off:0.648,高于 GPT-5.2 low reasoning 0.604
Sonnet 4.6 high reasoning:0.719,与当时 Gemini 3 Pro Preview 并列榜首,高于 GPT-5.2 high 0.649
hallucination resistance 0.921;social calibration 0.905;error detection 0.848
硬科学弱于 Gemini 3 Pro(philosophy 0.767 vs 0.900,chemistry 0.710 vs 0.839,economics 0.750 vs 0.812)
sycophancy resistance 0.716,低于 Sonnet 4.5 high 的 0.755
该 Reddit 帖有人质疑“写得很像 AI”且实际幻觉多;作者另附 https://trysansa.com/benchmark 与 https://docs.sansaml.com/。引用历史分项时必须标注帖子日期,且当前总榜已不再显示 0.719。
开高推理时,Sonnet 4.6 仍能进入 Sansa 总榜前五,但已被更新的 Opus 拉开。适合作为“要可靠性、可接受高推理成本”的候选。若关闭 reasoning,不要使用当前首页的 0.733,应单独打开该模型的 None/Low 行或自己跑同一方法。
题库轮换,跨月分数不可直接减。
首页 Top 5 只保证 Reasoning High 的 Overall;分项能力要以 Model Analysis 为准,本次采集未把每个 capability 表格整页展开。
Reddit 旧帖的 0.921 幻觉抗性等分项,在 2026-08-20 的总榜首屏未复现,不能当作当前官方数字。
LLM judge 会引入评判模型偏差。
打开 https://trysansa.com/benchmark,记录页面 Updated 日期和模型行的 Reasoning 档位。
如需分项,进入该模型的 Model Analysis,导出 hallucination、sycophancy、science 等 capability。
固定 claude-sonnet-4-6 的 reasoning off/high,不要和 Opus 5 的 High 混在一张“Sonnet 能力”表。
若对照 Reddit 旧帖,单独建“2026-02 快照”列,禁止覆盖当前 0.733。
Claude Sonnet 4.6