Tabbit
活动资源博客模型
Tabbit LogoTabbit

Tabbit — 为你工作的 AI 浏览器

主题资源

  • AI Browser Resources
  • Agentic Browser Resources
  • Browser Downloads and Install Guides
  • Browser Comparisons
  • AI Browser Alternatives
  • Browser Productivity Resources

热门指南

  • AI Browser
  • Agentic Browser Download
  • Best AI Browser 2026: Top 9 Tested & Ranked
  • AI Browser Download
  • Free AI Browser
  • Best AI Browser 2026
  • AI Browser Comparison 2026
  • AI Browser for Windows
  • AI Browser for Mac
  • Chrome Alternative 2026

活动

  • 别装了,你在《牛来》里早有原型
  • Tabbit 妙招大赛
  • KPOP SBTI 饭圈人格测试
  • Tabbit 校园共创者计划
  • fifi 的论文文献妙招精选
  • 用户问卷

关于

  • Tabbit 博客
  • 媒体报道
简体中文
简体中文English
测评
媒体GPT-6 Sol

GPT-6 Sol AIIQ 模型档案与基准覆盖率

原始来源

AI IQ

作者Liberated Software LLC(网站署名)

原文日期2026-09-22

Tabbit 整理2026-09-22

查看原文

一句话结论

AI IQ 模型页显示 GPT-6 Sol 的综合 IQ 估计为 136,但六个维度中仅学术推理、程序推理和可靠性有直接基准结果;其余维度及部分缺失基准由评分流程估算或填补,因此 136 应理解为覆盖不完整时的模型估计,不能当作直接测得的人类 IQ 等值。

模型页数据

六维分数与 benchmark 覆盖

维度页面所列 IQ覆盖数页面列出的基准结果
抽象推理1310/3无
数学推理1390/5无
学术推理1414/6CritPt 30.8571;Humanity’s Last Exam 47.9147;MMMU-Pro 83.2948;SciCode 57.6389
程序推理1431/6Terminal-Bench 4.0 43.9394
电脑操作1370/6无
可靠性1242/7AA Long Context Reasoning v1.1 83.6667;AA Omniscience 27.1167

模型页另列综合 IQ 136、IQ 排名 #6,以及有效成本 $9.0775。单项 benchmark 表只显示数值,没有在表内标明单位;此处保留网页显示值,不自行补成百分比或其他单位。有效成本不是模型能力分数。

IQ 估算与缺失覆盖边界

方法页说明:

  • 综合 IQ 是六个等权维度分数的平均值。各 benchmark 原始分数先依据该基准的校准阶梯映射到 IQ 值;一个有来源的 benchmark 即可形成维度估计,更多覆盖提高估计可信度。

  • 缺失 benchmark 和整个缺失维度会在评分流程中保守填补。页面显示的覆盖数用于区分直接基准覆盖与估计部分;全维度分数不代表该维度已被实测。

  • 至少两个维度有来源支持,网站才发布综合 IQ。GPT-6 Sol 页面有三个维度出现基准结果,另三个维度为 0 覆盖;因此 136 的综合值包含缺失覆盖的估算成分。

  • 方法页称这些维度与综合分数均为估计值,即使覆盖完整也不是对模型实施的人类心理测验或 IQ 研究。分数映射依赖网站设定的 benchmark 校准阶梯;新纳入的基准还可能采用临时映射。

因此,这组数据适合用作 AI IQ 自身评分体系中的第三方汇总参照,不能据此断言 GPT-6 Sol 的“真实 IQ”为 136,也不应将维度分数视为直接测量结果。

局限

  • 模型页汇总基准结果,但未在此页逐项展示评测组织、模型具体版本与推理档位、提示词、工具/harness、样本数或置信区间;仅凭本页不能独立复跑或验证每个原始分数。

  • 多个维度覆盖为零,程序推理只有 1/6,可靠性为 2/7;分数覆盖稀疏,综合值受估算和缺失值处理影响。

  • 单项分数在模型页的表格中没有单位说明;若引用,应保留原始显示值并注明这一限制。

  • 排名会随网站纳入的模型、benchmark 与校准更新而变化;它是 AI IQ 站内排名,不是跨站统一排名。

原始证据与数据

主证据为 GPT-6 Sol 模型档案页,其中列出综合 IQ、六维 IQ、维度覆盖数和七项 benchmark 分数。评分规则依据 AI IQ methodology 页补充说明。此记录只整理这两个页面的可见信息,不把估算值写成直接测量,也不推断未列出的 benchmark 成绩。

Tabbit 小编提醒

本文是第三方资料导航。测试环境、模型版本和主观体验可能不同,请以原文为准。

GPT-6 Sol

在 Tabbit 中使用并对比模型

GPT-6 Sol

相关测评

官方OpenAI2026-09-22

GPT-6 Sol 官方发布基准与评测边界

媒体Artificial Analysis2026-09-22

GPT-6 Sol:Artificial Analysis 成本效率与幻觉测量

社区KillSwitch-Bench

GPT-6 Sol:KillSwitch-Bench 对抗语言编码代理基准

媒体Artificial Analysis2026-09

GPT-6 Sol:Artificial Analysis 六档配置横向数据

GPT-6 Sol

相关提示词

官方OpenAI Developers

GPT-6 Sol 官方 API 模型配置

官方OpenAI Developers

GPT-6 Sol 自主推进提示

官方OpenAI 官方发布说明2026-09-22

GPT-6 提示缓存优化工作流

官方OpenAI Developers

OpenAI 官方 GPT-6 异步工具调用工作流