AI IQ 模型页显示 GPT-6 Sol 的综合 IQ 估计为 136,但六个维度中仅学术推理、程序推理和可靠性有直接基准结果;其余维度及部分缺失基准由评分流程估算或填补,因此 136 应理解为覆盖不完整时的模型估计,不能当作直接测得的人类 IQ 等值。
| 维度 | 页面所列 IQ | 覆盖数 | 页面列出的基准结果 |
|---|---|---|---|
| 抽象推理 | 131 | 0/3 | 无 |
| 数学推理 | 139 | 0/5 | 无 |
| 学术推理 | 141 | 4/6 | CritPt 30.8571;Humanity’s Last Exam 47.9147;MMMU-Pro 83.2948;SciCode 57.6389 |
| 程序推理 | 143 | 1/6 | Terminal-Bench 4.0 43.9394 |
| 电脑操作 | 137 | 0/6 | 无 |
| 可靠性 | 124 | 2/7 | AA Long Context Reasoning v1.1 83.6667;AA Omniscience 27.1167 |
模型页另列综合 IQ 136、IQ 排名 #6,以及有效成本 $9.0775。单项 benchmark 表只显示数值,没有在表内标明单位;此处保留网页显示值,不自行补成百分比或其他单位。有效成本不是模型能力分数。
方法页说明:
综合 IQ 是六个等权维度分数的平均值。各 benchmark 原始分数先依据该基准的校准阶梯映射到 IQ 值;一个有来源的 benchmark 即可形成维度估计,更多覆盖提高估计可信度。
缺失 benchmark 和整个缺失维度会在评分流程中保守填补。页面显示的覆盖数用于区分直接基准覆盖与估计部分;全维度分数不代表该维度已被实测。
至少两个维度有来源支持,网站才发布综合 IQ。GPT-6 Sol 页面有三个维度出现基准结果,另三个维度为 0 覆盖;因此 136 的综合值包含缺失覆盖的估算成分。
方法页称这些维度与综合分数均为估计值,即使覆盖完整也不是对模型实施的人类心理测验或 IQ 研究。分数映射依赖网站设定的 benchmark 校准阶梯;新纳入的基准还可能采用临时映射。
因此,这组数据适合用作 AI IQ 自身评分体系中的第三方汇总参照,不能据此断言 GPT-6 Sol 的“真实 IQ”为 136,也不应将维度分数视为直接测量结果。
模型页汇总基准结果,但未在此页逐项展示评测组织、模型具体版本与推理档位、提示词、工具/harness、样本数或置信区间;仅凭本页不能独立复跑或验证每个原始分数。
多个维度覆盖为零,程序推理只有 1/6,可靠性为 2/7;分数覆盖稀疏,综合值受估算和缺失值处理影响。
单项分数在模型页的表格中没有单位说明;若引用,应保留原始显示值并注明这一限制。
排名会随网站纳入的模型、benchmark 与校准更新而变化;它是 AI IQ 站内排名,不是跨站统一排名。
主证据为 GPT-6 Sol 模型档案页,其中列出综合 IQ、六维 IQ、维度覆盖数和七项 benchmark 分数。评分规则依据 AI IQ methodology 页补充说明。此记录只整理这两个页面的可见信息,不把估算值写成直接测量,也不推断未列出的 benchmark 成绩。
GPT-6 Sol