GPT-6 Sol 模型测评导航
汇总 GPT-6 Sol 的官方基准、媒体分析和社区实测,不把第三方观点包装成 Tabbit 自测。
官方
1 条已核对来源的资料媒体
3 条已核对来源的资料GPT-6 Sol:Artificial Analysis 成本效率与幻觉测量
Artificial Analysis 的公开结果显示,GPT-6 Sol max 的 Intelligence Index 为 48、Coding Agent Index 为 57;前者任务成本约为 GPT-5.6 Sol max 的一半,Coding Agent Index 高 2 分。AA-Omniscience 幻觉率由 92% 降至 60%,但准确率也由 59% 降至 54%,且 Sol 回答的问题比例从 99% 降至 83%。
GPT-6 Sol AIIQ 模型档案与基准覆盖率
AI IQ 模型页显示 GPT-6 Sol 的综合 IQ 估计为 136,但六个维度中仅学术推理、程序推理和可靠性有直接基准结果;其余维度及部分缺失基准由评分流程估算或填补,因此 136 应理解为覆盖不完整时的模型估计,不能当作直接测得的人类 IQ 等值。
GPT-6 Sol:Artificial Analysis 六档配置横向数据
Artificial Analysis 的 release 页列出 GPT-6 Sol 六档配置:Intelligence Index v4.3.2 从 Non-reasoning 的 28 到 max 的 48;输出速度为 109–129 tokens/s;每项 Intelligence Index 任务的加权平均成本为 0.13–1.06 美元。页面只给出 Non-reasoning 的首个答案 token 延迟(0.93 秒),其余档位延迟未列。
社区
3 条已核对来源的资料GPT-6 Sol:KillSwitch-Bench 对抗语言编码代理基准
KillSwitch-Bench 榜单列出 GPT-6 Sol(Codex harness)综合分 28.0%、每任务 $0.42、耗时 2m15s;28.0% 是由通过率、成本和代码规模组成的复合分,不能解读成准确率或任务通过率。
GPT-6 Sol:Arena 对比 GPT-5.6 Sol
Arena 称 Peter Gostev 将 GPT-6 Sol 与 GPT-5.6 Sol 在匹配条件下直接比较:两者使用相同提示词,并都设为最大推理档。帖子说明评估内容包括生成结果、总 token 数和挂钟耗时。 帖子同时明确说 GPT-6 Sol 与 GPT-6 Luna 的 Arena 分数“即将公布”,没有提供 Arena 排名或分数。不能把这条帖子当作 Arena 排行榜结果。
Reddit 单次任务反馈:GPT-6 Sol xhigh 与旧版 Sol
发帖者称 GPT-6 Sol xhigh 在一个未说明的既有任务上首次出错,而 GPT-5 至 5.5 系列过去没有出错;这是一条无法独立复核的单次个人报告,不能据此判断两代模型的总体优劣。
GPT-6 Sol
在 Tabbit 中使用并对比模型
汇总 GPT-6 Sol 的官方基准、媒体分析和社区实测,不把第三方观点包装成 Tabbit 自测。