发帖者称 GPT-6 Sol xhigh 在一个未说明的既有任务上首次出错,而 GPT-5 至 5.5 系列过去没有出错;这是一条无法独立复核的单次个人报告,不能据此判断两代模型的总体优劣。
可将其作为需要复核的回归测试线索:在自己的真实编码任务上固定输入和工具条件,对照 GPT-6 Sol xhigh 与旧版模型,并保存输出和运行轨迹。原帖没有说明任务内容,因此不能直接据此复现同一道题。
发帖者自述刚测试 GPT-6 Sol,effort 为 xhigh。
发帖者称在“这个任务”上,Sol 及 GPT-5 至 GPT-5.5 系列模型以前没有犯错,GPT-6 Sol 这次首次犯错。
旧模型的精确版本、effort、运行次数和是否使用相同提示词或工具均未说明。原帖没有贴出任务、输入、输出、错误定义或日志。
发帖者进一步推测,即使设为 max,GPT-6 Sol 在某些编码任务上也可能不如 GPT-5.6 Sol;这是推测,不是已报告的 max 档实测结果。
OP 实测陈述:一个未公开任务中,GPT-6 Sol xhigh 出现此前在 GPT-5 至 5.5 系列运行中未出现的错误。错误类型和影响未知。
评论者个人报告:Simple-Diver-2192 称 GPT-6 Sol 推理量明显更少、输出近似,且耗时不到 GPT-5.6 Sol 的一半;没有任务、计时方法或运行记录。Ill_Swim_5672 认为表现大致相近、略差但差异可忽略,并称额度下可用量约翻倍;这些都是其个人体验。
评论区猜测或断言:关于 GPT-6 Sol 是否为 Terra 级尺寸、是否蒸馏自 Astra,以及价格或额度变化的评论没有提供可核查证据,不作为模型规格或本次对照结果。
可引用为一条早期回归线索:同一未公开任务中,作者报告 GPT-6 Sol xhigh 出错,而其旧版 Sol 系列运行未出错。引用时应同时说明任务、输入和日志未公开;评论者的耗时、推理量及额度说法属于独立个人观察,不能当作 OP 的测试数据。
只有单个 OP 的未验证陈述,任务甚至没有具体描述,不能确认是编码任务还是其他任务。
没有 prompt、输入数据、预期结果、失败输出、代码仓库、工具轨迹或日志;缺少这些材料就无法重放错误或判断其严重程度。
旧模型只写作 Sol 与 GPT-5 至 5.5 系列,没有精确版本和配置;不能确认比较条件一致。
评论区其他用户的观察采用不同任务与入口,且无记录,不能与 OP 的单次结果合并统计。
要复核该线索,需先取得原任务与失败样例,再固定模型版本、effort、工具和输入,保存两边完整输出及运行记录,并在多个任务上重复。现有帖子不足以复现原测试。
GPT-6 Sol