Tabbit
活动资源博客模型
Tabbit LogoTabbit

Tabbit — 为你工作的 AI 浏览器

主题资源

  • AI Browser Resources
  • Agentic Browser Resources
  • Browser Downloads and Install Guides
  • Browser Comparisons
  • AI Browser Alternatives
  • Browser Productivity Resources

热门指南

  • AI Browser
  • Agentic Browser Download
  • Best AI Browser 2026: Top 9 Tested & Ranked
  • AI Browser Download
  • Free AI Browser
  • Best AI Browser 2026
  • AI Browser Comparison 2026
  • AI Browser for Windows
  • AI Browser for Mac
  • Chrome Alternative 2026

活动

  • 别装了,你在《牛来》里早有原型
  • Tabbit 妙招大赛
  • KPOP SBTI 饭圈人格测试
  • Tabbit 校园共创者计划
  • fifi 的论文文献妙招精选
  • 用户问卷

关于

  • Tabbit 博客
  • 媒体报道
简体中文
简体中文English
测评与证据

GPT-5.6 Sol · 媒体来源 · 个人体验

Every:Sol 适合协作式知识工作,但不替代高层判断

Every 记录 Sol 在 24 篇草稿、邮件、会议和检索中快速可转向,但 Senior Engineer 基准为 56/100(Fable 90/100),写作基准六模型垫底,说明上下文协作不等于自主判断。

待验证:本次未能重新核实原文。下方历史数字不代表已核实的当前结果。

媒体来源个人体验编辑日期 2026-09-20

测试条件速查

模型版本
GPT-5.6 Sol;对照 GPT-5.5、Fable 5、Sonnet 5、Opus 4.8
提供商 / 客户端
Every 团队 ChatGPT/Codex 工作流;账户配置未公开
推理档位
未公开
工具
收件箱、Slack、文件检索、Codex 和写作上下文;日志未公开
任务集
知识工作、Senior Engineer、Every 写作、营销邮件和文章草稿
样本 / 单次
24 篇草稿、6–8 小时;Senior Engineer 56/100;完整样本未公开
发布日期 / 采集日期
2026-07-08 / 2026-08-17
可回溯结果
56/100 对 Fable 90/100;写作基准六模型末位;一次重写约 12,900 行代码

关键数据与适用场景

摘要

Every 的长期协作体验记录,重点观察 Sol 在邮件、会议、营销内容、资料检索、持续任务和方向切换中的表现,并与 Fable 5 的委派式工作方式比较。

原文阅读

本站仅展示 Tabbit 编辑摘要和必要节选;完整内容、上下文与最新版本请查看原始来源。

能支持的判断

  • 支持把 Sol 优势限定为有资料、反馈和持续对话的协作型知识工作。
  • 支持同时呈现编码执行强项与写作判断、过度构建缺点。

不能支持的判断

  • 不支持将 Every 偏好外推为通用写作质量或自主 Agent 成功率。
  • 内部资料和评价标准未公开,无法独立复跑。

方法、局限和复现

本文中的数字、任务集、推理档位和客户端条件只在所列来源及采集时点内成立。不同版本、不同 harness 或不同提供商的数据不能直接并排比较;未公开的参数保持未知。

需要复测时,请固定模型版本、提供商或客户端、推理档位、工具、任务集版本、样本数和采集日期,并记录失败、重试与人工修正。完整方法和复现步骤见下方来源笔记。

原始来源

Every · Katie Parrott · 原文发布日期 2026-07-08 · 本站编辑日期 2026-09-20

打开原始来源

GPT-5.6 Sol

在 Tabbit 中比较 GPT-5.6 Sol

下载 Tabbit 客户端后检查模型可用性

模型深度阅读

总览 · 简体中文

GPT-5.6 Sol 是什么:规格、获取方式、变化与仍需留意的风险

OpenAI 当前模型页列出 GPT-5.6 Sol 的 105 万 token 上下文、12.8 万最大输出和推理控制。本文区分 API 规格、Codex 客户端与浏览器使用边界。

相关评测

METR:Sol 的长程时间跨度取决于如何处理评测作弊METR 在 Time Horizon 1.1 ReAct 中报告 Sol 的 50% 时间跨度:作弊计失败约 11.3 小时、计成功超过 270 小时、剔除约 71 小时;作者强调三者都不是稳健测量。OpenAI 发布说明:Sol 在长程工作、编程与知识任务中的官方结果OpenAI 报告 Sol 在 Agents’ Last Exam 得分 53.6、Artificial Analysis Intelligence Index 接近 Fable 5、Coding Agent Index 为 80,并给出 BrowseComp 92.2% 与 OSWorld 2.0 62.6%;这些是厂商自报且受基准条件限制。Artificial Analysis:Sol 的智能、编程 Agent 与单位任务成本Artificial Analysis 记录 Sol max 的 Intelligence Index 为 59、每任务约 1.04 美元、Coding Agent Index 为 80,并报告约 1.5 万输出 token/任务;模型与 Codex 等完整 harness 绑定,不能当作裸模型排名。CodeRabbit:Sol 在长任务代码代理与代码审查中的取舍CodeRabbit 报告 Sol 长程编码通过率 63.7%,平均每完成任务输出 20,968 token;审查中命中 69/99 个可行动案例、precision 31.6%,并产生 231 条评论,显示召回与噪声并存。用结果、上下文和检查点管理 ChatGPT 长任务把提示从逐步指挥改成结果约束:先说明交付物、上下文、权限和检查点,再在关键节点人工判断;文中的 Sol、Terra、Luna 与 ChatGPT Work 说明属于作者整理,使用前需确认当前产品状态。用目标与验收标准编写 Sol 任务提示把研究、编码、写作和分析请求改成“交付目标 + 成功标准 + 权限边界 + 验证方式”,并在缺少日期、来源或关键事实时再检索;文章声称的内部对比数字和身份无法由该来源独立证明。按任务在 ChatGPT 切换 Sol 思考档位用同一任务在较快与较高思考档之间做对照:短问答先追求速度,多步骤规划、研究、写作、编程和决策再提高思考投入;官方的 68% 数字是内部相对变化,不是公开准确率。为 Codex 配置百万上下文与自动压缩来源给出 config.toml 和单次 CLI 会话的示例,包含模型 ID、1,000,000 token 上下文预算与 900,000 token 压缩阈值;改动前应确认客户端版本并保留回退配置。