社区将 Sonnet 4.6 的强项归为办公、金融、电脑使用和常规编码,将 Opus 4.6 的优势归为深层推理、终端编码和 agentic search;但帖子也明确提醒这些是 Anthropic 自报 scaffold 的静态 benchmark。
环境:Reddit 用户整理 Anthropic 公告、VentureBeat、TechCrunch、OfficeChai 等资料。
输入/配置:帖子列出 Sonnet 4.6/Opus 4.6 的多项发布数字,未提供独立运行输入、重复次数或完整工具轨迹。
结果形式:二次整理和观点,非受控实验。
帖子没有公开完整可复制 prompt;可复用的是路由假设:生产办公/财务/电脑使用先试 Sonnet,深层搜索/新颖推理/终端编码再路由 Opus,最终用同一任务集验证。
帖子引用的 Anthropic 数字包括:SWE-bench Verified Sonnet 79.6% vs Opus 80.8%;OSWorld-Verified 72.5% vs 72.7%;GDPval-AA Elo 1633 vs 1606;Finance Agent v1.1 63.3% vs 60.1%;GPQA 89.9% vs 91.3%;Terminal-Bench 59.1% vs 65.4%;BrowseComp 74.7% vs 84.0%;ARC-AGI-2 58.3% vs 68.8%。
帖子还提到 Sonnet 4.6 价格 $3/$15,Opus 4.6 $5/$25,并指出 1M context 为 beta;这些价格和版本应以官方当前页面复核。
这份社区整理可用来形成“按任务路由、按 eval 复核”的候选策略:Sonnet 4.6 作为规模化默认,Opus 4.6 处理高难、长链路或错误代价高的分支。
数据主要转述官方/媒体,作者明确写出缺少 Aider、Chatbot Arena 等独立结果。
帖子中的个别数字与不同页面/版本可能有差异,不能当作实时排行榜。
没有统一 scaffold、样本、重复次数和成本统计;不能推导绝对成功率。
取真实生产任务按办公、金融、电脑使用、代码、搜索、深层推理分层。
固定同一模型版本、工具、effort、超时和最大 token,进行盲测。
记录成功率、错误严重度、调用数、延迟、成本和人工偏好;单独统计 Sonnet→Opus 路由收益。
对每次官方/社区新 benchmark 记录来源、发布日期和 harness,不把静态分数直接迁移到生产。
Claude Sonnet 4.6