Tabbit
活动资源博客模型
Tabbit LogoTabbit

Tabbit — 为你工作的 AI 浏览器

主题资源

  • AI Browser Resources
  • Agentic Browser Resources
  • Browser Downloads and Install Guides
  • Browser Comparisons
  • AI Browser Alternatives
  • Browser Productivity Resources

热门指南

  • AI Browser
  • Agentic Browser Download
  • Best AI Browser 2026: Top 9 Tested & Ranked
  • AI Browser Download
  • Free AI Browser
  • Best AI Browser 2026
  • AI Browser Comparison 2026
  • AI Browser for Windows
  • AI Browser for Mac
  • Chrome Alternative 2026

活动

  • 别装了,你在《牛来》里早有原型
  • Tabbit 妙招大赛
  • KPOP SBTI 饭圈人格测试
  • Tabbit 校园共创者计划
  • fifi 的论文文献妙招精选
  • 用户问卷

关于

  • Tabbit 博客
  • 媒体报道
简体中文
简体中文English
测评与证据

Claude Sonnet 4.6 · 社区来源 · 个人体验

Reddit:Sonnet 4.6 medium effort 能做日常工作,复杂项目仍要 Opus 规划

发帖人认为 Claude Code 里 Sonnet 4.6 medium effort 已能完成大量日常和高强度任务;评论共识则是:简单执行可以留在 Sonnet,复杂推理、规划和高压编码仍要用 Opus 先做架构,再交给 Sonnet 落地。

待验证:本次未能重新核实原文。下方历史数字不代表已核实的当前结果。

社区来源个人体验编辑日期 2026-09-20

测试条件速查

模型/版本
Claude-Sonnet-4.6;来源日期:2026-06。
harness/任务
产品:Claude Code(帖子 flair: Question about Claude Code)。;配置:发帖人明确只用 Sonnet,且不超过 medium effort。
样本/缺口
局限记录:发帖人自认不是最高强度用户,却又说“用得比大多数人深”,两端都无法验证。;BrowseComp 读图来自另一帖评论,缺少原图与官方表,不得升格为独立测评结论。

关键数据与适用场景

一句话结论

发帖人认为 Claude Code 里 Sonnet 4.6 medium effort 已能完成大量日常和高强度任务;评论共识则是:简单执行可以留在 Sonnet,复杂推理、规划和高压编码仍要用 Opus 先做架构,再交给 Sonnet 落地。

测试环境

  • 产品:Claude Code(帖子 flair: Question about Claude Code)。

  • 配置:发帖人明确只用 Sonnet,且不超过 medium effort。

  • 对照:评论中的“更大模型”主要指 Opus / beast mode,不是受控 A/B。

  • 样本:个人工作流 + 约 80 条评论;版主机器人做了讨论摘要。

输入/配置

没有公开仓库、任务清单或 token 账单。唯一明确的旋钮是:模型 = Sonnet 4.6,effort = medium。

结果数据

  • 发帖人:日常和高水平任务都能完成,从未高于 Sonnet medium;觉得更小/更不“聪明”的模型做日常小事更干净。

  • ClaudeAI-mod-bot 摘要(80 评后):社区认为发帖人低估了复杂场景;常见工作流是 Opus 做高层规划与架构,再切 Sonnet 执行明确子任务。只靠 Sonnet 做复杂项目会更多幻觉、隐蔽错误和缺少独立思考,修错耗时可能超过省下的 Opus 费用。

  • 高赞评论强调 Reddit 是回音室,多数真实用户只用 Claude 替代搜索或做简单事;也有工程师指出跨项目、难复现问题不是“提示词不够好”就能解决。

同一时期相邻帖(r/ClaudeCode,Prior-Meeting1645)讨论官方 BrowseComp 图:有评论称 Sonnet 5 medium 略差于 Sonnet 4.6 medium 且更便宜,Sonnet 5 high 略好,xhigh 明显更好但接近/超过 Opus 价。该帖正文几乎只有标题,分数来自评论对一张未在正文展开的图的读图,只能当线索,不能当 BrowseComp 原始表。

结论

Sonnet 4.6 + medium 适合作为 Claude Code 默认执行档:日常改代码、小任务、已拆好的子步骤。不适合单独承担“还没想清楚的大项目”。可复用决策是:

  1. 已有明确计划和验收 → Sonnet 4.6 medium。

  2. 需要架构、跨模块推理、高风险编码 → 先 Opus(或更强模型)规划,再回 Sonnet。

  3. 不要因为 medium 已经“感觉很快”就推断它在所有工程问题上等于更大模型。

局限

  • 无量化正确率、无 token 表、无盲测。

  • 版主机器人摘要会平滑反对意见,原始评论比摘要更分裂。

  • 发帖人自认不是最高强度用户,却又说“用得比大多数人深”,两端都无法验证。

  • BrowseComp 读图来自另一帖评论,缺少原图与官方表,不得升格为独立测评结论。

复现步骤

  1. 选 20 个已有计划和 10 个未规划大任务。

  2. 两组都只用 claude-sonnet-4-6 + effort=medium;第三组对未规划任务先 Opus 再 Sonnet。

  3. 记录一次通过、返工轮次、幻觉/隐蔽 bug、token 与延迟。

  4. 以“返工是否吃掉省下的 Opus 费用”为主要经济指标,而不是主观“感觉惊人”。

能支持的判断

  • 已有明确计划和验收 → Sonnet 4.6 medium。
  • 需要架构、跨模块推理、高风险编码 → 先 Opus(或更强模型)规划,再回 Sonnet。

不能支持的判断

  • 发帖人自认不是最高强度用户,却又说“用得比大多数人深”,两端都无法验证。
  • BrowseComp 读图来自另一帖评论,缺少原图与官方表,不得升格为独立测评结论。

方法、局限和复现

本文中的数字、任务集、推理档位和客户端条件只在所列来源及采集时点内成立。不同版本、不同 harness 或不同提供商的数据不能直接并排比较;未公开的参数保持未知。

需要复测时,请固定模型版本、提供商或客户端、推理档位、工具、任务集版本、样本数和采集日期,并记录失败、重试与人工修正。完整方法和复现步骤见下方来源笔记。

原始来源

Reddit / r/ClaudeAI · RudeCamel7239;讨论摘要由 ClaudeAI-mod-bot 在约 80 条评论后生成 · 原文发布日期 2026-06 · 本站编辑日期 2026-09-20

打开原始来源

Claude Sonnet 4.6

在 Tabbit 中比较 Claude Sonnet 4.6

下载 Tabbit 客户端后检查模型可用性

模型深度阅读

总览 · 简体中文

Claude Sonnet 4.6 是什么:价格、获取方式与 Sonnet 5 迁移问题

用来源说明 Claude Sonnet 4.6 的 1M 上下文、$3/$15 API 价格、Active legacy 状态、访问入口和迁移取舍。

相关评测

OSWorld-Verified 独立评测:Claude Sonnet 4.6 计算机操作与 GUI 任务深度分析在标准 Ubuntu 桌面评测套件 OSWorld-Verified 中,Claude Sonnet 4.6 取得了 72.5% 的任务成功率,逼近旗舰 Opus 4.6(72.7%),但在高频复杂动态弹窗及多层级右键菜单场景下仍存在一定的视觉定位抖动。Artificial Analysis:Sonnet 4.6 非推理 Intelligence Index 37Artificial Analysis 把 Claude Sonnet 4.6(Non-reasoning, High Effort)放在同类非推理模型里 Intelligence Index 37、约 46 tok/s、输入 $3 / 输出 $15 / 百万 token,并标明 1M 上下文;页面同时提示该模型已 deprecated,智能分数不再代表最新 Sonnet。Reddit MLOps 对 Claude Sonnet 4.6 与 Opus 4.6 的任务分层观察社区将 Sonnet 4.6 的强项归为办公、金融、电脑使用和常规编码,将 Opus 4.6 的优势归为深层推理、终端编码和 agentic search;但帖子也明确提醒这些是 Anthropic 自报 scaffold 的静态 benchmark。IDP Leaderboard:Sonnet 4.6 在真实文档理解上与 Opus 4.6 持平在开放文档 AI 排行榜上,Claude Sonnet 4.6 总分 80.7,略高于 Opus 4.6 的 80.4,适合把 OCR、表格、版式和关键信息抽取从 Opus 下放到 Sonnet;归档扫描件仍要防内容审核误拦。Claude Code 下 Sonnet 4.6 的多智能体协作与工程开发工作流按“Claude Code 下 Sonnet 4.6 的多智能体协作与工程开发工作流”的任务特定指南执行;前置条件、步骤、验收、修正和来源边界均已写明。Claude Sonnet 4.6 的清晰指令、XML 上下文与自检提示按“Claude Sonnet 4.6 的清晰指令、XML 上下文与自检提示”的任务特定指南执行;前置条件、步骤、验收、修正和来源边界均已写明。Claude Sonnet 4.6 的 Computer Use 工具定义与自动化闭环工作流按“Claude Sonnet 4.6 的 Computer Use 工具定义与自动化闭环工作流”的任务特定指南执行;前置条件、步骤、验收、修正和来源边界均已写明。Claude Sonnet 4.6 的 1M 长上下文与 Context Compaction 架构配置按“Claude Sonnet 4.6 的 1M 长上下文与 Context Compaction 架构配置”的任务特定指南执行;前置条件、步骤、验收、修正和来源边界均已写明。