发帖人认为 Claude Code 里 Sonnet 4.6 medium effort 已能完成大量日常和高强度任务;评论共识则是:简单执行可以留在 Sonnet,复杂推理、规划和高压编码仍要用 Opus 先做架构,再交给 Sonnet 落地。
产品:Claude Code(帖子 flair: Question about Claude Code)。
配置:发帖人明确只用 Sonnet,且不超过 medium effort。
对照:评论中的“更大模型”主要指 Opus / beast mode,不是受控 A/B。
样本:个人工作流 + 约 80 条评论;版主机器人做了讨论摘要。
没有公开仓库、任务清单或 token 账单。唯一明确的旋钮是:模型 = Sonnet 4.6,effort = medium。
发帖人:日常和高水平任务都能完成,从未高于 Sonnet medium;觉得更小/更不“聪明”的模型做日常小事更干净。
ClaudeAI-mod-bot 摘要(80 评后):社区认为发帖人低估了复杂场景;常见工作流是 Opus 做高层规划与架构,再切 Sonnet 执行明确子任务。只靠 Sonnet 做复杂项目会更多幻觉、隐蔽错误和缺少独立思考,修错耗时可能超过省下的 Opus 费用。
高赞评论强调 Reddit 是回音室,多数真实用户只用 Claude 替代搜索或做简单事;也有工程师指出跨项目、难复现问题不是“提示词不够好”就能解决。
同一时期相邻帖(r/ClaudeCode,Prior-Meeting1645)讨论官方 BrowseComp 图:有评论称 Sonnet 5 medium 略差于 Sonnet 4.6 medium 且更便宜,Sonnet 5 high 略好,xhigh 明显更好但接近/超过 Opus 价。该帖正文几乎只有标题,分数来自评论对一张未在正文展开的图的读图,只能当线索,不能当 BrowseComp 原始表。
Sonnet 4.6 + medium 适合作为 Claude Code 默认执行档:日常改代码、小任务、已拆好的子步骤。不适合单独承担“还没想清楚的大项目”。可复用决策是:
已有明确计划和验收 → Sonnet 4.6 medium。
需要架构、跨模块推理、高风险编码 → 先 Opus(或更强模型)规划,再回 Sonnet。
不要因为 medium 已经“感觉很快”就推断它在所有工程问题上等于更大模型。
无量化正确率、无 token 表、无盲测。
版主机器人摘要会平滑反对意见,原始评论比摘要更分裂。
发帖人自认不是最高强度用户,却又说“用得比大多数人深”,两端都无法验证。
BrowseComp 读图来自另一帖评论,缺少原图与官方表,不得升格为独立测评结论。
选 20 个已有计划和 10 个未规划大任务。
两组都只用 claude-sonnet-4-6 + effort=medium;第三组对未规划任务先 Opus 再 Sonnet。
记录一次通过、返工轮次、幻觉/隐蔽 bug、token 与延迟。
以“返工是否吃掉省下的 Opus 费用”为主要经济指标,而不是主观“感觉惊人”。
Claude Sonnet 4.6