原作者长期使用 M2.7,认为其质量/成本比优秀;试用 M3 后主要失望于新的额度限制,而不是模型本身。评论区出现两类相反反馈:一类认为 M3 更聪明、长 agent 更稳定;另一类认为 M3 慢、输出质量不稳定、额度消耗过快。该帖子适合作为“模型能力”和“套餐有效吞吐”需要分开评价的反例。
评价 M3 时要拆成两层:模型质量,以及套餐/缓存/额度带来的可用工作量。
评论中有人建议关闭 thinking 以降低消耗,或把 M2.7 用作执行模型、M3 用作规划模型。
复杂结构化任务可能受益于 M3 的上下文保持;创作类任务的质量反馈更不稳定。
同一个模型在不同 harness、thinking 设置和缓存实现下,体验可能显著不同。
本站仅展示 Tabbit 编辑摘要和必要节选;完整内容、上下文与最新版本请查看原始来源。
原帖没有提供统一任务集和计费日志;关于额度、缓存和质量的结论存在明显分歧,不能直接当成产品定价事实。
MiniMax M3