这篇帖子不是对 M3 智力的测评,而是对 Token Plan 在 agentic coding 场景下“有效吞吐”的实测。作者通过 OpenCode、OpenRouter BYOK 和缓存命中率观察到:其理解中的 PAYG 缓存折扣没有体现在 Token Plan 上,重复读取上下文会快速消耗额度。评论区给出一个 90% 重复上下文假设下的数量级估算:有效新工作量可能从 0.895B 降到 0.17B,或从 0.17B 降到 0.032B,取决于预算口径。
不能用“每月 1.7B tokens”直接估算 agentic coding 的可完成工作量。
需要区分 fresh input、output、cached/repeated context,并验证具体 harness 是否正确发送缓存标记。
该帖子指向两个可能混淆的问题:套餐本身的计费规则,以及 Anthropic-compatible endpoint / harness 的缓存 bug。
选择 M3 时应先做小额、可观测的任务测试,记录真实输入、缓存输入、输出和额度变化。
本站仅展示 Tabbit 编辑摘要和必要节选;完整内容、上下文与最新版本请查看原始来源。
帖子与评论存在冲突,且测试依赖具体 harness、endpoint 和时间点。本文只记录社区实测与争议,不把“Token Plan 没有缓存收益”写成已由官方文档确认的定论。
MiniMax M3