Ofox 用相同 prompt、5 次运行中位数和 senior reviewer 比较 Max/Plus:Max 在纯文本和长程迁移上有小幅质量/速度优势,但 Plus 在三个任务中约 5 倍便宜且支持视觉输入。
接口:Ofox OpenAI-compatible API。
配置:相同 prompt,temperature 0.2;每个任务运行 5 次,报告中位数;质量由 senior reviewer 按 1–5 评分。
任务:1,200 行 Python 服务异步重构;截图+stack trace 的 flaky test 调试;1,000 步 Postgres 14→16 自主 CLI migration。
长程任务:每个模型 unattended 4 小时,低于页面所称 35 小时 ceiling。
文章公开了任务描述、输入/输出 tokens、耗时、tool calls、错误恢复和成本,但没有发布完整代码仓库、每轮工具 trace、随机种子、评审量表细则或原始 API 响应。它可以复刻方法与预算数量级,不能逐行复算。
| 指标 | Qwen3.7-Plus | Qwen3.7-Max |
|---|---|---|
| Input tokens | 12,840 | 12,840 |
| Output tokens | 4,210 | 3,980 |
| Median time | 47s | 41s |
| Quality | 4/5 | 4/5 |
| Diff applied cleanly | Yes | Yes |
| Estimated task cost | $0.012 | $0.062 |
| 指标 | Qwen3.7-Plus | Qwen3.7-Max |
|---|---|---|
| Input | 8,420 + 1 image | 8,420,image dropped |
| Output tokens | 1,830 | 2,140 |
| Time | 12s | 9s |
| Quality | 5/5 | 2/5 |
| 找到真实原因 | Yes | No |
| 指标 | Qwen3.7-Plus | Qwen3.7-Max |
|---|---|---|
| Tool calls | 342 | 351 |
| Errors recovered | 4/5 | 5/5 |
| Completion | 96% | 100% |
| Total cost | $0.34 | $1.71 |
纯文本 async refactor 中,质量同为 4/5,Max 中位耗时约快 14%,但任务成本约为 Plus 的 5 倍。
视觉调试任务不是“便宜的 Max vs 更贵的 Plus”:Max 不能接收截图,Plus 以 5/5 找到原因,Max 2/5 且猜错位置。
长程 migration 中 Max 100% 完成、5/5 错误恢复,Plus 96%、4/5;对不可逆生产迁移,小质量差异可能值得付费,对可回滚 staging 则 Plus 更有成本优势。
同一文章的价格表称 Max 输入/输出 $2.50/$7.50,Plus $0.40/$1.60;实际报价应以 Alibaba Cloud 当前页面为准。
Ofox 同时提供比较 API 和推广服务,存在平台方利益;任务集为 3 个,不能代表所有 coding/Agent 工作流。
senior reviewer、样本代码和原始 trace 未公开,质量分可能含主观成分。
Plus 视觉优势依赖 API 的 image 输入和任务设计;Max 的文本路径不能与视觉路径严格等价。
4 小时运行、342–351 tool calls 不是 35 小时上限或任意 Agent 的稳定性证明。
使用同一 dated snapshot、同一 prompt、temperature 0.2 和相同工具权限,在自己的 API/网关中分别运行 Max 与 Plus。
每个任务重复至少 5 次,保存 input/output tokens、TTFT、墙钟时间、tool calls、错误恢复和最终 diff。
由两名不知模型身份的评审者按固定 rubric 评分,并独立记录“是否找到真实根因”和“是否通过测试”。
将视觉任务的 image 输入与纯文本任务分开,不把“模型看不到图”误判成推理能力差。
计算每个通过且无需人工重做的结果成本,再决定 Max 的质量溢价是否合理。
文章的成本结论是 “Plus wins on text-only cost”,但长程迁移的 100% vs 96% 提醒不可逆任务需要按失败代价路由。
Qwen3.7 Max