Tabbit
活动资源博客模型
Tabbit LogoTabbit

Tabbit — 为你工作的 AI 浏览器

主题资源

  • AI Browser Resources
  • Agentic Browser Resources
  • Browser Downloads and Install Guides
  • Browser Comparisons
  • AI Browser Alternatives
  • Browser Productivity Resources

热门指南

  • AI Browser
  • Agentic Browser Download
  • Best AI Browser 2026: Top 9 Tested & Ranked
  • AI Browser Download
  • Free AI Browser
  • Best AI Browser 2026
  • AI Browser Comparison 2026
  • AI Browser for Windows
  • AI Browser for Mac
  • Chrome Alternative 2026

活动

  • 别装了,你在《牛来》里早有原型
  • Tabbit 妙招大赛
  • KPOP SBTI 饭圈人格测试
  • Tabbit 校园共创者计划
  • fifi 的论文文献妙招精选
  • 用户问卷

关于

  • Tabbit 博客
  • 媒体报道
测评
媒体Qwen3.7 Max

Qwen3.7-Max 与 Qwen3.7-Plus 三项真实任务成本与质量对照

原始来源

Ofox AI

作者Ofox(文章页面未显示个人作者)

原文日期2026-06-02

Tabbit 整理2026-08-19

查看原文

一句话结论

Ofox 用相同 prompt、5 次运行中位数和 senior reviewer 比较 Max/Plus:Max 在纯文本和长程迁移上有小幅质量/速度优势,但 Plus 在三个任务中约 5 倍便宜且支持视觉输入。

测试环境

  • 接口:Ofox OpenAI-compatible API。

  • 配置:相同 prompt,temperature 0.2;每个任务运行 5 次,报告中位数;质量由 senior reviewer 按 1–5 评分。

  • 任务:1,200 行 Python 服务异步重构;截图+stack trace 的 flaky test 调试;1,000 步 Postgres 14→16 自主 CLI migration。

  • 长程任务:每个模型 unattended 4 小时,低于页面所称 35 小时 ceiling。

输入/配置

文章公开了任务描述、输入/输出 tokens、耗时、tool calls、错误恢复和成本,但没有发布完整代码仓库、每轮工具 trace、随机种子、评审量表细则或原始 API 响应。它可以复刻方法与预算数量级,不能逐行复算。

结果数据

任务 1:1,200 行 Python 服务异步重构

指标Qwen3.7-PlusQwen3.7-Max
Input tokens12,84012,840
Output tokens4,2103,980
Median time47s41s
Quality4/54/5
Diff applied cleanlyYesYes
Estimated task cost$0.012$0.062

任务 2:截图 + stack trace 的 flaky test 调试

指标Qwen3.7-PlusQwen3.7-Max
Input8,420 + 1 image8,420,image dropped
Output tokens1,8302,140
Time12s9s
Quality5/52/5
找到真实原因YesNo

任务 3:1,000 步 Postgres migration Agent

指标Qwen3.7-PlusQwen3.7-Max
Tool calls342351
Errors recovered4/55/5
Completion96%100%
Total cost$0.34$1.71

结论

  • 纯文本 async refactor 中,质量同为 4/5,Max 中位耗时约快 14%,但任务成本约为 Plus 的 5 倍。

  • 视觉调试任务不是“便宜的 Max vs 更贵的 Plus”:Max 不能接收截图,Plus 以 5/5 找到原因,Max 2/5 且猜错位置。

  • 长程 migration 中 Max 100% 完成、5/5 错误恢复,Plus 96%、4/5;对不可逆生产迁移,小质量差异可能值得付费,对可回滚 staging 则 Plus 更有成本优势。

  • 同一文章的价格表称 Max 输入/输出 $2.50/$7.50,Plus $0.40/$1.60;实际报价应以 Alibaba Cloud 当前页面为准。

局限

  • Ofox 同时提供比较 API 和推广服务,存在平台方利益;任务集为 3 个,不能代表所有 coding/Agent 工作流。

  • senior reviewer、样本代码和原始 trace 未公开,质量分可能含主观成分。

  • Plus 视觉优势依赖 API 的 image 输入和任务设计;Max 的文本路径不能与视觉路径严格等价。

  • 4 小时运行、342–351 tool calls 不是 35 小时上限或任意 Agent 的稳定性证明。

复现步骤

  1. 使用同一 dated snapshot、同一 prompt、temperature 0.2 和相同工具权限,在自己的 API/网关中分别运行 Max 与 Plus。

  2. 每个任务重复至少 5 次,保存 input/output tokens、TTFT、墙钟时间、tool calls、错误恢复和最终 diff。

  3. 由两名不知模型身份的评审者按固定 rubric 评分,并独立记录“是否找到真实根因”和“是否通过测试”。

  4. 将视觉任务的 image 输入与纯文本任务分开,不把“模型看不到图”误判成推理能力差。

  5. 计算每个通过且无需人工重做的结果成本,再决定 Max 的质量溢价是否合理。

来源摘录或观察(仅做合规短引)

文章的成本结论是 “Plus wins on text-only cost”,但长程迁移的 100% vs 96% 提醒不可逆任务需要按失败代价路由。

Tabbit 小编提醒

本文是第三方资料导航。测试环境、模型版本和主观体验可能不同,请以原文为准。

Qwen3.7 Max

在 Tabbit 中使用并对比模型

Qwen3.7 Max

相关测评

媒体Qwen 官方博客2026-05-20

Qwen3.7-Max 官方完整基准与 35 小时自主优化实验

媒体BenchLM.ai2026-05-16

Qwen3.7-Max BenchLM 公开证据覆盖与速度账本

媒体Artificial Analysis2026-05-20

Qwen3.7-Max Artificial Analysis 综合智能指数与成本速度实测

媒体Artificial Analysis & IBM Research2026-05-28

Qwen3.7-Max ITBench-AA 企业运维与 SRE 故障根因分析实测

Qwen3.7 Max

相关提示词

媒体Qwen 官方博客2026-05-20

Qwen3.7-Max 长程 Agent、前端原型与办公提示词

媒体Alibaba Cloud Model Studio2026-08-18

Qwen3.7-Max 阿里云 Model Studio 版本、价格与缓存配置

社区Reddit(r/opencodeCLI & r/QwenAI)2026-05-25

Qwen3.7-Max OpenCode 缓存配置与 Agent 防暴走规则

社区X.com & GitHub Community2026-08-08

Qwen3.7-Max 与多模型协同的代码阅读与审查路由配置