Tabbit
活动资源博客模型
Tabbit LogoTabbit

Tabbit — 为你工作的 AI 浏览器

主题资源

  • AI Browser Resources
  • Agentic Browser Resources
  • Browser Downloads and Install Guides
  • Browser Comparisons
  • AI Browser Alternatives
  • Browser Productivity Resources

热门指南

  • AI Browser
  • Agentic Browser Download
  • Best AI Browser 2026: Top 9 Tested & Ranked
  • AI Browser Download
  • Free AI Browser
  • Best AI Browser 2026
  • AI Browser Comparison 2026
  • AI Browser for Windows
  • AI Browser for Mac
  • Chrome Alternative 2026

活动

  • 别装了,你在《牛来》里早有原型
  • Tabbit 妙招大赛
  • KPOP SBTI 饭圈人格测试
  • Tabbit 校园共创者计划
  • fifi 的论文文献妙招精选
  • 用户问卷

关于

  • Tabbit 博客
  • 媒体报道
简体中文
简体中文English
测评与证据

Qwen3.7 Max · 媒体来源 · 独立测量

Qwen3.7-Max 与 Qwen3.7-Plus 三项真实任务成本与质量对照

Ofox 用相同提示、每项 5 次运行中位数和 senior reviewer 比较 Qwen3.7 Max/Plus;Max 在文本与长程迁移有小幅优势,Plus 约便宜 5 倍且支持视觉。

待验证:本次未能重新核实原文。下方历史数字不代表已核实的当前结果。

媒体来源独立测量编辑日期 2026-09-20

测试条件速查

来源具体观察
2026-06-02,更新 2026-08-03;三项任务包含 1,200 行 Python 重构、截图+stack trace 调试和 1,000 步 Postgres migration。
已公布条件
每模型每任务运行 5 次,temperature=0.2,长程任务 unattended 4 小时,质量由 senior reviewer 以 1–5 评分。

关键数据与适用场景

一句话结论

Ofox 用相同 prompt、5 次运行中位数和 senior reviewer 比较 Max/Plus:Max 在纯文本和长程迁移上有小幅质量/速度优势,但 Plus 在三个任务中约 5 倍便宜且支持视觉输入。

测试环境

  • 接口:Ofox OpenAI-compatible API。

  • 配置:相同 prompt,temperature 0.2;每个任务运行 5 次,报告中位数;质量由 senior reviewer 按 1–5 评分。

  • 任务:1,200 行 Python 服务异步重构;截图+stack trace 的 flaky test 调试;1,000 步 Postgres 14→16 自主 CLI migration。

  • 长程任务:每个模型 unattended 4 小时,低于页面所称 35 小时 ceiling。

输入/配置

文章公开了任务描述、输入/输出 tokens、耗时、tool calls、错误恢复和成本,但没有发布完整代码仓库、每轮工具 trace、随机种子、评审量表细则或原始 API 响应。它可以复刻方法与预算数量级,不能逐行复算。

结果数据

任务 1:1,200 行 Python 服务异步重构

指标Qwen3.7-PlusQwen3.7-Max
Input tokens12,84012,840
Output tokens4,2103,980
Median time47s41s
Quality4/54/5
Diff applied cleanlyYesYes
Estimated task cost$0.012$0.062

任务 2:截图 + stack trace 的 flaky test 调试

指标Qwen3.7-PlusQwen3.7-Max
Input8,420 + 1 image8,420,image dropped
Output tokens1,8302,140
Time12s9s
Quality5/52/5
找到真实原因YesNo

任务 3:1,000 步 Postgres migration Agent

指标Qwen3.7-PlusQwen3.7-Max
Tool calls342351
Errors recovered4/55/5
Completion96%100%
Total cost$0.34$1.71

结论

  • 纯文本 async refactor 中,质量同为 4/5,Max 中位耗时约快 14%,但任务成本约为 Plus 的 5 倍。

  • 视觉调试任务不是“便宜的 Max vs 更贵的 Plus”:Max 不能接收截图,Plus 以 5/5 找到原因,Max 2/5 且猜错位置。

  • 长程 migration 中 Max 100% 完成、5/5 错误恢复,Plus 96%、4/5;对不可逆生产迁移,小质量差异可能值得付费,对可回滚 staging 则 Plus 更有成本优势。

  • 同一文章的价格表称 Max 输入/输出 $2.50/$7.50,Plus $0.40/$1.60;实际报价应以 Alibaba Cloud 当前页面为准。

局限

  • Ofox 同时提供比较 API 和推广服务,存在平台方利益;任务集为 3 个,不能代表所有 coding/Agent 工作流。

  • senior reviewer、样本代码和原始 trace 未公开,质量分可能含主观成分。

  • Plus 视觉优势依赖 API 的 image 输入和任务设计;Max 的文本路径不能与视觉路径严格等价。

  • 4 小时运行、342–351 tool calls 不是 35 小时上限或任意 Agent 的稳定性证明。

复现步骤

  1. 使用同一 dated snapshot、同一 prompt、temperature 0.2 和相同工具权限,在自己的 API/网关中分别运行 Max 与 Plus。

  2. 每个任务重复至少 5 次,保存 input/output tokens、TTFT、墙钟时间、tool calls、错误恢复和最终 diff。

  3. 由两名不知模型身份的评审者按固定 rubric 评分,并独立记录“是否找到真实根因”和“是否通过测试”。

  4. 将视觉任务的 image 输入与纯文本任务分开,不把“模型看不到图”误判成推理能力差。

  5. 计算每个通过且无需人工重做的结果成本,再决定 Max 的质量溢价是否合理。

来源摘录或观察(仅做合规短引)

文章的成本结论是 “Plus wins on text-only cost”,但长程迁移的 100% vs 96% 提醒不可逆任务需要按失败代价路由。

能支持的判断

  • 支持在 Ofox 公布的设置下进行三项任务的成本与质量对照。

不能支持的判断

  • 不能代表所有仓库、更长自主运行或这些快照之外的当前 provider 价格。

方法、局限和复现

本文中的数字、任务集、推理档位和客户端条件只在所列来源及采集时点内成立。不同版本、不同 harness 或不同提供商的数据不能直接并排比较;未公开的参数保持未知。

需要复测时,请固定模型版本、提供商或客户端、推理档位、工具、任务集版本、样本数和采集日期,并记录失败、重试与人工修正。完整方法和复现步骤见下方来源笔记。

原始来源

Ofox AI · Ofox(文章页面未显示个人作者) · 原文发布日期 2026-06-02 · 本站编辑日期 2026-09-20

打开原始来源

Qwen3.7 Max

在 Tabbit 中比较 Qwen3.7 Max

下载 Tabbit 客户端后检查模型可用性

模型深度阅读

总览 · 简体中文

Qwen3.7 Max:模型定位、获取方式与适用边界

从官方快照、百万级上下文、Agent 场景、价格口径和实际风险,快速判断 Qwen3.7 Max 是否适合你的工作流。

相关评测

Qwen3.7-Max 官方完整基准与 35 小时自主优化实验Qwen 官方报告 Qwen3.7-Max 在编码、MCP/Skills、推理、多语言和长程工具任务上的结果,并展示 35 小时 GPU 优化实验;各项分数依赖不同 harness。Qwen3.7-Max BenchLM 公开证据覆盖与速度账本BenchLM 的 Qwen3.7 Max 账本记录 71.6/100、公开排名 #16/218、证据验证排名 #13/104 以及 204 tok/s 和 14.07 秒首 token;其聚合口径不统一。Qwen3.7-Max Artificial Analysis 综合智能指数与成本速度实测Artificial Analysis 把 Qwen3.7 Max 放入 182 模型池,按推理档位比较智能指数、单任务成本和输出速度;长思维 token 与档位会显著改变成本。Qwen3.7-Max ITBench-AA 企业运维与 SRE 故障根因分析实测ITBench-AA 用离线事故快照、Prometheus/OTel/Kubernetes 证据和 Stirrup 沙箱评估 Qwen3.7 Max 的 SRE 根因分析;工具权限与数据载荷决定结论。Qwen3.7-Max 长程 Agent、前端原型与办公提示词Qwen 官方长程案例把前端、办公和多步 Agent 任务拆成可验证阶段,并强调工具、超时和最终验收要分开记录。Qwen3.7-Max 阿里云 Model Studio 版本、价格与缓存配置Model Studio 页面把 Qwen3.7 Max 的快照、百万上下文、缓存计费和区域限流分开列出,适合先固定版本与成本口径。Qwen3.7-Max Three.js 电子魔方与 3D 物理交互原型提示词阿里云公开 Three.js 案例把视觉参考、交互规则和物理验收写成电子魔方原型任务,适合做浏览器端视觉原型的编辑改写。Qwen3.7-Max GPU 算子优化长程 Agent 提示词与验收闭环Qwen 团队的 GPU 算子案例把性能假设、编译测试、基准回归和长程进度记录连成闭环,硬件与验证器是关键边界。