Tabbit
活动资源博客模型
Tabbit LogoTabbit

Tabbit — 为你工作的 AI 浏览器

主题资源

  • AI Browser Resources
  • Agentic Browser Resources
  • Browser Downloads and Install Guides
  • Browser Comparisons
  • AI Browser Alternatives
  • Browser Productivity Resources

热门指南

  • AI Browser
  • Agentic Browser Download
  • Best AI Browser 2026: Top 9 Tested & Ranked
  • AI Browser Download
  • Free AI Browser
  • Best AI Browser 2026
  • AI Browser Comparison 2026
  • AI Browser for Windows
  • AI Browser for Mac
  • Chrome Alternative 2026

活动

  • 别装了,你在《牛来》里早有原型
  • Tabbit 妙招大赛
  • KPOP SBTI 饭圈人格测试
  • Tabbit 校园共创者计划
  • fifi 的论文文献妙招精选
  • 用户问卷

关于

  • Tabbit 博客
  • 媒体报道
测评
社区Qwen3.7 Max

Qwen3.7-Max 真实代码任务中的负向指令混淆与 Token 消耗实测

原始来源

Reddit(r/opencode, r/QwenAI, r/LocalLLaMA)

作者iSerter, Peleias, BoringAioli7916, crmexpert, flysnowbigbig

原文日期2026-05-28

Tabbit 整理2026-08-20

查看原文

一句话结论

在真实软件工程落地中,Qwen3.7-Max 在数学计算与金融代码重构上表现出色,但在自主 CLI Agent 中容易混淆“禁用”与“删除”等语义约束,并在无缓存/多轮工具调用下产生 3~5 倍的思考 Token 消耗与重试成本。

测试环境

  • 接入工具与环境:OpenCode CLI、Claude Code 兼容层、原生 DashScope API、OpenRouter。

  • 代码库类型:

    • 任务 A:包含复杂金融算法与高维数学推演的 Python/Rust 项目。

    • 任务 B:带 CI/CD 自动化流水线(GitHub Actions)的 Web 插件项目。

    • 任务 C:包含用户注册模块与单元测试的多文件全栈项目。

  • 参与测试人员背景:企业级后端开发、量化金融工程师、开源 CLI 工具重度用户。

输入/配置

  • 提示词风格:自然语言工程任务指令、多阶段 Red-teaming 提示、CI 故障排查请求。

  • 对比模型:Claude Opus 4.6 / 4.7、GLM-5.2、Kimi K2.6 / K3、DeepSeek V4 Flash / Pro。

  • 参数:默认思考模式(Thinking Mode 开启),temperature 0.2~0.7。

结果数据

1. 真实任务表现对照

任务场景Qwen3.7-Max 表现对照模型表现 (Opus / GLM / Kimi)
金融/量化复杂数学代码推演极强:准确识别旧代码中 Opus 4.6 遗留的边界数学逻辑错误,推导严密Kimi 2.6 审查较为浅层;Opus 4.6 会出现细微精度舍入问题
CI 流水线修改 (GITHUB_TOKEN)失误:要求替换凭据时误删了无关联的 release-please 配置文件Opus 4.6/4.7 仅做局部配置替换
功能禁用语义理解 ("Disable vs Delete")严重失误:要求“禁用注册页面”,模型未修改路由/开关,直接物理删除了注册页面源码GPT-5.5 / GLM-5.2 正确添加布尔开关或注释代码
多轮工具调用 Token 消耗偏高:3 次用户指令与 134 次内部交互产生 8.23M Input Tokens在无 Prompt Caching 场景下费用消耗速度是常规模型的 3~5 倍

2. 社区核心反馈统计

  • 优势面认可:多位金融量化开发者(crm_expert, Boring_Aioli7916)反馈其 Apex Math / 数学推理能力是同类中最可靠的工具之一,代码审查(Code Review)深度接近甚至在特定数学细节上超越 Opus 4.6。

  • 负向指令脆弱性:在涉及“不要做某事”、“仅停用而不删除”、“保持原有配置不变”等约束条件时,Qwen3.7-Max 极易产生过度修改或破坏性操作(如删除文件代替禁用)。

  • 工具调用稳定性:单次推理速度极快(200+ tok/s),但在多轮 Agent 遇到错误时,容易在思考链中反复尝试相同路径(Thinking Loop),直到触碰 max_tokens 上限。

结论

  • 强项边界清晰:对于算法密集型、数学推导型、代码重构与 Bug 静态审查任务,Qwen3.7-Max 具备极高的实用价值。

  • 自动化权限需严格受限:由于其对“非破坏性修改”语义理解存在偏差,绝对不能在生产代码库中赋予其无约束的 rm/文件删除或全量提交权限。

  • 必须搭配严格的 Prompt 护栏:必须在 Agent 系统提示词中明确禁止物理删除指令,并将“Disable”显式映射为“注释代码”或“修改 Feature Flag”。

局限

  • 数据来自 Reddit 开发者真实案例汇总与质性分析,样本量受社区公开用例限制,无法替代全量自动化回归测试。

  • 部分 Token 暴走现象受客户端 CLI(如 OpenCode 早期的 SDK 缓存头匹配问题)影响,纯模型本身的消耗需在标准 API 隔离环境下评估。

复现步骤

  1. 构建包含破坏性选项与非破坏性选项的测试用例(例如:“请在不删除组件文件的前提下禁用用户登录功能”)。

  2. 在 OpenCode CLI 或终端 Agent 中输入指令,记录模型执行的 Tool Call 清单(如 delete_file vs edit_file)。

  3. 统计模型在纠正错误时的交互轮次、思考 Token 长度及最终代码 Diff 准确率。

来源摘录或观察(仅做合规短引)

开发者 iSerter 在社区反馈:“I asked it to fix failing tests... I want to disable registration to the app... and it decided to delete it instead... like it can't even understand the difference between disabling and removing”。

Tabbit 小编提醒

本文是第三方资料导航。测试环境、模型版本和主观体验可能不同,请以原文为准。

Qwen3.7 Max

在 Tabbit 中使用并对比模型

Qwen3.7 Max

相关测评

媒体Qwen 官方博客2026-05-20

Qwen3.7-Max 官方完整基准与 35 小时自主优化实验

媒体BenchLM.ai2026-05-16

Qwen3.7-Max BenchLM 公开证据覆盖与速度账本

媒体Ofox AI2026-06-02

Qwen3.7-Max 与 Qwen3.7-Plus 三项真实任务成本与质量对照

媒体Artificial Analysis2026-05-20

Qwen3.7-Max Artificial Analysis 综合智能指数与成本速度实测

Qwen3.7 Max

相关提示词

媒体Qwen 官方博客2026-05-20

Qwen3.7-Max 长程 Agent、前端原型与办公提示词

媒体Alibaba Cloud Model Studio2026-08-18

Qwen3.7-Max 阿里云 Model Studio 版本、价格与缓存配置

社区Reddit(r/opencodeCLI & r/QwenAI)2026-05-25

Qwen3.7-Max OpenCode 缓存配置与 Agent 防暴走规则

社区X.com & GitHub Community2026-08-08

Qwen3.7-Max 与多模型协同的代码阅读与审查路由配置