Qwen3.8 Max · 社区来源 · 个人体验
原帖作者发现 Qwen3.8-Max 的综合分很高,但自己在 Qwen App 做研究时没有感受到同等智能,因此询问是否存在“benchmaxxing”。回复指出,综合分受到 Tau3-banking 等 agentic tool-use 项目拉动;也有人认为多数新模型在给足上下文和清晰提示后都能完成常见编码任务,单看 50 分和 60 分并不能反映实际差异。
待验证:本次未能重新核实原文。下方历史数字不代表已核实的当前结果。
原帖作者发现 Qwen3.8-Max 的综合分很高,但自己在 Qwen App 做研究时没有感受到同等智能,因此询问是否存在“benchmaxxing”。回复指出,综合分受到 Tau3-banking 等 agentic tool-use 项目拉动;也有人认为多数新模型在给足上下文和清晰提示后都能完成常见编码任务,单看 50 分和 60 分并不能反映实际差异。
先看分项指标和任务定义,不要只引用综合分。
工具使用基准的权重可能明显改变总分;要记录工具、提示词、上下文和通过标准。
社区日用反馈认为它适合一般编码和 agent 任务,但不能替代真实项目回归测试。
本站仅展示 Tabbit 编辑摘要和必要节选;完整内容、上下文与最新版本请查看原始来源。
本文中的数字、任务集、推理档位和客户端条件只在所列来源及采集时点内成立。不同版本、不同 harness 或不同提供商的数据不能直接并排比较;未公开的参数保持未知。
需要复测时,请固定模型版本、提供商或客户端、推理档位、工具、任务集版本、样本数和采集日期,并记录失败、重试与人工修正。完整方法和复现步骤见下方来源笔记。
Reddit,r/LocalLLaMA · 作者未公开 · 原文发布日期 Unknown · 本站编辑日期 2026-09-20
打开原始来源Qwen3.8 Max
下载 Tabbit 客户端后检查模型可用性