原帖作者发现 Qwen3.8-Max 的综合分很高,但自己在 Qwen App 做研究时没有感受到同等智能,因此询问是否存在“benchmaxxing”。回复指出,综合分受到 Tau3-banking 等 agentic tool-use 项目拉动;也有人认为多数新模型在给足上下文和清晰提示后都能完成常见编码任务,单看 50 分和 60 分并不能反映实际差异。
先看分项指标和任务定义,不要只引用综合分。
工具使用基准的权重可能明显改变总分;要记录工具、提示词、上下文和通过标准。
社区日用反馈认为它适合一般编码和 agent 任务,但不能替代真实项目回归测试。
本站仅展示 Tabbit 编辑摘要和必要节选;完整内容、上下文与最新版本请查看原始来源。
Qwen3.8 Max