Qwen 官方发布说明汇总 Qwen3.8 Max 的多项 benchmark;不同任务的 harness、样本和 reasoning 参数并不统一,发布日期与采集日期必须分开,不能拼成当前总榜。
Qwen 官方博客 · 查看证据Qwen3.8 Max · 测评与证据
Qwen3.8 Max,哪些结论值得看?
按主题、来源身份和证据类型浏览公开测评。不同版本、档位和测试环境不直接并排比较。
这是第三方资料导航,不是 Tabbit 自测。动态指标以原始来源当前页面为准;未知值保持未知。
编辑结论
编辑结论
Artificial Analysis 将 Qwen3.8 Max 的质量、成本、速度和输出冗长分开展示;页面版本、推理档位、provider 和任务样本需重开,不能把聚合指数拼成跨版本趋势。
Artificial Analysis · 查看证据NYU Shanghai RITS 资料讨论 Qwen3.8 Max 的代理轮次、幻觉或成本代理指标;任务集、工具、重复次数和版本以公开部分为准,不能外推到所有 Agent 工作负载。
NYU Shanghai RITS · 查看证据完整测评与相关内容
精选证据
Qwen3.8-Max:官方发布说明与完整性能结果
Qwen 官方发布说明汇总 Qwen3.8 Max 的多项 benchmark;不同任务的 harness、样本和 reasoning 参数并不统一,发布日期与采集日期必须分开,不能拼成当前总榜。
待验证:本次未能重新核实原文。
- 来源
- Qwen 官方发布说明;厂商自报基准
- 版本
- Qwen3.8 Max exact snapshot 以原文为准
- 任务集
- 多个 benchmark;harness、样本和推理参数不完全一致
Qwen3.8-Max:Artificial Analysis 独立指数的质量、成本、速度与冗长账本
Artificial Analysis 将 Qwen3.8 Max 的质量、成本、速度和输出冗长分开展示;页面版本、推理档位、provider 和任务样本需重开,不能把聚合指数拼成跨版本趋势。
待验证:本次未能重新核实原文。
- 平台/版本
- Artificial Analysis 指数页面;版本和窗口需重开
- 指标
- 质量、成本、速度、冗长维度分开解释
- 配置
- provider、档位、样本和任务集未全部公开
Qwen3.8-Max:NYU 上海 RITS 对代理指数演化、轮次和幻觉成本的复核
NYU Shanghai RITS 资料讨论 Qwen3.8 Max 的代理轮次、幻觉或成本代理指标;任务集、工具、重复次数和版本以公开部分为准,不能外推到所有 Agent 工作负载。
待验证:本次未能重新核实原文。
- 研究
- NYU Shanghai RITS 代理指数;版本和 harness 按原文
- 指标
- 轮次、幻觉或成本等代理指标,不是单一质量分
- 样本
- 任务集、重复次数和工具设置以公开部分为准
Qwen3.8 Max:BenchLM 的来源可核验基准分类账本
BenchLM 把 Qwen3.8 Max 的 exact-source benchmark 行与聚合排名分开;类别权重、provider、harness、样本和日期各异,因此这是可核验账本而非统一独立复跑。
待验证:本次未能重新核实原文。
- 平台
- BenchLM exact-source rows 与聚合排名分开
- 覆盖
- 类别权重和目录动态变化
- 配置
- 原始 benchmark 的 provider、harness、样本与日期各异
全部来源
全部来源
Qwen3.8-Max:官方发布说明与完整性能结果
Qwen 官方发布说明汇总 Qwen3.8 Max 的多项 benchmark;不同任务的 harness、样本和 reasoning 参数并不统一,发布日期与采集日期必须分开,不能拼成当前总榜。
待验证:本次未能重新核实原文。
- 来源
- Qwen 官方发布说明;厂商自报基准
- 版本
- Qwen3.8 Max exact snapshot 以原文为准
- 任务集
- 多个 benchmark;harness、样本和推理参数不完全一致
Qwen3.8-Max:Artificial Analysis 独立指数的质量、成本、速度与冗长账本
Artificial Analysis 将 Qwen3.8 Max 的质量、成本、速度和输出冗长分开展示;页面版本、推理档位、provider 和任务样本需重开,不能把聚合指数拼成跨版本趋势。
待验证:本次未能重新核实原文。
- 平台/版本
- Artificial Analysis 指数页面;版本和窗口需重开
- 指标
- 质量、成本、速度、冗长维度分开解释
- 配置
- provider、档位、样本和任务集未全部公开
Qwen3.8-Max:NYU 上海 RITS 对代理指数演化、轮次和幻觉成本的复核
NYU Shanghai RITS 资料讨论 Qwen3.8 Max 的代理轮次、幻觉或成本代理指标;任务集、工具、重复次数和版本以公开部分为准,不能外推到所有 Agent 工作负载。
待验证:本次未能重新核实原文。
- 研究
- NYU Shanghai RITS 代理指数;版本和 harness 按原文
- 指标
- 轮次、幻觉或成本等代理指标,不是单一质量分
- 样本
- 任务集、重复次数和工具设置以公开部分为准
Qwen3.8 Max:BenchLM 的来源可核验基准分类账本
BenchLM 把 Qwen3.8 Max 的 exact-source benchmark 行与聚合排名分开;类别权重、provider、harness、样本和日期各异,因此这是可核验账本而非统一独立复跑。
待验证:本次未能重新核实原文。
- 平台
- BenchLM exact-source rows 与聚合排名分开
- 覆盖
- 类别权重和目录动态变化
- 配置
- 原始 benchmark 的 provider、harness、样本与日期各异
Qwen3.8-Max:Legal Research Bench 的坚持度、全通过率与任务成本
Vals AI 的线程把 Qwen3.8-Max 的提升解释为“更坚持”而不只是“更聪明”:Legal Research Bench 排名从第 22 升到第 4,单任务成本约为 $2.49,但每个任务的轮次、工具调用、来源数和耗时都明显增加。全通过率从 25.5% 升至 47.6%,比只看平均准确率更能体现长链路任务的变化。
待验证:本次未能重新核实原文。
- 模型/版本
- 模型为 Qwen3.8-Max;来源标题:Qwen3.8-Max:Legal Research Bench 的坚持度、全通过率与任务成本。精确快照按原始来源。
- 任务/harness
- Vals AI 报告 Legal Research Bench 从第 22 升至第 4、全通过率从 25.5% 升到 47.6%,单任务约 $2.49,但轮次、工具调用、来源数和耗时也增加。 完整任务集、provider、参数和评审流程未完全公开。
- 样本/日期
- 来源笔记于 2026-09-20 复核;样本数和重复次数未公开处保持未知。
Qwen3.8-27B 本地量化模型:推理努力等级测试
作者在四台机器上测试 Qwen3.8-27B:M5 Max 上的 MLX 4-bit,以及 DGX Spark 上通过 vLLM 运行的 unsloth/Qwen3.8-27B-NVFP4。他观察到从关闭思考到 effort=low 有明显跃升,但 4-bit 下 xhigh 可能因为长思考和量化误差出现极端耗时或截断。后续回复还给出 64K 预算、8-bit 复测和内存消耗等信息。
待验证:本次未能重新核实原文。
- 模型/版本
- 模型为 Qwen3.8-Max;来源标题:Qwen3.8-27B 本地量化模型:推理努力等级测试。精确快照按原始来源。
- 任务/harness
- 四台机器上的 Qwen3.8-27B 测试显示,从关闭思考到 effort=low 有明显跃升;4-bit 下 xhigh 可能因量化误差长时间运行或截断。完整任务集、provider、参数和评审流程未完全公开。
- 样本/日期
- 来源笔记于 2026-09-20 复核;样本数和重复次数未公开处保持未知。
Reddit 社区:Qwen3.8-Max 编程能力、速度与额度消耗
这是一个问“Qwen3.8-Max 是否真的适合编程”的社区讨论。反馈两极:有人认为它接近 Claude/GPT,也有人认为它慢、贵、会过度思考;另有用户用它生成多个网页游戏和 Rust 神经网络编辑器,认为模型非常强,但需要把要求讲得足够具体。讨论的共同点是:模型能力、价格、任务规模和提示词质量必须一起评估。
待验证:本次未能重新核实原文。
- 模型/版本
- 模型为 Qwen3.8-Max;来源标题:Reddit 社区:Qwen3.8-Max 编程能力、速度与额度消耗。精确快照按原始来源。
- 任务/harness
- Qwen 社区讨论既报告了网页游戏和 Rust 项目的强表现,也抱怨输出慢、贵且会过度思考;讨论共同认为任务规模和提示词具体程度很重要。完整任务集、provider、参数和评审流程未完全公开。
- 样本/日期
- 来源笔记于 2026-09-20 复核;样本数和重复次数未公开处保持未知。
Reddit:Qwen3.8-Max 的高分是否被单项基准放大
原帖作者发现 Qwen3.8-Max 的综合分很高,但自己在 Qwen App 做研究时没有感受到同等智能,因此询问是否存在“benchmaxxing”。回复指出,综合分受到 Tau3-banking 等 agentic tool-use 项目拉动;也有人认为多数新模型在给足上下文和清晰提示后都能完成常见编码任务,单看 50 分和 60 分并不能反映实际差异。
待验证:本次未能重新核实原文。
- 模型/版本
- 模型为 Qwen3.8-Max;来源标题:Reddit:Qwen3.8-Max 的高分是否被单项基准放大。精确快照按原始来源。
- 任务/harness
- 该讨论对比了 Qwen3.8-Max 较高的综合分和 Qwen App 较弱的研究体验,并指出 Tau3-banking/tool-use 任务可能拉高总分。完整任务集、provider、参数和评审流程未完全公开。
- 样本/日期
- 来源笔记于 2026-09-20 复核;样本数和重复次数未公开处保持未知。
Qwen3.8-Max Preview:Trilogy AI 的 StackPerf 代码库架构盲测
在相同 269 文件、60 分钟、OpenCode 1.17.13 的 StackPerf 代码库架构任务中,Qwen3.8-Max Preview 得分 80、Kimi K3 得分 83;Qwen 的强项是系统边界、证据引用和 replay 元数据,Kimi 的强项是修订、再生成和场景生命周期,而两者都需要独立事实核验。
待验证:本次未能重新核实原文。
- 模型/版本
- Qwen3.8 Max;BenchLM 页面汇总的具体版本与日期以各来源行及页面快照为准
- 任务/账本
- 52 条来源可显示 benchmark 行归一为 79.91/100、218 个模型中第 6;类别权重、provider 与 harness 不统一
- 类别缺口
- Reasoning、Agentic、Multimodal 与指令遵循较强,但 AutomationBench、OSWorld 2.0、HLE 等项目仍有缺口