Qwen3.8 Max

Qwen3.8 Max · 测评与证据

Qwen3.8 Max,哪些结论值得看?

按主题、来源身份和证据类型浏览公开测评。不同版本、档位和测试环境不直接并排比较。

这是第三方资料导航,不是 Tabbit 自测。动态指标以原始来源当前页面为准;未知值保持未知。

编辑结论

编辑结论

Qwen 官方发布说明汇总 Qwen3.8 Max 的多项 benchmark;不同任务的 harness、样本和 reasoning 参数并不统一,发布日期与采集日期必须分开,不能拼成当前总榜。

Qwen 官方博客 · 查看证据

Artificial Analysis 将 Qwen3.8 Max 的质量、成本、速度和输出冗长分开展示;页面版本、推理档位、provider 和任务样本需重开,不能把聚合指数拼成跨版本趋势。

Artificial Analysis · 查看证据

NYU Shanghai RITS 资料讨论 Qwen3.8 Max 的代理轮次、幻觉或成本代理指标;任务集、工具、重复次数和版本以公开部分为准,不能外推到所有 Agent 工作负载。

NYU Shanghai RITS · 查看证据

完整测评与相关内容

模型深度阅读

总览 · 简体中文

Qwen3.8 Max:更新了什么、成本如何、适合谁

从 0902 快照、多模态边界、基准口径到获取路线,帮助你判断 Qwen3.8 Max 是否值得试用。

精选证据

媒体 / 基准方厂商自报

Qwen3.8-Max:官方发布说明与完整性能结果

Qwen 官方发布说明汇总 Qwen3.8 Max 的多项 benchmark;不同任务的 harness、样本和 reasoning 参数并不统一,发布日期与采集日期必须分开,不能拼成当前总榜。

来源Qwen 官方博客
原文日期2026-08-03
采集2026-08-18

待验证:本次未能重新核实原文。

来源
Qwen 官方发布说明;厂商自报基准
版本
Qwen3.8 Max exact snapshot 以原文为准
任务集
多个 benchmark;harness、样本和推理参数不完全一致
能力
媒体 / 基准方独立测量

Qwen3.8-Max:Artificial Analysis 独立指数的质量、成本、速度与冗长账本

Artificial Analysis 将 Qwen3.8 Max 的质量、成本、速度和输出冗长分开展示;页面版本、推理档位、provider 和任务样本需重开,不能把聚合指数拼成跨版本趋势。

来源Artificial Analysis
原文日期未知
采集2026-08-18

待验证:本次未能重新核实原文。

平台/版本
Artificial Analysis 指数页面;版本和窗口需重开
指标
质量、成本、速度、冗长维度分开解释
配置
provider、档位、样本和任务集未全部公开
推理成本速度与延迟
媒体 / 基准方独立测量

Qwen3.8-Max:NYU 上海 RITS 对代理指数演化、轮次和幻觉成本的复核

NYU Shanghai RITS 资料讨论 Qwen3.8 Max 的代理轮次、幻觉或成本代理指标;任务集、工具、重复次数和版本以公开部分为准,不能外推到所有 Agent 工作负载。

来源NYU Shanghai RITS
原文日期未知
采集2026-08-18

待验证:本次未能重新核实原文。

研究
NYU Shanghai RITS 代理指数;版本和 harness 按原文
指标
轮次、幻觉或成本等代理指标,不是单一质量分
样本
任务集、重复次数和工具设置以公开部分为准
Agent推理成本
媒体 / 基准方独立测量

Qwen3.8 Max:BenchLM 的来源可核验基准分类账本

BenchLM 把 Qwen3.8 Max 的 exact-source benchmark 行与聚合排名分开;类别权重、provider、harness、样本和日期各异,因此这是可核验账本而非统一独立复跑。

来源BenchLM
原文日期2026-08-17
采集2026-08-18

待验证:本次未能重新核实原文。

平台
BenchLM exact-source rows 与聚合排名分开
覆盖
类别权重和目录动态变化
配置
原始 benchmark 的 provider、harness、样本与日期各异
推理

全部来源

全部来源

9 / 9
媒体 / 基准方厂商自报

Qwen3.8-Max:官方发布说明与完整性能结果

Qwen 官方发布说明汇总 Qwen3.8 Max 的多项 benchmark;不同任务的 harness、样本和 reasoning 参数并不统一,发布日期与采集日期必须分开,不能拼成当前总榜。

来源Qwen 官方博客
原文日期2026-08-03
采集2026-08-18

待验证:本次未能重新核实原文。

来源
Qwen 官方发布说明;厂商自报基准
版本
Qwen3.8 Max exact snapshot 以原文为准
任务集
多个 benchmark;harness、样本和推理参数不完全一致
能力
媒体 / 基准方独立测量

Qwen3.8-Max:Artificial Analysis 独立指数的质量、成本、速度与冗长账本

Artificial Analysis 将 Qwen3.8 Max 的质量、成本、速度和输出冗长分开展示;页面版本、推理档位、provider 和任务样本需重开,不能把聚合指数拼成跨版本趋势。

来源Artificial Analysis
原文日期未知
采集2026-08-18

待验证:本次未能重新核实原文。

平台/版本
Artificial Analysis 指数页面;版本和窗口需重开
指标
质量、成本、速度、冗长维度分开解释
配置
provider、档位、样本和任务集未全部公开
推理成本速度与延迟
媒体 / 基准方独立测量

Qwen3.8-Max:NYU 上海 RITS 对代理指数演化、轮次和幻觉成本的复核

NYU Shanghai RITS 资料讨论 Qwen3.8 Max 的代理轮次、幻觉或成本代理指标;任务集、工具、重复次数和版本以公开部分为准,不能外推到所有 Agent 工作负载。

来源NYU Shanghai RITS
原文日期未知
采集2026-08-18

待验证:本次未能重新核实原文。

研究
NYU Shanghai RITS 代理指数;版本和 harness 按原文
指标
轮次、幻觉或成本等代理指标,不是单一质量分
样本
任务集、重复次数和工具设置以公开部分为准
Agent推理成本
媒体 / 基准方独立测量

Qwen3.8 Max:BenchLM 的来源可核验基准分类账本

BenchLM 把 Qwen3.8 Max 的 exact-source benchmark 行与聚合排名分开;类别权重、provider、harness、样本和日期各异,因此这是可核验账本而非统一独立复跑。

来源BenchLM
原文日期2026-08-17
采集2026-08-18

待验证:本次未能重新核实原文。

平台
BenchLM exact-source rows 与聚合排名分开
覆盖
类别权重和目录动态变化
配置
原始 benchmark 的 provider、harness、样本与日期各异
推理
社区独立测量

Qwen3.8-Max:Legal Research Bench 的坚持度、全通过率与任务成本

Vals AI 的线程把 Qwen3.8-Max 的提升解释为“更坚持”而不只是“更聪明”:Legal Research Bench 排名从第 22 升到第 4,单任务成本约为 $2.49,但每个任务的轮次、工具调用、来源数和耗时都明显增加。全通过率从 25.5% 升至 47.6%,比只看平均准确率更能体现长链路任务的变化。

来源X(@ValsAI)
原文日期2026-08-12
采集2026-08-18

待验证:本次未能重新核实原文。

模型/版本
模型为 Qwen3.8-Max;来源标题:Qwen3.8-Max:Legal Research Bench 的坚持度、全通过率与任务成本。精确快照按原始来源。
任务/harness
Vals AI 报告 Legal Research Bench 从第 22 升至第 4、全通过率从 25.5% 升到 47.6%,单任务约 $2.49,但轮次、工具调用、来源数和耗时也增加。 完整任务集、provider、参数和评审流程未完全公开。
样本/日期
来源笔记于 2026-09-20 复核;样本数和重复次数未公开处保持未知。
推理成本
社区个人体验

Qwen3.8-27B 本地量化模型:推理努力等级测试

作者在四台机器上测试 Qwen3.8-27B:M5 Max 上的 MLX 4-bit,以及 DGX Spark 上通过 vLLM 运行的 unsloth/Qwen3.8-27B-NVFP4。他观察到从关闭思考到 effort=low 有明显跃升,但 4-bit 下 xhigh 可能因为长思考和量化误差出现极端耗时或截断。后续回复还给出 64K 预算、8-bit 复测和内存消耗等信息。

来源X(@jtdavies)
原文日期2026-08-16
采集2026-08-18

待验证:本次未能重新核实原文。

模型/版本
模型为 Qwen3.8-Max;来源标题:Qwen3.8-27B 本地量化模型:推理努力等级测试。精确快照按原始来源。
任务/harness
四台机器上的 Qwen3.8-27B 测试显示,从关闭思考到 effort=low 有明显跃升;4-bit 下 xhigh 可能因量化误差长时间运行或截断。完整任务集、provider、参数和评审流程未完全公开。
样本/日期
来源笔记于 2026-09-20 复核;样本数和重复次数未公开处保持未知。
推理
社区个人体验

Reddit 社区:Qwen3.8-Max 编程能力、速度与额度消耗

这是一个问“Qwen3.8-Max 是否真的适合编程”的社区讨论。反馈两极:有人认为它接近 Claude/GPT,也有人认为它慢、贵、会过度思考;另有用户用它生成多个网页游戏和 Rust 神经网络编辑器,认为模型非常强,但需要把要求讲得足够具体。讨论的共同点是:模型能力、价格、任务规模和提示词质量必须一起评估。

来源Reddit,r/QwenAI
原文日期未知
采集2026-08-18

待验证:本次未能重新核实原文。

模型/版本
模型为 Qwen3.8-Max;来源标题:Reddit 社区:Qwen3.8-Max 编程能力、速度与额度消耗。精确快照按原始来源。
任务/harness
Qwen 社区讨论既报告了网页游戏和 Rust 项目的强表现,也抱怨输出慢、贵且会过度思考;讨论共同认为任务规模和提示词具体程度很重要。完整任务集、provider、参数和评审流程未完全公开。
样本/日期
来源笔记于 2026-09-20 复核;样本数和重复次数未公开处保持未知。
编程速度与延迟
社区个人体验

Reddit:Qwen3.8-Max 的高分是否被单项基准放大

原帖作者发现 Qwen3.8-Max 的综合分很高,但自己在 Qwen App 做研究时没有感受到同等智能,因此询问是否存在“benchmaxxing”。回复指出,综合分受到 Tau3-banking 等 agentic tool-use 项目拉动;也有人认为多数新模型在给足上下文和清晰提示后都能完成常见编码任务,单看 50 分和 60 分并不能反映实际差异。

来源Reddit,r/LocalLLaMA
原文日期未知
采集2026-08-18

待验证:本次未能重新核实原文。

模型/版本
模型为 Qwen3.8-Max;来源标题:Reddit:Qwen3.8-Max 的高分是否被单项基准放大。精确快照按原始来源。
任务/harness
该讨论对比了 Qwen3.8-Max 较高的综合分和 Qwen App 较弱的研究体验,并指出 Tau3-banking/tool-use 任务可能拉高总分。完整任务集、provider、参数和评审流程未完全公开。
样本/日期
来源笔记于 2026-09-20 复核;样本数和重复次数未公开处保持未知。
推理
媒体 / 基准方独立测量

Qwen3.8-Max Preview:Trilogy AI 的 StackPerf 代码库架构盲测

在相同 269 文件、60 分钟、OpenCode 1.17.13 的 StackPerf 代码库架构任务中,Qwen3.8-Max Preview 得分 80、Kimi K3 得分 83;Qwen 的强项是系统边界、证据引用和 replay 元数据,Kimi 的强项是修订、再生成和场景生命周期,而两者都需要独立事实核验。

来源Trilogy AI Center of Excellence(Substack)
原文日期2026-07-19
采集2026-08-18

待验证:本次未能重新核实原文。

模型/版本
Qwen3.8 Max;BenchLM 页面汇总的具体版本与日期以各来源行及页面快照为准
任务/账本
52 条来源可显示 benchmark 行归一为 79.91/100、218 个模型中第 6;类别权重、provider 与 harness 不统一
类别缺口
Reasoning、Agentic、Multimodal 与指令遵循较强,但 AutomationBench、OSWorld 2.0、HLE 等项目仍有缺口
编程

Qwen3.8 Max

在 Tabbit 中比较 Qwen3.8 Max

客户端中的模型、功能和权限以当前账户为准。