Tabbit
活动资源博客模型
Tabbit LogoTabbit

Tabbit — 为你工作的 AI 浏览器

主题资源

  • AI Browser Resources
  • Agentic Browser Resources
  • Browser Downloads and Install Guides
  • Browser Comparisons
  • AI Browser Alternatives
  • Browser Productivity Resources

热门指南

  • AI Browser
  • Agentic Browser Download
  • Best AI Browser 2026: Top 9 Tested & Ranked
  • AI Browser Download
  • Free AI Browser
  • Best AI Browser 2026
  • AI Browser Comparison 2026
  • AI Browser for Windows
  • AI Browser for Mac
  • Chrome Alternative 2026

活动

  • 别装了,你在《牛来》里早有原型
  • Tabbit 妙招大赛
  • KPOP SBTI 饭圈人格测试
  • Tabbit 校园共创者计划
  • fifi 的论文文献妙招精选
  • 用户问卷

关于

  • Tabbit 博客
  • 媒体报道
简体中文
简体中文English
测评与证据

Qwen3.8 Max · 媒体来源 · 独立测量

Qwen3.8 Max:BenchLM 的来源可核验基准分类账本

BenchLM 把 Qwen3.8 Max 的 exact-source benchmark 行与聚合排名分开;类别权重、provider、harness、样本和日期各异,因此这是可核验账本而非统一独立复跑。

待验证:本次未能重新核实原文。下方历史数字不代表已核实的当前结果。

媒体来源独立测量编辑日期 2026-09-20

测试条件速查

平台
BenchLM exact-source rows 与聚合排名分开
覆盖
类别权重和目录动态变化
配置
原始 benchmark 的 provider、harness、样本与日期各异
边界
不是统一 harness 的独立复跑

关键数据与适用场景

一句话结论

BenchLM 将 Qwen3.8 Max 的 52 条来源可显示基准归一为 79.91/100、218 个模型中第 6,但分类账本同时显示它在 Reasoning、Agentic、Multimodal 和指令遵循上很强,而 AutomationBench、OSWorld 2.0、HLE 等项目仍有明显缺口;“第 6”不能替代分项任务选择。

适用场景

  • 适合的任务:按能力类别筛选模型、核对每个分数的来源、把 Qwen 与其他模型放在同一套可见证据账本里比较。

  • 不适合的任务:把 BenchLM 总分当作新实验,或把 provider exact 的官方分数当成 BenchLM 自己复跑的独立结果。

  • 适用的模型版本:Qwen3.8 Max(页面标注 2026-08-03 发布);数据冻结/刷新点为 2026-08-17。

  • 适用的客户端、Agent 或 API:BenchLM/BenchAlign 数据库;实际部署仍需回到 Qwen 官方 endpoint 和自己的 harness。

  • 推荐的推理档位和参数:BenchLM 页面不公开统一的 Qwen 调用参数;各 benchmark 的原始配置以其 Evidence 链接和 Qwen 官方脚注为准。

测试环境与工作流步骤

  1. BenchLM 方法页说明公共表默认只显示 exact-source rows,生成或推测的 benchmark value 不进入 evidence;模型页每行保留 score、weight、cohort 和 evidence state。

  2. 整体 Agentic/Coding 使用 BenchAlign v5.2 的冻结产物;其余类别仍是证据视图,直到各自验证完成。

  3. 打开模型页,先记录总分、排名、来源行数和类别分数,再展开 Coding、Agentic、Reasoning、Knowledge、Multimodal、Instruction Following 等分类。

  4. 点击每个 row 的 Evidence 原始链接,确认 Qwen 官方发布表、评测脚注、运行 harness 和日期;不能把 BenchLM 的聚合排名当作原始数据。

结果数据

类别总览

  • Overall:79.91/100,#6/218;52 条 source-displayable rows。

  • AgenticRank:79.2,#2/131,99th percentile,14 个 benchmark,权重 22%。

  • CodingRank:66.6,#11/135,93rd percentile,7 个 benchmark,权重 20%。

  • ReasoningRank:94.3,#1/2,100th percentile,2 个 benchmark,权重 17%。

  • Knowledge:66.5,未排名,4 个 benchmark,证据已验证。

  • Multimodal:88.1,#2/33,97th percentile,24 个 benchmark,权重 12%。

  • Instruction Following:97.9,#1/40,1 个 benchmark,权重 5%。

  • Math 与 Multilingual:页面标为未测量,不能从总分推断。

分项读数

  • Coding:SWE-bench Pro 67.7%(比页面最佳 verified row 低 12.6 个百分点);Terminal-Bench 2.1 为 86.6%;PaperBench 93.0% 为当前 verified row 最佳。

  • Agentic:OSWorld-Verified 86.1%、CoWorkBench 74.8%、WideResearch 81.9%、AndroidWorld 85.3%、MobileWorld 77.8% 均在页面中列为 Qwen 当前最佳 verified row;AutomationBench 27.3%,比 GLM-5.3 的 48.2% 低 20.9 个百分点;OSWorld 2.0 为 19.4%,比 Claude Opus 5 的 70.6% 低 51.2 个百分点。

  • Reasoning/Knowledge:LongBench v2 66.3%;MRCRv2 92.9%,距页面最佳 0.7 个百分点;HLE 43.6%,比 Claude Opus 5 的 64.7% 低 21.1 个百分点;GPQA 92.6%,比页面最佳低 2.9 个百分点。

  • Multimodal:MMMU-Pro 82.3%;OmniDocBench 1.5 为 92.1%;Video-MME(含字幕)90.4%;LVBench 81.8%,比 Gemini 3.7 Flash 的 85.4% 低 3.6 个百分点。

结论

BenchLM 的价值在于把“高分”拆成可点击的来源行:Qwen3.8 Max 的强项集中在长上下文、工具/桌面代理、多模态文档视频和指令遵循,但自动化边界任务、OSWorld 2.0 和专家知识考试不能被总分掩盖。选型时应根据业务任务取对应分项,并把 Qwen 官方分数的 harness、温度、重复次数和脚注一起保存。

局限

  • BenchLM 的排名取决于其权重、cohort 和 BenchAlign 版本;分类排名与总分不是自然常数。

  • 绝大多数 Qwen 行的 Evidence 指向 Qwen 官方发布说明,BenchLM 并没有在该页面声明独立复跑;因此文档只能称为可核验聚合账本,不能冒充 independent re-run。

  • 页面显示的 best verified comparison 来自当前目录中的其他模型,随着新模型或来源加入,差距会变化。

  • 没有公开的一手 API 价格时,BenchLM 显示 N/A;本页面的总分不能代替成本、速度或上下文稳定性测试。

复现步骤

  1. 固定 2026-08-17 数据刷新点,保存 Qwen3.8 Max 模型页和 BenchLM 方法页。

  2. 将 52 条 source-displayable rows 导出为表格,保留 benchmark、score、weight、cohort、evidence 和原始 URL 五列。

  3. 对关键行回到 Qwen 官方页面,核对模型版本、harness、温度、重复次数、max tokens 和官方脚注。

  4. 用自己的真实任务集分别复跑 Coding、Agentic、Multimodal 和 HLE 风格任务,并把新结果另列为 independent reproduction,不覆盖 BenchLM 的聚合值。

来源摘录或观察(仅做合规短引)

BenchLM 对本页的证据约束是 “exact-source rows only”;这意味着它适合做来源账本,也意味着它不能被描述为一套全新独立跑分。

能支持的判断

  • 支持核对 exact-source benchmark 行和覆盖缺口。

不能支持的判断

  • 不支持把 BenchLM 聚合排名当作统一复跑或通用能力真值。

方法、局限和复现

本文中的数字、任务集、推理档位和客户端条件只在所列来源及采集时点内成立。不同版本、不同 harness 或不同提供商的数据不能直接并排比较;未公开的参数保持未知。

需要复测时,请固定模型版本、提供商或客户端、推理档位、工具、任务集版本、样本数和采集日期,并记录失败、重试与人工修正。完整方法和复现步骤见下方来源笔记。

原始来源

BenchLM · BenchLM 评测数据库团队 · 原文发布日期 2026-08-17 · 本站编辑日期 2026-09-20

打开原始来源

Qwen3.8 Max

在 Tabbit 中比较 Qwen3.8 Max

下载 Tabbit 客户端后检查模型可用性

模型深度阅读

总览 · 简体中文

Qwen3.8 Max:更新了什么、成本如何、适合谁

从 0902 快照、多模态边界、基准口径到获取路线,帮助你判断 Qwen3.8 Max 是否值得试用。

相关评测

Qwen3.8-Max:Artificial Analysis 独立指数的质量、成本、速度与冗长账本Artificial Analysis 将 Qwen3.8 Max 的质量、成本、速度和输出冗长分开展示;页面版本、推理档位、provider 和任务样本需重开,不能把聚合指数拼成跨版本趋势。Qwen3.8-Max:NYU 上海 RITS 对代理指数演化、轮次和幻觉成本的复核NYU Shanghai RITS 资料讨论 Qwen3.8 Max 的代理轮次、幻觉或成本代理指标;任务集、工具、重复次数和版本以公开部分为准,不能外推到所有 Agent 工作负载。Qwen3.8-Max:Legal Research Bench 的坚持度、全通过率与任务成本Vals AI 的线程把 Qwen3.8-Max 的提升解释为“更坚持”而不只是“更聪明”:Legal Research Bench 排名从第 22 升到第 4,单任务成本约为 $2.49,但每个任务的轮次、工具调用、来源数和耗时都明显增加。全通过率从 25.5% 升至 47.6%,比只看平均准确率更能体现长链路任务的变化。Qwen3.8-27B 本地量化模型:推理努力等级测试作者在四台机器上测试 Qwen3.8-27B:M5 Max 上的 MLX 4-bit,以及 DGX Spark 上通过 vLLM 运行的 unsloth/Qwen3.8-27B-NVFP4。他观察到从关闭思考到 effort=low 有明显跃升,但 4-bit 下 xhigh 可能因为长思考和量化误差出现极端耗时或截断。后续回复还给出 64K 预算、8-bit 复测和内存消耗等信息。Qwen3.8 Max:Qwen3.8-Max:推理努力、上下文保持与 Agent 接入提示词指南围绕“Qwen3.8-Max:推理努力、上下文保持与 Agent 接入提示词指南”整理任务边界、必需输入和运行环境;完整步骤、变量与限制见详情。Qwen3.8 Max:Qwen3.8-Max 生产路由:EvoLink 的提示词、思考流与工具调用指南围绕“Qwen3.8-Max 生产路由:EvoLink 的提示词、思考流与工具调用指南”整理任务边界、必需输入和运行环境;完整步骤、变量与限制见详情。Qwen3.8 Max:Qwen3.8-Max 多轮对话:从“后续提示失忆”反馈提炼上下文恢复提示词围绕“Qwen3.8-Max 多轮对话:从“后续提示失忆”反馈提炼上下文恢复提示词”整理任务边界、必需输入和运行环境;完整步骤、变量与限制见详情。Qwen3.8 Max:Qwen3.8-Max 角色扮演:方向遵循、推理时长与 preset 反馈围绕“Qwen3.8-Max 角色扮演:方向遵循、推理时长与 preset 反馈”整理任务边界、必需输入和运行环境;完整步骤、变量与限制见详情。