Tabbit
活动资源博客模型
Tabbit LogoTabbit

Tabbit — 为你工作的 AI 浏览器

主题资源

  • AI Browser Resources
  • Agentic Browser Resources
  • Browser Downloads and Install Guides
  • Browser Comparisons
  • AI Browser Alternatives
  • Browser Productivity Resources

热门指南

  • AI Browser
  • Agentic Browser Download
  • Best AI Browser 2026: Top 9 Tested & Ranked
  • AI Browser Download
  • Free AI Browser
  • Best AI Browser 2026
  • AI Browser Comparison 2026
  • AI Browser for Windows
  • AI Browser for Mac
  • Chrome Alternative 2026

活动

  • 别装了,你在《牛来》里早有原型
  • Tabbit 妙招大赛
  • KPOP SBTI 饭圈人格测试
  • Tabbit 校园共创者计划
  • fifi 的论文文献妙招精选
  • 用户问卷

关于

  • Tabbit 博客
  • 媒体报道
测评
媒体Qwen3.8 Max

Qwen3.8 Max:BenchLM 的来源可核验基准分类账本

原始来源

BenchLM

作者BenchLM 评测数据库团队

原文日期2026-08-17

Tabbit 整理2026-08-19

查看原文

一句话结论

BenchLM 将 Qwen3.8 Max 的 52 条来源可显示基准归一为 79.91/100、218 个模型中第 6,但分类账本同时显示它在 Reasoning、Agentic、Multimodal 和指令遵循上很强,而 AutomationBench、OSWorld 2.0、HLE 等项目仍有明显缺口;“第 6”不能替代分项任务选择。

适用场景

  • 适合的任务:按能力类别筛选模型、核对每个分数的来源、把 Qwen 与其他模型放在同一套可见证据账本里比较。

  • 不适合的任务:把 BenchLM 总分当作新实验,或把 provider exact 的官方分数当成 BenchLM 自己复跑的独立结果。

  • 适用的模型版本:Qwen3.8 Max(页面标注 2026-08-03 发布);数据冻结/刷新点为 2026-08-17。

  • 适用的客户端、Agent 或 API:BenchLM/BenchAlign 数据库;实际部署仍需回到 Qwen 官方 endpoint 和自己的 harness。

  • 推荐的推理档位和参数:BenchLM 页面不公开统一的 Qwen 调用参数;各 benchmark 的原始配置以其 Evidence 链接和 Qwen 官方脚注为准。

测试环境与工作流步骤

  1. BenchLM 方法页说明公共表默认只显示 exact-source rows,生成或推测的 benchmark value 不进入 evidence;模型页每行保留 score、weight、cohort 和 evidence state。

  2. 整体 Agentic/Coding 使用 BenchAlign v5.2 的冻结产物;其余类别仍是证据视图,直到各自验证完成。

  3. 打开模型页,先记录总分、排名、来源行数和类别分数,再展开 Coding、Agentic、Reasoning、Knowledge、Multimodal、Instruction Following 等分类。

  4. 点击每个 row 的 Evidence 原始链接,确认 Qwen 官方发布表、评测脚注、运行 harness 和日期;不能把 BenchLM 的聚合排名当作原始数据。

结果数据

类别总览

  • Overall:79.91/100,#6/218;52 条 source-displayable rows。

  • AgenticRank:79.2,#2/131,99th percentile,14 个 benchmark,权重 22%。

  • CodingRank:66.6,#11/135,93rd percentile,7 个 benchmark,权重 20%。

  • ReasoningRank:94.3,#1/2,100th percentile,2 个 benchmark,权重 17%。

  • Knowledge:66.5,未排名,4 个 benchmark,证据已验证。

  • Multimodal:88.1,#2/33,97th percentile,24 个 benchmark,权重 12%。

  • Instruction Following:97.9,#1/40,1 个 benchmark,权重 5%。

  • Math 与 Multilingual:页面标为未测量,不能从总分推断。

分项读数

  • Coding:SWE-bench Pro 67.7%(比页面最佳 verified row 低 12.6 个百分点);Terminal-Bench 2.1 为 86.6%;PaperBench 93.0% 为当前 verified row 最佳。

  • Agentic:OSWorld-Verified 86.1%、CoWorkBench 74.8%、WideResearch 81.9%、AndroidWorld 85.3%、MobileWorld 77.8% 均在页面中列为 Qwen 当前最佳 verified row;AutomationBench 27.3%,比 GLM-5.3 的 48.2% 低 20.9 个百分点;OSWorld 2.0 为 19.4%,比 Claude Opus 5 的 70.6% 低 51.2 个百分点。

  • Reasoning/Knowledge:LongBench v2 66.3%;MRCRv2 92.9%,距页面最佳 0.7 个百分点;HLE 43.6%,比 Claude Opus 5 的 64.7% 低 21.1 个百分点;GPQA 92.6%,比页面最佳低 2.9 个百分点。

  • Multimodal:MMMU-Pro 82.3%;OmniDocBench 1.5 为 92.1%;Video-MME(含字幕)90.4%;LVBench 81.8%,比 Gemini 3.7 Flash 的 85.4% 低 3.6 个百分点。

结论

BenchLM 的价值在于把“高分”拆成可点击的来源行:Qwen3.8 Max 的强项集中在长上下文、工具/桌面代理、多模态文档视频和指令遵循,但自动化边界任务、OSWorld 2.0 和专家知识考试不能被总分掩盖。选型时应根据业务任务取对应分项,并把 Qwen 官方分数的 harness、温度、重复次数和脚注一起保存。

局限

  • BenchLM 的排名取决于其权重、cohort 和 BenchAlign 版本;分类排名与总分不是自然常数。

  • 绝大多数 Qwen 行的 Evidence 指向 Qwen 官方发布说明,BenchLM 并没有在该页面声明独立复跑;因此文档只能称为可核验聚合账本,不能冒充 independent re-run。

  • 页面显示的 best verified comparison 来自当前目录中的其他模型,随着新模型或来源加入,差距会变化。

  • 没有公开的一手 API 价格时,BenchLM 显示 N/A;本页面的总分不能代替成本、速度或上下文稳定性测试。

复现步骤

  1. 固定 2026-08-17 数据刷新点,保存 Qwen3.8 Max 模型页和 BenchLM 方法页。

  2. 将 52 条 source-displayable rows 导出为表格,保留 benchmark、score、weight、cohort、evidence 和原始 URL 五列。

  3. 对关键行回到 Qwen 官方页面,核对模型版本、harness、温度、重复次数、max tokens 和官方脚注。

  4. 用自己的真实任务集分别复跑 Coding、Agentic、Multimodal 和 HLE 风格任务,并把新结果另列为 independent reproduction,不覆盖 BenchLM 的聚合值。

来源摘录或观察(仅做合规短引)

BenchLM 对本页的证据约束是 “exact-source rows only”;这意味着它适合做来源账本,也意味着它不能被描述为一套全新独立跑分。

Tabbit 小编提醒

本文是第三方资料导航。测试环境、模型版本和主观体验可能不同,请以原文为准。

Qwen3.8 Max

在 Tabbit 中使用并对比模型

Qwen3.8 Max

相关测评

媒体Qwen 官方博客2026-08-03

Qwen3.8-Max:官方发布说明与完整性能结果

媒体Artificial Analysis

Qwen3.8-Max:Artificial Analysis 独立指数的质量、成本、速度与冗长账本

媒体NYU Shanghai RITS

Qwen3.8-Max:NYU 上海 RITS 对代理指数演化、轮次和幻觉成本的复核

媒体Trilogy AI Center of Excellence(Substack)2026-07-19

Qwen3.8-Max Preview:Trilogy AI 的 StackPerf 代码库架构盲测

Qwen3.8 Max

相关提示词

媒体Qwen 官方博客《Qwen3.8-Max:编程与办公,全面跃升》2026-08-03

Qwen3.8-Max:推理努力、上下文保持与 Agent 接入提示词指南

媒体EvoLink.AI Blog2026-08-03

Qwen3.8-Max 生产路由:EvoLink 的提示词、思考流与工具调用指南

社区Reddit,r/QwenAI

Qwen Studio + MCP:让 Qwen3.8-Max 访问本地文件的提示词与权限边界

社区Reddit,r/QwenAI

Qwen3.8-Max 多轮对话:从“后续提示失忆”反馈提炼上下文恢复提示词