Tabbit
活动资源博客模型
Tabbit LogoTabbit

Tabbit — 为你工作的 AI 浏览器

主题资源

  • AI Browser Resources
  • Agentic Browser Resources
  • Browser Downloads and Install Guides
  • Browser Comparisons
  • AI Browser Alternatives
  • Browser Productivity Resources

热门指南

  • AI Browser
  • Agentic Browser Download
  • Best AI Browser 2026: Top 9 Tested & Ranked
  • AI Browser Download
  • Free AI Browser
  • Best AI Browser 2026
  • AI Browser Comparison 2026
  • AI Browser for Windows
  • AI Browser for Mac
  • Chrome Alternative 2026

活动

  • 别装了,你在《牛来》里早有原型
  • Tabbit 妙招大赛
  • KPOP SBTI 饭圈人格测试
  • Tabbit 校园共创者计划
  • fifi 的论文文献妙招精选
  • 用户问卷

关于

  • Tabbit 博客
  • 媒体报道
简体中文
简体中文English
测评与证据

Qwen3.8 Max · 媒体来源 · 独立测量

Qwen3.8-Max:Artificial Analysis 独立指数的质量、成本、速度与冗长账本

Artificial Analysis 将 Qwen3.8 Max 的质量、成本、速度和输出冗长分开展示;页面版本、推理档位、provider 和任务样本需重开,不能把聚合指数拼成跨版本趋势。

待验证:本次未能重新核实原文。下方历史数字不代表已核实的当前结果。

媒体来源独立测量编辑日期 2026-09-20

测试条件速查

平台/版本
Artificial Analysis 指数页面;版本和窗口需重开
指标
质量、成本、速度、冗长维度分开解释
配置
provider、档位、样本和任务集未全部公开
边界
不把聚合指数拼成跨版本趋势

关键数据与适用场景

一句话结论

Artificial Analysis 当前页面给 Qwen3.8 Max 的 Intelligence Index 评分为 58(同类 180 个模型中第 10),但同时记录了约 45 token/s 的低速度、150M 的指数评测总输出量和约 $1.13 的单任务成本,因此它更像“高质量但慢且很能思考”的 Agent 模型,而不是低延迟聊天模型。

适用场景

  • 适合的任务:需要工具调用、长链路交付、代码执行和较高完成质量的 Agent 任务;需要按任务成本而不是只按单价比较模型的选型。

  • 不适合的任务:强实时对话、短答案高吞吐服务,以及把文本英文综合指数直接当作多模态或中文业务质量的场景。

  • 适用的模型版本:Qwen3.8 Max 的 reasoning 版本;页面数据可能随供应商、评测版本和日期变化。

  • 适用的客户端、Agent 或 API:Artificial Analysis 的统一评测环境;不等于 Qwen Studio、DashScope 或第三方路由的实际延迟。

  • 推荐的推理档位和参数:未公开单模型可复制的完整 prompt;方法页对 reasoning 模型通常使用 temperature 0.6,并使用模型提供的最大输出上限。上线前应在自己的 Agent harness 中分别测低、中、高推理档位。

测试环境与工作流步骤

  1. Artificial Analysis Intelligence Index v4.1.1 包含 GDPval-AA v2、τ³-Banking、Terminal-Bench v2.1、SciCode、AA-LCR、AA-Omniscience、Humanity’s Last Exam、GPQA Diamond 和 CritPt,共 9 个评测。

  2. 指数按 Agents 34%、Coding 24%、Scientific Reasoning 24%、General 18% 加权;不同评测有不同重复次数和工具设置。

  3. 公开方法页给出的样例规模包括:GDPval-AA v2 为 220 个任务、1 次;τ³-Banking 为 97 个问题、5 次;Terminal-Bench v2.1 为 89 个任务、3 次;SciCode 为 288 个子问题、3 次;AA-LCR 为 100 个问题、3 次;AA-Omniscience 为 6,000 个问题、1 次;HLE 为 2,158 个问题、1 次;GPQA Diamond 为 198 个问题、5 次;CritPt 为 70 个问题、5 次。

  4. 方法页说明评测采用 zero-shot 指令、统一评分和 pass@1;GDPval-AA v2 使用 Stirrup harness、E2B sandbox、文件输出和网页/代码工具。

  5. 复核时同时打开模型页和 Artificial Analysis Intelligence Index 方法页,记录页面日期、评测版本、价格和模型端点;不要只截图一个总分。

原始证据与数据

  • 综合质量:58;页面模型摘要显示同类 180 个模型中第 10。

  • 成本:输入 $2.00 / 1M tokens,输出 $6.00 / 1M tokens,缓存折扣 88%;Artificial Analysis 页面显示 Intelligence Index 单任务成本约 $1.13,完整指数评测成本约 $1,741.41。

  • 速度:输出速度约 44.6 token/s,页面将其列为同类第 117/180;摘要将其归为 1/4 速度等级。

  • 输出量:指数评测累计生成约 150M tokens,页面将其归为同类第 70/180 的冗长度量,并明确提示该模型很 verbose。

  • 输入能力:支持 text、image、video 输入,text 输出;上下文窗口标为 1M tokens。

  • 方法边界:方法页称 Intelligence Index 是英文、纯文本评测;视觉、语音和多语言能力单独测量,不包含在该总分中。

结论

这个来源支持三个同时成立的判断:Qwen3.8-Max 的综合能力进入前列;其任务成本并非只由 $2/$6 的单价决定,而会被 reasoning 和输出量放大;在人工体验上,等待时间和答案长度可能比总分更先成为瓶颈。将它部署为高价值 Agent 的主模型时,应把“每个任务成功成本、完成时延、工具调用数、输出 token”作为同一张验收表,而不是只看 Intelligence Index。

局限

  • 页面是动态排行榜;排名、指数版本、供应商和价格可能变化,采集日数据不能代表永久排名。

  • Intelligence Index 是英文、文本为主的加权总分,不能直接代表图片、视频、中文或特定行业任务。

  • Artificial Analysis 的方法页公开了评测结构和参数,但单个任务的完整私有输入、运行轨迹和所有模型端点细节并不都在模型页展示;读者不能仅凭页面完全复刻 58 分。

  • 单任务成本含输入、缓存、reasoning 和答案 token 的加权计算;不能把它当作一次普通 API 请求的报价。

复现步骤

  1. 固定采集日期,并保存模型页的总分、排名、输入/输出价格、速度、上下文和输出量字段。

  2. 固定 Artificial Analysis Intelligence Index v4.1.1 及 9 项评测的权重,不把后续版本数据混入同一张表。

  3. 在自己的 Qwen3.8-Max endpoint 上建立一组相同任务的 zero-shot 回归集,至少记录成功率、首 token 延迟、总耗时、reasoning token、答案 token、工具调用数和每任务成本。

  4. 分别使用低/中/高 reasoning effort 重跑,比较“质量提升 ÷ 额外 token”和“成功任务成本”,不要据此宣称复现 Artificial Analysis 的绝对分数。

来源摘录或观察(仅做合规短引)

页面摘要把 Qwen3.8 Max 概括为 “notably slow and very verbose”;方法页同时说明 Intelligence Index 仅是综合比较指标,不能直接适用于每个使用场景。两点应一起引用。

能支持的判断

  • 支持分开比较公开的质量、成本、速度和冗长维度。

不能支持的判断

  • 不支持将聚合指数解释为固定版本的生产质量或趋势。

方法、局限和复现

本文中的数字、任务集、推理档位和客户端条件只在所列来源及采集时点内成立。不同版本、不同 harness 或不同提供商的数据不能直接并排比较;未公开的参数保持未知。

需要复测时,请固定模型版本、提供商或客户端、推理档位、工具、任务集版本、样本数和采集日期,并记录失败、重试与人工修正。完整方法和复现步骤见下方来源笔记。

原始来源

Artificial Analysis · Artificial Analysis 评测团队 · 原文发布日期 Unknown · 本站编辑日期 2026-09-20

打开原始来源

Qwen3.8 Max

在 Tabbit 中比较 Qwen3.8 Max

下载 Tabbit 客户端后检查模型可用性

模型深度阅读

总览 · 简体中文

Qwen3.8 Max:更新了什么、成本如何、适合谁

从 0902 快照、多模态边界、基准口径到获取路线,帮助你判断 Qwen3.8 Max 是否值得试用。

相关评测

Qwen3.8-Max:NYU 上海 RITS 对代理指数演化、轮次和幻觉成本的复核NYU Shanghai RITS 资料讨论 Qwen3.8 Max 的代理轮次、幻觉或成本代理指标;任务集、工具、重复次数和版本以公开部分为准,不能外推到所有 Agent 工作负载。Qwen3.8-Max:Legal Research Bench 的坚持度、全通过率与任务成本Vals AI 的线程把 Qwen3.8-Max 的提升解释为“更坚持”而不只是“更聪明”:Legal Research Bench 排名从第 22 升到第 4,单任务成本约为 $2.49,但每个任务的轮次、工具调用、来源数和耗时都明显增加。全通过率从 25.5% 升至 47.6%,比只看平均准确率更能体现长链路任务的变化。Qwen3.8 Max:BenchLM 的来源可核验基准分类账本BenchLM 把 Qwen3.8 Max 的 exact-source benchmark 行与聚合排名分开;类别权重、provider、harness、样本和日期各异,因此这是可核验账本而非统一独立复跑。Qwen3.8-27B 本地量化模型:推理努力等级测试作者在四台机器上测试 Qwen3.8-27B:M5 Max 上的 MLX 4-bit,以及 DGX Spark 上通过 vLLM 运行的 unsloth/Qwen3.8-27B-NVFP4。他观察到从关闭思考到 effort=low 有明显跃升,但 4-bit 下 xhigh 可能因为长思考和量化误差出现极端耗时或截断。后续回复还给出 64K 预算、8-bit 复测和内存消耗等信息。Qwen3.8 Max:Qwen3.8-Max:推理努力、上下文保持与 Agent 接入提示词指南围绕“Qwen3.8-Max:推理努力、上下文保持与 Agent 接入提示词指南”整理任务边界、必需输入和运行环境;完整步骤、变量与限制见详情。Qwen3.8 Max:Qwen3.8-Max 生产路由:EvoLink 的提示词、思考流与工具调用指南围绕“Qwen3.8-Max 生产路由:EvoLink 的提示词、思考流与工具调用指南”整理任务边界、必需输入和运行环境;完整步骤、变量与限制见详情。Qwen3.8 Max:Qwen3.8-Max 多轮对话:从“后续提示失忆”反馈提炼上下文恢复提示词围绕“Qwen3.8-Max 多轮对话:从“后续提示失忆”反馈提炼上下文恢复提示词”整理任务边界、必需输入和运行环境;完整步骤、变量与限制见详情。Qwen3.8 Max:Qwen3.8-Max 角色扮演:方向遵循、推理时长与 preset 反馈围绕“Qwen3.8-Max 角色扮演:方向遵循、推理时长与 preset 反馈”整理任务边界、必需输入和运行环境;完整步骤、变量与限制见详情。