Artificial Analysis 当前页面给 Qwen3.8 Max 的 Intelligence Index 评分为 58(同类 180 个模型中第 10),但同时记录了约 45 token/s 的低速度、150M 的指数评测总输出量和约 $1.13 的单任务成本,因此它更像“高质量但慢且很能思考”的 Agent 模型,而不是低延迟聊天模型。
适合的任务:需要工具调用、长链路交付、代码执行和较高完成质量的 Agent 任务;需要按任务成本而不是只按单价比较模型的选型。
不适合的任务:强实时对话、短答案高吞吐服务,以及把文本英文综合指数直接当作多模态或中文业务质量的场景。
适用的模型版本:Qwen3.8 Max 的 reasoning 版本;页面数据可能随供应商、评测版本和日期变化。
适用的客户端、Agent 或 API:Artificial Analysis 的统一评测环境;不等于 Qwen Studio、DashScope 或第三方路由的实际延迟。
推荐的推理档位和参数:未公开单模型可复制的完整 prompt;方法页对 reasoning 模型通常使用 temperature 0.6,并使用模型提供的最大输出上限。上线前应在自己的 Agent harness 中分别测低、中、高推理档位。
Artificial Analysis Intelligence Index v4.1.1 包含 GDPval-AA v2、τ³-Banking、Terminal-Bench v2.1、SciCode、AA-LCR、AA-Omniscience、Humanity’s Last Exam、GPQA Diamond 和 CritPt,共 9 个评测。
指数按 Agents 34%、Coding 24%、Scientific Reasoning 24%、General 18% 加权;不同评测有不同重复次数和工具设置。
公开方法页给出的样例规模包括:GDPval-AA v2 为 220 个任务、1 次;τ³-Banking 为 97 个问题、5 次;Terminal-Bench v2.1 为 89 个任务、3 次;SciCode 为 288 个子问题、3 次;AA-LCR 为 100 个问题、3 次;AA-Omniscience 为 6,000 个问题、1 次;HLE 为 2,158 个问题、1 次;GPQA Diamond 为 198 个问题、5 次;CritPt 为 70 个问题、5 次。
方法页说明评测采用 zero-shot 指令、统一评分和 pass@1;GDPval-AA v2 使用 Stirrup harness、E2B sandbox、文件输出和网页/代码工具。
复核时同时打开模型页和 Artificial Analysis Intelligence Index 方法页,记录页面日期、评测版本、价格和模型端点;不要只截图一个总分。
综合质量:58;页面模型摘要显示同类 180 个模型中第 10。
成本:输入 $2.00 / 1M tokens,输出 $6.00 / 1M tokens,缓存折扣 88%;Artificial Analysis 页面显示 Intelligence Index 单任务成本约 $1.13,完整指数评测成本约 $1,741.41。
速度:输出速度约 44.6 token/s,页面将其列为同类第 117/180;摘要将其归为 1/4 速度等级。
输出量:指数评测累计生成约 150M tokens,页面将其归为同类第 70/180 的冗长度量,并明确提示该模型很 verbose。
输入能力:支持 text、image、video 输入,text 输出;上下文窗口标为 1M tokens。
方法边界:方法页称 Intelligence Index 是英文、纯文本评测;视觉、语音和多语言能力单独测量,不包含在该总分中。
这个来源支持三个同时成立的判断:Qwen3.8-Max 的综合能力进入前列;其任务成本并非只由 $2/$6 的单价决定,而会被 reasoning 和输出量放大;在人工体验上,等待时间和答案长度可能比总分更先成为瓶颈。将它部署为高价值 Agent 的主模型时,应把“每个任务成功成本、完成时延、工具调用数、输出 token”作为同一张验收表,而不是只看 Intelligence Index。
页面是动态排行榜;排名、指数版本、供应商和价格可能变化,采集日数据不能代表永久排名。
Intelligence Index 是英文、文本为主的加权总分,不能直接代表图片、视频、中文或特定行业任务。
Artificial Analysis 的方法页公开了评测结构和参数,但单个任务的完整私有输入、运行轨迹和所有模型端点细节并不都在模型页展示;读者不能仅凭页面完全复刻 58 分。
单任务成本含输入、缓存、reasoning 和答案 token 的加权计算;不能把它当作一次普通 API 请求的报价。
固定采集日期,并保存模型页的总分、排名、输入/输出价格、速度、上下文和输出量字段。
固定 Artificial Analysis Intelligence Index v4.1.1 及 9 项评测的权重,不把后续版本数据混入同一张表。
在自己的 Qwen3.8-Max endpoint 上建立一组相同任务的 zero-shot 回归集,至少记录成功率、首 token 延迟、总耗时、reasoning token、答案 token、工具调用数和每任务成本。
分别使用低/中/高 reasoning effort 重跑,比较“质量提升 ÷ 额外 token”和“成功任务成本”,不要据此宣称复现 Artificial Analysis 的绝对分数。
页面摘要把 Qwen3.8 Max 概括为 “notably slow and very verbose”;方法页同时说明 Intelligence Index 仅是综合比较指标,不能直接适用于每个使用场景。两点应一起引用。
Qwen3.8 Max