Tabbit
活动资源博客模型
Tabbit LogoTabbit

Tabbit — 为你工作的 AI 浏览器

主题资源

  • AI Browser Resources
  • Agentic Browser Resources
  • Browser Downloads and Install Guides
  • Browser Comparisons
  • AI Browser Alternatives
  • Browser Productivity Resources

热门指南

  • AI Browser
  • Agentic Browser Download
  • Best AI Browser 2026: Top 9 Tested & Ranked
  • AI Browser Download
  • Free AI Browser
  • Best AI Browser 2026
  • AI Browser Comparison 2026
  • AI Browser for Windows
  • AI Browser for Mac
  • Chrome Alternative 2026

活动

  • 别装了,你在《牛来》里早有原型
  • Tabbit 妙招大赛
  • KPOP SBTI 饭圈人格测试
  • Tabbit 校园共创者计划
  • fifi 的论文文献妙招精选
  • 用户问卷

关于

  • Tabbit 博客
  • 媒体报道
测评
媒体Qwen3.8 Max

Qwen3.8-Max:Artificial Analysis 独立指数的质量、成本、速度与冗长账本

原始来源

Artificial Analysis

作者Artificial Analysis 评测团队

Tabbit 整理2026-08-19

查看原文

一句话结论

Artificial Analysis 当前页面给 Qwen3.8 Max 的 Intelligence Index 评分为 58(同类 180 个模型中第 10),但同时记录了约 45 token/s 的低速度、150M 的指数评测总输出量和约 $1.13 的单任务成本,因此它更像“高质量但慢且很能思考”的 Agent 模型,而不是低延迟聊天模型。

适用场景

  • 适合的任务:需要工具调用、长链路交付、代码执行和较高完成质量的 Agent 任务;需要按任务成本而不是只按单价比较模型的选型。

  • 不适合的任务:强实时对话、短答案高吞吐服务,以及把文本英文综合指数直接当作多模态或中文业务质量的场景。

  • 适用的模型版本:Qwen3.8 Max 的 reasoning 版本;页面数据可能随供应商、评测版本和日期变化。

  • 适用的客户端、Agent 或 API:Artificial Analysis 的统一评测环境;不等于 Qwen Studio、DashScope 或第三方路由的实际延迟。

  • 推荐的推理档位和参数:未公开单模型可复制的完整 prompt;方法页对 reasoning 模型通常使用 temperature 0.6,并使用模型提供的最大输出上限。上线前应在自己的 Agent harness 中分别测低、中、高推理档位。

测试环境与工作流步骤

  1. Artificial Analysis Intelligence Index v4.1.1 包含 GDPval-AA v2、τ³-Banking、Terminal-Bench v2.1、SciCode、AA-LCR、AA-Omniscience、Humanity’s Last Exam、GPQA Diamond 和 CritPt,共 9 个评测。

  2. 指数按 Agents 34%、Coding 24%、Scientific Reasoning 24%、General 18% 加权;不同评测有不同重复次数和工具设置。

  3. 公开方法页给出的样例规模包括:GDPval-AA v2 为 220 个任务、1 次;τ³-Banking 为 97 个问题、5 次;Terminal-Bench v2.1 为 89 个任务、3 次;SciCode 为 288 个子问题、3 次;AA-LCR 为 100 个问题、3 次;AA-Omniscience 为 6,000 个问题、1 次;HLE 为 2,158 个问题、1 次;GPQA Diamond 为 198 个问题、5 次;CritPt 为 70 个问题、5 次。

  4. 方法页说明评测采用 zero-shot 指令、统一评分和 pass@1;GDPval-AA v2 使用 Stirrup harness、E2B sandbox、文件输出和网页/代码工具。

  5. 复核时同时打开模型页和 Artificial Analysis Intelligence Index 方法页,记录页面日期、评测版本、价格和模型端点;不要只截图一个总分。

原始证据与数据

  • 综合质量:58;页面模型摘要显示同类 180 个模型中第 10。

  • 成本:输入 $2.00 / 1M tokens,输出 $6.00 / 1M tokens,缓存折扣 88%;Artificial Analysis 页面显示 Intelligence Index 单任务成本约 $1.13,完整指数评测成本约 $1,741.41。

  • 速度:输出速度约 44.6 token/s,页面将其列为同类第 117/180;摘要将其归为 1/4 速度等级。

  • 输出量:指数评测累计生成约 150M tokens,页面将其归为同类第 70/180 的冗长度量,并明确提示该模型很 verbose。

  • 输入能力:支持 text、image、video 输入,text 输出;上下文窗口标为 1M tokens。

  • 方法边界:方法页称 Intelligence Index 是英文、纯文本评测;视觉、语音和多语言能力单独测量,不包含在该总分中。

结论

这个来源支持三个同时成立的判断:Qwen3.8-Max 的综合能力进入前列;其任务成本并非只由 $2/$6 的单价决定,而会被 reasoning 和输出量放大;在人工体验上,等待时间和答案长度可能比总分更先成为瓶颈。将它部署为高价值 Agent 的主模型时,应把“每个任务成功成本、完成时延、工具调用数、输出 token”作为同一张验收表,而不是只看 Intelligence Index。

局限

  • 页面是动态排行榜;排名、指数版本、供应商和价格可能变化,采集日数据不能代表永久排名。

  • Intelligence Index 是英文、文本为主的加权总分,不能直接代表图片、视频、中文或特定行业任务。

  • Artificial Analysis 的方法页公开了评测结构和参数,但单个任务的完整私有输入、运行轨迹和所有模型端点细节并不都在模型页展示;读者不能仅凭页面完全复刻 58 分。

  • 单任务成本含输入、缓存、reasoning 和答案 token 的加权计算;不能把它当作一次普通 API 请求的报价。

复现步骤

  1. 固定采集日期,并保存模型页的总分、排名、输入/输出价格、速度、上下文和输出量字段。

  2. 固定 Artificial Analysis Intelligence Index v4.1.1 及 9 项评测的权重,不把后续版本数据混入同一张表。

  3. 在自己的 Qwen3.8-Max endpoint 上建立一组相同任务的 zero-shot 回归集,至少记录成功率、首 token 延迟、总耗时、reasoning token、答案 token、工具调用数和每任务成本。

  4. 分别使用低/中/高 reasoning effort 重跑,比较“质量提升 ÷ 额外 token”和“成功任务成本”,不要据此宣称复现 Artificial Analysis 的绝对分数。

来源摘录或观察(仅做合规短引)

页面摘要把 Qwen3.8 Max 概括为 “notably slow and very verbose”;方法页同时说明 Intelligence Index 仅是综合比较指标,不能直接适用于每个使用场景。两点应一起引用。

Tabbit 小编提醒

本文是第三方资料导航。测试环境、模型版本和主观体验可能不同,请以原文为准。

Qwen3.8 Max

在 Tabbit 中使用并对比模型

Qwen3.8 Max

相关测评

媒体Qwen 官方博客2026-08-03

Qwen3.8-Max:官方发布说明与完整性能结果

媒体NYU Shanghai RITS

Qwen3.8-Max:NYU 上海 RITS 对代理指数演化、轮次和幻觉成本的复核

媒体Trilogy AI Center of Excellence(Substack)2026-07-19

Qwen3.8-Max Preview:Trilogy AI 的 StackPerf 代码库架构盲测

媒体BenchLM2026-08-17

Qwen3.8 Max:BenchLM 的来源可核验基准分类账本

Qwen3.8 Max

相关提示词

媒体Qwen 官方博客《Qwen3.8-Max:编程与办公,全面跃升》2026-08-03

Qwen3.8-Max:推理努力、上下文保持与 Agent 接入提示词指南

媒体EvoLink.AI Blog2026-08-03

Qwen3.8-Max 生产路由:EvoLink 的提示词、思考流与工具调用指南

社区Reddit,r/QwenAI

Qwen Studio + MCP:让 Qwen3.8-Max 访问本地文件的提示词与权限边界

社区Reddit,r/QwenAI

Qwen3.8-Max 多轮对话:从“后续提示失忆”反馈提炼上下文恢复提示词