Tabbit
活动资源博客模型
Tabbit LogoTabbit

Tabbit — 为你工作的 AI 浏览器

主题资源

  • AI Browser Resources
  • Agentic Browser Resources
  • Browser Downloads and Install Guides
  • Browser Comparisons
  • AI Browser Alternatives
  • Browser Productivity Resources

热门指南

  • AI Browser
  • Agentic Browser Download
  • Best AI Browser 2026: Top 9 Tested & Ranked
  • AI Browser Download
  • Free AI Browser
  • Best AI Browser 2026
  • AI Browser Comparison 2026
  • AI Browser for Windows
  • AI Browser for Mac
  • Chrome Alternative 2026

活动

  • 别装了,你在《牛来》里早有原型
  • Tabbit 妙招大赛
  • KPOP SBTI 饭圈人格测试
  • Tabbit 校园共创者计划
  • fifi 的论文文献妙招精选
  • 用户问卷

关于

  • Tabbit 博客
  • 媒体报道
测评
媒体Qwen3.8 Max

Qwen3.8-Max:NYU 上海 RITS 对代理指数演化、轮次和幻觉成本的复核

原始来源

NYU Shanghai RITS

作者RITS 编辑团队(正文未单列个人作者;文末注明经工作人员审阅)

Tabbit 整理2026-08-19

查看原文

一句话结论

RITS 对 Artificial Analysis 快照的整理显示,Qwen3.8-Max 的代理能力接近顶级模型,但主要通过更长的 Agent 轨迹换取:GDPval-AA 每任务约 64 轮、成本约 $1.14,且 AA-LCR 与 AA-Omniscience 下降、观测幻觉率从 23% 上升到 40%。

适用场景

  • 适合的任务:可容忍较长运行时间、需要多轮工具调用和持续证据收集的研究、办公与代码 Agent;评估“完成质量是否值得额外轮次”的成本模型。

  • 不适合的任务:低延迟客服、固定 token 预算、对幻觉率有硬门槛的事实问答。

  • 适用的模型版本:Qwen3.8-Max GA 及其被 Artificial Analysis 评测的版本;文中混合了不同日期的 53/56/58 分快照,不能当成单一版本常数。

  • 适用的客户端、Agent 或 API:Artificial Analysis 的独立评测路径;原文未给出可直接复制的 Qwen API 配置。

  • 推荐的推理档位和参数:未公开;复现时需固定 endpoint、reasoning 设置、最大轮数和工具权限。

测试环境与工作流步骤

  1. RITS 汇总了 Artificial Analysis Intelligence Index v4.1 的公开快照,并区分完整指数与 Agentic Index;页面说明该指数包含 GDPval-AA、Terminal-Bench、τ³-Banking、HLE、SciCode、GPQA、CritPt、AA-LCR 和 AA-Omniscience 等评测。

  2. 重点任务是 GDPval-AA:来自 44 个职业的工作任务,允许 shell 和网页工具;文章给出模型的 Elo、每任务轮次和成本变化。

  3. 对比 Qwen3.7-Max、Qwen3.8-Max、Kimi K3、GPT-5.6 Sol Max 和 Claude Opus 5;文章同时提醒指数版本和端点问题会造成快照变化。

  4. 复核应把指数分数与任务轨迹分开记录:分数、轮次、成本、幻觉率和被扣分的评测不能压成一个“更聪明”的结论。

原始证据与数据

  • 指数演化:文章记录 Qwen3.8-Max 的 Artificial Analysis 总分曾从 53(因被测端点间歇性问题撤回)到 56,再修订为 58;因此发布时必须注明快照日期和指数版本。

  • GDPval-AA Elo:Qwen3.8-Max 为 1,739;Qwen3.7-Max 为 1,271,差值 468;GPT-5.6 Sol Max 为 1,730;Kimi K3 为 1,685;Claude Opus 5 为 1,852。

  • 轨迹长度:Qwen3.8-Max 每任务约 64 turns,Qwen3.7-Max 约 14 turns。

  • 成本:文章记录 Intelligence Index 单任务约 $1.14,Qwen3.7-Max 约 $0.53,Kimi K3 约 $0.86;Artificial Analysis 当前模型页约为 $1.13,属于同一量级但不是同一采集快照。

  • 退步信号:AA-LCR 下降 2 分;AA-Omniscience 下降 10 分;文中记录观测幻觉率由 23% 上升到 40%。

  • 代理指数位置:文章描述 Qwen3.8-Max 的 58 分与 Claude Opus 5 的 xhigh 档相当,比 Opus 5 max 低 1 分;这只是 Artificial Analysis 的特定指数,不是所有任务的通用排名。

结论

最可复用的判断不是“Qwen3.8-Max 已超过 Opus 5”,而是“它在代理任务上愿意持续工作更久,因而接近顶尖分数,同时承担更高的 token、延迟和幻觉风险”。适合采用预算守门:先设最大轮数、成本上限和事实核验,再让模型扩展搜索;当 AA-LCR/Omniscience 类可靠性比完成率更重要时,必须加第二模型或人工复核。

局限

  • 这是 RITS 对 Artificial Analysis 结果的二次整理,非 RITS 自己运行的完整基准;读者应回到 Artificial Analysis 模型页 与 方法页 核对。

  • 文中同时引用多个日期的指数快照;53、56、58 不能当作同一时间的可比值。

  • GDPval 的轮次、成本和幻觉率依赖具体 harness、端点和指数版本;不能直接外推到 Qwen Studio、OpenCode 或第三方 provider。

  • 文章没有公开完整输入 prompt、温度、最大 token、工具 schema 和每题原始输出,因此只能复核结论和指标定义,不能仅凭文章完全复跑。

复现步骤

  1. 记录 Artificial Analysis 当前的模型页、Agentic Index 页、指数版本和采集时间。

  2. 以固定 Qwen3.8-Max endpoint 重跑一个小型 GDPval 风格任务集,固定工具集、最大轮数、reasoning effort、温度和输出上限。

  3. 对每个任务记录成功/失败、轮数、工具调用、输入/输出/reasoning token、成本、事实错误和人工修正时间。

  4. 分别设置 14 轮与 64 轮上限,比较“额外轮次带来的通过率提升”是否值得成本;将结果标成自己的复现实验,不冒充 Artificial Analysis 原始分数。

来源摘录或观察(仅做合规短引)

文章把关键变化概括为 “buying capability with inference budget”;这句话对应其轮次、成本和幻觉率数据,不能脱离这些数字单独引用。

Tabbit 小编提醒

本文是第三方资料导航。测试环境、模型版本和主观体验可能不同,请以原文为准。

Qwen3.8 Max

在 Tabbit 中使用并对比模型

Qwen3.8 Max

相关测评

媒体Qwen 官方博客2026-08-03

Qwen3.8-Max:官方发布说明与完整性能结果

媒体Artificial Analysis

Qwen3.8-Max:Artificial Analysis 独立指数的质量、成本、速度与冗长账本

媒体Trilogy AI Center of Excellence(Substack)2026-07-19

Qwen3.8-Max Preview:Trilogy AI 的 StackPerf 代码库架构盲测

媒体BenchLM2026-08-17

Qwen3.8 Max:BenchLM 的来源可核验基准分类账本

Qwen3.8 Max

相关提示词

媒体Qwen 官方博客《Qwen3.8-Max:编程与办公,全面跃升》2026-08-03

Qwen3.8-Max:推理努力、上下文保持与 Agent 接入提示词指南

媒体EvoLink.AI Blog2026-08-03

Qwen3.8-Max 生产路由:EvoLink 的提示词、思考流与工具调用指南

社区Reddit,r/QwenAI

Qwen Studio + MCP:让 Qwen3.8-Max 访问本地文件的提示词与权限边界

社区Reddit,r/QwenAI

Qwen3.8-Max 多轮对话:从“后续提示失忆”反馈提炼上下文恢复提示词