RITS 对 Artificial Analysis 快照的整理显示,Qwen3.8-Max 的代理能力接近顶级模型,但主要通过更长的 Agent 轨迹换取:GDPval-AA 每任务约 64 轮、成本约 $1.14,且 AA-LCR 与 AA-Omniscience 下降、观测幻觉率从 23% 上升到 40%。
适合的任务:可容忍较长运行时间、需要多轮工具调用和持续证据收集的研究、办公与代码 Agent;评估“完成质量是否值得额外轮次”的成本模型。
不适合的任务:低延迟客服、固定 token 预算、对幻觉率有硬门槛的事实问答。
适用的模型版本:Qwen3.8-Max GA 及其被 Artificial Analysis 评测的版本;文中混合了不同日期的 53/56/58 分快照,不能当成单一版本常数。
适用的客户端、Agent 或 API:Artificial Analysis 的独立评测路径;原文未给出可直接复制的 Qwen API 配置。
推荐的推理档位和参数:未公开;复现时需固定 endpoint、reasoning 设置、最大轮数和工具权限。
RITS 汇总了 Artificial Analysis Intelligence Index v4.1 的公开快照,并区分完整指数与 Agentic Index;页面说明该指数包含 GDPval-AA、Terminal-Bench、τ³-Banking、HLE、SciCode、GPQA、CritPt、AA-LCR 和 AA-Omniscience 等评测。
重点任务是 GDPval-AA:来自 44 个职业的工作任务,允许 shell 和网页工具;文章给出模型的 Elo、每任务轮次和成本变化。
对比 Qwen3.7-Max、Qwen3.8-Max、Kimi K3、GPT-5.6 Sol Max 和 Claude Opus 5;文章同时提醒指数版本和端点问题会造成快照变化。
复核应把指数分数与任务轨迹分开记录:分数、轮次、成本、幻觉率和被扣分的评测不能压成一个“更聪明”的结论。
指数演化:文章记录 Qwen3.8-Max 的 Artificial Analysis 总分曾从 53(因被测端点间歇性问题撤回)到 56,再修订为 58;因此发布时必须注明快照日期和指数版本。
GDPval-AA Elo:Qwen3.8-Max 为 1,739;Qwen3.7-Max 为 1,271,差值 468;GPT-5.6 Sol Max 为 1,730;Kimi K3 为 1,685;Claude Opus 5 为 1,852。
轨迹长度:Qwen3.8-Max 每任务约 64 turns,Qwen3.7-Max 约 14 turns。
成本:文章记录 Intelligence Index 单任务约 $1.14,Qwen3.7-Max 约 $0.53,Kimi K3 约 $0.86;Artificial Analysis 当前模型页约为 $1.13,属于同一量级但不是同一采集快照。
退步信号:AA-LCR 下降 2 分;AA-Omniscience 下降 10 分;文中记录观测幻觉率由 23% 上升到 40%。
代理指数位置:文章描述 Qwen3.8-Max 的 58 分与 Claude Opus 5 的 xhigh 档相当,比 Opus 5 max 低 1 分;这只是 Artificial Analysis 的特定指数,不是所有任务的通用排名。
最可复用的判断不是“Qwen3.8-Max 已超过 Opus 5”,而是“它在代理任务上愿意持续工作更久,因而接近顶尖分数,同时承担更高的 token、延迟和幻觉风险”。适合采用预算守门:先设最大轮数、成本上限和事实核验,再让模型扩展搜索;当 AA-LCR/Omniscience 类可靠性比完成率更重要时,必须加第二模型或人工复核。
这是 RITS 对 Artificial Analysis 结果的二次整理,非 RITS 自己运行的完整基准;读者应回到 Artificial Analysis 模型页 与 方法页 核对。
文中同时引用多个日期的指数快照;53、56、58 不能当作同一时间的可比值。
GDPval 的轮次、成本和幻觉率依赖具体 harness、端点和指数版本;不能直接外推到 Qwen Studio、OpenCode 或第三方 provider。
文章没有公开完整输入 prompt、温度、最大 token、工具 schema 和每题原始输出,因此只能复核结论和指标定义,不能仅凭文章完全复跑。
记录 Artificial Analysis 当前的模型页、Agentic Index 页、指数版本和采集时间。
以固定 Qwen3.8-Max endpoint 重跑一个小型 GDPval 风格任务集,固定工具集、最大轮数、reasoning effort、温度和输出上限。
对每个任务记录成功/失败、轮数、工具调用、输入/输出/reasoning token、成本、事实错误和人工修正时间。
分别设置 14 轮与 64 轮上限,比较“额外轮次带来的通过率提升”是否值得成本;将结果标成自己的复现实验,不冒充 Artificial Analysis 原始分数。
文章把关键变化概括为 “buying capability with inference budget”;这句话对应其轮次、成本和幻觉率数据,不能脱离这些数字单独引用。
Qwen3.8 Max