Arena.ai 报告 DeepSeek-V4.1-Flash(Max)相对 Arena 基线净改进 +4.87%;正文写每个中位任务 $0.07,明细表写 $0.06,因此成本应按“原帖存在金额不一致”记录,不能把两者合并成一个无条件确定值。
适合判断的任务:真实 Agent Mode 任务中的工具编排、任务完成和可控性,以及成本与净改进的取舍。
不适合外推的任务:普通聊天、单项知识问答、独立代码题、视觉任务或其他未进入 Agent Arena 的任务;也不能据此推断所有调用的单次成本。
适用的模型版本:DeepSeek-V4.1-Flash(Max);原帖没有给出 API ID,不能仅凭此文把历史模型标签改写为其他版本。
测试环境或客户端:Agent Arena 的 Agent Mode;榜单页面说明数据来自真实 Agent Mode tasks。
推理档位和参数:DeepSeek 使用 Max;对比项包含 Max、High、xHigh。温度、上下文、工具配置和其他参数未注明。
原帖以 Agent Arena 的 Pareto frontier 和相对 Arena baseline 的净改进为依据,报告模型的净改进百分比与每任务中位成本。原帖没有公开任务样本量、任务提示词、工具集合、运行次数、聚合公式或误差范围。
帖内链接的 Agent Arena 页面(采集日 2026-09-16)将图表定义为“Net Improvement × Cost/task from real Agent Mode tasks”,成本统计选择 50th percentile,并标注为“Median cost per task (last 14 days)”。页面当日显示 1,850,083 sessions、46 models,说明这是动态榜单快照;它显示 Deepseek V4.1 Flash(Max)为 +4.88%、$0.06/task,与前一日 X 帖子的 +4.87% 存在正常的快照变化。
原帖未定义 Arena baseline 的具体分数、样本或计算方式;页面只概括其信号包括工具可靠性、任务完成和可控性。因此“净改进”只能理解为 Arena 内部相对基线的榜单指标,不能当作通用准确率或胜率。
原帖称 DeepSeek-V4.1-Flash(Max)在前三个开源模型中具有最低的每任务中位成本。
相对 Hy4 preview:保留其净改进的 98%,成本低 73%。
相对 Kimi K3(Max):保留其性能的 76%,成本低 92%。
相对 Fable 5 或更强模型:保留其净改进的 35–54%,成本低 97–99%;这些模型的每任务成本高 37–76 倍。
原帖还称本次发布后,GPT-5.6 Luna(xHigh)、GLM-5.3-Flash 和 DeepSeek-V4-Flash 脱离 Agent Arena Pareto frontier。这是榜单边界变化,不等于这些模型在所有任务上的能力下降。
原帖明细标题为“Net improvement over Arena baseline | Median cost/task”。以下保留原帖数字;成本金额的不一致见“适用边界”。
| 模型 | 推理档位 | 净改进 | 中位成本/任务 |
|---|---|---|---|
| Claude Fable 5.1 | Max | +13.90% | $4.54 |
| GPT 6 Astra | Max | +11.90% | $4.09 |
| Claude Opus 5 | Max | +11.09% | $3.52 |
| Claude Opus 5 | High | +10.49% | $2.24 |
| Claude Fable 5 | High | +9.03% | $2.19 |
| Claude Opus 4.8 | High | +7.75% | $1.36 |
| GPT 5.6 Sol | xHigh | +7.40% | $1.09 |
| Kimi K3 | Max | +6.39% | $0.77 |
| Hy4 preview | 未注明 | +4.96% | $0.22 |
| DeepSeek-V4.1-Flash | Max | +4.87% | $0.06 |
金额关系是原帖的四舍五入后表达。例如按表中 $0.06 计算,$0.06/$0.22≈27%,即相对 Hy4 成本降低约 73%;$0.06/$0.77≈8%,即相对 Kimi K3 成本降低约 92%。
这条资料支持的结论是:在 Arena 的真实 Agent Mode 任务、近 14 日中位成本口径下,DeepSeek-V4.1-Flash(Max)以约 $0.06–$0.07/任务 达到 +4.87% 净改进,并处于成本效率 Pareto frontier。它适合用于 Agent 模型选型中的成本性能比较。
边界包括:
正文的 $0.07 与明细表的 $0.06 不一致;原帖没有解释是四舍五入、不同统计时点还是展示错误。
原帖没有公开 Arena baseline、任务样本、任务分布、工具配置、成本构成、置信区间和显著性检验。
Agent Arena 榜单是动态快照;次日页面已显示 +4.88% 和 $0.06/task,不能把榜单数值视为永久固定结果。
“净改进”不是通用准确率;“成本降低”只适用于同一榜单的中位任务成本口径。
在 Tabbit 中打开原帖,点击“显示原文”读取英文内容,避免自动翻译造成倍数方向错误。随后在同一帖内打开其指向的 Agent Arena Pareto 页面,核对 50th percentile、last 14 days 和动态快照日期。由于原帖未提供任务集、提示词、工具和参数,无法独立复现 +4.87% 的净改进,只能复核页面公开的榜单快照。
DeepSeek V4.1 Flash