Artificial Analysis 在 Reasoning, Max Effort 档位下给 DeepSeek V4.1 Flash 的 Artificial Analysis Intelligence Index 约 40 分;它在 Agent、长上下文和成本上有吸引力,但输出非常冗长,且 AA-Omniscience 的非幻觉率只有 4%,因此“便宜”不能直接等同于可靠。
适合判断的任务:固定 AA 测试口径下的模型横向比较;Agent 工作流、长上下文任务、SaaS 操作和成本敏感型 API 选型。
不适合外推的任务:把 AA 分数当作普通聊天、生产业务或所有推理任务的统一能力;把一次任务成本外推到不同输入长度、缓存命中率、输出长度或非高峰价格。
适用的模型版本:DeepSeek V4.1 Flash;辅助页对应 DeepSeek V4.1 Flash (Reasoning, Max Effort),页面标记为开放权重模型,1M token 上下文。
测试环境或客户端:Artificial Analysis 独立评测;辅助页称测量在专用硬件上完成。具体硬件、提示词、样本数、重复次数、温度和工具配置未注明。
推理档位和参数:Reasoning, Max Effort(页面短名 max)。主帖记录官方 API 价格:输入 $0.30/1M tokens、输出 $1.20/1M tokens、缓存输入 $0.006/1M tokens(98% 折扣);非高峰期再打 50% 折扣。线程没有给出温度、top_p、最大输出或工具参数。
辅助来源:AA 模型页、同作者的任务成本说明与AA-Omniscience 结果。这些是同一组测评的补充,不另计独立资料。
主帖把 DeepSeek V4.1 Flash 与 DeepSeek V4 Pro 0813、V4 Flash 0731 及其他模型放在 Artificial Analysis 的独立指标中比较,使用的指标包括 Intelligence Index、GDPval-AA v2、AA-LCR v1.1、AutomationBench-AA、Terminal-Bench v4.0、Token Use、Cost per Task 和 AA-Omniscience。辅助模型页在 2026-09-16 的页面快照中显示,当前 Artificial Analysis Intelligence Index 为 v4.3,由 10 项评估组成:AA-Briefcase、GDPval-AA v2、AutomationBench-AA、Terminal-Bench 4.0、SciCode、Humanity's Last Exam、GDP.pdf、CritPt、AA-Omniscience 和 AA-LCR v1.1。
辅助页将该模型显示为 Reasoning, Max Effort,并称评测结果由 Artificial Analysis 独立测量。页面未公开完整题目、提示词、采样重复次数、置信区间和每项评估的详细 harness,因此下列结果适合当作该口径下的快照,不足以独立重建整套实验。
总指标:AI Index 显示分数 40;辅助页保留的精确值为 39.5454,排名 #6/113。主帖称它超过 DeepSeek V4 Pro 0813(1.6T),但因冗长性略低于 Intelligence vs. Cost Pareto frontier。
Agent 与长上下文:Terminal-Bench v4.0 27%;GDPval-AA v2 从 1468 升到 1632 Elo;AA-LCR v1.1 84%,与 GPT-5.6 Sol 和 Gemini 3.8 Flash 同为 84%。AutomationBench-AA 69%,与 GPT-6 Astra 持平,高于 Grok 4.6 的 67%、V4 Flash 0731 的 54%、V4 Pro 0813 的 57% 和 GLM-5.3 的 62%。该指标覆盖 657 个任务、39 个 SaaS 应用,按是否完成目标且未触发防护栏评分。
成本与冗长性:每个 Intelligence Index 任务约 89k tokens,任务成本 $0.27。主帖称该成本约为 GLM-5.3($2.01)和 Kimi K3($2.00)的七分之一、V4 Pro 0813($0.67)的约 2.5 分之一。辅助页的精确任务成本为 $0.2652,输出速度 209.8 tokens/s(页面四舍五入为 210),评测累计使用 250M tokens,运行整套 Intelligence Index 的成本为 $476.89。
幻觉边界:同作者后续帖子称 AA-Omniscience 指标“提升 9 点至 -5.3”,准确率从 40% 升至 46%,但非幻觉率从 8% 降至 4%。辅助页解释该指数范围为 -100 到 100,0 表示正确与错误数量相当,负数表示错误多于正确;因此 -5.3 不能解读为可靠性已经为正。
| 项目 | 原始数字或表述 |
|---|---|
| Artificial Analysis Intelligence Index | 40(辅助页精确值 39.5454) |
| GDPval-AA v2 | 1468 → 1632 Elo,+164 Elo |
| AA-LCR v1.1 | 84% |
| AutomationBench-AA | 69%;GPT-6 Astra 69%、Grok 4.6 67% |
| Terminal-Bench v4.0 | 27%;主帖同时写 V4.0 Flash 27%,并称“more than double”,两者表述不一致 |
| Intelligence Index Token Use | 每任务 89k tokens |
| Cost per Intelligence Index task | $0.27 |
| API 价格 | 输入 $0.30、输出 $1.20、缓存输入 $0.006 / 1M tokens;缓存折扣 98% |
| 上下文窗口 | 1M tokens |
| AA-Omniscience | 指数 -5.3;准确率 40% → 46%;非幻觉率 8% → 4% |
| 指标 | 页面值 |
|---|---|
| 模型显示档位 | Reasoning, Max Effort / max |
| Artificial Analysis Intelligence Index | 40;精确值 39.5454;#6/113 |
| Speed | 209.8 output tokens/s;#4/113 |
| Cost | 输入 $0.30、输出 $1.20、缓存折扣 98%;$0.27/任务;#19/113 |
| Verbosity | 250M output tokens from Intelligence Index;#37/113 |
| Index 版本 | v4.3,10 项评估 |
| Context window | 1M tokens |
| Total / active parameters | 页面为 552B / 16B |
AA-Omniscience 的 Non-Hallucination Rate 与整体 Accuracy 是不同指标;4% 不能解释为模型所有回答只有 4% 正确,也不能替代该页同时报告的 46% 准确率。
成本优势来自价格与缓存口径,不是低输出量。 主帖明确把每任务 $0.27 与 89k tokens 的冗长性同时报告;因此预算应按实际输出长度、缓存命中率和是否非高峰计价计算。
Agent 成绩不能替代可靠性评估。 AutomationBench-AA 的 69% 表明在该 657 任务、39 应用集合中有较强表现,但 AA-Omniscience 的指数仍为 -5.3,非幻觉率为 4%;涉及事实核验或高风险决策时需要额外验证、拒答和引用检查。
版本和档位决定可比性。 本文快照对应辅助页的 Reasoning, Max Effort 和 AI Index v4.3;若页面更新指标组成或改用其他推理档位,不能直接与本记录的 40 分、$0.27 或 -5.3 混用。
主帖存在需要保留的内部矛盾。 开头称模型为 552B,后文模型细节又写“763B total parameters”;辅助页当前写 552B total、16B active。另有 Terminal-Bench 对照中“27% 且 more than double 27%”的冲突。本文保留原文,不据此擅自修正。
不能把公开摘要当成完整复现实验。 来源未注明完整任务样本、提示词、采样参数、重复次数、置信区间、硬件细节和失败样本;分数应视为 AA 口径的独立测评快照。
记录模型标识 DeepSeek V4.1 Flash、推理档位 Reasoning, Max Effort、AI Index 版本 v4.3、采集日期和页面版本;不要把普通或低推理档位结果混入比较。
对照 AA 公布的价格口径分别计算输入、输出和缓存输入成本,并单独标记非高峰 50% 折扣;保留每个任务的输入 token、输出 token、缓存命中情况和实际费用。
Agent 复测至少固定 AutomationBench-AA 的任务集合、SaaS 工具权限、防护栏规则和完成判定;Terminal-Bench 复测需补齐版本、环境、工具、网络和样本设置。
可靠性复测同时报告 AA-Omniscience Index、Accuracy 和 Non-Hallucination Rate,不能只报告 Intelligence Index;保存错误、幻觉和拒答样本,避免由单一均值推导生产可靠性。
若要复核主帖,必须查看 X 的英文原文;页面自动翻译会把 ~4x less per token 错译成“约 4 倍”,正确含义是“每 token 约便宜 4 倍”。
DeepSeek V4.1 Flash