Tabbit
活动资源博客模型
Tabbit LogoTabbit

Tabbit — 为你工作的 AI 浏览器

主题资源

  • AI Browser Resources
  • Agentic Browser Resources
  • Browser Downloads and Install Guides
  • Browser Comparisons
  • AI Browser Alternatives
  • Browser Productivity Resources

热门指南

  • AI Browser
  • Agentic Browser Download
  • Best AI Browser 2026: Top 9 Tested & Ranked
  • AI Browser Download
  • Free AI Browser
  • Best AI Browser 2026
  • AI Browser Comparison 2026
  • AI Browser for Windows
  • AI Browser for Mac
  • Chrome Alternative 2026

活动

  • 别装了,你在《牛来》里早有原型
  • Tabbit 妙招大赛
  • KPOP SBTI 饭圈人格测试
  • Tabbit 校园共创者计划
  • fifi 的论文文献妙招精选
  • 用户问卷

关于

  • Tabbit 博客
  • 媒体报道
测评
社区DeepSeek V4.1 Flash

Artificial Analysis:DeepSeek V4.1 Flash 的智能、成本与幻觉边界

原始来源

X(Artificial Analysis)

作者Artificial Analysis(@ArtificialAnlys)

原文日期2026-09-11

Tabbit 整理2026-09-16

查看原文

一句话结论

Artificial Analysis 在 Reasoning, Max Effort 档位下给 DeepSeek V4.1 Flash 的 Artificial Analysis Intelligence Index 约 40 分;它在 Agent、长上下文和成本上有吸引力,但输出非常冗长,且 AA-Omniscience 的非幻觉率只有 4%,因此“便宜”不能直接等同于可靠。

适用场景

  • 适合判断的任务:固定 AA 测试口径下的模型横向比较;Agent 工作流、长上下文任务、SaaS 操作和成本敏感型 API 选型。

  • 不适合外推的任务:把 AA 分数当作普通聊天、生产业务或所有推理任务的统一能力;把一次任务成本外推到不同输入长度、缓存命中率、输出长度或非高峰价格。

  • 适用的模型版本:DeepSeek V4.1 Flash;辅助页对应 DeepSeek V4.1 Flash (Reasoning, Max Effort),页面标记为开放权重模型,1M token 上下文。

  • 测试环境或客户端:Artificial Analysis 独立评测;辅助页称测量在专用硬件上完成。具体硬件、提示词、样本数、重复次数、温度和工具配置未注明。

  • 推理档位和参数:Reasoning, Max Effort(页面短名 max)。主帖记录官方 API 价格:输入 $0.30/1M tokens、输出 $1.20/1M tokens、缓存输入 $0.006/1M tokens(98% 折扣);非高峰期再打 50% 折扣。线程没有给出温度、top_p、最大输出或工具参数。

测评方法

辅助来源:AA 模型页、同作者的任务成本说明与AA-Omniscience 结果。这些是同一组测评的补充,不另计独立资料。

主帖把 DeepSeek V4.1 Flash 与 DeepSeek V4 Pro 0813、V4 Flash 0731 及其他模型放在 Artificial Analysis 的独立指标中比较,使用的指标包括 Intelligence Index、GDPval-AA v2、AA-LCR v1.1、AutomationBench-AA、Terminal-Bench v4.0、Token Use、Cost per Task 和 AA-Omniscience。辅助模型页在 2026-09-16 的页面快照中显示,当前 Artificial Analysis Intelligence Index 为 v4.3,由 10 项评估组成:AA-Briefcase、GDPval-AA v2、AutomationBench-AA、Terminal-Bench 4.0、SciCode、Humanity's Last Exam、GDP.pdf、CritPt、AA-Omniscience 和 AA-LCR v1.1。

辅助页将该模型显示为 Reasoning, Max Effort,并称评测结果由 Artificial Analysis 独立测量。页面未公开完整题目、提示词、采样重复次数、置信区间和每项评估的详细 harness,因此下列结果适合当作该口径下的快照,不足以独立重建整套实验。

关键结果

  • 总指标:AI Index 显示分数 40;辅助页保留的精确值为 39.5454,排名 #6/113。主帖称它超过 DeepSeek V4 Pro 0813(1.6T),但因冗长性略低于 Intelligence vs. Cost Pareto frontier。

  • Agent 与长上下文:Terminal-Bench v4.0 27%;GDPval-AA v2 从 1468 升到 1632 Elo;AA-LCR v1.1 84%,与 GPT-5.6 Sol 和 Gemini 3.8 Flash 同为 84%。AutomationBench-AA 69%,与 GPT-6 Astra 持平,高于 Grok 4.6 的 67%、V4 Flash 0731 的 54%、V4 Pro 0813 的 57% 和 GLM-5.3 的 62%。该指标覆盖 657 个任务、39 个 SaaS 应用,按是否完成目标且未触发防护栏评分。

  • 成本与冗长性:每个 Intelligence Index 任务约 89k tokens,任务成本 $0.27。主帖称该成本约为 GLM-5.3($2.01)和 Kimi K3($2.00)的七分之一、V4 Pro 0813($0.67)的约 2.5 分之一。辅助页的精确任务成本为 $0.2652,输出速度 209.8 tokens/s(页面四舍五入为 210),评测累计使用 250M tokens,运行整套 Intelligence Index 的成本为 $476.89。

  • 幻觉边界:同作者后续帖子称 AA-Omniscience 指标“提升 9 点至 -5.3”,准确率从 40% 升至 46%,但非幻觉率从 8% 降至 4%。辅助页解释该指数范围为 -100 到 100,0 表示正确与错误数量相当,负数表示错误多于正确;因此 -5.3 不能解读为可靠性已经为正。

原始数据

主帖及线程(英文原文核对)

项目原始数字或表述
Artificial Analysis Intelligence Index40(辅助页精确值 39.5454)
GDPval-AA v21468 → 1632 Elo,+164 Elo
AA-LCR v1.184%
AutomationBench-AA69%;GPT-6 Astra 69%、Grok 4.6 67%
Terminal-Bench v4.027%;主帖同时写 V4.0 Flash 27%,并称“more than double”,两者表述不一致
Intelligence Index Token Use每任务 89k tokens
Cost per Intelligence Index task$0.27
API 价格输入 $0.30、输出 $1.20、缓存输入 $0.006 / 1M tokens;缓存折扣 98%
上下文窗口1M tokens
AA-Omniscience指数 -5.3;准确率 40% → 46%;非幻觉率 8% → 4%

辅助模型页快照(2026-09-16)

指标页面值
模型显示档位Reasoning, Max Effort / max
Artificial Analysis Intelligence Index40;精确值 39.5454;#6/113
Speed209.8 output tokens/s;#4/113
Cost输入 $0.30、输出 $1.20、缓存折扣 98%;$0.27/任务;#19/113
Verbosity250M output tokens from Intelligence Index;#37/113
Index 版本v4.3,10 项评估
Context window1M tokens
Total / active parameters页面为 552B / 16B

结论与边界

AA-Omniscience 的 Non-Hallucination Rate 与整体 Accuracy 是不同指标;4% 不能解释为模型所有回答只有 4% 正确,也不能替代该页同时报告的 46% 准确率。

  1. 成本优势来自价格与缓存口径,不是低输出量。 主帖明确把每任务 $0.27 与 89k tokens 的冗长性同时报告;因此预算应按实际输出长度、缓存命中率和是否非高峰计价计算。

  2. Agent 成绩不能替代可靠性评估。 AutomationBench-AA 的 69% 表明在该 657 任务、39 应用集合中有较强表现,但 AA-Omniscience 的指数仍为 -5.3,非幻觉率为 4%;涉及事实核验或高风险决策时需要额外验证、拒答和引用检查。

  3. 版本和档位决定可比性。 本文快照对应辅助页的 Reasoning, Max Effort 和 AI Index v4.3;若页面更新指标组成或改用其他推理档位,不能直接与本记录的 40 分、$0.27 或 -5.3 混用。

  4. 主帖存在需要保留的内部矛盾。 开头称模型为 552B,后文模型细节又写“763B total parameters”;辅助页当前写 552B total、16B active。另有 Terminal-Bench 对照中“27% 且 more than double 27%”的冲突。本文保留原文,不据此擅自修正。

  5. 不能把公开摘要当成完整复现实验。 来源未注明完整任务样本、提示词、采样参数、重复次数、置信区间、硬件细节和失败样本;分数应视为 AA 口径的独立测评快照。

复现说明

  1. 记录模型标识 DeepSeek V4.1 Flash、推理档位 Reasoning, Max Effort、AI Index 版本 v4.3、采集日期和页面版本;不要把普通或低推理档位结果混入比较。

  2. 对照 AA 公布的价格口径分别计算输入、输出和缓存输入成本,并单独标记非高峰 50% 折扣;保留每个任务的输入 token、输出 token、缓存命中情况和实际费用。

  3. Agent 复测至少固定 AutomationBench-AA 的任务集合、SaaS 工具权限、防护栏规则和完成判定;Terminal-Bench 复测需补齐版本、环境、工具、网络和样本设置。

  4. 可靠性复测同时报告 AA-Omniscience Index、Accuracy 和 Non-Hallucination Rate,不能只报告 Intelligence Index;保存错误、幻觉和拒答样本,避免由单一均值推导生产可靠性。

  5. 若要复核主帖,必须查看 X 的英文原文;页面自动翻译会把 ~4x less per token 错译成“约 4 倍”,正确含义是“每 token 约便宜 4 倍”。

Tabbit 小编提醒

本文是第三方资料导航。测试环境、模型版本和主观体验可能不同,请以原文为准。

DeepSeek V4.1 Flash

在 Tabbit 中使用并对比模型

DeepSeek V4.1 Flash

相关测评

官方Hugging Face(DeepSeek 官方模型卡)

DeepSeek-V4.1-Flash 官方模型卡基准:Agent 优势与 Harness 边界

社区X2026-09-15

DeepSeek-V4.1-Flash(Max)在 Agent Arena 的任务成本与净改进

媒体AI IQ

AI IQ 榜单中的 DeepSeek V4.1 Flash:综合分与基准覆盖率

社区Reddit,r/DeepSeek2026-09-15

DeepSeek V4.1 Flash 在 OpenCode 中修复旧代码:社区体验与误报边界

DeepSeek V4.1 Flash

相关提示词

官方DeepSeek API Docs

DeepSeek-V4.1-Flash:API 模型别名与首次调用

官方DeepSeek API Docs

DeepSeek V4.1 Flash 思考模式与推理参数配置

官方DeepSeek API Docs

DeepSeek V4.1 Flash:图像输入与视觉配置

官方DeepSeek API Docs

DeepSeek V4.1 Flash:JSON 问答抽取提示词