Tabbit
活动资源博客模型
Tabbit LogoTabbit

Tabbit — 为你工作的 AI 浏览器

主题资源

  • AI Browser Resources
  • Agentic Browser Resources
  • Browser Downloads and Install Guides
  • Browser Comparisons
  • AI Browser Alternatives
  • Browser Productivity Resources

热门指南

  • AI Browser
  • Agentic Browser Download
  • Best AI Browser 2026: Top 9 Tested & Ranked
  • AI Browser Download
  • Free AI Browser
  • Best AI Browser 2026
  • AI Browser Comparison 2026
  • AI Browser for Windows
  • AI Browser for Mac
  • Chrome Alternative 2026

活动

  • 别装了,你在《牛来》里早有原型
  • Tabbit 妙招大赛
  • KPOP SBTI 饭圈人格测试
  • Tabbit 校园共创者计划
  • fifi 的论文文献妙招精选
  • 用户问卷

关于

  • Tabbit 博客
  • 媒体报道
测评
媒体DeepSeek V4.1 Flash

AI IQ 榜单中的 DeepSeek V4.1 Flash:综合分与基准覆盖率

原始来源

AI IQ

作者未注明(页面署名 AI IQ)

Tabbit 整理2026-09-16

查看原文

一句话结论

AI IQ 页面在采集时给 DeepSeek V4.1 Flash 估计 IQ 116、排名 #38/138;这个 IQ 是六个等权能力维度的派生估计,缺失基准会进入保守填补流程,不能当作直接智商或一次覆盖完整的独立实测。页面可见的基准覆盖集中在 Academic Reasoning(4/6)与 Reliability(1/7),其余四个维度为 0/3、0/5、0/6、0/6。

适用场景

  • 适合判断的任务:在同一 AI IQ 口径下查看模型的综合排名、能力维度分数和已纳入的 benchmark 结果;用 coverage 判断分数证据覆盖到什么程度。

  • 不适合外推的任务:把 116 当成人类智商、把 #38/138 当成稳定名次,或据此断言模型在未测任务、任意客户端和生产工作流中的表现;也不能把 Effective Cost 当作单一 API token 单价。

  • 适用的模型版本:页面标注的 DeepSeek V4.1 Flash;API、开源权重部署和其他推理配置需单独核对。

  • 测试环境或客户端:AI IQ 公共模型档案及其收录的公开 benchmark 数据;具体运行 harness、样本量和参数未在模型页逐项注明。

  • 推理档位和参数:未注明。

测评方法

评分与成本定义的辅助来源为 AI IQ Methodology,模型分数仍以本篇主来源的采集日快照为准。

模型页将六个维度等权合成为 Composite IQ:Abstract、Mathematical、Academic、Programmatic、Computer Use、Reliability。页面链接的方法论说明,单个 benchmark 的原始分数先按 IQ 70、85、100、115、130、145、160 的校准梯度做分段线性插值,再对维度内 benchmark 求平均;缺失 benchmark 和缺失维度只在派生评分流程中保守填补。至少有 2/6 个维度具备直接或有效继承的测量证据时,才产生综合分。

可见 coverage 是该维度已覆盖的 benchmark 数 / 页面列出的 benchmark 总数。它衡量证据覆盖,不等于该维度的 IQ 百分比,也不表示每一项都是 AI IQ 独立运行的实验。AI IQ 方法论还明确提醒,所有维度值都是估计值;缺失填补、校准梯度和 benchmark 组合都会影响结果。

综合分可概括为:

$$ \mathrm{IQ}=\frac{\mathrm{Abstract}+\mathrm{Math}+\mathrm{Academic}+\mathrm{Programmatic}+\mathrm{Computer}+\mathrm{Reliability}}{6} $$

页面同时提供“Effective Cost”。同站方法论将它定义为:

$$ \mathrm{Effective\ Cost}=\mathrm{Sticker\ Price}\times\mathrm{Usage\ Multiplier} $$

其中 Sticker Price 以 1M 输入 + 1M 输出 token 为标准工作负载,Usage Multiplier 反映模型完成同类任务时实际使用的 token 或任务成本。因此它是任务效率调整后的比较指标,不是 API 的输入或输出单价。

关键结果

页面采集时显示:IQ 116、IQ Rank #38、Effective Cost $3.6328。FAQ 将排名表述为 138 个公开模型中的第 38 名,并称该分数综合六个等权维度、对缺失覆盖做保守估计;这是 2026-09-16 的页面快照,不能当作永久排名。

六维分数与 coverage:

维度IQCoverage读法
Abstract Reasoning990/3页面列出的 3 个 benchmark 均无直接覆盖,分数含估计成分
Mathematical Reasoning1160/5页面列出的 5 个 benchmark 均无直接覆盖,分数含估计成分
Academic Reasoning1364/66 个 benchmark 中有 4 个已覆盖
Programmatic Reasoning1220/6页面列出的 6 个 benchmark 均无直接覆盖,分数含估计成分
Computer Use1200/6页面列出的 6 个 benchmark 均无直接覆盖,分数含估计成分
Reliability1031/77 个 benchmark 中有 1 个已覆盖

原始数据

模型页公开列出的 benchmark 结果如下。页面没有在该档案中注明运行参数、样本量、重复次数或完整 harness,因此这里记录为 AI IQ 页面收录值,不改写成统一独立实验结果。

BenchmarkScore维度
AA Omniscience-5.3Reliability
CritPt14.2857Academic Reasoning
Humanity's Last Exam39.2493Academic Reasoning
MMMU-Pro76.9942Academic Reasoning
SciCode51.8519Academic Reasoning

页面 FAQ 还给出价格和运行概览:输入 $0.30 / 1M tokens、输出 $1.20 / 1M tokens;context window 1,000,000 tokens;独立测量约 190 tokens/s、典型响应时间约 14 秒。后两项在该模型页没有展开测量方案,不能据此复现性能。

FAQ 将模型发布日期写为 2026-09-10;这是模型发布时间,不是该榜单页面的发布日期。

按同站方法论的 1M 输入 + 1M 输出口径,页面公开的单价对应:

$$ \mathrm{Sticker\ Price}=0.30+1.20=$1.50 $$

页面的 $3.6328 是经过任务使用量调整后的 Effective Cost;仅按两组页面数字反推,调整倍数约为 $3.6328 / $1.50=2.42$,但页面没有公开该模型的具体 multiplier、配对任务记录或测量明细,不能把这个反推值当作独立成本实测。

结论与边界

  1. 116 是 AI IQ 的派生指标。 它使用人类 IQ 作为直观标尺,不等价于心理测量学意义上的人类智商。六维等权也不意味着模型在六类任务上有同等数量的直接证据。

  2. 覆盖率是阅读该页的关键。 Academic Reasoning 的 4/6 是页面最充分的直接覆盖,Reliability 只有 1/7;Abstract、Math、Programmatic、Computer Use 均为 0 coverage。0/3 等值表示缺少页面直接 benchmark 覆盖,不表示模型得分为 0。

  3. 综合分包含缺失值处理。 方法论说明缺失项在评分副本中保守填补,并区分 source-backed 数据与 derived scoring;因此页面分数可以存在,但不能按六维都被完整实测来宣传。

  4. #38/138 是动态日期快照。 本记录只说明 2026-09-16 采集时页面显示的名次;模型新增、数据更新、校准修改或榜单范围变化都可能改变它。

  5. Effective Cost 不是 API 单价。 API 标价是输入 $0.30/M、输出 $1.20/M;$3.6328 采用标准 I/O 工作负载再乘任务使用量调整,适合做任务效率比较,不能直接替代供应商账单估算。

  6. 这不是完整独立复测。 页面提供收录分数和派生排名,但未为本页列出完整输入、输出、样本、重复实验、置信区间和 harness;应与官方模型卡或可复现实验分开引用。

复现说明

  1. 记录访问日期、页面 URL、模型名称、IQ、排名、Effective Cost、六维分数和 coverage;动态榜单必须保留快照日期。

  2. 复现单项 benchmark 时,另行取得该 benchmark 的原始来源、版本、输入、评分指标、模型配置、harness、样本量和重复策略;AI IQ 页面本身不足以还原这些条件。

  3. 若要复算综合分,需获得 AI IQ 当前 benchmark 校准梯度和缺失值 waterfall,再按方法论先转换单项 IQ、处理维度内缺失,最后计算六维等权平均;不能用表中五个公开结果直接平均出 116。

  4. 成本比较应同时报告供应商 API 单价与 Effective Cost,并明确 1M 输入 + 1M 输出的标准工作负载和 usage multiplier 来源。

Tabbit 小编提醒

本文是第三方资料导航。测试环境、模型版本和主观体验可能不同,请以原文为准。

DeepSeek V4.1 Flash

在 Tabbit 中使用并对比模型

DeepSeek V4.1 Flash

相关测评

官方Hugging Face(DeepSeek 官方模型卡)

DeepSeek-V4.1-Flash 官方模型卡基准:Agent 优势与 Harness 边界

社区X2026-09-15

DeepSeek-V4.1-Flash(Max)在 Agent Arena 的任务成本与净改进

社区X(Artificial Analysis)2026-09-11

Artificial Analysis:DeepSeek V4.1 Flash 的智能、成本与幻觉边界

社区Reddit,r/DeepSeek2026-09-15

DeepSeek V4.1 Flash 在 OpenCode 中修复旧代码:社区体验与误报边界

DeepSeek V4.1 Flash

相关提示词

官方DeepSeek API Docs

DeepSeek-V4.1-Flash:API 模型别名与首次调用

官方DeepSeek API Docs

DeepSeek V4.1 Flash 思考模式与推理参数配置

官方DeepSeek API Docs

DeepSeek V4.1 Flash:图像输入与视觉配置

官方DeepSeek API Docs

DeepSeek V4.1 Flash:JSON 问答抽取提示词