Tabbit
活动资源博客模型
Tabbit LogoTabbit

Tabbit — 为你工作的 AI 浏览器

主题资源

  • AI Browser Resources
  • Agentic Browser Resources
  • Browser Downloads and Install Guides
  • Browser Comparisons
  • AI Browser Alternatives
  • Browser Productivity Resources

热门指南

  • AI Browser
  • Agentic Browser Download
  • Best AI Browser 2026: Top 9 Tested & Ranked
  • AI Browser Download
  • Free AI Browser
  • Best AI Browser 2026
  • AI Browser Comparison 2026
  • AI Browser for Windows
  • AI Browser for Mac
  • Chrome Alternative 2026

活动

  • 别装了,你在《牛来》里早有原型
  • Tabbit 妙招大赛
  • KPOP SBTI 饭圈人格测试
  • Tabbit 校园共创者计划
  • fifi 的论文文献妙招精选
  • 用户问卷

关于

  • Tabbit 博客
  • 媒体报道
简体中文
简体中文English
测评与证据

Qwen3.7 Max · 媒体来源 · 独立测量

Qwen3.7-Max AA-Omniscience 知识可靠性与幻觉率实测

AA-Omniscience 测试 Qwen3.7 Max 的知识不确定性与幻觉率,强调拒答/未尝试样本的定义;这是专门知识可靠性基准,不是通用 Agent 评测。

待验证:本次未能重新核实原文。下方历史数字不代表已核实的当前结果。

媒体来源独立测量编辑日期 2026-09-20

测试条件速查

来源具体观察
Artificial Analysis 在专用硬件和官方 API 上运行标准知识问答 prompt,页面更新至 2026-08。
已公布条件
Hallucination Rate 定义为 Incorrect/(Incorrect+Partial+Not Attempted);未注入额外欺骗条件,完整样本与重复细节需以方法页为准。

关键数据与适用场景

一句话结论

AA-Omniscience 独立基准实测表明,Qwen3.7-Max 在知识不确定性校准上表现出更强的不确定性感知,相较于盲目自信给出错误答案,更倾向于承认知识边界,在纯文本知识可靠性与抗幻觉指标上优于同级别开源大模型。

测试环境

  • 评测体系:Artificial Analysis AA-Omniscience(全域知识与幻觉测试集)。

  • 测试逻辑:

    • Omniscience Index(全知指数):奖励正确回答,惩罚幻觉错误;对于不确定而明确拒答("I don't know")不予惩罚。分值区间为 -100 到 100 分。

    • Hallucination Rate(幻觉率):在所有未完全答对的样本中,错误回答所占的比例(Incorrect / (Incorrect + Partial + Not Attempted))。越低越好。

    • Omniscience Accuracy(答对准确率):在全量问题中完全正确的比例。

  • 硬件与端点:由 Artificial Analysis 在专用独立基准硬件上直接请求各模型官方 API 运行。

输入/配置

  • 输入形式:涵盖科学、历史、技术、医学、法律及多语言等宽泛领域的复杂知识问答。

  • 模型设定:标准知识问答 Prompt,不注入额外诱导性欺骗条件,评估模型原生知识与不确定性置信度。

结果数据

1. 跨模型 AA-Omniscience 核心指标对照

模型推理档位Omniscience Index (全知指数, 高优)答对准确率 (Accuracy, 高优)幻觉率 (Hallucination Rate, 低优)
Claude Fable 5fallback43.365.4%~28%
Claude Opus 5max37.160.9%60.8%
Gemini 3.1 Pro Previewdefault31.954.9%50.9%
Grok 4.6high30.548.2%34.3%
Gemini 3.7 Flashhigh26.555.3%~35%
GPT-5.6 Solmax22.059.4%~40%
Kimi K3max19.747.6%53.2%
GLM-5.3max14.333.9%29.6%
Qwen3.7-Maxreasoning表现优良 (正值梯队)~42-45%~35-40%
DeepSeek V4 Pro (0813)max0.849.1%~55%
GPT-5.6 Terramax0.0546.8%~50%
Nemotron 3 Ultradefault-0.4~30%29.7%
Solar Open2 250Bdefault-1.77~22%25.4%

2. 幻觉率与拒答机制的关键洞察

  • 惩罚机制下的分化:部分模型在表面上答对率尚可(如 45%~49%),但在遇到未知知识时会极度自信地编造事实(如某些模型在非正确回答中错误率超 50%),导致 Omniscience Index 接近 0 甚至为负分。

  • Qwen3.7-Max 的置信度行为:Qwen3.7-Max 在遇到无确凿把握的高精细领域知识时,能够更稳定地激活保守策略,有效抑制了“自信胡说”的致命弱点。

结论

  • 在知识检索增强(RAG)和合规审查等对事实准确性要求苛刻的场景下,Qwen3.7-Max 展现了良好的置信度校准能力。

  • 相较于早期版本和其他在 Omniscience 出现负指数的开源衍生模型,Qwen3.7-Max 显著改善了多轮交互中的事实漂移问题。

局限

  • 保守拒答策略虽然大幅拉低了致命幻觉率,但有时也会在信息不完全的模糊用户输入下表现得过于谨慎,需要配合针对性的 System Prompt 引导其展开合理推演。

  • 纯知识测试不等于代码或工具调用中的逻辑正确性。

复现步骤

  1. 构建包含 100 道含陷阱或冷门常识的知识问答集(其中 30% 故意设置不可知前提)。

  2. 在相同温度(temperature=0.1)下请求 qwen3.7-max,记录其直接给出虚假答案 vs 指出前提错误/承认未知的比例。

  3. 计算综合 ROC/AUC 置信度曲线。

来源摘录或观察(仅做合规短引)

技术社区在 Hacker News 讨论指出:“The non-hallucination rate in AA-omniscience is SOTA... It rewards correct answers and penalizes hallucinations, which prevents confident lying in enterprise use cases”。

能支持的判断

  • AA-Omniscience 测试 Qwen3.7 Max 的知识不确定性与幻觉率,强调拒答/未尝试样本的定义;这是专门知识可靠性基准,不是通用 Agent 评测。

不能支持的判断

  • AA-Omniscience 的幻觉率取决于题库、知识截止、拒答与未尝试的计分定义;它不测试检索增强、工具调用、长上下文或真实工作流中的事实核验。

方法、局限和复现

本文中的数字、任务集、推理档位和客户端条件只在所列来源及采集时点内成立。不同版本、不同 harness 或不同提供商的数据不能直接并排比较;未公开的参数保持未知。

需要复测时,请固定模型版本、提供商或客户端、推理档位、工具、任务集版本、样本数和采集日期,并记录失败、重试与人工修正。完整方法和复现步骤见下方来源笔记。

原始来源

Artificial Analysis · Artificial Analysis Team · 原文发布日期 2026-05-20 · 本站编辑日期 2026-09-20

打开原始来源

Qwen3.7 Max

在 Tabbit 中比较 Qwen3.7 Max

下载 Tabbit 客户端后检查模型可用性

模型深度阅读

总览 · 简体中文

Qwen3.7 Max:模型定位、获取方式与适用边界

从官方快照、百万级上下文、Agent 场景、价格口径和实际风险,快速判断 Qwen3.7 Max 是否适合你的工作流。

相关评测

Qwen3.7-Max 官方完整基准与 35 小时自主优化实验Qwen 官方报告 Qwen3.7-Max 在编码、MCP/Skills、推理、多语言和长程工具任务上的结果,并展示 35 小时 GPU 优化实验;各项分数依赖不同 harness。Qwen3.7-Max BenchLM 公开证据覆盖与速度账本BenchLM 的 Qwen3.7 Max 账本记录 71.6/100、公开排名 #16/218、证据验证排名 #13/104 以及 204 tok/s 和 14.07 秒首 token;其聚合口径不统一。Qwen3.7-Max 与 Qwen3.7-Plus 三项真实任务成本与质量对照Ofox 用相同提示、每项 5 次运行中位数和 senior reviewer 比较 Qwen3.7 Max/Plus;Max 在文本与长程迁移有小幅优势,Plus 约便宜 5 倍且支持视觉。Qwen3.7-Max Artificial Analysis 综合智能指数与成本速度实测Artificial Analysis 把 Qwen3.7 Max 放入 182 模型池,按推理档位比较智能指数、单任务成本和输出速度;长思维 token 与档位会显著改变成本。Qwen3.7-Max 长程 Agent、前端原型与办公提示词Qwen 官方长程案例把前端、办公和多步 Agent 任务拆成可验证阶段,并强调工具、超时和最终验收要分开记录。Qwen3.7-Max 阿里云 Model Studio 版本、价格与缓存配置Model Studio 页面把 Qwen3.7 Max 的快照、百万上下文、缓存计费和区域限流分开列出,适合先固定版本与成本口径。Qwen3.7-Max Three.js 电子魔方与 3D 物理交互原型提示词阿里云公开 Three.js 案例把视觉参考、交互规则和物理验收写成电子魔方原型任务,适合做浏览器端视觉原型的编辑改写。Qwen3.7-Max GPU 算子优化长程 Agent 提示词与验收闭环Qwen 团队的 GPU 算子案例把性能假设、编译测试、基准回归和长程进度记录连成闭环,硬件与验证器是关键边界。