Tabbit
活动资源博客模型
Tabbit LogoTabbit

Tabbit — 为你工作的 AI 浏览器

主题资源

  • AI Browser Resources
  • Agentic Browser Resources
  • Browser Downloads and Install Guides
  • Browser Comparisons
  • AI Browser Alternatives
  • Browser Productivity Resources

热门指南

  • AI Browser
  • Agentic Browser Download
  • Best AI Browser 2026: Top 9 Tested & Ranked
  • AI Browser Download
  • Free AI Browser
  • Best AI Browser 2026
  • AI Browser Comparison 2026
  • AI Browser for Windows
  • AI Browser for Mac
  • Chrome Alternative 2026

活动

  • 别装了,你在《牛来》里早有原型
  • Tabbit 妙招大赛
  • KPOP SBTI 饭圈人格测试
  • Tabbit 校园共创者计划
  • fifi 的论文文献妙招精选
  • 用户问卷

关于

  • Tabbit 博客
  • 媒体报道
测评
媒体Qwen3.7 Max

Qwen3.7-Max AA-Omniscience 知识可靠性与幻觉率实测

原始来源

Artificial Analysis

作者Artificial Analysis Team

原文日期2026-05-20

Tabbit 整理2026-08-20

查看原文

一句话结论

AA-Omniscience 独立基准实测表明,Qwen3.7-Max 在知识不确定性校准上表现出更强的不确定性感知,相较于盲目自信给出错误答案,更倾向于承认知识边界,在纯文本知识可靠性与抗幻觉指标上优于同级别开源大模型。

测试环境

  • 评测体系:Artificial Analysis AA-Omniscience(全域知识与幻觉测试集)。

  • 测试逻辑:

    • Omniscience Index(全知指数):奖励正确回答,惩罚幻觉错误;对于不确定而明确拒答("I don't know")不予惩罚。分值区间为 -100 到 100 分。

    • Hallucination Rate(幻觉率):在所有未完全答对的样本中,错误回答所占的比例(Incorrect / (Incorrect + Partial + Not Attempted))。越低越好。

    • Omniscience Accuracy(答对准确率):在全量问题中完全正确的比例。

  • 硬件与端点:由 Artificial Analysis 在专用独立基准硬件上直接请求各模型官方 API 运行。

输入/配置

  • 输入形式:涵盖科学、历史、技术、医学、法律及多语言等宽泛领域的复杂知识问答。

  • 模型设定:标准知识问答 Prompt,不注入额外诱导性欺骗条件,评估模型原生知识与不确定性置信度。

结果数据

1. 跨模型 AA-Omniscience 核心指标对照

模型推理档位Omniscience Index (全知指数, 高优)答对准确率 (Accuracy, 高优)幻觉率 (Hallucination Rate, 低优)
Claude Fable 5fallback43.365.4%~28%
Claude Opus 5max37.160.9%60.8%
Gemini 3.1 Pro Previewdefault31.954.9%50.9%
Grok 4.6high30.548.2%34.3%
Gemini 3.7 Flashhigh26.555.3%~35%
GPT-5.6 Solmax22.059.4%~40%
Kimi K3max19.747.6%53.2%
GLM-5.3max14.333.9%29.6%
Qwen3.7-Maxreasoning表现优良 (正值梯队)~42-45%~35-40%
DeepSeek V4 Pro (0813)max0.849.1%~55%
GPT-5.6 Terramax0.0546.8%~50%
Nemotron 3 Ultradefault-0.4~30%29.7%
Solar Open2 250Bdefault-1.77~22%25.4%

2. 幻觉率与拒答机制的关键洞察

  • 惩罚机制下的分化:部分模型在表面上答对率尚可(如 45%~49%),但在遇到未知知识时会极度自信地编造事实(如某些模型在非正确回答中错误率超 50%),导致 Omniscience Index 接近 0 甚至为负分。

  • Qwen3.7-Max 的置信度行为:Qwen3.7-Max 在遇到无确凿把握的高精细领域知识时,能够更稳定地激活保守策略,有效抑制了“自信胡说”的致命弱点。

结论

  • 在知识检索增强(RAG)和合规审查等对事实准确性要求苛刻的场景下,Qwen3.7-Max 展现了良好的置信度校准能力。

  • 相较于早期版本和其他在 Omniscience 出现负指数的开源衍生模型,Qwen3.7-Max 显著改善了多轮交互中的事实漂移问题。

局限

  • 保守拒答策略虽然大幅拉低了致命幻觉率,但有时也会在信息不完全的模糊用户输入下表现得过于谨慎,需要配合针对性的 System Prompt 引导其展开合理推演。

  • 纯知识测试不等于代码或工具调用中的逻辑正确性。

复现步骤

  1. 构建包含 100 道含陷阱或冷门常识的知识问答集(其中 30% 故意设置不可知前提)。

  2. 在相同温度(temperature=0.1)下请求 qwen3.7-max,记录其直接给出虚假答案 vs 指出前提错误/承认未知的比例。

  3. 计算综合 ROC/AUC 置信度曲线。

来源摘录或观察(仅做合规短引)

技术社区在 Hacker News 讨论指出:“The non-hallucination rate in AA-omniscience is SOTA... It rewards correct answers and penalizes hallucinations, which prevents confident lying in enterprise use cases”。

Tabbit 小编提醒

本文是第三方资料导航。测试环境、模型版本和主观体验可能不同,请以原文为准。

Qwen3.7 Max

在 Tabbit 中使用并对比模型

Qwen3.7 Max

相关测评

媒体Qwen 官方博客2026-05-20

Qwen3.7-Max 官方完整基准与 35 小时自主优化实验

媒体BenchLM.ai2026-05-16

Qwen3.7-Max BenchLM 公开证据覆盖与速度账本

媒体Ofox AI2026-06-02

Qwen3.7-Max 与 Qwen3.7-Plus 三项真实任务成本与质量对照

媒体Artificial Analysis2026-05-20

Qwen3.7-Max Artificial Analysis 综合智能指数与成本速度实测

Qwen3.7 Max

相关提示词

媒体Qwen 官方博客2026-05-20

Qwen3.7-Max 长程 Agent、前端原型与办公提示词

媒体Alibaba Cloud Model Studio2026-08-18

Qwen3.7-Max 阿里云 Model Studio 版本、价格与缓存配置

社区Reddit(r/opencodeCLI & r/QwenAI)2026-05-25

Qwen3.7-Max OpenCode 缓存配置与 Agent 防暴走规则

社区X.com & GitHub Community2026-08-08

Qwen3.7-Max 与多模型协同的代码阅读与审查路由配置