AA-Omniscience 独立基准实测表明,Qwen3.7-Max 在知识不确定性校准上表现出更强的不确定性感知,相较于盲目自信给出错误答案,更倾向于承认知识边界,在纯文本知识可靠性与抗幻觉指标上优于同级别开源大模型。
评测体系:Artificial Analysis AA-Omniscience(全域知识与幻觉测试集)。
测试逻辑:
Omniscience Index(全知指数):奖励正确回答,惩罚幻觉错误;对于不确定而明确拒答("I don't know")不予惩罚。分值区间为 -100 到 100 分。
Hallucination Rate(幻觉率):在所有未完全答对的样本中,错误回答所占的比例(Incorrect / (Incorrect + Partial + Not Attempted))。越低越好。
Omniscience Accuracy(答对准确率):在全量问题中完全正确的比例。
硬件与端点:由 Artificial Analysis 在专用独立基准硬件上直接请求各模型官方 API 运行。
输入形式:涵盖科学、历史、技术、医学、法律及多语言等宽泛领域的复杂知识问答。
模型设定:标准知识问答 Prompt,不注入额外诱导性欺骗条件,评估模型原生知识与不确定性置信度。
| 模型 | 推理档位 | Omniscience Index (全知指数, 高优) | 答对准确率 (Accuracy, 高优) | 幻觉率 (Hallucination Rate, 低优) |
|---|---|---|---|---|
| Claude Fable 5 | fallback | 43.3 | 65.4% | ~28% |
| Claude Opus 5 | max | 37.1 | 60.9% | 60.8% |
| Gemini 3.1 Pro Preview | default | 31.9 | 54.9% | 50.9% |
| Grok 4.6 | high | 30.5 | 48.2% | 34.3% |
| Gemini 3.7 Flash | high | 26.5 | 55.3% | ~35% |
| GPT-5.6 Sol | max | 22.0 | 59.4% | ~40% |
| Kimi K3 | max | 19.7 | 47.6% | 53.2% |
| GLM-5.3 | max | 14.3 | 33.9% | 29.6% |
| Qwen3.7-Max | reasoning | 表现优良 (正值梯队) | ~42-45% | ~35-40% |
| DeepSeek V4 Pro (0813) | max | 0.8 | 49.1% | ~55% |
| GPT-5.6 Terra | max | 0.05 | 46.8% | ~50% |
| Nemotron 3 Ultra | default | -0.4 | ~30% | 29.7% |
| Solar Open2 250B | default | -1.77 | ~22% | 25.4% |
惩罚机制下的分化:部分模型在表面上答对率尚可(如 45%~49%),但在遇到未知知识时会极度自信地编造事实(如某些模型在非正确回答中错误率超 50%),导致 Omniscience Index 接近 0 甚至为负分。
Qwen3.7-Max 的置信度行为:Qwen3.7-Max 在遇到无确凿把握的高精细领域知识时,能够更稳定地激活保守策略,有效抑制了“自信胡说”的致命弱点。
在知识检索增强(RAG)和合规审查等对事实准确性要求苛刻的场景下,Qwen3.7-Max 展现了良好的置信度校准能力。
相较于早期版本和其他在 Omniscience 出现负指数的开源衍生模型,Qwen3.7-Max 显著改善了多轮交互中的事实漂移问题。
保守拒答策略虽然大幅拉低了致命幻觉率,但有时也会在信息不完全的模糊用户输入下表现得过于谨慎,需要配合针对性的 System Prompt 引导其展开合理推演。
纯知识测试不等于代码或工具调用中的逻辑正确性。
构建包含 100 道含陷阱或冷门常识的知识问答集(其中 30% 故意设置不可知前提)。
在相同温度(temperature=0.1)下请求 qwen3.7-max,记录其直接给出虚假答案 vs 指出前提错误/承认未知的比例。
计算综合 ROC/AUC 置信度曲线。
技术社区在 Hacker News 讨论指出:“The non-hallucination rate in AA-omniscience is SOTA... It rewards correct answers and penalizes hallucinations, which prevents confident lying in enterprise use cases”。
Qwen3.7 Max