Gemini 3.7 Flash · 社区来源 · 编辑分析
这条证据记录 Gemini 3.7 Flash 在 THOR 发现分诊基准中的观察;版本、样本与运行环境不能外推为统一排名或当前生产保证。
待验证:本次未能重新核实原文。下方历史数字不代表已核实的当前结果。
在 189 个真实世界 THOR findings 上报告 72.5% 得分、100% Threat Capture、0% Critical Misses,并称假阳性过滤优于其测试的 Qwen 3.7 Max、Kimi K3 与 DeepSeek V4。
注意:这是作者自建基准的单条公开结果,应结合其评分方法与排行榜复核。
本站仅展示 Tabbit 编辑摘要和必要节选;完整内容、上下文与最新版本请查看原始来源。
本文档是来源资料存档,不代表 Tabbit 或本文档维护者对原文结论的背书。引用基准分数、价格和模型能力时,请回到原文确认版本、测试集和时间。
本文中的数字、任务集、推理档位和客户端条件只在所列来源及采集时点内成立。不同版本、不同 harness 或不同提供商的数据不能直接并排比较;未公开的参数保持未知。
需要复测时,请固定模型版本、提供商或客户端、推理档位、工具、任务集版本、样本数和采集日期,并记录失败、重试与人工修正。完整方法和复现步骤见下方来源笔记。
X · Florian Roth(@cyb3rops) · 原文发布日期 2026-08-14 · 本站编辑日期 2026-09-20
打开原始来源Gemini 3.7 Flash
下载 Tabbit 客户端后检查模型可用性