LayerLens 在 Stratix 的 14,549 个测试用例上测得 Gemini 3.1 Pro Preview 从 ARC-AGI-2 92.3% 到 BIRD-CRITIC 32.5% 的大幅任务差异,说明它更适合抽象推理,SQL 与仓库级工程需要路由或补充工具。
平台:LayerLens Stratix。
样本:14,549 个测试用例。
类别/基准:ARC AGI 2、LiveCodeBench、SWE Bench Lite、IF-Evals、BIRD-CRITIC、BFCL v3,覆盖抽象推理、代码、软件工程、指令遵循、SQL、函数调用。
配置:文章称使用 standardized benchmark configurations、consistent parameters;未公开每个 benchmark 的完整 prompt、temperature、重复次数和置信区间。
文章报告的是 2026-02-19 的 Gemini 3.1 Pro Preview 评测,未说明是否与公开 API gemini-3.1-pro-preview 的具体 snapshot 完全一致。测试按六个标准 benchmark 分发,结果来自自动化评估而非精选 demo。
| 基准 | 得分 | 观察 |
|---|---|---|
| ARC AGI 2 | 92.3% | 最强,抽象模式与多步推理 |
| IF-Evals | 78.4% | 多条指令总体较好,冲突约束会失败 |
| BFCL v3 | 71.2% | 函数调用高于平均,但复杂多工具链不稳定 |
| LiveCodeBench | 61.0% | 标准代码题尚可,长/多文件任务下降 |
| SWE Bench Lite | 48.7% | 仓库级工程中等,跨文件依赖困难 |
| BIRD-CRITIC | 32.5% | SQL/数据推理弱,多表 join、子查询和 schema 推断易错 |
该实测支持按任务路由:抽象推理和结构化指令优先试 Gemini 3.1 Pro;SQL、仓库级代码和复杂多工具链必须配合 schema/测试/工具校验,或评估其他模型。
ARC-AGI-2 92.3% 与 Google 发布的 verified 77.1% 不一致,可能来自数据集、harness、解码或版本差异;不能直接比较排名。
LayerLens 没有在文章中公开完整原始输入、运行日志、种子、费用和逐题结果下载,复现需要 Stratix 或另行取得数据。
文章作者为 LayerLens 营销负责人,平台存在产品关联;证据高于观点但仍需第三方复核。
“2M context”与 Google API 模型页采集到的 1,048,576 输入 token 不一致,应以目标 endpoint 的实时规格为准。
固定模型 snapshot、API endpoint、thinking level、temperature 和 max output。
使用同版本 ARC AGI 2、IF-Evals、BFCL v3、LiveCodeBench、SWE Bench Lite、BIRD-CRITIC;记录每个样本的输入、输出、工具调用和失败原因。
报告六项分数和置信区间,不用平均数掩盖 92.3%/32.5% 的任务差异。
与 Google 77.1% 基线并列展示,并在报告中解释数据集/harness 差异。
Gemini 3.1 Pro