Tabbit
活动资源博客模型
Tabbit LogoTabbit

Tabbit — 为你工作的 AI 浏览器

主题资源

  • AI Browser Resources
  • Agentic Browser Resources
  • Browser Downloads and Install Guides
  • Browser Comparisons
  • AI Browser Alternatives
  • Browser Productivity Resources

热门指南

  • AI Browser
  • Agentic Browser Download
  • Best AI Browser 2026: Top 9 Tested & Ranked
  • AI Browser Download
  • Free AI Browser
  • Best AI Browser 2026
  • AI Browser Comparison 2026
  • AI Browser for Windows
  • AI Browser for Mac
  • Chrome Alternative 2026

活动

  • 别装了,你在《牛来》里早有原型
  • Tabbit 妙招大赛
  • KPOP SBTI 饭圈人格测试
  • Tabbit 校园共创者计划
  • fifi 的论文文献妙招精选
  • 用户问卷

关于

  • Tabbit 博客
  • 媒体报道
简体中文
简体中文English
测评与证据

Gemini 3.1 Pro · 媒体来源 · 独立测量

MindStudio 对 GPT-5.4、Claude Opus 4.6 与 Gemini 3.1 Pro 的三旗舰全任务实测

MindStudio 用 HumanEval、SWE-bench、MATH、GPQA、MMLU Pro 及定制长文档任务比较三款旗舰;Gemini 的长上下文优势不能外推到所有代码修复。

待验证:本次未能重新核实原文。下方历史数字不代表已核实的当前结果。

媒体来源独立测量编辑日期 2026-09-20

测试条件速查

来源具体观察
2026-03-15 MindStudio;HumanEval 164 道 Python pass@1,另有 SWE-bench Verified、MATH、GPQA Diamond、MMLU Pro、120k token 文档和 5,000 词写作任务。
已公布条件
客观项目自动判定,主观项目由 3 位独立评审盲评;评测混合 GPT-5.4、Claude Opus 4.6 与 Gemini 3.1 Pro。

关键数据与适用场景

一句话结论

在涵盖代码、长篇创意写作、研究生级推理、数学与长文档综合的统一多模型横评中,Gemini 3.1 Pro 在 200 万 token 超长上下文和输出成本(比 Claude 便宜 60%)上占据压倒性优势,但在复杂多文件代码修复与文学级主观写作上略逊于 GPT-5.4 与 Claude Opus 4.6。

测试环境

  • 平台:MindStudio 模型评测与多 Agent 编排流水线。

  • 对比模型:OpenAI GPT-5.4、Anthropic Claude Opus 4.6、Google Gemini 3.1 Pro。

  • 评测项目:

    • 标准基准:HumanEval(164 道 Python pass@1)、SWE-bench Verified(真实 GitHub Issue 解决率)、MATH(竞赛级数学)、GPQA Diamond(高难度科学推理)、MMLU Pro(57 个学术领域综合)。

    • 定制实测任务:5,000 词长篇文学写作、品牌营销文案(严格规则遵循)、120k token 多文档研究综合报告、6 类 SVG 空间与视觉代码生成。

  • 评判方式:客观代码/数学自动判定;主观任务由 3 位独立人类评审员盲评,评分维度包括行文质感、指令遵循与叙事连贯性。

输入/配置

  • 所有模型在标准测试中采用完全一致的 Prompt 与默认 Temperature。

  • 长文档综合任务统一输入 80,000~150,000 tokens 的多篇研报与学术资料。

  • 计价与参数对照:

    • GPT-5.4: 输入 $15.00 / 1M,输出 $60.00 / 1M,上下文 128k tokens,生成速率 ~80 TPS

    • Claude Opus 4.6: 输入 $20.00 / 1M,输出 $100.00 / 1M,上下文 200k tokens,生成速率 ~55 TPS

    • Gemini 3.1 Pro: 输入 $12.50 / 1M,输出 $37.50 / 1M,上下文 2M tokens,生成速率 ~75 TPS

结果数据

1. 标准化基准对比

评测基准GPT-5.4Claude Opus 4.6Gemini 3.1 Pro分析与观察
HumanEval (pass@1)93.1%90.4%89.2%Gemini 在歧义 Prompt 下易过早锁定错误假设;明确算法题表现接近
SWE-bench Verified52.7%50.3%48.1%真实跨文件仓库修复,Gemini 依靠大上下文部分缩小差距
GPQA Diamond83.9%87.4%82.1%Claude 在多步深层科学推导上领先
MMLU Pro92.3%91.7%90.8%三者知识广度均达到极高水准(极小差距)
MATH94.8%94.1%94.6%竞赛数学三者基本持平(差距在误差范围内)

2. 定制长篇写作与 SVG 生成(1~10 分,3 人盲评均分)

测试任务GPT-5.4Claude Opus 4.6Gemini 3.1 Pro核心结论
5000 词长篇文学写作7.88.67.3Gemini 能完成剧情要求但文笔较机械,Claude 在节奏与潜台词上最佳
严格限制营销文案8.28.07.5GPT-5.4 负向约束遵循最严,Gemini 文风偏通用
120k token 研报综合良好(局部深层连接遗漏)优秀(跨文档整合最佳)扎实(信息检索完整但总结偏通用)Gemini 在百万级单次吞吐无压力,Claude 在 200k 内细腻度胜出
复杂 SVG 与空间排版优秀(图层与 Z-index 最佳)良好(动画与流程图最佳)一般(易添加冗余 viewBox 需人工清洗)Gemini 在复杂空间排版 SVG 代码生成上略有短板

结论

MindStudio 给出清晰的模型选型边界建议:

  1. 代码与工程落地默认首选:GPT-5.4(准确率最高、速度最快)。

  2. 高质量长篇写作与极难科研推理:Claude Opus 4.6(行文质感与 GPQA 领先)。

  3. 超长文档检索、代码库通读与生产级大吞吐成本敏感任务:Gemini 3.1 Pro(2M 级上下文、输出成本仅为 Claude 的 37.5%,最具工程性价比)。

局限

  • 实测文章发表于 2026 年 3 月中旬,各模型后续的微调更新可能导致分数微调。

  • 主观评分受限于 3 位评审员的偏好分布,虽然采用盲评但文学评价天然存在主观性。

复现步骤

  1. 准备 HumanEval 与 SWE-bench Verified 标准测试环境。

  2. 构造 5,000 词文学 Brief 与 120k token 多文档数据集,分别固定三家模型的 API 入口。

  3. 统计 pass@1、运行成本、实际吞吐 TPS,并组织三组评审员进行盲评归一化评分。

能支持的判断

  • 支持比较长文档、成本和代码/写作任务的相对观察

不能支持的判断

  • 支持比较长文档、成本和代码/写作任务的相对观察;不支持把该平台结果当作 Gemini 单模型 API SLA 或所有仓库质量。

方法、局限和复现

本文中的数字、任务集、推理档位和客户端条件只在所列来源及采集时点内成立。不同版本、不同 harness 或不同提供商的数据不能直接并排比较;未公开的参数保持未知。

需要复测时,请固定模型版本、提供商或客户端、推理档位、工具、任务集版本、样本数和采集日期,并记录失败、重试与人工修正。完整方法和复现步骤见下方来源笔记。

原始来源

MindStudio Blog · Luis Chavez-Mattos(Director of Product, MindStudio) · 原文发布日期 2026-03-15 · 本站编辑日期 2026-09-20

打开原始来源

Gemini 3.1 Pro

在 Tabbit 中比较 Gemini 3.1 Pro

下载 Tabbit 客户端后检查模型可用性

相关评测

LayerLens Stratix 对 Gemini 3.1 Pro Preview 的六类基准实测LayerLens Stratix 用 14,549 个样本覆盖六类基准,显示 Gemini 3.1 Pro 在 ARC 与 BIRD-CRITIC 等任务间差异很大。Artificial Analysis 对 Gemini 3.1 Pro Preview 的 182 模型综合基准与端到端延迟实测Artificial Analysis 在第一方 API 上比较 182 个同价位模型,给 Gemini 3.1 Pro Preview 48 的 Intelligence Index、121.4 t/s 和 32.45 秒 TTFT,呈现高吞吐但高前置延迟。Gemini 3.1 Pro 官方发布:ARC-AGI-2 与产品定位基线Google 发布页以 2026-02-19 的 Gemini 3.1 Pro preview 和 ARC-AGI-2 verified 77.1% 作为产品基线,但没有公开完整 ARC harness。Google AI 开发者论坛:4000 词复杂系统提示词下 Gemini 3.1 Pro 的指令遵循实测一名 Antigravity Ultra 用户报告:约 4,000 词、含多阶段流程与负向约束的工程指令下,Gemini 3.1 Pro High 会跳过规划、缩短输出、长会话漂移或越权重构。Gemini 3.1 Pro 的简洁指令与长上下文定位提示Google 的 Gemini 3 指南建议保持直接简洁,并把长上下文中的具体问题放在资料末尾,用短语锚定回答范围。Gemini 3.1 Pro 的思考级别、结构化输出与工具配置Google 的官方文档将 thinking_level、默认 temperature、工具调用和 JSON schema 放在同一配置检查中,并区分 customtools 端点。Claude 主导规划、Gemini 隔离执行的 Spec 驱动编程工作流开发者论坛案例让 Claude 负责规格拆解与审计、Gemini 3.1 Pro 在新会话中隔离执行,再回到审计环节核对改动。Gemini 3.1 Pro 开源项目架构对齐与多模型结对编程工作流该 Antigravity 社区案例把成熟开源项目的架构资料注入 Gemini 3.1 Pro,再用第二模型做交叉评审和架构对齐。