Tabbit
活动资源博客模型
Tabbit LogoTabbit

Tabbit — 为你工作的 AI 浏览器

主题资源

  • AI Browser Resources
  • Agentic Browser Resources
  • Browser Downloads and Install Guides
  • Browser Comparisons
  • AI Browser Alternatives
  • Browser Productivity Resources

热门指南

  • AI Browser
  • Agentic Browser Download
  • Best AI Browser 2026: Top 9 Tested & Ranked
  • AI Browser Download
  • Free AI Browser
  • Best AI Browser 2026
  • AI Browser Comparison 2026
  • AI Browser for Windows
  • AI Browser for Mac
  • Chrome Alternative 2026

活动

  • 别装了,你在《牛来》里早有原型
  • Tabbit 妙招大赛
  • KPOP SBTI 饭圈人格测试
  • Tabbit 校园共创者计划
  • fifi 的论文文献妙招精选
  • 用户问卷

关于

  • Tabbit 博客
  • 媒体报道
测评
媒体Gemini 3.1 Pro

MindStudio 对 GPT-5.4、Claude Opus 4.6 与 Gemini 3.1 Pro 的三旗舰全任务实测

原始来源

MindStudio Blog

作者Luis Chavez-Mattos(Director of Product, MindStudio)

原文日期2026-03-15

Tabbit 整理2026-08-20

查看原文

一句话结论

在涵盖代码、长篇创意写作、研究生级推理、数学与长文档综合的统一多模型横评中,Gemini 3.1 Pro 在 200 万 token 超长上下文和输出成本(比 Claude 便宜 60%)上占据压倒性优势,但在复杂多文件代码修复与文学级主观写作上略逊于 GPT-5.4 与 Claude Opus 4.6。

测试环境

  • 平台:MindStudio 模型评测与多 Agent 编排流水线。

  • 对比模型:OpenAI GPT-5.4、Anthropic Claude Opus 4.6、Google Gemini 3.1 Pro。

  • 评测项目:

    • 标准基准:HumanEval(164 道 Python pass@1)、SWE-bench Verified(真实 GitHub Issue 解决率)、MATH(竞赛级数学)、GPQA Diamond(高难度科学推理)、MMLU Pro(57 个学术领域综合)。

    • 定制实测任务:5,000 词长篇文学写作、品牌营销文案(严格规则遵循)、120k token 多文档研究综合报告、6 类 SVG 空间与视觉代码生成。

  • 评判方式:客观代码/数学自动判定;主观任务由 3 位独立人类评审员盲评,评分维度包括行文质感、指令遵循与叙事连贯性。

输入/配置

  • 所有模型在标准测试中采用完全一致的 Prompt 与默认 Temperature。

  • 长文档综合任务统一输入 80,000~150,000 tokens 的多篇研报与学术资料。

  • 计价与参数对照:

    • GPT-5.4: 输入 $15.00 / 1M,输出 $60.00 / 1M,上下文 128k tokens,生成速率 ~80 TPS

    • Claude Opus 4.6: 输入 $20.00 / 1M,输出 $100.00 / 1M,上下文 200k tokens,生成速率 ~55 TPS

    • Gemini 3.1 Pro: 输入 $12.50 / 1M,输出 $37.50 / 1M,上下文 2M tokens,生成速率 ~75 TPS

结果数据

1. 标准化基准对比

评测基准GPT-5.4Claude Opus 4.6Gemini 3.1 Pro分析与观察
HumanEval (pass@1)93.1%90.4%89.2%Gemini 在歧义 Prompt 下易过早锁定错误假设;明确算法题表现接近
SWE-bench Verified52.7%50.3%48.1%真实跨文件仓库修复,Gemini 依靠大上下文部分缩小差距
GPQA Diamond83.9%87.4%82.1%Claude 在多步深层科学推导上领先
MMLU Pro92.3%91.7%90.8%三者知识广度均达到极高水准(极小差距)
MATH94.8%94.1%94.6%竞赛数学三者基本持平(差距在误差范围内)

2. 定制长篇写作与 SVG 生成(1~10 分,3 人盲评均分)

测试任务GPT-5.4Claude Opus 4.6Gemini 3.1 Pro核心结论
5000 词长篇文学写作7.88.67.3Gemini 能完成剧情要求但文笔较机械,Claude 在节奏与潜台词上最佳
严格限制营销文案8.28.07.5GPT-5.4 负向约束遵循最严,Gemini 文风偏通用
120k token 研报综合良好(局部深层连接遗漏)优秀(跨文档整合最佳)扎实(信息检索完整但总结偏通用)Gemini 在百万级单次吞吐无压力,Claude 在 200k 内细腻度胜出
复杂 SVG 与空间排版优秀(图层与 Z-index 最佳)良好(动画与流程图最佳)一般(易添加冗余 viewBox 需人工清洗)Gemini 在复杂空间排版 SVG 代码生成上略有短板

结论

MindStudio 给出清晰的模型选型边界建议:

  1. 代码与工程落地默认首选:GPT-5.4(准确率最高、速度最快)。

  2. 高质量长篇写作与极难科研推理:Claude Opus 4.6(行文质感与 GPQA 领先)。

  3. 超长文档检索、代码库通读与生产级大吞吐成本敏感任务:Gemini 3.1 Pro(2M 级上下文、输出成本仅为 Claude 的 37.5%,最具工程性价比)。

局限

  • 实测文章发表于 2026 年 3 月中旬,各模型后续的微调更新可能导致分数微调。

  • 主观评分受限于 3 位评审员的偏好分布,虽然采用盲评但文学评价天然存在主观性。

复现步骤

  1. 准备 HumanEval 与 SWE-bench Verified 标准测试环境。

  2. 构造 5,000 词文学 Brief 与 120k token 多文档数据集,分别固定三家模型的 API 入口。

  3. 统计 pass@1、运行成本、实际吞吐 TPS,并组织三组评审员进行盲评归一化评分。

Tabbit 小编提醒

本文是第三方资料导航。测试环境、模型版本和主观体验可能不同,请以原文为准。

Gemini 3.1 Pro

在 Tabbit 中使用并对比模型

Gemini 3.1 Pro

相关测评

官方Google Blog / Gemini models2026-02-19

Gemini 3.1 Pro 官方发布:ARC-AGI-2 与产品定位基线

官方Google AI Developers Forum2026-04-07

Google AI 开发者论坛:4000 词复杂系统提示词下 Gemini 3.1 Pro 的指令遵循实测

媒体LayerLens / Stratix2026-02-19

LayerLens Stratix 对 Gemini 3.1 Pro Preview 的六类基准实测

媒体Artificial Analysis2026-02-19

Artificial Analysis 对 Gemini 3.1 Pro Preview 的 182 模型综合基准与端到端延迟实测

Gemini 3.1 Pro

相关提示词

官方Google AI for Developers / Gemini 3 Developer Guide2026-08-04

Gemini 3.1 Pro 的简洁指令与长上下文定位提示

官方Google AI for Developers / Gemini 3 Developer Guide 与 Gemini 3.1 Pro Preview 模型页2026-02

Gemini 3.1 Pro 的思考级别、结构化输出与工具配置

官方Google AI Developers Forum2026-04-07

Claude 主导规划、Gemini 隔离执行的 Spec 驱动编程工作流

社区GitHub / asgeirtj/systempromptsleaks2026-05-18

Gemini 3.1 Pro Web 端官方系统提示词与交互组件规范