在涵盖代码、长篇创意写作、研究生级推理、数学与长文档综合的统一多模型横评中,Gemini 3.1 Pro 在 200 万 token 超长上下文和输出成本(比 Claude 便宜 60%)上占据压倒性优势,但在复杂多文件代码修复与文学级主观写作上略逊于 GPT-5.4 与 Claude Opus 4.6。
平台:MindStudio 模型评测与多 Agent 编排流水线。
对比模型:OpenAI GPT-5.4、Anthropic Claude Opus 4.6、Google Gemini 3.1 Pro。
评测项目:
标准基准:HumanEval(164 道 Python pass@1)、SWE-bench Verified(真实 GitHub Issue 解决率)、MATH(竞赛级数学)、GPQA Diamond(高难度科学推理)、MMLU Pro(57 个学术领域综合)。
定制实测任务:5,000 词长篇文学写作、品牌营销文案(严格规则遵循)、120k token 多文档研究综合报告、6 类 SVG 空间与视觉代码生成。
评判方式:客观代码/数学自动判定;主观任务由 3 位独立人类评审员盲评,评分维度包括行文质感、指令遵循与叙事连贯性。
所有模型在标准测试中采用完全一致的 Prompt 与默认 Temperature。
长文档综合任务统一输入 80,000~150,000 tokens 的多篇研报与学术资料。
计价与参数对照:
GPT-5.4: 输入 $15.00 / 1M,输出 $60.00 / 1M,上下文 128k tokens,生成速率 ~80 TPS
Claude Opus 4.6: 输入 $20.00 / 1M,输出 $100.00 / 1M,上下文 200k tokens,生成速率 ~55 TPS
Gemini 3.1 Pro: 输入 $12.50 / 1M,输出 $37.50 / 1M,上下文 2M tokens,生成速率 ~75 TPS
| 评测基准 | GPT-5.4 | Claude Opus 4.6 | Gemini 3.1 Pro | 分析与观察 |
|---|---|---|---|---|
| HumanEval (pass@1) | 93.1% | 90.4% | 89.2% | Gemini 在歧义 Prompt 下易过早锁定错误假设;明确算法题表现接近 |
| SWE-bench Verified | 52.7% | 50.3% | 48.1% | 真实跨文件仓库修复,Gemini 依靠大上下文部分缩小差距 |
| GPQA Diamond | 83.9% | 87.4% | 82.1% | Claude 在多步深层科学推导上领先 |
| MMLU Pro | 92.3% | 91.7% | 90.8% | 三者知识广度均达到极高水准(极小差距) |
| MATH | 94.8% | 94.1% | 94.6% | 竞赛数学三者基本持平(差距在误差范围内) |
| 测试任务 | GPT-5.4 | Claude Opus 4.6 | Gemini 3.1 Pro | 核心结论 |
|---|---|---|---|---|
| 5000 词长篇文学写作 | 7.8 | 8.6 | 7.3 | Gemini 能完成剧情要求但文笔较机械,Claude 在节奏与潜台词上最佳 |
| 严格限制营销文案 | 8.2 | 8.0 | 7.5 | GPT-5.4 负向约束遵循最严,Gemini 文风偏通用 |
| 120k token 研报综合 | 良好(局部深层连接遗漏) | 优秀(跨文档整合最佳) | 扎实(信息检索完整但总结偏通用) | Gemini 在百万级单次吞吐无压力,Claude 在 200k 内细腻度胜出 |
| 复杂 SVG 与空间排版 | 优秀(图层与 Z-index 最佳) | 良好(动画与流程图最佳) | 一般(易添加冗余 viewBox 需人工清洗) | Gemini 在复杂空间排版 SVG 代码生成上略有短板 |
MindStudio 给出清晰的模型选型边界建议:
代码与工程落地默认首选:GPT-5.4(准确率最高、速度最快)。
高质量长篇写作与极难科研推理:Claude Opus 4.6(行文质感与 GPQA 领先)。
超长文档检索、代码库通读与生产级大吞吐成本敏感任务:Gemini 3.1 Pro(2M 级上下文、输出成本仅为 Claude 的 37.5%,最具工程性价比)。
实测文章发表于 2026 年 3 月中旬,各模型后续的微调更新可能导致分数微调。
主观评分受限于 3 位评审员的偏好分布,虽然采用盲评但文学评价天然存在主观性。
准备 HumanEval 与 SWE-bench Verified 标准测试环境。
构造 5,000 词文学 Brief 与 120k token 多文档数据集,分别固定三家模型的 API 入口。
统计 pass@1、运行成本、实际吞吐 TPS,并组织三组评审员进行盲评归一化评分。
Gemini 3.1 Pro