Tabbit
活动资源博客模型
Tabbit LogoTabbit

Tabbit — 为你工作的 AI 浏览器

主题资源

  • AI Browser Resources
  • Agentic Browser Resources
  • Browser Downloads and Install Guides
  • Browser Comparisons
  • AI Browser Alternatives
  • Browser Productivity Resources

热门指南

  • AI Browser
  • Agentic Browser Download
  • Best AI Browser 2026: Top 9 Tested & Ranked
  • AI Browser Download
  • Free AI Browser
  • Best AI Browser 2026
  • AI Browser Comparison 2026
  • AI Browser for Windows
  • AI Browser for Mac
  • Chrome Alternative 2026

活动

  • 别装了,你在《牛来》里早有原型
  • Tabbit 妙招大赛
  • KPOP SBTI 饭圈人格测试
  • Tabbit 校园共创者计划
  • fifi 的论文文献妙招精选
  • 用户问卷

关于

  • Tabbit 博客
  • 媒体报道
测评
媒体Gemini 3.5 Flash

Gemini 3.5 Flash:Appwrite Arena 技能上下文与 Agent 任务对照

原始来源

Appwrite Blog / Appwrite Arena

作者Atharva Deosthale

原文日期2026-05-20

Tabbit 整理2026-08-19

查看原文

一句话结论

Appwrite 的公开 Arena 结果显示 Gemini 3.5 Flash 在 MCP/工具、多模态和速度上有优势,而加载 Appwrite Skill 后 freeform 得分从 77.5% 升到 91.9%,说明文档上下文对其当前知识覆盖有显著影响。

适用场景

  • 适合的任务:SDK/API Agent、MCP 工具调用、文档驱动的后端开发、吞吐优先的多模态和短迭代工作流。

  • 不适合的任务:高难学术推理、没有领域文档的最新 API 猜测,或把 Appwrite 专项结果外推到所有软件工程任务。

  • 适用的模型版本:Gemini 3.5 Flash;文章对比 Gemini 3 Flash、Gemini 3.1 Pro、Claude Sonnet 4.6、Claude Opus 4.7、GPT-5.5 等。

  • 适用的客户端、Agent 或 API:Gemini API、Appwrite API/Docs MCP、Appwrite Skills;文章建议 Cursor、Google AI Studio、Google Antigravity 或直接 API。

  • 推荐的推理档位和参数:文章说明主要 Google 数字使用 high thinking;Arena 运行参数和 temperature 未在文章中完整列出,不能据此固定。

测试环境

  • 基准:Appwrite Arena,文章描述为开源、覆盖 191 个问题、9 个 Appwrite 服务类别;每个模型分别在“加载 Skill”和“不加载 Skill”两种条件下运行。

  • 任务类型:Appwrite Foundation、Auth、Databases、Functions、Storage、Sites、Messaging、Realtime、CLI;含选择题和 freeform。

  • 对照模型:GPT 5.5、Claude Opus 4.7、Qwen 3.6 Plus、Kimi K2.6、DeepSeek V4 Flash、Gemini 3.1 Pro 等。

  • 评测维度:overall、MCQ、freeform、成本和耗时;文章链接了 Arena GitHub 和公开 leaderboard。

输入/配置

  • “With Skills”把相关 Appwrite 文档放进上下文;“Without Skills”只使用模型内置知识。

  • 文章报告 2026-05-20 运行;未公开完整问题集快照、OpenRouter 请求体、随机种子、temperature、每题 token 和评委提示。

  • 文章另引用 Google model card 和 Artificial Analysis,需与 Appwrite Arena 结果分开理解。

结果数据

Google/模型卡对照(文章转录)

基准Gemini 3.5 Flash主要结果
Terminal-Bench 2.1(Terminus-2)76.2%GPT-5.5 78.2%,Gemini 3.1 Pro 70.3%,Opus 4.7 66.1%
SWE-Bench Pro55.1%Opus 4.7 64.3%,GPT-5.5 58.6%,Gemini 3.1 Pro 54.2%
MCP Atlas83.6%GPT-5.5 75.3%,Opus 4.7 79.1%,Gemini 3.1 Pro 78.2%
Toolathlon56.5%GPT-5.5 55.6%
OSWorld-Verified78.4%GPT-5.5 78.7%,Opus 4.7 78.0%,Gemini 3.1 Pro 76.2%
Finance Agent v257.9%GPT-5.5 51.8%,Opus 4.7 51.5%,Gemini 3.1 Pro 43.0%
CharXiv Reasoning84.2%GPT-5.5 84.1%,Gemini 3.1 Pro 83.3%
MMMU-Pro83.6%GPT-5.5 81.2%,Gemini 3.1 Pro 80.5%
Humanity’s Last Exam40.2%Opus 4.7 46.9%,GPT-5.5 41.4%,Gemini 3.1 Pro 44.4%

Appwrite Arena(2026-05-20)

条件OverallMCQFreeform成本时长
With Skills96.2096.9091.90$3.7820 分钟
Without Skills90.7092.9077.50$1.1413 分钟

文章据此计算:Skill 使 freeform 提升 14.4 个百分点;with-Skills 条件下 Gemini 3.5 Flash 比同表多数高分模型更快,但 GPT-5.5、Claude Opus 4.7 的整体分数仍更高。

Artificial Analysis(文章转录)

  • Intelligence Index:55.3,147 个模型中排名 #7。

  • 速度:278 output tokens/s,同价位排名 #2。

  • 完整指数输出量:73M tokens;整套评估成本 $1,552。

  • 文章报告 hallucination measure 为 61%,并强调 token 量和价格共同决定重推理任务成本。

结论

Gemini 3.5 Flash 适合速度、工具和上下文文档比纯内置知识更重要的 Agent。Appwrite 专项实验最有复用价值的结论不是绝对排名,而是“把当前 API 文档作为 Skill 提供给模型”会显著改善 freeform 工具任务;对高难推理和正确性优先编码,应保留更强模型作为对照或升级路径。

局限

  • Appwrite Arena 是领域专项基准;结果不能代表一般代码、数学或开放域能力。

  • 文章虽然给出问题数量、Skill 条件、成本和时长,但未公开完整请求配置、评分提示、随机种子和原始逐题结果。

  • Appwrite GitHub 仓库当前 README 显示的是另一版 70 题(57 选择题 + 13 freeform、7 类别)且模型列表不含 Gemini 3.5 Flash;这与文章所称 191 题/9 类别存在版本差异,复现时必须锁定文章对应的 benchmark commit 或数据快照。

  • Artificial Analysis 与 Appwrite Arena 的分数、价格和任务定义不同,不能合并计算成单一能力分数。

复现步骤

  1. 固定 Appwrite Arena 的题集版本、Skills 文件、模型 ID、OpenRouter 路由、thinking level 和评分器。

  2. 为 Gemini 3.5 Flash 各运行 with-Skills/without-Skills 两组,保存每题响应、MCQ 判分、freeform 评委输出、token、成本和时长。

  3. 至少重复 3–5 次,报告均值、方差和失败类别;单次 overall 不足以判断生产稳定性。

  4. 额外在目标项目自己的 SDK/MCP 任务集上做 A/B,比较文档注入的增益是否仍存在。

来源摘录或观察(仅做合规短引)

文章将 Gemini 3.5 Flash 概括为“speed is the column where it dominates”,同时承认速度不等于 coding intelligence。最可复用的工程观察是:该模型在 Appwrite freeform 任务上对 Skills 文档依赖明显。

Tabbit 小编提醒

本文是第三方资料导航。测试环境、模型版本和主观体验可能不同,请以原文为准。

Gemini 3.5 Flash

在 Tabbit 中使用并对比模型

Gemini 3.5 Flash

相关测评

官方Google Blog2026-07-21

Gemini 3.5 Flash:Google 官方后续发布中的效率与能力对照

社区Reddit / r/GeminiAI

Gemini 3.5 Flash:十组保存任务与五次重复的社区现场报告

Gemini 3.5 Flash

相关提示词

官方Google AI for Developers

Gemini 3.5 Flash:结构化提示、接地和 Agent 系统指令

官方Google AI for Developers2026-07-30

Gemini 3.5 Flash:思考等级与 Gemini API 配置