Tabbit
活动资源博客模型
Tabbit LogoTabbit

Tabbit — 为你工作的 AI 浏览器

主题资源

  • AI Browser Resources
  • Agentic Browser Resources
  • Browser Downloads and Install Guides
  • Browser Comparisons
  • AI Browser Alternatives
  • Browser Productivity Resources

热门指南

  • AI Browser
  • Agentic Browser Download
  • Best AI Browser 2026: Top 9 Tested & Ranked
  • AI Browser Download
  • Free AI Browser
  • Best AI Browser 2026
  • AI Browser Comparison 2026
  • AI Browser for Windows
  • AI Browser for Mac
  • Chrome Alternative 2026

活动

  • 别装了,你在《牛来》里早有原型
  • Tabbit 妙招大赛
  • KPOP SBTI 饭圈人格测试
  • Tabbit 校园共创者计划
  • fifi 的论文文献妙招精选
  • 用户问卷

关于

  • Tabbit 博客
  • 媒体报道
简体中文
简体中文English
测评与证据

Gemini 3.5 Flash · 媒体来源 · 独立测量

Gemini 3.5 Flash:Appwrite Arena 技能上下文与 Agent 任务对照

Appwrite Arena 的 2026-05-20 运行记录显示,加载 Appwrite Skill 后 freeform 得分从 77.5% 升到 91.9%,说明上下文文档会改变 Agent 结果。

待验证:本次未能重新核实原文。下方历史数字不代表已核实的当前结果。

媒体来源独立测量编辑日期 2026-09-20

测试条件速查

来源具体观察
Appwrite Arena,2026-05-20 运行;报告 freeform、MCP/工具、多模态和速度维度。
已公布条件
Skill 上下文使 freeform 从 77.5% 提升至 91.9%;任务集与运行配置属于 Appwrite Arena。

关键数据与适用场景

一句话结论

Appwrite 的公开 Arena 结果显示 Gemini 3.5 Flash 在 MCP/工具、多模态和速度上有优势,而加载 Appwrite Skill 后 freeform 得分从 77.5% 升到 91.9%,说明文档上下文对其当前知识覆盖有显著影响。

适用场景

  • 适合的任务:SDK/API Agent、MCP 工具调用、文档驱动的后端开发、吞吐优先的多模态和短迭代工作流。

  • 不适合的任务:高难学术推理、没有领域文档的最新 API 猜测,或把 Appwrite 专项结果外推到所有软件工程任务。

  • 适用的模型版本:Gemini 3.5 Flash;文章对比 Gemini 3 Flash、Gemini 3.1 Pro、Claude Sonnet 4.6、Claude Opus 4.7、GPT-5.5 等。

  • 适用的客户端、Agent 或 API:Gemini API、Appwrite API/Docs MCP、Appwrite Skills;文章建议 Cursor、Google AI Studio、Google Antigravity 或直接 API。

  • 推荐的推理档位和参数:文章说明主要 Google 数字使用 high thinking;Arena 运行参数和 temperature 未在文章中完整列出,不能据此固定。

测试环境

  • 基准:Appwrite Arena,文章描述为开源、覆盖 191 个问题、9 个 Appwrite 服务类别;每个模型分别在“加载 Skill”和“不加载 Skill”两种条件下运行。

  • 任务类型:Appwrite Foundation、Auth、Databases、Functions、Storage、Sites、Messaging、Realtime、CLI;含选择题和 freeform。

  • 对照模型:GPT 5.5、Claude Opus 4.7、Qwen 3.6 Plus、Kimi K2.6、DeepSeek V4 Flash、Gemini 3.1 Pro 等。

  • 评测维度:overall、MCQ、freeform、成本和耗时;文章链接了 Arena GitHub 和公开 leaderboard。

输入/配置

  • “With Skills”把相关 Appwrite 文档放进上下文;“Without Skills”只使用模型内置知识。

  • 文章报告 2026-05-20 运行;未公开完整问题集快照、OpenRouter 请求体、随机种子、temperature、每题 token 和评委提示。

  • 文章另引用 Google model card 和 Artificial Analysis,需与 Appwrite Arena 结果分开理解。

结果数据

Google/模型卡对照(文章转录)

基准Gemini 3.5 Flash主要结果
Terminal-Bench 2.1(Terminus-2)76.2%GPT-5.5 78.2%,Gemini 3.1 Pro 70.3%,Opus 4.7 66.1%
SWE-Bench Pro55.1%Opus 4.7 64.3%,GPT-5.5 58.6%,Gemini 3.1 Pro 54.2%
MCP Atlas83.6%GPT-5.5 75.3%,Opus 4.7 79.1%,Gemini 3.1 Pro 78.2%
Toolathlon56.5%GPT-5.5 55.6%
OSWorld-Verified78.4%GPT-5.5 78.7%,Opus 4.7 78.0%,Gemini 3.1 Pro 76.2%
Finance Agent v257.9%GPT-5.5 51.8%,Opus 4.7 51.5%,Gemini 3.1 Pro 43.0%
CharXiv Reasoning84.2%GPT-5.5 84.1%,Gemini 3.1 Pro 83.3%
MMMU-Pro83.6%GPT-5.5 81.2%,Gemini 3.1 Pro 80.5%
Humanity’s Last Exam40.2%Opus 4.7 46.9%,GPT-5.5 41.4%,Gemini 3.1 Pro 44.4%

Appwrite Arena(2026-05-20)

条件OverallMCQFreeform成本时长
With Skills96.2096.9091.90$3.7820 分钟
Without Skills90.7092.9077.50$1.1413 分钟

文章据此计算:Skill 使 freeform 提升 14.4 个百分点;with-Skills 条件下 Gemini 3.5 Flash 比同表多数高分模型更快,但 GPT-5.5、Claude Opus 4.7 的整体分数仍更高。

Artificial Analysis(文章转录)

  • Intelligence Index:55.3,147 个模型中排名 #7。

  • 速度:278 output tokens/s,同价位排名 #2。

  • 完整指数输出量:73M tokens;整套评估成本 $1,552。

  • 文章报告 hallucination measure 为 61%,并强调 token 量和价格共同决定重推理任务成本。

结论

Gemini 3.5 Flash 适合速度、工具和上下文文档比纯内置知识更重要的 Agent。Appwrite 专项实验最有复用价值的结论不是绝对排名,而是“把当前 API 文档作为 Skill 提供给模型”会显著改善 freeform 工具任务;对高难推理和正确性优先编码,应保留更强模型作为对照或升级路径。

局限

  • Appwrite Arena 是领域专项基准;结果不能代表一般代码、数学或开放域能力。

  • 文章虽然给出问题数量、Skill 条件、成本和时长,但未公开完整请求配置、评分提示、随机种子和原始逐题结果。

  • Appwrite GitHub 仓库当前 README 显示的是另一版 70 题(57 选择题 + 13 freeform、7 类别)且模型列表不含 Gemini 3.5 Flash;这与文章所称 191 题/9 类别存在版本差异,复现时必须锁定文章对应的 benchmark commit 或数据快照。

  • Artificial Analysis 与 Appwrite Arena 的分数、价格和任务定义不同,不能合并计算成单一能力分数。

复现步骤

  1. 固定 Appwrite Arena 的题集版本、Skills 文件、模型 ID、OpenRouter 路由、thinking level 和评分器。

  2. 为 Gemini 3.5 Flash 各运行 with-Skills/without-Skills 两组,保存每题响应、MCQ 判分、freeform 评委输出、token、成本和时长。

  3. 至少重复 3–5 次,报告均值、方差和失败类别;单次 overall 不足以判断生产稳定性。

  4. 额外在目标项目自己的 SDK/MCP 任务集上做 A/B,比较文档注入的增益是否仍存在。

来源摘录或观察(仅做合规短引)

文章将 Gemini 3.5 Flash 概括为“speed is the column where it dominates”,同时承认速度不等于 coding intelligence。最可复用的工程观察是:该模型在 Appwrite freeform 任务上对 Skills 文档依赖明显。

能支持的判断

  • 支持把文档上下文作为独立变量评估

不能支持的判断

  • 支持把文档上下文作为独立变量评估;不支持将该提升解释为裸模型能力或所有任务的固定增益。

方法、局限和复现

本文中的数字、任务集、推理档位和客户端条件只在所列来源及采集时点内成立。不同版本、不同 harness 或不同提供商的数据不能直接并排比较;未公开的参数保持未知。

需要复测时,请固定模型版本、提供商或客户端、推理档位、工具、任务集版本、样本数和采集日期,并记录失败、重试与人工修正。完整方法和复现步骤见下方来源笔记。

原始来源

Appwrite Blog / Appwrite Arena · Atharva Deosthale · 原文发布日期 2026-05-20 · 本站编辑日期 2026-09-20

打开原始来源

Gemini 3.5 Flash

在 Tabbit 中比较 Gemini 3.5 Flash

下载 Tabbit 客户端后检查模型可用性

模型深度阅读

总览 · 简体中文

Gemini 3.5 Flash 是什么:价格、生命周期与获取方式

说明 Gemini 3.5 Flash 的 1M 上下文、多模态工具、API 价格、legacy 状态、证据边界与迁移选择。

相关评测

Gemini 3.5 Flash:Google 官方后续发布中的效率与能力对照Google 后续发布把 Gemini 3.5 Flash 作为 Gemini 3.6 Flash 的对照基线;DeepSWE、MLE Bench、OSWorld-Verified 与 GDPval-AA v2 的差异属于官方 harness 结果。Gemini 3.5 Flash:十组保存任务与五次重复的社区现场报告Reddit 用户在约 10 组保存任务上重复 Gemini 3.5 Flash 五次,报告真实任务均值低于旧版本;这是个人现场报告而非受控 benchmark。Gemini 3.5 Flash:结构化提示、接地和 Agent 系统指令Google 官方建议把 Gemini 3.5 Flash 的目标、上下文、任务边界、输出格式和接地工具写成结构化提示,再用代表样本迭代。Gemini 3.5 Flash:思考等级与 Gemini API 配置官方 Thinking 文档说明 Gemini 3.5 Flash 的 effort 档位、多轮 parts/思维签名保留和 API 参数边界。