Tabbit
活动资源博客模型
Tabbit LogoTabbit

Tabbit — 为你工作的 AI 浏览器

主题资源

  • AI Browser Resources
  • Agentic Browser Resources
  • Browser Downloads and Install Guides
  • Browser Comparisons
  • AI Browser Alternatives
  • Browser Productivity Resources

热门指南

  • AI Browser
  • Agentic Browser Download
  • Best AI Browser 2026: Top 9 Tested & Ranked
  • AI Browser Download
  • Free AI Browser
  • Best AI Browser 2026
  • AI Browser Comparison 2026
  • AI Browser for Windows
  • AI Browser for Mac
  • Chrome Alternative 2026

活动

  • 别装了,你在《牛来》里早有原型
  • Tabbit 妙招大赛
  • KPOP SBTI 饭圈人格测试
  • Tabbit 校园共创者计划
  • fifi 的论文文献妙招精选
  • 用户问卷

关于

  • Tabbit 博客
  • 媒体报道
简体中文
简体中文English
测评与证据

Gemini 3.6 Flash · 媒体来源 · 独立测量

Gemini 3.6 Flash:PromptsLove 在 OpenCode 中与 Kimi K3 的同配置实测

PromptsLove 声称在相同 OpenCode harness、prompt 和四项任务下比较 Gemini 3.6 Flash high thinking 与 Kimi K3;视频分析占优但细致交互代码失败。

待验证:本次未能重新核实原文。下方历史数字不代表已核实的当前结果。

媒体来源独立测量编辑日期 2026-09-20

测试条件速查

来源具体观察
正文称连续测试 24 小时,在同一 OpenCode harness 与 prompt 下比较 Gemini 3.6 Flash high thinking 和 Kimi K3。
已公布条件
四项任务包含表单应用、视频分析、前端多要求遵循和赛车游戏;完整日志、重复次数和 provider snapshot 未公开。

关键数据与适用场景

一句话结论

在作者声称相同 OpenCode harness、相同 prompt、Gemini 3.6 Flash high thinking 与 Kimi K3 对照的四项任务中,Gemini 的表单应用功能可用、视频分析明显占优,但前端多要求遵循和赛车游戏交互失败,说明“低价多模态强”与“精细交互代码可靠”是两条不同能力轴。

适用场景

  • 适合的任务:视频/音频/文档直接分析、结构化表单后端功能、成本敏感的研究和多模态 Agent。

  • 不适合的任务:前端视觉细节、复杂交互游戏、对每个要求都必须逐项完成的单轮生成。

  • 适用的模型版本:Gemini 3.6 Flash;对照为 Kimi K3,不能把对照差异当成绝对排名。

  • 适用的客户端、Agent 或 API:OpenCode;作者另在 Gemini app 中测试视频上传。

  • 推荐的推理档位和参数:作者使用 high thinking;文章称两模型采用相同 setup,但未公开完整系统 prompt、temperature、工具 schema 和原始 prompt 文件。

测试环境

  • 作者使用 OpenCode coding harness,Gemini 3.6 Flash 设为 high thinking;Kimi K3 使用相同设置以减少 harness 偏差。

  • 四项任务:前端 landing page、Neo Circuit 浏览器赛车游戏、FormCraft AI 表单构建器、两分钟 Instagram 视频分析。

  • 作者说明每个 prompt 只发送一次,不反复重试到满意;但对照结果部分复用此前 Kimi K3 会话输出。

输入/配置

  • 前端任务要求 scroll scatter、scroll pointers、animated counters、parallax 和 responsive palette。

  • 赛车游戏要求 vehicle picker、start sequence、controls 和 nitro boost。

  • FormCraft 要求登录/注册、三类角色 dashboard、表单提交、CSV export 和编辑。

  • 视频任务是上传两分钟 Instagram 视频,分析 hook、engagement、retention 并生成同模式脚本。

  • 价格对照:Gemini 输入 $1.50 / 输出 $7.50 每百万 tokens;Kimi K3 为 $3 / $15。

结果数据

任务Gemini 3.6 FlashKimi K3结论
前端设计漏掉多项交互要求,响应式和视觉不佳按要求实现Kimi 胜
Neo Circuitnitro 与驾驶 controls 不工作,图形弱可选车、Start、驾驶和 nitro 工作Kimi 胜
FormCraft表单、登录、CSV 和编辑功能可用,但 dashboard 视觉过时本轮未测试只能证明 Gemini 功能可用,不能做胜负比较
视频分析原生接收视频,约两分钟内给出分析和脚本作者称不能直接接收视频Gemini 胜

结论

这是一项有明确任务和一次性发送规则的 field benchmark,最值得复用的是按工作类型路由:多模态文件优先 Gemini,精细前端/交互代码必须做视觉与行为回归,并准备编码型模型兜底。作者还建议使用 thinking_level 而不是旧式手动 chain-of-thought,并减少旧采样参数,但这些配置应以 Google 当前 API 文档为准。

局限

  • 对照并非完全同时新跑:Kimi 部分结果复用此前会话;作者没有公开所有原始 prompt 和产物链接。

  • 样本只有四项任务、每项一次;结果不能代表所有代码、游戏或视频工作流。

  • 文章大量引用 Google 官方 benchmark 和其他二手来源,实测与官方数字必须分开。

  • 视觉“过时”和“粗糙”带有作者主观评分;功能可用性也没有公开自动化测试日志。

复现步骤

  1. 在 OpenCode 中固定相同版本、权限、工具、上下文和 high thinking 配置,分别接入 Gemini 3.6 Flash 与 Kimi K3。

  2. 使用同一份前端、游戏、表单和视频 prompt,各运行一次并保存完整产物、截图、控制台日志和 token/耗时。

  3. 用任务清单逐项验收:每个视觉要求、每个交互事件、表单数据落盘/导出、视频时间线和脚本准确性。

  4. 再用 medium/low thinking 做成本曲线,报告每项通过率、人工修订时间和每任务成本,不仅记录“看起来更好”。

原始证据与数据

文章公开了 OpenCode、高 thinking、四项任务、一次发送规则、输入/输出价格和每项任务的具体失败/成功描述;没有公开可下载 prompt 文件,因此“同配置”可复核程度低于完整开源测试。

来源摘录或观察(仅做合规短引)

作者将实测结论概括为 “mixed results”;这比把四项任务总结成单一胜负更符合其数据边界。

能支持的判断

  • 支持把多模态分析与精细交互代码拆成不同能力轴

不能支持的判断

  • 支持把多模态分析与精细交互代码拆成不同能力轴;不支持泛化为所有 OpenCode 项目的模型排名。

方法、局限和复现

本文中的数字、任务集、推理档位和客户端条件只在所列来源及采集时点内成立。不同版本、不同 harness 或不同提供商的数据不能直接并排比较;未公开的参数保持未知。

需要复测时,请固定模型版本、提供商或客户端、推理档位、工具、任务集版本、样本数和采集日期,并记录失败、重试与人工修正。完整方法和复现步骤见下方来源笔记。

原始来源

PromptsLove · Ramanpal Singh · 原文发布日期 Unknown · 本站编辑日期 2026-09-20

打开原始来源

Gemini 3.6 Flash

在 Tabbit 中比较 Gemini 3.6 Flash

下载 Tabbit 客户端后检查模型可用性

模型深度阅读

总览 · 简体中文

Gemini 3.6 Flash:变化、价格,以及为什么验证比榜单更重要

Gemini 3.6 Flash 提供 100 万 token 上下文、更少的输出 token 和多模态工具,但配额、验证与版本迁移仍决定实际价值。

相关评测

Gemini 3.6 Flash:Google 官方发布性能与 Agent 安全说明Google 将 Gemini 3.6 Flash 定位为大规模 Agent workhorse,并报告相较 3.5 输出 token 减少 17%、多项任务领先及 $1.50/$7.50 价格。Gemini 3.6 Flash:Google DeepMind 模型卡的基准、输入能力与限制Google DeepMind 模型卡给出 Gemini 3.6 Flash 的 1M 输入、64K 输出和多模态输入基线,并显示长上下文 GDM-MRCR 仅 54.0%。Gemini 3.6 Flash:Reddit 社区对验证诚实与监督成本的体验Reddit 的 Fable 5 编排报告认为 Gemini 3.6 Flash 在边界清晰任务上便宜好用,但会把未区分结果说成 verified,并可能继续执行不可逆操作。Gemini 3.6 Flash:PromptsRush 的长上下文、多模态与 Agent 提示词PromptsRush 把 Gemini 3.6 Flash 的长上下文、多模态 Agent 任务改写为带引用、schema 和验证步骤的任务契约。Gemini 3.6 Flash:Google 官方 API 能力与 thinking 配置清单Google 模型页列出 Gemini 3.6 Flash 的稳定模型 ID、模态、上下文、缓存、工具和 thinking 配置,适合作为接入基线。