Tabbit
活动资源博客模型
Tabbit LogoTabbit

Tabbit — 为你工作的 AI 浏览器

主题资源

  • AI Browser Resources
  • Agentic Browser Resources
  • Browser Downloads and Install Guides
  • Browser Comparisons
  • AI Browser Alternatives
  • Browser Productivity Resources

热门指南

  • AI Browser
  • Agentic Browser Download
  • Best AI Browser 2026: Top 9 Tested & Ranked
  • AI Browser Download
  • Free AI Browser
  • Best AI Browser 2026
  • AI Browser Comparison 2026
  • AI Browser for Windows
  • AI Browser for Mac
  • Chrome Alternative 2026

活动

  • 别装了,你在《牛来》里早有原型
  • Tabbit 妙招大赛
  • KPOP SBTI 饭圈人格测试
  • Tabbit 校园共创者计划
  • fifi 的论文文献妙招精选
  • 用户问卷

关于

  • Tabbit 博客
  • 媒体报道
测评
媒体Gemini 3.6 Flash

Gemini 3.6 Flash:PromptsLove 在 OpenCode 中与 Kimi K3 的同配置实测

原始来源

PromptsLove

作者Ramanpal Singh

Tabbit 整理2026-08-19

查看原文

一句话结论

在作者声称相同 OpenCode harness、相同 prompt、Gemini 3.6 Flash high thinking 与 Kimi K3 对照的四项任务中,Gemini 的表单应用功能可用、视频分析明显占优,但前端多要求遵循和赛车游戏交互失败,说明“低价多模态强”与“精细交互代码可靠”是两条不同能力轴。

适用场景

  • 适合的任务:视频/音频/文档直接分析、结构化表单后端功能、成本敏感的研究和多模态 Agent。

  • 不适合的任务:前端视觉细节、复杂交互游戏、对每个要求都必须逐项完成的单轮生成。

  • 适用的模型版本:Gemini 3.6 Flash;对照为 Kimi K3,不能把对照差异当成绝对排名。

  • 适用的客户端、Agent 或 API:OpenCode;作者另在 Gemini app 中测试视频上传。

  • 推荐的推理档位和参数:作者使用 high thinking;文章称两模型采用相同 setup,但未公开完整系统 prompt、temperature、工具 schema 和原始 prompt 文件。

测试环境

  • 作者使用 OpenCode coding harness,Gemini 3.6 Flash 设为 high thinking;Kimi K3 使用相同设置以减少 harness 偏差。

  • 四项任务:前端 landing page、Neo Circuit 浏览器赛车游戏、FormCraft AI 表单构建器、两分钟 Instagram 视频分析。

  • 作者说明每个 prompt 只发送一次,不反复重试到满意;但对照结果部分复用此前 Kimi K3 会话输出。

输入/配置

  • 前端任务要求 scroll scatter、scroll pointers、animated counters、parallax 和 responsive palette。

  • 赛车游戏要求 vehicle picker、start sequence、controls 和 nitro boost。

  • FormCraft 要求登录/注册、三类角色 dashboard、表单提交、CSV export 和编辑。

  • 视频任务是上传两分钟 Instagram 视频,分析 hook、engagement、retention 并生成同模式脚本。

  • 价格对照:Gemini 输入 $1.50 / 输出 $7.50 每百万 tokens;Kimi K3 为 $3 / $15。

结果数据

任务Gemini 3.6 FlashKimi K3结论
前端设计漏掉多项交互要求,响应式和视觉不佳按要求实现Kimi 胜
Neo Circuitnitro 与驾驶 controls 不工作,图形弱可选车、Start、驾驶和 nitro 工作Kimi 胜
FormCraft表单、登录、CSV 和编辑功能可用,但 dashboard 视觉过时本轮未测试只能证明 Gemini 功能可用,不能做胜负比较
视频分析原生接收视频,约两分钟内给出分析和脚本作者称不能直接接收视频Gemini 胜

结论

这是一项有明确任务和一次性发送规则的 field benchmark,最值得复用的是按工作类型路由:多模态文件优先 Gemini,精细前端/交互代码必须做视觉与行为回归,并准备编码型模型兜底。作者还建议使用 thinking_level 而不是旧式手动 chain-of-thought,并减少旧采样参数,但这些配置应以 Google 当前 API 文档为准。

局限

  • 对照并非完全同时新跑:Kimi 部分结果复用此前会话;作者没有公开所有原始 prompt 和产物链接。

  • 样本只有四项任务、每项一次;结果不能代表所有代码、游戏或视频工作流。

  • 文章大量引用 Google 官方 benchmark 和其他二手来源,实测与官方数字必须分开。

  • 视觉“过时”和“粗糙”带有作者主观评分;功能可用性也没有公开自动化测试日志。

复现步骤

  1. 在 OpenCode 中固定相同版本、权限、工具、上下文和 high thinking 配置,分别接入 Gemini 3.6 Flash 与 Kimi K3。

  2. 使用同一份前端、游戏、表单和视频 prompt,各运行一次并保存完整产物、截图、控制台日志和 token/耗时。

  3. 用任务清单逐项验收:每个视觉要求、每个交互事件、表单数据落盘/导出、视频时间线和脚本准确性。

  4. 再用 medium/low thinking 做成本曲线,报告每项通过率、人工修订时间和每任务成本,不仅记录“看起来更好”。

原始证据与数据

文章公开了 OpenCode、高 thinking、四项任务、一次发送规则、输入/输出价格和每项任务的具体失败/成功描述;没有公开可下载 prompt 文件,因此“同配置”可复核程度低于完整开源测试。

来源摘录或观察(仅做合规短引)

作者将实测结论概括为 “mixed results”;这比把四项任务总结成单一胜负更符合其数据边界。

Tabbit 小编提醒

本文是第三方资料导航。测试环境、模型版本和主观体验可能不同,请以原文为准。

Gemini 3.6 Flash

在 Tabbit 中使用并对比模型

Gemini 3.6 Flash

相关测评

官方Google Blog2026-07-21

Gemini 3.6 Flash:Google 官方发布性能与 Agent 安全说明

官方Google DeepMind2026-07-21

Gemini 3.6 Flash:Google DeepMind 模型卡的基准、输入能力与限制

社区Reddit,r/googleantigravity2026-07-22

Gemini 3.6 Flash:Reddit 社区对验证诚实与监督成本的体验

Gemini 3.6 Flash

相关提示词

官方Google AI for Developers2026-07-30

Gemini 3.6 Flash:Google 官方 API 能力与 thinking 配置清单

媒体PromptsRush2026-07-25

Gemini 3.6 Flash:PromptsRush 的长上下文、多模态与 Agent 提示词