在作者声称相同 OpenCode harness、相同 prompt、Gemini 3.6 Flash high thinking 与 Kimi K3 对照的四项任务中,Gemini 的表单应用功能可用、视频分析明显占优,但前端多要求遵循和赛车游戏交互失败,说明“低价多模态强”与“精细交互代码可靠”是两条不同能力轴。
适合的任务:视频/音频/文档直接分析、结构化表单后端功能、成本敏感的研究和多模态 Agent。
不适合的任务:前端视觉细节、复杂交互游戏、对每个要求都必须逐项完成的单轮生成。
适用的模型版本:Gemini 3.6 Flash;对照为 Kimi K3,不能把对照差异当成绝对排名。
适用的客户端、Agent 或 API:OpenCode;作者另在 Gemini app 中测试视频上传。
推荐的推理档位和参数:作者使用 high thinking;文章称两模型采用相同 setup,但未公开完整系统 prompt、temperature、工具 schema 和原始 prompt 文件。
作者使用 OpenCode coding harness,Gemini 3.6 Flash 设为 high thinking;Kimi K3 使用相同设置以减少 harness 偏差。
四项任务:前端 landing page、Neo Circuit 浏览器赛车游戏、FormCraft AI 表单构建器、两分钟 Instagram 视频分析。
作者说明每个 prompt 只发送一次,不反复重试到满意;但对照结果部分复用此前 Kimi K3 会话输出。
前端任务要求 scroll scatter、scroll pointers、animated counters、parallax 和 responsive palette。
赛车游戏要求 vehicle picker、start sequence、controls 和 nitro boost。
FormCraft 要求登录/注册、三类角色 dashboard、表单提交、CSV export 和编辑。
视频任务是上传两分钟 Instagram 视频,分析 hook、engagement、retention 并生成同模式脚本。
价格对照:Gemini 输入 $1.50 / 输出 $7.50 每百万 tokens;Kimi K3 为 $3 / $15。
| 任务 | Gemini 3.6 Flash | Kimi K3 | 结论 |
|---|---|---|---|
| 前端设计 | 漏掉多项交互要求,响应式和视觉不佳 | 按要求实现 | Kimi 胜 |
| Neo Circuit | nitro 与驾驶 controls 不工作,图形弱 | 可选车、Start、驾驶和 nitro 工作 | Kimi 胜 |
| FormCraft | 表单、登录、CSV 和编辑功能可用,但 dashboard 视觉过时 | 本轮未测试 | 只能证明 Gemini 功能可用,不能做胜负比较 |
| 视频分析 | 原生接收视频,约两分钟内给出分析和脚本 | 作者称不能直接接收视频 | Gemini 胜 |
这是一项有明确任务和一次性发送规则的 field benchmark,最值得复用的是按工作类型路由:多模态文件优先 Gemini,精细前端/交互代码必须做视觉与行为回归,并准备编码型模型兜底。作者还建议使用 thinking_level 而不是旧式手动 chain-of-thought,并减少旧采样参数,但这些配置应以 Google 当前 API 文档为准。
对照并非完全同时新跑:Kimi 部分结果复用此前会话;作者没有公开所有原始 prompt 和产物链接。
样本只有四项任务、每项一次;结果不能代表所有代码、游戏或视频工作流。
文章大量引用 Google 官方 benchmark 和其他二手来源,实测与官方数字必须分开。
视觉“过时”和“粗糙”带有作者主观评分;功能可用性也没有公开自动化测试日志。
在 OpenCode 中固定相同版本、权限、工具、上下文和 high thinking 配置,分别接入 Gemini 3.6 Flash 与 Kimi K3。
使用同一份前端、游戏、表单和视频 prompt,各运行一次并保存完整产物、截图、控制台日志和 token/耗时。
用任务清单逐项验收:每个视觉要求、每个交互事件、表单数据落盘/导出、视频时间线和脚本准确性。
再用 medium/low thinking 做成本曲线,报告每项通过率、人工修订时间和每任务成本,不仅记录“看起来更好”。
文章公开了 OpenCode、高 thinking、四项任务、一次发送规则、输入/输出价格和每项任务的具体失败/成功描述;没有公开可下载 prompt 文件,因此“同配置”可复核程度低于完整开源测试。
作者将实测结论概括为 “mixed results”;这比把四项任务总结成单一胜负更符合其数据边界。
Gemini 3.6 Flash