Tabbit
活动资源博客模型
Tabbit LogoTabbit

Tabbit — 为你工作的 AI 浏览器

主题资源

  • AI Browser Resources
  • Agentic Browser Resources
  • Browser Downloads and Install Guides
  • Browser Comparisons
  • AI Browser Alternatives
  • Browser Productivity Resources

热门指南

  • AI Browser
  • Agentic Browser Download
  • Best AI Browser 2026: Top 9 Tested & Ranked
  • AI Browser Download
  • Free AI Browser
  • Best AI Browser 2026
  • AI Browser Comparison 2026
  • AI Browser for Windows
  • AI Browser for Mac
  • Chrome Alternative 2026

活动

  • 别装了,你在《牛来》里早有原型
  • Tabbit 妙招大赛
  • KPOP SBTI 饭圈人格测试
  • Tabbit 校园共创者计划
  • fifi 的论文文献妙招精选
  • 用户问卷

关于

  • Tabbit 博客
  • 媒体报道
简体中文
简体中文English
测评与证据

Kimi K3 · 官方来源 · 厂商自报

官方案例显示长程 Agent 潜力,也暴露复现边界

Kimi 官方发布材料中的长程编码、视觉闭环、知识工作和研究案例。

官方来源厂商自报编辑日期 2026-09-20

测试条件速查

条件
来源:Kimi/Moonshot 官方技术博客
条件
案例:最多 24 小时 sandbox、48 小时芯片设计、研究/知识工作数字
条件
条件:官方案例,任务与 harness 细节不完整

关键数据与适用场景

一句话结论

官方材料把 Kimi K3 定位为适合长程编码、视觉闭环、知识工作和研究型 Agent 的 2.8T/104B-active 模型,同时明确承认总体仍落后 Claude Fable 5 与 GPT-5.6 Sol。

测试环境

  • 模型:Kimi K3,2.8T 参数、16/896 专家激活、1M context、原生视觉。

  • 官方产品:Kimi.com、Kimi Work、Kimi Code、Kimi API。

  • 默认设置:发布时 max thinking;官方脚注说明评测使用 max、temperature=1.0、top-p=1.0。

  • API 价格:cache-hit 输入 $0.30/M,cache-miss 输入 $3/M,输出 $15/M。

输入/配置

  • 长程 Agent 必须保留完整 thinking history;官方建议使用兼容 harness,例如 Kimi Code,不要在会话中途切换模型。

  • 官方建议对过度主动行为增加更明确的 system prompt 或 AGENTS.md 边界。

  • Kimi Code 中可通过 /model 选择 Kimi K3;官方 API 模型名为 kimi-k3。

结果数据

  • GPU kernel 优化:官方称 K3 与带 fallback 的 Fable 5 竞争力相当,明显超过 Opus 4.8、GPT-5.6 Sol 和 GPT-5.5;每个模型在相同 sandbox 中最多 24 小时优化、重写和 benchmark 四个任务。

  • MiniTriton:官方案例称模型从 MLIR/IR 到 PTX codegen 构建完整编译器,并在部分 roofline workload 上达到或超过 Triton/torch.compile。

  • 芯片设计:官方称一次 48 小时 autonomous run 完成设计、优化和验证,模拟达到 100 MHz、8,700+ tokens/s;这些是发布方案例数据。

  • 科研工作流:官方称约两小时完成通常需 1–2 周的 I–Love–Q 复现,审阅/交叉验证 20+ 论文、评估 300+ EOS、生成 3,000+ 行 Python 和交互式 dashboard。

  • 知识工作:一个 ASIC 研究案例使用 120+ 轮递归改进、2.8k+ web searches/fetches、1.1k+ terminal data pulls、11k+ 页面、87 份季度报告和 99 份原始 PDF。

  • 多模态创作:官方展示截图闭环的游戏/前端/CAD,以及从 56 个素材片段进行剪辑和多轮修订的案例。

结论

这些案例支持把 K3 作为“长程、工具密集、需要视觉或大文档上下文”的候选模型;它们不支持“所有任务都胜过闭源模型”的结论。官方自己把总体性能放在 Fable 5 和 GPT-5.6 Sol 之后,并指出用户体验仍有差距。

局限

  • 页面主要是官方案例叙述,没有公开每个案例的完整输入、随机种子、工具日志、失败率或可下载产物。

  • 不同 benchmark 使用 Kimi Code、Claude Code 或 Codex 等不同 harness;官方数字不能直接当作同 harness 对照。

  • max thinking 和高 token 用量可能造成高延迟、高成本;模型过度主动时可能在模糊指令下替用户做决定。

  • 评测案例不等于生产 SLA;企业应使用自己的仓库、数据和验收标准做 pilot。

复现步骤

  1. 在 Kimi Code 或官方 API 选择 kimi-k3,固定 harness、模型版本、温度、top-p、工具权限和停止条件。

  2. 选择一个真实长程任务,例如仓库级修复、截图驱动 UI 修复或多文档研究;保存初始输入与数据快照。

  3. 强制保留完整 assistant reasoning/tool-call history,并为过度主动行为设置显式权限边界。

  4. 记录成功率、工具调用数、总输出 token、耗时、人工修改量和可交付物质量;与一个已知基线模型做相同任务对照。

原始证据与数据

官方页面的可核验字段包括模型架构、API 价格、默认 thinking、案例运行时长/轮次/文件数量,以及对 thinking history、过度主动和用户体验差距的限制说明。

来源摘录或观察(仅做合规短引)

官方结论为:“While its overall performance still trails the most powerful proprietary models”。

能支持的判断

  • Kimi 官方发布材料中的长程编码、视觉闭环、知识工作和研究案例,包括最多 24 小时 sandbox 与 48 小时芯片设计。

不能支持的判断

  • 条件:官方案例,任务与 harness 细节不完整

方法、局限和复现

本文中的数字、任务集、推理档位和客户端条件只在所列来源及采集时点内成立。不同版本、不同 harness 或不同提供商的数据不能直接并排比较;未公开的参数保持未知。

需要复测时,请固定模型版本、提供商或客户端、推理档位、工具、任务集版本、样本数和采集日期,并记录失败、重试与人工修正。完整方法和复现步骤见下方来源笔记。

原始来源

Kimi 官方技术博客 · Kimi / Moonshot AI · 原文发布日期 Unknown · 本站编辑日期 2026-09-20

打开原始来源

Kimi K3

在 Tabbit 中比较 Kimi K3

下载 Tabbit 客户端后检查模型可用性

模型深度阅读

定价 · 简体中文

Kimi K3 价格:API 成本、会员方案与预算计算

用官方费率解释 Kimi K3 的 API 价格、缓存写入、会员方案和三种实际预算场景。

相关评测

同一 K3 在八种 harness 上通过率相差 20 个百分点Reddit 单模型、单提供商、八种 Agent harness 的 25 任务对照。Kimi K3 代码安全评估:基准强不等于精度够Semgrep 的 IDOR 代码安全基准;可区分 precision、recall 和 F1。实战编码:简单任务接近,陷阱任务暴露可靠性差距相同 GitHub issue、规划—实现—验证三阶段与 70 分量表的编码 Agent 观察。Coding Agent 证据足够严肃,但不支持“通用最佳”NxCode 对 Kimi K3 公开 coding-agent 基准的口径、配置和可比性整理。把 Kimi K3 的 Agent loop 拆成可控步骤依据 Kimi API 指南,将任务拆解、工具 schema、循环控制、权限和终检串成可复查流程;不会在 Tabbit 中自动配置工具。用九步流程把需求转成可审查代码变更Kimi AI 的编码工作流强调先计划、再实现、再验证;适用于有仓库和验收标准的变更,不等于模型已替你运行测试。让 Kimi K3 在 OpenCode 中调用 Firecrawl 获取网页资料把 Kimi K3、OpenCode 与 Firecrawl MCP 连接成可引用的网页研究流程;要求先限定域名、权限和停止条件。搭建 Kimi K3 API 与 Agent loop围绕“搭建 Kimi K3 API 与 Agent loop”整理来源中的任务边界、输入和执行环境;完整步骤与限制见详情。