Tabbit
活动资源博客模型
Tabbit LogoTabbit

Tabbit — 为你工作的 AI 浏览器

主题资源

  • AI Browser Resources
  • Agentic Browser Resources
  • Browser Downloads and Install Guides
  • Browser Comparisons
  • AI Browser Alternatives
  • Browser Productivity Resources

热门指南

  • AI Browser
  • Agentic Browser Download
  • Best AI Browser 2026: Top 9 Tested & Ranked
  • AI Browser Download
  • Free AI Browser
  • Best AI Browser 2026
  • AI Browser Comparison 2026
  • AI Browser for Windows
  • AI Browser for Mac
  • Chrome Alternative 2026

活动

  • 别装了,你在《牛来》里早有原型
  • Tabbit 妙招大赛
  • KPOP SBTI 饭圈人格测试
  • Tabbit 校园共创者计划
  • fifi 的论文文献妙招精选
  • 用户问卷

关于

  • Tabbit 博客
  • 媒体报道
测评
媒体Kimi K3

BenchLM:Kimi K3 公开可核验基准账本

原始来源

BenchLM

作者BenchLM

原文日期2026-08-17

Tabbit 整理2026-08-19

查看原文

测试环境

  • BenchLM 模型档案与 benchmark ledger;页面把每行的分数、对照、权重、cohort 和 evidence 状态放在一起。

  • 页面数据截至 2026-08-17,覆盖 218 个模型的排名视图。

  • 价格:输入 $3/M、输出 $15/M、缓存输入 $0.30/M。

输入/配置

  • 页面显示 44 条可展示来源的 benchmark rows;证据状态有 Verified、Mixed sources、Provider exact、Benchmark exact、Secondary exact 等。

  • K3 的很多 coding/agentic 数字来自 Kimi 官方发布表;BenchLM 是证据账本和跨模型比较层,不是统一 harness 的重新运行。

结果数据

分类Kimi K3排名/证据
总分80.5/100#5/218;44 条 source-displayable rows
AgenticRank73.9#5/131,10 个 benchmark,Verified
CodingRank78.0#5/135,13 个 benchmark,Mixed sources
Knowledge84.8#5/57,4 个 benchmark,Verified
Multimodal87.9#4/33,13 个 benchmark,Verified
Reasoning/Math/Multilingual/Instruction未测量页面无可用 benchmark rows

关键账本行包括:DeepSWE 67.5(低于 GPT-5.6 Sol 72.7)、Terminal-Bench 2.1 88.3(低于 Sol 91.9)、BrowseComp 91.2(低于 Sol 92.2)、AutomationBench 30.8(低于 GLM-5.3 48.2)、APEX-Agents 37.6(低于 Grok 4.6 57.5)、MathVision 94.3/97.8(无工具/有 Python)、ExploitBench 32(来源链指向 NIST/UK AISI/CAISI)。

结论

BenchLM 的价值不是再宣布一个“第一”,而是把 K3 的排名拆成可追溯来源:Agentic、Coding、Knowledge、Multimodal 均在前五,但若把 Provider exact、Benchmark exact 和 Verified 混在一起,容易误读成全部都是独立复跑结果。

局限

  • 页面没有提供 K3 的统一输入、完整 harness、运行日志或原始输出;不能作为独立受控测评的替代品。

  • 44 行中有不少 provider exact,且某些分类完全未测量;总分不是全能力覆盖。

  • 排名和 Elo/来源会随着新模型、来源更新和 benchmark 版本变化;应保存采集日期。

复现步骤

  1. 保存页面快照和每一行的 source link、evidence 状态、日期。

  2. 只对 Verified 或 Benchmark exact 行作为候选复核,逐条打开原始 leaderboard/报告。

  3. 对实际选型任务建立相同分类的本地 held-out 集,并报告 K3 与基线的相同 harness 结果。

  4. 不把 Provider exact 数字写成独立实验结果,保留原始证据标签。

原始证据与数据

页面公开总分 80.5、#5/218、44 条来源可展示行、分类分数/排名、价格和每个 benchmark 的对照与证据类型;页面链接到 Kimi 官方博客、NIST/UK AISI/CAISI 与具体 benchmark 页面。

来源摘录或观察(仅做合规短引)

页面证据摘要为:“Evidence: Supported; this profile shows 44 source-displayable benchmark rows.”

Tabbit 小编提醒

本文是第三方资料导航。测试环境、模型版本和主观体验可能不同,请以原文为准。

Kimi K3

在 Tabbit 中使用并对比模型

Kimi K3

相关测评

媒体Google / Semgrep

Kimi K3 的代码安全测评:表面强劲,精度不足

媒体Google / MindStudio

Kimi K3 实战编码测评:真的像宣传的那么好吗?

媒体Google / Simon Willison

Kimi K3 与 pelican benchmark:我们还能学到什么

媒体Google / NxCode

Kimi K3 benchmark 详解:coding-agent 测评指南

Kimi K3

相关提示词

媒体Google / Business Compass LLC

Kimi K3 提示词工程指南

媒体Google / Together AI

Kimi K3:完整开发者指南

媒体Google / Kimi API Platform

Kimi 提示词最佳实践

媒体Google / Kimi API Platform

使用 Kimi K3 构建 Agent