Tabbit
活动资源博客模型
Tabbit LogoTabbit

Tabbit — 为你工作的 AI 浏览器

主题资源

  • AI Browser Resources
  • Agentic Browser Resources
  • Browser Downloads and Install Guides
  • Browser Comparisons
  • AI Browser Alternatives
  • Browser Productivity Resources

热门指南

  • AI Browser
  • Agentic Browser Download
  • Best AI Browser 2026: Top 9 Tested & Ranked
  • AI Browser Download
  • Free AI Browser
  • Best AI Browser 2026
  • AI Browser Comparison 2026
  • AI Browser for Windows
  • AI Browser for Mac
  • Chrome Alternative 2026

活动

  • 别装了,你在《牛来》里早有原型
  • Tabbit 妙招大赛
  • KPOP SBTI 饭圈人格测试
  • Tabbit 校园共创者计划
  • fifi 的论文文献妙招精选
  • 用户问卷

关于

  • Tabbit 博客
  • 媒体报道
简体中文
简体中文English
测评与证据

LongCat 2.0 · 社区来源 · 个人体验

r/AIToolsPerformance:LongCat 2.0 与 Kimi K3 等 1M 上下文模型的价格对比讨论

发布当天社区就注意到:同样是 1M 上下文,LongCat 2.0($0.30/$1.20)比 Kimi K3($3.00/$15.00)输入便宜约 10 倍、输出便宜约 12 倍,是当时 OpenRouter 上"最便宜的 1M+ 上下文模型"——但帖子同时提醒:列表页没有任何质量数据,"激进定价可能是抢份额,也可能是真高效"。

待验证:本次未能重新核实原文。下方历史数字不代表已核实的当前结果。

社区来源个人体验编辑日期 2026-09-20

测试条件速查

模型/版本
LongCat-2.0;来源日期:2026-07-20。
harness/任务
发布当天社区就注意到:同样是 1M 上下文,LongCat 2.0($0.30/$1.20)比 Kimi K3($3.00/$15.00)输入便宜约 10 倍、输出便宜约 12 倍,是当时 OpenRouter 上"最便宜的 1M+ 上下文模型"——但帖子同时提醒:列表页没有任何质量数据,"激进定价可能是抢份额,也可能是真高效"。
样本/缺口
局限记录:价格数据可复核(OpenRouter 历史页,见测评 03 采集的 2026-08-18 快照:LongCat 仍为 $0.30/$1.20 标价、实际成交输入 $0.03872/M);Kimi K3 价格以 OpenRouter 实时页为准。;帖子明确标注"无质量数据"的局限,与 BenchLM 的"无共享基准"(测评 11)、AlphaSignal 的核查(测评 04)一致:价格对比成立,质量对比缺位。;适用判断:预算敏感、需要 1M 上下文的场景,LongCat 2.0 是当前价格洼地候选;但"便宜 10 倍"不等于"性价比 10 倍",需结合任务实测(见测评 05–09)。

关键数据与适用场景

一句话结论

发布当天社区就注意到:同样是 1M 上下文,LongCat 2.0($0.30/$1.20)比 Kimi K3($3.00/$15.00)输入便宜约 10 倍、输出便宜约 12 倍,是当时 OpenRouter 上"最便宜的 1M+ 上下文模型"——但帖子同时提醒:列表页没有任何质量数据,"激进定价可能是抢份额,也可能是真高效"。

原始数据(帖子原文要点)

  • OpenRouter 同窗口期对比(发布日 2026-07-20):

    • Meituan LongCat 2.0:$0.30/M in,$1.20/M out,1048k context

    • Kimi K3:$3.00/M in,$15.00/M out(同 1M 上下文)

    • Muse Spark 1.1:$1.25/M in,$4.25/M out

    • Thinking Machines Inkling:$1.00/M in,$4.05/M out

  • 结论:LongCat 2.0 对 Kimi K3 输入约 10x、输出约 12x 便宜;是列表上"by a wide margin"最便宜的 1M+ 上下文模型。

  • 质疑:"列表本身不显示任何质量信息——没有 eval 分数、没有参数数、没有基准数字…… 这种激进的定价可能是抢份额的举动,也可能真的是个高效模型。"

  • 社区评论:有用户指出 DeepSeek V4 Flash 显著更便宜(但非 1M 上下文);有评论揶揄"两者里只有一家能可靠运行自己的模型"(指 Kimi)。

复核与适用边界

  • 价格数据可复核(OpenRouter 历史页,见测评 03 采集的 2026-08-18 快照:LongCat 仍为 $0.30/$1.20 标价、实际成交输入 $0.03872/M);Kimi K3 价格以 OpenRouter 实时页为准。

  • 帖子明确标注"无质量数据"的局限,与 BenchLM 的"无共享基准"(测评 11)、AlphaSignal 的核查(测评 04)一致:价格对比成立,质量对比缺位。

  • 适用判断:预算敏感、需要 1M 上下文的场景,LongCat 2.0 是当前价格洼地候选;但"便宜 10 倍"不等于"性价比 10 倍",需结合任务实测(见测评 05–09)。

能支持的判断

  • 价格数据可复核(OpenRouter 历史页,见测评 03 采集的 2026-08-18 快照:LongCat 仍为 $0.30/$1.20 标价、实际成交输入 $0.03872/M);Kimi K3 价格以 OpenRouter 实时页为准。
  • 帖子明确标注"无质量数据"的局限,与 BenchLM 的"无共享基准"(测评 11)、AlphaSignal 的核查(测评 04)一致:价格对比成立,质量对比缺位。

不能支持的判断

  • 价格数据可复核(OpenRouter 历史页,见测评 03 采集的 2026-08-18 快照:LongCat 仍为 $0.30/$1.20 标价、实际成交输入 $0.03872/M);Kimi K3 价格以 OpenRouter 实时页为准。
  • 帖子明确标注"无质量数据"的局限,与 BenchLM 的"无共享基准"(测评 11)、AlphaSignal 的核查(测评 04)一致:价格对比成立,质量对比缺位。
  • 适用判断:预算敏感、需要 1M 上下文的场景,LongCat 2.0 是当前价格洼地候选;但"便宜 10 倍"不等于"性价比 10 倍",需结合任务实测(见测评 05–09)。

方法、局限和复现

本文中的数字、任务集、推理档位和客户端条件只在所列来源及采集时点内成立。不同版本、不同 harness 或不同提供商的数据不能直接并排比较;未公开的参数保持未知。

需要复测时,请固定模型版本、提供商或客户端、推理档位、工具、任务集版本、样本数和采集日期,并记录失败、重试与人工修正。完整方法和复现步骤见下方来源笔记。

原始来源

Reddit(r/AIToolsPerformance) · u/(原帖匿名) · 原文发布日期 2026-07-20 · 本站编辑日期 2026-09-20

打开原始来源

LongCat 2.0

在 Tabbit 中比较 LongCat 2.0

下载 Tabbit 客户端后检查模型可用性

模型深度阅读

总览 · 简体中文

LongCat 2.0:变化、使用方式,以及低价没有告诉你的事

LongCat 2.0 提供 100 万上下文、开放权重和低价 API,但工具兼容、数据条款与实际运维成本仍需单独核实。

相关评测

OpenRouter 渠道数据:LongCat-2.0 定价、实测性能与第三方基准(Artificial Analysis)OpenRouter 页面提供了官方之外的第三方口径:LongCat-2.0 标价 $0.30/$1.20 per 1M(采集时 60% 折扣),实际加权成交输入价仅 $0.03872/M(缓存命中率 88.9%),吞吐 P50 29 tok/s、3 天可用性 99.93%,工具调用错误率 0.90%,且真实流量主要来自 Hermes Agent(7.77B tokens)与 Claude Code(3.31B tokens)。LongCat-2.0 官方模型卡:规格与官方基准(含与 Gemini/GPT-5.5/Claude Opus 对比表)官方模型卡是判断 LongCat-2.0 适用任务的第一手权威依据:它在 SWE-bench Pro(59.5)超过 GPT-5.5(58.6)与 Gemini 3.1 Pro(54.2),Terminal-Bench 2.1 达 70.8,但在 BrowseComp/GPQA/IFEval 等多项上落后于 GPT-5.5 与 Claude Opus 4.8——即"编码与 Agent 任务强、检索与通用推理非顶尖"。LongCat-2.0 官方技术博客:架构、国产算力训练与推理部署(发布说明)官方技术博客给出了 LongCat-2.0 的完整技术底稿(LSA 稀疏注意力、N-gram Embedding、国产算力 6D 并行训练、prefill-decode 分离部署),可用于判断模型的长上下文/Agent 能力设计意图,以及复现官方基准与部署路径。eesel 独立核查:LongCat-2.0 的 Agent 可靠性与生产接入硬阻塞这篇独立核查把 LongCat-2.0 拆成“模型能否完成 Agent 工作”和“产品能否进入企业生产”两件事:公开用户报告支持其作为便宜、稳定的编码执行器,但上下文规格、工具契约和数据治理文档不足以通过敏感数据生产审核。LongCat-2.0 聊天模板与工具调用配置(官方 Hugging Face 模型卡)The official model card’s chat template and tool-call examples are converted into a local inference configuration check.Claude Code 接入 LongCat-2.0 配置(官方文档)The LongCat Claude Code guide configures a compatible endpoint and keeps the first task in a disposable worktree.官方账号展示:五个「单提示词生成」创意项目(体素/3D/CG/落地页/小游戏)来源「官方账号展示:五个「单提示词生成」创意项目(体素/3D/CG/落地页/小游戏)」整理为可执行的任务指南;运行环境、输入与验收边界按该来源保留。r/opencodeCLI 案例:单提示词生成浏览器内 Ubuntu 桌面(完整提示词 + 可复现产物)来源「r/opencodeCLI 案例:单提示词生成浏览器内 Ubuntu 桌面(完整提示词 + 可复现产物)」整理为可执行的任务指南;运行环境、输入与验收边界按该来源保留。