LongCat 2.0

LongCat 2.0 · 测评与证据

LongCat 2.0,哪些结论值得看?

按主题、来源身份和证据类型浏览公开测评。不同版本、档位和测试环境不直接并排比较。

这是第三方资料导航,不是 Tabbit 自测。动态指标以原始来源当前页面为准;未知值保持未知。

编辑结论

编辑结论

OpenRouter 页面提供了官方之外的第三方口径:LongCat-2.0 标价 $0.30/$1.20 per 1M(采集时 60% 折扣),实际加权成交输入价仅 $0.03872/M(缓存命中率 88.9%),吞吐 P50 29 tok/s、3 天可用性 99.93%,工具调用错误率 0.90%,且真实流量主要来自 Hermes Agent(7.77B tokens)与 Claude Code(3.31B tokens)。

OpenRouter(第三方模型路由平台) · 查看证据

官方模型卡是判断 LongCat-2.0 适用任务的第一手权威依据:它在 SWE-bench Pro(59.5)超过 GPT-5.5(58.6)与 Gemini 3.1 Pro(54.2),Terminal-Bench 2.1 达 70.8,但在 BrowseComp/GPQA/IFEval 等多项上落后于 GPT-5.5 与 Claude Opus 4.8——即"编码与 Agent 任务强、检索与通用推理非顶尖"。

Hugging Face(meituan-longcat/LongCat-2.0) · 查看证据

官方技术博客给出了 LongCat-2.0 的完整技术底稿(LSA 稀疏注意力、N-gram Embedding、国产算力 6D 并行训练、prefill-decode 分离部署),可用于判断模型的长上下文/Agent 能力设计意图,以及复现官方基准与部署路径。

LongCat 官网博客(longcat.chat) · 查看证据

完整测评与相关内容

模型深度阅读

总览 · 简体中文

LongCat 2.0:变化、使用方式,以及低价没有告诉你的事

LongCat 2.0 提供 100 万上下文、开放权重和低价 API,但工具兼容、数据条款与实际运维成本仍需单独核实。

精选证据

官方平台遥测

OpenRouter 渠道数据:LongCat-2.0 定价、实测性能与第三方基准(Artificial Analysis)

OpenRouter 页面提供了官方之外的第三方口径:LongCat-2.0 标价 $0.30/$1.20 per 1M(采集时 60% 折扣),实际加权成交输入价仅 $0.03872/M(缓存命中率 88.9%),吞吐 P50 29 tok/s、3 天可用性 99.93%,工具调用错误率 0.90%,且真实流量主要来自 Hermes Agent(7.77B tokens)与 Claude Code(3.31B tokens)。

来源OpenRouter(第三方模型路由平台)
原文日期2026-07-20
采集2026-09-20

待验证:本次未能重新核实原文。

模型/版本
LongCat-2.0;来源日期:2026-07-20。
harness/任务
模型与定价;模型 ID:`meituan/longcat-2.0`(页面版本 20260720);48B 激活 / 1.6T 总参数 MoE;上下文 1M;仅文本。
样本/缺口
局限记录:Artificial Analysis 的 Coding Index 45.3(优于 49% 模型)明显低于官方 SWE-bench Pro 59.5 的观感——两者基准集不同,第三方指数对 LongCat 的排序并不靠前,是判断"适合哪些任务"的重要修正项。;单提供方(AtlasCloud)意味着无多路由冗余;99.93% 可用性为近 3 天快照。
编程Agent成本
媒体 / 基准方厂商自报

LongCat-2.0 官方模型卡:规格与官方基准(含与 Gemini/GPT-5.5/Claude Opus 对比表)

官方模型卡是判断 LongCat-2.0 适用任务的第一手权威依据:它在 SWE-bench Pro(59.5)超过 GPT-5.5(58.6)与 Gemini 3.1 Pro(54.2),Terminal-Bench 2.1 达 70.8,但在 BrowseComp/GPQA/IFEval 等多项上落后于 GPT-5.5 与 Claude Opus 4.8——即"编码与 Agent 任务强、检索与通用推理非顶尖"。

来源Hugging Face(meituan-longcat/LongCat-2.0)
原文日期2026-06-30
采集2026-09-20

待验证:本次未能重新核实原文。

模型/版本
LongCat-2.0;来源日期:2026-06-30。
harness/任务
架构:MoE,1.6T 总参数,每 token 激活约 48B(动态 33B–56B,官方 X 账号口径);HF 元数据模型大小 1.8T(含 N-gram Embedding 135B、BF16)。;上下文:原生 1M tokens(在数千亿 tokens 的百万上下文数据上训练)。
样本/缺口
局限记录:落后项:FORTE/RWSearch/BrowseComp 全面落后 GPT-5.5(77.8/85.3/84.4 vs 73.2/78.8/79.9);GPQA-diamond、IFEval 落后 GPT-5.5 与 Gemini 3.1 Pro;Claude Opus 4.8 在 SWE-bench Pro(69.2)上领先 LongCat 近 10 分。;综合:官方图表中 LongCat-2.0 唯一稳定战胜的是 Gemini 3.1 Pro(AlphaSignal 结论),对 GPT-5.5 仅 SWE-bench Pro 一项险胜。
编程Agent成本
媒体 / 基准方厂商自报

LongCat-2.0 官方技术博客:架构、国产算力训练与推理部署(发布说明)

官方技术博客给出了 LongCat-2.0 的完整技术底稿(LSA 稀疏注意力、N-gram Embedding、国产算力 6D 并行训练、prefill-decode 分离部署),可用于判断模型的长上下文/Agent 能力设计意图,以及复现官方基准与部署路径。

来源LongCat 官网博客(longcat.chat)
原文日期2026-06-30
采集2026-09-20

待验证:本次未能重新核实原文。

模型/版本
LongCat-2.0;来源日期:2026-06-30。
harness/任务
发布口径(与模型卡一致);1.6T 总参数、每 token 激活约 48B 的 MoE;完整训练与大规模部署全部使用国产算力集群。
样本/缺口
局限记录:适用边界:博客是工程说明而非独立测评,官方吞吐/可靠性数字(如故障率降 70%+)无第三方复核;部署方案面向超大规模集群,对个人开发者仅有 SGLang cookbook 参考价值。;关联文档:测评 01(官方基准表)、测评 04(AlphaSignal 核查)。
编程Agent成本
媒体 / 基准方独立测量

eesel 独立核查:LongCat-2.0 的 Agent 可靠性与生产接入硬阻塞

这篇独立核查把 LongCat-2.0 拆成“模型能否完成 Agent 工作”和“产品能否进入企业生产”两件事:公开用户报告支持其作为便宜、稳定的编码执行器,但上下文规格、工具契约和数据治理文档不足以通过敏感数据生产审核。

来源eesel AI Blog
原文日期2026-08-04
采集2026-09-20

待验证:本次未能重新核实原文。

模型/版本
LongCat-2.0;来源日期:2026-08-04。
harness/任务
这篇独立核查把 LongCat-2.0 拆成“模型能否完成 Agent 工作”和“产品能否进入企业生产”两件事:公开用户报告支持其作为便宜、稳定的编码执行器,但上下文规格、工具契约和数据治理文档不足以通过敏感数据生产审核。
样本/缺口
局限记录:作者为 eesel AI 从业者,文中含其产品推广;有关数据治理的核查项可复查,但购买建议应与供应商原始政策、法律和安全团队意见分开。;复现时保存:官方 config.json、API 响应头与错误体、harness 配置、输入 token 数、工具 schema、供应商政策页面和采集日期。
编程Agent成本

全部来源

全部来源

15 / 15
官方平台遥测

OpenRouter 渠道数据:LongCat-2.0 定价、实测性能与第三方基准(Artificial Analysis)

OpenRouter 页面提供了官方之外的第三方口径:LongCat-2.0 标价 $0.30/$1.20 per 1M(采集时 60% 折扣),实际加权成交输入价仅 $0.03872/M(缓存命中率 88.9%),吞吐 P50 29 tok/s、3 天可用性 99.93%,工具调用错误率 0.90%,且真实流量主要来自 Hermes Agent(7.77B tokens)与 Claude Code(3.31B tokens)。

来源OpenRouter(第三方模型路由平台)
原文日期2026-07-20
采集2026-09-20

待验证:本次未能重新核实原文。

模型/版本
LongCat-2.0;来源日期:2026-07-20。
harness/任务
模型与定价;模型 ID:`meituan/longcat-2.0`(页面版本 20260720);48B 激活 / 1.6T 总参数 MoE;上下文 1M;仅文本。
样本/缺口
局限记录:Artificial Analysis 的 Coding Index 45.3(优于 49% 模型)明显低于官方 SWE-bench Pro 59.5 的观感——两者基准集不同,第三方指数对 LongCat 的排序并不靠前,是判断"适合哪些任务"的重要修正项。;单提供方(AtlasCloud)意味着无多路由冗余;99.93% 可用性为近 3 天快照。
编程Agent成本
媒体 / 基准方厂商自报

LongCat-2.0 官方模型卡:规格与官方基准(含与 Gemini/GPT-5.5/Claude Opus 对比表)

官方模型卡是判断 LongCat-2.0 适用任务的第一手权威依据:它在 SWE-bench Pro(59.5)超过 GPT-5.5(58.6)与 Gemini 3.1 Pro(54.2),Terminal-Bench 2.1 达 70.8,但在 BrowseComp/GPQA/IFEval 等多项上落后于 GPT-5.5 与 Claude Opus 4.8——即"编码与 Agent 任务强、检索与通用推理非顶尖"。

来源Hugging Face(meituan-longcat/LongCat-2.0)
原文日期2026-06-30
采集2026-09-20

待验证:本次未能重新核实原文。

模型/版本
LongCat-2.0;来源日期:2026-06-30。
harness/任务
架构:MoE,1.6T 总参数,每 token 激活约 48B(动态 33B–56B,官方 X 账号口径);HF 元数据模型大小 1.8T(含 N-gram Embedding 135B、BF16)。;上下文:原生 1M tokens(在数千亿 tokens 的百万上下文数据上训练)。
样本/缺口
局限记录:落后项:FORTE/RWSearch/BrowseComp 全面落后 GPT-5.5(77.8/85.3/84.4 vs 73.2/78.8/79.9);GPQA-diamond、IFEval 落后 GPT-5.5 与 Gemini 3.1 Pro;Claude Opus 4.8 在 SWE-bench Pro(69.2)上领先 LongCat 近 10 分。;综合:官方图表中 LongCat-2.0 唯一稳定战胜的是 Gemini 3.1 Pro(AlphaSignal 结论),对 GPT-5.5 仅 SWE-bench Pro 一项险胜。
编程Agent成本
媒体 / 基准方厂商自报

LongCat-2.0 官方技术博客:架构、国产算力训练与推理部署(发布说明)

官方技术博客给出了 LongCat-2.0 的完整技术底稿(LSA 稀疏注意力、N-gram Embedding、国产算力 6D 并行训练、prefill-decode 分离部署),可用于判断模型的长上下文/Agent 能力设计意图,以及复现官方基准与部署路径。

来源LongCat 官网博客(longcat.chat)
原文日期2026-06-30
采集2026-09-20

待验证:本次未能重新核实原文。

模型/版本
LongCat-2.0;来源日期:2026-06-30。
harness/任务
发布口径(与模型卡一致);1.6T 总参数、每 token 激活约 48B 的 MoE;完整训练与大规模部署全部使用国产算力集群。
样本/缺口
局限记录:适用边界:博客是工程说明而非独立测评,官方吞吐/可靠性数字(如故障率降 70%+)无第三方复核;部署方案面向超大规模集群,对个人开发者仅有 SGLang cookbook 参考价值。;关联文档:测评 01(官方基准表)、测评 04(AlphaSignal 核查)。
编程Agent成本
媒体 / 基准方独立测量

eesel 独立核查:LongCat-2.0 的 Agent 可靠性与生产接入硬阻塞

这篇独立核查把 LongCat-2.0 拆成“模型能否完成 Agent 工作”和“产品能否进入企业生产”两件事:公开用户报告支持其作为便宜、稳定的编码执行器,但上下文规格、工具契约和数据治理文档不足以通过敏感数据生产审核。

来源eesel AI Blog
原文日期2026-08-04
采集2026-09-20

待验证:本次未能重新核实原文。

模型/版本
LongCat-2.0;来源日期:2026-08-04。
harness/任务
这篇独立核查把 LongCat-2.0 拆成“模型能否完成 Agent 工作”和“产品能否进入企业生产”两件事:公开用户报告支持其作为便宜、稳定的编码执行器,但上下文规格、工具契约和数据治理文档不足以通过敏感数据生产审核。
样本/缺口
局限记录:作者为 eesel AI 从业者,文中含其产品推广;有关数据治理的核查项可复查,但购买建议应与供应商原始政策、法律和安全团队意见分开。;复现时保存:官方 config.json、API 响应头与错误体、harness 配置、输入 token 数、工具 schema、供应商政策页面和采集日期。
编程Agent成本
社区个人体验

AlphaSignal 深度核查:Owl Alpha 真身与 LongCat-2.0 官方宣称的现实检验

这篇发布次日发布的深度核查给出最关键的背景事实——OpenRouter 上匿名跑了两个月的免费模型 "Owl Alpha" 就是 LongCat-2.0(月处理约 10 万亿 tokens、Hermes Agent 榜单第一)——同时逐条拆解官方宣称:SWE-bench Pro 险胜 GPT-5.5 是官方自测、权重发布当时还是"计划"、开源界真正的对手是 GLM-5.2(62.1 vs 59.5)。

来源X(Twitter)Articles(AlphaSignal)
原文日期2026-07-01
采集2026-09-20

待验证:本次未能重新核实原文。

模型/版本
LongCat-2.0;来源日期:2026-07-01。
harness/任务
这篇发布次日发布的深度核查给出最关键的背景事实——OpenRouter 上匿名跑了两个月的免费模型 "Owl Alpha" 就是 LongCat-2.0(月处理约 10 万亿 tokens、Hermes Agent 榜单第一)——同时逐条拆解官方宣称:SWE-bench Pro 险胜 GPT-5.5 是官方自测、权重发布当时还是"计划"、开源界真正的对手是 GLM-5.2(62.1 vs 59.5)。
样本/缺口
局限记录:文章是分析性评论而非受控测评,数字均转引自官方与平台,但"10 万亿 tokens/月""GLM-5.2 62.1"等关键数据未附独立原始来源链接(作者称 source links 在首条回复),引用时按第二手处理。;与官方文档(测评 01、02)结合阅读效果最佳:官方给全量细节,本文给批判框架。
编程Agent成本
社区个人体验

r/SillyTavernAI 实测:LongCat 2.0 一周角色扮演(写作/越狱/重复倾向)

一周角色扮演实测显示 LongCat 2.0 在创意写作上"中了大奖":指令遵循忠实、故事连贯、无硬性拒答、叙述中立不煽情,但有两个明显毛病——对给定信息过度忠实导致重复惯性、以及需要非常具体的要求才能触达越狱内容(作者被迫使用极强的 jailbreak 提示词)。

来源Reddit(r/SillyTavernAI)
原文日期2026-08
采集2026-09-20

待验证:本次未能重新核实原文。

模型/版本
LongCat-2.0;来源日期:2026-08。
harness/任务
Pros;指令遵循忠实且准确:能优雅驾驭非常复杂的世界观设定。
样本/缺口
局限记录:任务适用判断:适合创意写作、RP、长文叙事(需自行加防重复指令);不适合需要明确审查边界的合规场景。;关联:r/SillyTavernAI 另帖(1u4ts39)报告"多角色 RP 时爱插入不在场角色",可作为多角色场景的补充负面观察。
编程Agent成本
社区个人体验

r/hermesagent PSA:LongCat 2.0 推理档位 Bug 与模型定位(DeepSeek V4 Flash/Pro 之间)

实测确认 LongCat-2.0 的 API 只接受 `low/med/high` 三档 reasoning effort,收到其他档位(如 DeepSeek 系的 `xhigh`)会返回畸形 200 响应而非报错,导致 Hermes Agent 静默回退到 fallback provider;同一用户还给出能力定位:介于 DeepSeek-V4-Flash 与 DeepSeek-V4-Pro 之间、缓存好、PAYG 便宜。

来源Reddit(r/hermesagent)
原文日期2026-08
采集2026-09-20

待验证:本次未能重新核实原文。

模型/版本
LongCat-2.0;来源日期:2026-08。
harness/任务
模型定位(用户主观,基于实际使用);"用了一阵子后,我的感觉是它(能力)介于 Deepseek-4-Flash 和 Deepseek-4-Pro 之间,定价也如此。"
样本/缺口
局限记录:能力定位(介于 DS4-Flash 与 DS4-Pro 之间)是主观判断,与 AlphaSignal 的"DeepSeek V4-Pro 标价更低"(测评 04)、OpenRouter 第三方指数(测评 03)互相补充,可交叉验证。;任务适用判断:适合缓存友好的 Agent 循环与 PAYG 成本敏感场景;切换模型频繁的 Hermes 用户需注意上述配置坑。
编程Agent成本
社区个人体验

r/vibecoding 实测:LongCat 2.0 定价"疯狂"——缓存命中免费的真实账单

用户实测 2 美元 5000 万 tokens 包:一次任务提示词 2700 万 tokens,因缓存命中只扣了 57 万 tokens——官方"缓存命中不计费、只扣未命中与输出"的规则在真实 Agent 工作流里把有效用量放大到约 2B tokens,是 LongCat 定价最反直觉的地方。

来源Reddit(r/vibecoding)
原文日期2026-07
采集2026-09-20

待验证:本次未能重新核实原文。

模型/版本
LongCat-2.0;来源日期:2026-07。
harness/任务
动机:对美团 LongCat 2.0 心动但犹豫,因为没有太多基准;不过大家都在夸 Owl Alpha,而"结果证明是同一个模型"。;购买:官方 50M tokens 卖 $2(实际扣了 0.86€,"不知道为什么");需要手机装 AliPay,花了约 15 分钟。
样本/缺口
局限记录:适用任务:反复重读同一上下文的 Agent(编码循环、长文档研究)最划算(AlphaSignal 同样结论);一次性 one-shot 提示词几乎享受不到缓存红利。;边界:价格为活动期($2 包、$4.9 包 67% 折扣),当前售价以平台为准;AliPay 注册是中国区用户的门槛(其他用户评论提到需要手机号/支付宝,国际用户可用 OpenRouter/Nous Portal 渠道绕过,见提示词目录 03/06)。
编程Agent成本
社区个人体验

X 实测:DeepSeek V4 Flash / V4 Pro / LongCat 2.0 三模型同任务物理+编程测试

开发者把 DeepSeek V4 Flash 0731、DeepSeek V4 Pro 与 LongCat 2.0 放进同一个"物理 + 编程"测试(相同任务、相同条件),结果中"最让他惊讶的是 LongCat 2.0"——表现比他预期成功得多,且这是他第一次在免费档位上遇到它。

来源X(Twitter)
原文日期2026-08-07
采集2026-09-20

待验证:本次未能重新核实原文。

模型/版本
LongCat-2.0;来源日期:2026-08-07。
harness/任务
> 我把 DeepSeek V4 Flash 0731、DeepSeek V4 Pro 和 LongCat 2.0 放进了同一个物理 + 编程测试中。;> 三个模型都给了相同的任务,相同的条件。
样本/缺口
局限记录:该结论与 r/hermesagent 的定位(介于 DS4-Flash 与 DS4-Pro 之间,测评 06)方向一致:LongCat 2.0 与 DeepSeek V4 系列处于同一能力带,性价比竞争激烈(AlphaSignal 指出 DS4-Pro 标价更低,测评 04)。;免费档位体验:与"OpenRouter/Nous Portal 免费端点"(提示词目录 03)互相印证,说明免费入口确实可用且性能可用。
编程Agent成本
社区个人体验

X(atomic.chat)对比:LongCat 2.0 vs GPT-5.5 同任务代理式游戏开发(Duck Hunt)

在 Kilo Code CLI 中让 LongCat 2.0(开源权重、本地/免费运行)与 GPT-5.5(云端付费)执行同一个任务——3 次 Agent 迭代把 `game.html` 里的复古 Duck Hunt 游戏做到含鸭子波次、弹药与物理——两者产物质量"运行流畅、无剪切问题、图形/物理/游戏逻辑同步",唯一区别是账单:LongCat 0 美元 vs GPT-5.5 $0.65。

来源X(Twitter)
原文日期2026-07-07
采集2026-09-20

待验证:本次未能重新核实原文。

模型/版本
LongCat-2.0;来源日期:2026-07-07。
harness/任务
在 Kilo Code CLI 中让 LongCat 2.0(开源权重、本地/免费运行)与 GPT-5.5(云端付费)执行同一个任务——3 次 Agent 迭代把 `game.html` 里的复古 Duck Hunt 游戏做到含鸭子波次、弹药与物理——两者产物质量"运行流畅、无剪切问题、图形/物理/游戏逻辑同步",唯一区别是账单:LongCat 0 美元 vs GPT-5.5 $0.65。
样本/缺口
局限记录:与官方 5 个单提示词项目(提示词目录 07)、r/opencodeCLI Ubuntu 案例(提示词目录 08)共同构成"创意/前端编程任务"证据群:LongCat 2.0 在此类任务上与前沿闭源模型质量接近、成本优势显著。;注意:此处 "GPT-5.5" 为 2026 年版本的云端模型,成本 $0.65 为其平台账单口径;不同时期、不同渠道价格不可直接外推。
编程Agent成本
媒体 / 基准方个人体验

AI Profit Boardroom 实测:LongCat 2.0 游戏构建测试与 GLM 5.2 同任务对比

作者自测结论与多数社区口碑相反:LongCat 2.0 做的游戏"可玩但粗糙有 bug"(一个构建甚至全黑屏),同任务下 GLM 5.2 的产物"更干净、更流畅、更精致",因此他的建议是"值得玩玩、不值得切换"——这是对 LongCat 2.0 偏负面的独立样本,需与正面证据并读。

来源aiprofitboardroom.com(博客,属 Julian Goldie 的 AI Profit Boardroom 社区)
原文日期2026-05-29
采集2026-09-20

待验证:本次未能重新核实原文。

模型/版本
LongCat-2.0;来源日期:2026-05-29。
harness/任务
测试方法;让 LongCat 2.0 构建多个游戏 demo:Dragon Realm、Skyrim 风格开放世界、VoxelCraft;结论"可玩,但 buggy、粗糙——一个构建甚至在某些点全黑"。
样本/缺口
局限记录:测试未公开提示词、档位与复现链接,仅凭文字描述,无法复核到产物级别;日期字段异常,发布时点不确。;任务适用判断:若以该文为准,LongCat 2.0 不适合对产物完成度要求高的创意编程任务;若以官方与 r/opencodeCLI 证据为准则适合。综合判断:创意编程任务上 LongCat 2.0 方差大,建议先小样自测。
编程Agent成本
媒体 / 基准方个人体验

BenchLM 对比页:GPT-5.5 vs LongCat-2.0——"无共享基准,无法给出质量结论"的边界说明

截至 2026-08-17,BenchLM 认为 GPT-5.5 与 LongCat-2.0 之间没有任何共享的第三方基准结果(GPT-5.5 有 38 条、LongCat-2.0 为 0 条),因此"公开证据不支持任何质量结论"——这是对"LongCat 2.0 击败 GPT-5.5"类说法的权威边界提示:官方 SWE-bench Pro 59.5>58.6 尚未被任何独立来源复测。

来源BenchLM.ai(第三方模型对比聚合站)
原文日期2026-08-17
采集2026-09-20

待验证:本次未能重新核实原文。

模型/版本
LongCat-2.0;来源日期:2026-08-17。
harness/任务
截至 2026-08-17,BenchLM 认为 GPT-5.5 与 LongCat-2.0 之间没有任何共享的第三方基准结果(GPT-5.5 有 38 条、LongCat-2.0 为 0 条),因此"公开证据不支持任何质量结论"——这是对"LongCat 2.0 击败 GPT-5.5"类说法的权威边界提示:官方 SWE-bench Pro 59.5>58.6 尚未被任何独立来源复测。
样本/缺口
局限记录:BenchLM 收录的是第三方已发布基准;官方自测分数(SWE-bench Pro 59.5 等,测评 01)不在其收录范围,两者不是矛盾而是口径不同。;任务适用判断:在独立复测出现前,"LongCat-2.0 击败 GPT-5.5"只能作为官方宣称引用,并标注自测性质。
编程Agent成本
社区个人体验

r/AIToolsPerformance:LongCat 2.0 与 Kimi K3 等 1M 上下文模型的价格对比讨论

发布当天社区就注意到:同样是 1M 上下文,LongCat 2.0($0.30/$1.20)比 Kimi K3($3.00/$15.00)输入便宜约 10 倍、输出便宜约 12 倍,是当时 OpenRouter 上"最便宜的 1M+ 上下文模型"——但帖子同时提醒:列表页没有任何质量数据,"激进定价可能是抢份额,也可能是真高效"。

来源Reddit(r/AIToolsPerformance)
原文日期2026-07-20
采集2026-09-20

待验证:本次未能重新核实原文。

模型/版本
LongCat-2.0;来源日期:2026-07-20。
harness/任务
发布当天社区就注意到:同样是 1M 上下文,LongCat 2.0($0.30/$1.20)比 Kimi K3($3.00/$15.00)输入便宜约 10 倍、输出便宜约 12 倍,是当时 OpenRouter 上"最便宜的 1M+ 上下文模型"——但帖子同时提醒:列表页没有任何质量数据,"激进定价可能是抢份额,也可能是真高效"。
样本/缺口
局限记录:价格数据可复核(OpenRouter 历史页,见测评 03 采集的 2026-08-18 快照:LongCat 仍为 $0.30/$1.20 标价、实际成交输入 $0.03872/M);Kimi K3 价格以 OpenRouter 实时页为准。;帖子明确标注"无质量数据"的局限,与 BenchLM 的"无共享基准"(测评 11)、AlphaSignal 的核查(测评 04)一致:价格对比成立,质量对比缺位。;适用判断:预算敏感、需要 1M 上下文的场景,LongCat 2.0 是当前价格洼地候选;但"便宜 10 倍"不等于"性价比 10 倍",需结合任务实测(见测评 05–09)。
编程Agent成本
社区个人体验

r/LocalLLaMA 讨论:权重发布、下载体积与"AI ASIC superpods"国产算力猜测

r/LocalLLaMA 从发布起就盯住两件事:权重与量化(BF16 全量 3.55TB、FP8 2.05TB,官方出 INT8/FP8 量化版)和"AI ASIC superpods"到底是谁家的芯片(社区据华为 HCCL 致谢与 superpod 术语推断为华为 Ascend 910C),这些是判断 LongCat-2.0 可落地性的重要社区信息。

来源Reddit(r/LocalLLaMA)
原文日期2026-07
采集2026-09-20

待验证:本次未能重新核实原文。

模型/版本
LongCat-2.0;来源日期:2026-07。
harness/任务
r/LocalLLaMA 从发布起就盯住两件事:权重与量化(BF16 全量 3.55TB、FP8 2.05TB,官方出 INT8/FP8 量化版)和"AI ASIC superpods"到底是谁家的芯片(社区据华为 HCCL 致谢与 superpod 术语推断为华为 Ascend 910C),这些是判断 LongCat-2.0 可落地性的重要社区信息。
样本/缺口
局限记录:3.55TB(BF16)/ 2.05TB(FP8)体积意味着个人单机无法加载全量;官方文档的部署路径为 SGLang 多节点(提示词目录 02),量化版体积对多卡集群才现实。;任务适用判断:对"本地跑 LongCat-2.0"感兴趣者,先看 FP8/INT8 量化卡与显存需求,再决定是否值得;对绝大多数用户,走 API/OpenRouter 免费端点更现实。
编程Agent成本
媒体 / 基准方个人体验

Hacker News 单题对比:LongCat-2.0 的科学推理错误与测试设计边界

Hacker News 的单题对比给出一个可复现但不能排名的警告样本:LongCat-2.0 在一个核燃料选择问题上给出作者判定为错误的理由,Qwen 3.7 Plus 与 Gemini Flash 给出不同答案;评论区则指出题目语义、事实背景和 n=1 设计都不足以支持普遍结论。

来源Hacker News
原文日期2026-06-29
采集2026-09-20

待验证:本次未能重新核实原文。

模型/版本
LongCat-2.0;来源日期:2026-06-29。
harness/任务
原帖作者把 U-235 与 Pu-241(均混合 95% U-238)作为二选一核反应堆燃料,询问应选哪个以及原因;原始问题可直接从页面复核。;LongCat-2.0 的回答被作者描述为“理由写得很好但结论错误”,选择了 Pu-241。
样本/缺口
局限记录:Hacker News 的单题对比给出一个可复现但不能排名的警告样本:LongCat-2.0 在一个核燃料选择问题上给出作者判定为错误的理由,Qwen 3.7 Plus 与 Gemini Flash 给出不同答案;评论区则指出题目语义、事实背景和 n=1 设计都不足以支持普遍结论。
编程Agent成本

LongCat 2.0

在 Tabbit 中比较 LongCat 2.0

客户端中的模型、功能和权限以当前账户为准。