Tabbit
活动资源博客模型
Tabbit LogoTabbit

Tabbit — 为你工作的 AI 浏览器

主题资源

  • AI Browser Resources
  • Agentic Browser Resources
  • Browser Downloads and Install Guides
  • Browser Comparisons
  • AI Browser Alternatives
  • Browser Productivity Resources

热门指南

  • AI Browser
  • Agentic Browser Download
  • Best AI Browser 2026: Top 9 Tested & Ranked
  • AI Browser Download
  • Free AI Browser
  • Best AI Browser 2026
  • AI Browser Comparison 2026
  • AI Browser for Windows
  • AI Browser for Mac
  • Chrome Alternative 2026

活动

  • 别装了,你在《牛来》里早有原型
  • Tabbit 妙招大赛
  • KPOP SBTI 饭圈人格测试
  • Tabbit 校园共创者计划
  • fifi 的论文文献妙招精选
  • 用户问卷

关于

  • Tabbit 博客
  • 媒体报道
简体中文
简体中文English
测评与证据

LongCat 2.0 · 媒体来源 · 独立测量

eesel 独立核查:LongCat-2.0 的 Agent 可靠性与生产接入硬阻塞

这篇独立核查把 LongCat-2.0 拆成“模型能否完成 Agent 工作”和“产品能否进入企业生产”两件事:公开用户报告支持其作为便宜、稳定的编码执行器,但上下文规格、工具契约和数据治理文档不足以通过敏感数据生产审核。

待验证:本次未能重新核实原文。下方历史数字不代表已核实的当前结果。

媒体来源独立测量编辑日期 2026-09-20

测试条件速查

模型/版本
LongCat-2.0;来源日期:2026-08-04。
harness/任务
这篇独立核查把 LongCat-2.0 拆成“模型能否完成 Agent 工作”和“产品能否进入企业生产”两件事:公开用户报告支持其作为便宜、稳定的编码执行器,但上下文规格、工具契约和数据治理文档不足以通过敏感数据生产审核。
样本/缺口
局限记录:作者为 eesel AI 从业者,文中含其产品推广;有关数据治理的核查项可复查,但购买建议应与供应商原始政策、法律和安全团队意见分开。;复现时保存:官方 config.json、API 响应头与错误体、harness 配置、输入 token 数、工具 schema、供应商政策页面和采集日期。

关键数据与适用场景

一句话结论

这篇独立核查把 LongCat-2.0 拆成“模型能否完成 Agent 工作”和“产品能否进入企业生产”两件事:公开用户报告支持其作为便宜、稳定的编码执行器,但上下文规格、工具契约和数据治理文档不足以通过敏感数据生产审核。

适用场景

  • 适合的任务:非敏感数据上的高频 Agent 编码、代码库导航、文档转换和长程重构;需要自带 harness 的个人开发者或小团队

  • 不适合的任务:客户工单、受监管数据、需要明确保留/训练/驻留政策的企业;依赖公开 function calling/MCP 契约的服务

  • 适用的模型版本:LongCat-2.0;文章核对的是 2026-08-04 前后官方 API、模型卡和部署资料

  • 适用的客户端、Agent 或 API:Claude Code、Hermes 等由客户端承担 Agent 循环的 harness;OpenRouter 或官方 API 路径需分别核验

  • 推荐的推理档位和参数:文章没有给出统一 temperature/effort 配置;复现时应记录渠道、是否 thinking、harness 版本和上下文长度

测试/工作流步骤

  1. 分别检查官方许可、价格页、config.json、API 参考、模型卡、平台 FAQ 和部署配方,不把新闻稿当作完整产品文档。

  2. 以 Agent harness 运行同一仓库任务,记录计划、工具调用、代码修改、测试结果和失败恢复;不要只做单轮谜题。

  3. 单独测试工具契约:工具参数格式、tool_choice、并行调用、tool_result、内容块和温度范围;把不支持项列成阻断清单。

  4. 单独做上下文验证:用 256K 以下、接近 1M 的输入分别测量截断、延迟和错误,而不是直接采用营销页的 1M 数字。

  5. 做数据治理审查:要求供应商明确提示词是否留存/训练、数据驻留、SLA 和零数据保留;没有书面答案就不进入敏感生产。

原始数据与结果

可靠 Agent 的正向证据

  • 文章引用一名通过 OpenRouter/Hermes 跑过 3.6B tokens 的用户:长上下文保持连贯,能按计划执行并完成多个应用;另一名 Hacker News 用户也称它是“dependable workhorse”。

  • 作者将这类证据解释为“执行可靠、不是顶级推理器”:更适合由 harness 负责规划、模型负责执行的编码 Agent,而非单轮通用推理。

  • 文章同时保留反例:低票数 Reddit 用户报告直接 prompting 时指令跟随和代码质量很差;作者认为成功与失败都提示 harness 对结果影响很大。

公开规格与基准的核对

  • 文章复列 SWE-bench Pro 59.5,并指出 LongCat 的官方结果来自 Meituan 自建 harness、无 reasoning mode 且标注修正过 problematic tasks;与其他厂商分数不应视为同一实验。

  • 文章指出官方配置文件把 max_position_embeddings 设为 262,144,并把 YaRN 预留到更高长度;据此建议把“可运行的上下文”按 256K 输入而非无条件 1M 处理。

  • 文章核对到 API 参考没有公开 tools 数组、tool_choice、parallel_tool_calls、metadata、stop_sequences 或 tool_result 内容块等完整契约;文章认为 Agent 能力主要来自客户端 harness。

产品接入阻塞

  • 文章对官方 FAQ 的核查结果:没有明确说明数据留存、是否用 prompt 训练、数据驻留或 SLA;作者把数据治理项评为 F。

  • 官方直连支付方式、优惠价格和 OpenRouter 单提供方策略会随时间变化;文章把价格优势限定为促销期,不把 $0.30/M 当作永久价格。

  • 结论分层:个人项目可试;客户数据、企业合规和支持队列先停在治理审查,不因 MIT 许可或低 token 价格跳过审核。

结论

在“由成熟 Agent harness 驱动、数据不敏感、成本敏感”的编码任务上,LongCat-2.0 值得试用;在生产接入上,真正的阻塞点是可核验的上下文/工具契约和数据处理政策缺失,而不是单一 benchmark 分数。

局限与复现步骤

  • 文章不是公开盲测:正负面体验来自不同用户、不同渠道和不同 harness,不能给出统一胜率。

  • 上下文 256K 的判断依赖文章对 config.json 的核对;API/部署渠道可能采用不同限制,应在目标端点实测并保存响应。

  • 作者为 eesel AI 从业者,文中含其产品推广;有关数据治理的核查项可复查,但购买建议应与供应商原始政策、法律和安全团队意见分开。

  • 复现时保存:官方 config.json、API 响应头与错误体、harness 配置、输入 token 数、工具 schema、供应商政策页面和采集日期。

来源摘录或观察(仅做合规短引)

  • 文章的总评是“better model than its benchmark table suggests and a worse product than its price suggests”。

  • 文章把推荐限定为“cheap, high-volume agentic coding”,并把敏感数据生产列为硬阻塞。

能支持的判断

  • 在“由成熟 Agent harness 驱动、数据不敏感、成本敏感”的编码任务上,LongCat-2.0 值得试用;在生产接入上,真正的阻塞点是可核验的上下文/工具契约和数据处理政策缺失,而不是单一 benchmark 分数。

不能支持的判断

  • 作者为 eesel AI 从业者,文中含其产品推广;有关数据治理的核查项可复查,但购买建议应与供应商原始政策、法律和安全团队意见分开。
  • 复现时保存:官方 config.json、API 响应头与错误体、harness 配置、输入 token 数、工具 schema、供应商政策页面和采集日期。

方法、局限和复现

本文中的数字、任务集、推理档位和客户端条件只在所列来源及采集时点内成立。不同版本、不同 harness 或不同提供商的数据不能直接并排比较;未公开的参数保持未知。

需要复测时,请固定模型版本、提供商或客户端、推理档位、工具、任务集版本、样本数和采集日期,并记录失败、重试与人工修正。完整方法和复现步骤见下方来源笔记。

原始来源

eesel AI Blog · Alicia Kirana Utomo;Katelin Teen 审阅 · 原文发布日期 2026-08-04 · 本站编辑日期 2026-09-20

打开原始来源

LongCat 2.0

在 Tabbit 中比较 LongCat 2.0

下载 Tabbit 客户端后检查模型可用性

模型深度阅读

总览 · 简体中文

LongCat 2.0:变化、使用方式,以及低价没有告诉你的事

LongCat 2.0 提供 100 万上下文、开放权重和低价 API,但工具兼容、数据条款与实际运维成本仍需单独核实。

相关评测

LongCat-2.0 官方模型卡:规格与官方基准(含与 Gemini/GPT-5.5/Claude Opus 对比表)官方模型卡是判断 LongCat-2.0 适用任务的第一手权威依据:它在 SWE-bench Pro(59.5)超过 GPT-5.5(58.6)与 Gemini 3.1 Pro(54.2),Terminal-Bench 2.1 达 70.8,但在 BrowseComp/GPQA/IFEval 等多项上落后于 GPT-5.5 与 Claude Opus 4.8——即"编码与 Agent 任务强、检索与通用推理非顶尖"。LongCat-2.0 官方技术博客:架构、国产算力训练与推理部署(发布说明)官方技术博客给出了 LongCat-2.0 的完整技术底稿(LSA 稀疏注意力、N-gram Embedding、国产算力 6D 并行训练、prefill-decode 分离部署),可用于判断模型的长上下文/Agent 能力设计意图,以及复现官方基准与部署路径。OpenRouter 渠道数据:LongCat-2.0 定价、实测性能与第三方基准(Artificial Analysis)OpenRouter 页面提供了官方之外的第三方口径:LongCat-2.0 标价 $0.30/$1.20 per 1M(采集时 60% 折扣),实际加权成交输入价仅 $0.03872/M(缓存命中率 88.9%),吞吐 P50 29 tok/s、3 天可用性 99.93%,工具调用错误率 0.90%,且真实流量主要来自 Hermes Agent(7.77B tokens)与 Claude Code(3.31B tokens)。AI Profit Boardroom 实测:LongCat 2.0 游戏构建测试与 GLM 5.2 同任务对比作者自测结论与多数社区口碑相反:LongCat 2.0 做的游戏"可玩但粗糙有 bug"(一个构建甚至全黑屏),同任务下 GLM 5.2 的产物"更干净、更流畅、更精致",因此他的建议是"值得玩玩、不值得切换"——这是对 LongCat 2.0 偏负面的独立样本,需与正面证据并读。LongCat-2.0 聊天模板与工具调用配置(官方 Hugging Face 模型卡)The official model card’s chat template and tool-call examples are converted into a local inference configuration check.Claude Code 接入 LongCat-2.0 配置(官方文档)The LongCat Claude Code guide configures a compatible endpoint and keeps the first task in a disposable worktree.Hermes Agent 接入 LongCat-2.0 配置(官方文档 + Nous Portal 免费入口)来源「Hermes Agent 接入 LongCat-2.0 配置(官方文档 + Nous Portal 免费入口)」整理为可执行的任务指南;运行环境、输入与验收边界按该来源保留。OpenClaw 接入 LongCat-2.0 配置(官方文档)来源「OpenClaw 接入 LongCat-2.0 配置(官方文档)」整理为可执行的任务指南;运行环境、输入与验收边界按该来源保留。