Tabbit
活动资源博客模型
Tabbit LogoTabbit

Tabbit — 为你工作的 AI 浏览器

主题资源

  • AI Browser Resources
  • Agentic Browser Resources
  • Browser Downloads and Install Guides
  • Browser Comparisons
  • AI Browser Alternatives
  • Browser Productivity Resources

热门指南

  • AI Browser
  • Agentic Browser Download
  • Best AI Browser 2026: Top 9 Tested & Ranked
  • AI Browser Download
  • Free AI Browser
  • Best AI Browser 2026
  • AI Browser Comparison 2026
  • AI Browser for Windows
  • AI Browser for Mac
  • Chrome Alternative 2026

活动

  • 别装了,你在《牛来》里早有原型
  • Tabbit 妙招大赛
  • KPOP SBTI 饭圈人格测试
  • Tabbit 校园共创者计划
  • fifi 的论文文献妙招精选
  • 用户问卷

关于

  • Tabbit 博客
  • 媒体报道
测评
社区LongCat 2.0

AlphaSignal 深度核查:Owl Alpha 真身与 LongCat-2.0 官方宣称的现实检验

原始来源

X(Twitter)Articles(AlphaSignal)

作者AlphaSignal(@AlphaSignalAI,AI 行业资讯,30 万+ 订阅)

原文日期2026-07-01

Tabbit 整理2026-08-19

查看原文

一句话结论

这篇发布次日发布的深度核查给出最关键的背景事实——OpenRouter 上匿名跑了两个月的免费模型 "Owl Alpha" 就是 LongCat-2.0(月处理约 10 万亿 tokens、Hermes Agent 榜单第一)——同时逐条拆解官方宣称:SWE-bench Pro 险胜 GPT-5.5 是官方自测、权重发布当时还是"计划"、开源界真正的对手是 GLM-5.2(62.1 vs 59.5)。

核心事实与论点(原文要点)

Owl Alpha 背景

  • Owl Alpha 匿名在 OpenRouter 运行两个月,开发者调用时不知道厂商与内部结构;发布时月处理约 10 万亿 tokens,超过 OpenRouter 上 Hermes Agent 榜单任何模型。

  • 唯一非官方自报的证据:两个月的匿名使用量——"这是整个发布中最强的证据,也是美团唯一没有自己生成的一项"。

  • 风险披露:Owl Alpha 的 OpenRouter 列表披露提示词与补全可能被提供方记录用于改进模型——免费用户两个月里在不知情的情况下喂养了训练信号。

技术解读(与官方博客互证)

  • 零计算专家(Zero-Computation Experts):简单 token(变量名、括号)走近乎空的计算路径,难 token 走完整专家栈;按 token 路由而非按请求。

  • LSA:官方承认索引器本身成为新瓶颈(逐层逐 token 打分仍二次方、访存模式不匹配硬件预取);SI/CLI/HI 三招对应修复;风险是"错误路由把需要完整推理的 token 发到廉价路径时会静默失败",且没有公开数字说明发生频率。

  • N-gram Embedding:n-gram size 5、约 128B 参数(官方口径 135B)、有效词表扩展约 900 倍;MoE+N-gram 使有效稀疏度约 97%,N-gram 占比 <10%(>30% 后收益递减)。

  • MOPD:后训练分成 Agent / Reasoning / Interaction 三组专家,用门控网络在推理时按任务路由——"最可能真正新颖的部分",多数实验室只做权重平均合并。

硬件与训练

  • 官方称首次完全在国产集群训练万亿参数模型(约 5 万加速器、无 Nvidia),但未点名芯片商;官方致谢华为 HCCL 通信库,独立估算指向华为 Ascend 910C。

  • 官方工程声明:月硬件故障率降 70%+、35T tokens 全程无回滚无不可恢复 loss 突刺——"在不成熟的非 CUDA 硬件上做到这点是真实成果"。

基准核查

  • 官方自测表中 LongCat-2.0 唯一稳定战胜的是 Gemini 3.1 Pro;对 GPT-5.5 仅 SWE-bench Pro 险胜(59.5 vs 58.6),其余全面落后(FORTE 73.2 vs 77.8、RWSearch 78.8 vs 85.3、BrowseComp 79.9 vs 84.4)。

  • Claude Opus 4.8 对 LongCat-2.0 是更大威胁:同测试 SWE-bench Pro 69.2(领先近 10 分),Opus 4.7 也有 64.3。

  • 三项宣称逐条变薄:

    1. 权重当时未发布——GitHub 明写 "Model weights coming soon, stay tuned"(上线 10 小时仅 76 stars/4 forks);媒体"美团开源"是描述计划而非发布。(注:截至 2026-08-18,权重已在 HF 发布,此点已过期。)

    2. 最强开源对手 GLM-5.2 不在官方对比图上:GLM-5.2 同测试 SWE-bench Pro 62.1 > 59.5,且 MIT 权重早两周可下载。

    3. 官方图全为自家 harness、自家评分,且注明"problematic tasks corrected";截至发布无 Artificial Analysis、Scale 等任何独立第三方分数。

最终结论(原文)

  • 免费缓存命中对"反复重读同一上下文的 Agent"(单仓库编码 Agent、单长文档研究 Agent)最划算;一次性 one-shot 提示词几乎享受不到。

  • DeepSeek V4-Pro 标价仍低于 LongCat-2.0;想验证基准就用 GLM-5.2(权重可下载、SWE-bench Pro 更高);浏览、多步工具链、任务中判断仍由闭源前沿模型领先。

复核与适用边界

  • 文章发布于 2026-07-01(发布次日),"权重未发布"与部分价格数据($0.69/$2.78 per 1M)已过时:权重现已在 HF 发布(提示词目录 02),官方当前定价为 ¥5/¥20(提示词目录 01),OpenRouter 现价 $0.30/$1.20(测评 03)。

  • 文章是分析性评论而非受控测评,数字均转引自官方与平台,但"10 万亿 tokens/月""GLM-5.2 62.1"等关键数据未附独立原始来源链接(作者称 source links 在首条回复),引用时按第二手处理。

  • 与官方文档(测评 01、02)结合阅读效果最佳:官方给全量细节,本文给批判框架。

Tabbit 小编提醒

本文是第三方资料导航。测试环境、模型版本和主观体验可能不同,请以原文为准。

LongCat 2.0

在 Tabbit 中使用并对比模型

LongCat 2.0

相关测评

媒体Hugging Face(meituan-longcat/LongCat-2.0)2026-06-30

LongCat-2.0 官方模型卡:规格与官方基准(含与 Gemini/GPT-5.5/Claude Opus 对比表)

媒体LongCat 官网博客(longcat.chat)2026-06-30

LongCat-2.0 官方技术博客:架构、国产算力训练与推理部署(发布说明)

媒体OpenRouter(第三方模型路由平台)2026-07-20

OpenRouter 渠道数据:LongCat-2.0 定价、实测性能与第三方基准(Artificial Analysis)

媒体aiprofitboardroom.com(博客,属 Julian Goldie 的 AI Profit Boardroom 社区)2026-05-29

AI Profit Boardroom 实测:LongCat 2.0 游戏构建测试与 GLM 5.2 同任务对比

LongCat 2.0

相关提示词

媒体LongCat 官方 API 文档站(longcat.chat)2026-07

LongCat-2.0 API 平台接入快速上手(官方 Quick Start + Chat Completions 参考 + 定价)

媒体Hugging Face2026-06-30

LongCat-2.0 聊天模板与工具调用配置(官方 Hugging Face 模型卡)

媒体LongCat 官方 API 文档站(longcat.chat);X(@NousResearch 官方账号佐证免费入口)2026-08-13

Hermes Agent 接入 LongCat-2.0 配置(官方文档 + Nous Portal 免费入口)

媒体LongCat 官方 API 文档站(longcat.chat)2026-06-30

Claude Code 接入 LongCat-2.0 配置(官方文档)