Tabbit
活动资源博客模型
Tabbit LogoTabbit

Tabbit — 为你工作的 AI 浏览器

主题资源

  • AI Browser Resources
  • Agentic Browser Resources
  • Browser Downloads and Install Guides
  • Browser Comparisons
  • AI Browser Alternatives
  • Browser Productivity Resources

热门指南

  • AI Browser
  • Agentic Browser Download
  • Best AI Browser 2026: Top 9 Tested & Ranked
  • AI Browser Download
  • Free AI Browser
  • Best AI Browser 2026
  • AI Browser Comparison 2026
  • AI Browser for Windows
  • AI Browser for Mac
  • Chrome Alternative 2026

活动

  • 别装了,你在《牛来》里早有原型
  • Tabbit 妙招大赛
  • KPOP SBTI 饭圈人格测试
  • Tabbit 校园共创者计划
  • fifi 的论文文献妙招精选
  • 用户问卷

关于

  • Tabbit 博客
  • 媒体报道
测评
媒体LongCat Flash Chat

LongCat-Flash-Chat 官方模型卡:MoE 架构、基准与工具能力

原始来源

Hugging Face(Meituan LongCat 官方模型卡)

作者Meituan LongCat Team

Tabbit 整理2026-08-19

查看原文

一句话结论

LongCat-Flash-Chat 是 560B 总参数、平均约 27B 激活的非思考 MoE,官方表格显示其工具调用和指令遵循较强、代码中等偏强,但长上下文图遍历和隐私安全指标仍需单独验证。

适用场景

  • 适合的任务:非思考对话、工具调用、多步 Agent、指令执行、代码生成/解释、低延迟大模型推理和 128K 长上下文任务。

  • 不适合的任务:仅凭官方表格将其用于敏感生产系统;尤其是长上下文检索、隐私、安全和跨语言场景需本地复测。

  • 适用的模型版本:开源 meituan-longcat/LongCat-Flash-Chat;API 后续版本与开源权重可能不同。

  • 适用的客户端、Agent 或 API:Hugging Face 权重、SGLang/vLLM、本地 chat template;历史 LongCat API 另受退役时间线约束。

  • 推荐的推理档位和参数:模型卡标为 non-thinking;未公开一组统一 temperature/top-p/采样参数。

测试环境

  • 测试方:Meituan LongCat Team。

  • 对照模型:DeepSeek V3.1、Qwen3 MoE-2507、Kimi-K2、GPT-4.1、Claude 4 Sonnet、Gemini 2.5 Flash。

  • 模型规模:LongCat-Flash 总参数 560B,平均激活 27B(动态范围 18.6B–31.3B)。

  • 推理效率主张:官方称 H800 推理速度超过 100 TPS;上下文在模型卡中为 128K,API 2025-12 更新另称支持 256K,需区分版本。

输入/配置

  • 模式:non-thinking foundation model。

  • 工具:官方给出 <longcat_tool_call> XML 工具调用格式,函数名和参数以 JSON 放入标签。

  • 部署:仓库提供 SGLang/vLLM 基础适配和 deployment guide;完整硬件、量化、batch 和采样配置未公开。

  • 评测备注:对照表注明部分带 * 的外部数值来自其他公开报告,且多种对照模型以 non-thinking 模式评测。

结果数据

模型卡公开的 LongCat-Flash 数值(括号为指标定义):

能力BenchmarkLongCat-Flash
通用MMLU89.71
通用MMLU-Pro82.68
通用ArenaHard-V286.50
指令遵循IFEval89.65
指令遵循COLLIE57.10
数学MATH50096.40
数学AIME24 avg@1070.42
数学AIME25 avg@1061.25
推理GPQA-diamond73.23
推理ZebraLogic89.30
长上下文GraphWalks-128k precision51.05
代码LiveCodeBench pass@148.02
代码Humaneval+ pass@188.41
代码MBPP+ pass@179.63
代码SWE-Bench-Verified60.40
代码TerminalBench39.51
Agent 工具τ²-Bench telecom avg@473.68
Agent 工具τ²-Bench airline avg@458.00
Agent 工具τ²-Bench retail avg@471.27
Agent 工具AceBench76.10
Agent 工具VitaBench avg@424.30
安全Harmful / Criminal / Misinformation / Privacy83.98 / 91.24 / 81.72 / 93.98

结论

官方表格支持 LongCat-Flash 在工具使用、指令遵循、对话和代码基础任务上具有竞争力;τ²-Bench telecom 73.68、IFEval 89.65 和 SWE-Bench Verified 60.4 是较有用的任务信号。GraphWalks-128k 仅 51.05,说明长上下文图遍历不能被“128K 支持”替代;安全和隐私分数也应结合真实政策测试。

局限

  • 数字来自官方模型卡,完整 prompt、硬件、采样和独立复核未公开。

  • 模型卡与 API Change Log 对上下文有 128K/256K 两个版本口径,不能混为同一快照。

  • 对照模型有些使用非思考模式、部分带星号数据来自其他报告,跨列比较需谨慎。

  • 模型卡明确提醒下游应用应自行评估准确性、安全和公平性;官方分数不构成敏感场景上线许可。

复现步骤

  1. 固定开源 commit、tokenizer、推理引擎、量化、context、temperature 和 batch 配置。

  2. 使用官方 chat template,分别测试无工具、多轮和工具调用,保存原始消息与 XML 解析日志。

  3. 按通用、指令、数学、代码、Agent、长上下文、安全分桶复测,记录 token、吞吐、延迟和失败恢复。

  4. 对历史 API 与本地权重分开报告,标注 128K/256K 版本和模型下线状态。

来源摘录或观察(仅做合规短引)

  • 模型卡把 LongCat-Flash 定义为 non-thinking model,并将动态激活范围写为 18.6B–31.3B。

  • 官方 Agent 评测同时覆盖 telecom、airline、retail 三类 τ²-Bench,说明工具任务表现存在场景差异。

Tabbit 小编提醒

本文是第三方资料导航。测试环境、模型版本和主观体验可能不同,请以原文为准。

LongCat Flash Chat

在 Tabbit 中使用并对比模型

LongCat Flash Chat

相关测评

媒体LongCat API Platform Change Log2025-08-29

LongCat 官方 Change Log:Flash-Chat API 上线、升级与退役迁移边界

社区Reddit r/LocalLLaMA2025-08-31

Reddit:LongCat-Flash-Chat 560B MoE 速度与本地部署社区观察

LongCat Flash Chat

相关提示词

社区GitHub(Meituan LongCat 官方仓库)

LongCat-Flash-Chat 官方聊天模板与工具调用提示

媒体LongCat API Docs

LongCat API 官方兼容格式与鉴权配置