LongCat-Flash-Chat 是 560B 总参数、平均约 27B 激活的非思考 MoE,官方表格显示其工具调用和指令遵循较强、代码中等偏强,但长上下文图遍历和隐私安全指标仍需单独验证。
适合的任务:非思考对话、工具调用、多步 Agent、指令执行、代码生成/解释、低延迟大模型推理和 128K 长上下文任务。
不适合的任务:仅凭官方表格将其用于敏感生产系统;尤其是长上下文检索、隐私、安全和跨语言场景需本地复测。
适用的模型版本:开源 meituan-longcat/LongCat-Flash-Chat;API 后续版本与开源权重可能不同。
适用的客户端、Agent 或 API:Hugging Face 权重、SGLang/vLLM、本地 chat template;历史 LongCat API 另受退役时间线约束。
推荐的推理档位和参数:模型卡标为 non-thinking;未公开一组统一 temperature/top-p/采样参数。
测试方:Meituan LongCat Team。
对照模型:DeepSeek V3.1、Qwen3 MoE-2507、Kimi-K2、GPT-4.1、Claude 4 Sonnet、Gemini 2.5 Flash。
模型规模:LongCat-Flash 总参数 560B,平均激活 27B(动态范围 18.6B–31.3B)。
推理效率主张:官方称 H800 推理速度超过 100 TPS;上下文在模型卡中为 128K,API 2025-12 更新另称支持 256K,需区分版本。
模式:non-thinking foundation model。
工具:官方给出 <longcat_tool_call> XML 工具调用格式,函数名和参数以 JSON 放入标签。
部署:仓库提供 SGLang/vLLM 基础适配和 deployment guide;完整硬件、量化、batch 和采样配置未公开。
评测备注:对照表注明部分带 * 的外部数值来自其他公开报告,且多种对照模型以 non-thinking 模式评测。
模型卡公开的 LongCat-Flash 数值(括号为指标定义):
| 能力 | Benchmark | LongCat-Flash |
|---|---|---|
| 通用 | MMLU | 89.71 |
| 通用 | MMLU-Pro | 82.68 |
| 通用 | ArenaHard-V2 | 86.50 |
| 指令遵循 | IFEval | 89.65 |
| 指令遵循 | COLLIE | 57.10 |
| 数学 | MATH500 | 96.40 |
| 数学 | AIME24 avg@10 | 70.42 |
| 数学 | AIME25 avg@10 | 61.25 |
| 推理 | GPQA-diamond | 73.23 |
| 推理 | ZebraLogic | 89.30 |
| 长上下文 | GraphWalks-128k precision | 51.05 |
| 代码 | LiveCodeBench pass@1 | 48.02 |
| 代码 | Humaneval+ pass@1 | 88.41 |
| 代码 | MBPP+ pass@1 | 79.63 |
| 代码 | SWE-Bench-Verified | 60.40 |
| 代码 | TerminalBench | 39.51 |
| Agent 工具 | τ²-Bench telecom avg@4 | 73.68 |
| Agent 工具 | τ²-Bench airline avg@4 | 58.00 |
| Agent 工具 | τ²-Bench retail avg@4 | 71.27 |
| Agent 工具 | AceBench | 76.10 |
| Agent 工具 | VitaBench avg@4 | 24.30 |
| 安全 | Harmful / Criminal / Misinformation / Privacy | 83.98 / 91.24 / 81.72 / 93.98 |
官方表格支持 LongCat-Flash 在工具使用、指令遵循、对话和代码基础任务上具有竞争力;τ²-Bench telecom 73.68、IFEval 89.65 和 SWE-Bench Verified 60.4 是较有用的任务信号。GraphWalks-128k 仅 51.05,说明长上下文图遍历不能被“128K 支持”替代;安全和隐私分数也应结合真实政策测试。
数字来自官方模型卡,完整 prompt、硬件、采样和独立复核未公开。
模型卡与 API Change Log 对上下文有 128K/256K 两个版本口径,不能混为同一快照。
对照模型有些使用非思考模式、部分带星号数据来自其他报告,跨列比较需谨慎。
模型卡明确提醒下游应用应自行评估准确性、安全和公平性;官方分数不构成敏感场景上线许可。
固定开源 commit、tokenizer、推理引擎、量化、context、temperature 和 batch 配置。
使用官方 chat template,分别测试无工具、多轮和工具调用,保存原始消息与 XML 解析日志。
按通用、指令、数学、代码、Agent、长上下文、安全分桶复测,记录 token、吞吐、延迟和失败恢复。
对历史 API 与本地权重分开报告,标注 128K/256K 版本和模型下线状态。
模型卡把 LongCat-Flash 定义为 non-thinking model,并将动态激活范围写为 18.6B–31.3B。
官方 Agent 评测同时覆盖 telecom、airline、retail 三类 τ²-Bench,说明工具任务表现存在场景差异。
LongCat Flash Chat