官方技术报告显示 LongCat-Flash-Thinking-2601 的优势集中在工具搜索、复杂 Agent 环境和噪声鲁棒性,但其分数来自厂商设计的环境与测试协议,不能直接当作跨模型独立复测结果。
模型:560B 总参数、约 27B 平均激活参数的 MoE 推理模型。
训练/推理环境:DORA 多环境强化学习;报告称覆盖 10,000+ 环境、20+ 领域,并可支持最多 32,000 个并发环境。
Agent 环境:工具依赖图包含 60+ 工具;任务在可执行环境中验证,代码 Agent 沙箱提供搜索、文件读写、代码编辑和 shell 能力。
Heavy Thinking:并行生成多条轨迹扩展推理宽度,再通过总结与递归反馈扩展深度;官方描述使用相对较高的推理温度以保持轨迹多样性。
测评协议:搜索、工具调用、噪声环境、随机复杂任务、数学、通用问答和编码等多组任务;部分指标为 Avg@4/Avg@16 或 Pass@1。
对标准工具 Agent 任务,提供可执行工具环境并记录完整工具轨迹。
对 Heavy Thinking 对照,分别记录普通推理和多轨迹 + 总结递归模式,不把两者混为一个温度参数。
对噪声测试,在相同任务中注入环境不确定性,单独报告 clean 与 noise 结果。
对随机复杂任务,使用随机生成的工具集和可执行环境,记录随机种子、工具图和任务答案。
报告/官方模型卡给出的 LongCat-Flash-Thinking-2601 结果包括:
| 任务 | 结果 | 复核说明 |
|---|---|---|
| BrowseComp | 56.6 / 73.1 | 页面同时报告普通与上下文管理条件;复现时保留原顺序 |
| BrowseComp-zh | 69.0 / 77.7 | 官方说明人工修订了 24 个标注错误案例 |
| RW Search | 79.5 | Agent 搜索 Pass@1 |
| τ²-Avg | 88.2 | 四次平均 |
| τ²-Noise | 67.1 | 注入环境噪声的四次平均 |
| VitaBench / VitaBench-Noise | 29.3 / 20.5 | 噪声条件明显降低结果 |
| Random Complex Tasks | 35.8 | 随机环境泛化测试 |
| AIME-25 Avg@16 | 99.6 / 100.0‡ | ‡ 为 Heavy Thinking |
| GPQA-Diamond Avg@16 | 80.5 / 85.2‡ | ‡ 为 Heavy Thinking |
| SWE-bench Verified Avg@5 | 70.0 | 编码任务 |
报告摘要将 BrowseComp 73.1、RW Search 77.7、τ²-Bench 88.2、VitaBench 29.3 概括为其 Agent 能力代表结果;网页表格与摘要存在指标命名/条件差异,复核时应以表格和脚注为准。
适合:需要搜索、工具链编排、复杂依赖图和不完美环境下恢复的 Agent 任务。
可能不占优:纯通用问答或不允许工具的任务;官方表中 HLE text-only 为 25.2,不能用 Agent 分数替代无工具能力。
重视边界:Heavy Thinking 的收益来自额外轨迹和递归总结,意味着更高推理成本,不是普通单次调用的免费增益。
这是模型团队自己的技术报告,环境构造、标注修订、采样预算和实现细节并非完全独立审计。
表中带 † 的对照数来自其他公开报告;带 * 的部分结果是无工具分数;这些不能与同一协议下的独立实测直接混排。
BrowseComp-zh 修订 24 个案例、τ²-Airline 使用对其他报告的环境修复,都会影响横向比较。
报告没有提供一份可直接运行的完整 benchmark harness、随机种子和全部环境资产,复现需要向官方仓库/团队进一步核对。
固定 2601 权重、推理引擎、工具 schema、上下文管理策略和采样预算。
先跑无工具/普通模式基线,再跑工具模式;独立记录 Avg@4、Avg@16、Pass@1 和失败类型。
复制相同任务到 clean/noise 环境,保留噪声类型和强度。
如实现 Heavy Thinking,保存每条并行轨迹、总结输入和递归轮数,并报告额外 token 与墙钟时间。
对 BrowseComp-zh 和 τ²-Airline 另列“官方修订/修复”版本,避免与原始数据混淆。
技术报告介绍 DORA 多环境 RL、环境噪声 curriculum、随机复杂任务合成和 Heavy Thinking;以上数值来自报告/模型卡的结果表及脚注,未做二次推断。
官方结果适合判断“是否值得测试工具 Agent 与 Heavy Thinking”,不适合作为目标业务的延迟、成本或成功率承诺。部署者必须用自己的工具、噪声和任务集复测。
报告的核心设计是将多条独立轨迹送入总结环节,再递归反馈;这解释了它在难题上的潜在收益,也解释了额外推理开销。
LongCat Flash Thinking