Tabbit
活动资源博客模型
Tabbit LogoTabbit

Tabbit — 为你工作的 AI 浏览器

主题资源

  • AI Browser Resources
  • Agentic Browser Resources
  • Browser Downloads and Install Guides
  • Browser Comparisons
  • AI Browser Alternatives
  • Browser Productivity Resources

热门指南

  • AI Browser
  • Agentic Browser Download
  • Best AI Browser 2026: Top 9 Tested & Ranked
  • AI Browser Download
  • Free AI Browser
  • Best AI Browser 2026
  • AI Browser Comparison 2026
  • AI Browser for Windows
  • AI Browser for Mac
  • Chrome Alternative 2026

活动

  • 别装了,你在《牛来》里早有原型
  • Tabbit 妙招大赛
  • KPOP SBTI 饭圈人格测试
  • Tabbit 校园共创者计划
  • fifi 的论文文献妙招精选
  • 用户问卷

关于

  • Tabbit 博客
  • 媒体报道
测评
媒体LongCat Flash Thinking

LongCat-Flash-Thinking-2601:Heavy Thinking、环境噪声与 Agent 基准

原始来源

arXiv

作者Meituan LongCat Team

Tabbit 整理2026-08-19

查看原文

一句话结论

官方技术报告显示 LongCat-Flash-Thinking-2601 的优势集中在工具搜索、复杂 Agent 环境和噪声鲁棒性,但其分数来自厂商设计的环境与测试协议,不能直接当作跨模型独立复测结果。

测试环境

  • 模型:560B 总参数、约 27B 平均激活参数的 MoE 推理模型。

  • 训练/推理环境:DORA 多环境强化学习;报告称覆盖 10,000+ 环境、20+ 领域,并可支持最多 32,000 个并发环境。

  • Agent 环境:工具依赖图包含 60+ 工具;任务在可执行环境中验证,代码 Agent 沙箱提供搜索、文件读写、代码编辑和 shell 能力。

  • Heavy Thinking:并行生成多条轨迹扩展推理宽度,再通过总结与递归反馈扩展深度;官方描述使用相对较高的推理温度以保持轨迹多样性。

  • 测评协议:搜索、工具调用、噪声环境、随机复杂任务、数学、通用问答和编码等多组任务;部分指标为 Avg@4/Avg@16 或 Pass@1。

输入/配置

  1. 对标准工具 Agent 任务,提供可执行工具环境并记录完整工具轨迹。

  2. 对 Heavy Thinking 对照,分别记录普通推理和多轨迹 + 总结递归模式,不把两者混为一个温度参数。

  3. 对噪声测试,在相同任务中注入环境不确定性,单独报告 clean 与 noise 结果。

  4. 对随机复杂任务,使用随机生成的工具集和可执行环境,记录随机种子、工具图和任务答案。

结果数据

报告/官方模型卡给出的 LongCat-Flash-Thinking-2601 结果包括:

任务结果复核说明
BrowseComp56.6 / 73.1页面同时报告普通与上下文管理条件;复现时保留原顺序
BrowseComp-zh69.0 / 77.7官方说明人工修订了 24 个标注错误案例
RW Search79.5Agent 搜索 Pass@1
τ²-Avg88.2四次平均
τ²-Noise67.1注入环境噪声的四次平均
VitaBench / VitaBench-Noise29.3 / 20.5噪声条件明显降低结果
Random Complex Tasks35.8随机环境泛化测试
AIME-25 Avg@1699.6 / 100.0‡‡ 为 Heavy Thinking
GPQA-Diamond Avg@1680.5 / 85.2‡‡ 为 Heavy Thinking
SWE-bench Verified Avg@570.0编码任务

报告摘要将 BrowseComp 73.1、RW Search 77.7、τ²-Bench 88.2、VitaBench 29.3 概括为其 Agent 能力代表结果;网页表格与摘要存在指标命名/条件差异,复核时应以表格和脚注为准。

结论

  • 适合:需要搜索、工具链编排、复杂依赖图和不完美环境下恢复的 Agent 任务。

  • 可能不占优:纯通用问答或不允许工具的任务;官方表中 HLE text-only 为 25.2,不能用 Agent 分数替代无工具能力。

  • 重视边界:Heavy Thinking 的收益来自额外轨迹和递归总结,意味着更高推理成本,不是普通单次调用的免费增益。

局限

  • 这是模型团队自己的技术报告,环境构造、标注修订、采样预算和实现细节并非完全独立审计。

  • 表中带 † 的对照数来自其他公开报告;带 * 的部分结果是无工具分数;这些不能与同一协议下的独立实测直接混排。

  • BrowseComp-zh 修订 24 个案例、τ²-Airline 使用对其他报告的环境修复,都会影响横向比较。

  • 报告没有提供一份可直接运行的完整 benchmark harness、随机种子和全部环境资产,复现需要向官方仓库/团队进一步核对。

复现步骤

  1. 固定 2601 权重、推理引擎、工具 schema、上下文管理策略和采样预算。

  2. 先跑无工具/普通模式基线,再跑工具模式;独立记录 Avg@4、Avg@16、Pass@1 和失败类型。

  3. 复制相同任务到 clean/noise 环境,保留噪声类型和强度。

  4. 如实现 Heavy Thinking,保存每条并行轨迹、总结输入和递归轮数,并报告额外 token 与墙钟时间。

  5. 对 BrowseComp-zh 和 τ²-Airline 另列“官方修订/修复”版本,避免与原始数据混淆。

原始证据与数据

技术报告介绍 DORA 多环境 RL、环境噪声 curriculum、随机复杂任务合成和 Heavy Thinking;以上数值来自报告/模型卡的结果表及脚注,未做二次推断。

适用边界

官方结果适合判断“是否值得测试工具 Agent 与 Heavy Thinking”,不适合作为目标业务的延迟、成本或成功率承诺。部署者必须用自己的工具、噪声和任务集复测。

来源摘录或观察(仅做合规短引)

报告的核心设计是将多条独立轨迹送入总结环节,再递归反馈;这解释了它在难题上的潜在收益,也解释了额外推理开销。

Tabbit 小编提醒

本文是第三方资料导航。测试环境、模型版本和主观体验可能不同,请以原文为准。

LongCat Flash Thinking

在 Tabbit 中使用并对比模型

LongCat Flash Thinking

相关测评

媒体LongCat API Platform2025-09-22

LongCat-Flash-Thinking:API 别名升级、自动路由与服务退役边界

社区Reddit / r/LocalLLaMA

LongCat-Flash-Thinking-2601:LocalLLaMA 社区的初步阅读与部署观察

LongCat Flash Thinking

相关提示词

媒体Hugging Face

LongCat-Flash-Thinking-2601:官方聊天模板、工具调用与思维历史配置

社区GitHub

LongCat-Flash-Thinking-2601:官方 SGLang/vLLM 部署与 MTP 配置