Tabbit
活动资源博客模型
Tabbit LogoTabbit

Tabbit — 为你工作的 AI 浏览器

主题资源

  • AI Browser Resources
  • Agentic Browser Resources
  • Browser Downloads and Install Guides
  • Browser Comparisons
  • AI Browser Alternatives
  • Browser Productivity Resources

热门指南

  • AI Browser
  • Agentic Browser Download
  • Best AI Browser 2026: Top 9 Tested & Ranked
  • AI Browser Download
  • Free AI Browser
  • Best AI Browser 2026
  • AI Browser Comparison 2026
  • AI Browser for Windows
  • AI Browser for Mac
  • Chrome Alternative 2026

活动

  • 别装了,你在《牛来》里早有原型
  • Tabbit 妙招大赛
  • KPOP SBTI 饭圈人格测试
  • Tabbit 校园共创者计划
  • fifi 的论文文献妙招精选
  • 用户问卷

关于

  • Tabbit 博客
  • 媒体报道
简体中文
简体中文English
测评与证据

Qwen3.8 Max · 社区来源 · 独立测量

Qwen3.8-Max:Legal Research Bench 的坚持度、全通过率与任务成本

Vals AI 的线程把 Qwen3.8-Max 的提升解释为“更坚持”而不只是“更聪明”:Legal Research Bench 排名从第 22 升到第 4,单任务成本约为 $2.49,但每个任务的轮次、工具调用、来源数和耗时都明显增加。全通过率从 25.5% 升至 47.6%,比只看平均准确率更能体现长链路任务的变化。

待验证:本次未能重新核实原文。下方历史数字不代表已核实的当前结果。

社区来源独立测量编辑日期 2026-09-20

测试条件速查

模型/版本
模型为 Qwen3.8-Max;来源标题:Qwen3.8-Max:Legal Research Bench 的坚持度、全通过率与任务成本。精确快照按原始来源。
任务/harness
Vals AI 报告 Legal Research Bench 从第 22 升至第 4、全通过率从 25.5% 升到 47.6%,单任务约 $2.49,但轮次、工具调用、来源数和耗时也增加。 完整任务集、provider、参数和评审流程未完全公开。
样本/日期
来源笔记于 2026-09-20 复核;样本数和重复次数未公开处保持未知。

关键数据与适用场景

摘要

Vals AI 的线程把 Qwen3.8-Max 的提升解释为“更坚持”而不只是“更聪明”:Legal Research Bench 排名从第 22 升到第 4,单任务成本约为 $2.49,但每个任务的轮次、工具调用、来源数和耗时都明显增加。全通过率从 25.5% 升至 47.6%,比只看平均准确率更能体现长链路任务的变化。

关键数据

  • Legal Research Bench:208 个隔离问题;准确率 78.4% → 86.1%。

  • 全通过率:25.5% → 47.6%。

  • 每任务轮次:19.7 → 35.5;工具调用:38 → 60;来源:7.1 → 12.2;耗时:809 秒 → 3,678 秒。

  • CourtListener 调用:6.8 → 22.9 次;通用网络搜索下降。

  • 最大输出令牌从 64K 增至 128K;法律研究使用约 6 倍推理能力,最终答案长度增加 1.7 倍。

  • 任务成本:Qwen3.8-Max $2.49;Opus 5 $6.76;Fable 5 $9.79;GPT-5.6 Sol $21.61。

对 Tabbit 国际版内容的启发

把 Qwen3.8-Max 的优势写成“长链路完成率/证据覆盖率提升”比简单写“更聪明”更准确;同时必须把延迟、工具调用和成本一起写出。对于需要快速响应的场景,不应默认使用最高推理档位。

原文阅读

本站仅展示 Tabbit 编辑摘要和必要节选;完整内容、上下文与最新版本请查看原始来源。

采集说明

以上英文为 X 页面中“显示原文”对应的线程正文;原帖还包含互动数据和评论,未将导航、广告和无关推荐内容放入正文。

能支持的判断

  • Vals AI 报告 Legal Research Bench 从第 22 升至第 4、全通过率从 25.5% 升到 47.6%,单任务约 $2.49,但轮次、工具调用、来源数和耗时也增加。

不能支持的判断

  • 不支持将该来源的结果外推为普遍能力、生产成功率或当前排名;Vals AI 报告 Legal Research Bench 从第 22 升至第 4、全通过率从 25.5% 升到 47.6%,单任务约 $2.49,但轮次、工具调用、来源数和耗时也增加的完整 harness、样本和复测条件未完全公开。

方法、局限和复现

本文中的数字、任务集、推理档位和客户端条件只在所列来源及采集时点内成立。不同版本、不同 harness 或不同提供商的数据不能直接并排比较;未公开的参数保持未知。

需要复测时,请固定模型版本、提供商或客户端、推理档位、工具、任务集版本、样本数和采集日期,并记录失败、重试与人工修正。完整方法和复现步骤见下方来源笔记。

原始来源

X(@ValsAI) · Vals AI · 原文发布日期 2026-08-12 · 本站编辑日期 2026-09-20

打开原始来源

Qwen3.8 Max

在 Tabbit 中比较 Qwen3.8 Max

下载 Tabbit 客户端后检查模型可用性

模型深度阅读

总览 · 简体中文

Qwen3.8 Max:更新了什么、成本如何、适合谁

从 0902 快照、多模态边界、基准口径到获取路线,帮助你判断 Qwen3.8 Max 是否值得试用。

相关评测

Qwen3.8-Max:Artificial Analysis 独立指数的质量、成本、速度与冗长账本Artificial Analysis 将 Qwen3.8 Max 的质量、成本、速度和输出冗长分开展示;页面版本、推理档位、provider 和任务样本需重开,不能把聚合指数拼成跨版本趋势。Qwen3.8-Max:NYU 上海 RITS 对代理指数演化、轮次和幻觉成本的复核NYU Shanghai RITS 资料讨论 Qwen3.8 Max 的代理轮次、幻觉或成本代理指标;任务集、工具、重复次数和版本以公开部分为准,不能外推到所有 Agent 工作负载。Qwen3.8 Max:BenchLM 的来源可核验基准分类账本BenchLM 把 Qwen3.8 Max 的 exact-source benchmark 行与聚合排名分开;类别权重、provider、harness、样本和日期各异,因此这是可核验账本而非统一独立复跑。Qwen3.8-27B 本地量化模型:推理努力等级测试作者在四台机器上测试 Qwen3.8-27B:M5 Max 上的 MLX 4-bit,以及 DGX Spark 上通过 vLLM 运行的 unsloth/Qwen3.8-27B-NVFP4。他观察到从关闭思考到 effort=low 有明显跃升,但 4-bit 下 xhigh 可能因为长思考和量化误差出现极端耗时或截断。后续回复还给出 64K 预算、8-bit 复测和内存消耗等信息。Qwen3.8 Max:Qwen3.8-Max 多轮对话:从“后续提示失忆”反馈提炼上下文恢复提示词围绕“Qwen3.8-Max 多轮对话:从“后续提示失忆”反馈提炼上下文恢复提示词”整理任务边界、必需输入和运行环境;完整步骤、变量与限制见详情。Qwen3.8 Max:Qwen3.8-Max:推理努力、上下文保持与 Agent 接入提示词指南围绕“Qwen3.8-Max:推理努力、上下文保持与 Agent 接入提示词指南”整理任务边界、必需输入和运行环境;完整步骤、变量与限制见详情。Qwen3.8 Max:Qwen3.8-Max 生产路由:EvoLink 的提示词、思考流与工具调用指南围绕“Qwen3.8-Max 生产路由:EvoLink 的提示词、思考流与工具调用指南”整理任务边界、必需输入和运行环境;完整步骤、变量与限制见详情。Qwen3.8 Max:Qwen3.8-Max 角色扮演:方向遵循、推理时长与 preset 反馈围绕“Qwen3.8-Max 角色扮演:方向遵循、推理时长与 preset 反馈”整理任务边界、必需输入和运行环境;完整步骤、变量与限制见详情。