Vals AI 的线程把 Qwen3.8-Max 的提升解释为“更坚持”而不只是“更聪明”:Legal Research Bench 排名从第 22 升到第 4,单任务成本约为 $2.49,但每个任务的轮次、工具调用、来源数和耗时都明显增加。全通过率从 25.5% 升至 47.6%,比只看平均准确率更能体现长链路任务的变化。
Legal Research Bench:208 个隔离问题;准确率 78.4% → 86.1%。
全通过率:25.5% → 47.6%。
每任务轮次:19.7 → 35.5;工具调用:38 → 60;来源:7.1 → 12.2;耗时:809 秒 → 3,678 秒。
CourtListener 调用:6.8 → 22.9 次;通用网络搜索下降。
最大输出令牌从 64K 增至 128K;法律研究使用约 6 倍推理能力,最终答案长度增加 1.7 倍。
任务成本:Qwen3.8-Max $2.49;Opus 5 $6.76;Fable 5 $9.79;GPT-5.6 Sol $21.61。
把 Qwen3.8-Max 的优势写成“长链路完成率/证据覆盖率提升”比简单写“更聪明”更准确;同时必须把延迟、工具调用和成本一起写出。对于需要快速响应的场景,不应默认使用最高推理档位。
本站仅展示 Tabbit 编辑摘要和必要节选;完整内容、上下文与最新版本请查看原始来源。
以上英文为 X 页面中“显示原文”对应的线程正文;原帖还包含互动数据和评论,未将导航、广告和无关推荐内容放入正文。
Qwen3.8 Max