Qwen3.8 Max 模型测评导航
汇总 Qwen3.8 Max 的官方基准、媒体分析和社区实测,不把第三方观点包装成 Tabbit 自测。
媒体
5 条已核对来源的资料Qwen3.8-Max:官方发布说明与完整性能结果
Qwen 官方把 Qwen3.8-Max 定位为面向编码、办公、科研、长程任务和多模态智能体的旗舰模型,宣称总参数 2.4T、激活参数 95B,并提供 reasoning effort、API 和多种 Agent harness 集成。官方文章给出大量内部基准与端到端案例,优势集中在长链路工具使用、视觉 Agent、文档办公和持续反馈;这些数字属于厂商发布结果,引用时必须同时标注评测框架、运行次数和基准性质。
Qwen3.8-Max:Artificial Analysis 独立指数的质量、成本、速度与冗长账本
Artificial Analysis 当前页面给 Qwen3.8 Max 的 Intelligence Index 评分为 58(同类 180 个模型中第 10),但同时记录了约 45 token/s 的低速度、150M 的指数评测总输出量和约 $1.13 的单任务成本,因此它更像“高质量但慢且很能思考”的 Agent 模型,而不是低延迟聊天模型。
Qwen3.8-Max:NYU 上海 RITS 对代理指数演化、轮次和幻觉成本的复核
RITS 对 Artificial Analysis 快照的整理显示,Qwen3.8-Max 的代理能力接近顶级模型,但主要通过更长的 Agent 轨迹换取:GDPval-AA 每任务约 64 轮、成本约 $1.14,且 AA-LCR 与 AA-Omniscience 下降、观测幻觉率从 23% 上升到 40%。
Qwen3.8-Max Preview:Trilogy AI 的 StackPerf 代码库架构盲测
在相同 269 文件、60 分钟、OpenCode 1.17.13 的 StackPerf 代码库架构任务中,Qwen3.8-Max Preview 得分 80、Kimi K3 得分 83;Qwen 的强项是系统边界、证据引用和 replay 元数据,Kimi 的强项是修订、再生成和场景生命周期,而两者都需要独立事实核验。
Qwen3.8 Max:BenchLM 的来源可核验基准分类账本
BenchLM 将 Qwen3.8 Max 的 52 条来源可显示基准归一为 79.91/100、218 个模型中第 6,但分类账本同时显示它在 Reasoning、Agentic、Multimodal 和指令遵循上很强,而 AutomationBench、OSWorld 2.0、HLE 等项目仍有明显缺口;“第 6”不能替代分项任务选择。
社区
4 条已核对来源的资料Qwen3.8-Max:Legal Research Bench 的坚持度、全通过率与任务成本
Vals AI 的线程把 Qwen3.8-Max 的提升解释为“更坚持”而不只是“更聪明”:Legal Research Bench 排名从第 22 升到第 4,单任务成本约为 $2.49,但每个任务的轮次、工具调用、来源数和耗时都明显增加。全通过率从 25.5% 升至 47.6%,比只看平均准确率更能体现长链路任务的变化。
Qwen3.8-27B 本地量化模型:推理努力等级测试
作者在四台机器上测试 Qwen3.8-27B:M5 Max 上的 MLX 4-bit,以及 DGX Spark 上通过 vLLM 运行的 unsloth/Qwen3.8-27B-NVFP4。他观察到从关闭思考到 effort=low 有明显跃升,但 4-bit 下 xhigh 可能因为长思考和量化误差出现极端耗时或截断。后续回复还给出 64K 预算、8-bit 复测和内存消耗等信息。
Reddit 社区:Qwen3.8-Max 编程能力、速度与额度消耗
这是一个问“Qwen3.8-Max 是否真的适合编程”的社区讨论。反馈两极:有人认为它接近 Claude/GPT,也有人认为它慢、贵、会过度思考;另有用户用它生成多个网页游戏和 Rust 神经网络编辑器,认为模型非常强,但需要把要求讲得足够具体。讨论的共同点是:模型能力、价格、任务规模和提示词质量必须一起评估。
Reddit:Qwen3.8-Max 的高分是否被单项基准放大
原帖作者发现 Qwen3.8-Max 的综合分很高,但自己在 Qwen App 做研究时没有感受到同等智能,因此询问是否存在“benchmaxxing”。回复指出,综合分受到 Tau3-banking 等 agentic tool-use 项目拉动;也有人认为多数新模型在给足上下文和清晰提示后都能完成常见编码任务,单看 50 分和 60 分并不能反映实际差异。
Qwen3.8 Max
在 Tabbit 中使用并对比模型
汇总 Qwen3.8 Max 的官方基准、媒体分析和社区实测,不把第三方观点包装成 Tabbit 自测。