Tabbit
活动资源博客模型
Tabbit LogoTabbit

Tabbit — 为你工作的 AI 浏览器

主题资源

  • AI Browser Resources
  • Agentic Browser Resources
  • Browser Downloads and Install Guides
  • Browser Comparisons
  • AI Browser Alternatives
  • Browser Productivity Resources

热门指南

  • AI Browser
  • Agentic Browser Download
  • Best AI Browser 2026: Top 9 Tested & Ranked
  • AI Browser Download
  • Free AI Browser
  • Best AI Browser 2026
  • AI Browser Comparison 2026
  • AI Browser for Windows
  • AI Browser for Mac
  • Chrome Alternative 2026

活动

  • 别装了,你在《牛来》里早有原型
  • Tabbit 妙招大赛
  • KPOP SBTI 饭圈人格测试
  • Tabbit 校园共创者计划
  • fifi 的论文文献妙招精选
  • 用户问卷

关于

  • Tabbit 博客
  • 媒体报道
简体中文
简体中文English
测评与证据

Qwen3.8 Max · 媒体来源 · 独立测量

Qwen3.8-Max Preview:Trilogy AI 的 StackPerf 代码库架构盲测

在相同 269 文件、60 分钟、OpenCode 1.17.13 的 StackPerf 代码库架构任务中,Qwen3.8-Max Preview 得分 80、Kimi K3 得分 83;Qwen 的强项是系统边界、证据引用和 replay 元数据,Kimi 的强项是修订、再生成和场景生命周期,而两者都需要独立事实核验。

待验证:本次未能重新核实原文。下方历史数字不代表已核实的当前结果。

媒体来源独立测量编辑日期 2026-09-20

测试条件速查

模型/版本
Qwen3.8 Max;BenchLM 页面汇总的具体版本与日期以各来源行及页面快照为准
任务/账本
52 条来源可显示 benchmark 行归一为 79.91/100、218 个模型中第 6;类别权重、provider 与 harness 不统一
类别缺口
Reasoning、Agentic、Multimodal 与指令遵循较强,但 AutomationBench、OSWorld 2.0、HLE 等项目仍有缺口
样本/日期
聚合页与底层项目日期可能不同;样本、提示、重复和当前状态需逐项重开

关键数据与适用场景

一句话结论

在相同 269 文件、60 分钟、OpenCode 1.17.13 的 StackPerf 代码库架构任务中,Qwen3.8-Max Preview 得分 80、Kimi K3 得分 83;Qwen 的强项是系统边界、证据引用和 replay 元数据,Kimi 的强项是修订、再生成和场景生命周期,而两者都需要独立事实核验。

适用场景

  • 适合的任务:需要阅读陌生代码库、比较系统职责、设计数据契约、写迁移计划和证据账本的长上下文架构评审。

  • 不适合的任务:把一次代码库架构盲测当作通用 coding benchmark、单轮问答或 Qwen3.8-Max GA 的当前成绩。

  • 适用的模型版本:Qwen3.8-Max-Preview(2026-07-19 服务快照),不是后续 GA 版本的直接替代。

  • 适用的客户端、Agent 或 API:OpenCode 1.17.13;Qwen 走 Alibaba 国际 Token Plan endpoint,Kimi 走 Kimi Code subscription endpoint。

  • 推荐的推理档位和参数:Qwen enable_thinking: true,未固定 thinking budget;原文未公开温度和完整系统 prompt,不应擅自补写。

测试环境与输入/配置

  • 输入是两个陌生项目的只读快照:trilogy-group/ttv-pipeline 与 kumanday/media-tooling,合计 269 个文件;生成媒体、缓存、虚拟环境和仓库内部目录被排除。

  • 任务要求逐文件/逐行证据分析、区分全局规划与 provider-specific 生成、比较 15/30 秒视频生成、设计 typed/JSON contract、提出迁移阶段、测试、风险和 evidence ledger。

  • 两个模型使用相同 task card、权限和 60 分钟 wall-clock limit,completion ceiling 为 65,536 tokens。

  • 允许 read、search、listing 和安全检查;禁止编辑、联网、写源文件、插件和 subagents。

  • StackPerf 注册会话并收集请求、工具和输出指标;报告在盲评前被改名为 Report A/B,另有事实核验阶段。

结果数据

  • Qwen3.8-Max Preview:事实扣分后 80/100;Kimi K3:83/100。

  • Qwen:22 个 gateway requests、44 次 tool calls,工具调用全部成功;报告更长,引用出现 354 次,核验未发现虚构路径或符号,但有 2 处引用行号不准确、7 组结论超出代码证据。

  • Kimi:53 次 tool calls,其中 2 个复合 shell 命令被策略拒绝后恢复;引用出现 274 次,未发现虚构路径或符号,同样有 7 组超出证据的结论。

  • 两个模型得出了相同的系统边界:全局规划和最终装配由一侧拥有,provider-specific 生成、重试和 provenance 由另一侧负责,并通过版本化 contract 连接。

  • Qwen 的 GenerationManifest / GenerationResult 和 replay 记录更完整,记录了 model、seed、prompt、references、provider request ID、媒体 URI、duration 和 cost;Kimi 对 revision、supersession、retry history 和 take invalidation 建模更完整。

  • 两条 provider 路径重复 prompt 的缓存命中率均超过 90%;该数字受 provider、路由和会话缓存影响。

工作流/复现步骤

  1. 固定两个项目的 SHA-256 快照,排除媒体、缓存和仓库内部目录。

  2. 用 OpenCode 1.17.13 载入同一 task card,设相同权限、60 分钟上限和 65,536 completion ceiling;保留模型原生 reasoning 设置。

  3. 禁止编辑、联网、插件和 subagents,只允许安全读取、检索和目录检查。

  4. 用 StackPerf 记录每次请求、工具调用、失败、token 和缓存;将两个最终报告匿名后盲评,再做路径/符号/结论事实核验。

  5. 分开报告分数、调用效率、引用覆盖和未证实主张;不要把单次 80/83 直接外推成模型总排名。

结论

这是一项“模型 × harness × 任务”联合测量,而不是 Qwen3.8-Max 的绝对能力证明。Qwen 在架构边界、replay 和少工具调用方面有优势;Kimi 在生命周期和再生成设计方面有优势。对高价值代码评审,两个模型并行产出再交叉核验,比让一个模型的漂亮长文直接进入实现更稳妥。

局限

  • 测试的是 Qwen3.8-Max Preview;文章明确指出 GA、正式 API 或开放权重变化后应重新运行。

  • 每个模型只有一条完整服务路径、一个任务和一次 60 分钟会话,无法分离模型能力与 endpoint、缓存、限流及 harness 的影响。

  • 盲评得分包含人工事实扣分,且文章没有公开完整 task prompt、所有工具 schema 和原始逐轮 transcript。

  • 任务是视频系统架构与代码库阅读,不能替代 SWE-bench、Terminal-Bench、中文或多模态回归。

原始证据与数据

原文公开了两个项目链接、StackPerf 仓库、269 文件规模、OpenCode 版本、权限、时间/token 上限、模型 reasoning 配置、请求/工具计数、引用计数和事实核验结果;这些字段足以复刻实验结构,但不足以在没有相同快照与服务权限时精确复现 80 分。

来源摘录或观察(仅做合规短引)

原文对 Qwen 的配置写为 “enable_thinking: true and no fixed thinking budget”;这只证明测试配置,不代表所有 Qwen3.8-Max 客户端的默认设置。

能支持的判断

  • 支持引用 BenchLM 的 52 条来源可显示基准、79.91/100 与第 6 名,并按类别缺口安排复测。

不能支持的判断

  • 不支持把 79.91/100 或第 6 名当作统一复跑、通用能力真值或当前排名;底层任务与权重并不一致。
  • 动态页面、底层榜单、价格与可用性需逐项重新打开确认。

方法、局限和复现

本文中的数字、任务集、推理档位和客户端条件只在所列来源及采集时点内成立。不同版本、不同 harness 或不同提供商的数据不能直接并排比较;未公开的参数保持未知。

需要复测时,请固定模型版本、提供商或客户端、推理档位、工具、任务集版本、样本数和采集日期,并记录失败、重试与人工修正。完整方法和复现步骤见下方来源笔记。

原始来源

Trilogy AI Center of Excellence(Substack) · Leonardo Gonzalez · 原文发布日期 2026-07-19 · 本站编辑日期 2026-09-20

打开原始来源

Qwen3.8 Max

在 Tabbit 中比较 Qwen3.8 Max

下载 Tabbit 客户端后检查模型可用性

模型深度阅读

总览 · 简体中文

Qwen3.8 Max:更新了什么、成本如何、适合谁

从 0902 快照、多模态边界、基准口径到获取路线,帮助你判断 Qwen3.8 Max 是否值得试用。

相关评测

Reddit 社区:Qwen3.8-Max 编程能力、速度与额度消耗这是一个问“Qwen3.8-Max 是否真的适合编程”的社区讨论。反馈两极:有人认为它接近 Claude/GPT,也有人认为它慢、贵、会过度思考;另有用户用它生成多个网页游戏和 Rust 神经网络编辑器,认为模型非常强,但需要把要求讲得足够具体。讨论的共同点是:模型能力、价格、任务规模和提示词质量必须一起评估。Qwen3.8-Max:官方发布说明与完整性能结果Qwen 官方发布说明汇总 Qwen3.8 Max 的多项 benchmark;不同任务的 harness、样本和 reasoning 参数并不统一,发布日期与采集日期必须分开,不能拼成当前总榜。Qwen3.8-Max:Artificial Analysis 独立指数的质量、成本、速度与冗长账本Artificial Analysis 将 Qwen3.8 Max 的质量、成本、速度和输出冗长分开展示;页面版本、推理档位、provider 和任务样本需重开,不能把聚合指数拼成跨版本趋势。Qwen3.8-Max:NYU 上海 RITS 对代理指数演化、轮次和幻觉成本的复核NYU Shanghai RITS 资料讨论 Qwen3.8 Max 的代理轮次、幻觉或成本代理指标;任务集、工具、重复次数和版本以公开部分为准,不能外推到所有 Agent 工作负载。Qwen3.8 Max:Qwen3.8-Max:推理努力、上下文保持与 Agent 接入提示词指南围绕“Qwen3.8-Max:推理努力、上下文保持与 Agent 接入提示词指南”整理任务边界、必需输入和运行环境;完整步骤、变量与限制见详情。Qwen3.8 Max:Qwen3.8-Max 生产路由:EvoLink 的提示词、思考流与工具调用指南围绕“Qwen3.8-Max 生产路由:EvoLink 的提示词、思考流与工具调用指南”整理任务边界、必需输入和运行环境;完整步骤、变量与限制见详情。Qwen3.8 Max:Qwen Studio + MCP:让 Qwen3.8-Max 访问本地文件的提示词与权限边界围绕“Qwen Studio + MCP:让 Qwen3.8-Max 访问本地文件的提示词与权限边界”整理任务边界、必需输入和运行环境;完整步骤、变量与限制见详情。Qwen3.8 Max:Qwen3.8-Max 多轮对话:从“后续提示失忆”反馈提炼上下文恢复提示词围绕“Qwen3.8-Max 多轮对话:从“后续提示失忆”反馈提炼上下文恢复提示词”整理任务边界、必需输入和运行环境;完整步骤、变量与限制见详情。