Tabbit
活动资源博客模型
Tabbit LogoTabbit

Tabbit — 为你工作的 AI 浏览器

主题资源

  • AI Browser Resources
  • Agentic Browser Resources
  • Browser Downloads and Install Guides
  • Browser Comparisons
  • AI Browser Alternatives
  • Browser Productivity Resources

热门指南

  • AI Browser
  • Agentic Browser Download
  • Best AI Browser 2026: Top 9 Tested & Ranked
  • AI Browser Download
  • Free AI Browser
  • Best AI Browser 2026
  • AI Browser Comparison 2026
  • AI Browser for Windows
  • AI Browser for Mac
  • Chrome Alternative 2026

活动

  • 别装了,你在《牛来》里早有原型
  • Tabbit 妙招大赛
  • KPOP SBTI 饭圈人格测试
  • Tabbit 校园共创者计划
  • fifi 的论文文献妙招精选
  • 用户问卷

关于

  • Tabbit 博客
  • 媒体报道
测评
媒体Qwen3.8 Max

Qwen3.8-Max Preview:Trilogy AI 的 StackPerf 代码库架构盲测

原始来源

Trilogy AI Center of Excellence(Substack)

作者Leonardo Gonzalez

原文日期2026-07-19

Tabbit 整理2026-08-19

查看原文

一句话结论

在相同 269 文件、60 分钟、OpenCode 1.17.13 的 StackPerf 代码库架构任务中,Qwen3.8-Max Preview 得分 80、Kimi K3 得分 83;Qwen 的强项是系统边界、证据引用和 replay 元数据,Kimi 的强项是修订、再生成和场景生命周期,而两者都需要独立事实核验。

适用场景

  • 适合的任务:需要阅读陌生代码库、比较系统职责、设计数据契约、写迁移计划和证据账本的长上下文架构评审。

  • 不适合的任务:把一次代码库架构盲测当作通用 coding benchmark、单轮问答或 Qwen3.8-Max GA 的当前成绩。

  • 适用的模型版本:Qwen3.8-Max-Preview(2026-07-19 服务快照),不是后续 GA 版本的直接替代。

  • 适用的客户端、Agent 或 API:OpenCode 1.17.13;Qwen 走 Alibaba 国际 Token Plan endpoint,Kimi 走 Kimi Code subscription endpoint。

  • 推荐的推理档位和参数:Qwen enable_thinking: true,未固定 thinking budget;原文未公开温度和完整系统 prompt,不应擅自补写。

测试环境与输入/配置

  • 输入是两个陌生项目的只读快照:trilogy-group/ttv-pipeline 与 kumanday/media-tooling,合计 269 个文件;生成媒体、缓存、虚拟环境和仓库内部目录被排除。

  • 任务要求逐文件/逐行证据分析、区分全局规划与 provider-specific 生成、比较 15/30 秒视频生成、设计 typed/JSON contract、提出迁移阶段、测试、风险和 evidence ledger。

  • 两个模型使用相同 task card、权限和 60 分钟 wall-clock limit,completion ceiling 为 65,536 tokens。

  • 允许 read、search、listing 和安全检查;禁止编辑、联网、写源文件、插件和 subagents。

  • StackPerf 注册会话并收集请求、工具和输出指标;报告在盲评前被改名为 Report A/B,另有事实核验阶段。

结果数据

  • Qwen3.8-Max Preview:事实扣分后 80/100;Kimi K3:83/100。

  • Qwen:22 个 gateway requests、44 次 tool calls,工具调用全部成功;报告更长,引用出现 354 次,核验未发现虚构路径或符号,但有 2 处引用行号不准确、7 组结论超出代码证据。

  • Kimi:53 次 tool calls,其中 2 个复合 shell 命令被策略拒绝后恢复;引用出现 274 次,未发现虚构路径或符号,同样有 7 组超出证据的结论。

  • 两个模型得出了相同的系统边界:全局规划和最终装配由一侧拥有,provider-specific 生成、重试和 provenance 由另一侧负责,并通过版本化 contract 连接。

  • Qwen 的 GenerationManifest / GenerationResult 和 replay 记录更完整,记录了 model、seed、prompt、references、provider request ID、媒体 URI、duration 和 cost;Kimi 对 revision、supersession、retry history 和 take invalidation 建模更完整。

  • 两条 provider 路径重复 prompt 的缓存命中率均超过 90%;该数字受 provider、路由和会话缓存影响。

工作流/复现步骤

  1. 固定两个项目的 SHA-256 快照,排除媒体、缓存和仓库内部目录。

  2. 用 OpenCode 1.17.13 载入同一 task card,设相同权限、60 分钟上限和 65,536 completion ceiling;保留模型原生 reasoning 设置。

  3. 禁止编辑、联网、插件和 subagents,只允许安全读取、检索和目录检查。

  4. 用 StackPerf 记录每次请求、工具调用、失败、token 和缓存;将两个最终报告匿名后盲评,再做路径/符号/结论事实核验。

  5. 分开报告分数、调用效率、引用覆盖和未证实主张;不要把单次 80/83 直接外推成模型总排名。

结论

这是一项“模型 × harness × 任务”联合测量,而不是 Qwen3.8-Max 的绝对能力证明。Qwen 在架构边界、replay 和少工具调用方面有优势;Kimi 在生命周期和再生成设计方面有优势。对高价值代码评审,两个模型并行产出再交叉核验,比让一个模型的漂亮长文直接进入实现更稳妥。

局限

  • 测试的是 Qwen3.8-Max Preview;文章明确指出 GA、正式 API 或开放权重变化后应重新运行。

  • 每个模型只有一条完整服务路径、一个任务和一次 60 分钟会话,无法分离模型能力与 endpoint、缓存、限流及 harness 的影响。

  • 盲评得分包含人工事实扣分,且文章没有公开完整 task prompt、所有工具 schema 和原始逐轮 transcript。

  • 任务是视频系统架构与代码库阅读,不能替代 SWE-bench、Terminal-Bench、中文或多模态回归。

原始证据与数据

原文公开了两个项目链接、StackPerf 仓库、269 文件规模、OpenCode 版本、权限、时间/token 上限、模型 reasoning 配置、请求/工具计数、引用计数和事实核验结果;这些字段足以复刻实验结构,但不足以在没有相同快照与服务权限时精确复现 80 分。

来源摘录或观察(仅做合规短引)

原文对 Qwen 的配置写为 “enable_thinking: true and no fixed thinking budget”;这只证明测试配置,不代表所有 Qwen3.8-Max 客户端的默认设置。

Tabbit 小编提醒

本文是第三方资料导航。测试环境、模型版本和主观体验可能不同,请以原文为准。

Qwen3.8 Max

在 Tabbit 中使用并对比模型

Qwen3.8 Max

相关测评

媒体Qwen 官方博客2026-08-03

Qwen3.8-Max:官方发布说明与完整性能结果

媒体Artificial Analysis

Qwen3.8-Max:Artificial Analysis 独立指数的质量、成本、速度与冗长账本

媒体NYU Shanghai RITS

Qwen3.8-Max:NYU 上海 RITS 对代理指数演化、轮次和幻觉成本的复核

媒体BenchLM2026-08-17

Qwen3.8 Max:BenchLM 的来源可核验基准分类账本

Qwen3.8 Max

相关提示词

媒体Qwen 官方博客《Qwen3.8-Max:编程与办公,全面跃升》2026-08-03

Qwen3.8-Max:推理努力、上下文保持与 Agent 接入提示词指南

媒体EvoLink.AI Blog2026-08-03

Qwen3.8-Max 生产路由:EvoLink 的提示词、思考流与工具调用指南

社区Reddit,r/QwenAI

Qwen Studio + MCP:让 Qwen3.8-Max 访问本地文件的提示词与权限边界

社区Reddit,r/QwenAI

Qwen3.8-Max 多轮对话:从“后续提示失忆”反馈提炼上下文恢复提示词