在相同 269 文件、60 分钟、OpenCode 1.17.13 的 StackPerf 代码库架构任务中,Qwen3.8-Max Preview 得分 80、Kimi K3 得分 83;Qwen 的强项是系统边界、证据引用和 replay 元数据,Kimi 的强项是修订、再生成和场景生命周期,而两者都需要独立事实核验。
适合的任务:需要阅读陌生代码库、比较系统职责、设计数据契约、写迁移计划和证据账本的长上下文架构评审。
不适合的任务:把一次代码库架构盲测当作通用 coding benchmark、单轮问答或 Qwen3.8-Max GA 的当前成绩。
适用的模型版本:Qwen3.8-Max-Preview(2026-07-19 服务快照),不是后续 GA 版本的直接替代。
适用的客户端、Agent 或 API:OpenCode 1.17.13;Qwen 走 Alibaba 国际 Token Plan endpoint,Kimi 走 Kimi Code subscription endpoint。
推荐的推理档位和参数:Qwen enable_thinking: true,未固定 thinking budget;原文未公开温度和完整系统 prompt,不应擅自补写。
输入是两个陌生项目的只读快照:trilogy-group/ttv-pipeline 与 kumanday/media-tooling,合计 269 个文件;生成媒体、缓存、虚拟环境和仓库内部目录被排除。
任务要求逐文件/逐行证据分析、区分全局规划与 provider-specific 生成、比较 15/30 秒视频生成、设计 typed/JSON contract、提出迁移阶段、测试、风险和 evidence ledger。
两个模型使用相同 task card、权限和 60 分钟 wall-clock limit,completion ceiling 为 65,536 tokens。
允许 read、search、listing 和安全检查;禁止编辑、联网、写源文件、插件和 subagents。
StackPerf 注册会话并收集请求、工具和输出指标;报告在盲评前被改名为 Report A/B,另有事实核验阶段。
Qwen3.8-Max Preview:事实扣分后 80/100;Kimi K3:83/100。
Qwen:22 个 gateway requests、44 次 tool calls,工具调用全部成功;报告更长,引用出现 354 次,核验未发现虚构路径或符号,但有 2 处引用行号不准确、7 组结论超出代码证据。
Kimi:53 次 tool calls,其中 2 个复合 shell 命令被策略拒绝后恢复;引用出现 274 次,未发现虚构路径或符号,同样有 7 组超出证据的结论。
两个模型得出了相同的系统边界:全局规划和最终装配由一侧拥有,provider-specific 生成、重试和 provenance 由另一侧负责,并通过版本化 contract 连接。
Qwen 的 GenerationManifest / GenerationResult 和 replay 记录更完整,记录了 model、seed、prompt、references、provider request ID、媒体 URI、duration 和 cost;Kimi 对 revision、supersession、retry history 和 take invalidation 建模更完整。
两条 provider 路径重复 prompt 的缓存命中率均超过 90%;该数字受 provider、路由和会话缓存影响。
固定两个项目的 SHA-256 快照,排除媒体、缓存和仓库内部目录。
用 OpenCode 1.17.13 载入同一 task card,设相同权限、60 分钟上限和 65,536 completion ceiling;保留模型原生 reasoning 设置。
禁止编辑、联网、插件和 subagents,只允许安全读取、检索和目录检查。
用 StackPerf 记录每次请求、工具调用、失败、token 和缓存;将两个最终报告匿名后盲评,再做路径/符号/结论事实核验。
分开报告分数、调用效率、引用覆盖和未证实主张;不要把单次 80/83 直接外推成模型总排名。
这是一项“模型 × harness × 任务”联合测量,而不是 Qwen3.8-Max 的绝对能力证明。Qwen 在架构边界、replay 和少工具调用方面有优势;Kimi 在生命周期和再生成设计方面有优势。对高价值代码评审,两个模型并行产出再交叉核验,比让一个模型的漂亮长文直接进入实现更稳妥。
测试的是 Qwen3.8-Max Preview;文章明确指出 GA、正式 API 或开放权重变化后应重新运行。
每个模型只有一条完整服务路径、一个任务和一次 60 分钟会话,无法分离模型能力与 endpoint、缓存、限流及 harness 的影响。
盲评得分包含人工事实扣分,且文章没有公开完整 task prompt、所有工具 schema 和原始逐轮 transcript。
任务是视频系统架构与代码库阅读,不能替代 SWE-bench、Terminal-Bench、中文或多模态回归。
原文公开了两个项目链接、StackPerf 仓库、269 文件规模、OpenCode 版本、权限、时间/token 上限、模型 reasoning 配置、请求/工具计数、引用计数和事实核验结果;这些字段足以复刻实验结构,但不足以在没有相同快照与服务权限时精确复现 80 分。
原文对 Qwen 的配置写为 “enable_thinking: true and no fixed thinking budget”;这只证明测试配置,不代表所有 Qwen3.8-Max 客户端的默认设置。
Qwen3.8 Max