官方将 Qwen3.5-Plus 定位为 Qwen3.5-397B-A17B 的托管 API 版本,优势方向是原生视觉、多模态 Agent、工具调用和百万上下文,但官方 benchmark 不能替代同 harness 复测。
适合的任务:图像/视频理解、长文档与代码库处理、编码智能体、工具增强的生产流程。
不适合的任务:需要在本地完整复现托管 API 的内部工具策略,或需要把官方自报分数当成跨模型公平比较。
适用的模型版本:Qwen3.5-Plus;官方博客同时介绍开放权重 Qwen3.5-397B-A17B。
适用的客户端、Agent 或 API:Qwen Chat、阿里云百炼 API,以及自行编排的工具调用 Agent。
推荐的推理档位和参数:官方博客未公开 Plus 的完整请求参数、system prompt 和 harness;应固定 API 快照与工具集合后再测。
评测主体:Qwen 官方发布说明中的 Qwen3.5 系列,包含托管的 Qwen3.5-Plus 与开放权重 Qwen3.5-397B-A17B。
输入/任务:官方按自然语言、推理、编程、Agent、多模态理解等类别进行对照;页面可见对照模型包括 GPT-5.2、Claude 4.5 Opus、Gemini-3 Pro、Qwen3-Max-Thinking、K2.5-1T-A32B。
配置:官方正文未完整公开每项 prompt、采样参数、工具 schema、重复次数和评测 harness。
Qwen3.5-397B-A17B 总参数约 397B,每次前向仅激活约 17B;架构将 Gated Delta Networks 线性注意力与稀疏 MoE 结合。
Qwen 官方称语言与方言覆盖从 119 扩展至 201 种;博客将其描述为原生视觉-语言模型,并把 Qwen3.5-Plus 说明为 API 版本。
官方博客把 Qwen3.5-Plus 的上下文窗口列为 1M tokens,并提到官方工具及自适应调用;阿里云模型页进一步列出文本/图像/视频输入、函数调用和结构化输出支持。
页面可见 benchmark 表格的模型列和任务类别,但当前正文抽取只完整保留到部分自然语言表行;未把未完整核验的分数写入本文。
若任务同时需要视觉输入、长上下文和 Agent 工具,Qwen3.5-Plus 值得优先做成本/延迟基线;若任务是纯文本或编码,需用相同 prompt、工具和输出预算与其他模型重跑,不能仅凭官方“前沿模型相当”的叙述选型。
官方发布属于厂商自报,缺少统一公开的完整 prompt、代码、随机种子和逐题产物。
开放权重基线与托管 Plus API 不是同一个服务形态,工具、上下文和推理实现可能不同。
博客页面含动态示例内容,表格正文并非所有行都能从当前页面抽取;缺失分数明确记为未核实。
使用阿里云百炼固定 qwen3.5-plus-2026-02-15 快照,记录地域、工具白名单、上下文长度、温度和输出上限。
选择一组公开任务,分别覆盖纯文本、图像理解、函数调用和长上下文检索;公开每个输入和期望输出。
每题重复至少 3 次,记录成功率、工具参数合法率、延迟、输入/输出 token 和错误类型。
在相同 API 协议、同等输出预算和相同工具集合下,与目标对照模型复跑;将官方发布表与实测表分开保存。
官方标题把 Qwen3.5 定义为“Towards Native Multimodal Agents”;本文只使用页面直接可核对的架构、模型版本和能力定位,未补写抽取不完整的 benchmark 数字。
Qwen3.5 Plus