这份独立技术指南把 Qwen3.5-Plus 的长上下文、工具接入和 API 便利性,与开放权重的硬件/控制权优势并列,适合作为选型初筛而非最终基准。
适合的任务:在托管 API 与自部署之间做初步取舍,或用公开 benchmark 数字建立待复测清单。
不适合的任务:把文章转述的厂商数字当作独立同 harness 结果,或据此承诺生产 Agent 的成功率。
适用的模型版本:Qwen3.5-Plus 与 Qwen3.5-397B-A17B 开放权重;文章比较的是系列定位,不是固定快照的逐题实验。
适用的客户端、Agent 或 API:阿里云百炼兼容接口、Model Studio、Hugging Face/vLLM/TGI 自部署。
推荐的推理档位和参数:文章示例未设置温度或思考预算;先使用 provider 默认值,显式记录 model、base_url 和工具配置。
评测来源:文章汇总 Qwen3.5 发布期的推理、代码、Agent 和多模态 benchmark,并将 Plus 与 GPT-5.2、Claude Opus 4.5、Gemini 3 Pro 等做横向说明。
输入/配置:文章没有逐题输入、随机种子、重复次数或统一 harness;其 API 章节提供了可运行的 OpenAI SDK 最小调用示例。
部署对照:托管 Plus 使用 Model Studio;开放权重面向 Hugging Face、自托管和自定义上下文配置。
文章报告的 Qwen3.5 系列分数包括:
| 基准 | 文章列出的分数 | 任务方向 |
|---|---|---|
| AIME26 | 91.3 | 数学推理 |
| GPQA Diamond | 88.4 | 研究生级推理 |
| LiveCodeBench v6 | 83.6 | 竞赛编程 |
| SWE-bench Verified | 76.4 | 软件工程 |
| Terminal-Bench 2 | 52.5 | 终端 Agent 编程 |
| BFCL v4 | 72.9 | 工具调用 |
| BrowseComp | 78.6 | Agent 搜索 |
| IFBench | 76.5 | 指令遵循 |
| MMMU | 85.0 | 多模态 |
| Video-MME | 87.5 | 视频理解 |
文章同时给出一个 API 迁移示例:base_url=https://dashscope.aliyuncs.com/compatible-mode/v1,模型名 qwen3.5-plus,并使用 OpenAI Python SDK 的 chat.completions.create。
如果团队优先考虑无 GPU 运维、1M 上下文和托管工具,Plus 是更短的上线路径;如果需要数据主权、模型权重和自定义推理栈,开放权重版本更合适。文章的 benchmark 表可帮助确定要复测的维度,但不能证明 Plus 在任一真实业务上的成功率。
文章自称“independent guide”,但没有公开统一评测 harness;表中不少数字可能来自官方发布或二手汇总,证据应降级为“独立整理/待核验”。
“约 0.18 美元/百万 tokens”“60% 成本下降”等成本叙述与地域、输入长度和促销有关;实际定价应以阿里云模型页和租户区域为准。
文章把托管 Plus 与开放权重模型放在同一系列叙事下,但工具、上下文和部署默认值不同,不能把开放权重 benchmark 直接等同于 Plus API。
按文章提供的兼容端点创建请求,先只发送 model=qwen3.5-plus 和一条纯文本消息,确认端点与快照。
逐项增加结构化输出、函数调用、图像/视频输入和长上下文,记录每项是否支持以及错误消息。
对文章列出的 LiveCodeBench、SWE、BFCL、BrowseComp 和 IFBench 选择公开题目,公开输入、工具 schema、输出预算和评分脚本。
同一题在 Plus 与开放权重部署各重复至少 3 次,分别报告正确率、工具成功率、延迟、token 成本和硬件配置。
文章明确把 Plus 描述为“OpenAI SDK compatible API”,并给出 qwen3.5-plus 的兼容端点示例;本文将其作为接入复现线索,而不是官方 benchmark 证明。
Qwen3.5 Plus