在 Qubrid 单次 Playground 视觉测试中,Qwen3.5-Plus 首 token 和总响应更快,但把大部分 completion token 用在 reasoning,输出文本较短,不能据此推断所有任务质量。
适合的任务:需要视觉输入、低延迟和原始生成速度的初筛;也适合复现“同一图片、同一提示、同一 provider”基线。
不适合的任务:用单张图片一次运行证明复杂 Agent、长上下文或代码能力;跨 provider 比较延迟和 token。
适用的模型版本:Qubrid Playground 中的 Qwen/Qwen3.5-Plus;具体后端快照未公开。
适用的客户端、Agent 或 API:Qubrid AI Playground;文章另给出 Qubrid OpenAI 兼容接口示例。
推荐的推理档位和参数:文章对 Qwen3.5-Plus 建议沿用 temperature=0.6、top_p=0.95;该值是文章的 provider 配置建议,不是阿里云官方模型页推荐。
平台:Qubrid AI Playground,Vision 模式。
输入:同一张“蓝灰色表面上的折纸船”图片;用户提示为 Describe what you see in this image.。
配置:两模型均打开 Model Reasoning;文章记录 prompt tokens、completion tokens、reasoning tokens、输出文本 token、TTFT、总时长和 tokens/s。
对照:Qwen 3.5 Plus 与 Qwen 3.6 Plus;本文重点保留 Qwen3.5-Plus 的原始观测。
视觉输入:同一张折纸船图片
用户提示:Describe what you see in this image.
Model Reasoning:True
模型:Qwen/Qwen3.5-Plus| 指标 | Qwen3.5-Plus | Qwen3.6-Plus(对照) |
|---|---|---|
| 总响应时间 | 26.02 s | 40.03 s |
| TTFT | 6.86 s | 6.93 s |
| Completion tokens | 2,036 | 1,613 |
| Reasoning tokens | 1,858 | 1,343 |
| 输出文本 tokens | 178 | 270 |
| Tokens/s | 106.27 | 38.32 |
| Prompt tokens | 5,111 | 5,117 |
| 响应结构 | 流式段落 | 标题化分段 |
按文章数据计算,Qwen3.5-Plus 的 reasoning token 约占 completion 的 91.3%(1,858/2,036),输出文本约占 8.7%;这是该次运行的 token 分配,不是模型固定比例。
该案例支持一个窄结论:在 Qubrid 的同图同提示单次运行中,Qwen3.5-Plus 的总时延和生成速度优于对照,但回答文本较短且 reasoning 占比高。要评估生产 Agent,应继续测工具成功率、结构化输出、重复一致性和长上下文检索。
文章没有公开图片文件、随机种子、完整后端快照、并发、硬件和重复次数;严格意义上只能按公开输入步骤复现近似实验。
Qubrid provider 的计时和 token 统计不能直接代表阿里云百炼原生端点。
文章表格把 Qwen3.5-Plus 的多模态描述延伸到音频,但阿里云官方模型页列出的输入是文本、图像、视频;该冲突应以官方能力表为准,不能把音频能力写成已核实事实。
在 Qubrid Playground 选择 Qwen/Qwen3.5-Plus,进入 Vision 模式。
上传同一张折纸船图片,输入完全相同的英文描述提示,打开 Model Reasoning。
保存一次完整响应及页面显示的 TTFT、总时长和 token 明细;不要只记录最终文本。
至少重复 5 次,再报告均值、标准差和失败次数;如切换到百炼 API,单独标注 provider 和模型快照。
文章给出的可复核输入是“Describe what you see in this image.”,并明确记录了 26.02 秒总响应、6.86 秒 TTFT 和 1,858 reasoning tokens;本文保留其 provider 边界。
Qwen3.5 Plus