官方价格页把 qwen3.7-max 别名映射到 dated snapshot,并明确列出 1M 输入上限、标准费率、促销和缓存/批处理规则,是预算与复现时必须锁定的配置来源。
适合的任务:在阿里云百炼国际区部署 Qwen3.7-Max、规划长上下文预算、固定模型版本和比较缓存/批处理成本。
不适合的任务:把限时促销当永久价格,或用此价格页推断模型质量和延迟。
适用的模型版本:qwen3.7-max(页面当前等同 qwen3.7-max-2026-05-20),或显式使用 qwen3.7-max-2026-05-20 / qwen3.7-max-2026-06-08。
适用的客户端、Agent 或 API:Alibaba Cloud Model Studio 国际区;可通过兼容 OpenAI/Anthropic 的客户端接入。
推荐的推理档位和参数:Thinking/Non-Thinking 按任务 A/B;长程 Agent 需记录是否启用上下文缓存和是否使用批处理。
将价格页关键字段写入部署配置:
provider: Alibaba Cloud Model Studio
region: International
model_alias: qwen3.7-max
resolved_snapshot: qwen3.7-max-2026-05-20
context_limit: 1000000
standard_price_per_1M:
input: 2.50
output: 7.50
pricing_mode: thinking_or_non_thinking
cache: verify_current_context_cache_table预算函数:
standard_cost =
input_tokens / 1M × 2.50
+ output_tokens / 1M × 7.50
如果使用缓存或 batch:
不要把两种折扣叠加;
按当日 Model Studio Context Cache / Batch 规则分别重算。在部署记录中同时保存别名和 dated snapshot;若使用别名,定期检查官方页面的“currently equivalent”映射。
固定国际区、模型模式、输入长度和输出上限,先运行一组无缓存基线。
将稳定 system prompt、工具定义和参考文档放在前缀,启用显式或隐式 cache 后比较命中率、缓存写入和缓存读取成本。
需要批量任务时单独运行 batch,并确认 batch 与缓存折扣不能同时使用。
对 1M 内的请求按页表的 0<Token≤1M 费率计算;超过模型上限时分块,不要假定分层价格会自动延伸。
记录区域、促销状态、快照、模式、token 账单和缓存命中,确保下一次复现使用同一计费版本。
qwen3.7-max 当前等同 qwen3.7-max-2026-05-20;页面也列出 qwen3.7-max-2026-06-08 和 qwen3.7-max-2026-05-20 的 dated entries。
国际区、Thinking/Non-Thinking 模式、0<Token≤1M。
标准列表价:输入 $2.50、输出 $7.50 每 1M tokens;当前页面对别名行显示限时 50% off,但应以控制台最终价格为准。
Alibaba Cloud 的通用规则:缓存命中输入与创建显式缓存的 token 使用不同费率;示例为显式缓存创建按标准输入价 125%、命中按 10% 计费。
Batch 若支持,输入/输出均按实时推理价的 50% 计费;batch 与上下文缓存折扣不能同时使用。
页面标注 1M 是该价格层的单次输入范围;具体上下文能力仍应结合 Qwen 官方模型页和实际 API 限制。
价格页会随区域、促销和日期更新;限时 50% off 不能写死到长期预算。
“缓存命中按 10%”是页面给出的示例规则,实际支持模型和缓存 TTL 要再查 Context Cache 页面。
别名等价关系会变化;需要论文/基准可复核性时使用 dated snapshot。
价格、缓存和 batch 只说明运营成本,不证明 Qwen3.7-Max 在特定任务的质量、速度或安全性。
页面强调 “This document only lists standard prices”,所以报价决策必须保留采集日期和促销状态。
Qwen3.7 Max