查看所有模型

在 Tabbit 中使用 Qwen3.8 Max

在 Tabbit 中使用

在 Tabbit 中使用 Qwen3.8 Max

精选提示词

查看全部提示词
媒体Qwen 官方博客《Qwen3.8-Max:编程与办公,全面跃升》

Qwen3.8-Max:推理努力、上下文保持与 Agent 接入提示词指南

官方建议用 reasoningeffort 控制推理深度:low 适合速度和成本,medium 做平衡,xhigh 处理复杂任务;xhigh 为默认档位,preservethinking 默认开启。官方 API 示例还展示了如何分别处理 reasoningcontent 与最终答案,以及如何把模型接入 Claude Code、Codex、Qwen Code 和 OpenClaw。

媒体EvoLink.AI Blog

Qwen3.8-Max 生产路由:EvoLink 的提示词、思考流与工具调用指南

EvoLink 建议把模型 ID 放进配置,将 Chat Completions、Responses 和 Messages 按应用架构分开选择,并用一次真实 smoke test 验证路由、响应、计费和 fallback。对提示词的直接建议是:保持系统提示短而稳定;先写清任务、输出和边界;把思考内容与最终答案分开处理;工具调用先做 allowlist、schema 和权限校验;重试和缓存都要用可观测证据确认。

社区Reddit,r/QwenAI

Qwen Studio + MCP:让 Qwen3.8-Max 访问本地文件的提示词与权限边界

作者介绍了通过 Qwen Studio 的 Filesystem MCP,让云端 Qwen3.8-Max 读写本地指定目录。模型仍然运行在云端,MCP server 在本地。指南强调要明确文件夹路径、语言/框架和任务范围,并在接受修改前审查代码。评论区还暴露出可用性、服务条款、Linux 不支持和账号被暂停等风险。

社区Reddit,r/QwenAI

Qwen3.8-Max 多轮对话:从“后续提示失忆”反馈提炼上下文恢复提示词

原帖反馈两个问题:回答过长、赘述多、结构混乱;在追问时,模型似乎无法正确引用上一轮上下文。评论区有人认为这是提示词表达问题,也有人报告相反体验。这里不能把单个帖子当成模型事实,但可以把它转化为可验证的多轮提示词和回归测试。

社区Reddit,r/SillyTavernAI

Qwen3.8-Max 角色扮演:方向遵循、推理时长与 preset 反馈

社区讨论主要围绕 RP 的 prose、内容过滤、方向遵循和思考时长。反馈并不一致:有人认为 3.8-Max 太多 guardrails、写作无趣;有人认为低 token preset 下响应更快,但更容易忽略格式指令;也有人观察到长思考换来更强的 prompt/rule adherence。可操作的结论是:把文风、角色规则、输出格式和停止条件写成短而明确的契约,并分别测试 reasoning 档位。

测评与真实反馈

查看全部测评
媒体Qwen 官方博客

Qwen3.8-Max:官方发布说明与完整性能结果

Qwen 官方把 Qwen3.8-Max 定位为面向编码、办公、科研、长程任务和多模态智能体的旗舰模型,宣称总参数 2.4T、激活参数 95B,并提供 reasoning effort、API 和多种 Agent harness 集成。官方文章给出大量内部基准与端到端案例,优势集中在长链路工具使用、视觉 Agent、文档办公和持续反馈;这些数字属于厂商发布结果,引用时必须同时标注评测框架、运行次数和基准性质。

媒体Artificial Analysis

Qwen3.8-Max:Artificial Analysis 独立指数的质量、成本、速度与冗长账本

Artificial Analysis 当前页面给 Qwen3.8 Max 的 Intelligence Index 评分为 58(同类 180 个模型中第 10),但同时记录了约 45 token/s 的低速度、150M 的指数评测总输出量和约 $1.13 的单任务成本,因此它更像“高质量但慢且很能思考”的 Agent 模型,而不是低延迟聊天模型。

媒体NYU Shanghai RITS

Qwen3.8-Max:NYU 上海 RITS 对代理指数演化、轮次和幻觉成本的复核

RITS 对 Artificial Analysis 快照的整理显示,Qwen3.8-Max 的代理能力接近顶级模型,但主要通过更长的 Agent 轨迹换取:GDPval-AA 每任务约 64 轮、成本约 $1.14,且 AA-LCR 与 AA-Omniscience 下降、观测幻觉率从 23% 上升到 40%。

媒体Trilogy AI Center of Excellence(Substack)

Qwen3.8-Max Preview:Trilogy AI 的 StackPerf 代码库架构盲测

在相同 269 文件、60 分钟、OpenCode 1.17.13 的 StackPerf 代码库架构任务中,Qwen3.8-Max Preview 得分 80、Kimi K3 得分 83;Qwen 的强项是系统边界、证据引用和 replay 元数据,Kimi 的强项是修订、再生成和场景生命周期,而两者都需要独立事实核验。

媒体BenchLM

Qwen3.8 Max:BenchLM 的来源可核验基准分类账本

BenchLM 将 Qwen3.8 Max 的 52 条来源可显示基准归一为 79.91/100、218 个模型中第 6,但分类账本同时显示它在 Reasoning、Agentic、Multimodal 和指令遵循上很强,而 AutomationBench、OSWorld 2.0、HLE 等项目仍有明显缺口;“第 6”不能替代分项任务选择。

Qwen

在 Tabbit 中使用 Qwen3.8 Max

汇总 Qwen3.8 Max 的推理配置、Agent 接入方式、公开性能数据与社区编码反馈,集中了解能力和限制。