DeepSeek 的技术报告显示 V3.2 用大规模环境/复杂指令合成来训练 Agent 泛化;使用时应把工具结果、任务约束和可验证 outcome 组织成轨迹,而不是只依赖一句“请自主思考”。
适合的任务:长上下文研究、代码 Agent、搜索/工具链、需要 outcome 验证的多步任务。
不适合的任务:没有可靠工具结果或可执行验收标准的“自主 Agent”;也不适合把训练报告当作部署 prompt 的完整说明。
适用的模型版本:DeepSeek-V3.2;报告同时讨论 V3.2-Speciale,二者的工具/长度边界不同。
适用的客户端、Agent 或 API:OpenAI-compatible API、DeepSeek 自研/自定义 Agent harness。
推荐的推理档位和参数:依任务固定 thinking/non-thinking;代码与研究先以 high 做 baseline,再用 eval 降档。
你是一个可验证的多步 Agent。
<goal>
完成:<具体任务>
</goal>
<constraints>
- 只使用已授权工具和上下文。
- 每一步写明目标、输入证据和可验证结果。
- 不能访问/写入未授权资源;不确定时停止并报告。
</constraints>
<workflow>
1. 分解任务并列出完成标准。
2. 选择最小必要工具,保存每次调用的参数和返回来源。
3. 根据工具结果更新计划;若结果冲突,保留冲突并重新验证。
4. 完成后运行测试/规则检查,逐项对照完成标准。
</workflow>
<final_format>
结论:...
证据:...
工具轨迹摘要:...
未解决项:...
</final_format>先运行无工具 baseline,再提供相同工具集和 outcome checker。
将每个任务的工具调用、reasoning 状态、结果和最终 outcome 存为可重放轨迹。
对长上下文任务按 32k/64k/128k 等输入长度分层,测试 DSA/服务端实现是否改变质量或延迟。
使用 rule-based checker 或人工评分验证最终结果,不仅统计是否生成了长 reasoning。
报告称使用超过 1,800 个环境和 85,000 个复杂 prompt 的大规模 agentic task synthesis pipeline。
报告指出工具场景同时训练 thinking 与 non-thinking 专家域,目标是提升复杂交互中的 generalization 和 instruction-following robustness。
报告把 V3.2 描述为在多项推理 benchmark 上与 GPT-5、Kimi-K2-Thinking 相近,并在 agent 任务上提升开放模型能力;这些是作者实验结论。
报告技术层面称 DSA 将主注意力复杂度从 O(L²) 降至 O(Lk),在长上下文使用 top-k 选择;这解释了长上下文效率目标,不等于每个 API 任务都会线性加速。
该 prompt 是基于技术报告的可复用工作流模板,不是 DeepSeek 官方发布的完整 system prompt;要标记为改编模板。
1,800/85,000 是训练数据合成规模,不是公开评测样本的成功率;不能把数据量当作能力证明。
DSA 的复杂度与服务端 kernel、长度和硬件有关;自托管复现必须看实际吞吐/延迟。
Agent outcome 需要工具和检查器,模型本身不保证执行真实验证。
技术报告把关键方法称为“Large-Scale Agentic Task Synthesis Pipeline”(合规短引)。
DeepSeek V3.2