Tabbit
活动资源博客模型
Tabbit LogoTabbit

Tabbit — 为你工作的 AI 浏览器

主题资源

  • AI Browser Resources
  • Agentic Browser Resources
  • Browser Downloads and Install Guides
  • Browser Comparisons
  • AI Browser Alternatives
  • Browser Productivity Resources

热门指南

  • AI Browser
  • Agentic Browser Download
  • Best AI Browser 2026: Top 9 Tested & Ranked
  • AI Browser Download
  • Free AI Browser
  • Best AI Browser 2026
  • AI Browser Comparison 2026
  • AI Browser for Windows
  • AI Browser for Mac
  • Chrome Alternative 2026

活动

  • 别装了,你在《牛来》里早有原型
  • Tabbit 妙招大赛
  • KPOP SBTI 饭圈人格测试
  • Tabbit 校园共创者计划
  • fifi 的论文文献妙招精选
  • 用户问卷

关于

  • Tabbit 博客
  • 媒体报道
提示词
媒体DeepSeek V3.2

DeepSeek-V3.2 的长上下文与 Agent 证据锚定工作流

原始来源

DeepSeek-V3.2 技术报告(arXiv)

作者DeepSeek-AI

原文日期2025-12-03

Tabbit 整理2026-08-19

查看原文

一句话结论

DeepSeek 的技术报告显示 V3.2 用大规模环境/复杂指令合成来训练 Agent 泛化;使用时应把工具结果、任务约束和可验证 outcome 组织成轨迹,而不是只依赖一句“请自主思考”。

适用场景

  • 适合的任务:长上下文研究、代码 Agent、搜索/工具链、需要 outcome 验证的多步任务。

  • 不适合的任务:没有可靠工具结果或可执行验收标准的“自主 Agent”;也不适合把训练报告当作部署 prompt 的完整说明。

  • 适用的模型版本:DeepSeek-V3.2;报告同时讨论 V3.2-Speciale,二者的工具/长度边界不同。

  • 适用的客户端、Agent 或 API:OpenAI-compatible API、DeepSeek 自研/自定义 Agent harness。

  • 推荐的推理档位和参数:依任务固定 thinking/non-thinking;代码与研究先以 high 做 baseline,再用 eval 降档。

可直接使用的内容

你是一个可验证的多步 Agent。

<goal>
完成:<具体任务>
</goal>
<constraints>
- 只使用已授权工具和上下文。
- 每一步写明目标、输入证据和可验证结果。
- 不能访问/写入未授权资源;不确定时停止并报告。
</constraints>
<workflow>
1. 分解任务并列出完成标准。
2. 选择最小必要工具,保存每次调用的参数和返回来源。
3. 根据工具结果更新计划;若结果冲突,保留冲突并重新验证。
4. 完成后运行测试/规则检查,逐项对照完成标准。
</workflow>
<final_format>
结论:...
证据:...
工具轨迹摘要:...
未解决项:...
</final_format>

测试/工作流步骤

  1. 先运行无工具 baseline,再提供相同工具集和 outcome checker。

  2. 将每个任务的工具调用、reasoning 状态、结果和最终 outcome 存为可重放轨迹。

  3. 对长上下文任务按 32k/64k/128k 等输入长度分层,测试 DSA/服务端实现是否改变质量或延迟。

  4. 使用 rule-based checker 或人工评分验证最终结果,不仅统计是否生成了长 reasoning。

原始证据与数据

  • 报告称使用超过 1,800 个环境和 85,000 个复杂 prompt 的大规模 agentic task synthesis pipeline。

  • 报告指出工具场景同时训练 thinking 与 non-thinking 专家域,目标是提升复杂交互中的 generalization 和 instruction-following robustness。

  • 报告把 V3.2 描述为在多项推理 benchmark 上与 GPT-5、Kimi-K2-Thinking 相近,并在 agent 任务上提升开放模型能力;这些是作者实验结论。

  • 报告技术层面称 DSA 将主注意力复杂度从 O(L²) 降至 O(Lk),在长上下文使用 top-k 选择;这解释了长上下文效率目标,不等于每个 API 任务都会线性加速。

适用边界

  • 该 prompt 是基于技术报告的可复用工作流模板,不是 DeepSeek 官方发布的完整 system prompt;要标记为改编模板。

  • 1,800/85,000 是训练数据合成规模,不是公开评测样本的成功率;不能把数据量当作能力证明。

  • DSA 的复杂度与服务端 kernel、长度和硬件有关;自托管复现必须看实际吞吐/延迟。

  • Agent outcome 需要工具和检查器,模型本身不保证执行真实验证。

来源摘录或观察(仅做合规短引)

技术报告把关键方法称为“Large-Scale Agentic Task Synthesis Pipeline”(合规短引)。

Tabbit 小编提醒

提示词内容来自公开资料与 Tabbit 编辑整理。引用前请查看原文授权与适用范围。

DeepSeek V3.2

在 Tabbit 中使用

DeepSeek V3.2

相关提示词

官方DeepSeek API Docs / DeepSeek-V3.2 Release 与 Thinking Mode2025-12-01

DeepSeek-V3.2 的思考式工具调用与多轮状态配置

DeepSeek V3.2

相关测评

官方DeepSeek API Docs / DeepSeek-V3.2 Release2025-12-01

DeepSeek-V3.2 官方发布:V3.2 与 Speciale 的推理/Agent 定位

媒体arXiv / DeepSeek-V3.2: Pushing the Frontier of Open Large Language Models2025-12-03

DeepSeek-V3.2 技术报告:DSA、Agent 合成数据与推理基线

媒体SWE-bench Leaderboards2026-02-17

SWE-bench Leaderboard 中 DeepSeek V3.2 的编码 Agent 结果

社区Reddit / r/LocalLLaMA2025-12

Reddit LocalLLaMA 对 DeepSeek V3.2 Agent 编码的体验边界