Tabbit
活动资源博客模型
Tabbit LogoTabbit

Tabbit — 为你工作的 AI 浏览器

主题资源

  • AI Browser Resources
  • Agentic Browser Resources
  • Browser Downloads and Install Guides
  • Browser Comparisons
  • AI Browser Alternatives
  • Browser Productivity Resources

热门指南

  • AI Browser
  • Agentic Browser Download
  • Best AI Browser 2026: Top 9 Tested & Ranked
  • AI Browser Download
  • Free AI Browser
  • Best AI Browser 2026
  • AI Browser Comparison 2026
  • AI Browser for Windows
  • AI Browser for Mac
  • Chrome Alternative 2026

活动

  • 别装了,你在《牛来》里早有原型
  • Tabbit 妙招大赛
  • KPOP SBTI 饭圈人格测试
  • Tabbit 校园共创者计划
  • fifi 的论文文献妙招精选
  • 用户问卷

关于

  • Tabbit 博客
  • 媒体报道
简体中文
简体中文English
测评与证据

DeepSeek V4 Pro · 媒体来源 · 编辑分析

XSCT Bench 两用例对照:V4-Pro 规划执行强、人设澄清弱

同一平台、同一被测模型的对照显示:V4-Pro 在“自主规划执行”(基础 98.0 / 进阶 92.6)上接近满分,而在“模糊需求澄清”人设用例上只得 68.5——结构化工具规划是强项,需要主动追问多义需求的人设对话是短板。

待验证:本次未能重新核实原文。下方历史数字不代表已核实的当前结果。

媒体来源编辑分析编辑日期 2026-09-20

测试条件速查

条件
版本 V4 Pro;XSCT Bench 同平台两用例;采集 2026-08-21 时平台覆盖 112 模型/1,517 用例;prompt、重复和完整 harness 未公开。

关键数据与适用场景

一句话结论

同一平台、同一被测模型的对照显示:V4-Pro 在“自主规划执行”(基础 98.0 / 进阶 92.6)上接近满分,而在“模糊需求澄清”人设用例上只得 68.5——结构化工具规划是强项,需要主动追问多义需求的人设对话是短板。

适用场景

  • 适合的任务:判断 V4-Pro 是否适合“先规划后执行的 Agent 工具任务”(证据:强)与“客服/助理类需要澄清歧义的角色对话”(证据:弱);作为给 Agent 写系统提示的结构参照。

  • 不适合的任务:把两个用例的分数当作整体能力排名;把 LLM-as-a-Judge 点评当作人工评审结论。

  • 适用的模型版本:deepseek-v4-pro(平台模型名;未披露快照与 effort,见边界)。

  • 适用的客户端、Agent 或 API:平台统一 harness;用户侧复现需自备工具调用环境。

  • 推荐的推理档位和参数:未公开;复现时必须自己记录 effort/temperature 并固定,否则无法横向比较。

测试环境

  • 平台与方法:XSCT Bench,LLM-as-a-Judge + 多 Judge(CLAUDE/GEMINI/KIMI)+ 证据锚定 + 难度分层 + 评分与被测模型分离;方法论页自述“缺乏 Ground Truth 校验”“用例覆盖存在盲区”。

  • 用例一(l_agent_008 自主规划执行):Agent MCP 型文本生成。系统提示要求 <plan> 先行、JSON 工具调用、<observation> 复盘、<summary> 收尾;用户提示要求继续完成读 README、检查 config/、不读 secrets.env 的多步任务。得分:基础 98.0 / 进阶 92.6,均通过;进阶题要求对 read_file 失败做容错并汇总失败清单。

  • 用例二(l_alice_persona_002 模糊需求澄清):人设对话型文本生成。系统提示为 26 岁远程助理 Alice 的完整人设(称呼规则、说话风格、不猜不乱做、WLB 边界);用户任务含“文件整理”的双重歧义。得分:综合 68.5 / 基础 68.5,通过但评审指出核心缺陷。

  • 评审摘要(用例二):CLAUDE——“只问了文件在哪里,完全遗漏‘整理’动作本身的歧义”;GEMINI——人设与禁忌遵循出色但澄清不完整;KIMI——“看似问了,实则没问到点子上”。

  • 补充背景:平台排行榜 deepseek-v4-pro 综合 87.7(基础 89.1 / 进阶 87.4 / 困难 86.5),与 kimi-for-coding、GLM-5v-turbo 并列该档。

原始证据与数据

  • 用例一模型实际输出(采集可见):<plan> 中声明安全约束(不读 secrets.env);依次 read_file README、list_directory config/;进阶题完整走通“失败跳过+记录原因+汇总写入”流程,评审点评为“高质量 Agent 执行示例”。

  • 用例二模型实际输出全文(采集可见):“老板,你说的那个文件我这边没看到,发我一下?另外,我怎么称呼你比较好?”——仅澄清了文件缺失,未追问“整理”的歧义。

  • 两个用例页面均公开:完整系统提示词、用户提示词、任务要求(评分锚点)、模型生成产物、多 Judge 评审点评、基础/进阶得分。

  • 搜索摘要中的“96 分”“83 分”与页面当前数值(98.0/68.5)不一致,说明平台会更新结果;以采集时页面为准。

适用边界

  • 未披露被测模型快照、effort 档位、temperature、重复次数与调用 harness;分数会随平台更新变化,复现需先锁定这些变量。

  • 单平台、两用例的证据强度有限:可作“规划执行强、澄清弱”的方向性证据,不能替代官方 benchmark 或自建评测。

  • 用例一人格化程度低、输出格式强约束,容易得高分;用例二强调人设语气与主动澄清,暴露的是“提示要求被格式带偏”的问题,而非纯推理能力。

  • LLM-as-a-Judge 点评与人类判断可能存在系统偏差(偏好格式完整、语气规范)。

来源摘录或观察(仅做合规短引)

用例二 KIMI 评审原文:“候选输出在核心任务上严重失焦:仅处理了单一歧义且方式不当(假设文件未收到),完全遗漏「整理」的动作歧义,违背「不猜,不乱做,先问最关键的问题」原则。”

能支持的判断

  • 支持把 98.0/92.6 与 68.5 的任务差异用于提示词设计和澄清流程。

不能支持的判断

  • 不支持将两用例分数当作总体 Agent 能力或复杂需求沟通成功率。

方法、局限和复现

本文中的数字、任务集、推理档位和客户端条件只在所列来源及采集时点内成立。不同版本、不同 harness 或不同提供商的数据不能直接并排比较;未公开的参数保持未知。

需要复测时,请固定模型版本、提供商或客户端、推理档位、工具、任务集版本、样本数和采集日期,并记录失败、重试与人工修正。完整方法和复现步骤见下方来源笔记。

原始来源

XSCT Bench(xsctbench.com,场景化模型选型评测) · XSCT Bench(xsct.ai 出题与平台运营) · 原文发布日期 Unknown · 本站编辑日期 2026-09-20

打开原始来源

DeepSeek V4 Pro

在 Tabbit 中比较 DeepSeek V4 Pro

下载 Tabbit 客户端后检查模型可用性

模型深度阅读

总览 · 简体中文

DeepSeek V4 Pro:有哪些变化、如何计费,适合谁使用

用可回溯来源拆解 DeepSeek V4 Pro 0813 的 Agent 升级、API 限制、价格边界、独立测评与安全试用方法。

相关评测

DeepSeek-V4-Pro-0813 MindStudio 八题编码与 Agent 实测对照MindStudio 的公开八题实测给 V4-Pro-0813 61/80(76.25%),显示前端、规划、数学和长程 Agent 是强项,但 SVG、游戏打磨和简单任务的过度思考仍是边界。Artificial Analysis:DeepSeek V4 Pro 0813(max effort)智能指数、成本与定位Artificial Analysis 的 2026-08-21 页面快照记录 V4-Pro 0813 max effort 指数 53、速度 80.3 tok/s、输出 $3.96/1M、1M context 与 1.6T/49B;本轮 2026-09-20 重开页面显示指数已为 36,不能混作同一时点。DeepSeek-V4-Pro 官方发布:Reasoning 与 Agent 能力升级DeepSeek 的 GA 公告明确把 V4-Pro 定位为生产 Agent 模型:支持可调 reasoning effort、Responses API 与 Codex,但公告没有公开可复核分数,不能把“major upgrades”当作胜率。Reuters DeepSeek-V4-Pro-0813 价格与独立指数对照Reuters 引用 Artificial Analysis 的独立价格/指数数据:V4-Pro-0813 的 reasoning Intelligence Index 为 53、V4 Flash 为 40,但 Pro 的输入/输出价格约为 Flash 的 9/14 倍,选型必须把质量与成本一起算。DeepSeek-V4-Pro 思考档位与工具调用工作流V4-Pro 默认开启 thinking、默认 effort 为 high;简单任务用 low,日常 Agent 用 high,复杂任务用 max,并在工具调用的每一轮完整回传 `reasoning_content`。DeepSeek-V4-Pro 在 Codex 中的 Responses 配置工作流DeepSeek-V4-Pro 可通过原生 Responses API 接入 Codex CLI、ChatGPT 桌面应用和 VS Code 扩展;一次配置共享,但应先备份并验证 `config.toml`/`models.json`。XSCT Bench「自主规划执行」用例:deepseek-v4-pro 的 Agent 工具调用提示词与生成结果平台公开了完整的系统提示词、用户提示词、模型实际生成产物和双难度得分(基础 98.0 / 进阶 92.6):一份可直接复制的“先 `<plan>` 规划、JSON 调工具、`<observation>` 复盘、`<summary>` 收尾”的 Agent 执行提示词。DeepSeek-V4-Pro 在 Claude Code 中的 1M 上下文环境变量配置工作流通过 8 个环境变量即可把 Claude Code(及 Claude Desktop 开发者模式)指向 DeepSeek,用 `deepseek-v4-pro[1m]` 解锁 1M 上下文,并用 `deepseek-v4-flash` 承担子代理,主模型 effort 设 `max`、自动压缩窗口 786432。