Tabbit
活动资源博客模型
Tabbit LogoTabbit

Tabbit — 为你工作的 AI 浏览器

主题资源

  • AI Browser Resources
  • Agentic Browser Resources
  • Browser Downloads and Install Guides
  • Browser Comparisons
  • AI Browser Alternatives
  • Browser Productivity Resources

热门指南

  • AI Browser
  • Agentic Browser Download
  • Best AI Browser 2026: Top 9 Tested & Ranked
  • AI Browser Download
  • Free AI Browser
  • Best AI Browser 2026
  • AI Browser Comparison 2026
  • AI Browser for Windows
  • AI Browser for Mac
  • Chrome Alternative 2026

活动

  • 别装了,你在《牛来》里早有原型
  • Tabbit 妙招大赛
  • KPOP SBTI 饭圈人格测试
  • Tabbit 校园共创者计划
  • fifi 的论文文献妙招精选
  • 用户问卷

关于

  • Tabbit 博客
  • 媒体报道
测评
媒体Doubao Seed 1.8

Doubao-Seed-1.8:arXiv 官方模型卡的 Agent、多模态与思考档位基准

原始来源

arXiv

作者ByteDance Seed

原文日期2026-04-17

Tabbit 整理2026-08-19

查看原文

一句话结论

官方模型卡显示 Seed1.8 的强项集中在搜索、GUI、视频工具和可调测试时计算,适合长流程 Agent,但其分数是厂商自报且包含内部任务与技术报告对照。

适用场景

  • 适合的任务:多步搜索与证据合成、浏览器/桌面 GUI、视频时间窗分析、工具调用和需要按预算调节推理的 Agent。

  • 不适合的任务:把内部 benchmark 直接外推到业务成功率,或只用高档思考追求低延迟和低成本。

  • 适用的模型版本:Seed1.8;报告采用 no_think、think-low、think-medium、think-high 四档。

  • 适用的客户端、Agent 或 API:ByteDance Seed/火山引擎模型服务,以及自行实现的搜索、代码、GUI、VideoCut 工具编排。

  • 推荐的推理档位和参数:简单抽取先试 no_think/low;复杂检索、编码和视频推理用 medium/high,并记录每档的 token、步骤和成功率。

测试环境

  • 评测类别:基础语言、多模态视觉/视频、Agent 搜索/编码/写作/工具/GUI、效率和真实世界启发的内部工作流。

  • 对照模型:GPT-5-high、Claude-Sonnet-4.5、Gemini-2.5-pro、Gemini-3-pro 等;非 Seed 分数多来自各自技术报告。

  • 配置:第 2.1–2.3 节报告主要使用 think-high;表 1 基础能力默认不使用工具;表 7 比较 Seed1.8 与 increased thinking。

输入/配置

  • 公共任务包括 AIME-25、LiveCodeBench v6、GPQA-Diamond、BrowseComp-en/zh、GAIA、SWE-bench Verified、Terminal Bench 2.0、BFCL-v4、OSWorld、Online-Mind2web、AndroidWorld 和长视频集合。

  • 报告支持 VideoCut 工具:模型指定起止时间和 1–5 FPS,工具重采样视频帧后再供模型分析。

  • 报告没有公开全部题目、system prompt、采样参数和每题产物;可复现的是任务名、思考档位、工具机制和汇总分数。

结果数据

基础与 Agent 汇总

基准/任务Seed1.8 分数说明
AIME-2594.3表 1,think-high、无工具
LiveCodeBench v679.5表 1,Pass@1
GPQA-Diamond83.8表 1,Pass@1
MMLU92.3表 1,Pass@1
Customer Support Q&A(内部)69.0经济价值任务
Complex Workflow(内部)54.6按 SOP 多步执行
GAIA93.2Agentic search,报告称高于 GPT-5-high 的 76.7
BrowseComp-en / zh67.6 / 78.5搜索
WideSearch63.8搜索
SWE-bench Verified未在正文 Agent 段给出单独分数仅列为评测项,避免用搜索摘要补写
FinSearchComp56.2财务检索与合成
XpertBench Finance / Law62.0 / 55.2内部专家任务

GUI 与视频工具

基准Seed1.8Seed1.8 + 工具
OSWorld61.9—
Realbench49.1—
Online-Mind2web85.9—
AndroidWorld70.7—
CGBench62.465.9
LVBench73.078.9
ZeroVideo6.918.8

增加测试时计算

基准Seed1.8Increased Thinking
AIME-25 Avg@1094.397.3
HMMT25(Feb) Avg@1089.796.7
LeetCodeBench(v6) Avg@879.484.7
HLE full / text / vision21.4 / 22.1 / 17.325.6 / 26.4 / 20.2

结论

Seed1.8 的可复用优势是把搜索、视觉、GUI、视频工具和多档思考放入同一 Agent 接口;VideoCut 在长视频任务上带来明显增益。纯编码或纯知识任务仍应按相同 harness 与目标模型重测,不能只依据 Agent 搜索分数选型。

局限

  • 这是官方模型卡,存在厂商自报、内部 benchmark 和引用其他技术报告结果的混合证据。

  • 复杂工作流的任务定义、评分器、工具环境和成功判据没有全部公开;表格分数不能直接当作业务 SLA。

  • think-high/increased thinking 会提升计算量;模型卡强调质量-延迟-成本权衡,但没有给出每档统一 token/美元表。

  • 报告中的模型名称是 Seed1.8,不应与 Seed1.8 的不同火山/BytePlus 快照或第三方代理结果混在一起。

复现步骤

  1. 固定 Seed1.8 实际 endpoint、区域、思考档位和工具版本;先复现无工具的 AIME/代码/视觉基线。

  2. 对搜索、GUI 和视频任务公开输入、工具 schema、网页/应用环境和终止条件。

  3. 分别跑 no_think、low、medium、high,记录正确率、工具调用成功率、执行步骤、总 token、延迟和失败类型。

  4. 视频任务固定 VideoCut 的时间窗和 FPS,报告开启/关闭 VideoCut 的差值。

  5. 对外部模型使用相同题目、工具、预算和重复次数,并把官方自报结果与实测结果分栏。

来源摘录或观察(仅做合规短引)

模型卡明确列出四档思考模式,并把 Agent 评测扩展到 search、coding、tool use、GUI 与 video tool-use;本文只保留页面可直接核对的汇总数据。

Tabbit 小编提醒

本文是第三方资料导航。测试环境、模型版本和主观体验可能不同,请以原文为准。

Doubao Seed 1.8

在 Tabbit 中使用并对比模型

Doubao Seed 1.8

相关测评

媒体Puter Developer

Doubao-Seed-1.8:Puter Developer API 与搜索 Agent 选型观察

社区X2025-12-19

Doubao-Seed-1.8:X 上的发布后多任务体验与边界

Doubao Seed 1.8

相关提示词

社区GitHub / ByteDance-Seed 官方仓库2025-12-19

Doubao-Seed-1.8:ByteDance 官方 Code Agent 工具闭环工作流

媒体BytePlus 官方文档

Doubao-Seed-1.8:BytePlus 多模态深思考与视频输入配置