在作者自用的三个 UI sanity-check 中,Seed2.1 Pro 能完成 3D 桥梁和 Sankey 仪表盘首轮任务,但 guesthouse 页面视觉完成度落后于 M3、K2.7 和 Opus 4.8,且样本太小不能代表通用能力。
适合的任务:把相同 UI 提示词集作为快速 sanity check,判断模型是否值得进入前端 Agent 的更大规模盲测。
不适合的任务:据三次个人运行直接宣称模型是编码榜首或可无审查上线。
适用的模型版本:作者测试的是 Seed 2.1 Pro;具体 preview/snapshot 未公开。
适用的客户端、Agent 或 API:通过 ZenMux 聚合 API;不是火山方舟原生端到端测试。
推荐的推理档位和参数:未公开;作者承认提示词按个人习惯调优。
任务数量:3 个 UI 提示词,每个只运行少数几次。
任务 A:由单张照片生成 3D 互动金门大桥场景,观察空间结构、悬索、塔和水线。
任务 B:从 Sankey 图像生成收益仪表盘,检查数字、类别和卡片交互。
任务 C:一次生成 guesthouse 落地页,观察布局和视觉完成度。
路由与对照:ZenMux;作者将结果与此前 GPT-5.5、DeepSeek V4 Pro、M3、K2.7、Opus 4.8 的个人运行对照。
原始三条提示词未公开;只能复用任务类型,不能声称拥有作者完整 prompt。
每个案例的调用参数、图片、代码仓库、运行次数和输出链接未公开。
作者使用自己的 prompt 偏好,比较并非盲测。
3D 桥梁:作者称轮廓、悬索、塔和水线正确;此前 GPT-5.5 与 DeepSeek V4 Pro 在同一提示中出现结构错误。
Sankey 仪表盘:作者称数字和类别保持正确、卡片可点击,首轮无需手工修数据。
guesthouse 页面:布局可用,但视觉完成度低于 M3、K2.7 和 Opus 4.8,需要清理后才能发布。
成本:作者估计这三个任务的 Seed2.1 Pro 运行成本约为 Opus 4.8 的四分之一;如果每五次只需额外清理一次仍划算,超过两次则经济性反转。
这是一个“便宜模型能否通过常用 UI 检查”的个人样本:模型在空间结构和数据型 UI 上给作者留下可用印象,但审美和首轮交付仍有差距。它适合作为前端 Agent 的初筛证据,不足以替代更大规模、盲化、同 prompt 的测试。
样本量为一个人的三个任务,提示词经过个人调优,且通过聚合路由,无法排除 provider 差异。
没有公开原始 prompt、完整输出、token/延迟、图像输入和评分规则。
成本是作者的约数,不能替代当前官方价格表。
固定三类输入资产和完整 prompt,分别在 Pro、Turbo、参考模型上运行至少多次。
统一 provider、超时、工具、前端框架和验收清单,记录首轮交付与清理轮次。
对 3D 结构、数据正确性、交互可用性、视觉完成度分别评分,并记录 token、延迟和成本。
进行盲化审查;将个人 sanity-check 结果与更大任务集分开报告。
作者把这些任务定义为“容易描述但难以做对”的个人 UI 检查,而不是 benchmark。
作者明确提醒这是一个人的设置和小样本,生产代码仍需要更大规模盲测。
Doubao Seed 2.1 Pro