在一个每天为 22 个城市研究和整理活动的网站中,作者发现 Sonnet 5、GPT-5.6 Terra 甚至 Haiku 都能稳定完成同一类任务,远低于 Opus 的额度压力;但这不是受控模型横评。
项目:aievents.now;每个城市一个 Agent,每天早晨研究和整理未来活动。
规模:约 25 个 Agent 连续运行一个月;22 个城市;单个城市运行约 30 分钟;通过 cronloop 运行 Claude Code 与 Codex。
对照:作者把城市 Agent 从 Opus 切换/试验到 Sonnet 5、GPT-5.6 Terra 和 Haiku,目标是找出最便宜且足够可靠的模型。
评价标准:没有正式分数;作者关注幻觉、遗漏活动、运行时长、5 小时额度和长期日志表现。
原帖没有公开完整 prompt、模型 snapshot、temperature、工具权限或逐次输出;公开的是可复用的 Agent 运营流程:
给每个 Agent 明确完成时限,防止记忆/指令增长造成 workflow explosion。
将城市运行错峰,每个下一个城市延后 15 分钟,使并发约为 3。
先用小模型做成本/质量试验,选择能稳定完成任务的最低成本模型。
保存每次运行的完整日志,并让 Agent 分析最近 N 次运行、发现低效点和更新指令。
每次运行结束把学习写入持久 Markdown,下一次开始先读取;作者称数周后明显减少重复研究和错误。
作者称 Sonnet 5、GPT-5.6 Terra 和 Haiku 对该活动研究任务“非常稳健”,质量大致接近 Opus,同时显著减少使用量;原帖没有给出逐模型成功率。
约 30 分钟/城市、15 分钟错峰和并发约 3 是作者实际配置,可作为复现实验的起点。
持久记忆帮助 Agent 记录失效来源、低质量场馆和可复用 JSON endpoint;这是工作流收益,不是 Terra 单模型能力的独立测量。
Terra 有现实证据适合作为长时间批量研究/整理 Agent 的中档执行模型,尤其当任务可以限时、错峰、记录日志并自动复核。它不应被直接升级为需要最高质量的规划器;先用自己的任务日志比较 Luna/Terra/Sol/其他模型。
单一项目、单一作者、无盲测、无固定任务集和无逐题数据,属于 field report。
“大致和 Opus 一样好”是个人总体观察,不能解释复杂任务、语言或网站变化下的表现。
cronloop、订阅额度和 Agent 工具链会影响成本与稳定性,不能直接等同 API 价格。
选取相同城市/主题的 20–30 个研究任务,固定来源清单、工具和完成时限。
用 Terra、Luna、Sol 和一个基线模型各运行至少 10 次;错峰控制并发。
保存每次输入、工具调用、输出、耗时、token、费用、幻觉、遗漏和人工修订。
加入持久 Markdown 记忆与无记忆对照,分别报告模型效果和记忆工作流效果。
GPT-5.6 Terra