Aniruddha 称 Ox Alpha 的代理工具调用和基于搜索的功能很多,并表示其截至当时测试都很好;由于没有任务、轨迹和完成标准,这是一条待复测的工具使用体验。
入口:回复 OpenCode 的 Ox Alpha 使用量帖子,具体客户端配置未公开。
任务:作者未公开具体任务集,只提到大量代理工具调用和搜索能力。
结果:作者称“到目前为止我测试的所有这些都很好”。
未公开:工具列表、搜索来源、调用次数、错误、耗时、模型版本和对照模型。
可把这条体验转成“工具选择与搜索证据链”的专项测评,但不能把“工具调用多”写成工具调用正确率,也不能把“都很好”当作 benchmark 分数。
固定工具 schema、搜索引擎、权限和模型版本,准备 20 个需要检索后执行的任务。
要求每次输出查询、引用、工具参数、失败恢复和最终结果。
用人工标注或测试套件判断引用相关性、工具参数正确率、完成率和返工时间。
与一个固定基线在相同工具权限下运行,分开报告模型错误与工具/网络错误。
Ox Alpha