把 Luna 放在摘要、标签、轻量 review precheck 和脚手架等低风险首轮,并把失败或复杂任务升级给 Terra/Sol,是 CodeRabbit 对三档编码 Agent 的可复用路由建议。
适合的任务:PR 摘要、简单代码解释、测试名生成、changelog 草稿、低风险 review 预检、可单元测试验证的重复转换。
不适合的任务:跨文件架构、长程自主实现、最终高风险安全审查和无法定义通过条件的开放任务。
适用的模型版本:GPT-5.6 Luna;文章同时讨论 Terra、Sol,但没有单独运行 Luna 的量化编码任务。
适用的客户端、Agent 或 API:CodeRabbit 风格的 PR review/代码 Agent,也可迁移到自建网关。
推荐的推理档位和参数:首轮使用较低 reasoning;质量闸门或升级时由 Terra/Sol 重新执行,具体档位需用项目验收集校准。
按 CodeRabbit 的工作地图整理为路由规则:
if task in {summary, simple_explanation, pr_summary,
lightweight_review_precheck, test_name, changelog_scaffold}:
run Luna first
require a bounded output and a deterministic check
if check fails, fields are missing, or scope expands:
escalate to Terra
if task is scoped implementation or review triage:
try Terra
keep escalation to Sol available
if task requires multi-file persistence, long task lists,
architecture judgment, or final high-risk review:
route Sol or a separately validated frontier model为首轮任务定义输出 schema、最大 token、允许修改范围和通过/升级条件。
用 Luna 只做读取、摘要、分类或可回滚的小改动;记录首轮通过率、返工次数和每个结果的总成本。
发现缺字段、测试失败、跨文件依赖、重复循环或范围扩大时立即升级,不要让 Luna 无限重试。
对升级后的 Terra/Sol 结果单独统计,不把首轮和升级 token 混为 Luna 的单次成本。
PR review 场景保留模型原始评论,先过滤低置信度和 nitpick,再把可行动问题交给人工。
每周抽样复核 Luna 的漏报与误报;如果低风险任务的人工修正成本超过节省的 token 成本,撤回该路由。
CodeRabbit 将 Luna 定位为 low-reasoning、high-volume lane,例子包括 quick summaries、simple code explanations、PR summaries、lightweight review prechecks、test-name generation 和 changelog scaffolds。
同文对 Sol/Terra 的长程 coding run(100+ tasks)报告:Sol pass rate 63.7%、平均输出 20,968 tokens;Terra 40.7%、55,594 tokens。Luna 没有参加这项量化长程 run。
同文的 CodeRabbit review benchmark 也没有把 Luna 放进最终表:Sol 为 69/99 actionable pass、69.7%;Terra 为 53/101、52.5%。
因此该 workflow 的 Luna 结论来自作者的模型地图和路由建议,不是 Luna 的独立 pass-rate 证明。
文章的量化结果主要属于 Sol/Terra,不能拿来宣称 Luna 的编码通过率。
CodeRabbit 是产品方测评,任务集、过滤器、基线 ensemble 和评论定义由其控制;跨项目迁移前必须自测。
“首轮低风险”需要由业务定义;摘要、分类一旦驱动付款、合规或安全决策,就不再是低风险。
路由升级应有预算、停止条件和人工回滚,避免便宜首轮因反复失败变成更贵的总工作流。
作者建议 “Use Luna as a first-pass lane”,但同文的量化编码数据并未测量 Luna;两者不能混为一个 benchmark 结论。
GPT-5.6 Luna