帖子标题用 benchmark 宣称 Luna 优于 Google 模型,但评论提供了重要的生产反例:在 PDF 文档审计、分类、问答和 bounding box 任务中,评论者认为 Gemini 3.6 Flash 更稳定、更遵循指令,月成本约 $7,000;Luna 预估约 $2,000,但视觉能力和 bounding box 质量更差。
benchmark 排名与具体视觉工作流可能不一致。
Luna 的价格优势明显,但低成本不等于在视觉任务中更高的可接受率。
真实评估应同时记录指令遵循、定位框准确率、分类准确率、人工返工和月度总成本。
该帖子中的月成本是用户估算,不是统一 API 测试结果。
本站仅展示 Tabbit 编辑摘要和必要节选;完整内容、上下文与最新版本请查看原始来源。
GPT-5.6 Luna