该讨论反映用户对综合排行榜可信度、价格下降和实际使用时长的分歧,适合当作选型问题清单,不能当作独立测评结果。
环境:Reddit 社区讨论,帖子标题提及 Artificial Analysis Intelligence Index 名次;评论者使用的订阅、模型档位和工作流不同。
主题:排行榜权重、实际编码任务、GPT-6 Luna 与 Sol 的价格/表现,以及 Codex 用量。
帖子本身未在可见正文提供基准数据表、任务输入或配置。评论没有统一模型档位、提示、任务或计量方法。
有评论者质疑综合排行榜,认为另一模型的名次与个人使用感受不符,并建议谨慎看待单一榜单。
有评论者认为 Luna 6 high 价格更低、使用时长更好;其中一人称将 Sol 6 medium 用作编排、Luna 6 high 用作 worker 后,自己的 Codex 使用时长有所增加。该评论没有公开可核对的账单或相同任务对照。
也有用户表示更相信实际模型体验而非单榜排名,意见并不一致。
此讨论支持在模型选型中分别核对能力、价格、使用限额和工作流成本。评论里的名次与时长是个人陈述,不能据此推算总体用户表现或复现 Artificial Analysis 的评测。
帖子正文没有可见的 benchmark 图表或原始数据,标题中的名次无法由该页单独核验。
评论样本自选且没有统一任务、账号档位或计量方式。
用量窗口和订阅额度会影响所谓“可持续工作时长”。
本文仅记录直接打开页面可见的帖子和评论;没有把标题或评论当作已验证的模型分数。
在同一账号和计费周期下固定 Codex 入口、模型档位与任务集。
对 Luna、Sol 及基线分别记录任务完成率、使用 token、费用、限额消耗和等待时间。
公开测试任务、配置和原始计量结果;将综合榜单和产品限额分开报告。
GPT-6 Luna