Hacker News 的单题对比给出一个可复现但不能排名的警告样本:LongCat-2.0 在一个核燃料选择问题上给出作者判定为错误的理由,Qwen 3.7 Plus 与 Gemini Flash 给出不同答案;评论区则指出题目语义、事实背景和 n=1 设计都不足以支持普遍结论。
适合的任务:构造模型事实性回归样本;检查小众科学问题的自信错误;练习把“模型输出”和“题目是否良好”分开记录
不适合的任务:据单个问题给模型排序、证明幻觉率或推断生产安全性
适用的模型版本:帖子中的 LongCat-2.0、Qwen 3.7 Plus、Gemini Flash;具体 provider、温度和系统提示词未公开
适用的客户端、Agent 或 API:未公开;页面是 Hacker News 评论中的手工对话报告
推荐的推理档位和参数:未公开;复现应固定 provider、temperature、thinking、系统提示词和新会话状态
使用新会话向每个模型发送同一问题;保存完整输入、系统提示词、模型 ID、provider、参数和原始响应。
运行多次而非一次:至少记录 n、随机种子(若可用)、温度和答案一致性。
先用权威核查资料确认问题的真实前提,再把“知识错误”“问题歧义”“回答风格”分开评分。
对每个模型记录最终选择、理由、置信语气和是否主动标注不确定性。
若要比较小众科学知识,增加带参考材料的检索增强组,避免把训练语料覆盖度误当作推理能力。
原帖作者把 U-235 与 Pu-241(均混合 95% U-238)作为二选一核反应堆燃料,询问应选哪个以及原因;原始问题可直接从页面复核。
LongCat-2.0 的回答被作者描述为“理由写得很好但结论错误”,选择了 Pu-241。
同一作者称 Qwen 3.7 Plus 选择 U-235,Gemini Flash 也选择 U-235 且回答更快、理由更有说服力。
未公开:模型具体版本号、API/provider、temperature、thinking/reasoning、是否联网、完整对话记录和重复次数。
| 模型 | 原帖记录 | 证据强度 |
|---|---|---|
| LongCat-2.0 | 作者判定为“漂亮理由+错误选择” | 单次手工试验 |
| Qwen 3.7 Plus | 作者称选择 U-235 | 单次手工试验 |
| Gemini Flash | 作者称选择 U-235,回答更快且理由更强 | 单次手工试验 |
评论区对照了 ChatGPT 5.5 的条件化回答,并质疑题目是否预设了“真实世界核燃料选择”而非“假设拥有纯 Pu-241”。也有评论指出该题缺少唯一无争议答案;因此该来源最可靠的结论是“需要更严谨的测试设计”,而不是 LongCat 的总体能力排名。
可复用结论:小众事实题适合做回归测试,但必须保留原始问题和完整前提;只保存“模型答错了”会丢掉题目歧义。
LongCat 的这一次输出提示在缺少外部资料时可能出现流畅、理由完整但结论有争议或错误的回答;不能据此估计错误率。
该页面还记录了用户对工具调用 wrapper、英文界面返回中文等兼容性观察,但它们是其他评论者的单点体验,不能与这道科学题合并成一个受控实验。
复现应加入权威核查、重复采样和带资料对照,否则“知识缺失”“题目歧义”“模型推理”无法区分。
原帖作者的总结是“Gemini Flash best, Qwen 3.7 Plus acceptable second, LongCat-2.0 ok-ish third”。
评论区明确提醒“n=1”不足以形成模型排名;该提醒是本条资料的关键适用边界。
LongCat 2.0