在 11 个匹配 prompt、7 个参考模型和确定性的 460 特征文风协议下,Ox Alpha 每个 prompt 都最接近 GLM 5.3,但这只能说明测试条件下的风格相似,不能识别权重或开发者。
入口:OpenRouter Chat Completions API,2026-08-25(America/Los_Angeles)。
目标:stealth/ox-alpha,共 11 个可匹配 prompt;p12 因上游限流/停滞未纳入分析。
参考模型:GLM 5.3、GLM 5.2、GLM 5、MiMo V2.5、DeepSeek V4 Flash、Gemini 3.7 Flash、MiniMax M3。
数据规模:每个来源每个 prompt 一次输出;平衡交集为 88 份分析文档,仓库保存 95 份成功收集的最终答案。
特征:256 个 hashed character n-grams、136 个 function-word rates、23 个结构特征、21 个 discourse-marker rates、13 个标点特征、11 个形态特征,共 460 项。
控制:特征缩放只用参考模型;按 prompt 去除主要影响;Ox Alpha 未参与缩放、prompt 均值或训练 centroid。
| 排名 | 参考模型 | 平均距离 | Bootstrap winner | Prompt votes |
|---|---|---|---|---|
| 1 | GLM 5.3 | 1.8094 | 100.0% | 11/11 |
| 2 | GLM 5.2 | 1.9363 | 0.0% | 0/11 |
| 3 | Gemini 3.7 Flash | 1.9995 | 0.0% | 0/11 |
| 4 | GLM 5 | 2.0036 | 0.0% | 0/11 |
| 5 | MiMo V2.5 | 2.0116 | 0.0% | 0/11 |
| 6 | DeepSeek V4 Flash | 2.0299 | 0.0% | 0/11 |
| 7 | MiniMax M3 | 2.0423 | 0.0% | 0/11 |
GLM 5.3 在 4,000 次 prompt-level bootstrap 重采样中获胜 100%。
已知模型留一 prompt 验证准确率:72.7%。
GLM 5.3 与 GLM 5.2 的最近参考距离差约 6.6%。
prompt battery:https://github.com/ItsKaiwenDu/Ox-Alpha-Stylometry/blob/main/prompts.md
原始答案与预测表:仓库 data/raw/、results/predictions.csv。
固定仓库 commit,按 prompts.md 为每个 prompt 建立新会话,只保存最终答案。
使用相同 OpenRouter 模型 ID、模型列表和请求设置收集参考模型与 Ox Alpha 输出。
按仓库 analyze.py validate 检查数据,再执行 analyze.py run,生成报告、距离表、混淆矩阵和图像。
记录路由提供商、失败/限流、长度截断和 reasoning 参数差异;不要删除异常样本。
用事先写好的 p13–p30 作为真正的 held-out confirmation,而不是只在已观察到结果的 11 个 prompt 上重复。
证据支持“在该候选集合和该文风特征协议下,Ox Alpha 呈现 GLM-5.3-like writing behavior”。它不支持“Ox Alpha 已被确认是 GLM 5.3/5.4”,因为风格可受 system prompt、后处理、共享数据、后训练和服务栈影响。
样本只有 11 个匹配 prompt,每个模型/prompt 只有一次随机生成。
参考模型的 reasoning 参数因提供商支持不同而不完全一致,部分模型使用 native/default reasoning。
参考模型集合不完整,且已知模型验证准确率只有 72.7%。
p13–p30 尚未完成,因此当前结果仍是 screening study。
Ox Alpha