
复盘页:叠加的曲线、记分卡,以及解释差异来源的配置 diff。
你会看到什么
配置 diff 是最被低估的那一块。两个 run 曲线不一致,几乎总有某个配置键不一致,
而 diff 找到它的速度远快于对着读两份 YAML。
你可以做什么
- 增删 run —— 叠加图会即时更新,不用刷新。
- Ask Agent —— 对所选 run 的自然语言分析。除非部署设了
FORGE_PREMIUM_PUBLIC,否则仅管理员可用。 - 分享 —— 生成这份对比的只读链接,带过期时间。见分享。
诚实地读一次对比
配置完全相同,曲线却不同
配置完全相同,曲线却不同
随机种子。后训练在完全相同的配置之间也会有波动,有时还不小。
两个 run 不构成一个结论;如果这个差异重要,把那个变体再跑一次。
主指标更好,别的更差
主指标更好,别的更差
这是正常结果,也是记分卡展示多个基准而不是一个数的原因。
后训练会稳定地改进一个轴,同时悄悄损伤另一个——数学、代码、知识、中文、指令遵循
这几个轴的划分就是为了让这件事可见。
reward 在涨,评测分数不动
reward 在涨,评测分数不动
模型是在变得更擅长你的 reward,而不是更擅长这个任务。
庆祝之前先看看验证样本:单看曲线的话,reward hacking 长得和这一模一样。