Skip to main content
选两个或更多作业,控制台会叠加它们的曲线、对比配置差异,并给出一张记分卡。 它要回答的问题不是「发生了什么」,而是「这次有没有变好,我们留哪一个」。
StarForge 复盘页

复盘页:叠加的曲线、记分卡,以及解释差异来源的配置 diff。

你会看到什么

配置 diff 是最被低估的那一块。两个 run 曲线不一致,几乎总有某个配置键不一致, 而 diff 找到它的速度远快于对着读两份 YAML。

你可以做什么

  • 增删 run —— 叠加图会即时更新,不用刷新。
  • Ask Agent —— 对所选 run 的自然语言分析。除非部署设了 FORGE_PREMIUM_PUBLIC,否则仅管理员可用。
  • 分享 —— 生成这份对比的只读链接,带过期时间。见分享

诚实地读一次对比

随机种子。后训练在完全相同的配置之间也会有波动,有时还不小。 两个 run 不构成一个结论;如果这个差异重要,把那个变体再跑一次。
这是正常结果,也是记分卡展示多个基准而不是一个数的原因。 后训练会稳定地改进一个轴,同时悄悄损伤另一个——数学、代码、知识、中文、指令遵循 这几个轴的划分就是为了让这件事可见。
模型是在变得更擅长你的 reward,而不是更擅长这个任务。 庆祝之前先看看验证样本:单看曲线的话,reward hacking 长得和这一模一样。