Skip to main content
Benchmarks 页(/benchmarks)汇总所有 sf bench 产出的分数:

Benchmarks 看板。跑过 sf bench 之后才会有分数。

  • 行 = 模型 / run,列 = 基准(GSM8K / MMLU / C-Eval…)。单元格是分数和样本数。
  • 每列最优分标绿。
  • 过滤:基座、方法、runner、时间范围。
  • 点分数跳到那次评测作业(日志和 runner 参数)。

数据从哪来

sf bench 的评测作业在训练容器内跑 lm-eval / evalscope,分数经 ingest 幂等入库(同 run 同基准重跑覆盖旧分,不产生重复行)。两个 runner 遵守同一分数契约,同一基准跨 runner 可比。
养成「训练前先评基座」的习惯,看板上才有提升幅度的参照系。用法见标准基准评测