/benchmarks)汇总所有 sf bench 产出的分数:
Benchmarks 看板。跑过 sf bench 之后才会有分数。
- 行 = 模型 / run,列 = 基准(GSM8K / MMLU / C-Eval…)。单元格是分数和样本数。
- 每列最优分标绿。
- 过滤:基座、方法、runner、时间范围。
- 点分数跳到那次评测作业(日志和 runner 参数)。
数据从哪来
sf bench 的评测作业在训练容器内跑 lm-eval / evalscope,分数经 ingest 幂等入库(同 run 同基准重跑覆盖旧分,不产生重复行)。两个 runner 遵守同一分数契约,同一基准跨 runner 可比。