<EXP> 是一个评测实验,用 sf new my-bench --method evalkit/benchmark 建一次然后复用。
围绕这些命令的完整流程见跑一次评测。
sf bench ls 打印什么
内置基准随平台发布,用户发布的经 sf recipe sync 同步下来。
每一行说明它用哪个 runner、主指标是什么、属于哪一类。
runner 通常轮不到你选
用哪个 runner、few-shot 给几个、样本上限多少,都由基准自己声明——
所以你不用记住「gsm8k 要 5-shot」或者「humaneval 要加
--confirm_run_unsafe_code」。
--runner 只在评测平台没有收录的原始 suite 名时才需要。如果你选中的基准跨了两个 runner——比如 gsm8k 用 lm-eval、ceval 用 evalscope——
提交会被拒绝,并告诉你分两次提交。一次评测作业是一个进程,
而悄悄把它拆成两次比明说更糟。