Loading...
Loading...
Publish the nurb model leaderboard from merged benchmark submissions. Sanity-checks every run landed since the last regeneration, writes or refreshes the editorial verdicts, regenerates evals/REPORT.md and site/benchmarks.html, and opens the publish PR. Use when the user says "update the leaderboard", "publish the benchmarks", "regenerate the benchmark page", or after merging submission PRs.
npx skill4agent add shpigford/nurb leaderboardevals/REPORT.mdsite/benchmarks.htmlevals/submissions/evals/src/nurb_evals/site.pygit log -1 --format=%H -- site/benchmarks.html
git diff --stat <that-commit>..HEAD -- evals/submissions/evals/submissions/<harness>-<model>-<effort>-<hex>/results.jsonlevals/uv sync --lockedresults.jsonl/Users//home/evals/tests/solutions/task.materializemeasurements.tomlnurb devVERDICTSevals/src/nurb_evals/site.pycd evals
uv run python -m nurb_evals.report --write
uv run python -m nurb_evals.sitesite/benchmarks.htmluv run pytest -qevals/site/