How many runs before your eval means anything? Reliability statistics for stochastic evals: audit miss rates, exact intervals, runs-needed.
statistics reliability evaluation confidence-intervals flaky-tests statistical-power llm-evaluation clopper-pearson pass-at-k
-
Updated
Aug 18, 2026 - Python