Statistical analysis for LLM evaluations, from model comparisons to inference resilient to LLM judge bias, optimized for small sample sizes. All defaults battle-tested in Monte Carlo simulations.
benchmarking statistical-analysis ai-statistics ai-evaluation prompt-engineering prompt-evaluation ai-evaluation-tools
-
Updated
Aug 28, 2026 - Python