evals
openai/evals
Evals is a framework for evaluating LLMs and LLM systems, and an open-source registry of benchmarks.
19,582stars
Forks
3,112
Open issues
347
Watchers
19,582
Size
6.5 MB
PythonOther
Created: Jan 23, 2023
Updated: Oct 10, 2026
Last push: Apr 14, 2026