Code, data, and raw model outputs for "Failure Modes in Perturbation-Based Measurement of Language Model Reliability". evaluation/reproduce.py re-derives every reported number offline, no API key required.
benchmark language-models reproducibility uncertainty-quantification llm-evaluation sycophancy research-artifact measurement-validity
-
Updated
Aug 1, 2026 - Python