Companion code for the paper "Sparse Readout Prism: Explaining Logit-Lens Scores in Features Instead of Tokens" (arXiv:2609.01936). Pretrained dictionaries: hf.co/hematteo/sparse-readout-prism
language-models sparse-autoencoders interpretability mechanistic-interpretability logit-lens unembedding
-
Updated
Sep 3, 2026 - Python