Back to feed
arXiv cs.LG
arXiv cs.LG
7/23/2026
Building Fast, Evaluating Slow: Pipeline Choices Dominate Autointerpretability Score Variance

Building Fast, Evaluating Slow: Pipeline Choices Dominate Autointerpretability Score Variance

Short summary

This paper shows that autointerpretability scores for sparse autoencoders are dominated by methodological pipeline variance rather than architectural differences. Across four metrics, two models, and four variation axes, pipeline choices explain more score variance than the SAEs being compared. The authors contribute a variance decomposition approach, Stability Check, and Minimum Reporting Checklist to improve evaluation reliability.

  • Autointerpretability score variance is driven more by evaluation pipeline choices than by SAE architecture differences
  • Detection is the most stable metric while fuzzing is unreliable across all conditions
  • Authors propose variance decomposition, Stability Check, and Minimum Reporting Checklist for reliable evaluation

Generated with AI, which can make mistakes.

Is this a good recommendation for you?

Comments

Failed to load comments. Please try again.

Explore more