Reproducible causal-subspace experiments in GPT-2-small: interventions, matched-span controls, and audit-ready evidence.
pytorch computational-neuroscience superposition causal-inference ai-safety interpretability gpt-2 toy-models neuroai mechanistic-interpretability transformer-circuits polysemanticity mixed-selectivity
-
Updated
Aug 14, 2026 - Python