Sparse Autoencoders Use L1 Penalties to Isolate Distinct Model Features
Sparse autoencoders use L1 penalties on residual activations to generate sparse mostly zero latents that correspond to candidate features in languageā¦
Sparse autoencoders use L1 penalties on residual activations to generate sparse mostly zero latents that correspond to candidate features in languageā¦