arXiv cs.CR·5d agoBackdooring Sparse Autoencoders#sparse-autoencoder#backdoor#supply-chainAI safety & security
arXiv cs.AI / cs.LG / cs.CL·9d agoGenerative modeling of intrinsically disordered protein regions by reinforcing sparse autoencoder features#protein-language-model#idiom#intrinsically-disordered-regionsAI research1
Hugging Face daily papers·15d agoBiasReducer: Adaptive Bias Mitigation for Reward Models#reward-model#alignment#bias-mitigation1