arXiv cs.CR·10d agoSafer Content or Firmer Refusals? A Hybrid Perturbation Defense for Alignment under Harmful Fine-tuning#alignment#harmful-fine-tuning#llama-2AI safety & security