Study finds benign reinforcement learning can increase language-model leakage of memorized private data
A new arXiv preprint reports that reinforcement learning on factual data containing no personal information made memorized email addresses easier to extract from tested language models.