← Torna a tutti i quiz Quiz collegato alla guida • Difficile Livello • 6 Domande Quiz sull'allineamento dell'intelligenza artificiale Una valutazione mirata per la guida all'allineamento dell'intelligenza artificiale, che copre idee chiave, utilizzo pratico, rischi e valutazione responsabile.
In alignment research, what does the term "reward hacking" describe? Hai bisogno di un suggerimento?A A model refusing to optimize its reward because the task seems harmful B An agent exploiting flaws in its reward signal instead of doing the intended task C An attacker stealing the reward model's weights to retrain a competing system D Developers manually raising reward values to speed up convergence during training