Reward-Hacking: Warum KI-Agenten lügen und betrügen - und was wir dagegen machen können
Dass KIs auch mal unlautere Abkürzungen nutzen, um die gesetzten Ziele zu erreichen, ist an sich nicht neu. Doch mit zunehmender Komplexität der großen Sprachmodelle wird es immer schwieriger, ihne...