Modellverhalten
KI-Toxizität
Mechanismus
Das unbeabsichtigte Generieren beleidigender, diskriminierender oder rassistischer Inhalte durch generative Modelle.
Implikation
Erfordert engmaschige Inhaltsfilter-Klassifikatoren und restriktive Alignment-Verfahren vor der Auslieferung.