Zurück zum Glossar
    Modellverhalten

    KI-Toxizität

    Mechanismus

    Das unbeabsichtigte Generieren beleidigender, diskriminierender oder rassistischer Inhalte durch generative Modelle.

    Implikation

    Erfordert engmaschige Inhaltsfilter-Klassifikatoren und restriktive Alignment-Verfahren vor der Auslieferung.

    Ausführliche Erklärung