MIT AI Risk Repository · Additional evidence · 73.04.02a

Inconsistent Performance across and within Domains

Category: LLM-Systems Can Be Untrustworthy

Description

From Foundational Challenges in Assuring Alignment and Safety of Large Language Models (Anwar2024), as extracted by the MIT AI Risk Repository (CC BY 4.0).

Classification

Domain
Subdomain
Causal entity
Intent
Timing

Other entries from Anwar2024