MIT AI Risk Repository

Browse AI risks

2,500 risk entries extracted from 74 frameworks, coded by domain, subdomain, causal entity, intent and timing. Filter, then export the current selection with its licence and citation attached.

Reset Also filtered by framework G'sell2025 ×

2,500 entries · page 45 of 50

  1. 62.16.03a · Additional evidence

    Model Evaluations

    General Evaluations (Difficulty of identification and measurement of capabilities)

  2. 62.16.03b · Additional evidence

    Model Evaluations

    General Evaluations (Difficulty of identification and measurement of capabilities)

  3. 62.16.07a · Additional evidence

    Model Evaluations

    General Evaluations (AI outputs for which evaluation is too difficult for humans)

  4. 62.16.11a · Additional evidence

    Model Evaluations

    Benchmarking (Guideline contamination)

  5. 62.18.02 · Risk Sub-Category

    Model Evaluations (Interpretability/Explainability)

    Misunderstanding or overestimating the results and scope of interpretability techniques

    "The results of explainability techniques are not free of bias and require careful interpretation. Users might develop a false sense of security or reliability if the resulting explanations align with their initial beliefs, leading to confirmation bias and an overestimation of abilities of these techniques [24]."

    From Risk Sources and Risk Management Measures in Support of Standards for General-Purpose AI Systems (Gipiškis2024)

  6. 62.18.02a · Additional evidence

    Model Evaluations (Interpretability/Explainability)

    Misunderstanding or overestimating the results and scope of in- terpretability techniques

  7. "This section catalogs the risk sources related to GPAI failure modes or attacks targeting GPAIs. Many of these apply mainly to LLM-based GPAIs, which share some common failure modes such as jailbreaks and trojans. These vulnerabilities often extend beyond GPAIs and fall into the broader field of adversarial machine learning. However, additional vulnerabilities may arise with the introduction of new modalities, longer context windows, or different encodings."

    From Risk Sources and Risk Management Measures in Support of Standards for General-Purpose AI Systems (Gipiškis2024)

  8. 62.19.10a · Additional evidence

    Attacks on GPAIs/GPAI Failure Modes

    Lack of understanding of in-context learning in language models

  9. 62.20.11a · Additional evidence

    Attacks on GPAIs/GPAI Failure Modes

    Misuse of AI model by user-performed persuasion

  10. 62.21.00a · Additional evidence

    Agency

  11. 62.22.04a · Additional evidence

    Agency (Goal-Directedness)

    Goal misgeneralization

  12. 62.22.04b · Additional evidence

    Agency (Goal-Directedness)

    Goal misgeneralization

  13. 62.23.01a · Additional evidence

    Agency (Deception)

    Deceptive behavior

  14. 62.24.01a · Additional evidence

    Agency (Situational Awareness)

    Situational awareness in AI systems

  15. 62.28.03a · Additional evidence

    Cybersecurity

    AI System bypassing a sandbox environment

  16. 62.29.01a · Additional evidence

    Impacts of AI (General)

    High-impact misuses and abuses beyond original purpose

  17. 62.30.03a · Additional evidence

    Impacts of AI (Physical)

    Critical infrastructure component failures when integrated with AI systems

  18. 62.30.04a · Additional evidence

    Impacts of AI (Physical)

    AI Systems interacting with brittle environments

  19. 62.31.01a · Additional evidence

    Impacts of AI (Financial Impacts)

    Deployment of GPAI agents in finance

  20. 62.33.01a · Additional evidence

    Impacts of AI (Weapons)

    Misuse of AI systems to assist in the creation of weapons

  21. 62.34.01a · Additional evidence

    Impacts of AI (Bias)

    Homogenization or correlated failures in model derivatives

  22. 62.34.02a · Additional evidence

    Impacts of AI (Bias)

    Reporting of user-preferred answers instead of correct answers

  23. 62.34.02b · Additional evidence

    Impacts of AI (Bias)

    Reporting of user-preferred answers instead of correct answers

  24. 62.35.03a · Additional evidence

    Impacts of AI (Bias)

    Biases in AI-based content moderation algorithms

  25. 62.36.04a · Additional evidence

    Impacts of AI (Bias)

    Systemic bias across specific communities

  26. 62.38.01a · Additional evidence

    Impacts of AI (Privacy)

    Decision-making on inferred private data

  27. 62.38.01b · Additional evidence

    Impacts of AI (Privacy)

    Decision-making on inferred private data

  28. 63.01.00a · Additional evidence

    Miscoordination

    From Multi-Agent Risks from Advanced AI (Hammond2025)

  29. 63.01.01a · Additional evidence

    Miscoordination

    Incompatible strategies

    From Multi-Agent Risks from Advanced AI (Hammond2025)

  30. 63.02.00a · Additional evidence

    Conflict

    From Multi-Agent Risks from Advanced AI (Hammond2025)

  31. 63.02.00b · Additional evidence

    Conflict

    From Multi-Agent Risks from Advanced AI (Hammond2025)

  32. 63.03.00a · Additional evidence

    Collusion

    From Multi-Agent Risks from Advanced AI (Hammond2025)

  33. 63.04.00a · Additional evidence

    Information Asymmetries

    From Multi-Agent Risks from Advanced AI (Hammond2025)

  34. 63.04.00b · Additional evidence

    Information Asymmetries

    From Multi-Agent Risks from Advanced AI (Hammond2025)

  35. 63.04.00c · Additional evidence

    Information Asymmetries

    From Multi-Agent Risks from Advanced AI (Hammond2025)

  36. 63.04.02a · Additional evidence

    Information Asymmetries

    Bargaining

    From Multi-Agent Risks from Advanced AI (Hammond2025)

  37. 63.05.00a · Additional evidence

    Network Effects

    From Multi-Agent Risks from Advanced AI (Hammond2025)

  38. 63.05.00b · Additional evidence

    Network Effects

    From Multi-Agent Risks from Advanced AI (Hammond2025)

  39. 63.05.00c · Additional evidence

    Network Effects

    From Multi-Agent Risks from Advanced AI (Hammond2025)

  40. 63.05.02a · Additional evidence

    Network Effects

    Network rewiring

    From Multi-Agent Risks from Advanced AI (Hammond2025)

  41. 63.05.02b · Additional evidence

    Network Effects

    Network rewiring

    From Multi-Agent Risks from Advanced AI (Hammond2025)

  42. 63.05.03a · Additional evidence

    Network Effects

    Homogeneity and correlated failures

    From Multi-Agent Risks from Advanced AI (Hammond2025)

  43. 63.06.00a · Additional evidence

    Selection Pressures

    From Multi-Agent Risks from Advanced AI (Hammond2025)

  44. 63.06.03a · Additional evidence

    Selection Pressures

    Undesirable Capabilities

    From Multi-Agent Risks from Advanced AI (Hammond2025)

  45. 63.07.00a · Additional evidence

    Destabilising Dynamics

    From Multi-Agent Risks from Advanced AI (Hammond2025)

Informational only, not legal advice. Verify every claim against the linked official sources and consult qualified counsel before acting.