# Accuracy, robustness, fairness and security testing

- **Record type**: Control
- **Kind**: Technical measure
- **Owner**: Quality or testing lead
- **Frequency**: At launch and on material change
- **Duties served**: 15

## What the control achieves

Verifies before release, and again after material change, that a system performs to declared accuracy levels, behaves consistently across groups and conditions, and resists the attacks specific to AI.

## How it is typically implemented

A test plan defines the metrics, datasets, thresholds and acceptance criteria for each trustworthiness property the risk assessment flagged: accuracy and calibration, performance across demographic and operational subgroups, resilience to noisy or out-of-distribution input, and security against data and model poisoning, evasion and extraction. Tests are run by people independent of the developers where practical, results are compared against the criteria and failures block release until fixed or formally accepted. Declared performance figures in user documentation are drawn directly from the latest report, and the plan is re-run on retraining or a change in operating context.

## Evidence it produces

- Pre-release test report (evaluation_report): Metrics, subgroup results, robustness and security findings against acceptance criteria.
- Test plan and acceptance criteria (procedure)
- Release test sign-off (approval_record)

## Legal duties this control serves

- Test and monitor systems, enable human control, and be transparent with users (guardrails 4 to 6) — Australian Voluntary AI Safety Standard, Australia (supports): https://aipolicytracker.org/obligations/australia-vaiss-testing-human-control-transparency
- Establish a risk management system for high-risk AI — EU AI Act, European Union (supports): https://aipolicytracker.org/obligations/eu-ai-act-risk-management-system
- Achieve appropriate accuracy, robustness and cybersecurity — EU AI Act, European Union (satisfies): https://aipolicytracker.org/obligations/eu-ai-act-accuracy-robustness-cybersecurity
- Providers of generative AI must mark synthetic output as artificially generated in a machine-readable way — EU AI Act, European Union (supports): https://aipolicytracker.org/obligations/eu-ai-act-art-50-2-synthetic-content-marking
- Providers of systemic-risk GPAI models must secure the model and its infrastructure — EU AI Act, European Union (satisfies): https://aipolicytracker.org/obligations/eu-ai-act-art-55-systemic-risk-cybersecurity
- Implement reasonable security safeguards and notify breaches — India DPDP Act, India (supports): https://aipolicytracker.org/obligations/india-dpdp-security-and-breach-notification
- Manage data quality, model development and monitoring across the lifecycle — Singapore Model AI Governance Framework, Singapore (supports): https://aipolicytracker.org/obligations/singapore-mgf-operations-management
- Ensure AI systems are safe, secure and robust throughout their lifecycle — UK AI regulation framework, United Kingdom (satisfies): https://aipolicytracker.org/obligations/uk-principles-safety-security-robustness
- Use AI in ways that are fair and do not discriminate unlawfully — UK AI regulation framework, United Kingdom (satisfies): https://aipolicytracker.org/obligations/uk-principles-fairness
- Developers must use reasonable care to avoid algorithmic discrimination — Colorado AI Act, Colorado (United States) (supports): https://aipolicytracker.org/obligations/us-colorado-ai-act-developer-reasonable-care
- Employers and employment agencies must obtain an independent bias audit before using an automated employment decision tool — NYC Local Law 144 (automated employment decision tools), New York (United States) (satisfies): https://aipolicytracker.org/obligations/us-new-york-city-local-law-144-bias-audit
- Employers and employment agencies must publish a summary of the bias audit results — NYC Local Law 144 (automated employment decision tools), New York (United States) (supports): https://aipolicytracker.org/obligations/us-new-york-city-local-law-144-publish-audit-summary
- Developers and deployers must not use AI with the intent to unlawfully discriminate against a protected class — Texas Responsible AI Governance Act (TRAIGA), Texas (United States) (supports): https://aipolicytracker.org/obligations/us-texas-responsible-ai-governance-act-traiga-unlawful-discrimination-prohibition
- Measure and test trustworthiness characteristics (Measure) — NIST AI RMF, United States (satisfies): https://aipolicytracker.org/obligations/us-nist-ai-rmf-measure
- Apply minimum risk-management practices to high-impact AI — OMB M-25-21, United States (supports): https://aipolicytracker.org/obligations/us-omb-m-25-21-high-impact-ai-practices

## Standards clauses it corresponds to (clause numbers only)

- ISO/IEC 42001:2023: Annex A.6.2.4 — Verification and validation.
- NIST AI RMF 1.0: MEASURE 2.5, 2.6, 2.7, 2.11
- ISO/IEC 27001:2022: Clause 8.1; Annex A 8.29 Security testing in development
- MITRE ATLAS: AML.M0008 Validate ML Model, AML.M0003 Model Hardening, AML.M0015 Adversarial Input Detection
- OWASP Top 10 for LLM Applications: LLM04 Data and Model Poisoning

## MIT AI Risk Repository subdomains addressed

7.3, 1.3, 2.2, 1.1

## Provenance

- **Record page**: https://aipolicytracker.org/controls/accuracy-robustness-security-testing
- **Official source**: none recorded — this record is incomplete, see https://aipolicytracker.org/gaps
- **Review status**: pending review
- **Confidence**: high
- **Facts last confirmed**: never confirmed against the official source
- **Retrieved**: 2026-09-24
- **Licence**: https://creativecommons.org/licenses/by/4.0/

> This record is a structured summary with a link to the official text. It is not legal advice. Open the official source before relying on any date or duty. How current each record type must be is published at https://aipolicytracker.org/verification; what a record must carry at all is published at https://aipolicytracker.org/coverage.
