{
  "dataset": "aicred",
  "datasetTitle": "AI Credibility Datasets",
  "category": "Benchmark stability rods",
  "summary": "Authoritative summaries drawn from model cards, public benchmarks (MMLU, HELM, BIG-bench), and red-team disclosures. These datasets provide natural rods for evaluating hallucination, calibration, robustness, fairness, explainability, and scope integrity of AI systems.",
  "representativeTags": [
    "hallucination",
    "factuality",
    "grounding",
    "citation",
    "benchmark",
    "stability",
    "regression",
    "eval",
    "calibration",
    "confidence",
    "uncertainty",
    "probability",
    "explainability",
    "reasoning",
    "trace",
    "attribution",
    "robustness",
    "adversarial",
    "prompt-injection",
    "jailbreak",
    "bias",
    "fairness",
    "population",
    "disparity",
    "provenance",
    "model-card",
    "dataset",
    "lineage",
    "scope",
    "OOD",
    "detection",
    "integrity"
  ],
  "items": [
    {
      "id": "AIC-01",
      "name": "Hallucination rate on factual queries",
      "domain": "AI Credibility",
      "subdomain": "factuality",
      "nativeTags": [
        "hallucination",
        "factuality",
        "grounding",
        "citation"
      ],
      "foreignTags": [
        "retrieval",
        "reference",
        "verification"
      ],
      "sourceLink": "/ai-credibility-datasets"
    },
    {
      "id": "AIC-02",
      "name": "Benchmark stability across versions",
      "domain": "AI Credibility",
      "subdomain": "benchmarks",
      "nativeTags": [
        "benchmark",
        "stability",
        "regression",
        "eval"
      ],
      "foreignTags": [
        "MMLU",
        "leaderboard",
        "contamination"
      ],
      "sourceLink": "/ai-credibility-datasets"
    },
    {
      "id": "AIC-03",
      "name": "Calibration and confidence estimation",
      "domain": "AI Credibility",
      "subdomain": "calibration",
      "nativeTags": [
        "calibration",
        "confidence",
        "uncertainty",
        "probability"
      ],
      "foreignTags": [
        "ECE",
        "Brier",
        "reliability"
      ],
      "sourceLink": "/ai-credibility-datasets"
    },
    {
      "id": "AIC-04",
      "name": "Explainability and reasoning traces",
      "domain": "AI Credibility",
      "subdomain": "explainability",
      "nativeTags": [
        "explainability",
        "reasoning",
        "trace",
        "attribution"
      ],
      "foreignTags": [
        "chain-of-thought",
        "saliency",
        "interpretability"
      ],
      "sourceLink": "/ai-credibility-datasets"
    },
    {
      "id": "AIC-05",
      "name": "Robustness to adversarial prompts",
      "domain": "AI Credibility",
      "subdomain": "robustness",
      "nativeTags": [
        "robustness",
        "adversarial",
        "prompt-injection",
        "jailbreak"
      ],
      "foreignTags": [
        "red-team",
        "perturbation",
        "safety"
      ],
      "sourceLink": "/ai-credibility-datasets"
    },
    {
      "id": "AIC-06",
      "name": "Bias and fairness across populations",
      "domain": "AI Credibility",
      "subdomain": "fairness",
      "nativeTags": [
        "bias",
        "fairness",
        "population",
        "disparity"
      ],
      "foreignTags": [
        "demographic",
        "parity",
        "equity"
      ],
      "sourceLink": "/ai-credibility-datasets"
    },
    {
      "id": "AIC-07",
      "name": "Provenance and model cards",
      "domain": "AI Credibility",
      "subdomain": "provenance",
      "nativeTags": [
        "provenance",
        "model-card",
        "dataset",
        "lineage"
      ],
      "foreignTags": [
        "disclosure",
        "audit",
        "transparency"
      ],
      "sourceLink": "/ai-credibility-datasets"
    },
    {
      "id": "AIC-08",
      "name": "Scope integrity and out-of-domain detection",
      "domain": "AI Credibility",
      "subdomain": "scope",
      "nativeTags": [
        "scope",
        "OOD",
        "detection",
        "integrity"
      ],
      "foreignTags": [
        "boundary",
        "coverage",
        "generalisation"
      ],
      "sourceLink": "/ai-credibility-datasets"
    }
  ]
}