Realistische und anonymisierte Testdaten mit KI

Synthetische Daten und Testdaten aus Echtdaten

Synthetische Daten ≠ Testdaten auf Basis anonymisierter Echtdaten.

Mein Prozess

  • Testziel, Fachmodell und erwartetes Verhalten festlegen.
  • Zwei Wege trennen: Echtdaten anonymisieren und prüfen; synthetische Fälle aus Regeln oder einem Modell erzeugen.
  • Beide Bestände gezielt kombinieren, fachlich prüfen und als versionierte Testfälle mit Soll-Ergebnis sichern.

Worauf achten?

  • Schema, Pflichtfelder, Schlüssel und Beziehungen; Grenzwerte, ungültige Fälle und seltene Konstellationen.
  • Plausible Verteilungen, Abhängigkeiten und zeitliche Abläufe; Untergruppen und Verzerrungen prüfen.
  • Generator, Parameter, Seed und erzeugte Daten sichern; Soll-Ergebnisse unabhängig herleiten. Synthetisch bedeutet nicht automatisch anonym.

Grenzen

  • Das Modell bildet nur bekannte Regeln ab; plausible Daten beweisen keine fachliche Richtigkeit.
  • Injection-Varianten und Kombinationen sind praktisch unerschöpflich. Risikoklassen, Grenzfälle und gezieltes Fuzzing priorisieren.
  • Mehr Varianten beweisen keine Sicherheit. Invarianten, Codeprüfung und sichere Verarbeitung, etwa parametrisierte SQL-Abfragen, ergänzen die Tests.