Realistische und anonymisierte Testdaten mit KI
»Synthetische Daten und Testdaten aus Echtdaten
Synthetische Daten ≠ Testdaten auf Basis anonymisierter Echtdaten.
Mein Prozess
- Testziel, Fachmodell und erwartetes Verhalten festlegen.
- Zwei Wege trennen: Echtdaten anonymisieren und prüfen; synthetische Fälle aus Regeln oder einem Modell erzeugen.
- Beide Bestände gezielt kombinieren, fachlich prüfen und als versionierte Testfälle mit Soll-Ergebnis sichern.
Worauf achten?
- Schema, Pflichtfelder, Schlüssel und Beziehungen; Grenzwerte, ungültige Fälle und seltene Konstellationen.
- Plausible Verteilungen, Abhängigkeiten und zeitliche Abläufe; Untergruppen und Verzerrungen prüfen.
- Generator, Parameter, Seed und erzeugte Daten sichern; Soll-Ergebnisse unabhängig herleiten. Synthetisch bedeutet nicht automatisch anonym.
Grenzen
- Das Modell bildet nur bekannte Regeln ab; plausible Daten beweisen keine fachliche Richtigkeit.
- Injection-Varianten und Kombinationen sind praktisch unerschöpflich. Risikoklassen, Grenzfälle und gezieltes Fuzzing priorisieren.
- Mehr Varianten beweisen keine Sicherheit. Invarianten, Codeprüfung und sichere Verarbeitung, etwa parametrisierte SQL-Abfragen, ergänzen die Tests.