Synthetische data genereren zonder training: nieuwe pipeline bewaart datastructuren perfect
Volgens het abstract op arXiv presenteren onderzoekers GENSCRIPT, een pipeline voor synthetische data die volledig zonder modeltraining werkt. Het systeem verwerkt een statistisch profiel van de brondata via een taalmodel om veldsemantiek en relatiebeperkingen vast te stellen, waarna een agent een auditable sampler compileert. In benchmarks bouwt de methode binnen twee minuten een generator en produceert 50.000 rijen binnen zes seconden, waarbij het marginaal even goed scoort als leidende methoden en databasestructuren perfect behoudt. Op een smart-building dataset levert het conditionele tijdreeksen op die dichter bij de werkelijke verdeling liggen dan twee basismethoden. Voor Nederlandse facility-afdelingen biedt dit een transparante manier om testdata voor CAFM-systemen en IoT-netwerken te genereren zonder dat zware trainingsprocessen of directe toegang tot gevoelige brondata nodig zijn.