N. 1056 - Generazione e validazione di dati sintetici per panel non bilanciati: evidenze dai microdati sulle imprese italiane
Il lavoro esamina le metodologie per la generazione di dati sintetici, ossia archivi artificiali che riproducono le proprietà statistiche dei dati originali riducendo allo stesso tempo il rischio di re-identificazione, cioè la possibilità che i dati siano ricollegati ai soggetti cui appartengono, violandone la riservatezza. I due approcci più diffusi in letteratura, la generazione sequenziale e le copule gaussiane, vengono applicati ai microdati dell'Indagine sulle imprese industriali e dei servizi della Banca d'Italia.
Entrambi gli approcci riproducono in modo accurato la struttura multivariata e le dipendenze temporali dei dati originali. Una maggiore fedeltà dei dati sintetici a quelli originali è associata a un aumento del rischio di re-identificazione, mitigabile introducendo perturbazioni casuali nei dati sintetici che determinano una perdita contenuta di capacità informativa. Tali tecniche risultano pertanto promettenti per coniugare la diffusione dei microdati per finalità di ricerca e la tutela della riservatezza statistica.
Testo della pubblicazione
-
17 settembre 2026
(testo in inglese)
Instagram
YouTube
X - Banca d’Italia
Linkedin