N. 1056 - Generazione e validazione di dati sintetici per panel non bilanciati: evidenze dai microdati sulle imprese italiane

Questioni di Economia e Finanza (Occasional Papers)
di Marco Langiulli, Alessandro Moro, Mattia Orzincolo e Daniele Piras
Settembre 2026
Go to the english version Cerca nel sito

Il lavoro esamina le metodologie per la generazione di dati sintetici, ossia archivi artificiali che riproducono le proprietà statistiche dei dati originali riducendo allo stesso tempo il rischio di re-identificazione, cioè la possibilità che i dati siano ricollegati ai soggetti cui appartengono, violandone la riservatezza. I due approcci più diffusi in letteratura, la generazione sequenziale e le copule gaussiane, vengono applicati ai microdati dell'Indagine sulle imprese industriali e dei servizi della Banca d'Italia.

Entrambi gli approcci riproducono in modo accurato la struttura multivariata e le dipendenze temporali dei dati originali. Una maggiore fedeltà dei dati sintetici a quelli originali è associata a un aumento del rischio di re-identificazione, mitigabile introducendo perturbazioni casuali nei dati sintetici che determinano una perdita contenuta di capacità informativa. Tali tecniche risultano pertanto promettenti per coniugare la diffusione dei microdati per finalità di ricerca e la tutela della riservatezza statistica.

Sezione di approfondimento