Que sont les données synthétiques ?
Les données synthétiques sont des données générées artificiellement qui reproduisent les propriétés statistiques d'un jeu de données réel, sans contenir les informations d'origine sur des personnes réelles.
Un modèle apprend la structure et les corrélations d'un jeu réel, puis produit de nouveaux enregistrements fictifs au comportement statistique proche. Ces données servent à entraîner des algorithmes, tester des logiciels ou partager un échantillon sans exposer de personnes existantes. La CNIL les cite parmi les approches qui renforcent la confidentialité, à condition que la génération n'autorise pas de ré-identification.
Quand la synthèse est bien conçue et coupe tout lien avec les individus sources, le résultat peut sortir du champ du RGPD. Une génération imparfaite qui laisse fuiter des enregistrements réels reste, elle, un traitement de données personnelles.
Voir aussi
- Anonymisation des données
- Confidentialité différentielle
- Technologies renforçant la confidentialité (PETs)
- Guide RGPD
ConsentLab clarifie quelles données réelles vos traceurs collectent vraiment. Lancez un scan gratuit.