La traçabilité des données d'entraînement sous le règlement européen sur l'IA
La traçabilité est la réponse documentée à deux questions : d'où viennent ces données d'entraînement, et quel droit avez-vous de les utiliser ? Sous le règlement européen sur l'IA, dont les obligations entrent en vigueur par étapes depuis 2025, les fournisseurs d'IA doivent pouvoir répondre aux deux, par écrit.
- L'obligation
- Un résumé suffisamment détaillé des contenus utilisés pour l'entraînement
- Données collectées
- Aucune chaîne de titres, donc aucun résumé que l'on puisse assumer
- Chez TGDC
- Vérification des droits par corpus, anonymisation contrôlée par lot
Ce qu'attend le règlement
Les fournisseurs de modèles d'IA à usage général doivent tenir une documentation technique sur leurs données d'entraînement et publier un résumé suffisamment détaillé des contenus utilisés, accompagné d'une politique de respect du droit d'auteur de l'Union, y compris des réserves de droits exprimées par les titulaires. Les fournisseurs de systèmes d'IA à haut risque sont soumis à des obligations de gouvernance des données sur les jeux de données d'entraînement. Toutes ces obligations pointent dans la même direction. Une collecte web ne peut pas fournir ce qu'elles demandent, car elle consigne ce qui a été pris et non ce qui a été permis. Régulateurs, clients et juridictions attendent de plus en plus une chaîne documentée reliant chaque jeu de données à une autorisation.
Collecté contre licencié
- Les données collectées n'ont pas de chaîne de titres. Leur statut au regard du droit d'auteur est contesté, les oppositions sont difficiles à honorer rétroactivement, et leur contenu se trouve, par construction, déjà dans tous les modèles concurrents.
- Les données licenciées arrivent avec une réponse écrite à la question de la provenance : à qui elles appartenaient, qui en a autorisé l'usage, ce qui a été payé et quelles conditions s'y attachent. La documentation que la réglementation réclame fait simplement partie de la livraison.
Ce que « droits vérifiés » signifie chez TGDC
Chaque corpus livré par The General Data Company porte sa provenance avec lui :
- Une chaîne de titres écrite, depuis l'autorisation à la source jusqu'à la licence que signe l'acheteur. À la source, c'est le mandat d'un administrateur judiciaire, un enregistrement de flux de travail consenti, ou le consentement d'un particulier dans l'application.
- Une vérification des droits par corpus portant sur la propriété, le matériel de tiers et les limites légales, avant toute livraison.
- Des rapports d'anonymisation par lot attestant que les entités nommées, les données personnelles et les identifiants commerciaux ont été supprimés ou pseudonymisés, et vérifiés.
Un laboratoire qui entraîne sur un tel corpus peut inscrire dans sa documentation technique une histoire d'approvisionnement documentée, plutôt que la description d'une collecte. Lorsqu'un auditeur ou un client demande plus tard d'où vient un jeu de données, la réponse est une chaîne de titres écrite et non une supposition. Voir licences de données pour le détail produit, ou les fonds de procédures collectives pour le fonctionnement du canal fondateur.
Une courte liste de contrôle pour les équipes IA
- Pouvez-vous nommer la source juridique de chaque jeu de données d'entraînement : une licence, un mandat, un consentement ?
- L'histoire de l'approvisionnement résisterait-elle à être inscrite dans la documentation technique de votre modèle ?
- Vos jeux de données sont-ils livrés avec des preuves d'anonymisation ou de traitement des données personnelles, par lot et non sous forme de promesse du fournisseur ?
- Si un titulaire de droits ou un régulateur pose la question demain, combien de temps prendrait la réponse ?
Aucune de ces questions ne devient plus simple une fois l'entraînement terminé. Si une réponse met mal à l'aise, c'est précisément la lacune que comble une licence à droits vérifiés : hello@thegeneraldata.com.