NapseflowNapseflow
Numérique

Généalogie des modèles d’IA ouverts : la CNIL propose un outil pour s’y retrouver

Next.ink · mis à jour il y a 17 j

Hugging Face déborde de modèles d’IA générative. Mais il est facile de se perdre dans les méandres de tous les modèles ouverts.

Défis des modèles IA ouverts

Les modèles d’intelligence artificielle (IA) générative ouverts, comme ceux hébergés sur la plateforme Hugging Face, posent un problème de lisibilité. Avec plus de 2 millions de modèles publiés, il est difficile pour un utilisateur de s’y retrouver et d’identifier les dérivés adaptés à ses besoins. Souvent, les modèles d’origine ne sont pas directement exploitables, car ils nécessitent des adaptations spécifiques, réalisées par des techniques comme l’inférence. Par exemple, un modèle peut être modifié pour répondre à un cas d’usage particulier, comme la génération de texte à partir d’images et de texte. Cette complexité rend le choix d’un modèle adapté particulièrement ardu pour les non-experts.

Solution de la CNIL

Pour répondre à ce défi, le LINC (Laboratoire d’Innovation Numérique de la CNIL), une entité de la Commission Nationale de l’Informatique et des Libertés (CNIL), a développé un outil nommé Genmod (ou Généalogie des modèles). Présenté en 2025, cet outil permet de visualiser les liens entre les modèles d’IA ouverts et leurs dérivés, facilitant ainsi leur traçabilité. Après une première version peu intuitive, une mise à jour a été déployée pour améliorer son accessibilité. Genmod s’adresse notamment aux chercheurs, développeurs et entreprises souhaitant comprendre l’évolution des modèles ou identifier ceux qui pourraient régurgiter des données sensibles, un enjeu crucial dans le cadre du RGPD (Règlement Général sur la Protection des Données).

Fonctionnement de Genmod

Genmod permet d’explorer la descendance d’un modèle d’IA, c’est-à-dire tous les modèles dérivés qui en découlent. Par exemple, en recherchant le modèle Kimi K3 de Moonshot AI, l’outil affiche ses dérivés, comme unsloth/Kimi-K3-GGUF, spécialisé pour des tâches Image-Text-to-Text grâce à la quantisation. Cette technique réduit la précision des poids du modèle original pour diminuer son empreinte mémoire, ce qui le rend plus accessible pour une utilisation locale. L’outil propose également une recherche experte pour affiner les critères de sélection, comme le type de dérivation ou la méthode utilisée. Pour effectuer une recherche, il est conseillé de connaître d’abord le nom du dépôt racine, par exemple moonshotai/ pour Kimi K3.

Traçabilité des jeux de données

Au-delà des modèles, Genmod permet de retracer l’utilisation des jeux de données (ou datasets) dans la création des modèles d’IA. Par exemple, il est possible de retrouver tous les modèles ayant utilisé The Cauldron, un jeu de données spécifique. Cette fonctionnalité répond à un enjeu majeur : identifier les modèles susceptibles de régurgiter des données personnelles ou protégées, comme le souligne un exemple cité par les chercheurs du LINC. Dans ce cas, si un individu découvre que ses données personnelles ont été utilisées pour entraîner un modèle, Genmod aide à identifier les autres modèles ayant potentiellement mémorisé ces mêmes données. Cet outil s’inscrit dans un contexte où les modèles d’IA sont soumis au RGPD, renforçant ainsi la transparence et la conformité.

Ce que ça pourrait changer

Genmod trouve des applications concrètes dans plusieurs domaines. Par exemple, il peut être utilisé pour vérifier si un modèle est susceptible de violer des droits d’auteur, comme dans le litige opposant le *New York Times* à *OpenAI*. Il permet aussi aux entreprises de s’assurer que leurs modèles respectent les réglementations en vigueur, notamment en matière de protection des données. Enfin, pour les chercheurs et développeurs, l’outil offre une visibilité sur l’évolution des modèles, facilitant ainsi l’innovation tout en garantissant une meilleure maîtrise des risques associés à l’utilisation de l’IA.

Sujets complémentaires

Ce contenu a été généré par intelligence artificielle à partir de l'article source. Il peut contenir des erreurs ou imprécisions.