NapseflowNapseflow
Droit

L'arrêt qui n'existait pas : de la relecture vers la vérification, le vrai sujet que l'IA générative pose aux cabinets.

Village Justice · mis à jour il y a 11 j

Une jurisprudence inventée par un modèle de langage ne se repère pas à la lecture : elle porte un numéro de pourvoi plausible, une date plausible, une chambre plausible. Elle ne se trahit qu'au moment où l'on interroge la base officielle.

Hallucinations trompeuses

L’article introduit le concept d’hallucination dans le contexte de l’intelligence artificielle générative, un terme qui désigne une information fausse mais présentée de manière convaincante. Contrairement à une erreur évidente, ces hallucinations imitent parfaitement la structure et le style des références juridiques, comme une citation de jurisprudence (exemple : « Cass. civ. 1re, 14 mars 2019, n° 17-24.892 »). Aucun élément ne semble faux à première vue : la chambre (Cass. civ. 1re pour la première chambre civile), la date et le numéro de pourvoi respectent les conventions. Pourtant, cette référence n’existe dans aucune base de données officielle. L’affaire Mata c. Avianca (juin 2023) illustre ce risque : deux avocats américains ont été sanctionnés pour avoir utilisé des décisions entièrement inventées par ChatGPT dans un mémoire judiciaire. Cette pratique, désormais répandue, pourrait toucher la France avec l’adoption croissante de l’IA dans la rédaction d’actes juridiques.

Obligation légale de contrôle

En droit français, il n’existe pas de texte spécifique encadrant l’usage de l’IA générative par les avocats. Cependant, les principes fondamentaux de la profession (compétence, diligence, prudence) s’appliquent à tout contenu produit, quel que soit l’outil utilisé. Un avocat est responsable de l’exactitude des documents qu’il signe, même si une partie a été générée par une machine. Cette responsabilité s’étend au client : l’obligation de moyens renforcée en conseil juridique ne disparaît pas parce qu’un outil automatisé a contribué à la rédaction. Une citation inventée, si elle est découverte par la partie adverse, peut discréditer l’intégralité d’un mémoire, même si 90 % des arguments sont valides. Le risque n’est pas seulement disciplinaire, mais aussi professionnel et financier.

Relecture vs vérification

Les cabinets juridiques réagissent souvent en renforçant la relecture des textes, une pratique utile mais insuffisante. La relecture vérifie la cohérence interne d’un document, or l’IA générative excelle dans ce domaine : elle produit des textes logiques et bien structurés. Pour détecter une hallucination, il faut une vérification externe au texte, en interrogeant directement les sources officielles. En France, cela signifie utiliser des bases comme Judilibre (pour la jurisprudence de la Cour de cassation) ou Légifrance (pour les textes de loi). Ces bases sont accessibles par programme, ce qui permet d’automatiser la vérification. Cependant, un outil de vérification ne doit pas demander au modèle de confirmer la validité d’une affirmation. Il doit extraire les citations et les confronter aux sources, laissant à ces dernières le soin de trancher. Demander au modèle de juger revient à remplacer une hallucination par une autre, plus confiante.

Échelle de fiabilité qualitative

Les scores de fiabilité en pourcentage (exemple : 87 % de confiance) sont peu utiles pour un avocat, car ils ne précisent pas si un document peut être déposé. L’article propose une échelle qualitative à quatre niveaux, basée sur la nature de la preuve : Élevé (une source officielle confirme l’affirmation, via Judilibre ou Légifrance), Moyen (des sources indépendantes concordent, sans autorité), Faible (l’affirmation est contredite ou introuvable), Invérifiable (aucune source n’a pu être consultée). Deux règles absolues doivent guider cette échelle : le niveau global d’un document est déterminé par la citation la moins fiable, jamais par une moyenne, et une panne d’accès à une source doit toujours aboutir à un classement Invérifiable, jamais à Faible. Cela évite de normaliser l’ignorance des alertes.

Piège des faux positifs

Un outil de vérification doit être testé sur des données réelles pour être fiable. Un corpus de tests synthétiques, généré artificiellement, ne permet pas de détecter les défauts, car ses références sont produites par le même code que l’on prétend tester. Lors d’un test sur 93 arrêts authentiques de la Cour de cassation, couvrant les huit chambres, l’outil a généré 93 fausses alertes sur des citations correctes. Par exemple, toute référence rédigée « Cass. com. » était signalée comme incohérente, car l’intitulé officiel de la chambre commerciale est « Chambre commerciale, financière et économique ». Un outil qui produit trop de faux positifs sera rapidement abandonné par les avocats, car il mine leur confiance dans le système.

Actions immédiates pour les cabinets

Les cabinets peuvent mettre en place quatre mesures dès maintenant pour limiter les risques liés à l’IA générative. 1. Séparer rédaction et vérification : l’outil ayant produit le texte ne doit pas être celui qui le contrôle, une erreur commise dans l’affaire Mata c. Avianca. 2. Traiter toute référence comme non vérifiée par défaut : numéro de pourvoi, date, chambre ou article de code doivent être confirmés par une source officielle, même s’ils semblent familiers. 3. Conserver les preuves : en cas de contestation, ce qui protège est l’extrait de la décision consultée et son horodatage, pas un score de fiabilité généré par un logiciel. 4. Formaliser la procédure interne : définir qui vérifie, à quel stade, et quelle action prendre face à une référence classée Invérifiable avant une échéance de dépôt. Sans réponse écrite à cette dernière question, le calendrier judiciaire tranchera à la place du cabinet.

Ce que ça pourrait changer

L’IA générative offre un gain de temps considérable aux cabinets juridiques, et son usage est légitime. Cependant, elle déplace le point de contrôle de la fiabilité des documents. Pendant deux siècles, la qualité d’un écrit judiciaire reposait sur l’attention du rédacteur. Aujourd’hui, elle dépend de plus en plus de la capacité à interroger les sources au bon moment. La question clé à poser aux éditeurs proposant des outils d’IA pour le droit n’est pas *« Quel modèle utilisez-vous ? »* ni *« Quel est votre taux d’exactitude ? »*, mais *« Qu’est-ce qui, dans votre système, a le droit de dire qu’une affirmation est vraie ? »*. Si la réponse est *« le modèle »*, le problème n’a pas été résolu : il a simplement été déplacé vers un niveau où il est plus difficile à détecter. La responsabilité reste humaine, même si l’outil est automatisé.

Sujets complémentaires

Ce contenu a été généré par intelligence artificielle à partir de l'article source. Il peut contenir des erreurs ou imprécisions.