Peut-on vraiment détecter les textes générés par IA ?
Il reste difficile, malgré l’apparition de logiciels de détection, de savoir si un texte a été généré par une intelligence artificielle ou par un humain. Shutterstock (no reuse) L’ESSENTIEL Il est très difficile, aujourd’hui, de savoir si un texte est produit par un humain ou par une intelligence artificielle, malgré des avancées législatives qui vont dans le sens d’un affichage de son usage.
Détecter si un texte est généré par une intelligence artificielle (IA) ou écrit par un humain est aujourd’hui extrêmement complexe. Malgré des avancées législatives comme l’IA Act européen, qui impose un affichage des contenus générés par IA, la majorité des utilisateurs considère par défaut ces textes comme authentiques. Les textes produits par IA ne sont ni clairement vrais ni clairement faux : ils échappent à toute catégorisation traditionnelle. Les entreprises qui les créent, comme les éditeurs de chatbots, se contentent de mentions vagues comme « Peut comporter des erreurs », sans garantir leur fiabilité. Par exemple, en 2024, la romancière japonaise Rie Kudan a révélé avoir utilisé l’IA pour 5% de son roman primé, suscitant des débats sur l’authenticité des œuvres littéraires.
L’édition fait face à un défi majeur avec l’émergence des textes générés par IA. Les éditeurs doivent désormais évaluer la part d’IA dans les manuscrits soumis, notamment après des scandales révélant des fraudes. Les grands éditeurs scientifiques anglo-saxons acceptent l’usage de l’IA dans les manuscrits, à condition qu’il soit mentionné dans les remerciements, comme s’il s’agissait d’un collègue. Cette approche soulève des questions sur la définition de l’authenticité et la crédibilité des auteurs. Par exemple, en 2026, l’auteur Jamir Nazir a dû rendre un prix littéraire après avoir été accusé d’avoir utilisé l’IA, avant de récupérer son prix et de voir son montant doublé en dédommagement.
Les IA sont entraînées à partir de données personnelles et de textes sous droits, souvent sans compensation pour les auteurs originaux. Ce processus, qualifié de « pillage initial » ou de fair use (« usage équitable »), a été négocié discrètement par certains éditeurs, mais reste largement non résolu. Les éditeurs tentent de rassurer leur public en publiant des recommandations pour les auteurs, mais la question de la rémunération des créateurs dont les œuvres ont servi à entraîner les IA reste entière. Par exemple, en mars 2026, des négociations ont eu lieu pour obliger les géants de l’IA à respecter le droit d’auteur.
Des logiciels spécialisés, comme Pangram ou Justdone, prétendent détecter les textes générés par IA en analysant des indices stylistiques. Cependant, leur fiabilité est très discutable. Par exemple, le texte L’Expérience humaine de Thierry Crouzet a été jugé à 61% généré par IA par un outil, mais ce pourcentage varie selon le logiciel utilisé. Ces détecteurs reposent sur des algorithmes opaques et produisent des résultats contradictoires, avec des taux élevés de faux positifs et de faux négatifs. En 2026, des universités comme Yale, Berkeley ou le MIT ont interdit leur usage, craignant des injustices et des procès.
L’impossibilité de détecter clairement les textes générés par IA a donné naissance à une nouvelle industrie économique, que l’on peut appeler « l’industrie du soupçon ». Des entreprises comme Pangram ou Grammarly monétisent cette confusion en proposant des outils de détection ou d’« humanisation » des textes. Par exemple, Justdone promet de « préserver l’authenticité » des écrits en identifiant les contenus générés par IA avec une prétendue précision de 99,8%. Pourtant, ces outils utilisent des technologies duales et contribuent à entretenir la méfiance généralisée envers tous les textes, qu’ils soient humains ou artificiels.
Les humains et les IA s’influencent mutuellement dans leur manière d’écrire, créant un phénomène appelé code-switching (alternance codique) pour les humains et « alignement » pour les IA. Les IA sont programmées pour imiter le langage humain, tandis que les humains adoptent progressivement des tournures typiques des chatbots. Par exemple, une étude a montré que les publications académiques sont de plus en plus influencées par le langage des IA génératives. Cette convergence rend la distinction entre textes humains et artificiels encore plus difficile, notamment en raison de la monotonie syntaxique, de la prévisibilité des phrases et de l’absence de mots rares dans les textes générés par IA.
L’Union européenne a adopté l’IA Act, entré en vigueur le 2 août 2026, qui impose aux producteurs de contenus générés par IA d’afficher des métadonnées ou des mentions explicites pour en garantir la transparence. Cependant, cette solution présente des limites : les métadonnées ne sont lisibles que par certains logiciels et restent inaccessibles au grand public. De plus, les résumés générés par IA, souvent mis en avant par les moteurs de recherche comme Google, échappent à ce marquage. Par exemple, dès début 2025, 83% du public considérait que l’affichage des résumés IA en tête des résultats suffisait à les valider. La suspicion généralisée envers tous les textes persiste donc malgré ces mesures.
La question de l’authenticité des textes est centrale, car un texte artificiel ne peut être interprété de manière fiable ni porter de responsabilité éthique. Friedrich Schlegel, dans sa Philosophie de la philologie (1797), soulignait déjà l’inutilité d’interpréter des textes inauthentiques. Aujourd’hui, les textes générés par IA échappent à toute garantie de vérité ou de fiabilité, car ils peuvent mélanger des éléments vrais et faux sans que cela soit détectable. Par exemple, un texte composite mêlant des passages humains et artificiels devient suspect, car le doute l’emporte toujours. La crédulité généralisée envers les contenus générés par IA s’installe, malgré les efforts réglementaires pour rétablir la transparence.
Des études linguistiques comparatives, comme celles de Przystalski et coll. ou Terčon et Dobrovoljc, ont identifié des traits stylistiques récurrents dans les textes générés par IA. Ces textes se caractérisent par une monotonie syntaxique, une prévisibilité des phrases, une rareté des mots rares, une ponctuation stéréotypée et une expressivité limitée. Par exemple, les textes artificiels utilisent davantage de nominalisations (mots transformés en noms) et de déterminants, tandis que les adjectifs et adverbes sont moins fréquents. Ces travaux, menés principalement sur l’anglais mais applicables à d’autres langues, confirment l’objectivité des différences stylistiques entre textes humains et artificiels, malgré la diversité des méthodes utilisées.

