OpenAI accusé d’avoir téléchargé des milliers de livres piratés pour entraîner ChatGPT
Les auteurs continuent de batailler contre l'IA..
Plusieurs auteurs américains, dont George R. R. Martin, ont porté plainte contre OpenAI devant un tribunal fédéral de New York. Ils accusent l'entreprise d'avoir utilisé des milliers d'œuvres littéraires téléchargées illégalement pour entraîner son modèle d'intelligence artificielle, ChatGPT. Les œuvres en question proviendraient du site pirate Library Genesis (surnommé LibGen), connu pour distribuer des livres protégés par le droit d'auteur sans autorisation. OpenAI aurait même renommé les compilations de livres piratés en Books1 et Books2 pour masquer leur origine illégale, avant de les supprimer pour éviter des poursuites. Ces accusations s'ajoutent à des reproches similaires formulés dès 2023, où les auteurs dénonçaient déjà l'utilisation non autorisée de leurs œuvres pour former ChatGPT.
Les auteurs s'appuient sur des déclarations d'un ancien employé d'OpenAI, chargé de la qualité rédactionnelle des modèles GPT. Celui-ci a révélé sur le réseau social X (ex-Twitter) qu'une de ses missions consistait à faire écrire par l'IA les deux derniers tomes de la saga Game of Thrones, celle de George R. R. Martin. Ces témoignages, combinés à des preuves techniques, renforcent les accusations de téléchargement illégal. OpenAI, de son côté, n'a pas encore répondu publiquement à ces allégations, mais a déjà évoqué la notion de fair use (ou usage raisonnable en français) pour justifier son utilisation des œuvres protégées.
Le fair use est une exception au droit d'auteur américain qui permet d'utiliser une œuvre protégée sans l'autorisation de son auteur, sous certaines conditions. OpenAI défend l'idée que l'entraînement d'une IA relève de cette exception, car les œuvres ne sont pas simplement reproduites, mais transformées pour générer de nouveaux contenus. Cependant, les auteurs contestent cette interprétation, soulignant que l'origine illégale des œuvres utilisées (téléchargées via un site pirate) constitue une violation distincte du droit d'auteur. En juin 2025, un juge américain a statué que l'utilisation de livres acquis légalement pour entraîner une IA pouvait relever du fair use, mais a clairement indiqué que le téléchargement de livres piratés était illégal. Ce point est central dans le litige opposant OpenAI aux auteurs.
Cette affaire soulève des questions majeures sur l'éthique et la légalité de l'entraînement des modèles d'IA. Si OpenAI est condamné, cela pourrait établir un précédent juridique lourd de conséquences pour l'industrie, forçant les entreprises à revoir leurs méthodes de collecte de données. Les auteurs, quant à eux, cherchent à distinguer deux problèmes : l'utilisation des œuvres pour entraîner une IA et la manière dont ces œuvres ont été obtenues. Leur objectif est d'obtenir réparation pour l'utilisation non autorisée de leurs créations, tout en clarifiant les limites du *fair use* dans le contexte de l'intelligence artificielle. L'issue de ce procès pourrait influencer les futures pratiques des géants de la tech dans le domaine de l'IA.

