The Authors Guild et d’autres auteurs ayant saisi la justice demandent à un juge fédéral d’examiner séparément la manière dont OpenAI a obtenu des livres protégés par le droit d’auteur et l’usage qu’elle en a fait par la suite. Dans leurs documents rendus publics le 17 septembre, ils décrivent des échanges internes au sujet de Library Genesis, la source des collections de livres utilisées pour l’entraînement des modèles. Ils soutiennent que le téléchargement, l’entraînement et le transfert de copies nécessitent chacun une analyse distincte au regard du droit d’auteur.

OpenAI conteste cette approche. Dans son propre mémoire révisé, déposé le même jour, elle soutient que l’acquisition des livres et l’entraînement des modèles poursuivaient un seul objectif transformateur, protégé par le fair use. Les demandes des parties sont toujours devant le juge Sidney H. Stein, à New York. Une ordonnance du 24 septembre a prolongé le calendrier des mémoires ; elle n’a pas tranché le litige sur le droit d’auteur. (Mémoire des demandeurs, mémoire d’OpenAI, ordonnance fixant le calendrier)

Le changement majeur

  • Ce qui a changé : Les auteurs peuvent désormais renvoyer les lecteurs à une présentation publique plus complète des décisions d’acquisition de livres qu’ils contestent. Les documents déposés en septembre dévoilent davantage d’éléments du litige sur l’origine des livres d’entraînement et la manière dont les entreprises les ont traités.
  • Pourquoi c’est important : Pour les auteurs qui demandent réparation comme pour les développeurs qui défendent leur usage des livres, le traitement juridique de l’acquisition compte autant que celui de l’entraînement. Les parties ne s’accordent pas sur la question de savoir si l’objectif d’un modèle peut justifier les copies antérieures.
  • À surveiller : Les prochains mémoires contesteront à la fois cet argument juridique et les éléments relatifs au préjudice subi par les auteurs. Les preuves que le juge admettra et les usages qu’il examinera séparément détermineront les demandes qu’il pourra trancher sans procès.

Books1 et Books2 dans le dossier public

Les documents du 17 septembre sont des versions publiques plus complètes des mémoires sollicitant un jugement sommaire. L’ordonnance de mise sous scellés du 3 septembre imposait aux parties de redéposer leurs mémoires et exposés des faits en laissant visibles les éléments pour lesquels aucune partie ni aucun tiers ne demandait le maintien du secret. Certains passages restent caviardés.

La publication de l’Authors Guild du 21 septembre a attiré l’attention sur deux de ces documents : le mémoire juridique des demandeurs, dossier 1982, et leur exposé des faits corrigé, dossier 1987. Cette publication présente la version de l’Authors Guild en tant que partie demanderesse.

Dans le dossier 1987, les auteurs citent des témoignages et des messages internes sur les noms Books1 et Books2 donnés aux jeux de données d’entraînement. Au paragraphe 271, l’ancien employé d’OpenAI Ben Mann est cité : il affirme que les deux jeux étaient issus de LibGen. Au paragraphe 275, le mémoire cite son explication de la formulation d’un projet d’article : « it’s deliberately vague since it’s libgen. »

Au paragraphe 749 du même mémoire, les auteurs reproduisent un message de mai 2020 de Jack Clark, alors directeur des politiques chez OpenAI, qui anticipait une concurrence avec les auteurs de romans de genre. Les demandeurs le présentent comme la preuve d’une préoccupation interne quant au risque de substitution. Ce message ne mesure pas les ventes de livres qui auraient été perdues par la suite et n’établit pas la position du tribunal sur le préjudice causé au marché.

Le titre du document contient les mots « faits matériels non contestés ». Il s’agit du mémoire des demandeurs à l’appui de leur demande de jugement sommaire. En vertu de la règle locale civile 56.1, la partie adverse répond aux faits numérotés par des admissions ou des dénégations accompagnées d’éléments de preuve. Le titre ne signifie pas que le juge a accepté l’ensemble de ce récit.

Le différend sur l’acquisition et l’entraînement

Le mémoire des demandeurs demande au tribunal de traiter comme des usages distincts l’obtention de livres sans paiement, leur copie à des fins d’entraînement et la distribution de copies à d’autres parties. Il soutient également que Microsoft est responsable de la contrefaçon alléguée par OpenAI, compte tenu de sa relation commerciale avec celle-ci et de sa capacité à en superviser les agissements.

Sur l’entraînement lui-même, les auteurs soutiennent que les modèles exploitent l’expression créative des livres pour produire des œuvres concurrentes. Ils affirment que cela menace les marchés des auteurs et les prive de revenus de licence. (Demandeurs, pages 25 à 38)

Dans son mémoire du 17 septembre, OpenAI reconnaît avoir utilisé des compilations de Library Genesis pour entraîner GPT-3 et GPT-3.5. Son argument juridique est que le téléchargement faisait partie du processus de création de modèles apprenant des structures générales du langage. OpenAI demande au tribunal d’examiner l’objectif de l’ensemble du processus et conteste tant la substitution aux livres que l’existence d’un préjudice au marché juridiquement reconnu. (OpenAI, pages 3, 23 à 25 et 28 à 37)

Le mémoire révisé de Microsoft dans l’affaire des livres défend lui aussi l’entraînement au titre du fair use. Microsoft affirme n’avoir pas participé à l’acquisition des jeux de données LibGen utilisés par OpenAI. Concernant les résultats générés, l’entreprise cite une analyse de 8,2 millions de conversations Copilot qui a relevé 24 réponses contenant 30 mots correspondants à des œuvres revendiquées par les auteurs. Il s’agit de la présentation par Microsoft d’une analyse précise reposant sur un seuil particulier de correspondance ; elle ne mesure pas toutes les formes de préjudice qu’un auteur pourrait invoquer.

Ce désaccord compte parce que le droit d’auteur américain demande aux tribunaux d’examiner l’objet d’un usage, la nature de l’œuvre, la quantité reprise et l’effet sur son marché. Un litige sur l’acquisition d’une copie et un autre sur la concurrence des textes générés soulèvent des questions factuelles différentes. Les parties débattent aussi de la manière dont ces questions s’articulent en droit.

Les éléments de preuve restent contestés

Le 23 septembre, OpenAI et Microsoft ont demandé au tribunal d’écarter un rapport d’expert complémentaire ainsi que des passages des mémoires des auteurs s’appuyant sur une étude de livres générés par l’IA et de dilution du marché. Le mémoire à l’appui de leur requête allègue que l’avocat des demandeurs a financé l’étude sans la divulguer ni la présenter selon la procédure requise pour les experts. Ces allégations constituent les arguments des défendeurs en faveur de l’exclusion ; elles ne sont pas des constatations de faute. La requête vise directement des éléments cités dans les dossiers 1982 et 1987.

Le jugement sommaire permet au tribunal de statuer sur une demande ou une partie de celle-ci lorsqu’aucun différend réel sur un fait déterminant ne nécessite un procès et que la partie requérante a droit à une décision en vertu de la loi. (Règle fédérale 56)

Le dossier public consulté jusqu’au 25 septembre recense la poursuite des échanges de mémoires et des requêtes portant sur les preuves d’experts. L’ordonnance du 24 septembre du juge Stein fixe au 23 octobre la date limite des mémoires en réponse de toutes les parties, au 30 octobre celle des mémoires d’amicus curiae et au 20 novembre celle des répliques. Pour les auteurs comme pour les développeurs d’IA, la prochaine étape sera l’examen par le tribunal de ces versions concurrentes des faits sur la copie et le préjudice. Les documents désormais publics présentent des arguments et des preuves citées à l’appui de cet examen ; ils n’accordent aucune indemnisation et ne rendent aucune décision définitive sur le fair use.