Die Authors Guild und weitere Buchautoren als Kläger fordern einen Bundesrichter auf, getrennt zu prüfen, wie OpenAI urheberrechtlich geschützte Bücher beschaffte und was das Unternehmen später mit ihnen tat. In ihren am 17. September veröffentlichten Schriftsätzen beschreiben sie interne Gespräche über Library Genesis, die Quelle von Büchersammlungen für das Modelltraining, und argumentieren, dass das Herunterladen, das Training und die Weitergabe von Kopien jeweils eine eigene urheberrechtliche Prüfung erfordern.

OpenAI widerspricht diesem Ansatz. In einem eigenen, an diesem Tag überarbeiteten Schriftsatz argumentiert das Unternehmen, Beschaffung und Modelltraining hätten einem einzigen transformativen Zweck gedient und seien durch Fair Use geschützt. Die konkurrierenden Anträge liegen weiterhin bei Richter Sidney H. Stein in New York. Eine Anordnung vom 24. September verlängerte den Zeitplan für die Schriftsätze; sie entschied den Urheberrechtsstreit nicht. (Schriftsatz der Kläger, Schriftsatz von OpenAI, Fristenanordnung)

Die große Änderung

  • Was sich geändert hat: Autoren können nun auf eine umfassendere öffentliche Darstellung der von ihnen beanstandeten Entscheidungen zur Beschaffung von Büchern verweisen. Die Schriftsätze vom September legen mehr über den Streit offen, woher die Bücher für das Training stammten und wie die Unternehmen mit ihnen umgingen.
  • Warum das wichtig ist: Für Autoren, die eine Vergütung verlangen, und Entwickler, die ihre Nutzung von Büchern verteidigen, ist die rechtliche Bewertung der Beschaffung ebenso wichtig wie die des Trainings. Die Parteien sind uneinig, ob der Zweck eines Modells frühere Kopiervorgänge rechtfertigen kann.
  • Worauf es ankommt: In den nächsten Schriftsätzen werden sowohl dieses Rechtsargument als auch Belege für eine Schädigung der Autoren angefochten. Welche Beweise der Richter zulässt und welche Nutzungen er getrennt bewertet, wird beeinflussen, welche Ansprüche er ohne Hauptverhandlung entscheiden kann.

Books1 und Books2 in den öffentlichen Gerichtsakten

Die Dokumente vom 17. September sind umfassendere öffentliche Fassungen von Anträgen auf ein Urteil im summarischen Verfahren samt Sachverhaltsdarstellungen. Die Anordnung des Gerichts vom 3. September zu Schwärzungen verpflichtete die Parteien, ihre Schriftsätze und Sachverhaltsdarstellungen erneut einzureichen und Informationen offenzulegen, deren weitere Schwärzung weder eine Partei noch ein Dritter beantragt hatte. Einige Passagen sind weiterhin geschwärzt.

Die Veröffentlichung der Authors Guild vom 21. September machte auf zwei dieser Dokumente aufmerksam: den Rechtsschriftsatz der Kläger, Aktenzeichen 1982, und ihre korrigierte Sachverhaltsdarstellung, Aktenzeichen 1987. Die Veröffentlichung gibt die Sicht der Guild als Klägerin wieder.

In Aktenzeichen 1987 führen die Autoren Aussagen und interne Mitteilungen dazu an, dass Trainingsdatensätze Books1 und Books2 genannt wurden. In Absatz 271 zitiert das Dokument den früheren OpenAI-Mitarbeiter Ben Mann mit der Aussage, beide beruhten auf LibGen. In Absatz 275 zitiert es seine Erklärung zur Formulierung in einem Entwurf: „sie ist absichtlich vage, da es LibGen ist.“

Derselbe Schriftsatz gibt in Absatz 749 eine Nachricht vom Mai 2020 des damaligen OpenAI-Politikdirektors Jack Clark wieder, der mit Konkurrenz durch Autoren von Unterhaltungsromanen rechnete. Die Kläger führen sie als Beleg für eine interne Sorge über Verdrängung an. Die Nachricht misst keine späteren Einbußen bei Buchverkäufen und belegt nicht, wie das Gericht eine Schädigung des Marktes beurteilt.

Der Titel des Dokuments enthält die Worte „unbestrittene wesentliche Tatsachen“. Es handelt sich um den Antrag der Kläger auf ein Urteil im summarischen Verfahren. Nach Zivilgerichtsregel 56.1 des örtlichen Gerichts muss die Gegenseite auf die nummerierten Tatsachenbehauptungen mit Zustimmung oder Widerspruch und Belegen antworten. Der Titel bedeutet nicht, dass der Richter die gesamte Darstellung angenommen hat.

Der Streit über Beschaffung und Training

Im Schriftsatz beantragen die Kläger, die unentgeltliche Beschaffung von Büchern, deren Kopieren für das Training und die Weitergabe von Kopien an andere Parteien als getrennte Nutzungen zu behandeln. Außerdem argumentieren sie, Microsoft hafte für die mutmaßliche Rechtsverletzung durch OpenAI, weil das Unternehmen eine Geschäftsbeziehung mit OpenAI unterhalte und dessen Verhalten überwachen könne.

Zum Training selbst argumentieren die Autoren, Modelle nutzten den kreativen Ausdruck der Bücher, um konkurrierende Werke zu erstellen. Das bedrohe die Märkte der Autoren und entziehe ihnen Lizenzeinnahmen, sagen sie. (Kläger, Seiten 25 bis 38)

OpenAIs Schriftsatz vom 17. September räumt ein, dass das Unternehmen Zusammenstellungen aus Library Genesis zum Training von GPT-3 und GPT-3.5 genutzt hat. Rechtlich argumentiert OpenAI, das Herunterladen sei Teil des Aufbaus von Modellen gewesen, die allgemeine Sprachmuster lernen. Das Gericht solle den Zweck dieses Gesamtprozesses beurteilen. Zugleich bestreitet OpenAI sowohl, dass die Modelle die Bücher ersetzen, als auch, dass ein rechtlich anerkannter Marktschaden vorliegt. (OpenAI, Seiten 3, 23 bis 25 und 28 bis 37)

Auch Microsoft verteidigt in seinem überarbeiteten Schriftsatz zum Buchverfahren das Training als Fair Use. Das Unternehmen erklärt, nicht an der Beschaffung der von OpenAI verwendeten LibGen-Datensätze beteiligt gewesen zu sein. Zu den Ausgaben verweist es auf eine Analyse von 8,2 Millionen Copilot-Unterhaltungen, in der 24 Antworten mit jeweils 30 übereinstimmenden Wörtern aus den von den Autoren geltend gemachten Werken gefunden worden seien. Das ist Microsofts Darstellung einer bestimmten Analyse mit einem festgelegten Schwellenwert für Textübereinstimmungen; sie misst nicht alle Arten wirtschaftlicher Schäden, die Autoren geltend machen könnten.

Die Auseinandersetzung ist bedeutsam, weil das US-Urheberrecht Gerichte auffordert, den Zweck der Nutzung, die Art des Werks, den Umfang der Übernahme und die Auswirkungen auf den Markt zu berücksichtigen. Beim Streit über die Beschaffung einer Kopie und bei dem über Konkurrenz durch generierte Texte stellen sich unterschiedliche Tatsachenfragen. Die Parteien streiten außerdem darüber, wie diese Fragen rechtlich zusammenhängen.

Die Beweise werden weiterhin angefochten

Am 23. September beantragten OpenAI und Microsoft, einen ergänzenden Sachverständigenbericht sowie Teile der Schriftsätze der Autoren auszuschließen, die sich auf eine Studie zu KI-generierten Büchern und einer Verwässerung des Marktes stützen. Im begründenden Schriftsatz zu ihrem Antrag behaupten die Beklagten, der Prozessbeistand der Kläger habe die Forschung finanziert und dies nicht offengelegt sowie die Studie nicht im vorgeschriebenen Sachverständigenverfahren vorgelegt. Das sind Behauptungen der Beklagten als Argumente für einen Ausschluss, keine Feststellungen eines Fehlverhaltens. Der Antrag richtet sich konkret gegen Material, das in den Aktenzeichen 1982 und 1987 angeführt wird.

Bei einem Urteil im summarischen Verfahren kann ein Gericht über einen Anspruch oder einen Teil davon entscheiden, wenn kein echter Streit über eine wesentliche Tatsache eine Verhandlung erfordert und die antragstellende Partei nach dem Gesetz Anspruch auf ein Urteil hat. (Bundesprozessregel 56)

Die bis zum 25. September geprüfte öffentliche Gerichtsakte verzeichnet weitere Schriftsatzfristen und Anträge zu Sachverständigenbeweisen. Steins Anordnung vom 24. September setzt den 23. Oktober als Frist für die Widerspruchsschriftsätze aller Parteien, den 30. Oktober für Amicus-Schriftsätze und den 20. November für Erwiderungen fest. Für Autoren und KI-Entwickler kommt es nun darauf an, wie das Gericht diese gegensätzlichen Darstellungen zu Kopieren und Schäden bewertet. Die neu veröffentlichten Schriftsätze enthalten Argumente und angeführte Beweise für diese Prüfung, aber weder eine Entschädigungsentscheidung noch ein abschließendes Fair-Use-Urteil.