Le 5 octobre, OpenAI a annoncé textGrain, un filigrane invisible qui modifie le profil statistique des mots choisis par ses modèles. L’entreprise indique lancer son déploiement par étapes en réponse aux règles de l’UE sur la provenance des textes. Un détecteur compatible peut rechercher ce profil dans un passage, mais le résultat ne donne qu’un indice limité sur le fait qu’un système d’OpenAI ait généré ou traité le texte.

Le changement majeur

  • Ce qui change : OpenAI passe de la recherche sur la provenance des textes à une mise à disposition limitée. Les réponses ChatGPT et Codex éligibles dans l’UE recevront un filigrane dans les prochaines semaines ; certains clients de l’API peuvent déjà l’activer partout dans le monde.
  • Pourquoi c’est important : Les organisations qui évaluent des textes générés par l’IA pourraient disposer à terme d’un signal intégré à leur formulation. Les résultats publiés par OpenAI montrent pourquoi il faut contextualiser celui d’un détecteur : les passages courts ou soumis à de fortes contraintes, ainsi que les textes retouchés, peuvent échapper à la détection, et des faux positifs restent possibles.
  • Ce qu’il faut suivre : Le premier test consistera à voir si le signal résiste de façon fiable à un usage normal, sur des textes de longueurs, de sujets et de langues différents. OpenAI réserve l’accès au détecteur aux chercheurs agréés et aux organisations spécialisées pendant qu’elle évalue ces limites.

Deux déploiements, des accès différents

OpenAI indique qu’elle ajoutera textGrain aux réponses textuelles de ChatGPT et de Codex éligibles dans tous les forfaits de l’Union européenne au cours des prochaines semaines. Il s’agit d’un déploiement régional prévu, et non de l’affirmation que toutes les réponses dans l’UE portent déjà un filigrane. Pour l’API, les clients du monde entier peuvent choisir de l’activer sur certains modèles à partir du 5 octobre ; le filigrane est désactivé par défaut. OpenAI précise que les clients peuvent l’activer dans les paramètres du projet ou de l’organisation et choisir les modèles pris en charge. La liste des modèles éligibles apparaît dans ces paramètres et peut évoluer.

TextGrain repose sur les choix du modèle parmi les mots ou fragments de mots possibles, appelés tokens. OpenAI indique qu’une clé secrète oriente de légères modifications de ces choix pendant la génération. Un détecteur doté de la clé et des paramètres correspondants vérifie ensuite si un passage présente le profil statistique obtenu. Le filigrane n’ajoute aucun caractère caché, espace ni signe de ponctuation visible. Copier le texte n’exige donc pas d’emporter des métadonnées séparées, même si conserver les mots à l’identique ne garantit pas que le signal sera détectable.

Cette distinction limite aussi les personnes autorisées à vérifier un passage. OpenAI accepte les demandes d’accès au détecteur de texte, d’abord de chercheurs agréés et d’organisations spécialisées. Au lancement, le détecteur ne sera pas ouvert au public. Ses outils publics de vérification pour les images et fichiers audio pris en charge sont distincts ; ils ne permettent pas de vérifier librement textGrain.

Un signal peut passer inaperçu ou être détecté à tort

OpenAI indique des taux de détection avec un taux cible de faux positifs de 1 % dans une évaluation. Pour des passages de psychologie, son détecteur a trouvé un filigrane dans environ 80 % des échantillons de 200 tokens et 95 % de ceux de 400 tokens. L’entreprise indique que la détection était nettement plus faible en mathématiques, où la formulation laisse moins de liberté. Il s’agit de résultats d’évaluations de l’entreprise dans des conditions précises, et non d’un taux de réussite mesuré sur les textes rencontrés dans la réalité.

Lors d’un autre test de l’entreprise sur des passages de 400 tokens, les retouches ont affaibli le signal : remplacer 10 % des mots par des synonymes a fait passer la détection d’environ 92 % à 66 % ; en remplacer 25 % l’a ramenée à 17 %. La documentation d’OpenAI indique aussi que la traduction, les paraphrases substantielles, les réponses courtes et le code sont des cas plus difficiles. L’entreprise précise que la détection varie selon la langue. Un résultat négatif ne permet donc pas de conclure qu’une personne a écrit le texte. Le passage peut être trop court, avoir été modifié ou produit avant le déploiement, ou provenir d’un modèle ou produit non couvert par le filigrane.

Un résultat positif a lui aussi ses limites. Un détecteur peut signaler à tort la présence d’un filigrane. S’il trouve un signal, OpenAI estime que cela indique que son système a probablement généré ou traité au moins une partie du passage. Le résultat ne mesure pas la contribution d’une personne, n’identifie ni un compte ni une invite, et ne permet pas de déterminer qui a écrit le texte, à qui il appartient ou qui en est responsable. Il ne peut pas non plus vérifier si le passage est exact. À lui seul, le résultat ne permet pas d’identifier la personne qui a utilisé un outil.

OpenAI prévoit de poursuivre les évaluations et indique vouloir publier textGrain en tant que technologie open source. Pour l’instant, le changement concret est plus limité : certains nouveaux textes générés par OpenAI porteront un signal lisible par machine, tandis que les moyens de l’inspecter et les conclusions qu’il permet d’étayer resteront restreints. Cet article repose sur l’annonce et la documentation d’aide d’OpenAI ; BIG CHANGE n’a pas généré de texte filigrané ni exécuté le détecteur.