A OpenAI anunciou o textGrain a 5 de outubro: uma marca de água invisível que altera o padrão estatístico das palavras escolhidas pelos seus modelos. A empresa afirma que está a iniciar uma implementação faseada em resposta às regras da UE sobre a proveniência de texto. Um detetor compatível pode procurar o padrão num excerto, mas o resultado é apenas uma indicação limitada de que um sistema da OpenAI gerou ou processou o texto.
A grande mudança
- O que mudou: A OpenAI está a passar da proveniência de texto como tema de investigação para uma disponibilização limitada. Os conteúdos elegíveis do ChatGPT e do Codex na UE receberão uma marca de água nas próximas semanas; alguns clientes da API já a podem ativar em todo o mundo.
- Porque é importante: As organizações que avaliam textos de IA poderão vir a dispor de um sinal incorporado na própria formulação. Os resultados publicados pela OpenAI mostram por que razão o resultado de um detetor precisa de contexto: excertos curtos ou sujeitos a fortes restrições e textos editados podem escapar à deteção, e continuam a ser possíveis falsos positivos.
- O que acompanhar: O primeiro teste é perceber com que fiabilidade o sinal resiste à utilização normal em textos de diferentes comprimentos, temas e idiomas. A OpenAI está a limitar o acesso ao detetor a investigadores aprovados e organizações especializadas enquanto avalia essas limitações.
Dois lançamentos, acessos diferentes
A OpenAI afirma que irá adicionar o textGrain às respostas de texto do ChatGPT e do Codex que cumpram os requisitos em todos os planos da União Europeia nas próximas semanas. Trata-se de uma implementação regional prevista, não de uma afirmação de que todas as respostas na UE já incluem hoje uma marca de água. Na API, clientes de todo o mundo podem optar por ativá-la em determinados modelos a partir de 5 de outubro; a funcionalidade está desativada por predefinição. A OpenAI diz que os clientes podem ativá-la nas definições do projeto ou da organização e escolher modelos compatíveis. A lista de modelos elegíveis aparece nessas definições e pode mudar.
O TextGrain funciona através das escolhas do modelo entre palavras ou partes de palavras possíveis, conhecidas como tokens. A OpenAI afirma que uma chave secreta orienta pequenas alterações nessas escolhas durante a geração. Em seguida, um detetor com a chave e as definições correspondentes verifica se o excerto contém o padrão estatístico resultante. A marca de água não acrescenta caracteres ocultos, espaços nem sinais de pontuação visíveis. Assim, copiar o texto não exige transportar metadados separados, embora manter as palavras intactas não garanta que o sinal continue detetável.
Essa distinção também limita quem pode verificar um excerto. A OpenAI está a aceitar pedidos de acesso ao detetor de texto, inicialmente de investigadores aprovados e organizações especializadas. No lançamento, não abrirá o detetor ao público. As suas ferramentas públicas de verificação de imagens e áudio compatíveis são distintas e não permitem verificar o textGrain de forma aberta.
O sinal pode não ser detetado ou ser identificado por engano
A OpenAI apresenta taxas de deteção com uma taxa-alvo de falsos positivos de 1% numa avaliação. Em excertos de psicologia, o detetor encontrou uma marca de água em cerca de 80% das amostras de 200 tokens e em cerca de 95% das amostras de 400 tokens. A empresa afirma que a deteção foi bastante inferior em matemática, onde há menos liberdade de formulação. Estes são resultados de uma avaliação da empresa em condições específicas, não uma taxa de sucesso medida em textos encontrados no mundo real.
Noutro teste da empresa com excertos de 400 tokens, as edições enfraqueceram o sinal: substituir 10% das palavras por sinónimos reduziu a deteção de cerca de 92% para 66%; substituir 25% reduziu-a para 17%. A documentação da OpenAI também identifica a tradução, a paráfrase extensa, as respostas curtas e o código como casos mais difíceis. A empresa afirma que a deteção varia consoante o idioma. Por isso, um resultado negativo não permite concluir que o texto foi escrito por uma pessoa. O excerto pode ser demasiado curto, ter sido alterado, ter sido produzido antes da implementação ou ter sido gerado por um modelo ou produto fora do âmbito da marca de água.
Um resultado positivo também tem limites. Um detetor pode assinalar uma marca de água por engano. Quando encontra um sinal, a OpenAI afirma que isso constitui um indício de que o seu sistema provavelmente gerou ou processou pelo menos parte do excerto. Não mede a contribuição de uma pessoa, não identifica uma conta ou instrução, nem determina quem escreveu, possui ou é responsável pelo texto. Também não verifica se o excerto é exato. O resultado, por si só, não identifica quem utilizou uma ferramenta.
A OpenAI planeia continuar a avaliação e afirma que pretende lançar o textGrain como tecnologia de código aberto. Para já, a mudança prática é mais limitada: alguns textos recém-gerados pela OpenAI terão um sinal legível por máquinas, mas os meios para o inspecionar e as conclusões que permite continuam condicionados. Este artigo baseia-se no anúncio e na documentação de ajuda da OpenAI; a BIG CHANGE não gerou texto com marca de água nem executou o detetor.



