A OpenAI anunciou o textGrain em 5 de outubro: uma marca-d’água invisível que altera o padrão estatístico das palavras escolhidas por seus modelos. A empresa afirma que está iniciando uma distribuição em etapas em resposta às regras da UE sobre a procedência de textos. Um detector compatível pode buscar esse padrão em um trecho, mas o resultado é apenas um indício limitado de que um sistema da OpenAI gerou ou processou o texto.

A grande mudança

  • O que mudou: A OpenAI está passando da pesquisa sobre procedência de textos para uma disponibilização limitada. Saídas elegíveis do ChatGPT e do Codex na UE receberão uma marca-d’água nas próximas semanas; alguns clientes de API já podem ativá-la globalmente.
  • Por que isso importa: Organizações que avaliam textos de IA talvez tenham, no futuro, um sinal incorporado à própria redação. Os resultados publicados pela OpenAI mostram por que o resultado de um detector precisa de contexto: trechos curtos ou sujeitos a restrições rígidas e textos editados podem escapar à detecção, e falsos positivos continuam possíveis.
  • O que acompanhar: O teste imediato é saber com que confiabilidade o sinal resiste ao uso cotidiano em textos de diferentes tamanhos, temas e idiomas. A OpenAI está restringindo o acesso ao detector a pesquisadores aprovados e organizações especializadas enquanto avalia esses limites.

Dois lançamentos, acessos diferentes

A OpenAI diz que adicionará o textGrain às saídas de texto do ChatGPT e do Codex que atendam aos requisitos em todos os planos da União Europeia nas próximas semanas. Trata-se de uma distribuição regional planejada, não de uma afirmação de que todas as respostas na UE já tenham marca-d’água hoje. Na API, clientes do mundo todo podem optar por ativá-la em alguns modelos a partir de 5 de outubro; a marca-d’água vem desativada por padrão. Segundo a OpenAI, os clientes podem habilitá-la nas configurações do projeto ou da organização e escolher modelos compatíveis. A lista de modelos elegíveis aparece nessas configurações e pode mudar.

O TextGrain funciona por meio das escolhas do modelo entre palavras ou partes de palavras possíveis, chamadas tokens. A OpenAI diz que uma chave secreta orienta pequenas mudanças nessas escolhas durante a geração. Em seguida, um detector com a chave e as configurações correspondentes verifica se um trecho contém o padrão estatístico resultante. A marca-d’água não acrescenta caracteres ocultos, espaços ou pontuação visível. Assim, copiar o texto não exige carregar metadados separados, embora manter as palavras intactas não garanta que o sinal possa ser detectado.

Essa distinção também limita quem pode verificar um trecho. A OpenAI está aceitando solicitações para usar o detector de texto, inicialmente de pesquisadores aprovados e organizações especializadas. No lançamento, o detector não será aberto ao público. As ferramentas públicas de verificação para imagens e áudios compatíveis são separadas; elas não oferecem uma verificação aberta do textGrain.

O sinal pode passar despercebido ou ser detectado por engano

A OpenAI informa taxas de detecção com uma taxa-alvo de falsos positivos de 1% em uma avaliação. Em trechos de psicologia, o detector encontrou uma marca-d’água em cerca de 80% das amostras de 200 tokens e em aproximadamente 95% das amostras de 400 tokens. Segundo a empresa, a detecção foi bem menor em matemática, em que há menos liberdade na escolha das palavras. Esses são resultados de uma avaliação da empresa em condições determinadas, não uma taxa de sucesso medida para textos encontrados no mundo real.

Em outro teste da empresa com trechos de 400 tokens, as edições enfraqueceram o sinal: substituir 10% das palavras por sinônimos reduziu a detecção de cerca de 92% para 66%; substituir 25% reduziu-a para 17%. A documentação da OpenAI também aponta tradução, paráfrases substanciais, respostas curtas e código como casos mais difíceis. A empresa diz que a detecção varia conforme o idioma. Por isso, um resultado negativo não prova que uma pessoa escreveu o texto. O trecho pode ser curto demais, ter sido alterado ou produzido antes da distribuição, ou ter sido gerado por um modelo ou produto fora da cobertura da marca-d’água.

Um resultado positivo também tem limites. Um detector pode indicar incorretamente a presença de uma marca-d’água. Quando encontra um sinal, a OpenAI diz que isso é evidência de que seu sistema provavelmente gerou ou processou pelo menos parte do trecho. O resultado não mede quanto uma pessoa contribuiu, não identifica uma conta ou prompt e não determina quem escreveu, possui ou é responsável pelo texto. Também não verifica se o trecho é preciso. O resultado, por si só, não identifica a pessoa que usou uma ferramenta.

A OpenAI planeja novas avaliações e diz que pretende lançar o textGrain como tecnologia de código aberto. Por enquanto, a mudança prática é mais restrita: alguns textos recém-gerados pela OpenAI terão um sinal legível por máquina, enquanto os meios de inspecioná-lo e as conclusões que ele sustenta continuam limitados. Este artigo se baseia no anúncio e na documentação de ajuda da OpenAI; a BIG CHANGE não gerou texto com marca-d’água nem executou o detector.