Inteligência Artificial

ChatGPT: textos terão marca d'água invisível na Europa

A OpenAI vai marcar textos do ChatGPT e do Codex com um sinal invisível para cumprir a lei da UE. Veja como funciona, o que falha e quem é afetado.

Por Redação IntelliTechs3 min de leitura
Uma folha de papel metálica com um padrão de pontos ciano quase invisível

A OpenAI anunciou na segunda-feira (5) que vai esconder uma marca d’água em textos e códigos gerados pelo ChatGPT e pelo Codex na União Europeia. Você não vê nada de diferente na tela, mas um detector especializado consegue reconhecer o padrão depois. A mudança chega nas próximas semanas e busca atender às regras de transparência da lei europeia de IA.

Como a marca d’água funciona

A tecnologia se chama textGrain. Em vez de colar uma etiqueta no texto, ela influencia de leve as palavras que o modelo escolhe, criando um padrão estatístico que o leitor não percebe, mas que o detector consegue apontar. Pense num sinal embutido no jeito de escolher sinônimos, e não em algo escrito na página.

Segundo a OpenAI, o desempenho do modelo não muda de forma relevante com o recurso ligado. A empresa também diz que pretende abrir o código do textGrain, o que permitiria a outros desenvolvedores estudar e testar a técnica.

Na Europa, a marca será obrigatória para quem usa o ChatGPT, em qualquer plano. Quem usa a API, a porta de entrada para empresas e desenvolvedores criarem seus próprios produtos, terá uma escolha: segundo o The Decoder, clientes de API no mundo todo podem optar por não usar a marca, ao contrário do que a Anthropic fez. A Xataka lembra que os modelos que a Anthropic lançou na UE desde 2 de agosto já saem com uma marca invisível nos textos.

O que o detector consegue (e o que não consegue)

Os números divulgados mostram uma ferramenta útil, mas longe de perfeita:

  • Nos testes iniciais, a detecção ficou em cerca de 92%, segundo o TechCrunch.
  • Trocar apenas 10% das palavras por sinônimos derrubou a taxa para 66%.
  • O The Decoder cita cerca de 95% de acerto em textos de 400 tokens (pedaços de palavras que o modelo processa) sobre psicologia, e perto de 80% em textos de 200 tokens.
  • Em respostas de matemática, a taxa fica bem menor, em torno de 60% com 400 tokens.
  • Quando um quarto das palavras é trocado, a detecção cai abaixo de 20%, mesmo em textos longos.

Textos curtos, contas e traduções também são mais difíceis de identificar. A própria OpenAI afirma que a falta de marca não prova autoria humana. Ou seja, o detector serve como indício, não como sentença. Um texto que passou por edição pesada, ou que foi traduzido, pode escapar sem que isso diga muito sobre quem o escreveu.

Quem terá acesso ao detector

Por enquanto, nem você nem o professor da escola vão poder colar um texto num site e receber um veredito. O acesso ao detector será restrito, a princípio, a pesquisadores aprovados e organizações especializadas, com pedidos analisados caso a caso por meio de um formulário, no âmbito do código de conduta europeu.

Por que isso acontece agora

O pano de fundo é a lei de IA da União Europeia, que exige que conteúdo gerado por inteligência artificial possa ser identificado por máquinas. A Engadget informa que o movimento da OpenAI vem na esteira do anúncio parecido da Anthropic. As fontes divergem sobre o prazo exato de adequação, por isso a data final fica de fora desta matéria.

O anúncio trata dos usuários da União Europeia. Quem usa o ChatGPT fora de lá não recebe a marca obrigatória, a não ser por meio de recursos da API que a empresa disponibiliza como opção. Vale acompanhar se a OpenAI vai ampliar a prática para outras regiões, já que a tecnologia, uma vez pronta, não depende do território.

O que isso significa na prática

Para quem estuda ou trabalha na Europa, usar o ChatGPT passa a deixar um rastro. Quem edita bastante o resultado, porém, reduz muito as chances de detecção, e isso mostra o limite da abordagem: ela ajuda a identificar texto cru de máquina, e não a vigiar cada frase escrita com apoio de IA. Se você quer entender por que esses modelos às vezes inventam informações, nosso texto sobre o que é um modelo de linguagem explica a base. E, se quiser acompanhar outras mudanças recentes no produto, veja como os anúncios chegam ao gerador de imagens.