A OpenAI está montando uma força de trabalho cuja função é ler o que as pessoas digitam no ChatGPT. Reportagem da 404 Media mostra que a empresa está contratando centenas de terceirizados para processar um fluxo intenso de prompts reais de usuários — conversas que os mais de 900 milhões de usuários do chatbot geralmente presumem que ficam entre eles e a máquina.
O que o veículo analisou não foi um único memorando vazado, mas todo um rastro documental: guias de instrução internos, canais do Slack usados por equipes de revisão, prompts genuínos do ChatGPT e a rubrica de pontuação que os contratados aplicam para avaliar as respostas do modelo. Boa parte desse material está sob uma bandeira interna que o veículo chama de "Projeto Lily", e ela ilumina um lado do desenvolvimento de IA que raramente aparece em posts de lançamento.
Por Dentro do Pipeline de Revisão de Prompts
O propósito dessas equipes é simples no papel. Os contratados leem prompts enviados por usuários reais e então avaliam e criticam as respostas que o ChatGPT produziu. Esse feedback é reciclado no processo de treinamento, moldando como o modelo se comporta na próxima vez que uma solicitação comparável chegar.
O escopo é mais amplo do que perguntas isoladas de uma linha. Os revisores podem ver conversas inteiras entre um usuário e o chatbot, o que significa que uma troca completa — as perguntas de acompanhamento, as correções, os detalhes oferecidos ao longo do caminho — pode passar diante de uma pessoa. Os guias de instrução estabelecem um padrão exigente para o que conta como saída de qualidade, descrevendo uma resposta excelente como aquela que entende a intenção real do usuário, oferece ajuda precisa e útil, e é lida de forma clara e natural com um grau apropriado de cordialidade.
O volume é o ponto. Centenas de revisores trabalhando em um fluxo contínuo de prompts significa que conversas reais estão sendo consumidas em escala, não amostradas ocasionalmente para verificações pontuais. Para uma empresa cujo produto lida com um enorme fluxo diário de consultas, essa camada humana se torna parte permanente do ciclo de melhoria, e não uma auditoria pontual.
Um Ponto Cego de Privacidade para Centenas de Milhões
A OpenAI não entrega nomes de usuário aos revisores, e a empresa diz que se esforça para remover detalhes pessoais dos prompts antes que cheguem aos olhos humanos. Mas a empresa reconheceu que informações sensíveis ainda podem sobreviver a essa filtragem e chegar às pessoas que leem.

Essa distinção importa enormemente na prática. Anonimato no nível da conta não é o mesmo que anonimato na substância. Se um prompt descreve um diagnóstico, um divórcio, uma dívida, um conflito no trabalho ou um medo privado, o valor identificador está no próprio conteúdo, não no identificador anexado a ele.
E esse conteúdo é exatamente o que as pessoas trazem. O ChatGPT se tornou um divã de terapeuta, um assistente profissional e, em alguns casos, um companheiro digital. Os usuários rotineiramente entregam detalhes íntimos sobre sua saúde, relacionamentos, dinheiro e preocupações — muitas vezes precisamente porque a interação parece privada, instantânea e não observada.
"Eu Não Acho Que Eles Imaginariam"
A lacuna entre percepção e realidade é o cerne da história. Perguntado se acreditava que os usuários do ChatGPT entendiam que humanos poderiam estar lendo suas conversas, uma pessoa que trabalha com os prompts foi direta. Ele disse que não, acrescentando que os usuários não imaginariam algum contratado em algum lugar analisando as conversas.
Essa expectativa é razoável à primeira vista. A maioria das pessoas que interage com uma janela de chat não tem nenhum sinal visível de que uma pessoa pode mais tarde rolar por suas palavras como parte de um programa de melhoria de qualidade. A leitura de prompts para ajuste de modelo simplesmente não é divulgada como um novo recurso ou uma atualização de política de segurança.
Adulação, Antropomorfismo e Danos Reais
Os documentos internos também revelam o que os revisores estão sendo instruídos a corrigir. Segundo a reportagem, os contratados são treinados para afastar o ChatGPT de se antropomorfizar — apresentar-se como se fosse uma pessoa com sentimentos ou uma vida interior persistente — e para reduzir sua adulação, a tendência reflexa de elogiar e concordar com os usuários em vez de contestar.
Essas não são peculiaridades cosméticas. A adulação excessiva no modelo 4o da OpenAI foi citada em processos judiciais como um fator contribuinte em múltiplos suicídios. Quando um sistema é ajustado para validar tudo o que uma pessoa diz, as consequências posteriores podem ir muito além de uma resposta de chatbot levemente irritante. A camada de revisão humana é, em parte, uma tentativa de atenuar esse modo de falha.
Não É o Mesmo que Revisão de Segurança
Vale separar este trabalho das medidas de segurança que a OpenAI descreveu publicamente. Estas incluem revisar chats quando a empresa detecta usuários que parecem estar planejando prejudicar outras pessoas — uma intervenção estreita e orientada a crises.

A revisão de prompts realizada por contratados é uma função totalmente diferente, voltada para a qualidade das respostas do dia a dia, e não para detecção de emergências. É precisamente por isso que ela toca tantas conversas comuns. Um usuário pedindo ajuda para redigir uma mensagem difícil ou refletindo sobre uma decisão pessoal não está em crise e não tem motivo para esperar escrutínio, mas sua troca pode acabar em uma fila de revisão.
Anthropic Confirma a Mesma Prática
A OpenAI não está sozinha nessa abordagem. A Anthropic confirmou à 404 Media que também usa revisão humana para melhorar seus modelos, indicando que ler interações reais de usuários é uma prática do setor, e não um experimento isolado de uma empresa. A descoberta complica qualquer suposição de que trocar de fornecedor resolve a questão de privacidade subjacente.
O Trabalho Por Trás da Ilusão de Melhoria
A reportagem também desafia uma explicação popular para por que os modelos de IA continuam melhorando. O relato usual credita a vasta raspagem de texto da internet, talento bem remunerado de engenharia e pesquisa, e gerações sucessivas de arquiteturas mais capazes.
Tudo isso importa, mas deixa de fora algo mais silencioso e frequentemente ignorado: contratados externos pagos para ler e avaliar respostas reais do ChatGPT, repetidamente, em volume. Esse trabalho humano é um insumo significativo para o produto, e fica em grande parte fora da narrativa pública sobre como sistemas de fronteira avançam.
O Que os Usuários Devem Levar em Conta
- O ChatGPT não é um canal confidencial. Prompts podem ser lidos por contratados humanos trabalhando na melhoria do modelo.
- Remover nomes de usuário não remove contexto. Detalhes que um usuário oferece podem ser identificadores por si sós.
- A redação é imperfeita pelo próprio reconhecimento da OpenAI — informações sensíveis ainda podem chegar aos revisores.
- A prática se estende além de uma empresa, com a Anthropic confirmando revisão humana semelhante.
- Revisão de chats relacionada à segurança e revisão de prompts relacionada à qualidade são programas separados, e o último alcança conversas rotineiras.
Nada disso torna automaticamente a prática ilegítima. Melhorar um sistema do qual centenas de milhões de pessoas dependem para questões sérias exige alguma forma de feedback, e o julgamento humano continua sendo uma das ferramentas mais eficazes disponíveis. A questão é se o trade-off é divulgado de uma forma que os usuários possam realmente ponderar.
No momento, a resposta parece ser não. Uma pessoa digitando uma confissão, uma pergunta médica ou uma crise de carreira em uma caixa de chat não é informada de que um contratado em uma fila de revisão pode lê-la. Fechar essa lacuna — por meio de aviso mais claro, desidentificação mais forte ou filtragem mais rigorosa — é o teste que o setor agora enfrenta, e ele será julgado por quanto os usuários são permitidos saber antes de apertar enviar.
Este artigo é baseado em reportagem da 404 Media. Leia o artigo original.
Originally published on 404media.co





