MIA Privacy
MIA Human Technology

Use ChatGPT, Claude ou Gemini com documentos que não são seus: a IA recebe apelidos, não os nomes.

Exemplo fictício, do começo ao fim
  1. Seu documento

    Folha de pagamento · agostoMariana Costa · CPF 529.982.247-25 · R$ 4.850,00Rafael Nunes · CPF 111.444.777-35 · R$ 3.920,00

    Nome e CPF de cada funcionário.

  2. O que vai para a IA

    Folha de pagamento · agosto[NOME_1] · CPF [CPF_1] · R$ 4.850,00[NOME_2] · CPF [CPF_2] · R$ 3.920,00

    Nome e CPF viram apelido. O salário fica, para a IA poder calcular. Você confere tudo antes de enviar.

  3. A resposta da IA

    Pedido: “resuma a folha”[NOME_1] recebe R$ 4.850,00 e [NOME_2], R$ 3.920,00. Total da folha: R$ 8.770,00.

    Ela responde igual de bem, sem saber quem é quem.

  4. O que você recebe

    Mariana Costa recebe R$ 4.850,00 e Rafael Nunes, R$ 3.920,00. Total da folha: R$ 8.770,00.

    Os nomes reais voltam pela tabela que fica no seu computador.

Você cola o documento, ele sai com apelidos, a IA responde igual de bem porque a estrutura não muda, e na volta você vê os nomes reais.

Testar com um documento seu

São 30 segundos, com um PDF qualquer que tenha um documento dentro.

Para médico, advogado, contador, agência e qualquer profissional que redija contrato ou relatório com dado de outra pessoa.

Antes de confiar um documento a qualquer ferramenta, confira quem responde por ela, onde fica cada dado e o que foi medido.

Quem responde

Daniel Ravetta

Daniel Ravetta

Fundador da MIA Human Technology

“Se depois de testar não ficar claro para que serve, a falha é do produto, e eu quero saber.”

Onde fica cada coisa

O seu computador
Guarda a tabela que devolve os nomes reais. Sem ela, a MIA não consegue reverter.
O nosso servidor
Recebe o texto para analisar; o conteúdo não vai para banco de dados nem para log. O acervo, se você usar, guarda o que você mandar guardar.
A IA
Recebe a versão com apelidos, que você conferiu antes de enviar.

É pseudonimização, não anonimização: o dado sai com apelido, e a sua tabela consegue religá-lo à pessoa. Por isso a LGPD continua valendo.

O que foi medido

99,60%de acerto no reconhecimento, medido em 600 documentos de teste brasileiros.

Número de documento é conferido pelo dígito verificador, não só pelo formato. Em espanhol e em inglês a qualidade também foi medida, e é boa.

836×menos texto de entrada por pergunta quando a IA consulta o seu acervo já com apelidos. Medido sobre 46 documentos: de uns 172.000 tokens para uns 205, porque ela recebe o trecho que responde, não o acervo inteiro.

O método e os limites, escritos por nós →
Anonimizar
Reverter
Solte um arquivo aqui ou clique para escolher PDF · DOCX/ODT · XLSX/ODS · PPTX/ODP · CSV · TXT · imagens (OCR) — até 40 MB
O que anonimizar

Data, valor e idade ficam de fora por padrão: sozinhos não identificam ninguém, e a IA costuma precisar deles para entender prazo e cálculo.

O resultado aparece aqui, com cada dado marcado por cor.
Dígito verificador conferido Formato reconhecido Encontrado pelo modelo Marcado por você

Sobrou alguma coisa? Selecione o trecho no texto acima e escolha como escondê-lo — vale para o que o motor não pegou e também para o que você simplesmente prefere não mandar. Clique de novo na marcação roxa para desfazer.

O dado do seu cliente já saiu da sua sala.

Toda vez que alguém cola uma petição, um prontuário ou uma planilha numa IA, o dado sai do escritório e entra num servidor que não é seu, num país que não é o seu. Esta página mostra o que já aconteceu, quem paga a conta quando dá errado, e o que o MIA Privacy faz a respeito — com número medido, não com adjetivo.

O resumo, em um minuto

Quatro vazamentos reais, uma lei que cobra de você — e um jeito simples de ficar de fora.

E a conta chega para você: pela LGPD, quem cola o documento na IA é o controlador (art. 42) — o processo bate na sua porta, não na da big tech.

Seu documento com nomes, CPFs, endereços
O MIA troca por apelidos a regra confere o dígito; o modelo acha os nomes
A IA trabalha às cegas ChatGPT, Claude ou Gemini veem só [NOME_1]
A resposta volta cole aqui de novo
Você desfaz no navegador a chave nunca sai do seu computador
99,60%cobertura MIA
0,02%falso positivo
83tipos de dado · Brasil e mais 47 países
Nem banco, nem logpara o texto que você cola ou sobe aqui

Testar com um documento seu · Onde funciona: Brasil + 33 países · Ler a documentação completa ↓

Onde funciona

Seu cliente é de fora? O documento dele também é reconhecido — e o dígito é conferido.

O Brasil tem régua própria desde o primeiro dia. Desde setembro de 2026, mais 33 países entram com os documentos deles — cada um com o nome certo no lugar do apelido: [CF_IT_1] para um codice fiscale, [NIF_PT_1] para um NIF português. Quem revisa sabe o que foi trocado.

Brasil 15

CPF, CNPJ, CEP, nº de processo (CNJ), cartão SUS, PIS, título de eleitor, CNH, RG, OAB, CRM, placa, chave Pix — mais nome, endereço, e-mail e telefone, que valem para qualquer país.

América Latina 21

  • Argentina
  • Uruguai
  • Chile
  • Peru
  • Paraguai
  • Equador
  • Colômbia
  • Venezuela
  • Panamá
  • Costa Rica
  • México
  • República Dominicana
  • Nicarágua
  • Bolívia
  • Guatemala
  • Honduras
  • El Salvador
  • Belize
  • Porto Rico
  • Barbados
  • Jamaica

DNI, cédula de identidad, CUIT/CUIL, RUT, RUC, NIT, RIF, CURP, RFC, CLABE — o dígito verificador de cada um conferido pela conta oficial.

Europa 14

  • Espanha
  • Portugal
  • Itália
  • França
  • Alemanha
  • Holanda
  • Bélgica
  • Polônia
  • Hungria
  • República Checa
  • Romênia
  • Bulgária
  • Eslovênia
  • Irlanda

DNI e NIE espanhóis, NIF e Cartão de Cidadão portugueses, codice fiscale e partita IVA, NIR francês, Steuer-IdNr alemã, BSN, PESEL, CNP, EGN, EMŠO e o IBAN de qualquer país.

Anglosfera e África do Sul 11

  • Reino Unido
  • Estados Unidos
  • Canadá
  • Austrália
  • Nova Zelândia
  • África do Sul
  • Índia
  • Singapura
  • Filipinas
  • Quênia
  • Nigéria

SSN e EIN americanos, National Insurance e NHS britânicos, SIN canadense, TFN e ABN australianos, IRD e NHI neozelandeses, ID number sul-africano.

Oriente Médio 1

  • Israel

Número de identidade (ת״ז) e número de empresa (ח״פ) — o ת״ז com dígito verificador de verdade — mais osek murshe, código postal (מיקוד), placa, conta bancária, passaporte, CNH, processo e imóvel (גוש/חלקה).

Por que isso não enche o seu texto de marcação errada: documento com formato próprio (o DNI espanhol, o codice fiscale) é reconhecido sozinho, e ainda assim só passa se o dígito bater. Número que é só dígito — um PESEL, um BSN — não é marcado sem a palavra do documento por perto. É a mesma regra do RG brasileiro: sem ela, toda nota fiscal viraria documento estrangeiro.

47países além do Brasil com documento reconhecido · qualidade medida em português, espanhol e inglês
240documentos reconhecidos
92com dígito conferido
4línguas na tela

Como cada documento é reconhecido, país por país →

A documentação completa

Daqui para baixo, cada afirmação do resumo com a fonte linkada, o número medido e o método — para quem quer conferir.

As 26 páginas de prova: tudo que medimos e o que ainda vamos testar →

O que já aconteceu de verdade

Quatro casos documentados

Nenhum deles é hipótese ou boato. Todos foram confirmados pelas próprias empresas ou por veículos de imprensa técnica, e estão linkados.

OpenAI · 20 de março de 2023

Usuários do ChatGPT viram a conversa e o cartão de outras pessoas

Uma falha na biblioteca Redis fez o ChatGPT mostrar, na barra lateral, títulos de conversas de outros usuários. A OpenAI confirmou que também ficaram expostos dados de pagamento de 1,2% dos assinantes Plus ativos naquela janela: nome, sobrenome, e-mail, endereço de cobrança, os quatro últimos dígitos do cartão e a validade.

A empresa tirou o serviço do ar para conter, e depois publicou o relatório do incidente.

Fonte: relatório oficial da OpenAI — openai.com/index/march-20-chatgpt-outage
Assistente de IA · fevereiro de 2024

Conversas com um assistente de IA foram parar num buscador

Pouco depois do lançamento, usuários encontraram conversas indexadas na busca. O caso repetia um problema já visto antes com links compartilhados de outro assistente, que não traziam as marcações que impedem indexação.

O provedor corrigiu e removeu os resultados — mas as cópias em cache já existiam. Relatos da época apontam retenção de conversas por até três anos.

Fontes: The Cyber Express, Snyk, LayerX Security
Anthropic · abril a julho de 2026

Modelos da própria Anthropic invadiram sistemas de três empresas

Durante avaliações de segurança, uma configuração errada deixou o ambiente de teste com internet aberta. Os modelos trataram sistemas reais como parte do exercício e obtiveram acesso não autorizado à infraestrutura de três organizações, usando coisas básicas: senha fraca e endpoint sem autenticação.

A própria Anthropic publicou o caso. Três modelos diferentes estavam envolvidos, e a revisão só começou depois de um incidente parecido na OpenAI.

Samsung · abril e maio de 2023

Não foi a plataforma que falhou. Foi o funcionário que colou.

Engenheiros da Samsung colaram código-fonte interno no ChatGPT para achar erros e otimizar um programa. O dado saiu da empresa pela porta da frente, digitado por gente de dentro.

A Samsung proibiu IA generativa e avisou que descumprir pode dar demissão. Este é o caso mais parecido com o do escritório brasileiro — ninguém foi invadido; alguém só colou.

Fontes: Bloomberg Línea, Exame, Tecnoblog

Três das quatro falhas vieram de dentro das empresas que vendem a IA. A quarta veio de dentro do cliente. Não existe lado seguro nessa conta.

E a conta, quem paga

Se a big tech vazar o dado do seu cliente, o processo é contra você

Essa é a parte que quase ninguém explica direito. Quando o advogado, o contador ou a clínica decide colar o documento na IA, ele é o controlador dos dados — quem decide o que é tratado e como. A plataforma estrangeira é operadora.

Art. 42 · responsabilidade

Controlador e operador respondem solidariamente pelo dano. Na prática, o titular processa quem ele conhece e quem está no Brasil — o seu escritório, não a empresa em outro continente.

Art. 33 · transferência internacional

Mandar dado pessoal para fora do país exige base legal e garantias. Se a transferência foi a causa do risco, o agente brasileiro responde mesmo que o vazamento tenha ocorrido lá fora.

Art. 48 · comunicação de incidente

Houve vazamento, você tem que comunicar à ANPD e ao titular. Não comunicar é, hoje, uma das infrações mais punidas.

E o argumento "eu não tinha como saber" não segura. Para que ato de terceiro afaste a responsabilidade, é preciso provar que foram adotadas todas as medidas técnicas esperadas e que o evento era imprevisível. Falha básica de segurança é tratada como fortuito interno — não exclui o dever de indenizar.

Você escolheu enviar. Essa escolha é o tratamento — e é sua.

Para advogado tem uma camada a mais, e ela é mais dura que a LGPD: sigilo profissional. Para clínica, o dado de saúde é sensível, na faixa de maior penalidade — e saúde é justamente o setor que a ANPD mais fiscaliza.

Conheça os planos · Começar grátis

Como o motor funciona

Dois detectores, porque existem dois tipos de dado

Não é complicação de engenharia. É que dado pessoal se acha de duas maneiras opostas, e usar a ferramenta errada em cada um é o motivo de todas as outras falharem.

Camada 1 · regra

Dado que tem fórmula

CPF, CNPJ, CEP, número de processo, CNH, PIS, título de eleitor, cartão SUS, cartão de crédito, placa, telefone.

Todos têm dígito verificador ou formato normativo. Isso é conta, não adivinhação: a regra pega e a gente sabe que acertou, porque o dígito bate.

E não é só o Brasil: a mesma camada reconhece documentos de mais 47 países — DNI espanhol, codice fiscale, NIF português, PESEL polonês, SSN americano — e confere o dígito verificador quando o documento tem um. A qualidade foi medida em português, espanhol e inglês. Ver país por país →

Camada 2 · modelo

Dado que não tem fórmula

Nome de pessoa, endereço por extenso, nome de empresa, referência indireta.

Não existe conta que prove que "João Silva" é nome. Aí entra o modelo, treinado por nós em 120 mil documentos brasileiros sintéticos, com 25 tipos de dado nacional.

A regra vence sempre. O modelo só acrescenta o que sobrou. É por isso que um CPF nunca depende de a IA "achar" que é um CPF.

Os números

Medido contra documento brasileiro, não contra o próprio gerador

Este é o ponto em que a maioria das ferramentas se engana sozinha: elas medem o modelo com dados parecidos com os do treino. O número sai lindo e não significa nada. Nós montamos uma régua separada.

600documentos de teste
5.070dados a encontrar
1.000processos reais do CNJ
83tipos de dado · Brasil e mais 47 países
99,60%cobertura MIA
0,02%falso positivo
98,17%dados 100% anonimizados
0,24%dados perdidos inteiros

Como a régua foi feita

Puxamos 1.000 processos públicos da API DataJud do Conselho Nacional de Justiça, de dez tribunais. Isso deu estrutura real: nome de vara, comarca, classe, movimentação e número de processo com dígito de verdade. Em cima disso plantamos dado pessoal sintético, com dígito válido, em posição conhecida.

Nenhum dado pessoal real, de ninguém, em momento algum. E como nós plantamos cada dado, sabemos exatamente onde ele está — a correção é perfeita, sem ninguém marcar à mão.

Cem desses documentos não têm nenhum dado pessoal, e existem só para medir falso positivo. Eles são feitos com armadilhas de verdade, como "Vara Única da Comarca de Piranga" e "Casimiro de Abreu" — nomes de lugar que qualquer modelo confunde com nome de gente.

O comparativo

MotorCobertura Falso positivo Docs com dado perdidoConfere dígito?
MIA Privacy99,60%0,02%Sim
OpenAI Privacy Filtermedição na mesma régua em andamentoNão
Nosso motor anteriormedição na mesma régua em andamentoNão

Como contamos "documento com dado perdido": documento em que algum dado foi perdido inteiro. Não conta o caso em que sobrou só pontuação de borda — o ponto final de "Ltda.", por exemplo, é o modelo fechando o nome da empresa um caractere antes, não um dado exposto. A mesma regra foi aplicada aos três motores, senão não seria comparação, seria propaganda.

MotorDado 100% anonimizado Sobrou só farelo Perdido inteiro
MIA Privacy98,17%1,60%0,24%
OpenAI Privacy Filter74,20%14,83%10,97%
Nosso motor anterior75,11%15,46%9,43%

Nos nossos 95% do farelo é um caractere só — quase sempre o ponto de "Ltda.". No Privacy Filter da OpenAI só 8% são de um caractere: o que sobra lá são pedaços de verdade, como , s/n de um endereço ou Junior de um nome.

E é justo dizer uma coisa a favor deles: boa parte do que a ferramenta da OpenAI perde inteiro é idade e valor — dois tipos que nós mesmos deixamos desligados por padrão. Descontando isso, a diferença diminui. O que não diminui é o resto: ela perdeu 68 nomes de pessoa por inteiro na mesma régua.

Tipo por tipo

É aqui que a diferença aparece de verdade. Cobertura por tipo de dado brasileiro, mesma régua, mesmo dia.

Os três motores foram medidos na mesma régua, no mesmo dia, com a mesma métrica.

O Privacy Filter da OpenAI é um modelo aberto, gratuito e tecnicamente muito bom — e é honesto dizer isso. Ele detecta oito categorias genéricas: conta, endereço, e-mail, pessoa, telefone, URL, data e segredo. É uma ferramenta feita para o mundo inteiro.

Como account_number é uma categoria genérica, ela acaba pegando boa parte dos números brasileiros. O preço disso aparece em duas colunas: ela marca 8,46% dos caracteres em documentos que não têm nenhum dado pessoal — contra 0,02% nossos — e não sabe o que marcou. Para o modelo dela, CPF, CNPJ e número de processo são a mesma coisa.

Saber o que é cada dado não é detalhe estético. É o que permite desfazer a troca corretamente e é o que a LGPD pede quando pergunta quais categorias de dado a sua empresa trata.

O que não prometemos

Os limites, escritos por nós mesmos

  • Não é 100%, e ninguém é. Por isso a tela de conferência é obrigatória: você vê tudo que foi encontrado antes de baixar, e pode marcar o que escapou.
  • Não é criptografia. Os dados viram apelido e o mapa fica com você. Se perder o arquivo da chave, ninguém desfaz — nem nós, porque nunca tivemos.
  • Não é parecer jurídico e não coloca ninguém em conformidade sozinho.
  • PDF escaneado ainda não. Se o arquivo for a foto de um documento, avisamos em vez de devolver vazio.
  • A régua tem limite. Ela usa estrutura de documento real, mas o dado plantado é sintético. O teste realmente cego é documento de cliente, e ele ainda não foi feito.
  • Não guardamos o seu texto. Ele passa pelo nosso servidor só para ser analisado — em memória, e é descartado na hora: não vai para banco de dados nem para log. A chave que liga apelido a nome real nunca sai do seu navegador. As notas que você mesmo salva no WikiSecret ficam cifradas até você apagar — essas são guardadas porque é o que você pediu; o resto, não.

Escrevemos isso porque um produto de privacidade que exagera na promessa é a primeira coisa que um advogado desmonta — e ele tem razão em desmontar.

Teste com um documento seu

Cole um texto ou suba um arquivo. Leva segundos. Pede só o seu e-mail — o seu WhatsApp é opcional, se você quiser. O dado do seu cliente é que não fica aqui.

Voltar e testar Ver planos e preço