Seu documento
Folha de pagamento · agostoMariana Costa · CPF 529.982.247-25 · R$ 4.850,00Rafael Nunes · CPF 111.444.777-35 · R$ 3.920,00
Nome e CPF de cada funcionário.
O que vai para a IA
Folha de pagamento · agosto[NOME_1] · CPF [CPF_1] · R$ 4.850,00[NOME_2] · CPF [CPF_2] · R$ 3.920,00
Nome e CPF viram apelido. O salário fica, para a IA poder calcular. Você confere tudo antes de enviar.
A resposta da IA
Pedido: “resuma a folha”[NOME_1] recebe R$ 4.850,00 e [NOME_2], R$ 3.920,00. Total da folha: R$ 8.770,00.
Ela responde igual de bem, sem saber quem é quem.
O que você recebe
Mariana Costa recebe R$ 4.850,00 e Rafael Nunes, R$ 3.920,00. Total da folha: R$ 8.770,00.
Os nomes reais voltam pela tabela que fica no seu computador.
Você cola o documento, ele sai com apelidos, a IA responde igual de bem porque a estrutura não muda, e na volta você vê os nomes reais.
São 30 segundos, com um PDF qualquer que tenha um documento dentro.
Para médico, advogado, contador, agência e qualquer profissional que redija contrato ou relatório com dado de outra pessoa.
Daniel Ravetta
Fundador da MIA Human Technology
“Se depois de testar não ficar claro para que serve, a falha é do produto, e eu quero saber.”
É pseudonimização, não anonimização: o dado sai com apelido, e a sua tabela consegue religá-lo à pessoa. Por isso a LGPD continua valendo.
99,60%de acerto no reconhecimento, medido em 600 documentos de teste brasileiros.
Número de documento é conferido pelo dígito verificador, não só pelo formato. Em espanhol e em inglês a qualidade também foi medida, e é boa.
836×menos texto de entrada por pergunta quando a IA consulta o seu acervo já com apelidos. Medido sobre 46 documentos: de uns 172.000 tokens para uns 205, porque ela recebe o trecho que responde, não o acervo inteiro.
O método e os limites, escritos por nós →Data, valor e idade ficam de fora por padrão: sozinhos não identificam ninguém, e a IA costuma precisar deles para entender prazo e cálculo.
Sobrou alguma coisa? Selecione o trecho no texto acima e escolha como escondê-lo — vale para o que o motor não pegou e também para o que você simplesmente prefere não mandar. Clique de novo na marcação roxa para desfazer.
Toda vez que alguém cola uma petição, um prontuário ou uma planilha numa IA, o dado sai do escritório e entra num servidor que não é seu, num país que não é o seu. Esta página mostra o que já aconteceu, quem paga a conta quando dá errado, e o que o MIA Privacy faz a respeito — com número medido, não com adjetivo.
E a conta chega para você: pela LGPD, quem cola o documento na IA é o controlador (art. 42) — o processo bate na sua porta, não na da big tech.
Testar com um documento seu · Onde funciona: Brasil + 33 países · Ler a documentação completa ↓
O Brasil tem régua própria desde o primeiro dia. Desde setembro de 2026,
mais 33 países entram com os documentos deles — cada um com o nome certo no lugar do
apelido: [CF_IT_1] para um codice fiscale, [NIF_PT_1] para um
NIF português. Quem revisa sabe o que foi trocado.
CPF, CNPJ, CEP, nº de processo (CNJ), cartão SUS, PIS, título de eleitor, CNH, RG, OAB, CRM, placa, chave Pix — mais nome, endereço, e-mail e telefone, que valem para qualquer país.
DNI, cédula de identidad, CUIT/CUIL, RUT, RUC, NIT, RIF, CURP, RFC, CLABE — o dígito verificador de cada um conferido pela conta oficial.
DNI e NIE espanhóis, NIF e Cartão de Cidadão portugueses, codice fiscale e partita IVA, NIR francês, Steuer-IdNr alemã, BSN, PESEL, CNP, EGN, EMŠO e o IBAN de qualquer país.
SSN e EIN americanos, National Insurance e NHS britânicos, SIN canadense, TFN e ABN australianos, IRD e NHI neozelandeses, ID number sul-africano.
Número de identidade (ת״ז) e número de empresa (ח״פ) — o ת״ז com dígito verificador de verdade — mais osek murshe, código postal (מיקוד), placa, conta bancária, passaporte, CNH, processo e imóvel (גוש/חלקה).
Por que isso não enche o seu texto de marcação errada: documento com formato próprio (o DNI espanhol, o codice fiscale) é reconhecido sozinho, e ainda assim só passa se o dígito bater. Número que é só dígito — um PESEL, um BSN — não é marcado sem a palavra do documento por perto. É a mesma regra do RG brasileiro: sem ela, toda nota fiscal viraria documento estrangeiro.
Daqui para baixo, cada afirmação do resumo com a fonte linkada, o número medido e o método — para quem quer conferir.
As 26 páginas de prova: tudo que medimos e o que ainda vamos testar →
Nenhum deles é hipótese ou boato. Todos foram confirmados pelas próprias empresas ou por veículos de imprensa técnica, e estão linkados.
Uma falha na biblioteca Redis fez o ChatGPT mostrar, na barra lateral, títulos de conversas de outros usuários. A OpenAI confirmou que também ficaram expostos dados de pagamento de 1,2% dos assinantes Plus ativos naquela janela: nome, sobrenome, e-mail, endereço de cobrança, os quatro últimos dígitos do cartão e a validade.
A empresa tirou o serviço do ar para conter, e depois publicou o relatório do incidente.
Pouco depois do lançamento, usuários encontraram conversas indexadas na busca. O caso repetia um problema já visto antes com links compartilhados de outro assistente, que não traziam as marcações que impedem indexação.
O provedor corrigiu e removeu os resultados — mas as cópias em cache já existiam. Relatos da época apontam retenção de conversas por até três anos.
Durante avaliações de segurança, uma configuração errada deixou o ambiente de teste com internet aberta. Os modelos trataram sistemas reais como parte do exercício e obtiveram acesso não autorizado à infraestrutura de três organizações, usando coisas básicas: senha fraca e endpoint sem autenticação.
A própria Anthropic publicou o caso. Três modelos diferentes estavam envolvidos, e a revisão só começou depois de um incidente parecido na OpenAI.
Engenheiros da Samsung colaram código-fonte interno no ChatGPT para achar erros e otimizar um programa. O dado saiu da empresa pela porta da frente, digitado por gente de dentro.
A Samsung proibiu IA generativa e avisou que descumprir pode dar demissão. Este é o caso mais parecido com o do escritório brasileiro — ninguém foi invadido; alguém só colou.
Três das quatro falhas vieram de dentro das empresas que vendem a IA. A quarta veio de dentro do cliente. Não existe lado seguro nessa conta.
Essa é a parte que quase ninguém explica direito. Quando o advogado, o contador ou a clínica decide colar o documento na IA, ele é o controlador dos dados — quem decide o que é tratado e como. A plataforma estrangeira é operadora.
Controlador e operador respondem solidariamente pelo dano. Na prática, o titular processa quem ele conhece e quem está no Brasil — o seu escritório, não a empresa em outro continente.
Mandar dado pessoal para fora do país exige base legal e garantias. Se a transferência foi a causa do risco, o agente brasileiro responde mesmo que o vazamento tenha ocorrido lá fora.
Houve vazamento, você tem que comunicar à ANPD e ao titular. Não comunicar é, hoje, uma das infrações mais punidas.
E o argumento "eu não tinha como saber" não segura. Para que ato de terceiro afaste a responsabilidade, é preciso provar que foram adotadas todas as medidas técnicas esperadas e que o evento era imprevisível. Falha básica de segurança é tratada como fortuito interno — não exclui o dever de indenizar.
Você escolheu enviar. Essa escolha é o tratamento — e é sua.
Para advogado tem uma camada a mais, e ela é mais dura que a LGPD: sigilo profissional. Para clínica, o dado de saúde é sensível, na faixa de maior penalidade — e saúde é justamente o setor que a ANPD mais fiscaliza.
Não é complicação de engenharia. É que dado pessoal se acha de duas maneiras opostas, e usar a ferramenta errada em cada um é o motivo de todas as outras falharem.
CPF, CNPJ, CEP, número de processo, CNH, PIS, título de eleitor, cartão SUS, cartão de crédito, placa, telefone.
Todos têm dígito verificador ou formato normativo. Isso é conta, não adivinhação: a regra pega e a gente sabe que acertou, porque o dígito bate.
E não é só o Brasil: a mesma camada reconhece documentos de mais 47 países — DNI espanhol, codice fiscale, NIF português, PESEL polonês, SSN americano — e confere o dígito verificador quando o documento tem um. A qualidade foi medida em português, espanhol e inglês. Ver país por país →
Nome de pessoa, endereço por extenso, nome de empresa, referência indireta.
Não existe conta que prove que "João Silva" é nome. Aí entra o modelo, treinado por nós em 120 mil documentos brasileiros sintéticos, com 25 tipos de dado nacional.
A regra vence sempre. O modelo só acrescenta o que sobrou. É por isso que um CPF nunca depende de a IA "achar" que é um CPF.
Este é o ponto em que a maioria das ferramentas se engana sozinha: elas medem o modelo com dados parecidos com os do treino. O número sai lindo e não significa nada. Nós montamos uma régua separada.
Puxamos 1.000 processos públicos da API DataJud do Conselho Nacional de Justiça, de dez tribunais. Isso deu estrutura real: nome de vara, comarca, classe, movimentação e número de processo com dígito de verdade. Em cima disso plantamos dado pessoal sintético, com dígito válido, em posição conhecida.
Nenhum dado pessoal real, de ninguém, em momento algum. E como nós plantamos cada dado, sabemos exatamente onde ele está — a correção é perfeita, sem ninguém marcar à mão.
Cem desses documentos não têm nenhum dado pessoal, e existem só para medir falso positivo. Eles são feitos com armadilhas de verdade, como "Vara Única da Comarca de Piranga" e "Casimiro de Abreu" — nomes de lugar que qualquer modelo confunde com nome de gente.
| Motor | Cobertura | Falso positivo | Docs com dado perdido | Confere dígito? |
|---|---|---|---|---|
| MIA Privacy | 99,60% | 0,02% | Sim | |
| OpenAI Privacy Filter | medição na mesma régua em andamento | Não | ||
| Nosso motor anterior | medição na mesma régua em andamento | Não | ||
Como contamos "documento com dado perdido": documento em que algum dado foi perdido inteiro. Não conta o caso em que sobrou só pontuação de borda — o ponto final de "Ltda.", por exemplo, é o modelo fechando o nome da empresa um caractere antes, não um dado exposto. A mesma regra foi aplicada aos três motores, senão não seria comparação, seria propaganda.
| Motor | Dado 100% anonimizado | Sobrou só farelo | Perdido inteiro |
|---|---|---|---|
| MIA Privacy | 98,17% | 1,60% | 0,24% |
| OpenAI Privacy Filter | 74,20% | 14,83% | 10,97% |
| Nosso motor anterior | 75,11% | 15,46% | 9,43% |
Nos nossos 95% do farelo é um caractere só — quase sempre o ponto
de "Ltda.". No Privacy Filter da OpenAI só 8% são de um caractere: o que
sobra lá são pedaços de verdade, como , s/n de um endereço
ou Junior de um nome.
E é justo dizer uma coisa a favor deles: boa parte do que a ferramenta da OpenAI perde inteiro é idade e valor — dois tipos que nós mesmos deixamos desligados por padrão. Descontando isso, a diferença diminui. O que não diminui é o resto: ela perdeu 68 nomes de pessoa por inteiro na mesma régua.
É aqui que a diferença aparece de verdade. Cobertura por tipo de dado brasileiro, mesma régua, mesmo dia.
Os três motores foram medidos na mesma régua, no mesmo dia, com a mesma métrica.
O Privacy Filter da OpenAI é um modelo aberto, gratuito e tecnicamente muito bom — e é honesto dizer isso. Ele detecta oito categorias genéricas: conta, endereço, e-mail, pessoa, telefone, URL, data e segredo. É uma ferramenta feita para o mundo inteiro.
Como account_number é uma categoria genérica, ela acaba
pegando boa parte dos números brasileiros. O preço disso aparece em duas
colunas: ela marca 8,46% dos caracteres em documentos que não têm
nenhum dado pessoal — contra 0,02% nossos — e não sabe o que
marcou. Para o modelo dela, CPF, CNPJ e número de processo são a
mesma coisa.
Saber o que é cada dado não é detalhe estético. É o que permite desfazer a troca corretamente e é o que a LGPD pede quando pergunta quais categorias de dado a sua empresa trata.
Escrevemos isso porque um produto de privacidade que exagera na promessa é a primeira coisa que um advogado desmonta — e ele tem razão em desmontar.
Cole um texto ou suba um arquivo. Leva segundos. Pede só o seu e-mail — o seu WhatsApp é opcional, se você quiser. O dado do seu cliente é que não fica aqui.
Voltar e testar Ver planos e preço