A maioria das ferramentas mede o próprio modelo com dados parecidos com os do treino — o número sai lindo e não significa nada. Nós montamos uma régua separada: puxamos 1.000 processos públicos da API DataJud do Conselho Nacional de Justiça, de dez tribunais, para ter estrutura de documento real (vara, comarca, classe, movimentação, número de processo com dígito de verdade). Em cima disso plantamos dado pessoal sintético, com dígito verificador válido, em posição conhecida.
Nenhum dado pessoal real, de ninguém, em momento algum. E como nós plantamos cada dado, sabemos exatamente onde ele está — a correção é perfeita, sem ninguém marcando à mão.
As armadilhas são de propósito
Cem dos 600 documentos não têm nenhum dado pessoal e existem só para medir falso positivo. Eles carregam pegadinhas reais: "Vara Única da Comarca de Piranga" e "Casimiro de Abreu" — nomes de lugar que todo modelo confunde com nome de gente.
O limite declarado
A régua usa estrutura real, mas o dado plantado é sintético. O teste realmente cego é documento de cliente — e ele está na fila (o teste cego).