MIA Privacy / Documentação Testar grátis Planos
24/26 Teste planejado · Planejado

Bateria de ruído de OCR e nomes corrompidos

O↔0, l↔1, acento comido: a fraqueza estreita achada pela rodada adversarial vira bateria sistemática — e depois, dado de treino.

Situação: especificado, com 1 caso já em regressão

A rodada adversarial de agosto achou uma fraqueza real e estreita: nome corrompido por dígito (R0drig0) em frase muito curta escapa do modelo (o veredito do modelo). Um caso desse já roda como regressão automática — a bateria gera um recibo PNG com nome corrompido a cada rodada.

O que a bateria completa vai cobrir

As trocas típicas de OCR e de digitação, medidas separadamente: O↔0, l↔1↔I, rn↔m, acento perdido (José→Jose), espaçamento quebrado (J o ã o), caixa alta de scanner. Para cada classe: taxa de detecção com o motor atual, no caminho real do produto (imagem → OCR → anonimização), não em frase de laboratório.

O destino dos casos

Cada classe que reprovar vira dado de treino sintético da próxima rodada do modelo — o gerador de corpus já produz variações; falta ligar as classes de ruído nele com medição antes/depois.