A rodada adversarial de agosto achou uma fraqueza real e estreita: nome
corrompido por dígito (R0drig0) em frase muito curta escapa do
modelo (o veredito do modelo). Um caso desse já roda
como regressão automática — a bateria gera um recibo PNG com nome corrompido
a cada rodada.
O que a bateria completa vai cobrir
As trocas típicas de OCR e de digitação, medidas separadamente:
O↔0, l↔1↔I, rn↔m, acento perdido
(José→Jose), espaçamento quebrado (J o ã o), caixa alta de scanner. Para
cada classe: taxa de detecção com o motor atual, no caminho real do produto
(imagem → OCR → anonimização), não em frase de laboratório.
O destino dos casos
Cada classe que reprovar vira dado de treino sintético da próxima rodada do modelo — o gerador de corpus já produz variações; falta ligar as classes de ruído nele com medição antes/depois.