Uma rodada de caça-regressão automática (6.000 textos + ~600 adversariais) concluiu: "reverter para o modelo antigo — 20 dados que ele cobria e o novo deixou passar". Antes de obedecer, reproduzimos os 20.
O que a reprodução mostrou
Os 20 eram o mesmo caso: um dígito 0 no lugar da letra
o dentro de uma única frase-molde de seis palavras. E no caso
real: (a) o modelo antigo também vazava ali — pegava "Silva" e deixava
"R0drig0"; (b) com frase de tamanho normal o novo pega o nome inteiro e o
antigo, só metade; (c) o ruído real de OCR é a letra O maiúscula,
não o dígito — um PNG rodado pelo caminho de produção saiu anonimizado
certo.
Veredito de "reverter produção" tem de reproduzir a perda pelo caminho real do produto — não só no corpus sintético.
A fraqueza é real, mas estreita, e virou duas coisas: um caso de regressão automática (a bateria agora gera um recibo PNG com nome corrompido a cada rodada) e matéria-prima do próximo treino (a bateria de ruído).