A medição (a medição de escala) definiu o plano — e, igualmente importante, o que não fazer (trocar framework/linguagem ataca os 11% errados).
O que será testado, na ordem
1. Ajuste de threads: 2 threads por inferência renderam +14% de
vazão na bancada; falta aplicar e medir em produção.
2. Réplicas do motor: 2 unidades do modelo atrás de um balanceador —
teste de carga com o dobro da saturação atual.
3. Batching em GPU: para o salto de ordem de grandeza (1M/hora),
medindo custo por milhão.
4. Fila assíncrona para os trabalhos pesados (documento grande, OCR,
ingestão) — o usuário acompanha o andamento em vez de segurar a conexão.
A restrição inegociável
O mapa apelido→valor da ponte vive só em memória, de propósito — persistir para facilitar réplica quebraria a promessa de que o dado real não fica no servidor. Toda arquitetura de réplica tem de respeitar isso; a que não respeitar, não sobe.