MIA Privacy / Documentação Testar grátis Planos
26/26 Teste planejado · Planejado

Réplicas, GPU e fila: o plano de crescer sem quebrar a promessa

O estudo de escala já disse onde dói (o modelo, 89%). O plano: réplicas do motor, batching em GPU e fila assíncrona — sem nunca gravar o mapa em disco.

Situação: plano medido, execução por demanda

A medição (a medição de escala) definiu o plano — e, igualmente importante, o que não fazer (trocar framework/linguagem ataca os 11% errados).

O que será testado, na ordem

1. Ajuste de threads: 2 threads por inferência renderam +14% de vazão na bancada; falta aplicar e medir em produção.
2. Réplicas do motor: 2 unidades do modelo atrás de um balanceador — teste de carga com o dobro da saturação atual.
3. Batching em GPU: para o salto de ordem de grandeza (1M/hora), medindo custo por milhão.
4. Fila assíncrona para os trabalhos pesados (documento grande, OCR, ingestão) — o usuário acompanha o andamento em vez de segurar a conexão.

A restrição inegociável

O mapa apelido→valor da ponte vive só em memória, de propósito — persistir para facilitar réplica quebraria a promessa de que o dado real não fica no servidor. Toda arquitetura de réplica tem de respeitar isso; a que não respeitar, não sobe.