MIA Privacy / Documentação Testar grátis Planos
13/26 Medição · Capacidade

Escala medida: onde o produto satura de verdade

Medido, não estimado: o modelo satura a ~21 req/s por unidade; a camada web custa 11% e o modelo 89%. Um milhão de textos/dia cabe em 2-3 unidades.

Medido em: 28/ago/2026

~21 req/ssaturação por unidade
89%do custo é o modelo
11%é a camada web
2-3unidades p/ 1M/dia

Antes de discutir arquitetura de escala, medimos onde dói: o gargalo é a inferência do modelo (89% do custo), não o framework web (11%). Trocar de framework, linguagem ou runtime atacaria os 11% — por isso o veredito foi "não" para essa classe inteira de proposta.

O que os números dizem

O modelo satura a ~21 req/s por unidade na concorrência atual; o app inteiro entrega 18,7. Um achado contraintuitivo: mais threads por inferência derruba a vazão — com 2 threads, 23,8 req/s; com 4, 20,7; com 12, 13,9. Paralelismo entre pedidos vence paralelismo dentro do pedido.

O caminho de crescimento

Réplicas horizontais funcionam com uma ressalva de privacidade deliberada: o mapa apelido→valor da ponte vive só em memória de propósito (gravar em disco quebraria a promessa). O plano de réplicas está na réplicas e fila.