Antes de discutir arquitetura de escala, medimos onde dói: o gargalo é a inferência do modelo (89% do custo), não o framework web (11%). Trocar de framework, linguagem ou runtime atacaria os 11% — por isso o veredito foi "não" para essa classe inteira de proposta.
O que os números dizem
O modelo satura a ~21 req/s por unidade na concorrência atual; o app inteiro entrega 18,7. Um achado contraintuitivo: mais threads por inferência derruba a vazão — com 2 threads, 23,8 req/s; com 4, 20,7; com 12, 13,9. Paralelismo entre pedidos vence paralelismo dentro do pedido.
O caminho de crescimento
Réplicas horizontais funcionam com uma ressalva de privacidade deliberada: o mapa apelido→valor da ponte vive só em memória de propósito (gravar em disco quebraria a promessa). O plano de réplicas está na réplicas e fila.