A média esconde o problema
Uma API pode responder em 10 ms na maior parte do tempo e ainda oferecer uma experiência ruim. A média dilui filas, pausas e contenções. O percentil 99 pergunta algo mais útil: quão lenta é a requisição de uma pessoa entre cem?
Latência é um orçamento
Rede, serialização, acesso a dados, sincronização e execução disputam o mesmo orçamento. Otimizar uma função isolada raramente compensa uma fila mal dimensionada ou uma chamada externa imprevisível.
Rust remove custos — não decisões
Controle de memória e abstrações de custo previsível ajudam muito, mas não eliminam contenção, backpressure ou trabalho excessivo. A linguagem oferece ferramentas; a arquitetura decide onde usá-las.
Meça sob pressão real
O p99 relevante nasce com concorrência, distribuição de carga e limites próximos dos encontrados em produção. Benchmark sem pressão costuma medir o caminho feliz — justamente o caminho que o percentil de cauda não representa.