
Benchmarks e Relatórios / Exemplo
Benchmark de Latência de API de IA: TTFT, Throughput e Confiabilidade
Uma metodologia transparente para medir a latência de API de IA sem confundir o tempo até o primeiro token, a velocidade de geração e o tempo total de resposta.
TTFT mede a capacidade de resposta; tokens por segundo medem a velocidade de geração.
Use a mesma versão do modelo, prompt, meta de saída e modo de streaming para cada rota.
Informe os valores de mediana e p95 em vez de uma única solicitação mais rápida.
Publique erros, timeouts, região e janela de teste junto com os números de desempenho.