FLUX 3 and Gemini 3.7 Flash are now live on CometAPI →
투명한 성능 연구

AI API 지연 시간 벤치마크: TTFT, 처리량 및 신뢰성

time-to-first-token, 생성 속도, 총 응답 시간을 혼동하지 않고 AI API 지연 시간을 측정하기 위한 투명한 방법론입니다.

지연 시간과 처리량 신호를 측정하는 AI API 벤치마크 계측기
CA
CometAPI 리서치
AI 모델 및 API 엔지니어링
2026년 8월 6일 8 분 읽기

핵심 요점

TTFT는 응답성을 측정하고, tokens per second는 생성 속도를 측정합니다.
모든 경로에 동일한 모델 버전, 프롬프트, 출력 대상, 스트리밍 모드를 사용하세요.
가장 빠른 단일 요청 대신 중앙값과 p95 값을 보고하세요.
성능 수치와 함께 오류, 타임아웃, 리전, 테스트 구간을 공개하세요.

네 가지 서로 다른 지연 신호 측정

단일 지연 시간 수치는 사용자가 어디에서 기다리는지 숨깁니다. 스트리밍 채팅은 낮은 TTFT로 빠르게 느껴질 수 있지만 전체 완료에는 더 오래 걸릴 수 있으며, 배치 추출은 종단 간 소요 시간만 중요할 수 있습니다.

  • 첫 토큰까지의 시간: 요청 시작부터 첫 스트리밍 토큰까지의 시간.
  • 생성 처리량: 출력 토큰 수를 생성 시간으로 나눈 값.
  • 종단 간 소요 시간: 요청 시작부터 응답 완료까지의 시간.
  • 신뢰성: 전체 시도 횟수 대비 성공한 응답의 비율.

벤치마크 워크로드 제어

의도한 워크로드를 대표하는 고정 프롬프트 집합을 사용하세요. model ID, provider route, region, request parameters, input tokens, 요청된 출력 길이를 기록하세요.

  • 측정 기록 전에 워밍업 요청을 실행하세요.
  • 시간대 편향을 줄이기 위해 provider 순서를 무작위화하세요.
  • 하나 이상의 트래픽 구간에서 테스트를 반복하세요.
  • 스트리밍 결과와 비스트리밍 결과를 분리해서 유지하세요.

리더보드 스크린샷이 아닌 분포를 사용

샘플 크기와 함께 중앙값, p90, p95 값을 보고하세요. 중앙값은 가장 빠르지만 극단적 지연이 자주 발생하는 경로는, 약간 느리지만 더 안정적인 경로보다 프로덕션 경험이 나쁠 수 있습니다.

{
  "sample_size": 100,
  "ttft_ms": { "median": 640, "p95": 1840 },
  "output_tokens_per_second": { "median": 42.1 },
  "end_to_end_ms": { "median": 5120, "p95": 9080 },
  "success_rate": 0.98
}

위 값들은 실제 CometAPI 벤치마크 결과가 아니라 예시 보고 형식입니다.

모든 보고서에 방법론 공개

벤치마크는 무엇이 측정되었는지 독자가 이해하고 접근 방식을 재현할 수 있을 때만 유용합니다. 제한 사항을 포함하고, provider route가 고정되었는지 자동 선택되었는지 설명하세요.

자주 묻는 질문

AI API에서 TTFT는 무엇인가요?

첫 토큰까지의 시간은 요청을 보낸 시점부터 스트리밍 응답에서 첫 생성 토큰을 수신할 때까지의 지속 시간입니다.

가장 빠른 AI API가 항상 최적의 경로인가요?

아닙니다. 프로덕션 선택에서는 오류율, p95 지연 시간, 출력 품질, 가격, 그리고 해당 경로가 필요한 기능을 지원하는지도 함께 고려해야 합니다.

벤치마크 및 보고서 계속 보기
섹션 개요와 향후 글로 돌아가기.
섹션 보기