FLUX 3 and Gemini 3.7 Flash are now live on CometAPI →
Nghiên cứu hiệu năng minh bạch

Điểm chuẩn độ trễ AI API: TTFT, thông lượng và độ tin cậy

Phương pháp minh bạch để đo lường độ trễ AI API mà không nhầm lẫn giữa thời gian đến token đầu tiên, tốc độ sinh token và tổng thời gian phản hồi.

Công cụ điểm chuẩn AI API đo lường các tín hiệu về độ trễ và thông lượng
CA
Nghiên cứu CometAPI
Kỹ thuật mô hình AI và API
Ngày 6 tháng 8 năm 2026 8 phút đọc

Điểm chính

TTFT đo lường khả năng phản hồi; số token mỗi giây đo lường tốc độ sinh token.
Sử dụng cùng phiên bản mô hình, prompt, mục tiêu đầu ra và chế độ streaming cho mọi route.
Báo cáo các giá trị trung vị và p95 thay vì chỉ đưa ra một yêu cầu nhanh nhất.
Công bố lỗi, thời gian chờ, khu vực và khoảng thời gian kiểm thử cùng với các số liệu hiệu năng.

Đo lường bốn tín hiệu độ trễ khác nhau

Một con số độ trễ duy nhất sẽ che khuất nơi người dùng phải chờ. Chat streaming có thể tạo cảm giác nhanh nhờ TTFT thấp ngay cả khi quá trình hoàn tất toàn bộ mất nhiều thời gian hơn, trong khi tác vụ trích xuất hàng loạt có thể chỉ quan tâm đến thời lượng đầu-cuối.

  • Thời gian đến token đầu tiên: khoảng thời gian từ lúc bắt đầu yêu cầu đến khi nhận được token đầu tiên qua streaming.
  • Thông lượng sinh token: số token đầu ra chia cho thời gian sinh token.
  • Thời lượng đầu-cuối: khoảng thời gian từ lúc bắt đầu yêu cầu đến khi nhận được phản hồi hoàn chỉnh.
  • Độ tin cậy: số phản hồi thành công chia cho tổng số lần thử.

Kiểm soát khối lượng công việc điểm chuẩn

Sử dụng một tập prompt cố định đại diện cho khối lượng công việc dự kiến. Ghi lại ID mô hình, route của nhà cung cấp, khu vực, các tham số yêu cầu, số token đầu vào và độ dài đầu ra được yêu cầu.

  • Thực hiện các yêu cầu khởi động trước khi ghi nhận số liệu đo lường.
  • Ngẫu nhiên hóa thứ tự nhà cung cấp để giảm sai lệch theo thời điểm trong ngày.
  • Lặp lại các bài kiểm thử trong nhiều khoảng thời gian có lưu lượng khác nhau.
  • Tách riêng kết quả streaming và không streaming.

Sử dụng phân phối thay vì ảnh chụp bảng xếp hạng

Báo cáo các giá trị trung vị, p90 và p95 cùng với kích thước mẫu. Một route có giá trị trung vị nhanh nhất nhưng thường xuyên xuất hiện độ trễ cực lớn có thể mang lại trải nghiệm production kém hơn so với một route chậm hơn đôi chút nhưng ổn định hơn.

{
  "sample_size": 100,
  "ttft_ms": { "median": 640, "p95": 1840 },
  "output_tokens_per_second": { "median": 42.1 },
  "end_to_end_ms": { "median": 5120, "p95": 9080 },
  "success_rate": 0.98
}

Các giá trị trên là định dạng báo cáo mang tính minh họa, không phải kết quả điểm chuẩn CometAPI trực tiếp.

Công bố phương pháp trong mọi báo cáo

Một điểm chuẩn chỉ hữu ích khi người đọc có thể hiểu nội dung được đo lường và tái tạo phương pháp thực hiện. Hãy nêu rõ các giới hạn, đồng thời giải thích liệu route của nhà cung cấp có được cố định hay được tự động lựa chọn.

Câu hỏi thường gặp

TTFT trong AI API là gì?

Thời gian đến token đầu tiên là khoảng thời gian từ lúc gửi yêu cầu đến khi nhận được token đầu tiên do mô hình sinh ra trong một phản hồi streaming.

AI API nhanh nhất có luôn là route tốt nhất không?

Không. Việc lựa chọn cho production cũng cần xem xét tỷ lệ lỗi, độ trễ p95, chất lượng đầu ra, chi phí và việc route đó có hỗ trợ các tính năng bắt buộc hay không.

Tiếp tục với Điểm chuẩn và Báo cáo
Quay lại tổng quan phần và các bài viết sắp tới.
Xem phần