
基準與報告 / 範例
AI API 延遲基準測試:TTFT、吞吐量與可靠性
一套透明的方法,用於測量 AI API 延遲,而不混淆首 token 時間、生成速度與端到端回應時間。
TTFT 衡量回應速度;tokens 每秒衡量生成速度。
對每條路由都使用相同的模型版本、提示詞、輸出目標與串流模式。
回報中位數與 p95 值,而不是單一最快請求。
在效能數據旁一併公開錯誤、逾時、區域與測試窗口。
用可重複的方法比較模型品質、延遲、吞吐量、價格與供應商可靠性。

第一篇文章展示此區塊會採用的編輯結構:直接答案、實作步驟、限制與 FAQ。

一套透明的方法,用於測量 AI API 延遲,而不混淆首 token 時間、生成速度與端到端回應時間。