TL;DR
沒有放諸四海皆準的最佳語音轉文字 API。針對錄製音訊,AssemblyAI Universal-2 與 Google Dynamic Batch 是低成本且有力的起點。針對即時字幕與語音代理,Deepgram、AssemblyAI 與 ElevenLabs 值得優先測試。當產品其他部分已使用 OpenAI SDK 時,OpenAI 具備便利性;而在既有雲端架構中,AWS 與 Google 可能降低營運摩擦。
不要只看每分鐘單價。實際生產成本還取決於聲道計費、語者分離與敏感資訊遮蔽費用、p95 定稿延遲、重試、資料條款,以及每條被接受逐字稿的人工作業分鐘數。
如何選擇語音轉文字 API:應先測哪個供應商?
先從你的工作負載出發,而不是追求通用排名。正確的語音轉文字 API 取決於你是否需要低成本批次轉錄、低延遲串流、多語支援、語者分離,或與既有雲端堆疊更緊密的整合。
使用下列精選清單決定哪些供應商應列入你的第一輪基準測試。
| 工作負載 | 首選 | 原因 | 關鍵決策測試 |
|---|---|---|---|
| 大量錄製檔案庫 | AssemblyAI Universal-2, Google Dynamic Batch, OpenAI gpt-4o-mini-transcribe | 已公布的錄製音訊單價較低 | 佇列時間、長檔處理、格式化品質與校訂分鐘數 |
| 即時字幕或語音代理 | Deepgram Nova-3 or Flux, AssemblyAI Realtime, ElevenLabs Scribe v2 Realtime | 具備部分結果與輪次偵測流程的串流 API | 穩定部分結果延遲、定稿延遲、中斷與重新連線表現 |
| 聯絡中心通話 | AWS Transcribe, Google Cloud STT, Deepgram, AssemblyAI | 聲道處理、語者分離、詞彙控制與遮蔽選項 | 逐聲道計費、重疊語音、PII 政策與區域處理 |
| 多語會議或媒體 | AssemblyAI Universal-3.5 Pro, ElevenLabs Scribe v2, Deepgram Nova-3 Multilingual, OpenAI transcription models | 廣泛語言覆蓋或語碼轉換支援 | 以你的實際語言配對、口音、姓名、時間戳與混用語言片段為準 |
語音轉文字 API 價格比較:2026 年現況快照
下表將公開牌價標準化為每小時音訊,便於掃描比較。這並不代表品質、延遲、功能覆蓋或商務條款相同。促銷、低優先序與高用量價格已標註,因其與一般入門價不具可比性。
| 供應商 | 最佳生產環境適配 | 錄製或非同步單價 | 即時或標準單價 | 最重要注意事項 |
|---|---|---|---|---|
| OpenAI | 既有 OpenAI 應用與簡單的上傳式轉錄 | gpt-4o-mini-transcribe: $0.18/hr; gpt-4o-transcribe: $0.36/hr | gpt-realtime-whisper: $1.02/hr | 上傳大小限制為 25 MB。字級 timestamp_granularities[] 僅於 whisper-1 有文件說明;語者分離使用獨立模型,且 Realtime API 不支援。 |
| Deepgram | 串流控制、即時字幕與語音代理管線 | Nova-3 Monolingual pre-recorded: $0.462/hr | Nova-3 Monolingual streaming: $0.288/hr promotional | 語者分離與遮蔽各加收 $0.0020/min;關鍵詞提示加收 $0.0013/min。標示費率預設加入 Model Improvement Program。 |
| AssemblyAI | 低成本錄製轉錄與清晰的功能定價 | Universal-2: $0.15/hr; Universal-3.5 Pro: $0.21/hr | Universal-Streaming: $0.15/hr; Universal-3.5 Pro Realtime: $0.45/hr | 多聲道檔案按聲道計費。$0.15/hr 的串流路線僅支援英文或六種語言,並非 Universal-2 的完整 99 種語言覆蓋。 |
| Google Cloud Speech-to-Text V2 | GCP 原生工作負載與低優先序封存 | Dynamic Batch: $0.18/hr | 標準辨識:前 500,000 每月分鐘 $0.96/hr | Dynamic Batch 以較低緊急度處理。每個音訊聲道分別計費。 |
| Amazon Transcribe | AWS 原生聯絡中心與雙聲道通話音訊 | 依區域與用量分級;官方 US East 200 萬分鐘範例:$0.36/hr | 官方 US East 200 萬分鐘範例:$0.60/hr | 以上為高用量範例,非通用入門價。請求以 15 秒為最低計費;時長費用包含最多兩個聲道。 |
| ElevenLabs Scribe | 多語媒體、詞級時間戳與快速即時實驗 | Scribe v2: $0.22/hr | Scribe v2 Realtime: $0.39/hr | 實體偵測加收 $0.07/hr,關鍵詞提示加收 $0.05/hr。廠商標示的延遲不包含你的網路與應用程式路徑。 |
開發者捷徑: 若你的精選清單包含 Whisper、GPT-4o Transcribe,或其他目前由 CometAPI 支援的語音模型,請查看即時模型目錄與定價,並使用相容 OpenAI 的快速開始將同一段音訊走過支援的路線。在建立基準測試前,確認確切的模型 ID 與端點。
供應商詳解:6 大 API 對比
1. OpenAI:最適合已使用 OpenAI SDK 的團隊
OpenAI 的定價頁估計,gpt-4o-mini-transcribe 的轉錄費用為每分鐘 $0.003,gpt-4o-transcribe 為每分鐘 $0.006。專用的 gpt-realtime-whisper 路線約為每分鐘 $0.017。
對已使用 OpenAI SDK 進行驗證、日誌、重試與模型治理的團隊而言,OpenAI 是務實的首選。gpt-4o-transcribe 與 gpt-4o-mini-transcribe 皆支援提示,能改善產品名、縮寫、人名與領域專有詞彙的辨識。若錄音需要語者識別,獨立的 gpt-4o-transcribe-diarize 模型可回傳帶說話者標籤的片段,並能以短參考片段將其與已知說話者關聯。
主要限制偏向架構層面,而非單純價格。上傳檔案限制為 25 MB,字級 timestamp_granularities[] 的文件僅見於 whisper-1,且語者分離模型不支援 Realtime API。處理長錄音、即時對話或說話者眾多的聯絡中心音訊的團隊,應在定型之前測試檔案處理、時間戳需求與說話者歸屬。請參閱官方的 OpenAI speech-to-text 文件了解目前端點行為與支援的輸出格式。
希望使用 GPT-4o Transcribe 同時降低直接 API 成本的團隊,也可參考 CometAPI 上的 GPT-4o Transcribe API。撰寫本文時,CometAPI 顯示的費率低於 OpenAI 直接 API 的標準定價,且維持相容 OpenAI 的整合路徑。基準測試前請檢視實際模型頁面,因為價格、可用性與支援參數可能變動。
先測試 OpenAI 的時機: 你的應用已使用相容 OpenAI 的工具,大多數音訊為上傳而非連續串流,且減少整合複雜度比專門的串流或聯絡中心控制更重要。
2. Deepgram:最適合串流控制與語音代理管線
Deepgram 的定價頁顯示,Nova-3 Monolingual 串流的限時價格為每分鐘 $0.0048,Nova-3 Multilingual 為每分鐘 $0.0058。相對應的預錄付費即用價格分別為每分鐘 $0.0077 與 $0.0092。Flux 主打對話型語音代理的輪次偵測與中斷處理。
Deepgram 值得列入即時產品的精選清單,因為串流行為與最終逐字稿的準確度同等重要。語音介面需要有用的部分結果、可靠的端點判定、自然的中斷處理與可預測的定稿,而不是在通話結束後才產出漂亮的逐字稿。
請將附加功能納入模型預算。語者分離與遮蔽各加收每分鐘 $0.0020;關鍵詞提示加收每分鐘 $0.0013。Deepgram 並聲明其標示費率會將使用者預設加入 Model Improvement Program,因此資料使用規範較嚴的團隊應確認替代的商務條款。
先測試 Deepgram 的時機: 主要需求是輪流說話、低延遲部分結果、串流控制或語音代理行為。
3. AssemblyAI:最適合低成本錄製路線與透明附加定價
AssemblyAI 的定價列出 Universal-2 為每小時 $0.15,Universal-3.5 Pro 為每小時 $0.21。Universal-2 支援 99 種語言;Universal-3.5 Pro 支援 18 種語言並具備語碼轉換與更高階模型。
即時產品線分開計價。Universal-Streaming 英文為每小時 $0.15;Universal-Streaming Multilingual 以相同價格支援英語、西班牙語、德語、法語、葡萄牙語與義大利語。Universal-3.5 Pro Realtime 每小時 $0.45,支援 18 種語言。
AssemblyAI 的明確附加功能矩陣有助規劃預算:錄製語者分離每小時 $0.02,即時語者分離每小時 $0.12;Universal-Streaming 的關鍵詞提示每小時 $0.04。多聲道檔案會按聲道計費,可能改變立體聲通話的結果。
先測試 AssemblyAI 的時機: 重視錄製音訊的低成本、廣泛語言覆蓋、清楚的功能定價,或需要簡單的非同步流程。
4. Google Cloud Speech-to-Text:最適合 Dynamic Batch 與 GCP 原生工作負載
Google Cloud Speech-to-Text V2 定價列出 Dynamic Batch 為每分鐘 $0.003,標準辨識在每月前 500,000 分鐘為每分鐘 $0.016。使用量更高時標準價格會下降。
Dynamic Batch 對不急著完成的封存很有吸引力,但較低價格綁定較低處理優先度。Google 也會將每個音訊聲道分別計費:一個 30 秒、四聲道的請求會以 120 秒音訊計費。
當音訊已在 Cloud Storage,且團隊使用 GCP 的身分、日誌、區域端點與計費控管時,Google 在營運上通常更具吸引力。請將儲存、傳輸與相鄰雲端服務納入總成本模型,而非將轉錄視為孤立項目。
先測試 Google 的時機: 重視大型非急件封存、GCP 原生作業、區域部署或調適功能,而非最簡單的價目表。
5. Amazon Transcribe:最適合 AWS 原生聯絡中心音訊
Amazon Transcribe 定價隨區域與每月使用量分級。AWS 對於每月 200 萬分鐘的 US East 公開範例為批次每分鐘 $0.006、串流每分鐘 $0.01。這些數字屬高用量範例,非一般入門報價。
使用量以每秒計費,單次請求至少 15 秒。標準定價包含自訂詞彙、詞彙過濾、語者分離與語言識別;自動內容遮蔽與自訂語言模型需額外付費。
AWS 的時長計費包含最多兩個聲道。對於立體聲客服通話,此規則可能比按每個聲道分開計費更有利。
先測試 AWS 的時機: 通話已在 AWS 流轉、雙聲道計費具價值,或 IAM、儲存、安全與採購整合比最低牌價更重要。
6. ElevenLabs Scribe:最適合多語媒體與快速即時實驗
ElevenLabs API 定價列出 Scribe v2 每小時 $0.22,Scribe v2 Realtime 每小時 $0.39。產品包含多語轉錄、詞級時間戳、語者分離、音訊標記,以及可選的關鍵詞與實體功能。
Scribe v2 Realtime 宣稱模型延遲較低,但使用者應測量從麥克風擷取到目標區域與傳輸堆疊中的穩定文本整條路徑的實際延遲。廠商標示的延遲不包含你的 WebSocket 處理、網路路徑、緩衝、UI 更新或下游代理邏輯。
實體偵測每小時加收 $0.07,關鍵詞提示每小時加收 $0.05。若產品需要兩者,請將其納入每條被接受逐字稿的成本中。
先測試 ElevenLabs 的時機: 多語媒體、詞級時間、音訊標籤或快速的即時原型是核心需求。
總持有成本:可能顛倒排名的隱形費用
多聲道計費
一小時的立體聲通話不一定只算一小時計費。
| 路線 | 60 分鐘雙聲道通話的規劃計算 | 預估基礎成本 |
|---|---|---|
| AssemblyAI Universal-2 | 1 小時 × 2 聲道 × $0.15/hr | $0.30 |
| AWS Transcribe batch | 1 小時合計 × $0.36/hr | $0.36 |
| Google standard recognition | 1 小時 × 2 聲道 × $0.96/hr | $1.92 |
AWS 的數值採用供應商在 US East、每月 200 萬分鐘的官方範例。實際費率請以所在區域與月用量透過 AWS 計算器估算。
上表為計費示例,非聯絡中心能力排名。請在選擇路線前測試重疊語音、說話者交替、術語、遮蔽、定稿延遲與校訂工作量。
附加功能、重試與人工審校
Deepgram 的 Nova-3 Monolingual 預錄處理在加入語者分離後,從每分鐘 $0.0077 升至 $0.0097。再加上遮蔽則升至每分鐘 $0.0117,尚未含關鍵詞提示。AssemblyAI 對錄製語者分離每小時收 $0.02,對即時語者分離每小時收 $0.12。ElevenLabs 對實體偵測每小時收 $0.07,對關鍵詞提示每小時收 $0.05。
重試、重複 webhook、儲存與跨雲傳輸會增加成本而不提升逐字稿品質。請為每個任務記錄音訊秒數、聲道數、功能旗標、請求狀態、重試次數、模型版本、延遲與審校時間。
更理想的採購指標不是每分鐘音訊單價。 每條被接受逐字稿的成本 = API 處理 + 付費功能 + 重試 + 儲存/傳輸 + 人工校訂時間
假設審校人員成本為 $30/小時:
| 示意路線 | 每小時音訊 API 成本 | 人工校訂 | 校訂成本 | 被接受逐字稿總成本 |
|---|---|---|---|---|
| 較低價格路線 | $0.15 | 8 分鐘 | $4.00 | $4.15 |
| 較高價格路線 | $0.60 | 3 分鐘 | $1.50 | $2.10 |
第二條路線在 API 層成本高出四倍,但在審校後的總成本約為前者的一半。校訂時間為規劃假設,非供應商基準結果;請以實際流程中負責核准逐字稿的人員測得數據替代。
如何用真實音訊評估語音轉文字 API
供應商的準確度宣稱不可直接比較,因為各家使用不同的資料集、語言、正規化政策、模型版本與聲學條件。2026 年的 GigaSpeechBench 研究在 680 小時、人工標註的真實語音上評估了低資源語言、中文方言、英語口音、12 個垂直領域的術語,以及兒童與高齡者語音。結果顯示,主流模型與商用 API 在困難情境下的表現大幅下降。
真正有用的結論不是某個公開基準找到了永久贏家,而是你的測試集必須像你的實際流量。
使用貼近生產的評測集
- 20 段包含姓名與領域術語的乾淨會議或訪談
- 20 通有噪音的客服來電,包含中斷、保留音樂、交談重疊與聲道變化
- 20 段帶口音或多語的片段,包含真正的語碼轉換
- 10 段長篇 podcast 或影片檔
- 10 段帶有靜默、遲疑、語塞與搶話的短即時語句
評估指標不只詞錯誤率
| 指標 | 測量內容 | 為何重要 |
|---|---|---|
| 詞錯誤率 | 在一致正規化政策下的插入、刪除與替換 | 衡量詞彙準確度,但不足以反映逐字稿的可用性 |
| 專名與關鍵詞準確度 | 產品名、人名、地名、縮寫、數字與產業詞彙 | 少量專有名詞錯誤即可造成大量審校工作 |
| 語者歸屬 | 錯配的詞與漏掉的語者切換 | 對通話、訪談、合規與分析至關重要 |
| 格式化品質 | 標點、大小寫、段落、數字、日期與語氣詞 | 決定發佈或分析前的清理時間 |
| 批次回轉時間 | 短長檔案自上傳至完成的 p50 與 p95 | 價格較低的低優先路線可能無法滿足營運時限 |
| 串流延遲 | 首個部分結果、穩定部分結果與最終文本在 p50 與 p95 | 平均延遲掩蓋了使用者實際感受到的停頓 |
| 可靠性 | 逾時、空結果、重試、重複 webhook 與回退比例 | 失敗會增加直接成本與使用者可見延遲 |
| 審校投入 | 每小時音訊的編輯分鐘數與被接受逐字稿比率 | 將輸出品質轉化為商務成本 |
七天評估計畫
- 定義接受契約。 設定必需語言、p95 延遲、語者標記容忍度、時間戳需求、保留規則與每小時音訊的最大審校分鐘數。
- 建立並標註音訊集。 使用具授權、貼近生產的音訊與一套共用的參考逐字稿政策。
- 統一整合。 匹配音訊格式、區域、詞彙提示、聲道配置、重試、逾時與模型版本。
- 執行錄製音訊測試。 量測成本、回轉時間、詞錯誤率、專名詞、格式、語者、失敗率與校訂時間。
- 執行即時音訊測試。 在 p50 與 p95 測量穩定部分結果、定稿延遲、端點判定、中斷處理與重新連線行為。
- 計算被接受逐字稿成本。 納入聲道、附加功能、重試、儲存、傳輸與審校時間。
- 制定路由策略。 最佳生產設計可能對英文即時通話、多語會議與低優先序封存採用不同路線。
簽約前的生產檢查清單
- 分別測試錄製與即時模型;其價格、語言與行為可能不同。
- 測量穩定部分結果與定稿,而非僅看首字出現時間。
- 在重疊語音上比較雙聲道識別與單聲道語者分離。
- 強制出現逾時、格式錯誤音訊、空回應、連線中斷、webhook 重送與速率限制錯誤。
- 驗證檔案大小、會話時長、並發、速率限制與長檔案工作流程。
- 確認保留、模型改進使用、區域處理、刪除控制、加密、DPA 或 BAA 可用性與分處理商,且針對實際方案核對。
- 儲存模型版本、音訊秒數、聲道、附加功能、請求成本、重試、延遲、審校分鐘數與接受狀態。
- 價格或模型變更後重新測試,不要假設先前的贏家持續最佳。
依工作負載篩選供應商,並用相同的音訊、設定與接受標準進行基準測試。對多數團隊而言,務實的第一輪應包含:一條低成本錄製路線、一條專長的串流路線,以及一條已與既有雲端或 SDK 堆疊契合的供應商路線。
透過 CometAPI 測試受支援的語音模型
評估相容 OpenAI 的受支援語音模型的團隊可依循 CometAPI 快速開始,透過統一路徑送出初始轉錄請求。
CometAPI 可簡化受支援模型的驗證、計費與用戶端整合。進入生產前,請驗證各模型支援的格式、限制、隱私條款、延遲與計費行為。
常見問題
2026 年最好的語音轉文字 API 是什麼?
沒有單一適用於所有工作負載的贏家。AssemblyAI 與 Google Dynamic Batch 是低成本錄製音訊的強力候選。Deepgram、AssemblyAI 與 ElevenLabs 值得優先測試即時轉錄。當處於相容 OpenAI 的堆疊時,OpenAI 具備便利性;在各自雲端中,AWS 與 Google 可能在營運上更簡單。
錄製音訊最便宜的語音轉文字 API 是哪個?
在此標準化的公開路線中,AssemblyAI Universal-2 起價為每小時 $0.15。Google Dynamic Batch 與 OpenAI gpt-4o-mini-transcribe 約為每小時 $0.18。最終成本會隨聲道數、用量級距、附加功能、重試、儲存、傳輸與人工校訂而變動。
哪個 API 最適合即時轉錄或語音代理?
先從 Deepgram、AssemblyAI 與 ElevenLabs 開始,當其生態或語言支援合適時,再納入 OpenAI、AWS 或 Google。請在你自己的即時流量型態上比較穩定部分結果、端點判定、定稿延遲、中斷處理、重新連線行為與 p95 延遲。
我該如何比較語音轉文字的準確度?
對所有供應商使用相同的授權音訊、區域、模型設定與正規化政策。除了回報詞錯誤率外,也請同時回報專名準確度、語者歸屬、格式化、p95 延遲、失敗率,以及每小時音訊的編輯分鐘數。不要將不同的供應商基準結果混為通用排名。
