TL;DR
Не существует универсально лучшего API преобразования речи в текст. AssemblyAI Universal-2 и Google Dynamic Batch — сильные недорогие стартовые варианты для записанного аудио. Deepgram, AssemblyAI и ElevenLabs стоит тестировать ранними для лайв-субтитров и голосовых агентов. OpenAI удобен, когда остальная часть продукта уже использует OpenAI SDK, а AWS и Google могут снизить операционные издержки внутри существующего облачного стека.
Не выбирайте только по цене за минуту. Производственная стоимость также зависит от тарификации по каналам, сборов за диаризацию и маскирование, p95 латентности финализации, повторных попыток, условий использования данных и минут, которые человек тратит на исправление каждой принятой расшифровки.
How to Choose a Speech-to-Text API: Which Provider Should You Test First?
Начинайте с своего типа нагрузки, а не с универсального рейтинга провайдеров. Подходящий API преобразования речи в текст зависит от того, нужны ли низкая стоимость пакетной транскрипции, низкая латентность стриминга, мульти-языковая поддержка, разделение говорящих или более тесная интеграция с существующим облаком.
Используйте шортлист ниже, чтобы решить, какие провайдеры включить в первый бенчмарк.
| Workload | Start with | Why | Decision-breaking test |
|---|---|---|---|
| Large recorded archive | AssemblyAI Universal-2, Google Dynamic Batch, OpenAI gpt-4o-mini-transcribe | Низкие опубликованные цены на обработку записанного аудио | Время ожидания в очереди, обработка длинных файлов, форматирование и минуты на исправления |
| Live captions or voice agents | Deepgram Nova-3 or Flux, AssemblyAI Realtime, ElevenLabs Scribe v2 Realtime | Потоковые API с частичными результатами и рабочими потоками определения очередности реплик | Задержка стабильных частичных результатов, задержка финализации, прерывания и переподключения |
| Contact-center calls | AWS Transcribe, Google Cloud STT, Deepgram, AssemblyAI | Обработка каналов, диаризация, управление словарём и опции маскирования | Тарификация по каналам, перекрывающаяся речь, политика PII и региональная обработка |
| Multilingual meetings or media | AssemblyAI Universal-3.5 Pro, ElevenLabs Scribe v2, Deepgram Nova-3 Multilingual, OpenAI transcription models | Широкое покрытие языков или поддержка переключения языков | Ваши реальные языковые пары, акценты, имена, временные метки и смешанные языковые сегменты |
Speech-to-Text API Pricing Comparison: 2026 Snapshot
Таблица нормализует публичные прайс-листы к одному часу аудио для ориентировочного сравнения. Она не подразумевает равенство качества, латентности, набора функций или коммерческих условий. Промо-ставки, пониженный приоритет и цены для больших объёмов помечены, потому что они не эквивалентны обычным базовым тарифам.
| Provider | Best production fit | Recorded or asynchronous price | Live or standard price | Most important caveat |
|---|---|---|---|---|
| OpenAI | Существующие приложения на OpenAI и простая загрузка для транскрипции | gpt-4o-mini-transcribe: $0.18/hr; gpt-4o-transcribe: $0.36/hr | gpt-realtime-whisper: $1.02/hr | Загрузки ограничены 25 MB. Word-level timestamp_granularities[] документированы только для whisper-1; диаризация использует отдельную модель и не поддерживается в Realtime API. |
| Deepgram | Контроль стриминга, лайв-субтитры и конвейеры голосовых агентов | Nova-3 Monolingual pre-recorded: $0.462/hr | Nova-3 Monolingual streaming: $0.288/hr promotional | Диаризация и маскирование добавляют по $0.0020/min; подсказки ключевых терминов добавляют $0.0013/min. Указанные ставки подразумевают участие в Model Improvement Program. |
| AssemblyAI | Недорогая транскрипция записей и чёткие цены на допфункции | Universal-2: $0.15/hr; Universal-3.5 Pro: $0.21/hr | Universal-Streaming: $0.15/hr; Universal-3.5 Pro Realtime: $0.45/hr | Мультиканальные файлы тарифицируются по каналам. Маршруты стриминга за $0.15/hr поддерживают английский или шесть языков, а не полное покрытие 99 языков в Universal-2. |
| Google Cloud Speech-to-Text V2 | GCP-нативные нагрузки и низкоприоритетные архивы | Dynamic Batch: $0.18/hr | Standard recognition: $0.96/hr for the first 500,000 monthly minutes | Dynamic Batch работает с пониженным приоритетом. Каждый аудиоканал тарифицируется отдельно. |
| Amazon Transcribe | AWS-нативный контакт-центр и двухканальное аудио звонков | Region- and volume-tiered; official 2M-minute US East example: $0.36/hr | Official 2M-minute US East example: $0.60/hr | Это примеры для больших объёмов, а не универсальные базовые цены. Минимум 15 секунд на запрос; до двух каналов включены в расчёт длительности. |
| ElevenLabs Scribe | Многоязычные медиа, тайминги слов и быстрые лайв-эксперименты | Scribe v2: $0.22/hr | Scribe v2 Realtime: $0.39/hr | Выделение сущностей добавляет $0.07/hr, подсказки ключевых терминов — $0.05/hr. Латентность вендора не включает вашу сеть и путь приложения. |
Быстрый путь для разработчиков: Если ваш шортлист включает Whisper, GPT-4o Transcribe или другую модель речи, поддерживаемую CometAPI, проверьте каталог живых моделей и цены и используйте совместимый с OpenAI быстрый старт, чтобы прогнать одно и то же аудио по поддерживаемым маршрутам. Подтвердите точный ID модели и endpoint перед построением бенчмарка.
Detailed Vendor Breakdown: The 6 APIs Compared
1. OpenAI: Best for Teams Already Using the OpenAI SDK
Страница цен OpenAI оценивает транскрипцию в $0.003 за минуту для gpt-4o-mini-transcribe и $0.006 за минуту для gpt-4o-transcribe. Маршрут gpt-realtime-whisper указан примерно как $0.017 за минуту.
OpenAI — практичный первый выбор для команд, уже использующих OpenAI SDK для аутентификации, логирования, повторных попыток и управления моделями. И gpt-4o-transcribe, и gpt-4o-mini-transcribe поддерживают prompting, что может улучшить распознавание названий продуктов, аббревиатур, имён и отраслевой лексики. Для записей, требующих идентификации говорящих, отдельная модель gpt-4o-transcribe-diarize может возвращать сегменты с метками говорящих и сопоставлять их с известными говорящими по коротким референсным клипам.
Главные ограничения носят архитектурный характер, а не только ценовой. Загрузки файлов ограничены 25 MB, word-level timestamp_granularities[] документированы для whisper-1, а модель диаризации недоступна через Realtime API. Командам, обрабатывающим длинные записи, живые разговоры или аудио контакт-центра с большим числом говорящих, стоит протестировать обработку файлов, требования к временным меткам и атрибуцию говорящих, прежде чем стандартизироваться на одном маршруте OpenAI. См. официальную документацию OpenAI по преобразованию речи в текст для текущего поведения endpoint'ов и поддерживаемых форматов вывода.
Команды, желающие использовать GPT-4o Transcribe при снижении прямых API-затрат, также могут посмотреть GPT-4o Transcribe API на CometAPI. На момент написания CometAPI предлагает доступ по ставкам ниже стандартных прямых цен OpenAI, сохраняя совместимый с OpenAI путь интеграции. Перед бенчмарком проверьте страницу модели, так как цены, доступность и поддерживаемые параметры могут измениться.
Тестируйте OpenAI первым, когда: ваше приложение уже использует совместимые с OpenAI инструменты, большинство аудио загружается, а не непрерывно стримится, и снижение сложности интеграции важнее специализированного стриминга или контролей контакт-центра.
2. Deepgram: Best for Streaming Control and Voice-Agent Pipelines
Страница цен Deepgram показывает ограниченные по времени ставки стриминга $0.0048 за минуту для Nova-3 Monolingual и $0.0058 за минуту для Nova-3 Multilingual. Соответствующие цены pay-as-you-go для предварительно записанного аудио — $0.0077 и $0.0092 за минуту. Flux позиционируется для разговорных голосовых агентов с определением очередности реплик и обработкой прерываний.
Deepgram должен быть в раннем шортлисте лайв-продуктов, потому что поведение стриминга столь же важно, как итоговая точность транскрипта. Голосовой интерфейс нуждается в полезных частичных результатах, надёжном endpointing'е, естественной обработке прерываний и предсказуемой финализации — а не только в чистой расшифровке после завершения звонка.
Закладывайте стоимость допфункций вместе с моделью. Диаризация и маскирование добавляют по $0.0020 за минуту; подсказки ключевых терминов — $0.0013 за минуту. Deepgram также отмечает, что указанные ставки подразумевают участие в Model Improvement Program, поэтому командам с более строгими требованиями к использованию данных следует проверить альтернативные коммерческие условия.
Тестируйте Deepgram первым, когда: первичны очередность реплик, низкая латентность частичных результатов, контроль стриминга или поведение голосового агента.
3. AssemblyAI: Best Low-Cost Recorded Route with Transparent Add-On Pricing
Цены AssemblyAI указывают Universal-2 по $0.15 за час аудио и Universal-3.5 Pro по $0.21 за час. Universal-2 поддерживает 99 языков; Universal-3.5 Pro поддерживает 18 языков с переключением языков и более продвинутым уровнем модели.
Линейка реального времени — отдельная. Universal-Streaming стоит $0.15 за час для английского, а Universal-Streaming Multilingual покрывает английский, испанский, немецкий, французский, португальский и итальянский по той же цене. Universal-3.5 Pro Realtime стоит $0.45 за час и поддерживает 18 языков.
Явная матрица допфункций AssemblyAI упрощает бюджетирование: диаризация для записей — $0.02 за час, диаризация в реальном времени — $0.12 за час, а подсказки ключевых терминов в Universal-Streaming — $0.04 за час. Мультиканальные файлы тарифицируются по каналам, что может изменить результат для стереозвонков.
Тестируйте AssemblyAI первым, когда: важны низкая стоимость для записанного аудио, широкое покрытие языков, понятные цены на функции или простой асинхронный процесс.
4. Google Cloud Speech-to-Text: Best for Dynamic Batch and GCP-Native Workloads
Цены Google Cloud Speech-to-Text V2 указывают Dynamic Batch по $0.003 за минуту и стандартное распознавание по $0.016 за минуту для первых 500,000 минут в месяц. Стандартные цены снижаются на более высоких объёмах.
Dynamic Batch привлекателен для архивов, не требующих срочного разворота, но низкая цена привязана к пониженной срочности обработки. Google также тарифицирует каждый аудиоканал отдельно: 30-секундный запрос с четырьмя каналами считается как 120 секунд обработанного аудио.
Google часто операционно удобен, когда аудио уже находится в Cloud Storage, а команда использует GCP для идентификации, логирования, региональных endpoint'ов и биллинга. Добавьте хранение, трансфер и смежные облачные сервисы в модель полной стоимости, а не рассматривайте транскрипцию как изолированную строку.
Тестируйте Google первым, когда: важнее большие несрочные архивы, GCP-нативные операции, региональное развёртывание или функции адаптации, чем самая простая таблица цен.
5. Amazon Transcribe: Best for AWS-Native Contact-Center Audio
Цены Amazon Transcribe варьируются по регионам и месячным объёмным уровням. Публичный пример AWS для US East на два миллиона минут в месяц использует $0.006 за минуту для пакетной обработки и $0.01 за минуту для стриминга. Это примеры для больших объёмов, а не обычные базовые ставки.
Использование тарифицируется по секундам с минимумом 15 секунд на запрос. Стандартные цены включают пользовательские словари, фильтрацию словаря, диаризацию и определение языка; автоматическое маскирование контента и пользовательские языковые модели стоят дополнительно.
AWS включает до двух каналов в расчёт длительности аудио. Для стереозвонков это правило может быть выгоднее, чем у провайдера, который тарифицирует каждый канал как отдельный час.
Тестируйте AWS первым, когда: звонки уже проходят через AWS, выгодна тарификация двух каналов или интеграция IAM, хранения, безопасности и закупок важнее самой низкой видимой базовой цены.
6. ElevenLabs Scribe: Best for Multilingual Media and Fast Real-Time Experiments
Цены ElevenLabs API указывают Scribe v2 по $0.22 за час и Scribe v2 Realtime по $0.39 за час. Продукт включает многоязычную транскрипцию, временные метки слов, диаризацию, тегирование аудио и опциональные функции ключевых терминов и сущностей.
Scribe v2 Realtime заявляет низкую латентность модели, но покупателю следует измерять весь путь от захвата микрофона до стабильного текста в целевом регионе и транспортном стеке. Латентность вендора не включает вашу обработку WebSocket, сетевой путь, буферизацию, обновления UI или последующую логику агента.
Выделение сущностей добавляет $0.07 за час, подсказки ключевых терминов — $0.05 за час. Включайте обе функции в стоимость принятой расшифровки, если они требуются продукту.
Тестируйте ElevenLabs первым, когда: центральны многоязычные медиа, тайминги слов, аудиотеги или быстрый прототип в реальном времени.
Total Cost of Ownership: Hidden Costs That Can Reverse the Ranking
Multichannel Billing
Часовой стереозвонок — это не всегда один биллинговый час.
| Route | Planning calculation for a 60-minute, two-channel call | Estimated base cost |
|---|---|---|
| AssemblyAI Universal-2 | 1 час × 2 канала × $0.15/hr | $0.30 |
| AWS Transcribe batch | 1 час итого × $0.36/hr | $0.36 |
| Google standard recognition | 1 час × 2 канала × $0.96/hr | $1.92 |
*Значение AWS использует официальный пример провайдера для US East на два миллиона минут в месяц. Используйте калькулятор AWS для фактического региона и месячного объёма.
Таблица — пример тарификации, а не рейтинг контакт-центров. Перед выбором маршрута протестируйте перекрывающуюся речь, смену говорящих, терминологию, маскирование, задержку финализации и усилия на исправления.
Add-Ons, Retries, and Human Review
Стоимость обработки Nova-3 Monolingual pre-recorded в Deepgram повышается с $0.0077 до $0.0097 за минуту при добавлении диаризации. Добавление маскирования повышает её до $0.0117 за минуту до подсказок ключевых терминов. AssemblyAI берёт $0.02 за час за диаризацию записей и $0.12 за час за диаризацию в реальном времени. ElevenLabs берёт $0.07 за час за выделение сущностей и $0.05 за час за подсказки ключевых терминов.
Повторные попытки, дублирующиеся вебхуки, хранение и межоблачный трансфер могут добавлять стоимость, не улучшая расшифровку. Логируйте секунды аудио, количество каналов, флаги функций, статус запросов, повторные попытки, версию модели, латентность и время ревью для каждой задачи.
Лучшей метрикой для закупки является не цена за минуту аудио. Стоимость принятой расшифровки = обработка API + платные функции + ретраи + хранение/трансфер + время человеческой правки
Предположим, что рецензент стоит $30 в час:
| Illustrative route | API cost for one audio hour | Human correction | Correction cost | Total accepted-transcript cost |
|---|---|---|---|---|
| Lower-price route | $0.15 | 8 минут | $4.00 | $4.15 |
| Higher-price route | $0.60 | 3 минуты | $1.50 | $2.10 |
Второй маршрут стоит в четыре раза дороже на уровне API, но примерно вдвое дешевле после ревью. Времена исправления — плановые допущения, а не результаты бенчмарка провайдера; замените их измерениями от людей, которые утверждают расшифровки в вашем процессе.
How to Evaluate Speech-to-Text APIs on Real Audio
Заявления вендоров о точности не напрямую сопоставимы, потому что провайдеры используют разные датасеты, языки, политики нормализации, версии моделей и акустические условия. Исследование 2026 года GigaSpeechBench study оценивает 680 часов человеческой разметки реальной речи по низкоресурсным языкам, диалектам китайского, акцентам английского, терминологии из 12 вертикалей, а также детской и пожилой речи. Его результаты показывают существенное ухудшение для ведущих моделей и коммерческих API в сложных условиях.
Полезный вывод не в том, что один публичный бенчмарк нашёл постоянного победителя. А в том, что ваш тестовый набор должен быть похож на ваш реальный трафик.
Use a Production-Like Evaluation Set
- 20 чистых встреч или интервью с именами и отраслевыми терминами.
- 20 шумных звонков поддержки с прерываниями, музыкой ожидания, кросс-перекрытием и сменой каналов.
- 20 клипов с акцентами или многоязычных, включая реальное переключение языков.
- 10 длинных подкастов или видеофайлов.
- 10 коротких живых высказываний с паузами, колебаниями, ложными стартами и вклиниванием.
Score More Than Word Error Rate
| Metric | What to measure | Why it matters |
|---|---|---|
| Word error rate | Вставки, удаления и замены по одной общей политике нормализации | Фиксирует лексическую точность, но не полноту пригодности транскрипта |
| Named-term accuracy | Названия продуктов, люди, места, аббревиатуры, числа и отраслевая лексика | Небольшая доля ошибок по собственным именам может создать большой объём ревью |
| Speaker attribution | Неправильно назначенные слова и пропущенные смены говорящих | Критично для звонков, интервью, комплаенса и аналитики |
| Formatting quality | Пунктуация, регистр, абзацы, числа, даты и дисфлюенции | Определяет время чистки перед публикацией или аналитикой |
| Batch turnaround | От загрузки до финала p50 и p95 для коротких и длинных файлов | Дешёвый низкоприоритетный маршрут может не уложиться в операционные сроки |
| Streaming latency | Первый частичный, стабильный частичный и финальный транскрипт на p50 и p95 | Средняя латентность скрывает паузы, которые реально ощущают пользователи |
| Reliability | Таймауты, пустые результаты, ретраи, дубли вебхуков и доля фолбэков | Сбои добавляют прямую стоимость и заметную пользователю задержку |
| Review effort | Минуты редактора на час аудио и доля принятых расшифровок | Превращает качество вывода в бизнес-стоимость |
A Seven-Day Evaluation Plan
- Определите контракт приемки. Задайте обязательные языки, p95 латентность, допуск по меткам говорящих, требования к временным меткам, правила хранения и максимум минут ревью на час аудио.
- Соберите и разметьте аудионабор. Используйте лицензированное аудио, близкое к продакшн-трафику, и одну общую политику референс-транскриптов.
- Нормализуйте интеграции. Сопоставьте форматы аудио, регионы, подсказки словаря, схемы каналов, ретраи, таймауты и версии моделей.
- Запустите тесты записанного аудио. Измеряйте стоимость, разворот, WER, именованные термины, форматирование, говорящих, сбои и время исправления.
- Запустите тесты лайв-аудио. Измеряйте стабильные частичные, задержку финализации, endpointing, обработку прерываний и поведение переподключений на p50 и p95.
- Рассчитайте стоимость принятой расшифровки. Учтите каналы, функции, ретраи, хранение, трансфер и время рецензента.
- Выберите политику маршрутизации. Лучшая продакшн-архитектура может использовать один маршрут для живых англоязычных звонков, другой — для многоязычных встреч и низкоприоритетный пакетный маршрут для архивов.
Production Checklist Before Signing a Contract
- Тестируйте модели для записей и реального времени отдельно; их цены, языки и поведение могут отличаться.
- Измеряйте стабильные частичные и финализацию, а не только время до первого текста.
- Сравнивайте идентификацию стереоканалов с диаризацией одного канала при перекрывающейся речи.
- Форсируйте таймауты, некорректное аудио, пустые ответы, обрывы соединений, повторную доставку вебхуков и ошибки rate limit.
- Проверьте лимиты размера файла, длительности сессии, конкуренции, rate limits и сценарии длинных файлов.
- Подтвердите хранение, участие в улучшении моделей, региональную обработку, удаление, шифрование, доступность DPA или BAA и subprocessors для конкретного плана.
- Сохраняйте версию модели, секунды аудио, каналы, допфункции, стоимость запроса, ретраи, латентность, минуты ревью и статус приемки.
- Повторно тестируйте после изменений цен или моделей, вместо предположения, что прежний победитель остаётся лучшим.
Сократите шортлист по типу нагрузки, затем бенчмаркните провайдеров на одном и том же аудио, настройках и критериях приемки. Для большинства команд практичный первый раунд должен включать один недорогой маршрут для записанного аудио, один специализированный стриминговый маршрут и одного провайдера, уже согласованного с существующим облаком или SDK-стеком.
Test Supported Speech Models Through CometAPI
Команды, оценивающие поддерживаемые совместимые с OpenAI модели речи, могут следовать CometAPI Quickstart, чтобы выполнить первоначальный запрос на транскрипцию через единый API endpoint.
CometAPI может упростить аутентификацию, биллинг и клиентскую интеграцию для поддерживаемых моделей. Перед переходом в продакшн подтвердите поддерживаемые форматы, лимиты, условия приватности, латентность и поведение тарификации для каждой модели.
Frequently Asked Questions
What is the best speech-to-text API in 2026?
Нет единственного победителя для всех типов нагрузок. AssemblyAI и Google Dynamic Batch — сильные недорогие кандидаты для записанного аудио. Deepgram, AssemblyAI и ElevenLabs стоит тестировать ранними для живой транскрипции. OpenAI удобен в стеке, совместимом с OpenAI, а AWS и Google могут быть операционно проще внутри своих облаков.
What is the cheapest speech-to-text API for recorded audio?
Среди публичных маршрутов, нормализованных здесь, AssemblyAI Universal-2 стартует с $0.15 за час аудио. Google Dynamic Batch и OpenAI gpt-4o-mini-transcribe нормализуются примерно к $0.18 за час. Итоговая стоимость может измениться из-за каналов, объёмных уровней, допфункций, ретраев, хранения, трансфера и человеческих исправлений.
Which API is best for real-time transcription or voice agents?
Начните с Deepgram, AssemblyAI и ElevenLabs, затем добавьте OpenAI, AWS или Google, если их экосистема или языковая поддержка подходит. Сравнивайте стабильные частичные, endpointing, задержку финализации, обработку прерываний, поведение переподключений и p95 латентность на своём реальном паттерне лайв-трафика.
How should I compare speech-to-text accuracy?
Используйте одно и то же лицензированное аудио, регион, настройки модели и политику нормализации для каждого провайдера. Отчитывайтесь по Word Error Rate вместе с точностью по именованным терминам, атрибуцией говорящих, форматированием, p95 латентностью, частотой сбоев и минутами редактора на час аудио. Не объединяйте несвязанные бенчмарки вендоров в универсальный рейтинг.
