GPT-Transcribe и GPT-Live-Transcribe: цены, различия API и миграция
TL;DR
Используйте gpt-transcribe для завершённых записей по цене $0.0045 за аудио-минуту и gpt-live-transcribe для микрофонов, звонков или живых медиастримов по цене $0.017 за минуту. По опубликованным бенчмаркам OpenAI сообщает о меньшей ошибке транскрипции у живой модели по сравнению с GPT-Realtime-Whisper, но правильный маршрут зависит от того, когда должен появляться текст, какие поля вывода нужны и как обе модели работают на вашем производственном аудио.
Краткое сравнение GPT-Transcribe и GPT-Live-Transcribe
Если транскрипция нужна только после записи аудио, используйте gpt-transcribe. Если вашему приложению нужен текст, пока аудио ещё поступает, используйте gpt-live-transcribe. Главное отличие — не только цена, но и момент начала транскрипции, а также тип API-потока, который должно поддерживать ваше приложение.
| Параметр | gpt-transcribe | gpt-live-transcribe |
|---|---|---|
| Лучше всего подходит | Загруженные записи, ограниченные аудиозапросы, асинхронные задания и зафиксированные реплики в Realtime | Микрофоны, звонки, встречи и живые медиастримы |
| Опубликованная цена | $0.0045 за аудио-минуту | $0.017 за аудио-минуту |
| Цена за аудио-час | $0.27 | $1.02 |
| API / конечные точки | /v1/audio/transcriptions; опциональный рабочий процесс Realtime с зафиксированной репликой | Сессии транскрипции в режиме реального времени (v1/realtime/transcription_sessions или аналогичные) |
| Соединение | Загрузка файла; при обработке возможен потоковый ответ | WebSocket для серверных конвейеров или WebRTC для аудио в браузере |
| Когда начинается транскрипция | После отправки файла или фиксации аудио-реплики | Пока аудио поступает |
| Вывод частичных транскриптов | Да, при потоковой обработке файла или при стриминге зафиксированных реплик | Да, по мере поступления живой речи |
| Параметры контекста | prompt, keywords, languages | prompt, keywords, languages, delay |
| Определённый язык в выводе | Да, когда модель может дать надёжный прогноз | Нет |
| Важные ограничения | Лимит загрузки 25 МБ; для временных меток, диаризации или перевода нужны другие маршруты | Нет временных меток на уровне слова, меток говорящих или оценок уверенности |
Хотя gpt-transcribe может возвращать частичные обновления транскрипта во время обработки завершённого файла или зафиксированной аудио-реплики, это не непрерывный маршрут для живого стриминга. Для живых субтитров, звонков или ввода с микрофона gpt-live-transcribe — лучшее решение.
Для более широкого сравнения поставщиков см. CometAPI: 6 лучших API распознавания речи в 2026 году.
Что такое GPT-Transcribe и GPT-Live-Transcribe?
OpenAI представила gpt-transcribe и gpt-live-transcribe 29 июля 2026 года. gpt-transcribe обрабатывает завершённые записи, потоковые транскрипции файлов и зафиксированные реплики в Realtime, а gpt-live-transcribe возвращает низколатентные обновления транскрипта по мере поступления аудио из микрофонов, звонков или живых медиастримов.
Эти две модели предоставляют новые маршруты по умолчанию для общей транскрипции файлов и живого аудио, но специализированные рабочие процессы Whisper и GPT-4o по-прежнему необходимы для временных меток, перевода, субтитров и диаризации говорящих.
Когда gpt-live-transcribe оправдывает более высокую цену?
На странице цен API OpenAI указывает gpt-transcribe по $0.0045 в минуту и gpt-live-transcribe по $0.017 в минуту. Живой маршрут стоит примерно в 3.8 раза дороже за аудио-минуту.
| Месячный объём аудио | gpt-transcribe | gpt-live-transcribe | Дополнительная стоимость за live |
|---|---|---|---|
| 100 часов | $27 | $102 | $75 |
| 1,000 часов | $270 | $1,020 | $750 |
| 10,000 часов | $2,700 | $10,200 | $7,500 |
Эти оценки стоимости транскрипции используют только опубликованные базовые тарифы OpenAI: часы аудио × 60 × цена за минуту. Они не включают хранение, сетевой транспорт, повторы, хостинг приложения, постобработку, ручную корректировку и стоимость резервных поставщиков.
Выбирайте gpt-live-transcribe, когда продукт требует мгновенных субтитров, помощи агенту, модерации или взаимодействия в реальном времени. Выбирайте gpt-transcribe, когда транскрипт нужен только после завершения встречи, звонка, интервью или загрузки медиа. Архитектура с двумя маршрутами может использовать живую транскрипцию для пользовательского опыта и файловую транскрипцию для постобработки звонков или бэкфиллов.
OpenAI в настоящее время указывает одинаковую базовую цену $0.017 за минуту для GPT-Realtime-Whisper и gpt-live-transcribe. Оценивайте миграцию между этими живыми маршрутами по качеству принимаемых транскриптов, латентности, обработке событий и операционной совместимости, а не только по прайс-листу.
Чем отличаются API GPT-Transcribe и GPT-Live-Transcribe?
Главное отличие — способ поступления аудио в систему и момент начала событий транскрипции. gpt-transcribe принимает завершённые файлы или зафиксированные аудио-реплики, а gpt-live-transcribe поддерживает соединение Realtime и выдаёт обновления транскрипта пока аудио ещё поступает.
Используйте GPT-Transcribe для завершённых записей
Для завершённой записи отправьте файл на /v1/audio/transcriptions. В руководстве по транскрипции файлов OpenAI принимаются файлы до 25 МБ в форматах mp3, mp4, mpeg, mpga, m4a, wav или webm.
from openai import OpenAI
client = OpenAI()
with open("support-call.wav", "rb") as audio_file:
transcript = client.audio.transcriptions.create(
model="gpt-transcribe",
file=audio_file,
prompt="A support call about a premium plan and account AC-42.",
extra_body={
"keywords": ["premium plan", "AC-42", "billing"],
"languages": ["en"],
},
)
print(transcript.text)
Установите stream=True, чтобы получать события дельт транскрипта во время обработки загруженной записи OpenAI. Это сокращает ожидание видимого текста, но не превращает файловую конечную точку в маршрут для живого микрофона.
Используйте GPT-Live-Transcribe для поступающего аудио
Создайте сессию Realtime с type: "transcription" и выберите gpt-live-transcribe. Используйте WebSocket для серверного медиапайплайна или WebRTC для аудио в браузере.
{
"type": "session.update",
"session": {
"type": "transcription",
"audio": {
"input": {
"format": {
"type": "audio/pcm",
"rate": 24000
},
"transcription": {
"model": "gpt-live-transcribe",
"prompt": "A support call about a premium plan and account AC-42.",
"keywords": ["premium plan", "AC-42", "billing"],
"languages": ["en"],
"delay": "low"
},
"turn_detection": null
}
}
}
}
Добавляйте аудиофрагменты через input_audio_buffer.append. Приложение может фиксировать реплики с помощью input_audio_buffer.commit или настроить серверное обнаружение голосовой активности.
Руководство по транскрипции Realtime возвращает инкрементальный текст через conversation.item.input_audio_transcription.delta, а затем conversation.item.input_audio_transcription.completed для зафиксированной записи. События завершения из разных реплик не гарантировано приходят по порядку, поэтому сопоставляйте их по item_id, а не по времени прибытия.
Используйте маршрут с зафиксированной репликой, когда мгновенный текст не требуется
gpt-transcribe также может работать в сессии транскрипции Realtime по WebSocket. Транскрипция начинается после фиксации аудио-реплики, модель может использовать ранее транскрибированные реплики как контекст, а событие завершения может включать определённые языки.
Этот маршрут с зафиксированными репликами полезен, когда потоковая передача по ходам или определение языка важнее, чем отображение текста во время речи. Его не следует путать с непрерывным, более низколатентным поведением gpt-live-transcribe.
Как prompt, keywords, languages и delay влияют на транскрипцию?
Обе модели принимают контекст, который может улучшить распознавание имён, чисел, аббревиатур, терминов продуктов, акцентной речи, мультиязычного аудио и «код-свитчинга».
| Параметр | Назначение | Предостережение для продакшена |
|---|---|---|
| prompt | Описывает запись, говорящего, домен или ожидаемую тему | Слишком узкий контекст может смещать транскрипт |
| keywords | Дословные имена, аббревиатуры, форматы аккаунтов или техтермины | Подсказки не являются обязательным выводом; проверяйте на вставку не произнесённых терминов |
| languages | Список одного или нескольких ожидаемых языков ввода | Неподдерживаемые или неверно отформатированные коды вызывают отклонение |
| delay | Обмен более ранними живыми дельтами на больший акустический контекст | Доступно для gpt-live-transcribe; проводите бенчмарки вместо предположения фиксированной задержки |
В новых моделях languages заменяет прежнее одиночное поле language. Не отправляйте оба. Каждый keyword должен находиться на одной строке и не может содержать <, >, символы возврата каретки или перевода строки; недопустимые значения приводят к отклонению запроса или обновления сессии.
gpt-live-transcribe поддерживает уровни задержки minimal, low, medium, high и xhigh. Более низкие уровни отдают предпочтение раннему частичному тексту, а более высокие дают больше контекста и могут улучшить качество транскрипции. OpenAI не обещает фиксированную латентность для каждого уровня, поэтому измеряйте время до первой дельты и до финального транскрипта на репрезентативных микрофонах, кодеках, сетях, языках и длинах сессий.
Что показывают бенчмарки точности OpenAI?
В анонсе запуска OpenAI сообщает, что gpt-live-transcribe превзошла GPT-Realtime-Whisper-1 в двух мультиязычных тестах транскрипции. Также сообщается, что свободная форма контекста улучшила семантическую точность на оценке Context Aware ASR.
| Оценка OpenAI | Результат gpt-live-transcribe | Сравнение | Сообщаемое изменение |
|---|---|---|---|
| Семантическая точность Context Aware ASR | 44.6% с произвольным контекстом | 38.5% без контекста | +6.1 п.п. |
| Common Voice, 22 языка, уровень ошибки транскрипции | 19.70% | 20.33% для GPT-Realtime-Whisper-1 | −0.63 п.п.; около 3.1% относительно |
| Запись реального мира, 9 языков, уровень ошибки транскрипции | 9.60% | 11.65% для GPT-Realtime-Whisper-1 | −2.05 п.п.; около 17.6% относительно |
Вывод ограничен: новая живая модель показала лучшие результаты на опубликованных тестах OpenAI, а контекст улучшил указанную семантическую точность. Эти данные от поставщика не гарантируют такое же улучшение для каждого языка, телеком- кодека, микрофона, уровня задержки, доменной лексики или политики коррекции.
Когда использовать Whisper или GPT-4o Transcribe вместо новых моделей?
Ни одна из новых моделей не заменяет все сценарии распознавания речи.
| Требование | Рекомендуемый маршрут |
|---|---|
| Общая транскрипция завершённых файлов | gpt-transcribe |
| Низколатентные живые субтитры или транскрипция звонков | gpt-live-transcribe |
| Метки говорящих для завершённых записей | gpt-4o-transcribe-diarize с diarized_json |
| Временные метки слов или сегментов | whisper-1 с timestamp_granularities[] |
| Перевод завершённого неанглийского аудио на английский | /v1/audio/translations с whisper-1 |
Для диаризации OpenAI требует файловый Transcriptions API; метки говорящих не поддерживаются в сессиях транскрипции Realtime. Для записей длиннее 30 секунд настройте chunking_strategy как "auto" или используйте конфигурацию обнаружения голосовой активности.
Для временных меток, субтитров, перевода или существующих рабочих процессов Whisper см. руководство CometAPI по Whisper API и страницу модели Whisper-1. Команды, оценивающие другой маршрут файловой транскрипции OpenAI, также могут изучить страницу модели GPT-4o Transcribe.
Как мигрировать с Whisper?
Смена идентификатора модели — лишь первый шаг. Проверьте весь рабочий процесс перед переводом производительного трафика.
| Проверка | Необходимое действие | Риск при пропуске |
|---|---|---|
| Выбор маршрута | Разделите завершённые записи и реально живые нагрузки | Переплата по live-тарифу за асинхронные работы |
| Поля языка | Замените language на languages для новых моделей; никогда не отправляйте оба | Отклонённые запросы или сессии |
| Контекстные подсказки | Тестируйте prompt и keywords на имена, числа, жаргон и шумную речь | Смещение или вставка терминов |
| Уровень задержки | Пробенчмарьте как минимум low, medium и high на репрезентативном аудио | Выбор скорости или качества без данных |
| Обработка событий | Сопоставляйте дельты и завершения по item_id | Неупорядоченные или перезаписанные транскрипты |
| Паритет функций | Инвентаризируйте зависимости: диаризация, таймкоды, уверенность, субтитры и перевод | Отсутствующие поля в downstream |
| Телеметрия затрат | Логируйте аудио-минуты, повторы, неудачи, время коррекции и долю принятых результатов | Путаница прайс-листа с реальной стоимостью |
| Роллаут | Тень-тест, канареечный запуск на небольшой доле трафика, резервный маршрут | Широкая регрессия без быстрого отката |
Для миграции с GPT-Realtime-Whisper сохраните формат аудио, политику обнаружения реплик, тестовый набор и целевую латентность неизменными. Поскольку опубликованная цена live не изменилась, отдайте приоритет доле принятых транскриптов, распределению латентности, стабильности вывода и совместимости с остальным конвейером.
Руководство по миграции (с Whisper / предыдущих моделей)
OpenAI предоставляет официальный cookbook: Миграция с Whisper на GPT-Transcribe и GPT-Live-Transcribe.
Высокоуровневые правила:
- Записанное / пакетное аудио → переключитесь на gpt-transcribe в существующей конечной точке /v1/audio/transcriptions.
- Непрерывное живое аудио → переключитесь на gpt-live-transcribe в сессии транскрипции Realtime.
- Более высокая точность после зафиксированной реплики → используйте gpt-transcribe внутри сессии Realtime.
Минимальный пример миграции файла (Python):
Python
# Before (Whisper)with open("meeting.wav", "rb") as audio: result = client.audio.transcriptions.create( model="whisper-1", file=audio, language="en", prompt="Support call about AC-42" )# After (GPT-Transcribe)with open("meeting.wav", "rb") as audio: result = client.audio.transcriptions.create( model="gpt-transcribe", file=audio, prompt="A customer support call about billing", extra_body={ "keywords": ["AC-42", "Premium Plus"], "languages": ["en", "fr"] }, response_format="json" # or stream=True for deltas )
Заметки по живой миграции:
- Сохраните ту же архитектуру сессии Realtime / WebSocket.
- Измените идентификатор модели и замените одиночное language на массив languages.
- Добавьте опционально prompt, keywords и delay (например, "low").
- Продолжайте обрабатывать те же события дельты/завершения.
- Не отправляйте одновременно language и languages.
Важные оговорки при миграции:
- GPT-Transcribe/GPT-Live-Transcribe не поддерживают таймкоды слов, SRT/VTT или перевод на английский так же, как whisper-1. Сохраните Whisper для этих нужд.
- Форматы ответа отличаются — не предполагайте, что text, verbose_json, srt или vtt работают одинаково.
- Keywords должны быть однострочными литералами (без <, >, CR или LF), иначе запрос будет отклонён.
- Тестируйте на репрезентативном производственном аудио (акценты, шум, доменные термины, короткие высказывания), а не полагайтесь только на опубликованные WER-числа.
Быстрая рекомендация
- По умолчанию для новых задач: GPT-Transcribe для файлов/пакетов, GPT-Live-Transcribe для живого стриминга.
- Существующие интеграции Whisper или GPT-4o-Transcribe продолжают работать, но больше не являются рекомендуемой отправной точкой.
- Чувствительные к стоимости пакетные задачи больше всего выигрывают от перехода на GPT-Transcribe ($0.0045 vs $0.006).
Для последних деталей смотрите официальные страницы моделей и обзор транскрипции на сайте для разработчиков OpenAI.
Как оценить две модели на производственном аудио?
Используйте лицензированное аудио, репрезентативное для вашего продукта, а не только чистые демонстрационные клипы.
- Выберите минимум 50 записей по основным кейсам, языкам, устройствам и условиям аудио.
- Включите акценты, перебивания, фоновой шум, код-свитчинг, числа, даты, валюту, email-адреса и доменную лексику.
- Прогоните завершённые записи через
gpt-transcribeс контекстными подсказками и без них. - Воспроизведите те же живые сэмплы через
gpt-live-transcribeна трёх уровнях delay. - Держите форматы, границы реплик, подсказки и правила оценивания постоянными между прогоном.
- Измеряйте ошибку транскрипции, полноту доменных терминов, правки частичного текста, p50 и p95 задержки, отказы, повторы и время ручной корректировки.
- Рассчитайте стоимость за принятый транскрипт, затем выполните канареечный запуск выбранной политики маршрутизации перед полной миграцией.
Итоговый дизайн может использовать одну или обе модели. Главным критерием должна быть стоимость и надёжность принятого производственного транскрипта, а не опубликованная цена за минуту сама по себе.
FAQ
Какую модель мне использовать: GPT-Transcribe или GPT-Live-Transcribe?
Используйте gpt-transcribe для завершённых записей и асинхронных задач. Используйте gpt-live-transcribe, когда текст должен приходить, пока аудио всё ещё стримится.
Сколько стоят GPT-Transcribe и GPT-Live-Transcribe?
OpenAI указывает gpt-transcribe по $0.0045 за аудио-минуту ($0.27 за час) и gpt-live-transcribe по $0.017 за минуту ($1.02 за час).
Точнее ли GPT-Live-Transcribe, чем GPT-Realtime-Whisper?
На девятиязычном бенчмарке Real-World Audio Recording, по данным OpenAI, уровень ошибки транскрипции снизился с 11.65% до 9.60%. Проверьте этот конкретный результат на вашем аудио.
Поддерживает ли GPT-Live-Transcribe диаризацию или таймкоды слов?
Нет. Он не возвращает метки говорящих, временные метки на уровне слова или оценки уверенности. Используйте совместимую файловую модель или резервный шаг при необходимости этих полей.
Является ли миграция с GPT-Realtime-Whisper простым обменом модели?
Нет. Проверьте конфигурацию сессии, поля языка, контекстные входы, уровни задержки, порядок событий, зависимости по функциям, латентность и качество выхода перед переводом производственного трафика.
Тестируйте маршруты транскрипции с CometAPI
Перед внедрением проверьте текущую доступность моделей и цены маршрутов на странице цен CometAPI и используйте документацию CometAPI для совместимых с OpenAI шаблонов запросов. Зафиксируйте точные идентификаторы моделей в тестах и логируйте длительность аудио, уровень delay, латентность первой дельты, латентность финального транскрипта, повторы и долю принятых транскриптов, чтобы решение по маршрутизации отражало общую стоимость рабочего процесса.
