GPT-5.6 Luna price down 80%, Terra down 20% →

GPT-Transcribe против GPT-Live-Transcribe: API и цены

CometAPI
Mia MarenJul 31, 2026
GPT-Transcribe против GPT-Live-Transcribe: API и цены

GPT-Transcribe и GPT-Live-Transcribe: цены, различия API и миграция

TL;DR

Используйте gpt-transcribe для завершённых записей по цене $0.0045 за аудио-минуту и gpt-live-transcribe для микрофонов, звонков или живых медиастримов по цене $0.017 за минуту. По опубликованным бенчмаркам OpenAI сообщает о меньшей ошибке транскрипции у живой модели по сравнению с GPT-Realtime-Whisper, но правильный маршрут зависит от того, когда должен появляться текст, какие поля вывода нужны и как обе модели работают на вашем производственном аудио.

Краткое сравнение GPT-Transcribe и GPT-Live-Transcribe

Если транскрипция нужна только после записи аудио, используйте gpt-transcribe. Если вашему приложению нужен текст, пока аудио ещё поступает, используйте gpt-live-transcribe. Главное отличие — не только цена, но и момент начала транскрипции, а также тип API-потока, который должно поддерживать ваше приложение.

Параметрgpt-transcribegpt-live-transcribe
Лучше всего подходитЗагруженные записи, ограниченные аудиозапросы, асинхронные задания и зафиксированные реплики в RealtimeМикрофоны, звонки, встречи и живые медиастримы
Опубликованная цена$0.0045 за аудио-минуту$0.017 за аудио-минуту
Цена за аудио-час$0.27$1.02
API / конечные точки/v1/audio/transcriptions; опциональный рабочий процесс Realtime с зафиксированной репликойСессии транскрипции в режиме реального времени (v1/realtime/transcription_sessions или аналогичные)
СоединениеЗагрузка файла; при обработке возможен потоковый ответWebSocket для серверных конвейеров или WebRTC для аудио в браузере
Когда начинается транскрипцияПосле отправки файла или фиксации аудио-репликиПока аудио поступает
Вывод частичных транскриптовДа, при потоковой обработке файла или при стриминге зафиксированных репликДа, по мере поступления живой речи
Параметры контекстаprompt, keywords, languagesprompt, keywords, languages, delay
Определённый язык в выводеДа, когда модель может дать надёжный прогнозНет
Важные ограниченияЛимит загрузки 25 МБ; для временных меток, диаризации или перевода нужны другие маршрутыНет временных меток на уровне слова, меток говорящих или оценок уверенности

Хотя gpt-transcribe может возвращать частичные обновления транскрипта во время обработки завершённого файла или зафиксированной аудио-реплики, это не непрерывный маршрут для живого стриминга. Для живых субтитров, звонков или ввода с микрофона gpt-live-transcribe — лучшее решение.

Для более широкого сравнения поставщиков см. CometAPI: 6 лучших API распознавания речи в 2026 году.

Что такое GPT-Transcribe и GPT-Live-Transcribe?

OpenAI представила gpt-transcribe и gpt-live-transcribe 29 июля 2026 года. gpt-transcribe обрабатывает завершённые записи, потоковые транскрипции файлов и зафиксированные реплики в Realtime, а gpt-live-transcribe возвращает низколатентные обновления транскрипта по мере поступления аудио из микрофонов, звонков или живых медиастримов.

Эти две модели предоставляют новые маршруты по умолчанию для общей транскрипции файлов и живого аудио, но специализированные рабочие процессы Whisper и GPT-4o по-прежнему необходимы для временных меток, перевода, субтитров и диаризации говорящих.

Когда gpt-live-transcribe оправдывает более высокую цену?

На странице цен API OpenAI указывает gpt-transcribe по $0.0045 в минуту и gpt-live-transcribe по $0.017 в минуту. Живой маршрут стоит примерно в 3.8 раза дороже за аудио-минуту.

Месячный объём аудиоgpt-transcribegpt-live-transcribeДополнительная стоимость за live
100 часов$27$102$75
1,000 часов$270$1,020$750
10,000 часов$2,700$10,200$7,500

Эти оценки стоимости транскрипции используют только опубликованные базовые тарифы OpenAI: часы аудио × 60 × цена за минуту. Они не включают хранение, сетевой транспорт, повторы, хостинг приложения, постобработку, ручную корректировку и стоимость резервных поставщиков.

Выбирайте gpt-live-transcribe, когда продукт требует мгновенных субтитров, помощи агенту, модерации или взаимодействия в реальном времени. Выбирайте gpt-transcribe, когда транскрипт нужен только после завершения встречи, звонка, интервью или загрузки медиа. Архитектура с двумя маршрутами может использовать живую транскрипцию для пользовательского опыта и файловую транскрипцию для постобработки звонков или бэкфиллов.

OpenAI в настоящее время указывает одинаковую базовую цену $0.017 за минуту для GPT-Realtime-Whisper и gpt-live-transcribe. Оценивайте миграцию между этими живыми маршрутами по качеству принимаемых транскриптов, латентности, обработке событий и операционной совместимости, а не только по прайс-листу.

Чем отличаются API GPT-Transcribe и GPT-Live-Transcribe?

Главное отличие — способ поступления аудио в систему и момент начала событий транскрипции. gpt-transcribe принимает завершённые файлы или зафиксированные аудио-реплики, а gpt-live-transcribe поддерживает соединение Realtime и выдаёт обновления транскрипта пока аудио ещё поступает.

Используйте GPT-Transcribe для завершённых записей

Для завершённой записи отправьте файл на /v1/audio/transcriptions. В руководстве по транскрипции файлов OpenAI принимаются файлы до 25 МБ в форматах mp3, mp4, mpeg, mpga, m4a, wav или webm.

from openai import OpenAI

client = OpenAI()
with open("support-call.wav", "rb") as audio_file:
    transcript = client.audio.transcriptions.create(
        model="gpt-transcribe",
        file=audio_file,
        prompt="A support call about a premium plan and account AC-42.",
        extra_body={
            "keywords": ["premium plan", "AC-42", "billing"],
            "languages": ["en"],
        },
    )
print(transcript.text)

Установите stream=True, чтобы получать события дельт транскрипта во время обработки загруженной записи OpenAI. Это сокращает ожидание видимого текста, но не превращает файловую конечную точку в маршрут для живого микрофона.

Используйте GPT-Live-Transcribe для поступающего аудио

Создайте сессию Realtime с type: "transcription" и выберите gpt-live-transcribe. Используйте WebSocket для серверного медиапайплайна или WebRTC для аудио в браузере.

{
  "type": "session.update",
  "session": {
    "type": "transcription",
    "audio": {
      "input": {
        "format": {
          "type": "audio/pcm",
          "rate": 24000
        },
        "transcription": {
          "model": "gpt-live-transcribe",
          "prompt": "A support call about a premium plan and account AC-42.",
          "keywords": ["premium plan", "AC-42", "billing"],
          "languages": ["en"],
          "delay": "low"
        },
        "turn_detection": null
      }
    }
  }
}

Добавляйте аудиофрагменты через input_audio_buffer.append. Приложение может фиксировать реплики с помощью input_audio_buffer.commit или настроить серверное обнаружение голосовой активности.

Руководство по транскрипции Realtime возвращает инкрементальный текст через conversation.item.input_audio_transcription.delta, а затем conversation.item.input_audio_transcription.completed для зафиксированной записи. События завершения из разных реплик не гарантировано приходят по порядку, поэтому сопоставляйте их по item_id, а не по времени прибытия.

Используйте маршрут с зафиксированной репликой, когда мгновенный текст не требуется

gpt-transcribe также может работать в сессии транскрипции Realtime по WebSocket. Транскрипция начинается после фиксации аудио-реплики, модель может использовать ранее транскрибированные реплики как контекст, а событие завершения может включать определённые языки.

Этот маршрут с зафиксированными репликами полезен, когда потоковая передача по ходам или определение языка важнее, чем отображение текста во время речи. Его не следует путать с непрерывным, более низколатентным поведением gpt-live-transcribe.

Как prompt, keywords, languages и delay влияют на транскрипцию?

Обе модели принимают контекст, который может улучшить распознавание имён, чисел, аббревиатур, терминов продуктов, акцентной речи, мультиязычного аудио и «код-свитчинга».

ПараметрНазначениеПредостережение для продакшена
promptОписывает запись, говорящего, домен или ожидаемую темуСлишком узкий контекст может смещать транскрипт
keywordsДословные имена, аббревиатуры, форматы аккаунтов или техтерминыПодсказки не являются обязательным выводом; проверяйте на вставку не произнесённых терминов
languagesСписок одного или нескольких ожидаемых языков вводаНеподдерживаемые или неверно отформатированные коды вызывают отклонение
delayОбмен более ранними живыми дельтами на больший акустический контекстДоступно для gpt-live-transcribe; проводите бенчмарки вместо предположения фиксированной задержки

В новых моделях languages заменяет прежнее одиночное поле language. Не отправляйте оба. Каждый keyword должен находиться на одной строке и не может содержать <, >, символы возврата каретки или перевода строки; недопустимые значения приводят к отклонению запроса или обновления сессии.

gpt-live-transcribe поддерживает уровни задержки minimal, low, medium, high и xhigh. Более низкие уровни отдают предпочтение раннему частичному тексту, а более высокие дают больше контекста и могут улучшить качество транскрипции. OpenAI не обещает фиксированную латентность для каждого уровня, поэтому измеряйте время до первой дельты и до финального транскрипта на репрезентативных микрофонах, кодеках, сетях, языках и длинах сессий.

Что показывают бенчмарки точности OpenAI?

В анонсе запуска OpenAI сообщает, что gpt-live-transcribe превзошла GPT-Realtime-Whisper-1 в двух мультиязычных тестах транскрипции. Также сообщается, что свободная форма контекста улучшила семантическую точность на оценке Context Aware ASR.

Оценка OpenAIРезультат gpt-live-transcribeСравнениеСообщаемое изменение
Семантическая точность Context Aware ASR44.6% с произвольным контекстом38.5% без контекста+6.1 п.п.
Common Voice, 22 языка, уровень ошибки транскрипции19.70%20.33% для GPT-Realtime-Whisper-1−0.63 п.п.; около 3.1% относительно
Запись реального мира, 9 языков, уровень ошибки транскрипции9.60%11.65% для GPT-Realtime-Whisper-1−2.05 п.п.; около 17.6% относительно

Вывод ограничен: новая живая модель показала лучшие результаты на опубликованных тестах OpenAI, а контекст улучшил указанную семантическую точность. Эти данные от поставщика не гарантируют такое же улучшение для каждого языка, телеком- кодека, микрофона, уровня задержки, доменной лексики или политики коррекции.

Когда использовать Whisper или GPT-4o Transcribe вместо новых моделей?

Ни одна из новых моделей не заменяет все сценарии распознавания речи.

ТребованиеРекомендуемый маршрут
Общая транскрипция завершённых файловgpt-transcribe
Низколатентные живые субтитры или транскрипция звонковgpt-live-transcribe
Метки говорящих для завершённых записейgpt-4o-transcribe-diarize с diarized_json
Временные метки слов или сегментовwhisper-1 с timestamp_granularities[]
Перевод завершённого неанглийского аудио на английский/v1/audio/translations с whisper-1

Для диаризации OpenAI требует файловый Transcriptions API; метки говорящих не поддерживаются в сессиях транскрипции Realtime. Для записей длиннее 30 секунд настройте chunking_strategy как "auto" или используйте конфигурацию обнаружения голосовой активности.

Для временных меток, субтитров, перевода или существующих рабочих процессов Whisper см. руководство CometAPI по Whisper API и страницу модели Whisper-1. Команды, оценивающие другой маршрут файловой транскрипции OpenAI, также могут изучить страницу модели GPT-4o Transcribe.

Как мигрировать с Whisper?

Смена идентификатора модели — лишь первый шаг. Проверьте весь рабочий процесс перед переводом производительного трафика.

ПроверкаНеобходимое действиеРиск при пропуске
Выбор маршрутаРазделите завершённые записи и реально живые нагрузкиПереплата по live-тарифу за асинхронные работы
Поля языкаЗамените language на languages для новых моделей; никогда не отправляйте обаОтклонённые запросы или сессии
Контекстные подсказкиТестируйте prompt и keywords на имена, числа, жаргон и шумную речьСмещение или вставка терминов
Уровень задержкиПробенчмарьте как минимум low, medium и high на репрезентативном аудиоВыбор скорости или качества без данных
Обработка событийСопоставляйте дельты и завершения по item_idНеупорядоченные или перезаписанные транскрипты
Паритет функцийИнвентаризируйте зависимости: диаризация, таймкоды, уверенность, субтитры и переводОтсутствующие поля в downstream
Телеметрия затратЛогируйте аудио-минуты, повторы, неудачи, время коррекции и долю принятых результатовПутаница прайс-листа с реальной стоимостью
РоллаутТень-тест, канареечный запуск на небольшой доле трафика, резервный маршрутШирокая регрессия без быстрого отката

Для миграции с GPT-Realtime-Whisper сохраните формат аудио, политику обнаружения реплик, тестовый набор и целевую латентность неизменными. Поскольку опубликованная цена live не изменилась, отдайте приоритет доле принятых транскриптов, распределению латентности, стабильности вывода и совместимости с остальным конвейером.

Руководство по миграции (с Whisper / предыдущих моделей)

OpenAI предоставляет официальный cookbook: Миграция с Whisper на GPT-Transcribe и GPT-Live-Transcribe.

Высокоуровневые правила:

  1. Записанное / пакетное аудио → переключитесь на gpt-transcribe в существующей конечной точке /v1/audio/transcriptions.
  2. Непрерывное живое аудио → переключитесь на gpt-live-transcribe в сессии транскрипции Realtime.
  3. Более высокая точность после зафиксированной реплики → используйте gpt-transcribe внутри сессии Realtime.

Минимальный пример миграции файла (Python):

Python

# Before (Whisper)with open("meeting.wav", "rb") as audio:    result = client.audio.transcriptions.create(        model="whisper-1",        file=audio,        language="en",        prompt="Support call about AC-42"    )# After (GPT-Transcribe)with open("meeting.wav", "rb") as audio:    result = client.audio.transcriptions.create(        model="gpt-transcribe",        file=audio,        prompt="A customer support call about billing",        extra_body={            "keywords": ["AC-42", "Premium Plus"],            "languages": ["en", "fr"]        },        response_format="json"  # or stream=True for deltas    )

Заметки по живой миграции:

  • Сохраните ту же архитектуру сессии Realtime / WebSocket.
  • Измените идентификатор модели и замените одиночное language на массив languages.
  • Добавьте опционально prompt, keywords и delay (например, "low").
  • Продолжайте обрабатывать те же события дельты/завершения.
  • Не отправляйте одновременно language и languages.

Важные оговорки при миграции:

  • GPT-Transcribe/GPT-Live-Transcribe не поддерживают таймкоды слов, SRT/VTT или перевод на английский так же, как whisper-1. Сохраните Whisper для этих нужд.
  • Форматы ответа отличаются — не предполагайте, что text, verbose_json, srt или vtt работают одинаково.
  • Keywords должны быть однострочными литералами (без <, >, CR или LF), иначе запрос будет отклонён.
  • Тестируйте на репрезентативном производственном аудио (акценты, шум, доменные термины, короткие высказывания), а не полагайтесь только на опубликованные WER-числа.

Быстрая рекомендация

  • По умолчанию для новых задач: GPT-Transcribe для файлов/пакетов, GPT-Live-Transcribe для живого стриминга.
  • Существующие интеграции Whisper или GPT-4o-Transcribe продолжают работать, но больше не являются рекомендуемой отправной точкой.
  • Чувствительные к стоимости пакетные задачи больше всего выигрывают от перехода на GPT-Transcribe ($0.0045 vs $0.006).

Для последних деталей смотрите официальные страницы моделей и обзор транскрипции на сайте для разработчиков OpenAI.

Как оценить две модели на производственном аудио?

Используйте лицензированное аудио, репрезентативное для вашего продукта, а не только чистые демонстрационные клипы.

  1. Выберите минимум 50 записей по основным кейсам, языкам, устройствам и условиям аудио.
  2. Включите акценты, перебивания, фоновой шум, код-свитчинг, числа, даты, валюту, email-адреса и доменную лексику.
  3. Прогоните завершённые записи через gpt-transcribe с контекстными подсказками и без них.
  4. Воспроизведите те же живые сэмплы через gpt-live-transcribe на трёх уровнях delay.
  5. Держите форматы, границы реплик, подсказки и правила оценивания постоянными между прогоном.
  6. Измеряйте ошибку транскрипции, полноту доменных терминов, правки частичного текста, p50 и p95 задержки, отказы, повторы и время ручной корректировки.
  7. Рассчитайте стоимость за принятый транскрипт, затем выполните канареечный запуск выбранной политики маршрутизации перед полной миграцией.

Итоговый дизайн может использовать одну или обе модели. Главным критерием должна быть стоимость и надёжность принятого производственного транскрипта, а не опубликованная цена за минуту сама по себе.

FAQ

Какую модель мне использовать: GPT-Transcribe или GPT-Live-Transcribe?

Используйте gpt-transcribe для завершённых записей и асинхронных задач. Используйте gpt-live-transcribe, когда текст должен приходить, пока аудио всё ещё стримится.

Сколько стоят GPT-Transcribe и GPT-Live-Transcribe?

OpenAI указывает gpt-transcribe по $0.0045 за аудио-минуту ($0.27 за час) и gpt-live-transcribe по $0.017 за минуту ($1.02 за час).

Точнее ли GPT-Live-Transcribe, чем GPT-Realtime-Whisper?

На девятиязычном бенчмарке Real-World Audio Recording, по данным OpenAI, уровень ошибки транскрипции снизился с 11.65% до 9.60%. Проверьте этот конкретный результат на вашем аудио.

Поддерживает ли GPT-Live-Transcribe диаризацию или таймкоды слов?

Нет. Он не возвращает метки говорящих, временные метки на уровне слова или оценки уверенности. Используйте совместимую файловую модель или резервный шаг при необходимости этих полей.

Является ли миграция с GPT-Realtime-Whisper простым обменом модели?

Нет. Проверьте конфигурацию сессии, поля языка, контекстные входы, уровни задержки, порядок событий, зависимости по функциям, латентность и качество выхода перед переводом производственного трафика.

Тестируйте маршруты транскрипции с CometAPI

Перед внедрением проверьте текущую доступность моделей и цены маршрутов на странице цен CometAPI и используйте документацию CometAPI для совместимых с OpenAI шаблонов запросов. Зафиксируйте точные идентификаторы моделей в тестах и логируйте длительность аудио, уровень delay, латентность первой дельты, латентность финального транскрипта, повторы и долю принятых транскриптов, чтобы решение по маршрутизации отражало общую стоимость рабочего процесса.

44 просмотров
Проверено на ясность, указание источников и актуальную терминологию API.

Готовы сократить затраты на AI-разработку на 20%?

Начните бесплатно за несколько минут. Пробные кредиты включены. Карта не нужна.

Читать далее