GPT-Transcribe vs GPT-Live-Transcribe: 가격, API 차이점, 마이그레이션
TL;DR
완료된 녹음에는 gpt-transcribe를 사용하세요. 요금은 오디오 분당 $0.0045입니다. 마이크, 통화, 라이브 미디어 스트림에는 gpt-live-transcribe를 사용하세요. 요금은 분당 $0.017입니다. OpenAI는 공개 벤치마크에서 라이브 모델이 GPT-Realtime-Whisper보다 전사 오류가 낮다고 보고하지만, 최적의 경로는 텍스트가 언제 표시되어야 하는지, 필요한 출력 필드, 그리고 두 모델이 실제 운영 오디오에서 어떻게 성능을 내는지에 따라 달라집니다.
GPT-Transcribe vs GPT-Live-Transcribe 한눈에 보기
오디오가 녹음된 후 전사만 필요하다면 gpt-transcribe를 사용하세요. 오디오가 유입되는 동안 텍스트가 필요하다면 gpt-live-transcribe를 사용하세요. 가장 큰 차이는 가격뿐만 아니라 전사가 시작되는 시점과 앱이 지원해야 하는 API 워크플로 유형입니다.
| 항목 | gpt-transcribe | gpt-live-transcribe |
|---|---|---|
| 적합한 용도 | 업로드된 녹음, 경계가 있는 오디오 요청, 비동기 작업, 커밋된 실시간 턴 | 마이크, 통화, 회의, 라이브 미디어 스트림 |
| 공개 가격 | $0.0045 per audio minute | $0.017 per audio minute |
| 오디오 시간당 가격 | $0.27 | $1.02 |
| API / 엔드포인트 | /v1/audio/transcriptions; 선택적 커밋된 턴 기반 실시간 워크플로 | 실시간 전사 세션 (v1/realtime/transcription_sessions 또는 유사) |
| 연결 방식 | 파일 업로드; 파일 처리 중 스트리밍 응답 선택 가능 | 서버 파이프라인용 WebSocket 또는 브라우저 오디오용 WebRTC |
| 전사 시작 시점 | 파일 제출 후 또는 오디오 턴 커밋 후 | 오디오가 도착하는 동안 |
| 부분 전사 출력 | 파일 스트리밍 또는 커밋된 턴 스트리밍으로 지원 | 라이브 음성이 도착하는 즉시 지원 |
| 컨텍스트 제어 | prompt, keywords, languages | prompt, keywords, languages, delay |
| 감지된 언어 출력 | 모델이 신뢰할 수 있는 예측을 할 수 있을 때 지원 | 미지원 |
| 중요한 제한 사항 | 25 MB 업로드 제한; 타임스탬프, 화자 분리, 번역에는 다른 경로 필요 | 단어 단위 타임스탬프, 화자 레이블, 신뢰도 점수 미지원 |
gpt-transcribe는 완료된 파일 처리 또는 커밋된 오디오 턴을 처리하는 동안에도 부분 전사 업데이트를 반환할 수 있지만, 연속적인 라이브 스트리밍 경로는 아닙니다. 라이브 자막, 통화, 마이크 입력에는 gpt-live-transcribe가 더 적합합니다.
서비스 전반 비교는 CometAPI의 2026년 최고의 음성-텍스트 API 6선을 참고하세요.
GPT-Transcribe와 GPT-Live-Transcribe란?
OpenAI는 2026년 7월 29일 gpt-transcribe와 gpt-live-transcribe를 공개했습니다. gpt-transcribe는 완료된 녹음, 스트리밍 파일 전사, 커밋된 실시간 턴을 처리하며, gpt-live-transcribe는 마이크, 통화, 라이브 미디어 스트림에서 유입되는 오디오에 대해 지연이 낮은 전사 업데이트를 반환합니다.
이 두 모델은 일반 파일 및 라이브 전사를 위한 새로운 기본 경로를 제공하지만, 타임스탬프, 번역, 자막, 화자 분리와 같은 특수 워크플로에는 Whisper 및 GPT-4o 기반 전사가 계속 필요합니다.
언제 GPT-Live-Transcribe의 높은 가격이 가치가 있나요?
OpenAI의 API 가격 페이지는 gpt-transcribe를 분당 $0.0045, gpt-live-transcribe를 분당 $0.017로 안내합니다. 따라서 라이브 경로는 오디오 분당 약 3.8배 더 비쌉니다.
| 월간 오디오 볼륨 | gpt-transcribe | gpt-live-transcribe | 추가 라이브 비용 |
|---|---|---|---|
| 100 hours | $27 | $102 | $75 |
| 1,000 hours | $270 | $1,020 | $750 |
| 10,000 hours | $2,700 | $10,200 | $7,500 |
이 전사 비용 추정치는 OpenAI가 공개한 기본 요금만을 사용합니다: 오디오 시간 × 60 × 분당 가격. 저장, 네트워크 전송, 재시도, 애플리케이션 호스팅, 후처리, 인력 보정, 폴백 공급자 비용은 제외됩니다.
즉시 자막, 상담원 지원, 모더레이션, 실시간 상호작용이 제품 요구사항이라면 gpt-live-transcribe를 선택하세요. 회의, 통화, 인터뷰, 미디어 업로드가 완료된 후에만 전사가 필요하다면 gpt-transcribe를 선택하세요. 라이브 전사는 사용자 경험을 위해, 파일 전사는 통화 후 처리나 백필을 위해 사용하는 이중 경로 아키텍처도 가능합니다.
현재 OpenAI는 GPT-Realtime-Whisper와 gpt-live-transcribe의 기본 요금을 동일한 분당 $0.017로 안내합니다. 이들 라이브 경로 간 마이그레이션은 단순 가격이 아니라 승인 전사 품질, 지연, 이벤트 처리, 운영 호환성으로 평가하세요.
GPT-Transcribe와 GPT-Live-Transcribe API는 어떻게 다른가요?
핵심 차이는 오디오가 시스템에 들어오는 방식과 전사 이벤트가 시작되는 시점입니다. gpt-transcribe는 완료된 파일 또는 커밋된 오디오 턴을 수락하고, gpt-live-transcribe는 실시간 연결을 유지하며 오디오가 도착하는 동안 전사 업데이트를 내보냅니다.
완료된 오디오에는 GPT-Transcribe 사용
완료된 녹음의 경우 파일을 /v1/audio/transcriptions에 전송하세요. OpenAI의 파일 전사 가이드는 최대 25 MB의 mp3, mp4, mpeg, mpga, m4a, wav, webm 형식을 지원합니다.
from openai import OpenAI
client = OpenAI()
with open("support-call.wav", "rb") as audio_file:
transcript = client.audio.transcriptions.create(
model="gpt-transcribe",
file=audio_file,
prompt="A support call about a premium plan and account AC-42.",
extra_body={
"keywords": ["premium plan", "AC-42", "billing"],
"languages": ["en"],
},
)
print(transcript.text)
stream=True를 설정하면 업로드된 녹음을 OpenAI가 처리하는 동안 전사 델타 이벤트를 수신할 수 있습니다. 이는 가시 텍스트 대기 시간을 줄여주지만, 파일 엔드포인트를 라이브 마이크 입력으로 바꾸지는 않습니다.
유입 중인 오디오에는 GPT-Live-Transcribe 사용
type: "transcription"으로 실시간 세션을 생성하고 gpt-live-transcribe를 선택하세요. 서버 측 미디어 파이프라인에는 WebSocket을, 브라우저 오디오에는 WebRTC를 사용합니다.
{
"type": "session.update",
"session": {
"type": "transcription",
"audio": {
"input": {
"format": {
"type": "audio/pcm",
"rate": 24000
},
"transcription": {
"model": "gpt-live-transcribe",
"prompt": "A support call about a premium plan and account AC-42.",
"keywords": ["premium plan", "AC-42", "billing"],
"languages": ["en"],
"delay": "low"
},
"turn_detection": null
}
}
}
}
input_audio_buffer.append로 오디오 청크를 추가하세요. 애플리케이션은 input_audio_buffer.commit으로 턴을 커밋하거나 서버 측 음성 활동 감지를 구성할 수 있습니다.
실시간 전사 가이드는 conversation.item.input_audio_transcription.delta를 통해 증분 텍스트를, 이어서 커밋된 항목에 대해 conversation.item.input_audio_transcription.completed를 반환합니다. 서로 다른 턴에서의 완료 이벤트는 도착 순서가 보장되지 않으므로 도착 순서가 아니라 item_id로 정합을 맞추세요.
즉시 텍스트가 불필요할 때는 커밋된 턴 경로 사용
gpt-transcribe는 WebSocket 기반의 실시간 전사 세션에서도 동작할 수 있습니다. 오디오 턴이 커밋된 후 전사가 시작되며, 모델은 이전에 전사된 턴을 컨텍스트로 사용할 수 있고 완료 이벤트에는 감지된 언어가 포함될 수 있습니다.
이 커밋된 턴 경로는 턴 기반 스트리밍이나 언어 감지가, 화자가 말하는 동안 텍스트 표시보다 더 중요한 경우에 유용합니다. 이는 gpt-live-transcribe의 연속적이고 더 낮은 지연 동작과 혼동하면 안 됩니다.
프롬프트, 키워드, 언어, 지연이 전사에 어떤 영향을 미치나요?
두 모델 모두 이름, 숫자, 약어, 제품 용어, 억양, 다국어 오디오, 코드 스위칭 인식에 도움이 되는 컨텍스트를 수락합니다.
| 제어 | 목적 | 운영상 주의사항 |
|---|---|---|
| prompt | 녹음, 화자, 도메인, 예상 주제를 설명 | 과도하게 특정한 컨텍스트는 전사를 편향시킬 수 있음 |
| keywords | 고유명사, 약어, 계정 형식, 기술 용어를 리터럴로 제공 | 힌트는 필수 출력이 아님; 말하지 않은 용어가 삽입되는지 테스트 |
| languages | 예상 입력 언어를 하나 이상 지정 | 지원되지 않거나 형식이 잘못된 코드면 거부됨 |
| delay | 더 이른 라이브 델타와 더 많은 음향 컨텍스트 간의 트레이드오프 | gpt-live-transcribe에서 사용 가능; 고정 ms를 가정하지 말고 벤치마크 |
새 모델에서는 languages가 이전의 단수 language 필드를 대체합니다. 둘 다 보내지 마세요. 각 키워드는 한 줄로 유지되어야 하며 <, >, 캐리지 리턴, 줄 바꿈을 포함할 수 없습니다. 유효하지 않은 값은 요청 또는 세션 업데이트가 거부됩니다.
gpt-live-transcribe는 minimal, low, medium, high, xhigh 지연 설정을 지원합니다. 낮은 설정은 더 이른 부분 텍스트를, 높은 설정은 더 많은 오디오 컨텍스트를 제공하여 전사 품질을 개선할 수 있습니다. OpenAI는 각 레벨에 대해 고정 지연을 보장하지 않으므로, 대표적인 마이크, 코덱, 네트워크, 언어, 세션 길이에서 최초 델타까지의 시간과 최종 전사까지의 시간을 측정하세요.
OpenAI의 정확도 벤치마크는 무엇을 보여주나요?
OpenAI의 출시 공지에 따르면 gpt-live-transcribe가 두 가지 다국어 전사 테스트에서 GPT-Realtime-Whisper-1보다 더 나은 성능을 보였습니다. 또한 자유형 컨텍스트가 Context Aware ASR 평가에서 의미 정확도를 개선했다고 보고했습니다.
| OpenAI 평가 | gpt-live-transcribe 결과 | 비교 | 보고된 변화 |
|---|---|---|---|
| Context Aware ASR 의미 정확도 | 컨텍스트 사용 시 44.6% | 컨텍스트 미사용 시 38.5% | +6.1 퍼센트 포인트 |
| Common Voice, 22개 언어, 전사 오류율 | 19.70% | GPT-Realtime-Whisper-1의 20.33% | -0.63포인트; 약 3.1% 상대 개선 |
| Real-World Audio Recording, 9개 언어, 전사 오류율 | 9.60% | GPT-Realtime-Whisper-1의 11.65% | -2.05포인트; 약 17.6% 상대 개선 |
방어 가능한 결론은 좁습니다. 새로운 라이브 모델이 OpenAI가 보고한 테스트에서 더 잘 수행됐고, 컨텍스트가 보고된 의미 정확도 점수를 개선했다는 점입니다. 이러한 벤더 보고 결과가 모든 언어, 전화 코덱, 마이크, 지연 설정, 도메인 용어, 보정 정책에서 동일한 개선을 보장하는 것은 아닙니다.
언제 Whisper 또는 GPT-4o Transcribe를 대신 사용해야 하나요?
새 모델이 모든 음성-텍스트 워크플로를 대체하는 것은 아닙니다.
| 요건 | 권장 경로 |
|---|---|
| 일반적인 완료 파일 전사 | gpt-transcribe |
| 저지연 라이브 자막 또는 통화 전사 | gpt-live-transcribe |
| 완료된 녹음의 화자 레이블 | gpt-4o-transcribe-diarize 와 diarized_json |
| 단어 또는 세그먼트 타임스탬프 | whisper-1 와 timestamp_granularities[] |
| 비영어 완료 오디오를 영어로 번역 | /v1/audio/translations 와 whisper-1 |
화자 분리의 경우 OpenAI는 파일 Transcriptions API를 요구합니다. 실시간 전사 세션에서는 화자 레이블을 지원하지 않습니다. 30초를 초과하는 녹음에는 chunking_strategy를 "auto"로 설정하거나 음성 활동 감지 구성을 사용하세요.
타임스탬프, 자막, 번역, 기존 Whisper 워크플로에 대해서는 CometAPI의 Whisper API 가이드와 Whisper-1 모델 페이지를 참고하세요. 다른 OpenAI 파일 전사 경로 평가 중인 팀은 GPT-4o Transcribe 모델 페이지도 검토할 수 있습니다.
Whisper에서 어떻게 마이그레이션해야 하나요?
모델 ID를 바꾸는 것이 전부가 아닙니다. 운영 트래픽을 전환하기 전에 전체 워크플로를 검증하세요.
| 점검 항목 | 필요한 조치 | 생략 시 위험 |
|---|---|---|
| 경로 선택 | 완료된 녹음과 진정한 라이브 워크로드를 분리 | 비동기 작업에 라이브 요금 지불 |
| 언어 필드 | 새 모델에서는 language를 languages로 교체; 둘을 동시에 보내지 않기 | 요청 또는 세션 거부 |
| 컨텍스트 힌트 | 이름, 숫자, 전문 용어, 잡음 있는 음성에 대해 프롬프트와 키워드 테스트 | 편향 또는 미발화 용어 삽입 |
| 지연 설정 | 대표 오디오에서 low, medium, high 최소 3가지를 벤치마크 | 데이터 없이 속도나 정확도를 임의 선택 |
| 이벤트 처리 | 델타와 완료 이벤트를 item_id로 정합 | 순서 뒤바뀜 또는 전사 덮어쓰기 |
| 기능 동등성 | 화자 분리, 타임스탬프, 신뢰도, 자막, 번역 의존성 인벤토리 | 다운스트림 필드 누락 |
| 비용 텔레메트리 | 오디오 분, 재시도, 실패, 보정 시간, 승인된 결과 로깅 | 정가와 실제 워크플로 비용 혼동 |
| 롤아웃 | 섀도 테스트, 소량 카나리, 폴백 유지 | 신속 롤백 없이 광범위한 회귀 |
GPT-Realtime-Whisper 마이그레이션에서는 오디오 형식, 턴 감지 정책, 테스트 세트, 지연 목표를 동일하게 유지하세요. 공개된 라이브 가격이 변하지 않았으므로, 우선순위는 승인 전사 비율, 지연 분포, 출력 안정성, 파이프라인 나머지와의 호환성입니다.
마이그레이션 가이드(Whisper / 이전 모델에서)
OpenAI는 공식 쿡북을 제공합니다: Whisper에서 GPT-Transcribe와 GPT-Live-Transcribe로 마이그레이션.
고수준 규칙:
- 녹음/배치 오디오 → 기존 /v1/audio/transcriptions 엔드포인트에서 gpt-transcribe로 전환
- 연속 라이브 오디오 → 실시간 전사 세션에서 gpt-live-transcribe로 전환
- 커밋된 턴 이후 더 높은 정확도 → 실시간 세션 내 gpt-transcribe 사용
최소 파일 마이그레이션 예시(Python):
Python
# Before (Whisper)with open("meeting.wav", "rb") as audio: result = client.audio.transcriptions.create( model="whisper-1", file=audio, language="en", prompt="Support call about AC-42" )# After (GPT-Transcribe)with open("meeting.wav", "rb") as audio: result = client.audio.transcriptions.create( model="gpt-transcribe", file=audio, prompt="A customer support call about billing", extra_body={ "keywords": ["AC-42", "Premium Plus"], "languages": ["en", "fr"] }, response_format="json" # or stream=True for deltas )
라이브 마이그레이션 참고:
- 동일한 실시간 세션 / WebSocket 아키텍처를 유지하세요.
- 모델 ID를 변경하고 단수 language를 languages 배열로 교체하세요.
- 선택적으로 prompt, keywords, delay(예: "low")를 추가하세요.
- 동일한 델타/완료 이벤트 처리를 계속하세요.
- language와 languages를 동시에 보내지 마세요.
마이그레이션 시 중요한 주의사항:
- GPT-Transcribe/GPT-Live-Transcribe는 단어 수준 타임스탬프, SRT/VTT, 영어 번역을 whisper-1과 동일 방식으로 지원하지 않습니다. 해당 필요에는 Whisper를 유지하세요.
- 응답 형식이 다릅니다 — text, verbose_json, srt, vtt가 동일하게 동작한다고 가정하지 마세요.
- 키워드는 단일 행 리터럴이어야 하며(<, >, CR, LF 없음), 그렇지 않으면 요청이 거부됩니다.
- 공개 WER 수치에만 의존하지 말고, 실제 운영 오디오(억양, 잡음, 도메인 용어, 짧은 발화)로 테스트하세요.
빠른 권장 사항
- 신규 작업의 기본값: 파일/배치는 GPT-Transcribe, 라이브 스트리밍은 GPT-Live-Transcribe.
- 기존 Whisper 또는 GPT-4o-Transcribe 통합은 계속 동작하지만 더 이상 권장 시작점은 아닙니다.
- 비용 민감한 배치 작업은 GPT-Transcribe 전환으로 특히 이점이 큽니다($0.006 대비 $0.0045).
최신 정보는 공식 모델 페이지와 OpenAI 개발자 사이트의 전사 개요 가이드를 확인하세요.
운영 오디오에서 두 모델을 어떻게 평가해야 하나요?
제품을 대표하는 라이선스 오디오를 사용하고, 깨끗한 데모 클립만으로 평가하지 마세요.
- 주요 사용 사례, 언어, 디바이스, 오디오 조건 전반에서 최소 50개 녹음을 선택합니다.
- 억양, 끊김, 배경 소음, 코드 스위칭, 숫자, 날짜, 통화, 이메일, 도메인 용어를 포함합니다.
- 완료된 녹음을
gpt-transcribe로 컨텍스트 힌트 유/무 두 가지로 실행합니다. - 동일한 라이브 샘플을
gpt-live-transcribe로 세 가지 지연 설정에서 재생합니다. - 포맷, 턴 경계, 프롬프트, 채점 규칙을 실행 간 일치시킵니다.
- 전사 오류, 도메인 용어 재현율, 부분 텍스트 수정, p50/p95 지연, 실패/재시도, 인력 보정 시간을 측정합니다.
- 승인된 전사당 비용을 계산하고, 전체 전환 전에 선택된 라우팅 정책을 카나리합니다.
최종 설계는 한 모델만 사용하거나 두 모델을 모두 사용할 수 있습니다. 의사결정 지표는 분당 정가가 아니라, 승인된 운영 전사의 비용과 신뢰성이어야 합니다.
FAQ
어떤 모델을 사용해야 하나요: GPT-Transcribe 또는 GPT-Live-Transcribe?
완료된 녹음과 비동기 작업에는 gpt-transcribe를 사용하세요. 오디오가 스트리밍되는 동안 텍스트가 도착해야 한다면 gpt-live-transcribe를 사용하세요.
GPT-Transcribe와 GPT-Live-Transcribe의 비용은 얼마인가요?
OpenAI는 gpt-transcribe를 오디오 분당 $0.0045(시간당 $0.27), gpt-live-transcribe를 분당 $0.017(시간당 $1.02)로 안내합니다.
GPT-Live-Transcribe가 GPT-Realtime-Whisper보다 더 정확한가요?
OpenAI의 9개 언어 Real-World Audio Recording 벤치마크에서 보고된 전사 오류율은 11.65%에서 9.60%로 감소했습니다. 귀사의 오디오로 이 벤치마크 특화 결과를 검증하세요.
GPT-Live-Transcribe는 화자 분리나 단어 타임스탬프를 지원하나요?
아니요. 화자 레이블, 단어 수준 타임스탬프, 신뢰도 점수를 반환하지 않습니다. 해당 필드가 필요하다면 호환되는 파일 모델이나 폴백 단계를 사용하세요.
GPT-Realtime-Whisper에서의 마이그레이션은 드롭인 모델 교체인가요?
아니요. 세션 구성, 언어 필드, 컨텍스트 입력, 지연 설정, 이벤트 순서, 기능 의존성, 지연, 출력 품질을 검증한 후 운영 트래픽을 전환하세요.
CometAPI로 전사 경로 테스트하기
구현 전에 CometAPI 가격 페이지에서 현재 모델 가용성과 경로 가격을 확인하고, OpenAI 호환 요청 패턴을 위해 CometAPI 문서를 사용하세요. 테스트에서는 정확한 모델 ID를 고정하고 오디오 길이, 지연 레벨, 최초 델타 지연, 최종 전사 지연, 재시도, 승인 전사 비율을 로깅하여 라우팅 결정이 전체 워크플로 비용을 반영하도록 하세요.
