GPT-Transcribe vs GPT-Live-Transcribe: Giá, khác biệt API và lộ trình di chuyển
TL;DR
Dùng gpt-transcribe cho bản ghi đã hoàn tất với giá $0.0045 mỗi phút âm thanh và gpt-live-transcribe cho micro, cuộc gọi hoặc luồng media trực tiếp với giá $0.017 mỗi phút. OpenAI báo cáo lỗi chép lời thấp hơn cho model live so với GPT-Realtime-Whisper trên các điểm chuẩn đã công bố, nhưng lựa chọn đúng phụ thuộc vào thời điểm văn bản phải xuất hiện, các trường đầu ra bạn cần và cách cả hai model thể hiện trên âm thanh sản xuất của bạn.
GPT-Transcribe vs GPT-Live-Transcribe: Tổng quan nhanh
Nếu bạn chỉ cần chép lời sau khi âm thanh đã được ghi, hãy dùng gpt-transcribe. Nếu ứng dụng của bạn cần văn bản khi âm thanh vẫn đang đến, hãy dùng gpt-live-transcribe. Khác biệt lớn nhất không chỉ là giá, mà là thời điểm bắt đầu chép lời và loại quy trình API mà ứng dụng của bạn phải hỗ trợ.
| Mục | gpt-transcribe | gpt-live-transcribe |
|---|---|---|
| Phù hợp nhất | Bản ghi đã tải lên, yêu cầu âm thanh có giới hạn, tác vụ bất đồng bộ và các lượt Realtime đã commit | Micro, cuộc gọi, cuộc họp và luồng media trực tiếp |
| Giá công bố | $0.0045 mỗi phút âm thanh | $0.017 mỗi phút âm thanh |
| Giá mỗi giờ âm thanh | $0.27 | $1.02 |
| API/Endpoint | /v1/audio/transcriptions; tùy chọn quy trình Realtime lượt đã commit | Phiên chép lời Realtime (v1/realtime/transcription_sessions hoặc tương tự) |
| Kết nối | Tải tệp; tùy chọn stream phản hồi trong khi tệp đang được xử lý | WebSocket cho pipeline phía máy chủ hoặc WebRTC cho âm thanh trình duyệt |
| Thời điểm bắt đầu chép lời | Sau khi tệp được gửi hoặc một lượt âm thanh được commit | Khi âm thanh đang đến |
| Đầu ra bản chép lời từng phần | Có, với stream tệp hoặc stream lượt đã commit | Có, khi lời nói đến trực tiếp |
| Tùy chọn ngữ cảnh | prompt, keywords, languages | prompt, keywords, languages, delay |
| Kết quả ngôn ngữ phát hiện | Có, khi mô hình có thể đưa ra dự đoán đáng tin cậy | Không |
| Giới hạn quan trọng | Giới hạn tải lên 25 MB; cần tuyến khác cho dấu thời gian, phân định người nói hoặc dịch | Không có dấu thời gian cấp từ, nhãn người nói hoặc điểm tin cậy |
Mặc dù gpt-transcribe có thể trả về cập nhật bản chép lời từng phần khi xử lý tệp đã hoàn tất hoặc lượt âm thanh đã commit, đây không phải là tuyến phát trực tiếp liên tục. Với phụ đề trực tiếp, cuộc gọi hoặc đầu vào từ micro, gpt-live-transcribe là lựa chọn tốt hơn.
Để so sánh rộng hơn giữa các nhà cung cấp, xem bài của CometAPI: 6 API chuyển giọng nói thành văn bản tốt nhất năm 2026.
GPT-Transcribe và GPT-Live-Transcribe là gì?
OpenAI giới thiệu gpt-transcribe và gpt-live-transcribe vào ngày 29/07/2026. gpt-transcribe xử lý bản ghi đã hoàn tất, chép lời tệp dạng stream và các lượt Realtime đã commit, trong khi gpt-live-transcribe trả về cập nhật bản chép lời độ trễ thấp khi âm thanh đến từ micro, cuộc gọi hoặc luồng media trực tiếp.
Hai model này cung cấp tuyến mặc định mới cho chép lời tệp thông thường và chép lời trực tiếp, nhưng quy trình chuyên biệt dùng Whisper và GPT-4o vẫn cần thiết cho dấu thời gian, dịch, phụ đề và phân định người nói.
Khi nào GPT-Live-Transcribe xứng đáng với mức giá cao hơn?
Trang API pricing của OpenAI liệt kê gpt-transcribe ở mức $0.0045 mỗi phút và gpt-live-transcribe ở mức $0.017 mỗi phút. Tuyến live vì vậy đắt hơn khoảng 3.8 lần trên mỗi phút âm thanh.
| Lưu lượng âm thanh hàng tháng | gpt-transcribe | gpt-live-transcribe | Chi phí bổ sung cho live |
|---|---|---|---|
| 100 giờ | $27 | $102 | $75 |
| 1,000 giờ | $270 | $1,020 | $750 |
| 10,000 giờ | $2,700 | $10,200 | $7,500 |
Các ước tính chi phí chép lời này chỉ sử dụng mức giá cơ bản được công bố của OpenAI: giờ âm thanh × 60 × giá mỗi phút. Không bao gồm lưu trữ, truyền tải mạng, retry, hosting ứng dụng, hậu xử lý, hiệu đính thủ công và chi phí nhà cung cấp dự phòng.
Chọn gpt-live-transcribe khi phụ đề tức thời, hỗ trợ tác vụ của agent, kiểm duyệt hoặc tương tác thời gian thực là yêu cầu sản phẩm. Chọn gpt-transcribe khi chỉ cần bản chép lời sau khi cuộc họp, cuộc gọi, phỏng vấn hoặc tải lên media đã hoàn tất. Kiến trúc hai tuyến có thể dùng chép lời live cho trải nghiệm người dùng và chép lời tệp cho xử lý sau cuộc gọi hoặc backfill.
Hiện OpenAI liệt kê GPT-Realtime-Whisper và gpt-live-transcribe cùng mức giá cơ bản $0.017/phút. Hãy đánh giá việc di chuyển giữa các tuyến live dựa trên chất lượng bản chép lời được chấp nhận, độ trễ, xử lý sự kiện và khả năng tương thích vận hành, thay vì chỉ dựa vào bảng giá.
API của GPT-Transcribe và GPT-Live-Transcribe khác nhau như thế nào?
Khác biệt chính là cách âm thanh đi vào hệ thống và thời điểm sự kiện bản chép lời bắt đầu. gpt-transcribe nhận tệp đã hoàn tất hoặc các lượt âm thanh đã commit, trong khi gpt-live-transcribe duy trì kết nối Realtime và phát các cập nhật bản chép lời khi âm thanh vẫn đang đến.
Dùng GPT-Transcribe cho âm thanh đã hoàn tất
Với bản ghi đã hoàn tất, gửi tệp đến /v1/audio/transcriptions. Hướng dẫn chép lời từ tệp của OpenAI chấp nhận tệp tối đa 25 MB ở định dạng mp3, mp4, mpeg, mpga, m4a, wav hoặc webm.
from openai import OpenAI
client = OpenAI()
with open("support-call.wav", "rb") as audio_file:
transcript = client.audio.transcriptions.create(
model="gpt-transcribe",
file=audio_file,
prompt="A support call about a premium plan and account AC-42.",
extra_body={
"keywords": ["premium plan", "AC-42", "billing"],
"languages": ["en"],
},
)
print(transcript.text)
Đặt stream=True để nhận các sự kiện delta của bản chép lời trong khi OpenAI xử lý tệp đã tải lên. Cách này rút ngắn thời gian chờ văn bản hiển thị, nhưng nó không biến endpoint tệp thành tuyến nhận âm thanh live từ micro.
Dùng GPT-Live-Transcribe cho âm thanh đang đến
Tạo phiên Realtime với type: "transcription" và chọn gpt-live-transcribe. Dùng WebSocket cho pipeline phía máy chủ hoặc WebRTC cho âm thanh trên trình duyệt.
{
"type": "session.update",
"session": {
"type": "transcription",
"audio": {
"input": {
"format": {
"type": "audio/pcm",
"rate": 24000
},
"transcription": {
"model": "gpt-live-transcribe",
"prompt": "A support call about a premium plan and account AC-42.",
"keywords": ["premium plan", "AC-42", "billing"],
"languages": ["en"],
"delay": "low"
},
"turn_detection": null
}
}
}
}
Nối các khối âm thanh bằng input_audio_buffer.append. Ứng dụng có thể commit lượt bằng input_audio_buffer.commit hoặc cấu hình phát hiện hoạt động giọng nói phía máy chủ.
Hướng dẫn chép lời Realtime trả về văn bản gia tăng qua conversation.item.input_audio_transcription.delta, theo sau là conversation.item.input_audio_transcription.completed cho mục đã commit. Các sự kiện hoàn tất từ các lượt khác nhau không đảm bảo đến theo thứ tự, vì vậy hãy đối chiếu bằng item_id thay vì thứ tự đến.
Dùng tuyến lượt đã commit khi không cần văn bản ngay lập tức
gpt-transcribe cũng có thể chạy trong một phiên chép lời Realtime qua WebSocket. Chép lời bắt đầu sau khi một lượt âm thanh được commit, mô hình có thể sử dụng các lượt đã chép trước đó làm ngữ cảnh, và sự kiện hoàn tất có thể bao gồm ngôn ngữ được phát hiện.
Tuyến lượt đã commit này hữu ích khi việc stream theo lượt hoặc phát hiện ngôn ngữ quan trọng hơn là hiển thị văn bản khi người nói vẫn đang nói. Đừng nhầm lẫn nó với hành vi liên tục, độ trễ thấp của gpt-live-transcribe.
Prompt, Keywords, Languages và Delay ảnh hưởng đến chép lời như thế nào?
Cả hai model đều chấp nhận ngữ cảnh có thể cải thiện nhận dạng tên, số, từ viết tắt, thuật ngữ sản phẩm, giọng nói có âm sắc, âm thanh đa ngôn ngữ và chuyển mã.
| Điều khiển | Mục đích | Lưu ý trong môi trường sản xuất |
|---|---|---|
| prompt | Mô tả bản ghi, người nói, lĩnh vực hoặc chủ đề dự kiến | Ngữ cảnh quá cụ thể có thể gây lệch bản chép lời |
| keywords | Cung cấp tên, từ viết tắt, định dạng tài khoản hoặc thuật ngữ kỹ thuật theo nghĩa đen | Gợi ý không phải đầu ra bắt buộc; thử để tránh chèn từ không được nói |
| languages | Liệt kê một hoặc nhiều ngôn ngữ đầu vào dự kiến | Mã không được hỗ trợ hoặc định dạng sai sẽ bị từ chối |
| delay | Đổi lấy văn bản live sớm hơn so với nhiều ngữ cảnh âm học hơn | Chỉ có ở gpt-live-transcribe; đo đạc thay vì giả định độ trễ cố định |
Với các model mới, languages thay thế trường language dạng số ít trước đây. Không gửi cả hai. Mỗi keyword phải nằm trên một dòng và không được chứa <, >, ký tự carriage return hoặc line feed; giá trị không hợp lệ sẽ khiến yêu cầu hoặc cập nhật phiên bị từ chối.
gpt-live-transcribe hỗ trợ các mức delay: minimal, low, medium, high và xhigh. Mức thấp ưu tiên văn bản tạm thời xuất hiện sớm hơn, trong khi mức cao cung cấp nhiều ngữ cảnh âm thanh hơn và có thể cải thiện chất lượng chép lời. OpenAI không đảm bảo độ trễ cố định cho từng mức, vì vậy hãy đo thời gian đến delta đầu tiên và thời gian đến bản chép lời cuối cùng trên micro, codec, mạng, ngôn ngữ và độ dài phiên đại diện.
Các điểm chuẩn độ chính xác của OpenAI cho thấy gì?
Thông báo ra mắt của OpenAI (link) cho biết gpt-live-transcribe vượt trội so với GPT-Realtime-Whisper-1 trên hai bài kiểm tra chép lời đa ngôn ngữ. Cũng báo cáo rằng ngữ cảnh tự do cải thiện độ chính xác ngữ nghĩa trên đánh giá Context Aware ASR.
| Đánh giá của OpenAI | Kết quả gpt-live-transcribe | So sánh | Mức thay đổi được báo cáo |
|---|---|---|---|
| Độ chính xác ngữ nghĩa Context Aware ASR | 44.6% với ngữ cảnh tự do | 38.5% không có ngữ cảnh | +6.1 điểm phần trăm |
| Common Voice, 22 ngôn ngữ, tỷ lệ lỗi chép lời | 19.70% | 20.33% cho GPT-Realtime-Whisper-1 | -0.63 điểm; khoảng 3.1% tương đối |
| Real-World Audio Recording, 9 ngôn ngữ, tỷ lệ lỗi chép lời | 9.60% | 11.65% cho GPT-Realtime-Whisper-1 | -2.05 điểm; khoảng 17.6% tương đối |
Kết luận có thể bảo vệ được là hẹp: model live mới thể hiện tốt hơn trên các bài kiểm tra mà OpenAI báo cáo, và ngữ cảnh cải thiện điểm độ chính xác ngữ nghĩa được báo cáo. Các kết quả do nhà cung cấp báo cáo không đảm bảo cải thiện tương tự cho mọi ngôn ngữ, codec thoại, micro, mức delay, từ vựng miền hay chính sách hiệu đính.
Khi nào bạn nên dùng Whisper hoặc GPT-4o Transcribe thay thế?
Không model mới nào thay thế mọi quy trình speech-to-text.
| Yêu cầu | Tuyến khuyến nghị |
|---|---|
| Chép lời tệp đã hoàn tất tổng quát | gpt-transcribe |
| Phụ đề live độ trễ thấp hoặc chép lời cuộc gọi | gpt-live-transcribe |
| Nhãn người nói cho bản ghi đã hoàn tất | gpt-4o-transcribe-diarize với diarized_json |
| Dấu thời gian theo từ hoặc theo đoạn | whisper-1 với timestamp_granularities[] |
| Dịch âm thanh không phải tiếng Anh đã hoàn tất sang tiếng Anh | /v1/audio/translations với whisper-1 |
Với phân định người nói, OpenAI yêu cầu dùng Transcriptions API dành cho tệp; gán nhãn người nói không được hỗ trợ trong các phiên chép lời Realtime. Với bản ghi dài hơn 30 giây, cấu hình chunking_strategy là "auto" hoặc dùng cấu hình phát hiện hoạt động giọng nói.
Đối với dấu thời gian, phụ đề, dịch hoặc quy trình Whisper hiện có, xem hướng dẫn Whisper API và trang model Whisper-1 của CometAPI. Các đội đang đánh giá một tuyến chép lời tệp khác của OpenAI cũng có thể tham khảo trang model GPT-4o Transcribe.
Bạn nên di chuyển từ Whisper như thế nào?
Thay đổi model ID chỉ là bước đầu. Hãy xác thực toàn bộ quy trình trước khi chuyển lưu lượng sản xuất.
| Hạng mục kiểm tra | Hành động bắt buộc | Rủi ro nếu bỏ qua |
|---|---|---|
| Lựa chọn tuyến | Tách bản ghi đã hoàn tất khỏi tải live thực sự | Trả giá live cho tác vụ bất đồng bộ |
| Trường ngôn ngữ | Thay language bằng languages cho các model mới; không bao giờ gửi cả hai | Yêu cầu hoặc phiên bị từ chối |
| Gợi ý ngữ cảnh | Thử prompt và keywords với tên, số, biệt ngữ và âm thanh nhiễu | Từ bị lệch hoặc chèn từ không được nói |
| Thiết lập delay | Đo đạc ít nhất low, medium và high trên âm thanh đại diện | Chọn tốc độ hoặc độ chính xác mà không có dữ liệu |
| Xử lý sự kiện | Đối chiếu delta và sự kiện hoàn tất bằng item_id | Bản chép lời sai thứ tự hoặc bị ghi đè |
| Tương đồng tính năng | Kiểm kê phụ thuộc vào phân định người nói, dấu thời gian, độ tin cậy, phụ đề và dịch | Thiếu trường đầu ra downstream |
| Theo dõi chi phí | Ghi log phút âm thanh, retry, kết quả lỗi, thời gian hiệu đính và bản chép lời được chấp nhận | Nhầm lẫn giữa bảng giá và chi phí quy trình |
| Triển khai | Shadow test, canary một phần nhỏ lưu lượng và giữ phương án dự phòng | Suy giảm diện rộng mà không có rollback nhanh |
Với việc di chuyển từ GPT-Realtime-Whisper, hãy giữ nguyên định dạng âm thanh, chính sách phát hiện lượt, bộ test và mục tiêu độ trễ. Vì giá live công bố không đổi, hãy ưu tiên tỷ lệ bản chép lời được chấp nhận, phân bố độ trễ, độ ổn định đầu ra và khả năng tương thích với phần còn lại của pipeline.
Hướng dẫn di chuyển (từ Whisper/các model trước đó)
OpenAI cung cấp cookbook chính thức: Migrate from Whisper to GPT-Transcribe and GPT-Live-Transcribe.
Quy tắc tổng quát:
- Âm thanh ghi sẵn/batch → chuyển sang gpt-transcribe trên endpoint /v1/audio/transcriptions hiện có.
- Âm thanh live liên tục → chuyển sang gpt-live-transcribe trong phiên chép lời Realtime.
- Độ chính xác cao hơn sau khi lượt được commit → dùng gpt-transcribe bên trong phiên Realtime.
Ví dụ di chuyển tối thiểu cho tệp (Python):
Python
# Before (Whisper)with open("meeting.wav", "rb") as audio: result = client.audio.transcriptions.create( model="whisper-1", file=audio, language="en", prompt="Support call about AC-42" )# After (GPT-Transcribe)with open("meeting.wav", "rb") as audio: result = client.audio.transcriptions.create( model="gpt-transcribe", file=audio, prompt="A customer support call about billing", extra_body={ "keywords": ["AC-42", "Premium Plus"], "languages": ["en", "fr"] }, response_format="json" # or stream=True for deltas )
Ghi chú di chuyển live:
- Giữ nguyên kiến trúc phiên Realtime/WebSocket.
- Thay model ID và thay trường
languageđơn thành mảnglanguages. - Thêm prompt, keywords và delay tùy chọn (ví dụ "low").
- Tiếp tục xử lý các sự kiện delta/completed như cũ.
- Không gửi đồng thời cả
languagevàlanguages.
Lưu ý quan trọng khi di chuyển:
- GPT-Transcribe/GPT-Live-Transcribe không hỗ trợ dấu thời gian cấp từ, SRT/VTT hoặc dịch tiếng Anh theo cách mà whisper-1 làm. Giữ Whisper cho các nhu cầu cụ thể này.
- Định dạng phản hồi khác nhau — đừng giả định text, verbose_json, srt hoặc vtt hoạt động giống hệt.
- Keywords phải là chuỗi một dòng (không có <, >, CR hoặc LF) nếu không yêu cầu sẽ bị từ chối.
- Kiểm thử trên âm thanh sản xuất đại diện (giọng, nhiễu, thuật ngữ miền, phát ngôn ngắn) thay vì chỉ dựa vào WER công bố.
Khuyến nghị nhanh
- Mặc định cho công việc mới: GPT-Transcribe cho tệp/batch, GPT-Live-Transcribe cho streaming live.
- Tích hợp Whisper hoặc GPT-4o-Transcribe hiện có vẫn hoạt động nhưng không còn là điểm khởi đầu khuyến nghị.
- Tác vụ batch nhạy cảm chi phí được lợi nhiều nhất khi chuyển sang GPT-Transcribe ($0.0045 so với $0.006).
Để biết chi tiết mới nhất, hãy xem các trang model chính thức và hướng dẫn tổng quan về chép lời trên trang dành cho nhà phát triển của OpenAI.
Bạn nên đánh giá hai model trên âm thanh sản xuất như thế nào?
Dùng âm thanh đã được cấp phép và đại diện cho sản phẩm thay vì chỉ dùng clip demo sạch.
- Chọn ít nhất 50 bản ghi bao phủ các trường hợp sử dụng chính, ngôn ngữ, thiết bị và điều kiện âm thanh.
- Bao gồm giọng/âm sắc, ngắt lời, tạp âm nền, chuyển mã, số, ngày, tiền tệ, địa chỉ email và từ vựng miền.
- Chạy bản ghi đã hoàn tất qua
gpt-transcribevới và không với gợi ý ngữ cảnh. - Phát lại cùng mẫu live qua
gpt-live-transcribeở ba mức delay. - Giữ định dạng, ranh giới lượt, prompt và quy tắc chấm điểm nhất quán giữa các lần chạy.
- Đo tỷ lệ lỗi chép lời, mức nhớ thuật ngữ miền, số lần sửa đổi văn bản tạm thời, độ trễ p50/p95, lỗi, retry và thời gian hiệu đính thủ công.
- Tính chi phí trên mỗi bản chép lời được chấp nhận, rồi canary chính sách định tuyến đã chọn trước khi di chuyển toàn bộ.
Thiết kế cuối có thể dùng một model hoặc cả hai. Chỉ số quyết định nên là chi phí và độ tin cậy của bản chép lời sản xuất được chấp nhận, không phải chỉ giá công bố mỗi phút.
Câu hỏi thường gặp
Tôi nên dùng model nào: GPT-Transcribe hay GPT-Live-Transcribe?
Dùng gpt-transcribe cho bản ghi đã hoàn tất và tác vụ bất đồng bộ. Dùng gpt-live-transcribe khi văn bản phải xuất hiện trong khi âm thanh vẫn đang stream.
GPT-Transcribe và GPT-Live-Transcribe có giá bao nhiêu?
OpenAI liệt kê gpt-transcribe ở $0.0045 mỗi phút âm thanh ($0.27 mỗi giờ) và gpt-live-transcribe ở $0.017 mỗi phút ($1.02 mỗi giờ).
GPT-Live-Transcribe có chính xác hơn GPT-Realtime-Whisper không?
Trên điểm chuẩn Real-World Audio Recording gồm chín ngôn ngữ của OpenAI, tỷ lệ lỗi chép lời giảm từ 11.65% xuống 9.60%. Hãy tự xác minh kết quả cụ thể này trên âm thanh của bạn.
GPT-Live-Transcribe có hỗ trợ phân định người nói hoặc dấu thời gian theo từ không?
Không. Model không trả về nhãn người nói, dấu thời gian cấp từ hoặc điểm tin cậy. Hãy dùng model tệp tương thích hoặc bước dự phòng khi cần các trường đó.
Việc di chuyển từ GPT-Realtime-Whisper có phải chỉ cần đổi model không?
Không. Hãy xác minh cấu hình phiên, trường ngôn ngữ, đầu vào ngữ cảnh, mức delay, thứ tự sự kiện, phụ thuộc tính năng, độ trễ và chất lượng đầu ra trước khi chuyển lưu lượng sản xuất.
Thử nghiệm các tuyến chép lời với CometAPI
Trước khi triển khai, kiểm tra tình trạng khả dụng model và giá tuyến hiện tại trên trang giá của CometAPI và dùng tài liệu CometAPI cho các mẫu request tương thích OpenAI. Ghim chính xác model ID trong các bài test và ghi log thời lượng âm thanh, mức delay, độ trễ đến delta đầu tiên, độ trễ đến bản chép lời cuối, retry và tỷ lệ bản chép lời được chấp nhận để quyết định định tuyến phản ánh chi phí toàn bộ quy trình.
