GPT-Transcribe مقابل GPT-Live-Transcribe: التسعير، فروق واجهة البرمجة، وخطوات الهجرة
الخلاصة
استخدم gpt-transcribe للتسجيلات المكتملة بسعر $0.0045 لكل دقيقة صوتية، وgpt-live-transcribe للميكروفونات أو المكالمات أو البثوصات الحية بسعر $0.017 لكل دقيقة. تشير تقارير OpenAI إلى خطأ تفريغ أقل للنموذج الحي مقارنة بـ GPT-Realtime-Whisper على معاييرها المنشورة، لكن المسار المناسب يعتمد على توقيت ظهور النص، وحقول المخرجات المطلوبة، وأداء كلا النموذجين على صوتك الإنتاجي.
GPT-Transcribe مقابل GPT-Live-Transcribe باختصار
إذا كنت تحتاج فقط إلى التفريغ بعد اكتمال التسجيل، استخدم gpt-transcribe. إذا كان تطبيقك يحتاج نصاً أثناء وصول الصوت، استخدم gpt-live-transcribe. أكبر الفروق ليست السعر فحسب، بل أيضاً توقيت بدء التفريغ ونوع سير عمل واجهة البرمجة الذي يجب أن يدعمه تطبيقك.
| Item | gpt-transcribe | gpt-live-transcribe |
|---|---|---|
| Best for | تسجيلات مرفوعة، طلبات صوتية محدودة، وظائف غير متزامنة، وأدوار Realtime مُلتزمة | ميكروفونات، مكالمات، اجتماعات، وبثوصات وسائط حية |
| Published price | $0.0045 لكل دقيقة صوتية | $0.017 لكل دقيقة صوتية |
| Price per audio hour | $0.27 | $1.02 |
| API / Endpoints | /v1/audio/transcriptions؛ خيار سير عمل Realtime قائم على الأدوار الملتزمة | جلسات تفريغ Realtime (v1/realtime/transcription_sessions أو ما شابه) |
| Connection | رفع ملف؛ خيار بث الاستجابة أثناء معالجة الملف | WebSocket لمسارات الخادم أو WebRTC لصوت المتصفح |
| When transcription begins | بعد إرسال ملف أو التزام دور صوتي | أثناء وصول الصوت |
| Partial transcript output | نعم، مع بث الملف أو بث الدور الملتزم | نعم، أثناء وصول الكلام الحي |
| Context controls | prompt, keywords, languages | prompt, keywords, languages, delay |
| Detected-language output | نعم، عندما يستطيع النموذج تقديم تنبؤ موثوق | لا |
| Important limitations | حد رفع 25 MB؛ مسارات أخرى مطلوبة للطرقات الزمنية، التفريق بين المتحدثين، أو الترجمة | لا توجد طوابع زمنية على مستوى الكلمات، ولا تسميات متحدثين، ولا درجات ثقة |
على الرغم من أن gpt-transcribe يمكنه إرجاع تحديثات جزئية للنص أثناء معالجة ملف مكتمل أو دور صوتي ملتزم، فإنه ليس مسار بث حي مستمر. للتسميات الحية، المكالمات، أو إدخال الميكروفون، يُعد gpt-live-transcribe الخيار الأفضل.
لمقارنة أوسع عبر المزوّدين، راجع مقال CometAPI: أفضل 6 واجهات برمجة لتحويل الكلام إلى نص في 2026.
ما هما GPT-Transcribe وGPT-Live-Transcribe؟
قدمت OpenAI gpt-transcribe وgpt-live-transcribe في 29 يوليو 2026. يعالج gpt-transcribe التسجيلات المكتملة، تفريغ ملفات مُذاعة، والأدوار الملتزمة ضمن Realtime، بينما يُرجع gpt-live-transcribe تحديثات نصية منخفضة الكمون أثناء وصول الصوت من الميكروفونات، المكالمات، أو بثوصات الوسائط الحية.
يوفر النموذجان مسارات افتراضية جديدة للتفريغ العام للملفات والبث الحي، لكن تبقى مسارات Whisper وGPT-4o المتخصصة مطلوبة للطوابع الزمنية، الترجمة، العناوين الفرعية، وتفريق المتحدثين.
متى يستحق GPT-Live-Transcribe السعر الأعلى؟
تسرد صفحة تسعير API من OpenAI gpt-transcribe بسعر $0.0045 في الدقيقة وgpt-live-transcribe بسعر $0.017 في الدقيقة. لذلك يكلف المسار الحي حوالي 3.8 مرات أكثر لكل دقيقة صوتية.
| Monthly audio volume | gpt-transcribe | gpt-live-transcribe | Additional live cost |
|---|---|---|---|
| 100 hours | $27 | $102 | $75 |
| 1,000 hours | $270 | $1,020 | $750 |
| 10,000 hours | $2,700 | $10,200 | $7,500 |
تستخدم تقديرات تكلفة التفريغ هذه معدلات OpenAI الأساسية المنشورة فقط: ساعات الصوت × 60 × السعر لكل دقيقة. وهي لا تشمل التخزين، نقل الشبكة، المحاولات المعادَة، استضافة التطبيق، المعالجة اللاحقة، التصحيح البشري، وتكاليف مزوّد احتياطي.
اختر gpt-live-transcribe عندما تكون التسميات الفورية، مساعدة العملاء، الإشراف، أو التفاعل اللحظي جزءاً من متطلبات المنتج. واختر gpt-transcribe عندما يكون النص مطلوباً فقط بعد اكتمال اجتماع، مكالمة، مقابلة، أو رفع وسائط. يمكن لهندسة بمسارين أن تستخدم التفريغ الحي لتجربة المستخدم وتفريغ الملف للمعالجة اللاحقة للمكالمة أو الاستدراكات.
تسرد OpenAI حالياً GPT-Realtime-Whisper وgpt-live-transcribe بالسعر الأساسي ذاته $0.017 لكل دقيقة. قيّم الهجرة بين هذين المسارين الحيين وفق جودة النص المقبول، الكمون، معالجة الأحداث، والتوافق التشغيلي بدلاً من الاعتماد على السعر المعلن وحده.
كيف تختلف واجهات برمجة GPT-Transcribe وGPT-Live-Transcribe؟
الفرق الرئيسي هو كيفية دخول الصوت إلى النظام ومتى تبدأ أحداث التفريغ. يقبل gpt-transcribe ملفات مكتملة أو أدواراً صوتية ملتزمة، بينما يحافظ gpt-live-transcribe على اتصال Realtime ويصدر تحديثات نصية أثناء وصول الصوت.
استخدم GPT-Transcribe للصوت المكتمل
للتسجيل المكتمل، أرسل الملف إلى /v1/audio/transcriptions. إن دليل تفريغ الملفات من OpenAI يقبل ملفات حتى 25 MB بصيغ mp3، mp4، mpeg، mpga، m4a، wav، أو webm.
from openai import OpenAI
client = OpenAI()
with open("support-call.wav", "rb") as audio_file:
transcript = client.audio.transcriptions.create(
model="gpt-transcribe",
file=audio_file,
prompt="A support call about a premium plan and account AC-42.",
extra_body={
"keywords": ["premium plan", "AC-42", "billing"],
"languages": ["en"],
},
)
print(transcript.text)
عيّن stream=True لاستقبال أحداث دلتا للنص أثناء معالجة التسجيل المرفوع. هذا يقلّل زمن الانتظار لظهور النص، لكنه لا يحوّل مسار الملفات إلى إدخال حي من الميكروفون.
استخدم GPT-Live-Transcribe للصوت الوافد
أنشئ جلسة Realtime مع type: "transcription" واختر gpt-live-transcribe. استخدم WebSocket لمسارات الوسائط على الخادم أو WebRTC لصوت المتصفح.
{
"type": "session.update",
"session": {
"type": "transcription",
"audio": {
"input": {
"format": {
"type": "audio/pcm",
"rate": 24000
},
"transcription": {
"model": "gpt-live-transcribe",
"prompt": "A support call about a premium plan and account AC-42.",
"keywords": ["premium plan", "AC-42", "billing"],
"languages": ["en"],
"delay": "low"
},
"turn_detection": null
}
}
}
}
ألحِق مقاطع الصوت عبر input_audio_buffer.append. يمكن للتطبيق الالتزام بالأدوار عبر input_audio_buffer.commit أو تهيئة كشف نشاط الصوت على الخادم.
إن دليل التفريغ Realtime يُرجع نصاً متزايداً عبر conversation.item.input_audio_transcription.delta، يتبعه conversation.item.input_audio_transcription.completed للبند الملتزم. لا يُضمن وصول أحداث الإكمال من أدوار مختلفة بالترتيب نفسه، لذا سوِّها باستخدام item_id بدلاً من ترتيب الوصول.
استخدم مسار الدور الملتزم عندما لا تكون الحاجة الفورية للنص ضرورية
يمكن تشغيل gpt-transcribe أيضاً ضمن جلسة تفريغ Realtime عبر WebSocket. يبدأ التفريغ بعد الالتزام بدور صوتي، ويمكن للنموذج استخدام الأدوار المفرّغة السابقة كسياق، ويمكن أن يتضمن حدث الإكمال اللغات المكتشفة.
هذا المسار مفيد عندما يكون بث النص المعتمد على الأدوار أو اكتشاف اللغة أهم من عرض النص أثناء استمرار حديث المتحدث. لا ينبغي الخلط بينه وبين السلوك المستمر منخفض الكمون لـ gpt-live-transcribe.
كيف تؤثر prompt وkeywords وlanguages وdelay على التفريغ؟
يقبل النموذجان سياقاً يمكنه تحسين تعرف الأسماء، الأرقام، الاختصارات، مصطلحات المنتجات، الكلام بلكنات، الصوت متعدد اللغات، وتبديل اللغات.
| Control | Purpose | Production caution |
|---|---|---|
| prompt | وصف التسجيل، المتحدث، المجال، أو الموضوع المتوقع | قد يؤدي السياق المفرط التخصيص إلى تحيز النص |
| keywords | تقديم أسماء حرفية، اختصارات، صيغ حسابات، أو مصطلحات تقنية | التلميحات ليست مخرجات إلزامية؛ اختبر إدراج مصطلحات غير منطوقة |
| languages | سرد لغة واحدة أو أكثر متوقعة للإدخال | الرموز غير المدعومة أو المُنسّقة بشكل خاطئ تؤدي للرفض |
| delay | المقايضة بين دلتات أبكر مقابل سياق صوتي أكبر | متاح لـ gpt-live-transcribe؛ قِس الأداء بدلاً من افتراض كمون ثابت |
بالنسبة للنماذج الجديدة، تستبدل languages الحقل الأقدم language. لا ترسلهما معاً. يجب أن يبقى كل keyword على سطر واحد ولا يحتوي على < أو > أو عودة عربة أو سطر جديد؛ القيم غير الصالحة تؤدي إلى رفض الطلب أو تحديث الجلسة.
يدعم gpt-live-transcribe مستويات delay: minimal وlow وmedium وhigh وxhigh. تفضّل الإعدادات الأدنى نصاً جزئياً أبكر، بينما توفر الإعدادات الأعلى سياقاً صوتياً أكبر وقد تحسن جودة التفريغ. لا تعد OpenAI بكمون ثابت لكل مستوى، لذا قِس زمن الوصول لأول دلتا وزمن الوصول للنص النهائي على ميكروفونات، ترميزات، شبكات، لغات، وأطوال جلسات ممثلة.
ماذا تُظهر معايير دقة OpenAI؟
تفيد إعلان الإطلاق من OpenAI بأن gpt-live-transcribe تفوق على GPT-Realtime-Whisper-1 في اختبارين متعددَي اللغات. كما يذكر أن السياق الحر حسّن الدقة الدلالية في تقييم Context Aware ASR.
| OpenAI evaluation | gpt-live-transcribe result | Comparison | Reported change |
|---|---|---|---|
| Context Aware ASR semantic accuracy | 44.6% with free-form context | 38.5% without context | +6.1 percentage points |
| Common Voice, 22 languages, transcription error rate | 19.70% | 20.33% for GPT-Realtime-Whisper-1 | -0.63 points; about 3.1% relative |
| Real-World Audio Recording, 9 languages, transcription error rate | 9.60% | 11.65% for GPT-Realtime-Whisper-1 | -2.05 points; about 17.6% relative |
الاستنتاج المتحفظ ضيق: أدّى النموذج الحي الجديد بشكل أفضل في اختبارات OpenAI المعلنة، وحسّن السياق المُتاح الدقة الدلالية المُبلّغ عنها. لا تضمن هذه النتائج المُبلّغ عنها من المورّد التحسين ذاته لكل لغة، ترميز هاتف، ميكروفون، إعداد delay، مفردات مجال، أو سياسة تصحيح.
متى ينبغي استخدام Whisper أو GPT-4o Transcribe بدلاً من ذلك؟
لا يستبدل أيٌّ من النموذجين كل مسارات تحويل الكلام إلى نص.
| Requirement | Recommended route |
|---|---|
| التفريغ العام لملفات مكتملة | gpt-transcribe |
| تسميات حية منخفضة الكمون أو تفريغ مكالمات | gpt-live-transcribe |
| تسميات المتحدثين للتسجيلات المكتملة | gpt-4o-transcribe-diarize مع diarized_json |
| طوابع زمنية للكلمات أو المقاطع | whisper-1 مع timestamp_granularities[] |
| ترجمة صوت غير إنجليزي مكتمل إلى الإنجليزية | /v1/audio/translations مع whisper-1 |
بالنسبة للتفريق بين المتحدثين، تتطلب OpenAI واجهة Transcriptions للملفات؛ لا يُدعم وضع تسميات المتحدثين في جلسات التفريغ Realtime. للتسجيلات الأطول من 30 ثانية، اضبط chunking_strategy على "auto" أو استخدم إعداد كشف نشاط الصوت.
للطوابع الزمنية، العناوين الفرعية، الترجمة، أو مسارات Whisper القائمة، راجع دليل واجهة Whisper من CometAPI وصفحة نموذج Whisper-1. يمكن للفرق التي تقيم مسار تفريغ ملفات آخر من OpenAI مراجعة صفحة نموذج GPT-4o Transcribe.
كيف تنتقل من Whisper؟
تغيير معرّف النموذج هو الخطوة الأولى فقط. تحقق من سير العمل كاملاً قبل تحويل حركة الإنتاج.
| Check | Required action | Risk if skipped |
|---|---|---|
| Route selection | فصل التسجيلات المكتملة عن الأحمال الحقيقية الحية | دفع سعر المسار الحي للوظائف غير المتزامنة |
| Language fields | استبدال language بـ languages للنماذج الجديدة؛ لا ترسل كليهما | رفض الطلبات أو الجلسات |
| Context hints | اختبار prompts وkeywords على الأسماء، الأرقام، المصطلحات، والكلام المزعج | مصطلحات منحازة أو مُدرجة دون أن تُنطق |
| Delay setting | قياس الأقل، المتوسط، والعالي على صوت ممثل | اختيار السرعة أو الدقة دون بيانات |
| Event handling | تسوية الدلتات وأحداث الإكمال باستخدام item_id | نصوص خارج الترتيب أو مستبدلة |
| Feature parity | جرد الاعتمادات على التفريق، الطوابع الزمنية، الثقة، العناوين الفرعية، والترجمة | فقدان حقول لاحقة |
| Cost telemetry | تسجيل دقائق الصوت، المحاولات، النتائج الفاشلة، وقت التصحيح البشري، ومعدل النص المقبول | الخلط بين السعر المعلن وتكلفة سير العمل |
| Rollout | اختبار ظلّي، طرح مرحلي لحصة صغيرة، والاحتفاظ بمسار رجوع | تدهور واسع دون تراجع سريع |
لهجرة GPT-Realtime-Whisper، احتفظ بتنسيق الصوت، سياسة كشف الأدوار، مجموعة الاختبار، وهدف الكمون ثابتة. ونظراً لأن السعر الحي المنشور لم يتغير، أعطِ الأولوية لمعدل النص المقبول، توزيع الكمون، استقرار المخرجات، والتوافق مع بقية خط الأنابيب.
دليل الهجرة (من Whisper / النماذج السابقة)
توفر OpenAI دليلاً رسمياً: الهجرة من Whisper إلى GPT-Transcribe وGPT-Live-Transcribe.
قواعد عليا:
- صوت مسجل/دفعات → التحويل إلى gpt-transcribe على مسار
/v1/audio/transcriptionsالقائم. - صوت حي مستمر → التحويل إلى gpt-live-transcribe في جلسة تفريغ Realtime.
- دقة أعلى بعد دور ملتزم → استخدم gpt-transcribe داخل جلسة Realtime.
مثال هجرة ملف مصغّر (Python):
Python
# Before (Whisper)with open("meeting.wav", "rb") as audio: result = client.audio.transcriptions.create( model="whisper-1", file=audio, language="en", prompt="Support call about AC-42" )# After (GPT-Transcribe)with open("meeting.wav", "rb") as audio: result = client.audio.transcriptions.create( model="gpt-transcribe", file=audio, prompt="A customer support call about billing", extra_body={ "keywords": ["AC-42", "Premium Plus"], "languages": ["en", "fr"] }, response_format="json" # or stream=True for deltas )
ملاحظات الهجرة الحية:
- احتفظ بهيكل جلسة Realtime / WebSocket نفسه.
- غيّر معرّف النموذج واستبدل الحقل المفرد language بمصفوفة languages.
- أضِف prompt وkeywords وdelay الاختيارية (مثل "low").
- استمر في التعامل مع أحداث delta/completed نفسها.
- لا ترسل language وlanguages معاً.
تحذيرات مهمة عند الهجرة:
- لا يدعم GPT-Transcribe/GPT-Live-Transcribe طوابع الكلمات الزمنية، SRT/VTT، أو الترجمة إلى الإنجليزية بالطريقة نفسها التي يعمل بها whisper-1. احتفظ بـ Whisper لهذه الاحتياجات.
- تختلف صيغ الاستجابة — لا تفترض أن text أو verbose_json أو srt أو vtt تعمل بشكل مماثل.
- يجب أن تكون keywords سلاسل أحادية السطر (بدون < أو > أو CR أو LF) وإلا يُرفَض الطلب.
- اختبر على صوت إنتاجي ممثل (لكنات، ضوضاء، مصطلحات المجال، عبارات قصيرة) بدلاً من الاعتماد فقط على أرقام WER المنشورة.
توصية سريعة
- الافتراضي للأعمال الجديدة: GPT-Transcribe للملفات/الدفعات، GPT-Live-Transcribe للبث الحي.
- تواصل تكاملات Whisper أو GPT-4o-Transcribe الحالية في العمل لكنها لم تعد نقطة البدء الموصى بها.
- تستفيد الوظائف الدفعية الحساسة للتكلفة أكثر من الانتقال إلى GPT-Transcribe ($0.0045 مقابل $0.006).
لأحدث التفاصيل، راجع الصفحات الرسمية للنماذج ونظرة عامة على التفريغ في موقع مطوّري OpenAI.
كيف تقيم النموذجين على الصوت الإنتاجي؟
استخدم صوتاً مرخّصاً يمثل المنتج بدلاً من مقاطع عرض نظيفة فقط.
- اختر ما لا يقل عن 50 تسجيلاً عبر حالات الاستخدام الرئيسية، اللغات، الأجهزة، وظروف الصوت.
- ضمّن لكنات، مقاطعات، ضوضاء خلفية، تبديل لغات، أرقام، تواريخ، عملات، عناوين بريد إلكتروني، ومفردات المجال.
- شغّل التسجيلات المكتملة عبر
gpt-transcribeمع وبدون تلميحات سياق. - أعد تشغيل العينات الحية نفسها عبر
gpt-live-transcribeعلى ثلاث إعدادات delay. - احتفظ بالتنسيقات، حدود الأدوار، التلميحات، وقواعد القياس ثابتة عبر التشغيلات.
- قِس خطأ التفريغ، استرجاع مصطلحات المجال، مراجعات النص الجزئي، كمون p50 وp95، الإخفاقات، المحاولات المعادَة، ووقت التصحيح البشري.
- احسب تكلفة كل نص مقبول، ثم نفّذ طرحاً مرحلياً لسياسة التوجيه المختارة قبل الهجرة الكاملة.
قد يستخدم التصميم النهائي نموذجاً واحداً أو كليهما. ينبغي أن يكون المقياس الحاسم هو تكلفة وموثوقية نص إنتاجي مقبول، وليس السعر المنشور لكل دقيقة بمعزل.
الأسئلة الشائعة
أي نموذج يجب أن أستخدم: GPT-Transcribe أم GPT-Live-Transcribe؟
استخدم gpt-transcribe للتسجيلات المكتملة والوظائف غير المتزامنة. استخدم gpt-live-transcribe عندما يجب وصول النص أثناء تدفق الصوت.
كم تكلفة GPT-Transcribe وGPT-Live-Transcribe؟
تسرد OpenAI gpt-transcribe بسعر $0.0045 لكل دقيقة صوتية ($0.27 في الساعة) وgpt-live-transcribe بسعر $0.017 لكل دقيقة ($1.02 في الساعة).
هل GPT-Live-Transcribe أدق من GPT-Realtime-Whisper؟
على معيار OpenAI لتسجيلات العالم الحقيقي بتسع لغات، انخفض معدل خطأ التفريغ من 11.65% إلى 9.60%. تحقّق من هذا في صوتك الخاص.
هل يدعم GPT-Live-Transcribe التفريق بين المتحدثين أو طوابع كلمات زمنية؟
لا. لا يُرجع تسميات متحدثين، طوابع زمنية على مستوى الكلمات، أو درجات ثقة. استخدم نموذج ملفات متوافقاً أو خطوة احتياط عند الحاجة إلى هذه الحقول.
هل الهجرة من GPT-Realtime-Whisper مجرد استبدال مباشر للنموذج؟
لا. تحقّق من تهيئة الجلسة، حقول اللغة، مدخلات السياق، إعدادات delay، ترتيب الأحداث، الاعتمادات على الميزات، الكمون، وجودة المخرجات قبل نقل حركة الإنتاج.
اختبر مسارات التفريغ مع CometAPI
قبل التنفيذ، تحقّق من توفر النماذج الحالية وتسعير المسارات على صفحة تسعير CometAPI واستخدم توثيق CometAPI لأنماط طلب متوافقة مع OpenAI. ثبّت معرّفات النماذج الدقيقة في الاختبارات وسجّل مدة الصوت، مستوى delay، كمون أول دلتا، كمون النص النهائي، المحاولات المعادَة، ومعدل النص المقبول حتى يعكس قرار التوجيه تكلفة سير العمل الإجمالية.
