GPT-5.6 Luna price down 80%, Terra down 20% →

GPT-Transcribe مقابل GPT-Live-Transcribe: API والأسعار

CometAPI
Mia MarenJul 31, 2026
GPT-Transcribe مقابل GPT-Live-Transcribe: API والأسعار

GPT-Transcribe مقابل GPT-Live-Transcribe: التسعير، فروق واجهة البرمجة، وخطوات الهجرة

الخلاصة

استخدم gpt-transcribe للتسجيلات المكتملة بسعر $0.0045 لكل دقيقة صوتية، وgpt-live-transcribe للميكروفونات أو المكالمات أو البثوصات الحية بسعر $0.017 لكل دقيقة. تشير تقارير OpenAI إلى خطأ تفريغ أقل للنموذج الحي مقارنة بـ GPT-Realtime-Whisper على معاييرها المنشورة، لكن المسار المناسب يعتمد على توقيت ظهور النص، وحقول المخرجات المطلوبة، وأداء كلا النموذجين على صوتك الإنتاجي.

GPT-Transcribe مقابل GPT-Live-Transcribe باختصار

إذا كنت تحتاج فقط إلى التفريغ بعد اكتمال التسجيل، استخدم gpt-transcribe. إذا كان تطبيقك يحتاج نصاً أثناء وصول الصوت، استخدم gpt-live-transcribe. أكبر الفروق ليست السعر فحسب، بل أيضاً توقيت بدء التفريغ ونوع سير عمل واجهة البرمجة الذي يجب أن يدعمه تطبيقك.

Itemgpt-transcribegpt-live-transcribe
Best forتسجيلات مرفوعة، طلبات صوتية محدودة، وظائف غير متزامنة، وأدوار Realtime مُلتزمةميكروفونات، مكالمات، اجتماعات، وبثوصات وسائط حية
Published price$0.0045 لكل دقيقة صوتية$0.017 لكل دقيقة صوتية
Price per audio hour$0.27$1.02
API / Endpoints/v1/audio/transcriptions؛ خيار سير عمل Realtime قائم على الأدوار الملتزمةجلسات تفريغ Realtime (v1/realtime/transcription_sessions أو ما شابه)
Connectionرفع ملف؛ خيار بث الاستجابة أثناء معالجة الملفWebSocket لمسارات الخادم أو WebRTC لصوت المتصفح
When transcription beginsبعد إرسال ملف أو التزام دور صوتيأثناء وصول الصوت
Partial transcript outputنعم، مع بث الملف أو بث الدور الملتزمنعم، أثناء وصول الكلام الحي
Context controlsprompt, keywords, languagesprompt, keywords, languages, delay
Detected-language outputنعم، عندما يستطيع النموذج تقديم تنبؤ موثوقلا
Important limitationsحد رفع 25 MB؛ مسارات أخرى مطلوبة للطرقات الزمنية، التفريق بين المتحدثين، أو الترجمةلا توجد طوابع زمنية على مستوى الكلمات، ولا تسميات متحدثين، ولا درجات ثقة

على الرغم من أن gpt-transcribe يمكنه إرجاع تحديثات جزئية للنص أثناء معالجة ملف مكتمل أو دور صوتي ملتزم، فإنه ليس مسار بث حي مستمر. للتسميات الحية، المكالمات، أو إدخال الميكروفون، يُعد gpt-live-transcribe الخيار الأفضل.

لمقارنة أوسع عبر المزوّدين، راجع مقال CometAPI: أفضل 6 واجهات برمجة لتحويل الكلام إلى نص في 2026.

ما هما GPT-Transcribe وGPT-Live-Transcribe؟

قدمت OpenAI gpt-transcribe وgpt-live-transcribe في 29 يوليو 2026. يعالج gpt-transcribe التسجيلات المكتملة، تفريغ ملفات مُذاعة، والأدوار الملتزمة ضمن Realtime، بينما يُرجع gpt-live-transcribe تحديثات نصية منخفضة الكمون أثناء وصول الصوت من الميكروفونات، المكالمات، أو بثوصات الوسائط الحية.

يوفر النموذجان مسارات افتراضية جديدة للتفريغ العام للملفات والبث الحي، لكن تبقى مسارات Whisper وGPT-4o المتخصصة مطلوبة للطوابع الزمنية، الترجمة، العناوين الفرعية، وتفريق المتحدثين.

متى يستحق GPT-Live-Transcribe السعر الأعلى؟

تسرد صفحة تسعير API من OpenAI gpt-transcribe بسعر $0.0045 في الدقيقة وgpt-live-transcribe بسعر $0.017 في الدقيقة. لذلك يكلف المسار الحي حوالي 3.8 مرات أكثر لكل دقيقة صوتية.

Monthly audio volumegpt-transcribegpt-live-transcribeAdditional live cost
100 hours$27$102$75
1,000 hours$270$1,020$750
10,000 hours$2,700$10,200$7,500

تستخدم تقديرات تكلفة التفريغ هذه معدلات OpenAI الأساسية المنشورة فقط: ساعات الصوت × 60 × السعر لكل دقيقة. وهي لا تشمل التخزين، نقل الشبكة، المحاولات المعادَة، استضافة التطبيق، المعالجة اللاحقة، التصحيح البشري، وتكاليف مزوّد احتياطي.

اختر gpt-live-transcribe عندما تكون التسميات الفورية، مساعدة العملاء، الإشراف، أو التفاعل اللحظي جزءاً من متطلبات المنتج. واختر gpt-transcribe عندما يكون النص مطلوباً فقط بعد اكتمال اجتماع، مكالمة، مقابلة، أو رفع وسائط. يمكن لهندسة بمسارين أن تستخدم التفريغ الحي لتجربة المستخدم وتفريغ الملف للمعالجة اللاحقة للمكالمة أو الاستدراكات.

تسرد OpenAI حالياً GPT-Realtime-Whisper وgpt-live-transcribe بالسعر الأساسي ذاته $0.017 لكل دقيقة. قيّم الهجرة بين هذين المسارين الحيين وفق جودة النص المقبول، الكمون، معالجة الأحداث، والتوافق التشغيلي بدلاً من الاعتماد على السعر المعلن وحده.

كيف تختلف واجهات برمجة GPT-Transcribe وGPT-Live-Transcribe؟

الفرق الرئيسي هو كيفية دخول الصوت إلى النظام ومتى تبدأ أحداث التفريغ. يقبل gpt-transcribe ملفات مكتملة أو أدواراً صوتية ملتزمة، بينما يحافظ gpt-live-transcribe على اتصال Realtime ويصدر تحديثات نصية أثناء وصول الصوت.

استخدم GPT-Transcribe للصوت المكتمل

للتسجيل المكتمل، أرسل الملف إلى /v1/audio/transcriptions. إن دليل تفريغ الملفات من OpenAI يقبل ملفات حتى 25 MB بصيغ mp3، mp4، mpeg، mpga، m4a، wav، أو webm.

from openai import OpenAI

client = OpenAI()
with open("support-call.wav", "rb") as audio_file:
    transcript = client.audio.transcriptions.create(
        model="gpt-transcribe",
        file=audio_file,
        prompt="A support call about a premium plan and account AC-42.",
        extra_body={
            "keywords": ["premium plan", "AC-42", "billing"],
            "languages": ["en"],
        },
    )
print(transcript.text)

عيّن stream=True لاستقبال أحداث دلتا للنص أثناء معالجة التسجيل المرفوع. هذا يقلّل زمن الانتظار لظهور النص، لكنه لا يحوّل مسار الملفات إلى إدخال حي من الميكروفون.

استخدم GPT-Live-Transcribe للصوت الوافد

أنشئ جلسة Realtime مع type: "transcription" واختر gpt-live-transcribe. استخدم WebSocket لمسارات الوسائط على الخادم أو WebRTC لصوت المتصفح.

{
  "type": "session.update",
  "session": {
    "type": "transcription",
    "audio": {
      "input": {
        "format": {
          "type": "audio/pcm",
          "rate": 24000
        },
        "transcription": {
          "model": "gpt-live-transcribe",
          "prompt": "A support call about a premium plan and account AC-42.",
          "keywords": ["premium plan", "AC-42", "billing"],
          "languages": ["en"],
          "delay": "low"
        },
        "turn_detection": null
      }
    }
  }
}

ألحِق مقاطع الصوت عبر input_audio_buffer.append. يمكن للتطبيق الالتزام بالأدوار عبر input_audio_buffer.commit أو تهيئة كشف نشاط الصوت على الخادم.

إن دليل التفريغ Realtime يُرجع نصاً متزايداً عبر conversation.item.input_audio_transcription.delta، يتبعه conversation.item.input_audio_transcription.completed للبند الملتزم. لا يُضمن وصول أحداث الإكمال من أدوار مختلفة بالترتيب نفسه، لذا سوِّها باستخدام item_id بدلاً من ترتيب الوصول.

استخدم مسار الدور الملتزم عندما لا تكون الحاجة الفورية للنص ضرورية

يمكن تشغيل gpt-transcribe أيضاً ضمن جلسة تفريغ Realtime عبر WebSocket. يبدأ التفريغ بعد الالتزام بدور صوتي، ويمكن للنموذج استخدام الأدوار المفرّغة السابقة كسياق، ويمكن أن يتضمن حدث الإكمال اللغات المكتشفة.

هذا المسار مفيد عندما يكون بث النص المعتمد على الأدوار أو اكتشاف اللغة أهم من عرض النص أثناء استمرار حديث المتحدث. لا ينبغي الخلط بينه وبين السلوك المستمر منخفض الكمون لـ gpt-live-transcribe.

كيف تؤثر prompt وkeywords وlanguages وdelay على التفريغ؟

يقبل النموذجان سياقاً يمكنه تحسين تعرف الأسماء، الأرقام، الاختصارات، مصطلحات المنتجات، الكلام بلكنات، الصوت متعدد اللغات، وتبديل اللغات.

ControlPurposeProduction caution
promptوصف التسجيل، المتحدث، المجال، أو الموضوع المتوقعقد يؤدي السياق المفرط التخصيص إلى تحيز النص
keywordsتقديم أسماء حرفية، اختصارات، صيغ حسابات، أو مصطلحات تقنيةالتلميحات ليست مخرجات إلزامية؛ اختبر إدراج مصطلحات غير منطوقة
languagesسرد لغة واحدة أو أكثر متوقعة للإدخالالرموز غير المدعومة أو المُنسّقة بشكل خاطئ تؤدي للرفض
delayالمقايضة بين دلتات أبكر مقابل سياق صوتي أكبرمتاح لـ gpt-live-transcribe؛ قِس الأداء بدلاً من افتراض كمون ثابت

بالنسبة للنماذج الجديدة، تستبدل languages الحقل الأقدم language. لا ترسلهما معاً. يجب أن يبقى كل keyword على سطر واحد ولا يحتوي على < أو > أو عودة عربة أو سطر جديد؛ القيم غير الصالحة تؤدي إلى رفض الطلب أو تحديث الجلسة.

يدعم gpt-live-transcribe مستويات delay: minimal وlow وmedium وhigh وxhigh. تفضّل الإعدادات الأدنى نصاً جزئياً أبكر، بينما توفر الإعدادات الأعلى سياقاً صوتياً أكبر وقد تحسن جودة التفريغ. لا تعد OpenAI بكمون ثابت لكل مستوى، لذا قِس زمن الوصول لأول دلتا وزمن الوصول للنص النهائي على ميكروفونات، ترميزات، شبكات، لغات، وأطوال جلسات ممثلة.

ماذا تُظهر معايير دقة OpenAI؟

تفيد إعلان الإطلاق من OpenAI بأن gpt-live-transcribe تفوق على GPT-Realtime-Whisper-1 في اختبارين متعددَي اللغات. كما يذكر أن السياق الحر حسّن الدقة الدلالية في تقييم Context Aware ASR.

OpenAI evaluationgpt-live-transcribe resultComparisonReported change
Context Aware ASR semantic accuracy44.6% with free-form context38.5% without context+6.1 percentage points
Common Voice, 22 languages, transcription error rate19.70%20.33% for GPT-Realtime-Whisper-1-0.63 points; about 3.1% relative
Real-World Audio Recording, 9 languages, transcription error rate9.60%11.65% for GPT-Realtime-Whisper-1-2.05 points; about 17.6% relative

الاستنتاج المتحفظ ضيق: أدّى النموذج الحي الجديد بشكل أفضل في اختبارات OpenAI المعلنة، وحسّن السياق المُتاح الدقة الدلالية المُبلّغ عنها. لا تضمن هذه النتائج المُبلّغ عنها من المورّد التحسين ذاته لكل لغة، ترميز هاتف، ميكروفون، إعداد delay، مفردات مجال، أو سياسة تصحيح.

متى ينبغي استخدام Whisper أو GPT-4o Transcribe بدلاً من ذلك؟

لا يستبدل أيٌّ من النموذجين كل مسارات تحويل الكلام إلى نص.

RequirementRecommended route
التفريغ العام لملفات مكتملةgpt-transcribe
تسميات حية منخفضة الكمون أو تفريغ مكالماتgpt-live-transcribe
تسميات المتحدثين للتسجيلات المكتملةgpt-4o-transcribe-diarize مع diarized_json
طوابع زمنية للكلمات أو المقاطعwhisper-1 مع timestamp_granularities[]
ترجمة صوت غير إنجليزي مكتمل إلى الإنجليزية/v1/audio/translations مع whisper-1

بالنسبة للتفريق بين المتحدثين، تتطلب OpenAI واجهة Transcriptions للملفات؛ لا يُدعم وضع تسميات المتحدثين في جلسات التفريغ Realtime. للتسجيلات الأطول من 30 ثانية، اضبط chunking_strategy على "auto" أو استخدم إعداد كشف نشاط الصوت.

للطوابع الزمنية، العناوين الفرعية، الترجمة، أو مسارات Whisper القائمة، راجع دليل واجهة Whisper من CometAPI وصفحة نموذج Whisper-1. يمكن للفرق التي تقيم مسار تفريغ ملفات آخر من OpenAI مراجعة صفحة نموذج GPT-4o Transcribe.

كيف تنتقل من Whisper؟

تغيير معرّف النموذج هو الخطوة الأولى فقط. تحقق من سير العمل كاملاً قبل تحويل حركة الإنتاج.

CheckRequired actionRisk if skipped
Route selectionفصل التسجيلات المكتملة عن الأحمال الحقيقية الحيةدفع سعر المسار الحي للوظائف غير المتزامنة
Language fieldsاستبدال language بـ languages للنماذج الجديدة؛ لا ترسل كليهمارفض الطلبات أو الجلسات
Context hintsاختبار prompts وkeywords على الأسماء، الأرقام، المصطلحات، والكلام المزعجمصطلحات منحازة أو مُدرجة دون أن تُنطق
Delay settingقياس الأقل، المتوسط، والعالي على صوت ممثلاختيار السرعة أو الدقة دون بيانات
Event handlingتسوية الدلتات وأحداث الإكمال باستخدام item_idنصوص خارج الترتيب أو مستبدلة
Feature parityجرد الاعتمادات على التفريق، الطوابع الزمنية، الثقة، العناوين الفرعية، والترجمةفقدان حقول لاحقة
Cost telemetryتسجيل دقائق الصوت، المحاولات، النتائج الفاشلة، وقت التصحيح البشري، ومعدل النص المقبولالخلط بين السعر المعلن وتكلفة سير العمل
Rolloutاختبار ظلّي، طرح مرحلي لحصة صغيرة، والاحتفاظ بمسار رجوعتدهور واسع دون تراجع سريع

لهجرة GPT-Realtime-Whisper، احتفظ بتنسيق الصوت، سياسة كشف الأدوار، مجموعة الاختبار، وهدف الكمون ثابتة. ونظراً لأن السعر الحي المنشور لم يتغير، أعطِ الأولوية لمعدل النص المقبول، توزيع الكمون، استقرار المخرجات، والتوافق مع بقية خط الأنابيب.

دليل الهجرة (من Whisper / النماذج السابقة)

توفر OpenAI دليلاً رسمياً: الهجرة من Whisper إلى GPT-Transcribe وGPT-Live-Transcribe.

قواعد عليا:

  1. صوت مسجل/دفعات → التحويل إلى gpt-transcribe على مسار /v1/audio/transcriptions القائم.
  2. صوت حي مستمر → التحويل إلى gpt-live-transcribe في جلسة تفريغ Realtime.
  3. دقة أعلى بعد دور ملتزم → استخدم gpt-transcribe داخل جلسة Realtime.

مثال هجرة ملف مصغّر (Python):

Python

# Before (Whisper)with open("meeting.wav", "rb") as audio:    result = client.audio.transcriptions.create(        model="whisper-1",        file=audio,        language="en",        prompt="Support call about AC-42"    )# After (GPT-Transcribe)with open("meeting.wav", "rb") as audio:    result = client.audio.transcriptions.create(        model="gpt-transcribe",        file=audio,        prompt="A customer support call about billing",        extra_body={            "keywords": ["AC-42", "Premium Plus"],            "languages": ["en", "fr"]        },        response_format="json"  # or stream=True for deltas    )

ملاحظات الهجرة الحية:

  • احتفظ بهيكل جلسة Realtime / WebSocket نفسه.
  • غيّر معرّف النموذج واستبدل الحقل المفرد language بمصفوفة languages.
  • أضِف prompt وkeywords وdelay الاختيارية (مثل "low").
  • استمر في التعامل مع أحداث delta/completed نفسها.
  • لا ترسل language وlanguages معاً.

تحذيرات مهمة عند الهجرة:

  • لا يدعم GPT-Transcribe/GPT-Live-Transcribe طوابع الكلمات الزمنية، SRT/VTT، أو الترجمة إلى الإنجليزية بالطريقة نفسها التي يعمل بها whisper-1. احتفظ بـ Whisper لهذه الاحتياجات.
  • تختلف صيغ الاستجابة — لا تفترض أن text أو verbose_json أو srt أو vtt تعمل بشكل مماثل.
  • يجب أن تكون keywords سلاسل أحادية السطر (بدون < أو > أو CR أو LF) وإلا يُرفَض الطلب.
  • اختبر على صوت إنتاجي ممثل (لكنات، ضوضاء، مصطلحات المجال، عبارات قصيرة) بدلاً من الاعتماد فقط على أرقام WER المنشورة.

توصية سريعة

  • الافتراضي للأعمال الجديدة: GPT-Transcribe للملفات/الدفعات، GPT-Live-Transcribe للبث الحي.
  • تواصل تكاملات Whisper أو GPT-4o-Transcribe الحالية في العمل لكنها لم تعد نقطة البدء الموصى بها.
  • تستفيد الوظائف الدفعية الحساسة للتكلفة أكثر من الانتقال إلى GPT-Transcribe ($0.0045 مقابل $0.006).

لأحدث التفاصيل، راجع الصفحات الرسمية للنماذج ونظرة عامة على التفريغ في موقع مطوّري OpenAI.

كيف تقيم النموذجين على الصوت الإنتاجي؟

استخدم صوتاً مرخّصاً يمثل المنتج بدلاً من مقاطع عرض نظيفة فقط.

  1. اختر ما لا يقل عن 50 تسجيلاً عبر حالات الاستخدام الرئيسية، اللغات، الأجهزة، وظروف الصوت.
  2. ضمّن لكنات، مقاطعات، ضوضاء خلفية، تبديل لغات، أرقام، تواريخ، عملات، عناوين بريد إلكتروني، ومفردات المجال.
  3. شغّل التسجيلات المكتملة عبر gpt-transcribe مع وبدون تلميحات سياق.
  4. أعد تشغيل العينات الحية نفسها عبر gpt-live-transcribe على ثلاث إعدادات delay.
  5. احتفظ بالتنسيقات، حدود الأدوار، التلميحات، وقواعد القياس ثابتة عبر التشغيلات.
  6. قِس خطأ التفريغ، استرجاع مصطلحات المجال، مراجعات النص الجزئي، كمون p50 وp95، الإخفاقات، المحاولات المعادَة، ووقت التصحيح البشري.
  7. احسب تكلفة كل نص مقبول، ثم نفّذ طرحاً مرحلياً لسياسة التوجيه المختارة قبل الهجرة الكاملة.

قد يستخدم التصميم النهائي نموذجاً واحداً أو كليهما. ينبغي أن يكون المقياس الحاسم هو تكلفة وموثوقية نص إنتاجي مقبول، وليس السعر المنشور لكل دقيقة بمعزل.

الأسئلة الشائعة

أي نموذج يجب أن أستخدم: GPT-Transcribe أم GPT-Live-Transcribe؟

استخدم gpt-transcribe للتسجيلات المكتملة والوظائف غير المتزامنة. استخدم gpt-live-transcribe عندما يجب وصول النص أثناء تدفق الصوت.

كم تكلفة GPT-Transcribe وGPT-Live-Transcribe؟

تسرد OpenAI gpt-transcribe بسعر $0.0045 لكل دقيقة صوتية ($0.27 في الساعة) وgpt-live-transcribe بسعر $0.017 لكل دقيقة ($1.02 في الساعة).

هل GPT-Live-Transcribe أدق من GPT-Realtime-Whisper؟

على معيار OpenAI لتسجيلات العالم الحقيقي بتسع لغات، انخفض معدل خطأ التفريغ من 11.65% إلى 9.60%. تحقّق من هذا في صوتك الخاص.

هل يدعم GPT-Live-Transcribe التفريق بين المتحدثين أو طوابع كلمات زمنية؟

لا. لا يُرجع تسميات متحدثين، طوابع زمنية على مستوى الكلمات، أو درجات ثقة. استخدم نموذج ملفات متوافقاً أو خطوة احتياط عند الحاجة إلى هذه الحقول.

هل الهجرة من GPT-Realtime-Whisper مجرد استبدال مباشر للنموذج؟

لا. تحقّق من تهيئة الجلسة، حقول اللغة، مدخلات السياق، إعدادات delay، ترتيب الأحداث، الاعتمادات على الميزات، الكمون، وجودة المخرجات قبل نقل حركة الإنتاج.

اختبر مسارات التفريغ مع CometAPI

قبل التنفيذ، تحقّق من توفر النماذج الحالية وتسعير المسارات على صفحة تسعير CometAPI واستخدم توثيق CometAPI لأنماط طلب متوافقة مع OpenAI. ثبّت معرّفات النماذج الدقيقة في الاختبارات وسجّل مدة الصوت، مستوى delay، كمون أول دلتا، كمون النص النهائي، المحاولات المعادَة، ومعدل النص المقبول حتى يعكس قرار التوجيه تكلفة سير العمل الإجمالية.

44 مشاهدات
تمت المراجعة للوضوح ودقة المصدر ومصطلحات API الحالية.

هل أنت مستعد لخفض تكاليف تطوير الذكاء الاصطناعي بنسبة 20%؟

ابدأ مجاناً في دقائق. رصيد تجريبي مجاني مدرج. لا حاجة لبطاقة ائتمانية.

اقرأ المزيد