FLUX 3 and Gemini 3.7 Flash are now live on CometAPI →

مدونة

مدونة CometAPI

واجهة برمجة تطبيقات واحدة. كل نموذج ذكاء اصطناعي رائد.

تحديثات النماذج، وأدلة واجهة برمجة التطبيقات، والمعايير، والرؤى العملية للبناء بشكل أسرع مع CometAPI.

ما هو Grok 4.6 وما الذي نعرفه حتى الآن
New

ما هو Grok 4.6 وما الذي نعرفه حتى الآن

I don’t have real‑time access. As of my last update (Oct 2024), there was no public release called “Grok 4.6.” For the latest, please verify via official xAI channels (website/docs blog, API changelog, status page, and xAI’s social announcements). Below is a concise checklist of what to look for and how to prepare. What to check - Release status and window: Official release post, docs changelog entry, and status page incident history; note any staged rollout dates (preview, GA, regional availability). - Expected specs: Context window, multimodality (text/vision/audio), tool/function calling schema, reasoning/coding improvements, latency/throughput targets, safety/steerability changes, and benchmark deltas (e.g., MMLU, HumanEval, MMMU). - API status: Endpoint names and versions, model IDs, tokenization changes, tool-calling JSON schema, streaming support, batch/async jobs, rate-limit tiers, availability regions, deprecations/migrations. - Pricing baseline: Unit prices per 1M input/output tokens, image/audio pricing if multimodal, batch discounts, rate-limit tiers, enterprise/SLA options, fine-tuning and storage fees. - Compatibility: SDK support, OpenAI-compatible surfaces (if any), breaking changes vs previous Grok models, and migration guides. Developer preparation checklist - Version pinning and rollout - Pin current model/version in production; enable per-env overrides. - Create canary cohort and feature flag to switch traffic gradually. - Fallbacks and SLAs - Define health checks and auto-fallback to a known-stable model on elevated error rates/latency. - Set per-request and workflow timeouts with circuit breakers. - Prompt and tool schema migration - Diff system/prompt templates; adjust to new function-calling or tool schemas. - Validate JSON outputs with strict schemas; add repair/retry logic. - Evaluations and QA - Build a representative eval set (accuracy, safety, latency, cost). - Run A/B or shadow tests; track regressions and prompt sensitivity. - Cost and token guardrails - Budget using worst‑case token counts; set max_tokens, truncation, and refusal handling. - Monitor per‑endpoint spend with alerts; consider batch/streaming to control costs. - Rate limits and throughput - Check new rate-limit tiers; implement token bucket backoff, jittered retries, and idempotency keys. - Use streaming where appropriate; handle backpressure. - SDKs and infrastructure - Update official SDKs/clients; verify TLS/ciphers and regional endpoints. - Prepare for new scopes/permissions and auth flows; rotate keys in staging. - Observability - Log prompts/outputs with PII redaction; tag by model/version. - Capture token counts, latency percentiles, errors, and tool-call stats. - Safety and compliance - Review new content policy/filters; re-run safety evals for your domain. - Update data handling, retention, and audit trails to match enterprise controls. - Fine-tuning and embeddings (if applicable) - Confirm datasets fit new token limits; re‑embed corpora if tokenizer changed. - Re‑tune or RAG‑retune if behavior or tokenization shifts. - Documentation and runbooks - Update operator playbooks for incidents, fallbacks, and quota exhaustion. - Provide developers with migration notes, examples, and test cases. If you can share an official announcement or docs link, I can extract the exact release window, specs, API details, and pricing and tailor the preparation plan to those specifics.

M
Mia Maren
GPT-Transcribe مقابل GPT-Live-Transcribe: API والأسعار
New

GPT-Transcribe مقابل GPT-Live-Transcribe: API والأسعار

فيما يلي مقارنة عملية بين GPT-Transcribe (تفريغ دفعي/غير متزامن) وGPT-Live-Transcribe (تفريغ زمني مباشر). تختلف الأرقام الدقيقة بحسب آخر تحديثات التسعير والوثائق الرسمية، لذا يُنصح بالتحقق من صفحة التسعير والـAPI المرجعية قبل الإطلاق: - التسعير - GPT-Transcribe: - يُحاسَب عادةً بحسب مدة الصوت المرفوع (بالدقيقة/الثانية). - مناسب للملفات المسجلة والسيناريوهات غير التفاعلية بكلفة أقل لكل دقيقة مقارنة بالزمن الحقيقي غالباً. - يدعم مخرجات متعددة التنسيق (JSON/SRT/VTT) بحسب النموذج/الإصدار. - GPT-Live-Transcribe: - يُحاسَب عادةً على مدة البث الصوتي في الجلسة الزمنية المباشرة، وأحياناً مع حد أدنى لكل جلسة أو تسعير خاص بقناة Realtime. - الكلفة لكل دقيقة قد تكون أعلى مقابل الكمون المنخفض والبث الثنائي الاتجاه. - تحقق من أي رسوم إضافية متعلقة بعدد الاتصالات المتزامنة أو أحداث البث. - الكمون (Latency) - GPT-Transcribe: - كمون يعتمد على مدة الملف وحجم الرفع والمعالجة؛ النتائج نهائية بعد إتمام المعالجة. - يناسب معالجة دفعات كبيرة وجودة نص نهائية دون حاجة إلى نتائج جزئية فورية. - GPT-Live-Transcribe: - نتائج جزئية شبه فورية (جزء من الثانية) مع نتائج نهائية عند انقضاء مقطع الكلام. - يتأثر الكمون بعوامل مثل VAD/التجزئة وجودة الشبكة وحجم دفعات الصوت (20–60 مللي ثانية شائعة للبث). - تدفقات واجهة البرمجة (API Workflows) - GPT-Transcribe: - REST عبر نقطة /audio/transcriptions (تحميل ملف multipart/form-data مع model، file، والخيارات). - معلمات شائعة: language، response_format (json/srt/vtt)، timestamp_granularity (word/segment) إن كانت مدعومة، prompt/hints إن توفرت، وإعدادات التصفية والتنميط إن كانت متاحة. - أنماط تشغيل: ملف كامل، أو تقطيع الملف محلياً للتوازي/الاستئناف، مع معالجة أخطاء مثل 413/429 وخوارزميات إعادة المحاولة. - GPT-Live-Transcribe: - Realtime API عادةً عبر WebSocket (وأحياناً WebRTC) مع جلسة تضبط model، sample_rate، تنسيق الصوت (PCM/Opus)، وتمكين partial_results وVAD/endpointing. - ترسل دفعات الصوت المشفرة base64 وتتلقى أحداث transcript.partial وtranscript.final مع أختام زمنية وثقة، وربما قناة/متحدث إذا كانت مدعومة. - إدارة الجلسة: إنشاء/تحديث إعدادات الجلسة أثناء التشغيل، وإرفاق سياق نصي لتوجيه الإخراج، والتعامل مع reconnect/backoff. - التحكم في السياق (Context Controls) - إرشادات/تعليمات نصية لتوحيد الترميز، أسلوب الكتابة، الصياغة المطلوبة (قوائم نقطية، جمل كاملة، ترقيم… إلخ). - تحديد اللغة target أو تمكين الترجمة بدلاً من التفريغ الحرفي إذا كان خيار الترجمة متاحاً. - تعزيز مفردات/عبارات مخصّصة (custom phrases/boosting) للأسماء التجارية والمصطلحات النادرة إن كانت مدعومة. - خيارات تفريغ القنوات/المتحدثين (diarization/channel labeling) وتمكين أختام زمنية على مستوى الكلمة/المقطع إذا كانت متاحة. - في الزمن الحقيقي: ضبط حساسية كشف نهاية الكلام، توازن بين سرعة النتائج الجزئية واستقرار النتائج النهائية. - القيود المعروفة - دقة الأسماء النادرة والاختصارات والمصطلحات المتخصصة دون تعزيز مفردات قد تكون محدودة. - ضوضاء الخلفية وتداخل المتحدثين يؤثران على الدقة، خاصةً في الزمن الحقيقي. - الترقيم وعلامات الوقف والتشكيل بالعربية قد تتفاوت بحسب المجال ونظافة الصوت. - نتائج جزئية متذبذبة في البث تتطلب منطق دمج/استقرار على مستوى العميل. - حدود المدة/الحجم/معدل الطلبات وسياسات الاحتفاظ بالبيانات قد تنطبق وفق إعدادات الحساب والمنطقة. - دعم ميزات مثل تقسيم المتحدثين، إخفاء البيانات الحساسة، أو لواحق تنسيق محددة قد يختلف بين النموذجين والإصدارات. - خطوات الهجرة الموصى بها 1) تصنيف حالات الاستخدام: ما يحتاج دفعات غير تفاعلية إلى GPT-Transcribe، وما يحتاج تفاعلاً فورياً إلى GPT-Live-Transcribe. 2) تبديل النماذج ونقاط النهاية: - استبدل استدعاءات /audio/transcriptions بالموديل GPT-Transcribe للملفات. - أضف/استبدل مسار Realtime WebSocket لاستخدام GPT-Live-Transcribe للبث. 3) ترميز الصوت: - وحّد sample_rate (مثل 16 kHz) والترميز (PCM أحادي/Opus) والنافذة الزمنية للدفعات (20–60 مللي ثانية للبث). - للملفات الكبيرة، اعتمد التقطيع المحلي والاستئناف وتجزئة النتائج إن لزم. 4) السياق والتخصيص: - املأ prompt/instructions لتنسيق الإخراج (ترقيم/أسلوب)، وفعّل language/translate حسب الحاجة. - أضِف custom phrases/boosting للأسماء والمصطلحات الحرجة إن كانت مدعومة. 5) المخرجات والتكامل: - حدّث المحلّلات للتعامل مع JSON/SRT/VTT، وفكّ تجميع partial/final في الزمن الحقيقي. - وحّد تمثيل الأختام الزمنية، والمتحدث/القناة إن لزم. 6) الاعتمادية والأداء: - نفّذ إعادة المحاولة مع backoff لأخطاء 429/5xx، وتعامل مع 413 بالتقطيع. - للبث: منطق إعادة الاتصال، قياس كمون النتائج الجزئية والنهائية، وضبط VAD/التجزئة. 7) الأمن والامتثال: - راجع سياسات الاحتفاظ بالبيانات وخيارات التعطيل/التحكم إن توفرت، وتحقق من الامتثال المحلي. - استخدم TLS افتراضياً وتحقق من القيود الإقليمية إن وُجدت. 8) القياس والتحسين: - قارن WER، ودقة المصطلحات، والكمون، والتكلفة لكل ساعة صوت بين القديم والجديد. - نفّذ تجارب A/B على عينات ممثلة للمجال. 9) الطرح التدريجي: - ابدأ بنطاق محدود/قناة كاناري، مع مسار رجوع للنموذج السابق حتى الاستقرار. - متى تختار أيهما؟ - اختر GPT-Transcribe عندما تكون التكلفة والكمال النصي النهائي والدفعات الكبيرة أولوية، ولا حاجة لزمن حقيقي. - اختر GPT-Live-Transcribe عندما تكون الاستجابة الفورية وتجربة المستخدم التفاعلية (دعم اجتماعات، مساعدين صوتيين) هي الأهم، وتقبل تكلفة أعلى ومنطق دمج النتائج الجزئية. للحصول على أرقام التسعير الدقيقة ومعلمات الطلب المدعومة فعلياً لكل نموذج، يرجى الرجوع إلى صفحة التسعير الرسمية ووثائق الـAPI الخاصة بإصدار GPT-Transcribe وGPT-Live-Transcribe الذي تنوي استخدامه. وإذا شاركتني روابط الوثائق/الإصدارات المستهدفة، يمكنني مواءمة التفاصيل خطوة بخطوة وفقها.

M
Mia Maren