Skip to main content

نظرة عامة

يترجم الصوت بأي لغة مدعومة إلى نص باللغة الإنجليزية. بخلاف النسخ، تقوم نقطة النهاية هذه دائمًا بإخراج نص باللغة الإنجليزية بغض النظر عن لغة الإدخال.

نص الطلب

مهلة الطلبات المتزامنة: ينتظر هذا الـ endpoint غير الخاص بالمحادثة حتى ينتهي النموذج الذي تم التوجيه إليه. قد تتجاوز المدخلات الكبيرة أو الصوت الطويل أو الدُفعات الكبيرة القيمة الافتراضية الشائعة للعميل وهي 30s، لذا اضبط مهلة عميل HTTP على 120s على الأقل.
file
مطلوب
ملف الصوت المراد ترجمته. التنسيقات المدعومة: flac, mp3, mp4, mpeg, mpga, m4a, ogg, wav, webm. الحد الأقصى لحجم الملف هو 25 MB.
string
افتراضي:"whisper-1"
النموذج المراد استخدامه. حاليًا، النموذج المدعوم الوحيد هو whisper-1.
string
نص اختياري لتوجيه أسلوب النموذج أو لمتابعة مقطع سابق. يجب أن يكون باللغة الإنجليزية.
string
افتراضي:"json"
تنسيق المخرجات. الخيارات: json, text, srt, verbose_json, vtt.
number
درجة حرارة أخذ العينات، بين 0 و1. القيم الأعلى مثل 0.8 تنتج مخرجات أكثر عشوائية، بينما القيم الأقل مثل 0.2 تجعل المخرجات أكثر تركيزًا وحتمية.

الاستجابة

string
النص المترجم باللغة الإنجليزية.
بالنسبة إلى تنسيق verbose_json، تتضمن الاستجابة أيضًا:
string
اللغة المكتشفة للصوت المُدخل.
number
مدة الصوت المُدخل بالثواني.
array
مقاطع من النص المترجم مع الطوابع الزمنية.

الترجمة مقابل النسخ

تقوم نقطة نهاية الترجمة تلقائيًا باكتشاف لغة المصدر وترجمتها إلى الإنجليزية. يتم تجاهل المعلمة language الخاصة بالنسخ.