جسم الطلب
مهلة الطلبات المتزامنة: ينتظر هذا الـ endpoint غير الخاص بالمحادثة حتى ينتهي النموذج الذي تم التوجيه إليه. قد تتجاوز المدخلات الكبيرة أو الصوت الطويل أو الدُفعات الكبيرة القيمة الافتراضية الشائعة للعميل وهي 30s، لذا اضبط مهلة عميل HTTP على120s على الأقل.
file
مطلوب
ملف الصوت المراد تفريغه. التنسيقات المدعومة: flac, mp3, mp4, mpeg, mpga, m4a, ogg, wav, webm.
string
افتراضي:"whisper-1"
النموذج المراد استخدامه. حاليًا لا يتم دعم سوى
whisper-1.string
لغة الصوت بتنسيق ISO-639-1 (على سبيل المثال:
en, zh, ja).string
نص اختياري لتوجيه أسلوب النموذج أو متابعة مقطع سابق.
string
افتراضي:"json"
تنسيق الإخراج:
json, text, srt, verbose_json, vtt.number
افتراضي:"0"
درجة حرارة أخذ العينات (من 0 إلى 1).
array
دقة الطابع الزمني:
word و/أو segment. يتطلب verbose_json.الاستجابة
string
النص المُفرَّغ.
verbose_json:
string
تكون دائمًا
transcribe.string
اللغة المكتشفة.
number
مدة الصوت بالثواني.
array
مقاطع التفريغ مع الطوابع الزمنية.
array
طوابع زمنية على مستوى الكلمات (إذا تم طلبها).