-->

إعلان بالهواتف فقط

إعلان بالحواسيب فقط

سبقت شركة ميتا شركة OpenAI بإطلاقها نموذجًا جديدًا لتحويل الصوت إلى نص فوري. طوّر فريق سوبر إنتليجنس نموذج Muse Voice Transcribe، القادر على تمييز الأشخاص المختلفين في المحادثة واكتشاف فترات الصمت. سيتوفر النموذج الجديد في واجهة برمجة تطبيقات ميتا للذكاء الاصطناعي وتطبيقها لأجهزة ماك.

ووفقًا لمدونة الشركة، يُعدّ Muse Voice Transcribe أول نموذج إدراك فوري من ميتا. وعلى عكس نماذج الذكاء الاصطناعي الأخرى التي جربتها الشركة، يستطيع هذا النموذج التمييز بين أكثر من 20 متحدثًا مختلفًا في تسجيل واحد. إذا سبق لك محاولة تسجيل اجتماع يتحدث فيه عدة أشخاص في وقت واحد، فأنت تدرك مدى صعوبة تحويله إلى نص.

دربت ميتا النظام على أكثر من 70 لغة، خضعت 25 منها لعملية تحقق دقيقة قبل الإطلاق. لا يتيح هذا التنوع لعدد أكبر من الأشخاص إنشاء نصوص فحسب، بل يمكّن أيضًا متحدثين متعددين من المشاركة في المحادثة نفسها. وتشير الشركة إلى أن المتحدثين ثنائيي اللغة ينتقلون بين اللغات بسلاسة، وأحيانًا في منتصف الجملة، وهو ما لن يمثل مشكلة لهذا النموذج.

من الناحية التقنية، تعالج بنية برنامج Muse Voice Transcribe الصوت على شكل أجزاء مدة كل منها 80 مللي ثانية. وهذا يعادل 12.5 مقطعًا صوتيًا في الثانية، يُحوّل كل منها إلى رمز يُحلل تلقائيًا. ضمن كل جزء، يمكن للذكاء الاصطناعي أن يختار ما إذا كان سيُنتج كلمة فورًا أم ينتظر الجزء الصوتي التالي لفهم السياق بشكل أفضل.

بحسب شركة ميتا، ينجح هذا النظام لأن الكلمات لا تتطلب جميعها نفس القدر من وقت التحليل. تُنسخ الكلمات البسيطة بشكل فوري تقريبًا، بينما تحتاج الكلمات الغامضة أو التي يصعب تفسيرها إلى سياق أوسع قبل أن يتمكن الذكاء الاصطناعي من تحويلها إلى نص. استخدم مهندسو ميتا التدريب المعزز، الذي يجمع بين دقة النسخ وسرعة التسليم كجزء من المكافأة.

 يدعم برنامج Muse Voice Transcribe تسجيلات صوتية تتجاوز مدتها ساعة دون الحاجة إلى معالجة إضافية. عند توقف الصوت، تُرسل إشارة إلى البرنامج تُفيد بعدم وجود معلومات واردة، مما يُحرر أي نص مُعلق. تُعرّف الشركة هذا السلوك بالاستماع المرن، وتُطبقه أيضًا عند تحديد هوية المتحدث.

أما من حيث الأداء، فيُسجل البرنامج معدل خطأ في الكلمات بنسبة 3.1% في اللغة الإنجليزية، متفوقًا بذلك على برنامجي GPT Live Transcribe وGemini Transcribe Live. وعند تحديد المتحدثين المختلفين، يبلغ معدل الخطأ %17.5، وهو الأدنى بين برامج النسخ الصوتي الأكثر شيوعًا.

أصبح Muse Voice Transcribe متاحًا الآن عبر واجهة برمجة التطبيقات (API) مقابل 3 دولارات لكل 1000 دقيقة من الصوت المُعالَج. أكدت شركة ميتا أنها لا تخطط لإصدار أوزان مفتوحة لهذا النموذج، ولكن يمكنك الوصول إليه من خلال Meta AI Dictation لنظام Mac وMuse Code. إذا كان البرنامج مُثبّتًا لديك بالفعل، فما عليك سوى الضغط على مفتاح Fn والبدء بالتحدث في أي تطبيق.

ليست هناك تعليقات:

إرسال تعليق

جميع الحقوق محفوظة ل حوحو للمعلوميات 2026
تصميم و تكويد : بيكود