-->

إعلان بالهواتف فقط

إعلان بالحواسيب فقط

كشفت جوجل النقاب عن Gemini 3.5 Transcribe، أحدث إصدار من نظام تحويل الصوت إلى نص ضمن عائلة Gemini. وتقدم الشركة هذا النظام باعتباره الأكثر دقةً حتى الآن، مع تحسينات ملحوظة في معالجة الضوضاء الخلفية والمصطلحات التقنية، وهو تطورٌ سيلحظه الكثيرون بمجرد إملاء رسالة صوتية من هواتفهم.

يأتي هذا الإصدار الجديد بميزات كانت تتطلب سابقًا مراجعة يدوية: فهو يُصحح الأخطاء فورًا، ويزيل الكلمات الزائدة، ويُنسق النص تلقائيًا دون أي تدخل من المستخدم. كما يُمكنه تفويض مهام أكثر تعقيدًا، مثل تحليل الملفات أو إنشاء الصور، مستفيدًا من نماذج أخرى في عائلة Gemini لإنجاز العمل ضمن الأداة نفسها.

تقيس جوجل أداء Gemini 3.5 Transcribe بمقياس محدد: معدل خطأ الكلمات (WER) الذي يبلغ %4.0 في المتوسط ​​عند نسخ الصوت المتدفق، وينخفض ​​إلى %2.6 عند تسجيل الصوت مسبقًا. تتيح هذه الدقة قراءة موثوقة للبيانات الأبجدية الرقمية، مثل أرقام الطلبات أو الرموز البريدية، وهي عناصر كانت تُنسخ بشكل خاطئ في السابق، وكان على الكثيرين منا تصحيحها يدويًا بعد كل جلسة إملاء.

وتعزو الشركة جزءًا من هذا التحسن إلى كيفية تفسير النموذج للكلام الطبيعي، وليس فقط الصوت الخام. فهو يتعرف على المفردات المخصصة والمصطلحات المتخصصة، مما يقلل الحاجة إلى تصحيح الأسماء أو المفاهيم التقنية التي كان يجب تهجئتها أو مراجعتها بعد كل جلسة إملاء. وأوضحت جوجل في منشورها التعريفي بالنموذج: "صُمم Gemini 3.5 Transcribe لالتقاط أسلوبك الطبيعي في الكلام وفهم قصدك بشكل أفضل، بالإضافة إلى التعرف على المفردات المخصصة، حتى تتمكن من أداء المهام بصوتك".

يعمل هذا النموذج بـ 85 لغة، ويتعرف على اللهجات الإقليمية والاختلافات اللهجية داخل كل لغة، مما يزيد من دقته في المحادثات التي تتعايش فيها طرق مختلفة للتحدث باللغة نفسها. وفي الملفات الصوتية المسجلة مسبقًا، يمكنه أيضًا التمييز بين ما يصل إلى ثلاثة متحدثين مختلفين، وتحديد اللحظة الدقيقة التي يتحدث فيها كل منهم بدقة، وإنشاء طوابع زمنية تلقائية لكل مشاركة.

تُعدّ هذه الميزة مفيدةً لتدوين محاضر الاجتماعات، والمقابلات، وتحليل خدمة العملاء بعد المكالمات، حيث يُوفّر معرفة المتحدث وتوقيت حديثه جزءًا كبيرًا من جهد التحرير اليدوي الذي كان يقوم به سابقًا مُفرّغ الصوت. وبالإضافة إلى خاصية التعرّف على المفردات المُخصصة، تُمكّنك هذه الأداة من العمل مع التسجيلات التي تجمع بين لهجات ومصطلحات مُحددة دون فقدان هوية كل صوت. بالنسبة لنا، نحن الذين نعمل بانتظام مع تسجيلات طويلة، في اجتماعات مع مشاركين من دول مختلفة أو بلهجات مُتباينة، يُحدث هذا المزيج من اللغات واللهجات وفصل الأصوات فرقًا حقيقيًا مُقارنةً بالأدوات التي استخدمناها سابقًا، والتي كانت تفقد دقتها بمجرد ظهور أكثر من لهجة في التسجيل نفسه.

- متوفر الآن للمطورين؛ قادم إلى متصفح كروم

يمكن للمطورين تجربة Gemini 3.5 Transcribe في معاينة عامة عبر واجهة برمجة تطبيقات Gemini، المتوفرة في Google AI Studio وGoogle Vertex AI. باستخدام هذه الميزة، يمكنهم بناء وكلاء صوتيين تفاعليين، وأنظمة ترجمة فورية للبث المباشر أو الأحداث المباشرة، وأدوات تحليل ما بعد المكالمات التي كانت تتطلب سابقًا خدمات نسخ خارجية.

بصفتنا مستخدمين عاديين، نلاحظ هذا التغيير بالفعل في مجالين يستخدمهما الكثيرون منكم يوميًا: تطبيق Gemini لنظام macOS وميزة الإملاء الصوتي في Gboard على نظام أندرويد ، حيث يدمجان النموذج الجديد، كما أكدت جوجل. وأعلنت الشركة أيضًا أن هذا النموذج سيُتاح قريبًا في متصفح جوجل كروم، حيث سنتمكن من إملاء النصوص في أي حقل ويب دون الحاجة إلى لوحة مفاتيح - وهي ميزة مثالية عند الرغبة في ملء النماذج أو البحث عن المعلومات عبر الإنترنت دون الحاجة إلى الكتابة باستمرار.

ليست هناك تعليقات:

إرسال تعليق

جميع الحقوق محفوظة ل حوحو للمعلوميات 2026
تصميم و تكويد : بيكود