جوجل تطلق Gemini 3.5 Transcribe: ثورة في تحويل الصوت إلى نص
أعلنت جوجل عن إطلاق نموذجها الجديد Gemini 3.5 Transcribe، وهو نموذج ذكاء اصطناعي متطور مصمم لإحداث نقلة نوعية في تجربة تحويل الكلام إلى نص، واعدًا بتقديم دقة وسرعة غير مسبوقتين.
يأتي هذا الإعلان بينما ينتظر العالم بفارغ الصبر إطلاق النسخة الكاملة من Gemini 3.5 Pro، لتكشف جوجل عن جزء جديد ومثير ضمن عائلة Gemini. نموذج Gemini 3.5 Transcribe، الذي يُعرف بقدرته على تنقية النصوص الصوتية من الترددات والتصحيحات العفوية، ليقدم نصًا مصقولًا وخاليًا من العيوب، بدأ بالفعل بتشغيل ميزة "Rambler" في Gboard على هواتف Pixel، ولكنه يستعد للانتشار في جميع أنحاء منظومة جوجل.
وفقًا لجوجل، يتفوق Gemini 3.5 Transcribe على محرك تحويل الصوت إلى نص السابق، Chirp 3، من حيث السرعة والدقة. يُتوقع أن يكون النموذج الجديد أسرع بنسبة تصل إلى 70% في تحويل الصوت إلى نص نهائي، مع انخفاض معدل أخطاء الكلام المباشر إلى 5.5%، مقارنة بـ 7.32% لـ Chirp 3. هذه التحسينات، وإن بدت طفيفة، تحدث فرقًا كبيرًا في تجربة المستخدم، خاصة عند الحاجة لتصحيح الأخطاء في النصوص المنطوقة.
لكن براعة Gemini 3.5 Transcribe لا تقتصر على التقاط الكلمات بدقة، بل تمتد إلى فهم جوهر ما يريد المتحدث قوله. فالنموذج قادر على إزالة الأصوات المترددة مثل "آه" و "امم" التي قد تشوب تدفق الحديث، كما يستطيع تعديل النص فورًا عند الحاجة للتصحيح، والاستعانة بقاموس مفردات مخصص للتعامل مع "المصطلحات المتخصصة". يعمل هذا النظام بكفاءة عبر 85 لغة، ويدعم حتى ثلاثة متحدثين في التسجيلات الصوتية المسجلة مسبقًا.
ومع ذلك، يبقى الاعتماد على الذكاء الاصطناعي لفك شفرة الكلام وفهم المعنى تحديًا. بينما أظهرت التجارب الأولية، خاصة مع ميزة Rambler، قدرة النموذج على تنظيف التناقضات والتعثرات اللفظية، إلا أن تغيير صياغة الكلمات الأصلية قد لا يكون مناسبًا لجميع السيناريوهات.