الموارد
المنتجات
نظام التعرف على الكلام Asr هو تقنية معالجة كلام متطورة مصممة خصيصًا لبيئات المؤتمرات متعددة الأطراف. هدفه الأساسي هو حل مشكلة "من قال ماذا ومتى"، حيث يحدد بدقة ويسجل محتوى الكلام لكل مشارك في الاجتماع ويحدد بوضوح هوية ووقت التحدث لكل متحدث.

يقوم نظام التعرف على الكلام Asr بمعالجة أصواتنا بشكل أساسي، ليكون قادرًا على فهم المحتوى الذي ينطق به المستخدم. قد تعتقد أنه من السهل على الكمبيوتر أن يفهم مباشرة ما نقوله عندما نتحدث إليه، لكن الأمر ليس بهذه البساطة. وذلك لأنه عندما يتحدث الناس، فإن لكل شخص لهجة ونبرة مختلفة، وقد يكون في بيئات صوتية معقدة وصاخبة. في هذه المرحلة، يعتبر فهم الكمبيوتر بوضوح ومعرفة ما تحاول التعبير عنه بدقة مشكلة صعبة للغاية.
يكمل نظام التعرف على الكلام Asr بشكل أساسي عملية تحويل الموجات الصوتية إلى نص مطابق. عملية التعرف هي كما يلي:
أولاً، تتم معالجة موجات الصوت لدينا من خلال معالجة الإشارات الصوتية لتشكيل رسم بياني للإشارة. يتم تقسيم إطارات الصوت إلى وحدات في نوافذ زمنية بالميلي ثانية. يتم التعرف على خصائص المعلومات لكل نافذة وحدة زمنية بالميلي ثانية.
الخطوة الثانية هي التعرف على سرعة الصوت. ما هي سرعة الصوت؟ إنها أقصر وأكثر وحدة صوتية إيجازًا يمكن للبشر إصدارها عند التحدث، ولا يمكن تقسيمها أكثر من ذلك. لذلك، تقوم سرعة الصوت بتقسيم الصوت الكبير إلى أصغر وحدات القوة.
في الخطوة الثالثة، نقوم بدمج وحدات سرعة الصوت هذه لتكوين كلمات أو أحرفنا النصية في النهاية.
التعرف على المتحدثين المتعددين: في الاجتماعات، غالبًا ما يتحدث عدة أشخاص في وقت واحد. يحتاج نظام التعرف على الكلام Asr إلى التمييز بدقة بين الكلام من متحدثين مختلفين وربطه بالهوية الصحيحة، مما يتضمن نمذجة خصائص الصوت وتأكيد الهوية.
معالجة الكلام المتداخل: من الشائع أن يتحدث عدة أشخاص في وقت واحد في الاجتماعات، مما يسبب تداخلًا في الإشارات الصوتية. يحتاج النظام إلى تقنية فصل الصوت لعزل الأصوات المتداخلة إلى إشارات منفصلة للتعرف والنسخ.
عدد غير معروف من المتحدثين: عادةً ما يكون عدد المشاركين في الاجتماع غير محدد. يحتاج نظام التعرف على الكلام Asr إلى التكيف ديناميكيًا مع عدد متغير من المتحدثين دون فقدان الدقة.
التقاط الصوت عن بُعد: في غرف الاجتماعات، إذا كان الميكروفون بعيدًا عن المتحدث، تنخفض جودة الإشارة الصوتية. يحتاج نظام التعرف على الكلام Asr إلى تقنية التقاط الصوت عن بُعد لتحسين جودة الإشارة وزيادة دقة التعرف.
الضوضاء والصدى: قد تكون هناك ضوضاء وأصداء مختلفة في غرفة الاجتماعات، مثل الضوضاء الخلفية وصدى الصوت. يحتاج نظام التعرف على الكلام Asr إلى تحمل هذه التداخلات للحفاظ على أداء التعرف على الكلام.
لذلك، يتضمن نظام التعرف على الكلام Asr بشكل أساسي نموذجًا صوتيًا لفهم الكلام بوضوح، ونموذجًا لغويًا لتحويل الكلام المُفهم بدقة إلى نص. نظرًا لتعقيدات التعرف على الكلام في سيناريوهات الاجتماعات، بما في ذلك متحدثون متعددون وإعدادات متنوعة وأجهزة متعددة ومتطلبات عالية في الوقت الفعلي، يواجه نظام التعرف على الكلام Asr تحديات. ومع ذلك، لدينا سبب للاعتقاد أنه مع التطوير والابتكار المستمرين، سيجعل نظام التعرف على الكلام Asr تسجيل الاجتماعات أكثر كفاءة ودقة.
جونسين هنا لتقديم الحلول المخصصة لنظام الصوت والفيديو للمؤتمرات.