Gonsin Conference Equipment Co., LTD.
Gonsin Conference Equipment Co., LTD.

المنتجات

نظام التعرف التلقائي على الكلام (ASR)

نظام التعرف التلقائي على الكلام من GONSIN يناسب العديد من سيناريوهات التطبيق، بما في ذلك محاضر الاجتماعات، سجلات التدريب، التسميات التوضيحية الصوتية في الوقت الفعلي، تفريغ سجلات المقابلات، سجلات المحاكمات في الوقت الفعلي، وغيرها. يمكن لنظام التعرف التلقائي على الكلام دمج النص والتسجيل الصوتي لكل دور، ودمج وإنشاء محاضر الاجتماعات، ودعم تصدير النصوص. نظام المؤتمرات في الصين يدعم نشر استئجار الخادم السحابي، ونشر الشبكة المحلية للخادم المحلي، والتعلم بالذكاء الاصطناعي، والتحسين المستمر للنظام.

برنامج تحويل الكلام إلى نص
التعرف التلقائي على الكلام (ASR)
برنامج تحويل الكلام إلى نص
التعرف التلقائي على الكلام (ASR)

وظائف نظام التعرف التلقائي على الكلام

باعتباره تطورًا جديدًا في حلول المؤتمرات الحديثة، يقدم نظام التعرف التلقائي على الكلام (ASR) تجربة تفاعل أكثر ذكاءً بين الإنسان والآلة. بالنسبة للمؤتمرات التقليدية، لم يعد التواصل الصوتي والمرئي قادرًا على تلبية احتياجات المؤتمرات الحديثة. بالإضافة إلى ذلك، بعد انتهاء الاجتماع، يلزم أيضًا تقديم معالجة المستندات ومحاضر الاجتماعات والإجراءات القانونية للمستخدمين المحددين بتنسيق Word. يمكن لنظام التعرف التلقائي على الكلام من Gonsin تحقيق تحويل نصي فوري وكامل ومنظم من الصوت، ويضمن تطابق النص مع كلام كل مندوب. يمكن عرض النص المحول على شاشة كبيرة، بالإضافة إلى نظام المؤتمرات غير الورقية من Gonsin في الوقت الفعلي.


يناسب نظام ASR سيناريوهات تطبيق متنوعة، بما في ذلك محاضر الاجتماعات وسجلات التدريب والترجمة النصية الفورية للكلام وتسجيل المقابلات وسجلات جلسات المحكمة في الوقت الفعلي، وغيرها.


image.png


حلول نظام التعرف التلقائي على الكلام من Gonsin

يقدم نظام GONSIN ASR ثلاثة حلول: حل التعرف على الكلام والترجمة عبر الإنترنت، وحل النشر الخاص خفيف الوزن، وحل النشر الخاص لمجموعة غرف المؤتمرات.


  • حل التعرف على الكلام والترجمة عبر الإنترنت

  • حل النشر الخاص خفيف الوزن

  • حل النشر الخاص لمجموعة غرف المؤتمرات


مزايا نظام التعرف التلقائي على الكلام

تم تطوير نظام برمجيات التعرف التلقائي على الكلام من GONSIN على منصة تقنية التعرف التلقائي على الكلام الرقمية الكاملة للمؤتمرات من GONSIN. من خلال ربط بيانات الصوت عبر الشبكة وخلفية ASR، وبدعم من برامج ASR والتطبيقات من GONSIN، يحقق النظام تحويلًا فوريًا للصوت إلى نص.

نظام التعرف التلقائي على الكلام

برنامج التعرف التلقائي على الكلام (ASR) من Gonsin الإصدار V7.1.0

الوظائف الأساسية

  • يدعم اختيار وربط خوادم التعرف على الكلام السحابية العامة والخاصة، مما يلبي طرق النشر المختلفة للخوادم. يدعم التثبيت على أجهزة الكمبيوتر أو خوادم التعرف على الكلام، ويمكن تطبيقه بمرونة في مجموعة متنوعة من سيناريوهات التطبيق.

  • يدعم وظيفة إدارة إيقاف تشغيل خادم ASR، وربط خادم ASR ونظام المناقشة والبحث وتخصيص دور الميكروفون، ويدعم الربط السلس مع سلسلة أنظمة المناقشة العامة وإدارة الاجتماعات وفصل الأدوار والتعرف التلقائي.

  • يدعم إدارة الأفراد والمعدات، بما في ذلك البحث عن المعدات وعرض معلومات رقم الوحدة وعنوان IP وإعداد أسماء الأفراد؛ يدعم تحرير معلومات الاجتماع، بما في ذلك إضافة اسم اجتماع جديد وتحديد وقت الاجتماع ومكانه وتحرير محتوى الاجتماع.

  • يدعم التعرف المتزامن على أدوار متعددة للميكروفونات ووظيفة مكافحة التداخل المتبادل، مما يتجنب بشكل فعال التداخل المتبادل عند التعرف على عدة ميكروفونات في نفس الوقت؛ يدعم مؤشرات حالة الميكروفون وعرض حالة تشغيله وإيقافه في الوقت الفعلي.

  • يدعم وظيفة تعلم النموذج اللغوي. يدعم استيراد الكلمات الشائعة مثل أسماء الأشخاص والأماكن لتعلم النموذج اللغوي.

  • يدعم التعرف التلقائي على أدوار المشاركين والتعرف التلقائي على أصواتهم وتحويلها إلى نص. يدعم البرنامج الترجمة إلى لغات أخرى حسب الحاجة (تختلف وظائف البرنامج وفقًا لإمكانيات المحرك).

  • يدعم الفهم الدلالي الذكي، حيث يمكنه فهم دلالات كلام المشاركين تلقائيًا وتقسيم الجمل والفقرات تلقائيًا وفقًا للدلالات. يدعم التحويل التلقائي للأرقام المتتالية إلى تنسيق عربي، والتعرف التلقائي على أرقام الهواتف المحمولة وأرقام الهوية وغيرها من الأرقام المتتالية وتحويلها إلى تنسيق عربي.

  • يدعم وظائف تحرير النص وتصحيحه في الاجتماع. إنشاء ملفات تسجيل منفصلة للأدوار المختلفة، أو دمج السجلات النصية والتسجيلات الصوتية لكل دور. يمكن مزامنة التسجيلات الصوتية والنصية وتشغيلها وعرضها مقابل تصحيح المستند.

  • يدعم وظيفة إخراج سجل الاجتماع. يدعم دمج النصوص وإنشاء محاضر الاجتماع وتصدير النص.

  • يدعم وظيفة البحث في المحتوى والبحث في النص. يمكن البحث عن الكلمات الرئيسية وتحديد موقع المحتوى المقابل بسرعة، مما يحسن كفاءة استرجاع المحتوى بشكل كبير.

  • يدعم وظيفة إخراج النص على شاشة منفصلة. عند التثبيت على جهاز كمبيوتر، يمكن عرض النص المحول في الوقت الفعلي على الشاشة الرئيسية لجهاز الكمبيوتر التشغيلي، ويدعم توسيع الإخراج على شاشة منفصلة وعرض محتوى النص الناتج عن التعرف على الكلام في الوقت الفعلي. يدعم وظيفة تخصيص الشاشة، مع تكيف تلقائي لدقة الشاشة، ويدعم إعدادات نوع الخط وحجمه، لتوفير خدمة عرض نص عالية الجودة على شاشة منفصلة.

  • يدعم التعرف على ملفات التسجيل الصوتي، من خلال استيراد ملف التسجيل الصوتي، يتم تحويل محتوى ملف التسجيل تلقائيًا إلى نص؛ يدعم تنسيقات ملفات مثل mp3 و wav وغيرها.

  • يدعم اختيار أجهزة إدخال الصوت، حيث يمكن توصيل أجهزة إدخال الصوت بالكمبيوتر وتحويل الإدخال الصوتي إلى نص في الوقت الفعلي.

  • يدعم التعرف على محتوى الصوت الذي يتم تشغيله على الكمبيوتر وتحويله تلقائيًا إلى نص.

  • يدعم المزيد من الميزات المخصصة: يدعم البرنامج التبديل بين اللغتين الإنجليزية والعربية، بالإضافة إلى لغات أخرى مخصصة؛ يدعم التطوير الثانوي وفقًا لبروتوكول الواجهة المفتوحة أو التطوير المخصص حسب متطلبات المشروع.


المعايير الفنية

النظامنظام تشغيل Win7 / Win8 / Win10 32 / 64 بت
المعالج (CPU)I7 أو أعلى
سعة القرص الصلب500 جيجابايت أو أعلى
سعة الذاكرة16 جيجابايت أو أعلى
بطاقة الرسومياتبطاقة رسوميات منفصلة تدعم واجهات VGA / HDMI / DVI وتدعم العرض على شاشة منفصلة
واجهات الكمبيوترواجهة RS-232 واحدة وواجهتا RJ45
الدقةمتكيف ذاتيًا
اتصال الكمبيوترEthernet / RS-232


برنامج عرض الترجمة النصية للتعرف التلقائي على الكلام من Gonsin الإصدار V7.1.0

الوظائف الأساسية

  • توافق جيد مع الأنظمة، يدعم عرض الترجمة النصية لأجهزة Windows و Android.

  • يدعم إعدادات متعددة لأوضاع عرض الترجمة. يدعم وضع الشاشة الكاملة ووضع النافذة المنبثقة.

  • وضع الشاشة الكاملة: عرض محتوى الترجمة بملء الشاشة على شكل مربع حوار. يدعم إعداد الخلفية وإعداد الخط.

  • وضع التسميات التوضيحية العائمة (Barrage): عرض محتوى الترجمة بأسلوب تسميات توضيحية عائمة. يدعم إعداد الأسطر وإعداد الخط.

  • يدعم وظيفة الترجمة فوق الفيديو: يدعم وظيفة الترجمة في الوقت الفعلي المتراكبة على شاشة الفيديو، والتكامل مع تطبيقات مؤتمرات الفيديو وتتبع الكاميرا.

  • يدعم وظيفة الترجمة المركبة على الأنظمة غير الورقية: يتيح تراكب الترجمة في الوقت الفعلي على شاشات الأنظمة غير الورقية، والتكامل مع الأنظمة غير الورقية، وعرض النص المحول في الوقت الفعلي على الأجهزة الطرفية غير الورقية.

خادم التعرف على الكلام التلقائي الذكي خفيف الوزن

الوظائف الأساسية

  • باستخدام برنامج التعرف على الصوت الذكي، يمكنه تحقيق إدارة الوصول إلى الويب

  • يدعم التعرف التلقائي على أدوار المشاركين، والتعرف التلقائي على صوت المشاركين، والنسخ إلى نص

  • بفضل محرك التعرف التلقائي على الكلام (ASR) المدمج، يعتمد تقنية التعرف على الكلام عبر الإنترنت الرائدة في الصناعة، ويتم نشره عبر السحابة لتوفير خدمات التعرف على الكلام للكلام المحلي. زمن وصول منخفض، دقة تعرف عالية، يمكن أن تصل دقة التعرف إلى أكثر من 99%

  • يمكن لخادم التعرف على الكلام تحقيق نسخ الكلام من قنوات مختلفة:

  • GX-AS201: يدعم قدرة التعرف على الكلام لقناة واحدة

  • GX-AS202: يدعم قدرة التعرف على الكلام لقناتين

  • GX-AS205: يدعم قدرة التعرف على الكلام لخمس قنوات

  • GX-AS208: يدعم قدرة التعرف على الكلام لثماني قنوات

  • يدعم التعرف على اللغات المخصصة، مثل الصينية والإنجليزية والإسبانية والعربية والروسية والفرنسية.

  • يدعم التعرف في سيناريوهات تطبيق متعددة: التعليم، القضاء، الطب، خطابات المؤتمرات، وسائل الإعلام الإخبارية، فيديو الترفيه، المنزل الذكي، التواصل الاجتماعي، السيارات، وما إلى ذلك.

  • يدعم مشاركة الخادم بين غرف مؤتمرات متعددة. يدعم تشكيل شبكة محلية (LAN) لغرف المؤتمرات المتعددة في مركز المؤتمرات ونشر الخادم مركزيًا لتلبية التعرف على الكلام والنسخ بالتوازي في غرف المؤتمرات المتعددة.

  • بفضل برنامج عرض الترجمة الذكي للتعرف على الكلام، يوفر خدمة عرض الترجمة للمؤتمرات.

المعايير الفنية

الطرازGX-AS201GX-AS202GX-AS205GX-AS208
إصدار النظامCentos7.4+
المعالجi3i7
سعة الذاكرة16G32G
القرص الصلب256G SSD500G SSD
واجهة اللوحة الأمامية4×USB2.0 Type-A, 1×3.5mm Line out, 1×3.5mm Micin, 1×Power button, 1×Power LED
واجهة اللوحة الخلفية4×USB3.0 Type-A, 1×RJ4510/100/1000M, 1×HDMI 1.4 out, 1×COM out, 1×3.5mm Line out, 1×3.5mm Mic in, 1×WIFI/BT ANT
مدخل الطاقة19V DC
درجة حرارة التشغيل-5°C~45°C
درجة حرارة التخزين-20°C~60°C
الأبعاد210(L)×210 (W)×56 (H) mm


خادم التعرف التلقائي على الكلام ASR GX-AS301

الوظائف الأساسية 

  • خادم مثبت على حامل قياسي 2U ذو أداء مستقر وموثوق، يعتمد على لوح فولاذي مجلفن SGCC، طلاء خارجي صديق للبيئة، مقاومة لبصمات الأصابع، ومقاومة لتداخل مغناطيسي قوي بجهد 4kV عند التلامس

  • يعتمد على خادم LINNUX عالي الأداء، ويتم تثبيت برنامج ASR Engine V3.0 لتحقيق التعرف التلقائي على أدوار المشاركين، والتعرف التلقائي على أصوات المشاركين وتحويلها إلى نص.

  • يدعم مشاركة الخادم بين غرف اجتماعات متعددة. يدعم غرف اجتماعات متعددة في مركز المؤتمرات لتشكيل شبكة LAN ونشر الخادم مركزيًا لتلبية احتياجات غرف الاجتماعات المتعددة للتعرف على الكلام والنسخ بالتوازي.

  • يعمل بالتعاون مع برنامج عرض الترجمة النصية للتعرف الذكي على الكلام لتوفير خدمة عرض الترجمة للاجتماعات

  • نموذج CTC عالي الكفاءة، من خلال الترخيص الاختياري، يدعم الخادم الواحد ما يصل إلى 50 عملية تعرف متزامنة.

  • يعتمد الخادم آلية تشفير SSL لضمان أمان التخزين وأمان نقل المعلومات الحساسة بشكل فعال. يتم استخدام خوارزميات التشفير RC4 وMD5 وRSA لضمان أمان بيانات المنصة وتجنب تسرب المعلومات الهامة.

  • برنامج مدمج لإدارة الطاقة. يمكنه مراقبة حالة الجهد لتجنب فشل المعدات الناتج عن تقلبات الجهد وتحقيق حماية على مدار الساعة.


محرك التعرف التلقائي على الكلام من GONSIN الإصدار V3.1/V3.2

  • باستخدام تقنية التعرف على الكلام عبر الإنترنت الرائدة في الصناعة، يتم نشره من خلال السحابة لتوفير خدمات التعرف على الكلام للكلام المحلي. زمن انتقال منخفض، دقة عالية في التعرف، يمكن أن تصل نسبة الدقة إلى أكثر من 99%

  • يعتمد المحرك نموذج دفع بالحزمة، مما يقلل بشكل فعال من تكلفة المدخلات ومتطلبات البناء للتعرف على الكلام. يمكن للمستخدمين شراء برنامج الحزمة بالطول المناسب وفقًا للطلب الفعلي لطول التعرف على الكلام (يرجى شراء خدمة الحزمة في الوقت المناسب لضمان الاستخدام الطبيعي للمحرك)

  • يدعم التعرف المفصل حسب الأدوار: يمكن اختيار لغات أصلية مختلفة ولغات ترجمة وفقًا للأدوار المختلفة، مما يحقق التعرف المتزامن على لغات متعددة، ونسخها إلى نصوص مقابلة، وترجمتها.

  • يدعم العديد من اللغات الرئيسية، مثل الصينية والإنجليزية والفرنسية والروسية والعربية والإسبانية.

  • مزود ببرنامج عرض الترجمة النصية بالتعرف الذكي على الكلام، يمكنه عرض النص الأصلي والنص المترجم في نفس الوقت، أو ضبطه لعرض النص الأصلي/المترجم بشكل منفصل، مما يوفر خدمة الترجمة النصية للمفاوضات التجارية ومؤتمرات الفيديو بلغات مختلفة.


محرك التعرف التلقائي على الكلام من GONSIN الإصدار V3.0

  • يعتمد تقنية نموذج التعرف الذكي على اللغة، بناءً على تقنية الذكاء الاصطناعي لتحقيق التعرف على الكلام

  • يدعم التعرف على اللغات المخصصة، مثل الصينية والإنجليزية والإسبانية والعربية والروسية والفرنسية

  • يدعم التعرف في سيناريوهات تطبيقية متعددة: التعليم، القضاء، الطب، خطابات المؤتمرات، الأخبار ووسائل الإعلام، فيديوهات الترفيه، المنزل الذكي، التواصل الاجتماعي، السيارات، وغيرها

أي برنامج للتعرف على الكلام الآلي، بغض النظر عن تعقيده، يمكنه استخراج كلماتك وتفكيكها للتحليل والاستجابة، ويتم سرد تسلسل الأحداث الأساسي الخاص به على النحو التالي:

1. تحدث إلى البرنامج عبر إدخال الصوت.

2. سيقوم التعرف التلقائي على الصوت الذي تتحدث إليه بإنشاء ملف موجي لكلماتك.

3. تم تنظيف ملفات الموجات الصوتية عن طريق إزالة الضوضاء الخلفية وتطبيع مستوى الصوت.

4. يتم تحليل الموجات الصوتية المصفاة إلى ما يسمى بالفونيمات. (الفونيمات هي المكونات الأساسية للغة ونطق الكلمات. يوجد 44 فونيمًا في اللغة الإنجليزية، تتكون من مقاطع صوتية مثل "wh" و"th" و"ka" و"t").

5. يعمل كل فونيم وكأنه سلسلة، بدءًا من الفونيم الأول وتحليلها بالتسلسل، ويستخدم متعرف الكلام ASR التحليل الإحصائي الاحتمالي لاستنتاج الكلمة بأكملها، ثم استنتاج الجمل الكاملة من هناك.

6. برنامج التعرف التلقائي على الكلام ASR الخاص بك، والذي أصبح الآن "يفهم" كلماتك، يمكنه الرد عليك بطريقة ذات معنى.



كيف يعمل برنامج التعرف التلقائي على الكلام؟

أي برنامج للتعرف على الكلام الآلي، بغض النظر عن تعقيده، يمكنه استخراج كلماتك وتفكيكها للتحليل والاستجابة، ويتم سرد تسلسل الأحداث الأساسي الخاص به على النحو التالي:

1. تحدث إلى البرنامج عبر إدخال الصوت.

2. سيقوم التعرف التلقائي على الصوت الذي تتحدث إليه بإنشاء ملف موجي لكلماتك.

3. تم تنظيف ملفات الموجات الصوتية عن طريق إزالة الضوضاء الخلفية وتطبيع مستوى الصوت.

4. يتم تحليل الموجات الصوتية المصفاة إلى ما يسمى بالفونيمات. (الفونيمات هي المكونات الأساسية للغة ونطق الكلمات. يوجد 44 فونيمًا في اللغة الإنجليزية، تتكون من مقاطع صوتية مثل "wh" و"th" و"ka" و"t").

5. يعمل كل فونيم وكأنه سلسلة، بدءًا من الفونيم الأول وتحليلها بالتسلسل، ويستخدم متعرف الكلام ASR التحليل الإحصائي الاحتمالي لاستنتاج الكلمة بأكملها، ثم استنتاج الجمل الكاملة من هناك.

6. برنامج التعرف التلقائي على الكلام ASR الخاص بك، والذي أصبح الآن "يفهم" كلماتك، يمكنه الرد عليك بطريقة ذات معنى.


دليل تعليمي للتعرف التلقائي على الكلام


منتجات تكوين النظام لـ نظام التعرف التلقائي على الكلام (ASR)




اتصل بنا

جونسين هنا لتقديم الحلول المخصصة لنظام الصوت والفيديو للمؤتمرات.

يرجى تعبئة المعلومات بصدق حتى نتمكن من الاتصال بك وتقديم الخدمات في أقرب وقت ممكن.



المنتجات ذات الصلة بـ نظام التعرف التلقائي على الكلام (ASR)
تقديم الثقة والقيمة
يمكنك
ثقة.
حقوق النشر © Gonsin Conference Equipment Co., LTD. جميع الحقوق محفوظة.
المعلومات والمواصفات المدرجة قابلة للتغيير دون إشعار مسبق.