أبحاث «بيت مانجر» تصل إلى مؤتمر Interspeech 2026.. واختبارات تكشف تفاوت قدرة أنظمة كشف التزييف الصوتي بين اللغات
في خطوة تعكس تنامي الحضور البحثي الإماراتي في مجال الذكاء الاصطناعي، يشارك باحثون من شركة «بيت مانجر» (Bitmanager) في مؤتمر Interspeech 2026، الذي تستضيفه مدينة سيدني الأسترالية، بأبحاث تتناول أمن الأنظمة الصوتية وجودة البيانات الكلامية وموثوقية تقنيات التعرف الآلي على الكلام.
وتكتسب هذه المشاركة أهمية خاصة في ظل الانتشار المتسارع للمحتوى الصوتي المُنتج بالذكاء الاصطناعي، وما يرافقه من تحديات تتعلق بكشف التزييف العميق والتحقق من أصالة التسجيلات، فضلاً عن ضمان دقة الأنظمة الصوتية عند التعامل مع لغات مختلفة.
66 لغة تكشف تفاوتاً في كشف التزييف الصوتي
تتناول إحدى الدراسات المقبولة في المؤتمر قدرة أنظمة الذكاء الاصطناعي على رصد الكلام الاصطناعي والتزييف العميق الصوتي، مستندة إلى قاعدة بيانات بحثية متعددة اللغات تحمل اسم LRLspoof.
وتضم القاعدة أكثر من 2700 ساعة من الكلام الاصطناعي، موزعة على 66 لغة، جرى إنتاجها باستخدام 24 نظاماً لتركيب الكلام، من بينها 45 لغة مصنفة ضمن اللغات منخفضة الموارد، التي تفتقر عادةً إلى كميات كافية من البيانات اللازمة لتطوير النماذج واختبارها.
وتكشف نتائج الدراسة عن تفاوت ملحوظ في أداء أنظمة كشف الكلام المولّد بالذكاء الاصطناعي من لغة إلى أخرى، بما يعني أن نجاح نظام في التعرّف على التزييف الصوتي بلغة معينة لا يضمن تحقيق مستوى الموثوقية نفسه عند استخدامه مع لغة أخرى.
وتسلّط هذه النتيجة الضوء على تحدٍّ متزايد في مجال أمن الذكاء الاصطناعي: ففاعلية أدوات الكشف لا ترتبط بالتقنيات المستخدمة وحدها، بل تتأثر أيضاً بطبيعة اللغة والبيانات التي دُرّبت عليها الأنظمة.
الذكاء الاصطناعي الصوتي العربي في صدارة الاهتمام
وتتقاطع هذه النتائج مع أحد المسارات البحثية التي تعمل عليها «بيت مانجر»، والمتمثل في تطوير تقنيات الذكاء الاصطناعي الصوتي باللغة العربية، بما يشمل التعرف على الكلام وتحويل النصوص إلى كلام، مع دعم أنماط البث المباشر واللهجات العربية المختلفة.
ويتطلب تطوير هذه الأنظمة توفير بيانات صوتية محلية ومتنوعة، إلى جانب تكييف النماذج وبناء بنية هندسية قادرة على معالجة الصوت في الزمن الحقيقي.
وتبرز أهمية هذا التوجه في ظل التحديات التي تفرضها الخصائص الصوتية واللهجية للغة العربية، إذ لا يكفي نقل نموذج طُوّر للغات أخرى إلى البيئة العربية لضمان أدائه بالكفاءة نفسها، ما يجعل البحث المتخصص والبيانات الملائمة عنصرين أساسيين في تطوير حلول أكثر دقة.
الهلوسة الصوتية.. تحدٍّ آخر أمام موثوقية الذكاء الاصطناعي
ولا تقتصر الأبحاث التي يقدمها فريق الشركة في المؤتمر على كشف التزييف العميق، بل تشمل أيضاً إعداد البيانات الكلامية وتحليل أداء أنظمة التعرف الآلي على الكلام.
ومن بين الموضوعات التي تتناولها هذه الأبحاث ظاهرة «الهلوسة» في نماذج التعرف على الكلام، ومنها نماذج Whisper، عندما ينتج النظام نصاً يتضمن كلمات أو عبارات لا يمكن سماعها في التسجيل الأصلي.
وتكتسب هذه المسألة أهمية عملية، لأن أخطاء التفريغ الصوتي قد تؤثر في دقة محاضر الاجتماعات، وخدمات مراكز الاتصال، وتحليل المكالمات، وغيرها من التطبيقات التي تعتمد على تحويل الكلام إلى نص.
وبذلك تتوزع أعمال الفريق على ثلاثة محاور مترابطة: التصدي للتزييف الصوتي، وتحسين جودة البيانات الكلامية، وتعزيز موثوقية أنظمة التعرف الآلي على الكلام.
حضور بحثي إماراتي وتوجه نحو التعاون العلمي
وقال فلاديمير فيسيسكي، مؤسس «بيت مانجر» ورئيسها التنفيذي، إن الشركة تسعى إلى بناء خبرة بحثية متخصصة في الإمارات في مجال الذكاء الاصطناعي الصوتي، ولا سيما ما يتعلق باللغة العربية.
وأضاف أن قبول أبحاث الفريق في مؤتمر Interspeech يعكس المستوى العلمي للباحثين، مؤكداً انفتاح الشركة على التعاون مع الجامعات والمؤسسات والشركات في مجالات البحث والتطوير، وإعداد البيانات الكلامية، واختبار نماذج الذكاء الاصطناعي الصوتي.
ويُعد مؤتمر Interspeech من أبرز المؤتمرات العلمية الدولية المتخصصة في تقنيات الكلام، وتنظمه الجمعية الدولية للتواصل الكلامي (ISCA)، ويجمع باحثين وخبراء يعملون على تطوير تقنيات معالجة اللغة المنطوقة.
أما «بيت مانجر»، فهي شركة متخصصة في الذكاء الاصطناعي، تطوّر منصة لوكلاء الذكاء الاصطناعي الصوتيين وحلول تحليل الكلام الموجهة إلى المؤسسات، مع التركيز على التعرف على الكلام وتركيبه، والبيانات متعددة اللغات، ومعالجة الصوت في الزمن الحقيقي.
وتعكس الأبحاث المقدمة في سيدني اتساع نطاق التحديات التي تواجه الذكاء الاصطناعي الصوتي؛ فالمنافسة لا تقتصر على إنتاج أصوات أكثر واقعية أو تحويل الكلام إلى نص بسرعة أكبر، بل تشمل أيضاً ضمان أمن هذه التقنيات ودقتها وقدرتها على العمل بكفاءة عبر لغات وبيئات مختلفة.


