شركة Rime الأمريكية تبني نظام بيانات صوتية خاصًا لدفع تطوير نماذج الصوت إلى الصوت منخفضة زمن الاستجابة

2026-07-16 11:12
المفضلة

أخبار ar.wedoany.com، تعمل شركة Rime الأمريكية المتخصصة في الذكاء الاصطناعي الصوتي على توسيع نطاق أنظمتها لجمع البيانات الصوتية، وتطوير النماذج، وتسليم الحلول للقطاعات الصناعية، مع التركيز على تطوير نماذج الصوت إلى الصوت منخفضة زمن الاستجابة. وقد أنشأت الشركة استوديو تسجيل خاصًا بها في سان فرانسيسكو بالولايات المتحدة، حيث تقوم بتسجيل حوارات بشرية حقيقية لإنتاج بيانات تدريبية، مما يقلل الاعتماد على الملفات الصوتية المتاحة على الإنترنت العام. وتركز الشركة على تحسين قدرات التفاعل الصوتي في سيناريوهات مثل خدمة العملاء المؤسسية، والخدمات الطبية، وأعمال الطيران، والتكنولوجيا المالية.

تأسست شركة Rime الأمريكية في عام 2022، ويتمتع أعضاء فريقها التأسيسي بخبرات في الأبحاث بجامعة ستانفورد الأمريكية، وتطوير نظام Alexa الصوتي من أمازون، والهندسة والتطوير. وعلى عكس الطرق التي تعتمد على جمع الملفات الصوتية من الإنترنت مباشرة لتدريب النماذج، تقوم الشركة بجمع بيانات حوارية داخل الاستوديو تحدد هوية المتحدث وسياق الكلام ومعلومات النطق، ثم تستخدم هذه البيانات في تدريب نماذج التركيب الصوتي، والتحكم في النطق، والتفاعل.

يتيح نظام التسجيل الخاص للشركة إمكانية تدريب النماذج بشكل أكثر استهدافًا. غالبًا ما تحتاج الأنظمة الصوتية المؤسسية في الاستخدام الفعلي إلى التعامل مع أسماء العلامات التجارية، وأرقام الموديلات، وأسماء الأدوية، والمصطلحات المتخصصة في القطاعات المختلفة. وتكون النماذج الصوتية العامة عرضة لأخطاء في التشديد، أو فقدان المقاطع الصوتية، أو عدم اتساق النطق. وتعتمد شركة Rime الأمريكية على بنية نموذجية قائمة على الفونيمات، حيث تقوم بتفكيك الكلمات إلى وحدات نطق أساسية، ثم تعديل طريقة النطق وفقًا لبيئة الاستخدام لكل مؤسسة وقطاع.

لا يتطلب هذا المسار التقني من العميل إعادة تدريب النموذج بالكامل. يمكن للمؤسسات إضافة مفردات العلامات التجارية، والمصطلحات المتخصصة، والنطق المحدد إلى النظام الصوتي الحالي، مما يمكن الذكاء الاصطناعي الصوتي من الحفاظ على دقة عالية عند التعامل مع المحتوى المتخصص في مجالات الطب والطيران والمالية. وقد تحول تركيز الشركة البحثي من مجرد توليد أصوات طبيعية إلى معالجة مشكلات اتساق النطق واستقرار التفاعل الصوتي في التطبيقات الفعلية.

كانت شركة Rime الأمريكية تعتمد سابقًا على خط أنابيب متعدد النماذج يتكون من تحويل الصوت إلى نص، ومعالجة النص، ونموذج لغة كبير، وتحويل النص إلى صوت. فعندما يتحدث المستخدم، يحتاج النظام أولاً إلى التعرف على النص، ثم يقوم نموذج اللغة الكبير بتوليد الرد، وأخيرًا يحول النص إلى صوت. يؤدي تشغيل نماذج متعددة بالتتابع إلى زيادة وقت الانتظار بسهولة، وقد يتسبب أيضًا في عدم طبيعية نبرة الصوت، والتوقفات، وانتقال الأدوار في الحوار.

تتجه الشركة حاليًا نحو تطوير نماذج الصوت إلى الصوت، مما يسمح للنظام بفهم المدخلات الصوتية مباشرة وتوليد مخرجات صوتية، مما يقلل من مراحل التنسيق بين النماذج المتعددة. يركز هذا الاتجاه البحثي الجديد على معالجة مشكلات زمن الاستجابة، وتبادل الأدوار في الحوارات الجماعية، والتداخل الناتج عن الضوضاء الخلفية، ومقاطعة المستخدم للنظام، مما يجعل الوكلاء الصوتيين للذكاء الاصطناعي أقرب إلى إيقاع التواصل البشري في خدمة العملاء.

تحتاج نماذج الصوت إلى الصوت أيضًا إلى دمج فهم المعنى، وتوليد الصوت، والتفاعل في الوقت الفعلي في نظام موحد. لا يجب على النموذج فقط تحديد ما قاله المستخدم، بل أيضًا التعرف على سرعة الكلام، ومواقع التوقف، وما إذا كان الحوار قد انتهى، ثم تحديد وقت الرد. بعد تقليل عدد النماذج الوسيطة، يصبح مسار تشغيل النظام أقصر، مما يسهل أيضًا التحكم الموحد في أسلوب الصوت، والعواطف، والنطق.

تم تطبيق النماذج الصوتية لشركة Rime الأمريكية في قطاعات خدمات الطعام، والرعاية الصحية، والطيران، والتكنولوجيا المالية، ويشمل عملاؤها Mayo Clinic، وDialpad، وUpstart، وAsurion. تختلف متطلبات النظام الصوتي باختلاف التطبيقات: تحتاج السيناريوهات الطبية إلى معالجة دقيقة لأسماء الأمراض والأدوية، بينما تحتاج سيناريوهات الطيران إلى التعرف على معلومات الرحلات والمطارات، بينما تركز أنظمة خدمة العملاء بشكل أكبر على سرعة الاستجابة واستقرار المكالمات الطويلة.

تخطط الشركة أيضًا لتوسيع فرق تطوير النماذج، والتنفيذ الهندسي، وتسليم الحلول للعملاء، لتعزيز قدرة النماذج الصوتية على الانتقال من بيئة البحث والتطوير إلى الأنظمة المؤسسية. وقد قامت شركة Rime الأمريكية مؤخرًا بتعيين كبير علماء يتمتع بخبرة في فهم الصوتيات والتعلم العميق، وستواصل تحسين عمليات جمع البيانات، وتدريب النماذج، ونشر الأنظمة، وتكييفها مع احتياجات العملاء.

لا يتمحور جوهر هذا التعديل في الأعمال حول مجرد زيادة عدد النماذج الصوتية، بل بناء نظام متكامل يبدأ من جمع الصوت البشري، ومعالجة بيانات الفونيمات، وتطوير النماذج، وصولاً إلى التسليم للمؤسسات. ستتجلى التطورات اللاحقة بشكل أساسي في إطلاق نماذج الصوت إلى الصوت، وانخفاض زمن الاستجابة التفاعلية، والقدرة على التعرف في البيئات المزعجة، ودمج المزيد من الأنظمة القطاعية.

تم تجميع هذه الأخبار القصيرة وإعادة نشرها من للمعلومات من الإنترنت العالمي والشركاء الاستراتيجيين، وهي مخصصة فقط للقراء للتواصل، إذا كان هناك أي انتهاكات أو مشاكل أخرى، فيرجى إبلاغنا في الوقت المناسب، وسنقوم بتعديلها أو حذفها. يُمنع منعًا باتًا إعادة نشر هذه المقالة دون إذن رسمي. البريد الإلكتروني: news@wedoany.com

المنتجات ذات الصلة

برنامج نظام معايرة/تحقق الضغط ACal - Beijing ConST Instruments Technology Inc.
شبكة إيثرنت الحلقية الصناعية المقاومة للانفجار والآمنة جوهريًا للمناجم (10 جيجابت/1 جيجابت) - Chongqing Mas Sci&Tech Co., Ltd.
مركبة Xinshiqi ذاتية القيادة X3 ذات صندوق الحمولة - Neolix Beijing Technology Co., Ltd.
شبكة محلية لاسلكية | نقطة وصول AirEngine 5776-56T - Huawei
برج اتصالات بأربعة أعمدة لخط مخصص للركاب - Henan Dingli Pole & Tower Co., Ltd.
حلول نظام أدوات السلامة SIS - Beijing Consen Automation Technology Co., Ltd.
ملف تعريف الخزانة T - Xinli Tongchuang Electronic Equipment Co., Ltd.
TWP16 رادار ملف تعريف الرياح التروبوسفيري في النطاق P - China Huayun Meteorological Technology Group Co., Ltd.
QPS- 20A المبدِّل السريع لمصادر الطاقة المتكررة - CHN ENERGY ZHISHEN CONTROL TECHNOLOGY CO., LTD.
التبديل الصناعي PRS-7961B - CYG SUNRI CO., LTD.
شركة Fengnan Iron and Steel Co., Ltd التابعة لمجموعة Hebei Zongheng Group: نظام إدارة وتحكم ذكي للطاقة في الشبكات الصناعية الصغيرة - Capital Engineering & Research Incorporation Limited
الألياف البصرية أحادية الوضع المزاحة غير المشتتة ذات نطاق الطول الموجي الموسع (G.652.D) - HONGAN GROUP CO. LTD
قراءات ذات صلة
شبكة المعلومات الائتمانية الكويتية (CINET) تتعاون مع جوجل كلاود لإعادة هيكلة البنية التحتية الائتمانية
2026-09-08
شيرون إيه آي الأسترالية توقّع اتفاقية تنسيق مدتها خمس سنوات مع رافاي
2026-09-08
كي ASIC وCT فيجن تخططان لإنشاء مركز بيانات ذكاء اصطناعي أخضر بقدرة 300 ميجاواط في ماليزيا
2026-09-08
غودمان تحصل على موافقة لإنشاء مركز بيانات "Project Apollo" بقدرة 135 ميجاواط في سيدني
2026-09-08
شركة كواسار كابيتال المكسيكية تدفع قدماً بمجمع مراكز بيانات بقدرة 300 ميجاواط
2026-09-07
LG Uplus تتعاون مع أربع شركات لتشكيل تحالف PMDC لتطوير نموذج قياسي لمراكز بيانات الذكاء الاصطناعي المعيارية بسعة 100 ميجاواط
2026-09-07
هيبرفولت التابعة لـTCS تعتزم استثمار 700 مليار روبية لإنشاء مجمع مراكز بيانات للذكاء الاصطناعي بقدرة 1 جيجاواط
2026-09-07
ديراك تخطط لنشر حاسوب كمي بـ 8 كيوبت في مركز بيانات إيكوينكس في سيدني
2026-09-07
مركز بيانات Pure DC في لندن بقدرة 70 ميجاواط يدخل مرحلة أعمال الأساسات الخوازيقية في المرحلة الثانية
2026-09-06
بدء أعمال المرحلة الأولى بقدرة 50 ميجاواط من مجمع Cerebras لمراكز البيانات بالذكاء الاصطناعي في فنلندا بقدرة إجمالية 165 ميجاواط
2026-09-05