فريق صيني يطلق نموذج AudioX-Turbo مفتوح المصدر، ينتج صوتًا في 0.24 ثانية بأربع خطوات استدلال
2026-06-16 10:05
المفضلة

أخبار ar.wedoany.com، تم إطلاق نموذج AudioX-Turbo فائق السرعة لتوليد الصوت، حيث ينتج 10 ثوانٍ من الصوت في 0.24 ثانية بأربع خطوات استدلال. طورته شركة Noiz AI بالتعاون مع جامعة هونغ كونغ للعلوم والتكنولوجيا وجامعة تسينغهوا، ويدعم النموذج إدخالات متعددة الوسائط مثل النصوص والفيديو والصور. من خلال تقنيات تقطير مطابقة التوزيع وتقطير المواجهة، تم ضغط عملية التوليد التقليدية لنماذج الانتشار من 50 إلى 200 خطوة إلى 4 خطوات فقط، مما يقلل عدد مرات تمرير النموذج الأمامي بنحو 25 مرة. على بطاقة رسوميات واحدة من نوع RTX 4090، يستغرق توليد 10 ثوانٍ من الصوت 0.24 ثانية فقط، بعامل زمني فوري يبلغ 0.02، مما يفتح آفاقًا للتفاعل الصوتي في الوقت الفعلي.

تعتمد النماذج الصوتية الرئيسية الحالية مثل MMAudio وStable Audio Open على تقنيات الانتشار أو مطابقة التدفق، وتتطلب عادةً عشرات إلى مئات التكرارات. يستخدم AudioX-Turbo محول الانتشار متعدد الوسائط (MMDiT) المدمج أصلاً كبنية أساسية، إلى جانب وحدة MAF، وتم تدريبه من الصفر بمعاملات تبلغ 2.7 مليار. في إطار مطابقة التدفق، أدخل فريق البحث تقطير مطابقة التوزيع (DMD) وتقطير المواجهة لضغط النموذج إلى 4 خطوات، مع إزالة النفقات الحسابية الإضافية لـ CFG من خلال تقطير CFG. بفضل المميِّز الانتشار، تفوق النموذج الطالب على النموذج المعلم ذي الـ 100 خطوة في بعض مؤشرات الأداء.

عالج AudioX-Turbo أيضًا مشكلة صعوبة التحكم الدقيق في النماذج الصوتية. أشار فريق البحث إلى أن العديد من النماذج السابقة لم تكن قادرة على التحكم بدقة في الطوابع الزمنية، ويعود السبب الجذري إلى غموض تسميات النصوص في بيانات التدريب. لهذا، قامت Noiz AI وفريق جامعة هونغ كونغ للعلوم والتكنولوجيا ببناء مجموعة بيانات صوتية متعددة الوسائط فائقة الحجم باسم IF-caps-Pro، يبلغ إجمالي حجمها حوالي 9.2 مليون عينة. اعتمد الفريق نهج "التوسيم المتسلسل للنماذج الكبيرة"، حيث قام أولاً ببناء أزواج فيديو-صوت عالية الجودة على نطاق واسع، ثم استخدم نموذج Gemini 2.5 Pro لتوليد قوالب منظمة تحتوي على طوابع زمنية وآلات وأعداد الأحداث، ثم استخدم Qwen2-Audio للتوسيع على نطاق واسع، مما حوّل البيانات من "ملخصات غامضة" إلى "نصوص ذات محاور زمنية دقيقة".

اكتشف فريق البحث بشكل غير متوقع أنه كلما كانت تسميات النصوص أكثر تفصيلاً، لم يتحسن أداء النموذج في توليد الصوت من النص فحسب، بل تحسنت أيضًا درجة التوافق عند "مزامنة الصوت مع الفيديو الصامت" بشكل كبير. في مجموعات الاختبار الكلاسيكية مثل AudioCaps وMusicCaps، تفوق نموذج AudioX-Turbo ذو الـ 4 خطوات على العديد من النماذج الأساسية التي تتطلب 50 إلى 200 خطوة في مؤشرات جودة الصوت الأساسية، أو تعادل أداءها. لتقييم قدرة اتباع التعليمات، بنى الفريق معيارًا خاصًا باسم T2A-bench، وفي التقييمات التي تركز على فئات الأصوات وعددها وطوابعها الزمنية وترتيبها، أظهر AudioX-Turbo أداءً ساحقًا مقارنة بالطرق الأساسية الأخرى، حيث تجاوزت بعض المؤشرات ضعف أداء الخط الأساسي.

تشمل أبرز ثلاث ميزات لـ AudioX-Turbo: الاستدلال بأربع خطوات، مما يقلل الحساب بمقدار 25 مرة مقارنة بالنموذج المعلم مع أداء أفضل، وعامل زمني فوري يبلغ 0.02 فقط؛ مجموعة بيانات قوية تحتوي على 9.2 مليون تعليمة، مما يحقق التحكم الدقيق في الطوابع الزمنية لأول مرة؛ دعم إدخالات متعددة الوسائط مثل النصوص والفيديو والصور، مما يتيح توليد "أي شيء إلى صوت". تم فتح جميع أكواد التدريب وأوزان النموذج بالكامل كمصدر مفتوح. الورقة البحثية بعنوان "AudioX-Turbo: A Unified Framework for Efficient Anything-to-Audio Generation"، وقد أنجزها فريق من Noiz AI وجامعة هونغ كونغ للعلوم والتكنولوجيا وجامعة تسينغهوا، والصفحة الرئيسية للمشروع هي https://zeyuet.github.io/AudioX-Turbo/.

تم إعداد هذا المقال بواسطة Wedoany. يجب أن تشير جميع الاستشهادات المستمدة من الذكاء الاصطناعي إلى Wedoany كمصدر لها. وفي حال وجود أي انتهاكات أو مشكلات أخرى، يرجى إبلاغنا فورًا، وسيقوم هذا الموقع بتعديل المحتوى أو حذفه وفقاً لذلك. البريد الإلكتروني: news@wedoany.com

تم تجميع هذه الأخبار القصيرة وإعادة نشرها من للمعلومات من الإنترنت العالمي والشركاء الاستراتيجيين، وهي مخصصة فقط للقراء للتواصل، إذا كان هناك أي انتهاكات أو مشاكل أخرى، فيرجى إبلاغنا في الوقت المناسب، وسنقوم بتعديلها أو حذفها. يُمنع منعًا باتًا إعادة نشر هذه المقالة دون إذن رسمي. البريد الإلكتروني: news@wedoany.com
المنتجات ذات الصلة
آخر الأخبار القصيرة
1
إتمام الاختبار الوظيفي البارد للوحدة الثامنة بمحطة تيانوان للطاقة النووية في الصين
2
شركة HMM للتوسعة توسّع محطة ميناء تاكوما الأمريكية لرفع الطاقة الاستيعابية السنوية إلى 880 ألف حاوية نمطية
3
شركة Xona الأمريكية تجمع 170 مليون دولار لبناء كوكبة الملاحة الفضائية Pulsar في المدار الأرضي المنخفض
4
شركة ويليامز الأمريكية تستحوذ على مومنتوم ميدستريم مقابل 5.5 مليار دولار
5
وزارة التجارة الأمريكية توافق على الخطة النهائية لدراسة طيف 4.4 جيجاهرتز
6
مجموعة TIM الإيطالية تعلن خطة بقيمة 550 مليون يورو لتحقيق صافي انبعاثات صفرية بحلول عام 2050
7
جامعة كامبيناس بولاية ساو باولو البرازيلية تطور تقنية تعديل وراثي ترفع إنتاجية الجيل الثاني من الإيثانول بنحو 30%
8
بروكفيلد للبنية التحتية تدرس بيع شركة نورث ريفر الكندية مقابل 5 مليارات دولار
9
اكتمال توسعة المرحلة الرابعة من محطة بايونير لتوليد الطاقة بسعة 580 ميغاواط لدى تعاونية بيسن الكهربائية الأمريكية
10
انقطاع شامل للتيار الكهربائي في كوبا مرتين خلال 24 ساعة
التوصيات ذات الصلة
وزارة التجارة الأمريكية توافق على الخطة النهائية لدراسة طيف 4.4 جيجاهرتز
2026-08-04
هواوي الصينية تقترح شبكة ذكية قائمة على IPv6+ لتجميع القدرة الحاسوبية الوطنية في حاسوب واحد
2026-08-04
المراقبة الذكية وأنظمة DCIM تصبحان ركيزة أساسية لمراكز البيانات المعتمدة على الذكاء الاصطناعي في الهند
2026-08-04
شركة أتوم روبوت الصينية تطلق الروبوت ثنائي الأرجل الذكي خفيف الوزن "تيانزو AR-L1"
2026-08-04
ريبليونز الكورية تحصل على أول طلب محلي لتحويل كاميرات المراقبة العامة إلى أنظمة NPU
2026-08-04
Liberty Networks وCANTV تطلقان كابل فينيكس البحري بقدرة 14 تيرابت في الثانية في فنزويلا
2026-08-04
ABI: انتعاش سوق إنترنت الأشياء في الربع الثاني من 2026، وشحنات البلوتوث تصل إلى 8.1 مليار وحدة بحلول 2030
2026-08-04
شركة Z Squared الأمريكية تستحوذ على مجمع Paradox Data بقدرة 150 ميجاواط
2026-08-04
شركة IonQ الأمريكية تستثمر 15 مليون دولار لإقامة مركز أبحاث الاتصالات الكمومية بالشراكة مع EPB
2026-08-04
مجموعة "أدانى" الهندية تعتزم استثمار تريليون روبية لإنشاء مركز بيانات للذكاء الاصطناعي في ولاية أوديشا
2026-08-04