شركة Tensormesh الأمريكية للبنية التحتية للذكاء الاصطناعي تتعاون مع AMD لتوسيع ذاكرة GPU، وانخفاض زمن الاستجابة لأول رمز مميز إلى 0.5 ثانية
2026-07-24 15:27
المفضلة

أخبار ar.wedoany.com، أعلنت شركة Tensormesh الأمريكية للبنية التحتية للذكاء الاصطناعي عن تعاونها مع شركة AMD (Advanced Micro Devices)، حيث يتم التعامل مع الذاكرة الخارجية للمسرعات باعتبارها امتدادًا لسعة GPU، وذلك لمساعدة الشركات على خدمة عدد أكبر من نماذج الذكاء الاصطناعي باستخدام عدد أقل من وحدات GPU.

تم الإعلان عن هذا التعاون في 23 يوليو 2026، ويجمع بين حل KV Cache من Tensormesh، وإدارة LMCache، وتقنية GPU من AMD، ومكونات AMD Live Context الافتراضية. لم تعد البنية الجديدة تقتصر على حصر بيانات الاستدلال النشطة في الذاكرة عالية النطاق الترددي (HBM)، بل تسمح بتدفق KV Cache إلى بنية هرمية تشمل DRAM وSSD والتخزين عن بُعد.

أصبحت سعة الذاكرة تمثل عنق الزجاجة الفعلي لاستدلال نماذج اللغة الكبيرة. فزيادة عدد وحدات GPU توفر سعة HBM أكبر، ولكنها ترفع أيضًا تكلفة المسرعات واستهلاك الطاقة ومتطلبات البنية التحتية. يمكن لبناء معالجات ذات تجمعات ذاكرة أكبر من ناحية الأجهزة أن يحل نفس عنق الزجاجة، لكنه سيزيد الطلب على مكونات الذاكرة المحدودة أساسًا. طرحت Tensormesh وAMD فكرة بديلة: ماذا لو تمكنت الشركات من الاستفادة بشكل أفضل من الذاكرة الموجودة بالفعل في كل عقدة؟

أصبحت بيانات KV Cache هي الهدف. أثناء عملية الاستدلال، تقوم نماذج المحولات (Transformer) بتخزين بيانات الانتباه الوسيطة، مما يتجنب إعادة حساب سياق المحادثة أو المستند بالكامل لكل رمز مميز (token) يتم توليده. عندما تكون المطالبات (prompts) طويلة، أو يزداد التزامن، أو تشارك نماذج متعددة في مجموعة استدلال مشتركة، يصبح حجم التخزين المؤقت كبيرًا جدًا. دفعت ورقة بحثية حول vLLM من خلال PagedAttention الصناعة إلى التركيز على تخصيص أكثر كفاءة لـ KV Cache، مما كشف عن تأثير إدارة الذاكرة على إنتاجية الاستدلال.

توسع LMCache هذه الفكرة لتشمل طبقات ذاكرة متعددة. وفقًا لـ Tensormesh، يمكن إعادة استخدام كتل التخزين المؤقت التي تم إخراجها من HBM للافتراضية قصيرة المدى لاحقًا لمطابقة KV Cache السابقة أو غير السابقة. نقل البيانات إلى تخزين أبطأ يزيد السعة، لكن تجنب إعادة الحساب هو المفتاح الذي قد تستعيد به هذه البنية الأداء.

استخدمت الاختبارات خوادم Dell المزودة بـ 8 وحدات GPU من مسرعات AMD/ATI (MI355) مع تخزين Dell. عند تشغيل مجموعة مستندات بحجم 300 جيجابايت باستخدام نموذج Kimi-K2.6، أبلغت Tensormesh وAMD عن انخفاض زمن الاستجابة لأول رمز مميز من 3.4 ثانية إلى أقل من 0.5 ثانية، أي بتحسن يقارب 7 أضعاف. نتجت هذه النتيجة عن استرداد بيانات KV المخزنة مؤقتًا من DRAM وNFS بدلاً من إعادة الحساب. مع زيادة حجم عبء العمل، ظل معدل الإنتاجية عند حوالي 48 رمزًا مميزًا في الثانية؛ وعلى النقيض من ذلك، انخفضت إنتاجية الاستدلال غير المحسّنة بنحو 40% تحت نفس عبء العمل. وفقًا للنتائج المبلغ عنها، تضاعفت كثافة النماذج على نفس الأجهزة أيضًا.

تم الإعلان عن النتائج ذات الصلة من قبل الموردين، وليست نتائج اختبارات مرجعية مستقلة واسعة النطاق. تحتاج فرق المؤسسات إلى إعادة إنتاج النتائج باستخدام نماذجها الخاصة، وأطوال المطالبات، وملفات تعريف التزامن. توفر MLCommons السياق اللازم لاختبارات الاستدلال الموحدة: حيث يختلف الأداء بشكل كبير اعتمادًا على النموذج، وأهداف زمن الاستجابة، وتكوين الخادم، وطرق عبء العمل.

لا يعني مضاعفة كثافة النماذج استيعاب المزيد من النماذج في رف واحد فحسب، بل قد يؤثر أيضًا على اقتصاديات أنظمة المساعدين الداخليين، وتوليد الاسترجاع المعزز (RAG)، وتحليل المستندات من خلال توزيع تكلفة المسرعات على عدد أكبر من أعباء العمل. هذه الميزة المحتملة مهمة بشكل خاص للمؤسسات التي تتعامل مع مجموعات مستندات كبيرة، حيث يخلق السياق المتكرر فرصًا لإعادة استخدام التخزين المؤقت.

تنطوي هذه الطريقة على مقايضات. DRAM أبطأ من HBM، بينما يضيف SSD والتخزين عن بُعد زمن استجابة إضافيًا ومخاطر التنافس على الشبكة. يعتمد التدرج الفعال على تحديد بيانات التخزين المؤقت التي يجب أن تبقى بالقرب من GPU، وأيها يمكن نقلها دون التأثير على أهداف مستوى الخدمة؛ قد تكون معدلات إصابة التخزين المؤقت، وعرض النطاق الترددي للتخزين، وسلوك التنسيق بنفس أهمية السعة الاسمية.

من غير المرجح أن يخف الضغط الأوسع نطاقًا بسرعة. سجل معهد ستانفورد للذكاء الاصطناعي المتمحور حول الإنسان (Stanford HAI) الطلب الحاسوبي المتزايد المرتبط بأنظمة الذكاء الاصطناعي المتقدمة، مما يدعم أهمية تحسين الاستفادة إلى جانب نشر أجهزة إضافية.

قبل هذا التعاون، شاركت AMD Ventures في جولة تمويل بقيمة 20 مليون دولار لشركة Tensormesh في مايو 2026. تعرض Tensormesh وAMD نتائج الأداء هذا الأسبوع في مؤتمر AMD Advancing AI 2026، ومن المتوقع أن يتم الإصدار العام لشفرة LMCache مفتوحة المصدر بعد شهر. قد يوسع هذا الإصدار نطاق التجارب على إدارة KV Cache متعددة الطبقات، ويمنح فرق البنية التحتية فهمًا أوضح لأداء هذه الطريقة خارج بيئة اختبار Dell الأولية.

تم تجميع هذه الأخبار القصيرة وإعادة نشرها من للمعلومات من الإنترنت العالمي والشركاء الاستراتيجيين، وهي مخصصة فقط للقراء للتواصل، إذا كان هناك أي انتهاكات أو مشاكل أخرى، فيرجى إبلاغنا في الوقت المناسب، وسنقوم بتعديلها أو حذفها. يُمنع منعًا باتًا إعادة نشر هذه المقالة دون إذن رسمي. البريد الإلكتروني: news@wedoany.com
المنتجات ذات الصلة
آخر الأخبار القصيرة
1
ميناء قرطاجنة الإسباني يُطلق منصة اختبار للطاقة البحرية في يوليو
2
تمديد تشغيل محطتين نوويتين بريطانيتين حتى عام 2030
3
الهند توافق على مشروع خط سكك حديدية ثالث بتكلفة 4.4 مليار روبية
4
شركة إينيفا البرازيلية تحصل على 340 مليون ريال برازيلي بسبب إنهاء عقد الغاز الطبيعي المسال مع شركة فالي
5
تحديث مساعد أمازون الذكي Alexa Plus يتكامل مع أجهزة ذكية من علامات تجارية متعددة
6
شركة T-Mobile الأمريكية تضيف نحو 400 ألف مشترك جديد في خدمات النطاق العريض خلال الربع الثاني
7
شركة Aerodisk الروسية تختبر تقنية MetroCluster مع منصة zVirt الافتراضية بنجاح
8
شركة Indoors Navigation الروسية تنشر نظام الملاحة الداخلية في مجمع VK Stadium
9
حصول الجزء السحابي من نظام المصادقة متعددة العوامل الروسي "Multifactor" على شهادة هيئة الرقابة التقنية والتصدير الفيدرالية (ФСТЭК)
10
منصة المدفوعات الرقمية السنغافورية Sunrate تطلق بالتعاون مع ماستركارد كتابًا أبيض حول المدفوعات العالمية الوكيلة في الصين
التوصيات ذات الصلة
تحديث مساعد أمازون الذكي Alexa Plus يتكامل مع أجهزة ذكية من علامات تجارية متعددة
2026-07-24
شركة T-Mobile الأمريكية تضيف نحو 400 ألف مشترك جديد في خدمات النطاق العريض خلال الربع الثاني
2026-07-24
شركة Aerodisk الروسية تختبر تقنية MetroCluster مع منصة zVirt الافتراضية بنجاح
2026-07-24
شركة Indoors Navigation الروسية تنشر نظام الملاحة الداخلية في مجمع VK Stadium
2026-07-24
حصول الجزء السحابي من نظام المصادقة متعددة العوامل الروسي "Multifactor" على شهادة هيئة الرقابة التقنية والتصدير الفيدرالية (ФСТЭК)
2026-07-24
منصة المدفوعات الرقمية السنغافورية Sunrate تطلق بالتعاون مع ماستركارد كتابًا أبيض حول المدفوعات العالمية الوكيلة في الصين
2026-07-24
شركة Monk الأمريكية تطلق خدمة التحصيل الصوتي "Voice Collections"
2026-07-24
نيفيديا وأمكور تبرمان اتفاقاً بقيمة 1.5 مليار دولار لتغليف الرقائق في الولايات المتحدة
2026-07-24
إصدار Collabora Online 26.04 البريطاني يتجاوز 115 مليون تحميل
2026-07-24
شركة SK الكورية الجنوبية تعلن عن خطة لمراكز بيانات الذكاء الاصطناعي تصل إلى 5 جيجاواط بحلول عام 2029
2026-07-24