أخبار ar.wedoany.com، أعلن مختبر أبحاث الذكاء الاصطناعي DeepMind التابع لشركة Alphabet Inc. (Google DeepMind) اليوم عن إطلاق سلسلة نماذج Gemini Robotics 2. صُممت هذه السلسلة خصيصًا للروبوتات البشرية، وتتيح دعم تنسيق عدة روبوتات مستقلة لإنجاز مهمة واحدة بشكل جماعي، فضلًا عن قدرتها على تنفيذ المهام المنزلية التي تتضمن مئات الخطوات تلقائيًا.
تعتمد الروبوتات البشرية السائدة حاليًا على بنية ذكاء اصطناعي مزدوجة النظام: نموذج الاستدلال التجسيدي المسؤول عن وضع الخطط عالية المستوى لتنفيذ المهام، ونموذج VLA المسؤول عن تحويل الخطط إلى أوامر منخفضة المستوى لمحركات الروبوت. يتمثل جوهر سلسلة Gemini Robotics 2 في نموذج الاستدلال التجسيدي المسمى Gemini Robotics ER 2، والذي يمكن المستخدمين من وصف المهام التي ينبغي على الروبوت تنفيذها باللغة الطبيعية. ووفقًا لجوجل، يدعم ER 2 المهام التي تتضمن مئات الخطوات وتستغرق عدة دقائق.
يمكن لـ ER 2 تقسيم المهام الطويلة إلى أجزاء موزعة على عدة روبوتات مختلفة لتسريع إنجازها، كما تتيح وظيفة استدعاء الأدوات في النموذج الوصول إلى الخدمات السحابية الخارجية، مثل استخدام بحث جوجل لتوضيح الأجزاء غير المفهومة في التعليمات.
استجابةً لحاجة الروبوتات البشرية إلى إعادة محاولة المهام غير الناجحة، زود المهندسون نموذج ER 2 بوظيفتين. الأولى: يمكن للنموذج استخدام الصور التي تلتقطها كاميرات الروبوت الخاصة لتتبع تقدم المهمة، وعند حدوث خطأ، يتعرف على آخر خطوة تم إنجازها بشكل صحيح ويستأنف من نقطة الانقطاع، مما يلغي الحاجة إلى إعادة المهمة من البداية. الثانية: يتفوق ER 2 على النماذج السابقة في تحديد توقيت اكتمال المهمة، فكلما أسرع الروبوت في التأكد من انتهاء مهمة ما، تمكن بشكل أسرع من الانتقال إلى المهمة التالية، كما تسهم هذه الوظيفة في تبسيط عمليات تحديد الأخطاء وتصحيحها.
أوضح مهندسا جوجل ستيفن هانسن (Steven Hansen) وبينج شو (Peng Xu) في مقال على مدونة الشركة أن الروبوت من خلال مشاهدة تدفق الفيديو المستمر يمكنه تتبع تقدمه الذاتي، والتكيف عند ظهور مشكلات، وتحديد الوقت المناسب للانتقال إلى الخطوة التالية.
بعد أن يضع ER 2 خطة العمل، يمكنه إرسال التعليمات إلى أحد نموذجي VLA الآخرين في سلسلة Gemini Robotics 2. النموذج الأول يُسمى Gemini Robotics 2، ويمكنه التحكم في جميع أجزاء جسم الروبوت البشري، وليس فقط اليدين، مع القدرة على تحسين مركز ثقل الروبوت المضيف لتقليل مخاطر السقوط، كما يدعم أنواعًا أكثر من الأيدي الآلية مقارنةً بالبرمجيات السابقة من DeepMind.
أما نموذج VLA الثاني فيُسمى Gemini Robotics On-Device 2، وهو مصمم للتشغيل مباشرة على الحاسوب المدمج في الروبوت البشري، ويمكن تكييفه مع روبوت جديد خلال ساعات قليلة من التدريب. يمكن للمطورين الوصول إلى ER 2 عبر Google Cloud وGemini API وGoogle AI Studio.
بالتزامن مع إطلاق النموذج، كشفت جوجل أيضًا عن معيار أمان جديد للذكاء الاصطناعي التجسيدي باسم ASIMOV-Agentic Benchmark، لتقييم قدرة الروبوتات البشرية على تجنب المخاطر مثل الاصطدام.










