من فضلك تسجيل الدخول أو تسجيل لتفعل ذلك.

أعلنت Google DeepMind عن إطلاق EmbeddingGemma 2، النموذج المتعدد الوسائط الأخف وزنًا والذي يدمج النصوص، الصور، الصوت والفيديو في مساحة تمثيل موحدة، وكل ذلك يُنفَّذ على الجهاز دون الحاجة للاتصال السحابي.

ما هو EmbeddingGemma 2؟

EmbeddingGemma 2 هو الجيل الثاني من نموذج EmbeddingGemma الذي تم إصداره العام الماضي. يعتمد على بنية Gemma 4 ويأتي بـ 740 مليون معامل، ما يجعله مثاليًا للتنفيذ على الأجهزة ذات الموارد المحدودة.

الميزات التقنية الرئيسية

  • أداء رائد بين النماذج تحت مليار معامل في اختبارات MTEB و MAEB.
  • تصميم معياري: 270 مليون معامل للمهام النصية فقط، مع إضافة رؤى بصرية (170 مليون) وصوتية (300 مليون) حسب الحاجة.
  • تخفيض التخزين حتى 6× باستخدام تقنية Matryoshka Representation Learning، مع إمكانية تقليص الأبعاد من 768 إلى 512 أو 256 أو 128.
  • استهلاك ذاكرة منخفض: ~191 ميغابايت RAM للنص فقط، ~567 ميغابايت للنموذج المتعدد الوسائط على Pixel 11 Pro.
  • نافذة سياق 8 K توكن (أربع مرات أكبر من الجيل السابق)، تسمح بمعالجة ما يصل إلى 5.5 دقيقة من الصوت أو 29 صورة أو 58 إطار فيديو في طلب واحد.
  • تحسين كبير في أداء الكود: ارتقاء 9.92 نقطة في اختبار MTEB Code (من 68.76 إلى 78.68).

كيف يمكن للمطورين الاستفادة؟

يمكن للمطورين الآن بناء أدوات بحث محلية تدعم استعلامات نصية أو صوتية للعثور على مقاطع فيديو أو صور أو ملفات صوتية مخزنة على الجهاز. كذلك يُمكن دمج النموذج مع Gemma 4 لإنشاء أنظمة RAG (Retrieval‑Augmented Generation) تعمل بالكامل دون إرسال البيانات إلى السحابة، ما يعزز الخصوصية ويقلل زمن الاستجابة.

الخطوات الأولى للبدء

  • تحميل الأوزان من Hugging Face أو Kaggle؛ النسخة المخصصة لمنصة Gemini Enterprise Agent Platform ستتوفر قريبًا.
  • استخدام MediaPipe أو LiteRT لتكامل النموذج في تطبيقات Android/iOS أو تطبيقات الويب عبر transformers.js أو WebGPU.
  • تخزين المتجهات الناتجة في قاعدة بيانات محلية مثل Qdrant لتسريع عمليات الاسترجاع.
  • تخصيص النموذج وفقًا لاحتياجاتك عبر إرشادات Unsloth لتدريب إضافي.

ما الذي يعنيه ذلك للمجتمع العربي؟

برأينا، يفتح EmbeddingGemma 2 آفاقًا جديدة لتطبيقات الذكاء الاصطناعي في المنطقة، خصوصًا في التطبيقات التي تتطلب خصوصية البيانات مثل التعليم الإلكتروني، الرعاية الصحية، وإدارة المحتوى الإعلامي. القدرة على تشغيل النموذج محليًا تجعل من الممكن تقديم حلول ذكية دون الاعتماد على بنية سحابية مكلفة أو خاضعة للقيود التنظيمية.

المصدر: deepmind.google

كيف تُحوِّل التطبيقات سلوكنا عبر البيانات والقياسات
نموذج Jev يسرّع اتخاذ القرارات في تجربة المستخدم

Reactions

0
0
0
0
0
0
بالفعل كان رد فعل لهذا المنصب.

ردود الفعل