Home الألعاب قد تكون وحدة المعالجة المركزية التالية الخاصة بك هي أكبر ترقية للذكاء...

قد تكون وحدة المعالجة المركزية التالية الخاصة بك هي أكبر ترقية للذكاء الاصطناعي منذ سنوات، وإليك السبب

22
0
شريحة SoC لمعالج الهاتف المحمول مقابل الكمبيوتر الشخصي

روبرت تريجز / هيئة أندرويد

الذكاء الاصطناعي يقترب بسرعة من مفترق الطريق. ال تصاعد تكلفة الذاكرة لكل من المنصات الشخصية والسحابية، ارتفاع تكاليف الحوسبة لتدريب نماذج الجيل التالي، و ارتفاع الطلب من قبل المستخدمين على المنصات السحابية جعلت الذكاء الاصطناعي مكلفًا للغاية من حيث توفيره واستخدامه. ثم هناك المخاوف المتزايدة المتعلقة بالخصوصية – ما مقدار المعلومات الشخصية الحساسة التي نمنحها لروبوتات الدردشة؟

يبدو الحل لجميع هذه المشكلات بشكل متزايد مثل تشغيل النماذج على أجهزتك الخاصة. سواء كان ذلك نماذج الجوزاء النانوية تلخيص رسائل البريد الإلكتروني الخاصة بك على هاتفك أو تعديل LoRAs الخاصة بك لإنشاء صور على وحدة معالجة الرسومات بجهاز الكمبيوتر الخاص بك، يعد تشغيل الذكاء الاصطناعي محليًا بالفعل أداة قوية يمكنها، من الناحية النظرية، فعل المزيد دون اتصال بالإنترنت.

ومع ذلك، فإن قول هذا أسهل من فعله. إن تشغيل نماذج اللغات الكبيرة الخاصة بك لا يتطلب فقط مجموعة كبيرة من ذاكرة الوصول العشوائي باهظة الثمن والسريعة، ولكنك تحتاج أيضًا إلى مُسرع لمعالجة هذه الأرقام. في حين أن هواتفنا الذكية تدعم منذ فترة طويلة وحدات NPU لهذا الغرض بالضبط، فإن واجهات برمجة التطبيقات الخاصة ودعم البرامج غير المتسق قد حدت من اعتمادها على نطاق واسع. ناهيك عن أن الهواتف الرائدة والمتوسطة تتمتع بقدرات مختلفة إلى حد كبير، مما يعني أنه يتعين على المطورين في كثير من الأحيان الحفاظ على مسارات تعليمات برمجية متعددة أو الرجوع إلى تطبيقات وحدة المعالجة المركزية الأبطأ على أي حال.

يعد الذكاء الاصطناعي الموجود على الجهاز أمرًا رائعًا، ولكنه عبارة عن مساحة متقطعة من واجهات برمجة التطبيقات والأجهزة الخاصة.

وبدلاً من ذلك، يعد تسريع أعباء العمل الأساسية للذكاء الاصطناعي على وحدة المعالجة المركزية بمثابة حل وسط شائع بشكل متزايد. قد لا يكون في أي مكان قريب من السرعة أو القدرة على تشغيل GPT-OSS على NVIDIA 5090، ولكن استهداف وحدة المعالجة المركزية يعني أن الأداة تعمل بشكل أساسي على أي شيء، دون مشاكل التطوير الخاصة ببرامج التشغيل وواجهات برمجة التطبيقات. مع وجود وحدات البناء المناسبة بشكل أعمق في وحدة المعالجة المركزية، لا يجب أن يكون هذا بطيئًا كما قد يبدو في البداية.

الرقائق الأسرع هي مجرد البداية

Siri AI وGemini يركضان بجانب بعضهما البعض.

دروف بوتاني / هيئة أندرويد

بدأت وحدات المعالجة المركزية المتنقلة في التحرك نحو قدرات حوسبة الذكاء الاصطناعي الأكثر قدرة مع ارمف9 في عام 2021، والذي قدم SVE2. بدلاً من تصميم بيانات متعددة (SIMD) ذات تعليمة واحدة ذات عرض ثابت، يستخدم SVE2 نموذجًا غير محدد الطول، مما يسمح للتطبيقات بقياس عرض SIMD من 128 بت إلى 2048 بت اعتمادًا على الأجهزة. بمعنى آخر، إنه نهج أكثر مرونة لإجراء العمليات الحسابية السريعة بالتوازي. كما أنها أضافت دعمًا لعمليات INT8 dot-product ودعمًا محسنًا للحسابات منخفضة الدقة مثل FP16، مما يجعلها مناسبة تمامًا لأحمال عمل الذكاء الاصطناعي الكمية الحديثة.

ومع ذلك، جاء التحول الحقيقي مع الشركات الصغيرة والمتوسطة الشركات الصغيرة والمتوسطة2. يعمل SME2 على توسيع وحدة المعالجة المركزية من خلال وضع تنفيذ مصفوفة مخصص، بما في ذلك سجل مصفوفة جديد ودعم الأجهزة لعمليات نمط GEMM. على عكس تنفيذ المتجهات التقليدي، تم تصميم SME2 خصيصًا لأنماط الجبر الخطي الكثيفة التي تهيمن على أحمال عمل المحولات وLLM، مما يقلل بشكل كبير من حركة مرور الذاكرة ويزيد الإنتاجية للمهام ذات مضاعفة المصفوفات الثقيلة.

ذراع تطور الذكاء الاصطناعي لوحدة المعالجة المركزية

حتى لو لم تتمكن أفكار مثل SME2 من سد فجوة الأداء في المسرعات المخصصة المتعطشة للطاقة، فإنها توفر أداءً محسنًا بشكل كبير مقارنة بوحدات المعالجة المركزية القديمة دون دعم التسريع – أفضل بما يصل إلى 3x إلى 5x في بعض الحالات، حسبما يشير Arm. والأهم من ذلك، أنها منخفضة الطاقة، وتشغل مساحة إضافية قليلة جدًا، ويسهل استهدافها من وجهة نظر التطوير، حيث إنها مدمجة بالفعل في مكتبات مشتركة مثل Arm’s KleidiAi.

SME2 متاح بالفعل في أبعاد ميدياتك 9500 المعالج وسيصل بلا شك إلى المزيد من شرائح الجيل التالي المبنية من نوى Arm’s C1 Ultra أو البنى المرخصة.

أجهزة الكمبيوتر المحمولة لا تريد أن يتم استبعادها

وحدة المعالجة المركزية Intel مثبتة على اللوحة الأم

مع انتهاء درس التاريخ، أعلنت AMD وIntel في الأخبار الأخيرة عن مشروع مشترك لجلب امتدادات حساب الذكاء الاصطناعي (ACE) إلى وحدات المعالجة المركزية المستقبلية. مثلما فعلت شركة Arm بالفعل، فإن هذا يجلب تعليمات المصفوفة الأصلية إلى x86 ISA، إلى جانب دعم أنواع البايتات الفرعية الصغيرة INT4 وأنواع بيانات BF16 وFP16 التقليدية، كل ذلك من مجموعة تعليمات وحدة المعالجة المركزية المألوفة.

قد يكون هاتفك وجهاز الكمبيوتر المحمول التاليين أفضل بكثير في تشغيل الذكاء الاصطناعي.

ويعتمد هذا على تعليمات AVX الحالية، مما يوفر وظائف متسقة ومحسنة ومعالجة رياضية متوازية أسرع عبر البائعين على منصة x86، مما يجعل الحياة أسهل بكثير للمطورين الذين يتطلعون إلى جلب أعباء عمل الذكاء الاصطناعي إلى المنتجات الاستهلاكية. تمامًا مثل معالجات الهاتف الحديثة، تم دمج ACE مباشرة في مسار وحدة المعالجة المركزية (CPU)، مما يعني عدم الحاجة إلى تفريغ GPU/NPU خارجي أو واجهات برمجة التطبيقات الخارجية.

في حين أن تفاصيل التنفيذ ستختلف بين البائعين، فإن كلاً من SME2 وACE يمثلان إمكانات تنفيذ مصفوفة وحدة المعالجة المركزية المدمجة بإحكام بدلاً من بنيات التسريع ذات نمط إلغاء التحميل. تتطور وحدات المعالجة المركزية (CPU) إلى ما هو أبعد من SIMD المتجه إلى بنيات تدعم في الأصل حساب الموتر والمصفوفة. في حين أن الطبيعة المتوازية للغاية لوحدات معالجة الرسومات ستظل مهيمنة على التدريب واسع النطاق وتشغيل أكبر النماذج، فإن وحدات المعالجة المركزية أصبحت بسرعة أكثر قدرة بكثير على التعامل مع أعباء عمل الاستدلال بالذكاء الاصطناعي على الجهاز وزمن الاستجابة المنخفض.

ولعل الجزء الأكثر أهمية هو أنه سيكون من الأسهل بكثير على المطورين استهداف تسريع الذكاء الاصطناعي المعتمد على وحدة المعالجة المركزية عبر الهواتف وأجهزة الكمبيوتر المحمولة وأجهزة الكمبيوتر، دون الاعتماد على GPU أو واجهات برمجة تطبيقات NPU. إذا كان هناك عيب واحد، فهو أن الهواتف وأجهزة الكمبيوتر المحمولة الحالية لن تستفيد، ولكن ربما ستستفيد الترقية التالية.

شكرا لكونك جزءا من مجتمعنا. اقرأ لدينا سياسة التعليق قبل النشر.

Source Link