
26 آب (سياحة) – كشفت شركة OpenAI عن تفاصيل جديدة حول شريحة Jalapeño المصممة لتشغيل نماذج الذكاء الاصطناعي بسرعة وعلى نطاق واسع، إلى جانب أول نتائج لاختبارات الأداء الخاصة بالنظام الجديد.
وخلال مؤتمر Hot Chips، الثلاثاء، استعرضت “OpenAI” نتائج اختبارات Jalapeño على معيار InferenceX التابع لشركة SemiAnalysis، حيث حقق النظام معدلات أعلى من حيث عدد الرموز التي يمكن معالجتها لكل مستخدم، إلى جانب إنتاجية أكبر لكل كيلوواط مقارنة بأحدث معالجات الاستدلال المتاحة حاليًا.
وقال ريتشارد هو، رئيس قسم الأجهزة في “OpenAI”، خلال مؤتمر صحفي: “الخلاصة أن النتائج تظهر تقدمًا كبيرًا جدًا في الأداء مقارنة بأحدث التقنيات المتاحة حاليًا”.
وأضاف أن Jalapeño قادرة على تنفيذ قدر أكبر من عمليات الذكاء الاصطناعي مقابل كل وحدة طاقة، مع تقديم الاستجابات للمستخدمين بسرعة أكبر.
وأوضح أن النظام يتمتع بكفاءة عالية تتيح له خدمة عدد كبير من العملاء، وفي الوقت نفسه الحفاظ على زمن استجابة منخفض للغاية، بحسب تقرير نشره موقع “تك كرانش” واطلعت عليه “العربية Business”.
ومن اللافت أن هذه المقارنة أُجريت أمام نظام يعتمد على معالجات Blackwell من “إنفيديا”، لكن المنافسة قد تكون قطعت شوطًا كبيرًا إلى الأمام بحلول الوقت الذي تصل فيه Jalapeño إلى مرحلة الانتشار الكامل.
وقدّر هو أن يبدأ نشر Jalapeño في نهاية عام 2026 بكميات صغيرة جدًا، على أن يشهد النظام انتشارًا أكثر اتساعًا خلال عام 2027.
وكانت “OpenAI” قد كشفت للمرة الأولى عن Jalapeño في أكتوبر الماضي، موضحة أنها طورتها بالتعاون الوثيق مع شركة برودكوم، مع الاستعانة بنماذج “OpenAI” نفسها للمساعدة في عملية التطوير.
وتخطط الشركة لتحويل Jalapeño إلى منصة متعددة الأجيال، بحيث يتم تطوير منتجات الذكاء الاصطناعي والنماذج والشرائح والذاكرة بصورة متزامنة ومتكاملة.
وبفضل هذا النهج المتكامل على مستوى منظومة الأجهزة والبرمجيات، تمكنت “OpenAI” من معالجة مراحل محددة في عملية الاستدلال غالبًا ما تتسبب في اختناقات تؤثر على الأداء.
وصُممت Jalapeño بشكل خاص لتقليل التأخير خلال مرحلتي التهيئة الأولية (Prefill) والاتصالات أثناء معالجة الطلبات، وهما مرحلتان تقول “OpenAI” إنهما غالبًا ما تمثلان نقاط اختناق رئيسية.
وقالت الشركة في تدوينة تستعرض نتائج الاختبارات: “صممنا Jalapeño لتقليل حركة البيانات وتأخيرات الاتصال”، موضحة أن ذلك يتيح وضع حالة النموذج، بما في ذلك ذاكرة KV Cache المستخدمة أثناء توليد الاستجابة، بشكل محدد والحفاظ عليها محليًا، بينما يعمل النظام على تفعيل المزيج المناسب من قدرات المعالجة والذاكرة والشبكات لكل مرحلة من مراحل الاستدلال.










