إصدار GLM-5.2 من Z.ai يبدو كأول نموذج صيني مفتوح الأوزان يقارب النماذج الرائدة، وليس فقط كبديل أرخص أو “جيد بالنسبة لنموذج مفتوح”. النموذج مبني للمهام الطويلة، خصوصًا البرمجة الوكيلية(Agentic Coding) والعمل على مستودعات كبيرة، مع سياق يصل إلى مليون token وتحكم في مستوى التفكير بين high وmax. 1
الأهم أن القفزة ليست في رقم واحد معزول. في شارت Z.ai، النموذج يتقدم بوضوح على GLM-5.1 في أغلب اختبارات البرمجة والعمل الوكيلي: SWE-bench Pro، Terminal-Bench 2.1، DeepSWE، ProgramBench، MCP-Atlas، Tool-Decathlon، وحتى Humanity’s Last Exam مع الأدوات. 2
هذه نقلة واضحة في مكان نماذج GLM على الخريطة.
DeepSWE: الرقم الذي لفت الانتباه
أكثر نتيجة مثيرة للاهتمام هي DeepSWE: النموذج وصل إلى 46.2%. هذا الاختبار مهم لأنه حديث وخاص، وبالتالي يصعب تحسين النموذج عليه بشكل مباشر مسبقًا. النتيجة تضع GLM-5.2 خلف نماذج القمة المغلقة مثل Claude Opus 4.7 و4.8 وGPT-5.4 وGPT-5.5، لكنها تضعه في منطقة لم تكن متوقعة من نموذج مفتوح الأوزان قبل فترة قصيرة. 2
في نفس الشارت، GLM-5.1 كان عند 18% فقط. الانتقال من 18% إلى 46.2% على اختبار من هذا النوع يعني أن التحسن ليس مجرد قدرة أفضل على كتابة مقاطع كود قصيرة، بل قدرة أعلى على قراءة مشروع، تعديل ملفات متعددة، التعامل مع فشل الاختبارات، والوصول لحل يعمل.
Terminal-Bench 2.1: كسر حاجز 80%
في Terminal-Bench 2.1، وصل GLM-5.2 إلى 81.0%. هذا رقم مهم جدًا لأن حاجز 80% لم يكن شيئًا معتادًا حتى بين النماذج المغلقة. في شارت Z.ai، النماذج فوق 80% هي Claude Opus 4.8 عند 85.0، وGPT-5.5 عند 84.0، ثم GLM-5.2 عند 81.0. 2
هذا الاختبار بالذات مهم لأنه يقيس القدرة على التعامل مع بيئة طرفية حقيقية: أوامر، ملفات، أخطاء، مخرجات غير مرتبة، وتجربة وخطأ. أي أنه أقرب لطريقة عمل النماذج داخل أدوات البرمجة الوكيلية من اختبارات البرمجة التقليدية.
حسب Z.ai، GLM-5.2 أصبح أقوى نموذج مفتوح الأوزان لديهم على اختبارات البرمجة القياسية، مع تحسن كبير على GLM-5.1: 81.0 مقابل 63.5 على Terminal-Bench 2.1، و62.1 مقابل 58.4 على SWE-bench Pro. 2
ليس فقط برمجة
النتائج الأخرى تعطي صورة أوسع. على SWE-bench Pro، وصل النموذج إلى 62.1، وهو أعلى من GPT-5.5 في الشارت المرفق، وأقل من Claude Opus 4.8. على MCP-Atlas وصل إلى 77.0، قريب جدًا من Opus 4.8 عند 77.8 وأعلى من GPT-5.5 عند 75.3. وعلى ProgramBench وصل إلى 63.7، خلف Opus 4.8 وGPT-5.5، لكن ليس بفارق يجعله خارج المنافسة. 2
حتى في Humanity’s Last Exam، النتيجة مع الأدوات تصل إلى 54.7، وهي ليست الأعلى، لكنها تضعه فوق GPT-5.5 وGemini 3.1 Pro في الشارت. بدون الأدوات يظهر الرقم 40.5، وهذا منطقي لنموذج مبني بوضوح حول العمل الوكيلي واستخدام الأدوات. 2
حسب Artificial Analysis، نسخة GLM-5.2 max ظهرت في صدارة مؤشر Intelligence Index لديهم، مع سرعة إخراج عالية وسعر منخفض مقارنة بالنماذج المغلقة من نفس الفئة. 3
Design Arena: مفاجأة التصميم
الجزء الأكثر غرابة أن GLM-5.2 لا يظهر فقط كنموذج برمجة. بحسب منشورات Design Arena، النموذج تصدر Design Arena عمومًا، وليس فقط بين النماذج المفتوحة. 4
هذا مهم لأن Design Arena لا يقيس فقط “هل الكود يعمل؟”. هو أقرب لسؤال: هل يستطيع النموذج إنتاج واجهات، مكونات، صفحات، SVG، ألعاب، ورسومات بشكل جيد بصريًا؟ لذلك تفوق GLM-5.2 هناك يعني أن Z.ai تنافس ايضا في التصميم وتشكيل التطبيقات.
وهذه نقطة مهمة للمطورين. كثير من الناس لا يحتاجون نموذجًا يحل مسائل خوارزميات. يريدون نموذجًا يبني واجهة تعمل وتبدو جيدة من أول محاولة أو ثاني محاولة.
لذلك ظهور GLM-5.2 بقوة على Terminal-Bench 2.1 يجعله نموذجًا مهمًا لمتابعته هناك. لو حافظ على قوته في اختبارات Vals، خصوصًا Vibe Code Bench، فسنكون أمام نموذج مفتوح لا ينجح فقط في لوحات Z.ai، بل في اختبارات أقرب للمهام الاقتصادية والعملية.
لماذا هذا مهم للمشهد المفتوح؟
القصة الأكبر أن نموذجًا مفتوح الأوزان من الصين بدأ يضغط على نماذج مغلقة من Anthropic وOpenAI في اختبارات كانت إلى وقت قريب تبدو حكرًا عليها. GLM-5.2 لا يتصدر كل شيء، ولا يزال خلف GPT-5.5 وOpus 4.8 في DeepSWE، لكن الفجوة لم تعد مرعبة كما كانت.
هذا مهم خصوصًا بعد كل ما رأيناه من سياسات الوصول المغلقة، القيود الصامتة، وبرامج “الشركاء الموثوقين”. عندما يكون لديك نموذج مفتوح الأوزان بسياق مليون token، ونتائج قوية في Terminal-Bench وDeepSWE، وترتيب عالٍ في مؤشرات مستقلة، يصبح الحديث عن النماذج المفتوحة أقل رومانسية وأكثر عملية.
هذه النماذج لن تكون دائمًا في المركز الأول. لكنها تمنع المركز الأول من أن يتحول إلى امتياز مغلق عند شركتين أو ثلاث.
الخلاصة
إصدار GLM-5.2 هو اول نموذج منذ فترة يقارب فعلا النماذج الرائدة من Anthropic و OpenAI, وحتى يتخطى نماذج جوجل.
النتيجة على DeepSWE تقول إن النموذج أصبح قادرًا على مهام برمجية طويلة ومعقدة. نتيجة Terminal-Bench 2.1 تقول إنه دخل منطقة كانت تقريبًا حكرًا على أفضل النماذج المغلقة. ونتائج Design Arena، إن استقرت، تضيف بعدًا جديدًا: النموذج لا يكتب الكود فقط، بل ينتج واجهات وتصاميم بمستوى عالٍ.
هذا الإصدار يستحق التجربة، خصوصًا لمن يهتم بالبرمجة الوكيلية، بناء الواجهات، والعمل على مشاريع طويلة.
ولأول مرة منذ فترة طويلة، يبدو أن نموذجًا صينيًا مفتوح الأوزان لا يلاحق فقط، بل بدأ يزاحم فعلًا, شيء يذكرنا قليلا بDeepSeek R1.
كتب من GPT 5.5 Extended thinking مع تنقيحات