الوكيل يُعلّم نفسه بمهارات كتبها بنفسه: كيف يحل SEED مشكلة المكافأة النادرة
العائق الحقيقي في التعلّم المعزّز للوكلاء (agentic RL) هو أن المكافأة تصل مرة واحدة فقط، في نهاية المسار (trajectory). يحوّل SEED هذه الإشارة النادرة الوحيدة...
العائق الحقيقي في التعلّم المعزّز للوكلاء (agentic RL) هو أن المكافأة تصل مرة واحدة فقط، في نهاية المسار (trajectory). يحوّل SEED هذه الإشارة النادرة الوحيدة...
الكلفة الحقيقية للاستدلال الطويل تأتي من نمو الحالة (state) بلا حدود. يقسّم التفكير الماركوفي (Markovian Thinking) الاستدلال إلى كتل (chunks) ثابتة الحجم ويم...
هل يتفوق عميل (agent) يراقب قياسات وحدة معالجة الرسوميات (GPU telemetry) ويضبط حجم الدفعة (batch size) والتزامن (concurrency) في الوقت الفعلي على التحكم الثا...
يعمل وكيل LLM المستخدِم للأدوات فوق harness يحيط بالنموذج. وتُثبت ورقة بحثية حديثة على arXiv، عملياً، أن الفصل بين تصميم هذا الـ harness والـ post-training ي...
كيف يمكن لحاضنة عميل ذاتية (agent harness) تعيد كتابة كودها بنفسها طوال الليل أن تنشر نتيجتها بأمان في اليوم التالي؟ تجربة تجمع بين إصدارات الكناري (canary r...
مع طرح GPT-5.6 لخمسة أو ستة إعدادات لجهد الاستدلال لكل حجم، أصبح التحكم في الجهد ركيزة أساسية لنماذج الاستدلال. نتناول هنا وصفة التدريب الكامنة خلف التسمية ن...
إذا كان فريقك قد واصل توسيع كتالوج مهارات الوكيل (agent skills) أو أدوات MCP، فمن المرجح أنك لاحظت في مرحلة ما تراجع دقة التوجيه (routing accuracy). ماذا لو،...
أي فريق يفكر في تكليف عميل LLM بمعالجة حوادث GPU في K8s عن بُعد سيصطدم في النهاية بهذا السؤال: إلى متى نترك العميل يصلح الأمور بمفرده، ومتى نستدعي الإنسان؟ ن...
بدأنا معتقدين أن الضبط الدقيق سيفوز، لكن البيانات قلبت التوقعات. نلخّص هنا كيف حصلنا على مولّد يحافظ على قواعد TDS دون أي تدريب، وصولًا إلى الدرس التالي: الش...
حتى في عصر تقرأ فيه نماذج الرؤية واللغة الخفيفة جدًا، التي تقل معاملاتها عن مليار، المستندات جيدًا، لا تزال المستندات الصعبة حقًا بحاجة إلى نموذج كبير. نقدّم...
تُدقق هذه الدراسة خط أنابيب مستقلاً بالكامل يُنتج بحثاً كل ليلة، ليس عبر فحص المخرجات النهائية بل عبر فحص سجلات تشغيله الفعلية. وعلى مدى ثمانية أيام، تكشف ال...
عندما تُعرّف مهام الشركة المتكررة كمهارات، يمكن الإجابة عن السؤال الذي يحدد إلى أي مستوى نموذج يمكن أن تنحدر كل مهارة فعليا بالقياس لا بالحدس. النموذج الأكثر...
لمهندسي الخدمة الذين يشغّلون نماذج MoE على عناقيد من فئة H200 أو Blackwell، نقدّم ورقة بحثية تُصيغ RASQ، وهي سياسة تكميم NVFP4 تحمي بشكل انتقائي الموجّه والخ...
مبدأ إغلاق كل عملية fan-out بتحقق عدائي أصبح شائعاً على نطاق واسع، لكن مستوى نموذج التحقق وعدد المدققين المشككين المطلوبين لم يُحدد عبر القياس الفعلي بل بالع...
عند تدريب مهام الوكلاء الطويلة عبر التعلّم المعزز، يُبقي أخذ العينات الجماعي في GRPO وحدات GPU عاطلة في انتظار أبطأ rollout. استخدمت جامعة تسينغهوا وZ AI طري...
تعمل الوكلاء طويلة المدى ضمن ذاكرة محدودة، لكن أساليب الذاكرة حتى الآن كانت تنظّم الماضي وفق معايير وصفية مثل الصلة أو جودة التلخيص. هذه الورقة، التي شارك في...
قارن باحثون من Yale وجامعة Chicago بين أفكار البحث البشرية وأفكار LLM باستخدام 11,683 ورقة بحثية حقيقية. الخلاصة مفاجئة. مشكلة أفكار LLM ليست في الجودة، بل ف...
يقيس ARC-AGI-3 قدرة العميل الذكي على فهم الموقف والتكيّف بنفسه داخل لعبة تفاعلية بلا تعليمات. حقق GPT-5.6 Sol أول اختراق لهذا المقياس بنسبة 7.78%، وكان الداف...
التيار السائد اليوم في التدريب اللاحق بالتعلم المعزز هو عائلة GRPO التي تتخلى عن الـ critic. لكن GLM-5.2 عاد إلى PPO بإحياء نموذج القيمة، وعالج عدم التطابق ب...
بعد أن توصل تشخيص سابق إلى أن السبب الحقيقي لفشل التوجيه في نظام مهارات كبير هو محرك الاسترجاع وليس التفكيك، تقيس هذه الدراسة تجريبياً ما إذا كان نقل يد الإص...
لنظام يوجّه مئات المهارات، يخبرنا هذا التشخيص برقمين اثنين إن كان الاستثمار القادم يجب أن يذهب إلى التفكيك أم إلى المسترجِع. تبيّن أن الإجابة المقيسة لم تكن ...
يدمج AgeMem إدارة الذاكرة طويلة وقصيرة المدى داخل سياسة الوكيل، ويكشف عمليات التخزين والاسترجاع والتلخيص والحذف كأفعال قائمة على الأدوات. نحلّل المنهجية وتدر...
نماذج الرؤية ونماذج اللغة المدرَّبة على بيانات مختلفة ولأهداف مختلفة بدأت تمثّل البيانات بالطريقة نفسها. تجادل فرضية التمثيل الأفلاطوني (Platonic Representat...
يجب على المستشفيات والبنوك والجهات الحكومية التي تشغّل منصات ذكاء اصطناعي محلية (on premises) أن تثبت للجهات التنظيمية أمرين: أن البيانات لم تتسرب خارج الحاو...
أصبح استخدام نموذج لغوي كبير كمقيّم، وهو ما يعرف بـ LLM-as-a-judge، الممارسة الافتراضية في تطوير النماذج، لكن الأدلة التي تراكمت خلال عام 2026 تظهر أن الحكم ...
من نشرة dair.ai الأسبوعية لأوراق الذكاء الاصطناعي، نتعمق في قراءة ثلاث أوراق بحثية من منظور ThakiCloud. RLMF الذي يتفوق على التعلم المعزز القياسي بنسبة تصل إ...
يقوم خط الدفاع الأساسي في ضبط الذكاء الاصطناعي (AI control)، القائل بأن النموذج القوي غير الموثوق يمكن ضبطه عبر نموذج إشراف أضعف موثوق به، على افتراض أن نموذ...
يتعامل تقرير Google DeepMind المكوّن من نحو 57 صفحة From AGI to ASI مع الذكاء الفائق لا كتجربة فكرية بعيدة بل كمشكلة تخطيط ينبغي الاستعداد لها الآن. يرسم أرب...
يقيس تقرير ATOM النماذج اللغوية المفتوحة عبر التنزيلات واستخدام الاستدلال في مكان واحد، ويُظهر بالبيانات أن النماذج المفتوحة الصينية تجاوزت المعسكر الأمريكي ...
كلما تحسّنت النماذج اللغوية الكبيرة ومهارات الوكلاء، ينتشر في الصناعة شعور بأن fine-tuning (الضبط الدقيق) لم يعد ضروريا. بل إن OpenAI بصدد إيقاف واجهة برمجة ...
تحليل مفصل لمجموعة بيانات Fox والاختبارات المرجعية لمشروع Dolphin الصادر عن ByteDance. تعرف على أحدث تقنيات فهم المستندات المنشورة في ACL 2025 ومجموعة البيان...