استبدل واجهة OpenAI Realtime بسطر واحد: hugging-voice، حزمة صوتية مفتوحة تشغّلها بنفسك
يغلّف مشروع hugging-voice من Hugging Face ومحركه speech-to-speech خط معالجة صوتي لحظي كامل، من كشف النشاط الصوتي إلى STT وLLM وTTS، خلف واجهة WebSocket متواف...
يغلّف مشروع hugging-voice من Hugging Face ومحركه speech-to-speech خط معالجة صوتي لحظي كامل، من كشف النشاط الصوتي إلى STT وLLM وTTS، خلف واجهة WebSocket متواف...
عادت مشكلة الرفض المفرط، التي تجعل النماذج المغلقة ترفض حتى المهام الأمنية والطبية والقانونية المشروعة، إلى الواجهة من جديد. أعلنت Moonshot أن نموذجها مفتوح ...
أطلقت Moonshot نموذج Kimi K3، وهو أكبر نموذج مفتوح الأوزان في التاريخ بـ 2.8 تريليون معامل. النتائج مبهرة، لكن جدلاً حول الإفراط في التكيّف مع المعايير القيا...
بدلاً من إنزال طبقات أو خبراء كاملين، يوزّع ATSInfer الموتّرات فرادى بين الـ CPU والـ GPU. تُبلّغ الورقة عن تشغيل نماذج تتجاوز سعة الـ VRAM بكثير على بطاقة R...
من حادثة فوترة بقيمة 25 مليار وون طالت مستخدما محليا إلى شبهات فوترة زائدة شملت 60 شركة، تشير أخبار تكلفة الذكاء الاصطناعي في الشهر الأخير إلى فجوة واحدة. في...
بنينا أداة مفتوحة تُشخّص أي مرحلة من وكيل الصوت لديك هي نقطة الاختناق، دون أي SDK من مزود، وقسنا مكدسنا الفعلي (Qwen3-ASR وVoxCPM2 وQwen3-TTS) على وحدة RunPo...
تدّعي ktransformers أنه يمكنك تشغيل نموذج MoE ضخم على بطاقة GPU واحدة بسعة 24 جيجابايت عبر نقل الخبراء (experts) إلى وحدة المعالجة المركزية. اختبرنا الادعاءا...
معظم تكلفة وكيل الذكاء الاصطناعي ليست في الحكم الذكي، بل في قرارات بسيطة متكرّرة آلاف المرات يوميًا. افصل هذه المهام إلى نماذج صغيرة متخصّصة تعمل على بنيتك ا...
أطلقت Moonshot نموذج Kimi K3، أكبر نموذج مفتوح الأوزان في العالم حتى الآن. المثير ليس فقط تفوقه على أفضل النماذج المغلقة في اختبار برمجة الواجهات الأمامية، ب...
عند نشر نموذج لغوي كبير في خدمة حقيقية، تتحدد معظم التكلفة ليس باختيار النموذج، بل بمحرك الاستدلال الذي يشغّله. نستعرض كيف يقلل vLLM من هدر GPU عبر PagedAtte...
عرض Cormac Brick من Google AI Edge حالة رفع فيها ضبطُ نموذج FunctionGemma بحجم 270 مليون معامل الدقةَ في مهمة وكيل محددة من 46% إلى 90%. الجوهر هو تشغيل نموذ...
تُقلّص نسخ Hy3 من Tencent بصيغة GGUF بدقة 1-bit و4-bit نموذج MoE بحجم 295B من 598GB إلى 85.5GiB ليعمل على وحدة معالجة رسومات واحدة. لكن المقصود بـ«وحدة واحدة...
لا يُعد Bonsai 27B، الذي أصدرته PrismML، نموذجا تم تدريبه من جديد، بل هو نتيجة ضغط أوزان Qwen3.6-27B إلى صيغتي 1-bit وternary مع إبقاء البنية المعمارية كما ه...
حتى الآن كان يجب بناء كل بنية نموذج مرتين: مرة في Transformers للتدريب والبحث، ومرة أخرى في vLLM للاستدلال الإنتاجي. خلفية Transformers بالسرعة الأصلية في vL...
كثير من الفرق تعرف كيف تقلّص نموذجا إلى 4 بت باستخدام Unsloth. لكن لحظة اتخاذ القرار بوضع ذلك الملف على EC2، أو تغليفه في نقطة نهاية SageMaker، أو تشغيله كحج...
ادعى أحدهم أنه قلّص GLM-5.2 من 1403 غيغابايت إلى 980 غيغابايت. لا تكميم ولا تشذيب، بل ضغط بلا خسارة مطابق للأصل بت ببت. كان من الصعب تصديق ذلك، لذا فتحنا 490...
وكلاء البرمجة مثل Claude Code وCodex مرتبطون بشكل وثيق بواجهة برمجة تطبيقات Anthropic. يضع free-claude-code وسيطاً متوافقاً مع Anthropic بين الطرفين، فتحتفظ ...
هناك فرق حقيقي بين من يحمل ملف GGUF من Hugging Face ويضغط زر التشغيل فقط، ومن يعرف بالضبط أي المصفوفات (tensors) مخزنة وبكم بت داخل ذلك الملف. قمنا فعليا بتح...
بدأت مايكروسوفت بتوجيه طلبات الذكاء الاصطناعي الجماعية من Excel وOutlook إلى نماذجها الخاصة، وأصبحت النماذج الصينية المفتوحة تعالج ما يقارب نصف استخدام الذكا...
قدّمت SpaceXAI نموذج Grok 4.5 بأداء قريب جداً من Opus 4.8 وGPT-5.5، لكن بسعر أقل من النصف. حين تضيق الفجوة بين النماذج إلى نقطة أو نقطتين في الاختبارات المعي...
كلما تحسّنت النماذج اللغوية الكبيرة ومهارات الوكلاء، ينتشر في الصناعة شعور بأن fine-tuning (الضبط الدقيق) لم يعد ضروريا. بل إن OpenAI بصدد إيقاف واجهة برمجة ...
نحلل، باستخدام نموذج roofline، المفارقة التي تجعل DeepSeek V4 Flash بحجم 284B مليار معلمة يسعّر رموز الإخراج بأرخص بخمسة أضعاف من Qwen3.6 بحجم 35B. من قراءات...
نتحقق من حالة خدمة GLM-5.2 743B MoE على عقدة واحدة من AMD MI355X بمعدل 2,626 tok/s لكل عقدة، بتكلفة أقل بأكثر من الضعف مقارنة بـ Blackwell، من زاوية تكميم MX...
انطلاقًا من أدلة بناء حاسوب الذكاء الاصطناعي الشخصي التي شاركها tom_doerr والتي تصل إلى 384GB من ذاكرة VRAM، نحسب كيف تحدد ذاكرة VRAM النماذج التي يمكن تشغيل...
معظم مهام الوكلاء لا تحتاج إلى نموذج طليعي. حين تُبنى المهارة مرة واحدة بنموذج مكلف ثم يُنقل التنسيق إلى الكود، يمكن تشغيل الجودة نفسها بنموذج أرخص. يقيس Pax...
قسنا فعلياً عدد الرموز المُولّدة في الثانية عبر التوازي على مستوى المُوتِّرات، والتوازي على مستوى البيانات، وفصل Prefill/Decode (1P1D) لنموذجَي Qwen3.6-27B-N...
أعادت NVIDIA تكميم Qwen3.6-27B إلى NVFP4 ليُخدَم على GPU واحدة من Blackwell عبر vLLM مباشرةً. نفكّك كيف تُوائم الدقة المختلطة (MLP بصيغة NVFP4 والانتباه وذاك...
نحلل دليل التوجيه الرسمي الذي أصدرته Anthropic لنموذج Claude Fable 5. يطرح الدليل خمسة مبادئ: التخلص من التعليمات التي كُتبت للنماذج القديمة، ومراجعة التقدم ...
إذا كنت تشغّل LLM في الإنتاج ولا تستطيع أن تشرح لماذا يستهلك KV Cache هذا القدر من الذاكرة، أو ما الذي يوفره GQA بالضبط، فإن التحسين يصبح مجرد تخمين. مستودع ...
الطلبات القصيرة التي تنتظر خلف الطلبات الطويلة في قائمة انتظار واحدة تُهدر وقت GPU في صمت — وهذا ما يُعرف بـ HoL Blocking. يقترح أسلوب Dual-Pool Token-Budget...
في منتصف عام 2026، باتت النماذج مفتوحة الأوزان على بُعد ثلاثة إلى ستة أشهر من الحدود الأمامية، والفجوة لا تتسع. القرار الحقيقي الآن لم يعد عن أداء النموذج، ب...
نقطة التفتيش GLM-5.2-NVFP4 التي أصدرتها NVIDIA تتيح تقديم نموذج MoE بحجم 469B على عقدة Blackwell واحدة (8× RTX PRO 6000) باستخدام vLLM. نحلّل بنية التكميم ال...
تم فتح المصدر بالكامل لإطار البنية التحتية للتعلّم المعزّز غير المتزامن slime، وهو الذي قاد مرحلة التدريب اللاحق للنموذج مفتوح الأوزان GLM-5.2 من Z.ai بسياق ...
وصفة الرئيس التنفيذي لـ Coinbase بريان أرمسترونغ للتحكم في كلفة الذكاء الاصطناعي لم تكن حدود الاستخدام ولا تنبيهات الإنفاق، بل إعدادات افتراضية أفضل وتوجيه و...
Ornith-1.0 الصادر عن DeepReinforce في 25 يونيو 2026 هو عائلة نماذج برمجة مفتوحة المصدر تعتمد آلية التسقيل الذاتي (self-scaffolding)، حيث يكتب النموذج بنفسه س...
كمّمت NVIDIA نموذج الاستدلال GLM-5.2 من ZAI (MoE بحجم 753B) إلى NVFP4 (4 بت) ونشرته على Hugging Face. بدلاً من سحق كل الأوزان إلى 4 بت، تُكمَّم فقط المعاملات...
تُطلق NVIDIA مجموعة بيانات استدلال متعددة اللغات تضم ستة ملايين مثال، وتوفر بيانات تدريب عالية الجودة تغطي خمس لغات: الفرنسية والإسبانية والألمانية والإيطالي...
استعراض النموذج البصري اللغوي dots.ocr الذي أصدرته RedNote، وكيفية تنفيذ تحليل تخطيط المستندات متعدد اللغات والتعرف الضوئي على الحروف في نموذج واحد.