العودة إلى الأخبار
المنتجAI Understanding إحاطة

يضيف llama.cpp 0.4.0 الدعم لنماذج الذكاء الاصطناعي الأحدث وإدخال الفيديو

يضيف إصدار llama.cpp 0.4.0 دعمًا أوليًا لـ Qwen3.8-Flash-Next وNVIDIA Nemotron-3-Puzzle، وخيارات إدخال الفيديو، وحدود سياق الخادم لكل فتحة، وقراءة الموتر البطيئة، وتغييرات ggml 0.23.0.

4 min readRead the primary source
Source-page capture accompanying llama.cpp 0.4.0 adds support for newer AI models and video input
وثيقة المصدر الأساسيتم تسجيل المصدر
الناشر
github.com
رابط المصدر
github.comhttps://github.com/ggml-org/llama.cpp/releases/tag/v0.4.0
نوع المصدر
المستند الأساسي - إعلان رسمي أو ورقة أو ملف أو صفحة الطرف الأول التي نقرأها مباشرة.
استشهد أيضا

القصة المنقحة الأخيرة

السياقافهم هذا في 60 ثانية

ابدأ هنا

المصطلحات الرئيسية

API (واجهة برمجة التطبيقات)
طريقة منظمة لنظام برمجي واحد لإرسال الطلبات إلى نظام آخر وتلقي الاستجابات منه.
الذاكرة (ذاكرة الوكيل)
السياق المُخزن الذي يستخدمه وكيل الذكاء الاصطناعي عبر الخطوات أو الجلسات لتحسين الاستمرارية.
نموذج متعدد الوسائط
نموذج يمكنه معالجة أو إنشاء أنواع بيانات متعددة مثل النص والصورة والصوت.
اختبر نفسكوأوضح نماذج الذكاء الاصطناعي مسابقة

ما تغير منذ النشر

  1. نشرت لأول مرة
  2. غطى إدخال llama.cpp السابق دعم الإصدار المسبق للعبة Nemotron-3-Puzzle من NVIDIA. يتضمن الإصدار 0.4.0 الآن دعم Nemotron-3-Puzzle-75B-A9B في إصدار ذي علامات أوسع يضيف أيضًا بنيات نموذجية أحدث، وإدخال الفيديو، وعناصر التحكم في سياق الخادم، وقراءة الموتر البطيء، وعمل الواجهة الخلفية لـ ggml 0.23.0.

ماذا حدث

أصدر llama.cpp الإصدار 0.4.0 على GitHub في 4 سبتمبر. يضيف الإصدار دعمًا أوليًا لـ Qwen3.8-Flash-Next، وNVIDIA Nemotron-3-Puzzle-75B-A9B، وDSpark لـ Nemotron 3.5، وnanbeige4.2-3B، و DeepSeek-V4-Flash-Vision-Exp. كما أنه يضيف معلمات إدخال الفيديو، وحدود سياق الخادم لكل فتحة، وقراءة الموتر البطيئة، وتغييرات توجيه الخبراء، وتحسينات ذاكرة التخزين المؤقت KV، وتحسينات الواجهة الخلفية المتعددة. يقوم الإصدار بتحديث ggml من 0.22.0 إلى 0.23.0. يقول المشروع أن هذا الإصدار يضيف اهتمامًا فلاشيًا متفرقًا، وواجهات برمجة التطبيقات غير المتزامنة والتنفيذ غير المتزامن، وحدث RPC وواجهات برمجة التطبيقات غير المتزامنة، ودعم النقل Apple RDMA. تسرد الصفحة إصدارًا ليليًا تم تحديده على أنه b10809. ولا يوثق التوفر الثنائي المعبأ أو متطلبات التثبيت أو توزيع وزن النموذج أو التسعير.

تحدد صفحة إصدار GitHub الإصدار 0.4.0 باعتباره الإصدار الأحدث وتسجل وقت النشر في 4 سبتمبر وهو الساعة 19:56، دون تحديد منطقة زمنية في النص المقدم. يتضمن الإصدار تغييرات واجهة برمجة التطبيقات مثل llama_lazy_mode، وعناصر التحكم في حجم المخزن المؤقت، وإصدارات الجلسة والحالة المحدثة، والمساعدين الجدد للترميز متعدد الوسائط.

تتضمن التغييرات النموذجية والأساسية الدعم الأولي لبنية Qwen3.8-Flash-Next، ودعم NVIDIA Nemotron-3-Puzzle-75B-A9B، ودعم DSpark لـ Nemotron 3.5، ودعم nanbeige4.2-3B، وقراءة الموتر البطيء، وتوجيه الخبراء لكل طبقة، والبحث عن سجل n-gram، وتحسينات استعادة ذاكرة التخزين المؤقت KV، والضمانات ضد ذروة ذاكرة الوصول العشوائي (RAM) أثناء تحميل النموذج.

تتضمن تغييرات الوسائط المتعددة والخادم دعم DeepSeek-V4-Flash-Vision-Exp، وخيارات سطر أوامر الفيديو، وحدود السياق لكل فتحة، وعناوين URL للبيانات الخاصة بالوسائط، والمحافظة الافتراضية على مخرجات الاستدلال، ورفض استدعاءات الأدوات المساعدة المملوءة مسبقًا. تعمل واجهة المستخدم أيضًا على تغيير سلوك سياسة الأداة والإعدادات، لكن المصدر لا يوفر أي بيانات حول اعتماد المستخدم أو الأداء.

تفاصيل المصدر: github.com ↗

لماذا يهم

يعد هذا تحديثًا جوهريًا لوقت تشغيل مفتوح المصدر يستخدمه المطورون الذين يقومون ببناء استدلال الذكاء الاصطناعي وتطبيقات الوسائط المتعددة. يمكن لتغطية النموذج الموسعة أن تجعل النماذج التي تم إصدارها مؤخرًا قابلة للاختبار ضمن الأنظمة المستندة إلى llama.cpp، بينما يعمل دعم إدخال الفيديو على توسيع أنواع الوسائط التي يمكن لهذه الأنظمة معالجتها. يصف المصدر الأداء والعمل المتعلق بالذاكرة، ولكنه لا يوفر أي معايير مستقلة، لذا فإن المكاسب العملية ستعتمد على الأجهزة وتنسيقات النماذج وتكوين النشر.

يربط الإصدار العديد من بنيات النماذج الأحدث بقاعدة بيانات استدلالية مستخدمة على نطاق واسع، بما في ذلك الدعم الأولي لـ Qwen3.8-Flash-Next وNemotron-3-Puzzle. قد يؤدي ذلك إلى تقليل عمل التكامل للمطورين الذين يقومون بتجربة هذه النماذج، على الرغم من أن المصدر لا يثبت التوافق عبر كل نظام أساسي أو تكوين.

يضيف تحديث ggml بنية أساسية للاهتمام المتناثر والواجهات الخلفية غير المتزامنة وأحداث استدعاء الإجراء عن بعد وApple RDMA. قد تكون هذه التغييرات مهمة بالنسبة لعمليات النشر التي يمكنها استخدام تلك الواجهات الخلفية المحددة، لكن صفحة الإصدار لا تحدد زمن الوصول أو الإنتاجية أو استخدام الذاكرة أو تحسينات الموثوقية.

توفر معلمات الفيديو ودعم عنوان URL للبيانات للوسائط وتغييرات المعالجة المسبقة متعددة الوسائط مسارًا أكثر واقعية للتطبيقات التي تتعامل مع الفيديو والوسائط الأخرى. لا يذكر المصدر ما إذا كانت هذه الإمكانات متوفرة في الإصدارات المجمعة أو تحت أي قيود خاصة بالطراز.

Interactive Mechanism

الآلية التفاعلية: كيف تعمل فعليًا

استكشف التكنولوجيا الأساسية وراء هذا التطور بشكل تفاعلي.

Thinking Budget (Test-Time Tokens):1,024 tokens
Complex Accuracy79%Math & Code Logic
Latency3.2sTime to first full output
Inference Cost$0.0092Per query estimated
Reasoning StyleStep VerificationInternal chain depth
Active Thinking Trace:
1Deconstruct user problem into formal constraints
2Propose candidate hypotheses & step-by-step calculation
3Self-correction: Backtrack and refute subtle edge cases
4Exhaustive consistency check & final output synthesis
Core takeaway: Test-time compute fundamentally changes AI economics. Instead of only scaling during pre-training, giving reasoning models more tokens at inference time allows them to systematically solve PhD-level STEM problems.
التحقق من المفهوم التفاعلي+10 Points
AI Models Explained Quiz

Which component of an AI application is the machine-learning model itself?

ماذا تشاهد بعد ذلك

يجب أن توضح إصدارات المتابعة والاختبارات الخاصة بالواجهة الخلفية والوثائق كيفية تصرف النموذج الجديد وميزات الفيديو عبر الأجهزة المدعومة. إن عدم اليقين الأكثر إلحاحًا هو ما إذا كان تطبيق Qwen3.8-Flash-Next الأولي يتلقى عمل التحسين الموعود ومدى تحسين الاهتمام المتناثر وتغييرات الذاكرة لأعباء العمل الحقيقية.

راقب تحديثات التحسين لـ Qwen3.8-Flash-Next والإصلاحات الإضافية لمسارات النماذج متعددة الوسائط المضافة حديثًا.

راقب النتائج المعيارية التي تفصل بين مطالبات تنفيذ صفحة الإصدار والمكاسب المقاسة في السرعة واستخدام الذاكرة والتزامن.

راقب الوثائق المتعلقة بالوصول المعبأ وملفات النماذج المدعومة ومتطلبات الأجهزة والاستعداد للإنتاج. لا يتم توفير هذه التفاصيل من خلال صفحة الإصدار.

الأدلة والاختبارات ذات الصلة

شرح نماذج الذكاء الاصطناعيChatGPT ونماذج اللغة الكبيرةالمحولاتاختبر ما تعرفه – جرّب اختبارًا مجانيًا للذكاء الاصطناعيابحث عن مصطلح الذكاء الاصطناعي في قاموسنااتبع أداة تعقب إصدار نموذج الذكاء الاصطناعي

التحديثات والتصحيحات

يتم تحديث هذه القصة الأساسية في مكانها عندما يتغير الحدث النامي بشكل جوهري. لا يتغير عنوان URL وتاريخ النشر الأصلي أبدًا.

  • غطى إدخال llama.cpp السابق دعم الإصدار المسبق للعبة Nemotron-3-Puzzle من NVIDIA. يتضمن الإصدار 0.4.0 الآن دعم Nemotron-3-Puzzle-75B-A9B في إصدار ذي علامات أوسع يضيف أيضًا بنيات نموذجية أحدث، وإدخال الفيديو، وعناصر التحكم في سياق الخادم، وقراءة الموتر البطيء، وعمل الواجهة الخلفية لـ ggml 0.23.0.
راجع سجل التصحيحات العامة
وجدت هذا مفيدا؟