العودة إلى الرئيسية

أحدث تحديثات ميسترال: تعزيز أداء النماذج المحلية

قامت Mistral مؤخرًا بترقية عائلتها من النماذج المحلية مع تحسين معالجة السياق، وتسريع الاستدلال، ودعم متعدد اللغات أفضل. تتكامل الإصدارات الجديدة من النماذج مفتوحة الأوزان الآن بسلاسة مع بيئات التشغيل المحلية الشهيرة مثل Ollama وllama.cpp، بينما تعمل خيارات التكميم على تقليل متطلبات الأجهزة. هذه التحديثات تجعل نشر الذكاء الاصطناعي المتطور على الأجهزة الشخصية أكثر عملية من أي وقت مضى.

القراءة الصوتية غير متاحة في هذا المتصفح
أحدث تحديثات ميسترال: تعزيز أداء النماذج المحلية

الوسوم

ملخص سريع

قامت Mistral مؤخرًا بترقية عائلتها من النماذج المحلية مع تحسين معالجة السياق، وتسريع الاستدلال، ودعم متعدد اللغات أفضل. تتكامل الإصدارات الجديدة من النماذج مفتوحة الأوزان الآن بسلاسة مع بيئات التشغيل المحلية الشهيرة مثل Ollama وllama.cpp، بينما تعمل خيارات التكميم على تقليل متطلبات الأجهزة. هذه التحديثات تجعل نشر الذكاء الاصطناعي المتطور على الأجهزة الشخصية أكثر عملية من أي وقت مضى.

آخر تحديثات ميسترال: تعزيز أداء النماذج المحلية

انتقلت النماذج اللغوية المحلية من تجربة هواة إلى تخصّص هندسي جاد. وقلّة من الأسماء هي التي شكّلت هذا التحوّل بوضوح مثل "ميسترال" (Mistral). فقد رفعت نماذجها مفتوحة الأوزان — بدءًا من إصدار 7B الأصلي إلى بنى خليط الخبراء المتفرقة (MoE) مثل Mixtral، وسلاسل NeMo وSmall الأحدث — مرارًا وتكرارًا مستوى ما يمكنك تشغيله على محطة عمل واحدة. وفي الأشهر الأخيرة، تركّزت الإعلانات الرسمية من شركة Mistral AI وتغطية النظام البيئي على مدونة Hugging Face على موضوع واحد متكرر: الأداء لكل واط، ولكل دولار، ولكل وحدة معالجة رسومية. وفي الوقت نفسه، وثّقت كل من مدونة Ollama ومدونة Meta AI الموجة الأوسع للمصادر المفتوحة التي ساعدت ميسترال في تسريعها، بدءًا من نماذج البرمجة العاملة بالوكالة وصولاً إلى الاستدلال المحلي الفعّال.

هذه المقالة دليل عملي للحصول على أفضل أداء ممكن من أحدث النماذج المحلية من ميسترال. سأرشدك خلال المتطلبات، ومسار التثبيت النظيف، وأمثلة استخدام ملموسة يمكنك تشغيلها اليوم على حاسوب محمول أو خادم مزود بوحدة معالجة رسومية واحدة. وعلى طول الطريق، سأريك كيفية استخراج المزيد من الرموز في الثانية باستخدام التكميم (quantization)، والانتباه السريع (flash attention)، وفك الترميز التخميني (speculative decoding)، ومحركات الإرسال الحديثة.

المتطلبات

قبل كتابة أي أمر، تحتاج إلى صورة واضحة عن عتادك. تُوزَّع نماذج ميسترال بعدة أحجام، وسيعتمد اختيارك للنموذج على الذاكرة وقوة المعالجة المتاحة على جهازك.

للاستخدام المحلي المريح، إليك نموذج تقريبي للذهن:

  • **ميسترال 7B** (7 مليارات معامل) يعمل بشكل مريح مع **8 جيجابايت من VRAM** عند تكميمه، أو حوالي 16 جيجابايت من RAM في إعداد يعتمد على المعالج فقط. هذه هي نقطة الدخول الكلاسيكية.
  • **ميسترال NeMo 12B** هو الحلّ العصري الشامل الذي طُوّر بالتعاون مع NVIDIA. يوفّر نافذة سياق كبيرة تبلغ 128 ألف رمز، ويحتاج إلى حوالي **12–16 جيجابايت من VRAM** عند تكميمه، أو ما يعادل 16–24 جيجابايت من الذاكرة الموحّدة على معالجات Apple Silicon.
  • **Mixtral 8x7B** هو نموذج موزاييك (MoE) يضم 47 مليار معامل إجمالاً، لكنه ينشّط اثنين فقط من خبرائه الثمانية لكل رمز. عمليًا، يعمل مع **32–48 جيجابايت من VRAM** في صورته المكمّمة. ويبدو أسرع بكثير مما يوحي به عدد معاملاته.
  • **ميسترال Small (24B)** هو أحدث نموذج محلي رئيسي من ميسترال وأكثرها قدرة. النسخة المكمّمة بدقة 4 بت تتسع في **16–24 جيجابايت من VRAM**، مما يجعلها مرشحًا قويًا لبطاقة RTX 4090 أو Mac Studio. النموذج غير المكمّم يحتاج حوالي 50 جيجابايت.

على الجانب البرمجي، تحتاج إلى نظام تشغيل حديث بدقة 64 بت. يعد لينكس المسار الأكثر سلاسة، ويعمل macOS بشكل ممتاز بفضل تقنية Metal والذاكرة الموحدة، بينما يجب على مستخدمي ويندوز تشغيل بيئة WSL2 للحصول على أفضل دعم للأدوات. يُنصح باستخدام بايثون 3.10 أو أحدث، وإذا كان لديك وحدة معالجة رسومية من NVIDIA، فثبّت برنامج تشغيل CUDA حديثًا (الإصدار 12.x اختيار آمن).

الأدوات الرئيسية التي سنستخدمها هي: **Ollama** لسهولة الاستخدام، و**Hugging Face Transformers** لسير عمل البحث والضبط الدقيق، و**llama.cpp** لأقصى تحكم منخفض المستوى، و**vLLM** للإرسال عالي الإنتاجية.

التثبيت خطوة بخطوة

سأقوم بتثبيت جميع الأدوات الأساسية بطريقة تحافظ على نظافة نظامك. ابدأ بـ Ollama، ثم جهّز بيئة بايثون افتراضية، وأخيرًا أضف llama.cpp وvLLM كتحسينات اختيارية لكن موصى بها بشدة.

1. تثبيت Ollama

أصبح Ollama الآن أبسط طريقة لتشغيل نماذج ميسترال. فهو يجمع إدارة النماذج، وخادم API متوافقًا مع OpenAI، وواجهة محادثة عبر سطر الأوامر في ملف واحد.

ثبّته على لينكس أو macOS باستخدام السكربت الرسمي:

curl -fsSL https://ollama.com/install.sh | sh

يضيف السكربت Ollama إلى متغير PATH، وينشئ خدمة `ollama` على لينكس، وينزّل أحدث إصدار. على macOS، يمكنك أيضًا تنزيل التطبيق الأصلي من موقع Ollama؛ يتضمن التطبيق أداة سطر الأوامر تلقائيًا.

على ويندوز، يعمل تطبيق Ollama لسطح المكتب أصليًا مع WSL2، لذا فإن أمر لينكس أعلاه يعمل أيضًا داخل طرفية WSL2.

تحقق من التثبيت:

ollama --version

إذا رأيت رقم إصدار، فأنت جاهز. لا حاجة لتثبيت برنامج تشغيل منفصل لـ Apple Silicon؛ يستخدم Ollama إطار عمل Metal. على وحدات معالجة الرسوميات من NVIDIA، سيكتشف Ollama بيئة CUDA تلقائيًا.

2. إعداد بيئة بايثون لـ Hugging Face

تعتمد العديد من سير العمل — خاصة الضبط الدقيق، والاستدلال المكمّم، وتقييم الوكلاء — على النظام البيئي لـ Hugging Face. أنشئ بيئة افتراضية حتى لا تلوّث الحزم بايثون النظام لديك:

python -m venv mistral-env
source mistral-env/bin/activate

على ويندوز PowerShell، استبدل السطر الثاني بـ `mistral-env\Scripts\activate`.

الآن ثبّت الحزم الأساسية:

pip install --upgrade transformers accelerate bitsandbytes huggingface_hub
  • **Transformers** هي المكتبة الرئيسية للاستدلال والضبط الدقيق.
  • **Accelerate** يتعامل مع تحديد الأجهزة والدقة المختلطة.
  • **bitsandbytes** يتيح التكميم بدقة 4 بت و8 بت على CUDA.
  • **huggingface_hub** يمنحك واجهة سطر الأوامر لتنزيل النماذج.

3. بناء llama.cpp من المصدر (اختياري)

إذا كنت تريد تحكمًا مطلقًا في سرعة الاستدلال — خاصة على الأجهزة التي تعمل بالمعالج فقط أو على Apple Silicon — فيجب عليك بناء llama.cpp من المصدر. هو المحرك الذي يعمل خلف Ollama، لكن تشغيله مباشرة يفتح لك خيارات لا يكشفها Ollama.

أولاً، استنسخ المستودع:

git clone https://github.com/ggml-org/llama.cpp
cd llama.cpp

ثم قم بتهيئة البناء باستخدام CMake. لوحدة معالجة رسومية من NVIDIA، استخدم:

cmake -B build -DGGML_CUDA=ON
cmake --build build --config Release -j

لـ Apple Silicon، استبدل علامة CUDA بـ Metal:

cmake -B build -DGGML_METAL=ON
cmake --build build --config Release -j

للبناء على المعالج فقط، يمكنك ببساطة تشغيل `cmake -B build` دون أي علامات إضافية. يستغرق البناء بضع دقائق وينتج ملفات تنفيذية تحت `build/bin/`، بما في ذلك `llama-cli` و`llama-server`.

4. تثبيت vLLM (اختياري، للإرسال)

vLLM هو محرك إرسال عالي الإنتاجية مع تجميع مستمر للطلبات. إذا كنت تخطط لكشف نموذج ميسترال كواجهة برمجية للإنتاج، فثبّته:

pip install vllm

يعمل vLLM بشكل أفضل على وحدات معالجة الرسوميات من NVIDIA مع CUDA. وهو يدعم العديد من بنى ميسترال أصليًا، بما في ذلك نماذج MoE، ويمكنه الإرسال باستخدام PagedAttention لتقليل هدر الذاكرة بشكل كبير.

أمثلة الاستخدام

مع توفر الأدوات، دعنا ننظر إلى أنماط الاستخدام العملية. جميع الأمثلة هنا تستخدم نماذج ميسترال المتاحة للجمهور.

الدردشة مع ميسترال 7B في Ollama

أسرع اختبار شامل هو جلسة محادثة. اسحب النموذج أولاً:

ollama pull mistral

هذا ينزّل نموذج ميسترال 7B التعليمات المكمّم بصيغة GGUF، والمحسّن للاستدلال المحلي على المعالج ووحدة المعالجة الرسومية. ابدأ محادثة:

ollama run mistral

ستظهر لك مطالبة داخل طرفيتك. اكتب سؤالاً، على سبيل المثال:

>>> اشرح خليط الخبراء في ثلاث جمل.

يجب أن ترى الرموز تتدفق في الوقت الفعلي تقريبًا. على حاسوب محمول حديث بشريحة من سلسلة M أو وحدة معالجة رسومية متوسطة، توقع عشرات الرموز في الثانية لهذا النموذج 7B.

يوفّر Ollama أيضًا علامات (tags) للعديد من الإصدارات الأخرى من نماذج ميسترال. اسحب وقم بتشغيل نموذج أكبر باستخدام:

ollama pull mixtral:8x7b
ollama run mixtral:8x7b

إذا كانت ذاكرة VRAM لديك محدودة، التزم بإصدارات 7B وNeMo 12B، فهي أكثر تسامحًا.

كشف نقطة نهاية محلية متوافقة مع OpenAI

أكبر ميزة عملية لـ Ollama هي أن خادمه يعد بديلاً جاهزًا لواجهة برمجة تطبيقات OpenAI. ابدأ الخادم في طرفية:

ollama serve

ثم أرسل طلب إكمال محادثة من طرفية أخرى باستخدام `curl`:

curl -X POST http://localhost:11434/v1/chat/completions -d '{
  "model": "mistral",
  "messages": [
    {"role": "user", "content": "ما هي أسرع طريقة لتشغيل ميسترال محليًا؟"}
  ]
}'

يكون الرد كائن JSON قياسيًا بحقول `choices` و`usage` و`model`. يمكنك توجيه أي عميل متوافق مع OpenAI، مثل LangChain أو LlamaIndex، إلى `http://localhost:11434/v1` وتغيير اسم النموذج إلى `mistral`. وهذا يجعل من السهل التبديل بين النماذج المحلية والسحابية دون إعادة كتابة كود التطبيق.

استدلال بايثون باستخدام Transformers

تعد Hugging Face Transformers الأداة المناسبة عندما تحتاج إلى دمج ميسترال في تطبيق بايثون. يتوفر نموذج ميسترال 7B التعليمات تحت المعرف `mistralai/Mistral-7B-Instruct-v0.3`. إليك سكربت محادثة بسيط:

from transformers import AutoModelForCausalLM, AutoTokenizer

model_id = "mistralai/Mistral-7B-Instruct-v0.3"

tokenizer = AutoTokenizer.from_pretrained(model_id)
model = AutoModelForCausalLM.from_pretrained(model_id, device_map="auto")

messages = [{"role": "user", "content": "اكتب هايكو عن النماذج اللغوية المحلية."}]
inputs = tokenizer.apply_chat_template(messages, return_tensors="pt").to(model.device)

outputs = model.generate(inputs, max_new_tokens=128, do_sample=True, temperature=0.7)
print(tokenizer.decode(outputs[0], skip_special_tokens=True))

تضع الوسيطة `device_map="auto"` الطبقات على وحدة المعالجة الرسومية إذا كانت متاحة، وتعود إلى المعالج فقط في الحالات الأخرى. إذا كنت تريد استخدام Flash Attention، أضف `attn_implementation="flash_attention_2"` إلى استدعاء `from_pretrained`. لاحظ أن Flash Attention 2 يتطلب وحدة معالجة رسومية تدعم CUDA ومن بنية Ampere فصاعدًا.

تشغيل أوزان GGUF المكمّمة مباشرة

للحصول على أقصى أداء خارج Ollama، يمكنك تنزيل تحويل GGUF رسمي وتشغيله باستخدام llama.cpp. يستضيف Hugging Face العديد من نقاط تفتيش GGUF. على سبيل المثال، يتوفر تكميم شائع بدقة 4 بت لنموذج ميسترال 7B التعليمات v0.2 في مساحة مجتمع `TheBloke`:

huggingface-cli download TheBloke/Mistral-7B-Instruct-v0.2-GGUF \
  mistral-7b-instruct-v0.2.Q4_K_M.gguf \
  --local-dir ./mistral-gguf \
  --local-dir-use-symlinks False

ثم قم بتشغيله باستخدام واجهة سطر الأوامر في llama.cpp. يتحكم العلم `-ngl` في عدد الطبقات التي يتم تحميلها إلى وحدة المعالجة الرسومية؛ اضبطه على رقم كبير لتحميل كل شيء:

./build/bin/llama-cli \
  -m mistral-gguf/mistral-7b-instruct-v0.2.Q4_K_M.gguf \
  -p "ما الذي يجعل Mixtral مختلفًا عن المحول الكثيف؟" \
  -n 256 \
  -ngl 99 \
  -fa

يعمل `-fa` على تمكين الانتباه السريع في llama.cpp، مما يسرّع توليد السياق الطويل بشكل كبير. مع `-ngl 99` ووحدة معالجة رسومية من NVIDIA، تعمل جميع الطبقات تقريبًا على وحدة المعالجة الرسومية، وغالبًا ما تتجاوز السرعة 40 رمزًا في الثانية لنموذج 7B.

تشغيل NeMo وCodestral محليًا

يعد ميسترال NeMo 12B إصدارًا حديثًا مهمًا للاستخدام المحلي. وهو متاح على Hugging Face Hub تحت المعرف `mistralai/Mistral-Nemo-Instruct-2407`، ومدمج أيضًا في Ollama. لتشغيله باستخدام Ollama:

ollama pull mistral-nemo
ollama run mistral-nemo

يتمتع هذا النموذج بنافذة سياق أصلية تبلغ 128 ألف رمز، وهو أقوى بشكل ملحوظ في الاستدلال والبرمجة من الإصدار 7B الأصلي. عند التكميم بدقة 4 بت، يستخدم حوالي 8–10 جيجابايت من RAM أو VRAM، مما يجعله نقطة مثالية لوحدة معالجة رسومية استهلاكية واحدة.

لأعمال البرمجة المحلية المركزة، يتوفر نموذج Codestral 22B من ميسترال أيضًا على Ollama:

ollama pull codestral
ollama run codestral

يستخدم Codestral ترخيصًا غير Apache لاستخدام إكمال الأكواد، لذا تحقق من شروط الترخيص على موقع ميسترال قبل استخدامه في منتجاتك.

تعزيز الأداء

التثبيت هو نصف المعركة فقط. بمجرد تشغيل نموذجك، يمكنك عادةً مضاعفة إنتاجيته من خلال بعض التحسينات المستهدفة.

التكميم هو رافعتك الأولى

يقلل التكميم من استهلاك الذاكرة ويزيد السرعة مقابل التضحية بجزء صغير من الجودة. تعد ملفات GGUF بصيغتي Q4_K_M وQ5_K_M النقطة المثلى لمعظم المستخدمين. على Ollama، تكون الإصدارات المكمّمة هي الافتراضية، لذا تحصل على هذه الفائدة تلقائيًا. في Transformers، يمكنك تحقيق نتائج مماثلة باستخدام تحميل 4-bit من bitsandbytes:

from transformers import BitsAndBytesConfig

bnb_config = BitsAndBytesConfig(
    load_in_4bit=True,
    bnb_4bit_compute_dtype="float16",
    bnb_4bit_quant_type="nf4",
)

model = AutoModelForCausalLM.from_pretrained(
    model_id,
    quantization_config=bnb_config,
    device_map="auto",
)

بالنسبة لنموذج 7B، يقلل التحميل بدقة 4 بت الذاكرة من حوالي 15 جيجابايت إلى حوالي 4–5 جيجابايت، وهو ما يحدث غالبًا الفرق بين التشغيل وعدم التشغيل على وحدة معالجة رسومية معينة.

اختر طول السياق المناسب لعبء عملك

تدعم نماذج ميسترال سياقات طويلة، لكن السياقات الأطول تكلف ذاكرة ووقتًا بشكل تربيعي أثناء الانتباه. إذا كانت مهمتك تحتاج فقط إلى 2000 رمز من السياق، فلا تدع المحلل اللغوي يملأ نافذة 32 ألف رمز. في Ollama، يمكنك تعيين طول السياق صراحةً في وقت التشغيل:

ollama run mistral --num-ctx 4096

على مستوى Transformers، مرر `max_new_tokens` وحدّ `max_length` في استدعاء `generate`. تؤدي السياقات الأقصر إلى زيادة كبيرة في الرموز في الثانية لأن ذاكرة الانتباه تقل.

استخدم خليط الخبراء عندما يمكنك

إن Mixtral 8x7B وMixtral 8x22B هما نموذجا MoE متفرقان. يتم تنشيط مجموعة فرعية فقط من الخبراء لكل رمز، لذا يكون الاستدلال أرخص بكثير من نموذج كثيف بحجم 47B، على الرغم من العدد الكبير للمعلمات. إذا كان لديك وحدة معالجة رسومية بسعة 48 جيجابايت على الأقل من VRAM، فإن تشغيل Mixtral 8x7B مكمّمًا يعطي جودة قريبة من نماذج أكبر بمرتين من حيث الحجم الفعّال. على الأجهزة الأصغر، يقدم ميسترال NeMo 12B حلاً وسطًا مفيدًا: بنية كثيفة مع تدريب أغنى وسياق أطول من إصدار 7B.

فعّل الانتباه السريع (Flash Attention)

الانتباه السريع هو خوارزمية انتباه تدرك الإدخال/الإخراج تقلل من النفقات العامة للذاكرة وتسرّع التوليد، خاصة للتسلسلات الطويلة. في Transformers، يكون تغييرًا بسطر واحد:

model = AutoModelForCausalLM.from_pretrained(
    model_id,
    torch_dtype="auto",
    attn_implementation="flash_attention_2",
)

في llama.cpp، مرر `-fa`. في vLLM، يكون الانتباه السريع مفعّلاً افتراضيًا على وحدات المعالجة الرسومية المدعومة. يكون التحسن أكثر وضوحًا عندما يتجاوز طول السياق 2048 رمزًا.

استخدم فك الترميز التخميني لزيادة الإنتاجية

فك الترميز التخميني هو تقنية يولّد فيها نموذج مسودة صغير رموزًا مرشحة، ويتحقق النموذج الكبير منها بالتوازي. يمكن أن يؤدي هذا إلى زيادة سرعة التوليد بشكل كبير دون التأثير على جودة المخرجات. يدعم llama.cpp هذا بواسطة نموذج مسودة بصيغة GGUF، مثل نموذج صغير بحجم 1B. تختلف صيغة أمر سطر الأوامر بين الإصدارات، لذا تحقق من تعليمات البناء لديك:

./build/bin/llama-cli --help | grep -i draft

إذا كان بناؤك يدعم علامة `--draft`، فوجّهها إلى ملف GGUF صغير واضبط `-n` لتوليد طويل. التأثير الملحوظ هو قفزة في الرموز في الثانية لنفس النموذج المستهدف.

الإرسال باستخدام vLLM لإنتاجية الإنتاج

بالنسبة للطلبات المتزامنة، تحتاج إلى خادم يجمّع الطلبات بكفاءة. يعمل التجميع المستمر في vLLM على حزم العديد من الطلبات في تمرير أمامي واحد، مما يمكن أن يزيد الإنتاجية الإجمالية عدة مرات مقارنة بحلقة بسيطة. أطلق خادم ميسترال هكذا:

python -m vllm.entrypoints.openai.api_server \
  --model mistralai/Mistral-7B-Instruct-v0.3 \
  --tensor-parallel-size 1 \
  --max-model-len 8192

الواجهة البرمجية متوافقة مع OpenAI على `/v1`. تحت الحمل، سترى استخدامًا أفضل بكثير لوحدة المعالجة الرسومية مقارنةً بعميل أحادي الدفق، لأن vLLM يُبقي وحدة المعالجة الرسومية مشغولة بدفعة دوّارة من الطلبات النشطة.

اضبط حجم الدفعة وعدد الخيوط

على الأنظمة التي تعتمد على المعالج فقط، يستفيد llama.cpp من ضبط عدد الخيوط. عدد كبير جدًا من الخيوط يمكن أن يسبب تنافسًا. نقطة بداية جيدة هي تعيين عدد الخيوط إلى عدد النوى المادية لديك:

./build/bin/llama-cli \
  -m model.gguf \
  -p "مرحبًا" \
  -n 64 \
  -t 8 \
  --numa

يساعد العلم `--numa` على محطات العمل متعددة المقابس. على Apple Silicon، عادةً ما يكون ترك الخيوط على الإعدادات الافتراضية هو الأفضل لأن Metal يدير الجدولة نيابةً عنك.

الخلاصة

لقد جعلت إصدارات ميسترال الأخيرة الاستدلال المحلي أكثر عملية من أي وقت مضى. إن الجمع بين النماذج الكثيفة الصغيرة مثل ميسترال 7B وNeMo 12B، ونماذج خليط الخبراء المتفرقة مثل Mixtral، والخيارات القوية الموجهة للبرمجة مثل Codestral، يعني أن هناك نموذج ميسترال يناسب كل ميزانية وتكوين عتاد تقريبًا. الركائز الأربع للأداء هي نفسها عبر جميع هذه النماذج: استخدم محرك استدلال حديث، وكمّم أوزانك، وأبقِ نوافذ السياق متناسبة مع مهمتك، وفعّل تحسينات الانتباه مثل الانتباه السريع وفك الترميز التخميني.

ابدأ بـ Ollama لجلسة خالية من الاحتكاك، وانتقل إلى llama.cpp عندما تحتاج إلى تحكم دقيق، وتدرّج إلى vLLM عندما تريد إنتاجية بمستوى الإنتاج. تعد صفحة أخبار Mistral AI الرسمية، ومدونة Hugging Face، ومدونة Ollama، ومدونة Meta AI أماكن ممتازة لمتابعة الموجة التالية من التحديثات. ومع استمرار تحسن كفاءة النماذج، ستستمر الفجوة بين واجهات برمجة التطبيقات السحابية والعتاد المحلي في التضيق — ومع الخطوات الواردة في هذه المقالة، فأنت بالفعل في الطليعة.

المصادر

أسئلة شائعة

عن ماذا يتحدث هذا المقال؟

يتناول هذا المقال موضوع "أحدث تحديثات ميسترال: تعزيز أداء النماذج المحلية" ضمن تصنيف نماذج محلية. قامت Mistral مؤخرًا بترقية عائلتها من النماذج المحلية مع تحسين معالجة السياق، وتسريع الاستدلال، ودعم متعدد اللغات أفضل. تتكامل الإصدارات الجديدة من النماذج مفتوحة الأوزان الآن بسلاسة مع بيئات التشغيل المحلية الشهيرة مثل Ollama وllama.cpp، بينما تعمل خيارات التكميم على تقليل متطلبات الأجهزة. هذه التحديثات تجعل نشر الذكاء الاصطناعي المتطور على الأجهزة الشخصية أكثر عملية من أي وقت مضى.

لمن يفيد هذا المقال؟

يفيد القراء المهتمين بفهم أدوات وتقنيات الذكاء الاصطناعي بطريقة عملية وواضحة.

ما الخطوة التالية؟

اقرأ المقال كاملاً، راجع المصادر المرفقة، ثم جرّب الأفكار المناسبة لاحتياجك بحذر.