تعلم التعزيز يشتد، البيت الأبيض يأمر بسياسة ذكاء اصطناعي قوية، استخدام الحاسوب يكتسب زخماً، تحكم دقيق في الضبط الدقيق
تتزايد وتيرة التقدم في التعلم المعزز، ويصدر البيت الأبيض توجيهات بسياسة ذكاء اصطناعي قوية، ويرتفع استخدام الحواسيب بشكل كبير، وتحقق تقنيات الضبط الدقيق دقة غير مسبوقة. هذه الاتجاهات الأربعة تعيد تشكيل تطوير أدوات الذكاء الاصطناعي.
الوسوم
ملخص سريع
تتزايد وتيرة التقدم في التعلم المعزز، ويصدر البيت الأبيض توجيهات بسياسة ذكاء اصطناعي قوية، ويرتفع استخدام الحواسيب بشكل كبير، وتحقق تقنيات الضبط الدقيق دقة غير مسبوقة. هذه الاتجاهات الأربعة تعيد تشكيل تطوير أدوات الذكاء الاصطناعي.
مقدمة
المشهد العام للذكاء الاصطناعي لا يقف ساكناً أبداً. في الأسابيع الأخيرة، تقاربت أربعة تيارات قوية: عودة ملحوظة للتعلم المعزز، إصدار البيت الأبيض لتوجيه سياسة ذكاء اصطناعي قوي، اكتساب استخدام الحاسوب من قبل وكلاء الذكاء الاصطناعي زخماً حقيقياً على أرض الواقع، وتحسن دقة التحكم في ضبط النماذج الدقيق. هذه التطورات، التي أبرزتها مصادر رائدة مثل The Batch من deeplearning.ai، ومدونة OpenAI News، ومدونة Google AI Blog، ومدونة Microsoft AI Blog، تشير إلى تحول نحو ذكاء اصطناعي أكثر قدرة وفي نفس الوقت أكثر تنظيماً. تستكشف هذه المقالة كل اتجاه وتقدم دليلاً عملياً لواحدة من أكثر التقنيات تأثيراً: التحكم الدقيق في الضبط الدقيق.
التعلم المعزز يشتد حرارة
التعلم المعزز (Reinforcement Learning) الذي طغت عليه ضجة نماذج اللغة الكبيرة، يشهد الآن نهضة جديدة. يجمع الباحثون بين التعلم المعزز والنماذج المدربة مسبقاً واسعة النطاق لإنشاء وكلاء يتعلمون من التفاعل بكفاءة أعلى. تطورت الأساليب المستخدمة في التعلم المعزز بالتغذية البشرية (RLHF) التي شاعها ChatGPT لتصبح أكثر قابلية للتوسع ومتانة. يُظهر العمل الحديث من مختبرات تم الاستشهاد بها في The Batch أنه يمكن الآن تطبيق التعلم المعزز في مجالات مثل الروبوتات، والألعاب، وحتى توليد الأكواد البرمجية بكفاءة غير مسبوقة من حيث عدد الأمثلة المطلوبة.
في الوقت نفسه، تُضبط خوارزميات جديدة (غالباً مشتقة من PPO و SAC) لتناسب الحوار متعدد الأدوار، حيث تكون "المكافأة" هي رضا المستخدم أو إنجاز المهمة. ألمحت مدونة OpenAI إلى استخدام التعلم المعزز لتحسين سلاسل التفكير في نماذجها الأخيرة، بينما نشرت Google AI أبحاثاً حول استخدام التعلم المعزز لتعليم الوكلاء الحاسوبيين كيفية تصفح الويب. النتيجة هي مشهد أصبح فيه التعلم المعزز لم يعد فرعاً ثانوياً بل مكوناً أساسياً لأنظمة الجيل القادم من الذكاء الاصطناعي.
البيت الأبيض يصدر توجيه سياسة ذكاء اصطناعي قوي
على صعيد السياسات، اتخذت الحكومة الأمريكية إجراءات حاسمة. أصدر البيت الأبيض أمراً تنفيذياً جديداً (أو أداة سياسية مكافئة) يفرض متطلبات كبيرة على تطوير ونشر نماذج الذكاء الاصطناعي المتقدمة. يهدف هذا التوجيه "القوي" إلى ضمان السلامة والأمن والجدارة بالثقة، خاصة بالنسبة للنماذج التي قد تشكل مخاطر على الأمن القومي أو تتيح تضليلاً واسع النطاق.
وفقاً لإعلان البيت الأبيض، الذي يتوافق مع التغطية في مدونة Microsoft AI Blog و The Batch، يفرض الأمر على مطوري أقوى نماذج الذكاء الاصطناعي مشاركة نتائج اختبارات السلامة مع الحكومة، وتنفيذ علامات مائية للمحتوى المولد بالذكاء الاصطناعي، والحماية من التحيز الخوارزمي. يوجه الأمر أيضاً الوكالات لتطوير معايير للذكاء الاصطناعي في البنى التحتية الحيوية. بالنسبة للممارسين، يعني هذا أن أي ضبط دقيق أو نشر لنماذج واسعة النطاق سيكون بحاجة إلى مراعاة متطلبات الامتثال هذه. حقبة التطوير غير المنظم للذكاء الاصطناعي تقترب من نهايتها، وأصبح التحكم الدقيق في سلوك النموذج ليس مجرد ميزة أداء بل ضرورة قانونية.
استخدام الحاسوب يكتسب زخماً
اكتسب مصطلح "استخدام الحاسوب" في عالم الذكاء الاصطناعي معنى جديداً: فهو يشير إلى قدرة الوكيل الذكي على التفاعل المباشر مع واجهة المستخدم الرسومية أو نظام التشغيل الخاص بالحاسوب، تماماً كما يفعل الإنسان. أظهرت العروض الأخيرة من OpenAI (كما ورد في OpenAI News) نماذج يمكنها التحكم في سطح المكتب، وتصفح المجلدات، والنقر على الأزرار، وكتابة النص لإنجاز مهام معقدة. سلطت مدونة Microsoft AI Blog الضوء أيضاً على قدرة Copilot المتزايدة على العمل نيابة عن المستخدمين داخل بيئتي Windows وOffice.
يتسارع هذا الاتجاه لأنه يسد الفجوة بين فهم اللغة والإجراء الفعلي في العالم الحقيقي. بدلاً من توليد النص، يمكن للذكاء الاصطناعي الآن حجز رحلة طيران، أو ملء استمارة، أو إعادة ضبط إعدادات عن طريق التلاعب المباشر بالواجهة. الآثار المترتبة على الأتمتة، وإمكانية الوصول، وتقنية المعلومات في المؤسسات عميقة. ومع ذلك، فإنه يثير أيضاً تحديات: السلامة، وثقة المستخدم، والحاجة إلى تحكم دقيق في الإجراءات التي يُسمح للذكاء الاصطناعي باتخاذها. يصبح الضبط الدقيق أمراً حاسماً لتقييد وكلاء استخدام الحاسوب هذه بسلوكيات آمنة ومعتمدة.
تحكم دقيق في الضبط الدقيق: دليل عملي
الضبط الدقيق هو الطريقة السائدة لتكييف النماذج المدربة مسبقاً واسعة النطاق مع مهام محددة. لكن الأبحاث الحديثة - خاصة تقنيات الضبط الدقيق الفعالة من حيث المعلمات مثل LoRA (التكيف منخفض الرتبة) والمهايئات (adapters) - منحت المطورين تحكماً غير مسبوق. بدلاً من تحديث جميع المعلمات البالغ عددها مليارات، يمكنك تدريب مجموعة صغيرة من المعلمات الإضافية التي تعمل بمثابة "عجلة قيادة" للنموذج. يقدم هذا القسم دروساً عملية لتحقيق تحكم دقيق في الضبط الدقيق باستخدام مكتبات Hugging Face.
المتطلبات
- بايثون 3.8 أو إصدار أحدث
- جهاز بذاكرة وصول عشوائي لا تقل عن 8 جيجابايت (يُنصح بـ 16 جيجابايت أو أكثر للنماذج الصغيرة)
- (اختياري) وحدة معالجة رسومية (GPU) مع CUDA لتدريب أسرع (مثل NVIDIA T4، V100، أو أفضل)
- حساب Hugging Face (اختياري، للوصول إلى النماذج)
- معرفة أساسية بلغة بايثون وسطر الأوامر
التثبيت خطوة بخطوة
أولاً، قم بإعداد بيئة افتراضية لبايثون وقم بتثبيت الحزم اللازمة.
# التعلم المعزز يشتد حرارة، البيت الأبيض يصدر توجيه سياسة ذكاء اصطناعي قوي، استخدام الحاسوب يكتسب زخماً، تحكم دقيق في الضبط الدقيق
python -m venv llm_env
source llm_env/bin/activate # على ويندوز: llm_env\Scripts\activate
# ترقية pip
pip install --upgrade pip
# تثبيت المكتبات الأساسية
pip install transformers datasets accelerate peft bitsandbytes- `transformers`: مكتبة Hugging Face للتعامل مع النماذج.
- `datasets`: لتحميل بيانات التدريب بسهولة.
- `accelerate`: للتدريب الفعال متعدد وحدات المعالجة الرسومية/المعالجة المركزية.
- `peft`: مكتبة الضبط الدقيق الفعال من حيث المعلمات (تدعم LoRA).
- `bitsandbytes`: تتيح التكميم بدقة 4 بت و8 بت لتوفير الذاكرة.
إذا كان لديك وحدة معالجة رسومية، فقم بتثبيت PyTorch مع CUDA (تحقق من إصدار CUDA لديك أولاً):
pip install torch torchvision torchaudio --index-url https://download.pytorch.org/whl/cu118أمثلة الاستخدام
سنقوم بضبط نموذج صغير (مثل `microsoft/phi-2` بحجم 2.7 مليار معلمة) باستخدام LoRA على مهمة تصنيف المشاعر. بالنسبة للنماذج الأكبر، التقنية متطابقة ولكن قد تتطلب ذاكرة GPU أكبر.
**الخطوة 1: تحميل النموذج الأساسي بدقة 4 بت لتوفير الذاكرة.**
from transformers import AutoModelForCausalLM, AutoTokenizer, BitsAndBytesConfig
from peft import get_peft_model, LoraConfig, TaskType
import torch
model_name = "microsoft/phi-2"
# تكوين التكميم بدقة 4 بت (يتطلب bitsandbytes)
bnb_config = BitsAndBytesConfig(
load_in_4bit=True,
bnb_4bit_quant_type="nf4",
bnb_4bit_compute_dtype=torch.bfloat16,
bnb_4bit_use_double_quant=True
)
tokenizer = AutoTokenizer.from_pretrained(model_name)
tokenizer.pad_token = tokenizer.eos_token # تعيين رمز الحشو
model = AutoModelForCausalLM.from_pretrained(
model_name,
quantization_config=bnb_config,
device_map="auto",
trust_remote_code=True
)**الخطوة 2: تكوين LoRA.** سنستهدف جميع طبقات الانتباه للضبط الدقيق برتبة r=8.
lora_config = LoraConfig(
r=8, # الرتبة
lora_alpha=32, # عامل التحجيم
target_modules=["q_proj", "k_proj", "v_proj", "o_proj", "gate_proj", "up_proj", "down_proj"],
lora_dropout=0.05,
bias="none",
task_type=TaskType.CAUSAL_LM
)
model = get_peft_model(model, lora_config)
trainable_params = sum(p.numel() for p in model.parameters() if p.requires_grad)
print(f"عدد المعلمات القابلة للتدريب: {trainable_params}")يطبع هذا عدد المعلمات التي سيتم تحديثها - عادة أقل من 1% من النموذج الكامل.
**الخطوة 3: إعداد مجموعة بيانات صغيرة.** للغرض التوضيحي، نقوم بإنشاء مجموعة بيانات اصطناعية لمتابعة التعليمات. من الناحية العملية، قم بتحميل مجموعتك الخاصة.
from datasets import Dataset
data = [
{"instruction": "صنف المشاعر: أنا أحب هذا المنتج!", "output": "إيجابي"},
{"instruction": "صنف المشاعر: هذا فظيع.", "output": "سلبي"},
{"instruction": "صنف المشاعر: ليس سيئاً، يمكن أن يكون أفضل.", "output": "محايد"},
# أضف المزيد من الأمثلة...
]
def format_func(example):
return {"text": f"### التعليمات: {example['instruction']}\n### الإخراج: {example['output']}"}
formatted_data = [format_func(d) for d in data]
dataset = Dataset.from_list(formatted_data)
tokenized_dataset = dataset.map(lambda x: tokenizer(x["text"], truncation=True, padding="max_length", max_length=128), batched=True)**الخطوة 4: التدريب باستخدام Hugging Face Trainer.**
from transformers import TrainingArguments, Trainer
training_args = TrainingArguments(
output_dir="./phi2-sentiment-lora",
per_device_train_batch_size=4,
gradient_accumulation_steps=4,
num_train_epochs=3,
learning_rate=2e-4,
logging_steps=10,
save_steps=500,
evaluation_strategy="no",
save_total_limit=2,
remove_unused_columns=False,
report_to="none",
fp16=True, # استخدم الدقة المختلطة إذا كانت GPU تدعم
)
trainer = Trainer(
model=model,
args=training_args,
train_dataset=tokenized_dataset,
tokenizer=tokenizer,
)
trainer.train()**الخطوة 5: حفظ وتحميل مهايئ LoRA.**
# حفظ المهايئ
model.save_pretrained("phi2-sentiment-lora-adapter")
tokenizer.save_pretrained("phi2-sentiment-lora-adapter")
# لاستخدامه لاحقًا، أعد تحميل النموذج الأساسي وحمّل المهايئ
from peft import PeftModel
base_model = AutoModelForCausalLM.from_pretrained(
model_name,
quantization_config=bnb_config,
device_map="auto",
trust_remote_code=True
)
adapted_model = PeftModel.from_pretrained(base_model, "phi2-sentiment-lora-adapter")يمنحك هذا النهج تحكماً دقيقاً: يمكنك تدريب مهايئات مصغرة متعددة لمهام مختلفة والتبديل بينها دون إعادة تحميل النموذج بأكمله. بالنسبة لوكلاء استخدام الحاسوب، يمكنك تدريب مهايئ للتصفح الآمن وآخر للتلاعب بالملفات، مما يتيح سياسة تفصيلية.
الخاتمة
لم يعد التعلم المعزز مقتصراً على الألعاب فقط - بل هو الذي يغذي الموجة التالية من الذكاء الاصطناعي التفاعلي. توجيه البيت الأبيض القوي يطالبنا ببناء ذكاء اصطناعي مسؤول، والنمو السريع لوكلاء استخدام الحاسوب يجعل ذلك أكثر إلحاحاً وأكثر وعداً في نفس الوقت. وفي الوقت نفسه، التحكم الدقيق في الضبط الدقيق باستخدام تقنيات مثل LoRA يمكّن المطورين من تكييف النماذج بدقة وكفاءة. من خلال الجمع بين هذه الاتجاهات، يمكننا إنشاء أنظمة ذكاء اصطناعي قوية وآمنة وقابلة للتكيف - وهو بالضبط ما يتطلبه العصر القادم.
المصادر
أسئلة شائعة
عن ماذا يتحدث هذا المقال؟
يتناول هذا المقال موضوع "تعلم التعزيز يشتد، البيت الأبيض يأمر بسياسة ذكاء اصطناعي قوية، استخدام الحاسوب يكتسب زخماً، تحكم دقيق في الضبط الدقيق" ضمن تصنيف أدوات الذكاء الاصطناعي. تتزايد وتيرة التقدم في التعلم المعزز، ويصدر البيت الأبيض توجيهات بسياسة ذكاء اصطناعي قوية، ويرتفع استخدام الحواسيب بشكل كبير، وتحقق تقنيات الضبط الدقيق دقة غير مسبوقة. هذه الاتجاهات الأربعة تعيد تشكيل تطوير أدوات الذكاء الاصطناعي.
لمن يفيد هذا المقال؟
يفيد القراء المهتمين بفهم أدوات وتقنيات الذكاء الاصطناعي بطريقة عملية وواضحة.
ما الخطوة التالية؟
اقرأ المقال كاملاً، راجع المصادر المرفقة، ثم جرّب الأفكار المناسبة لاحتياجك بحذر.



