الفصل السابع · مرحلة ما بعد تدريب النموذج¶
نظرة شاملة إلى المراحل الثلاث: التدريب المسبق، والضبط الدقيق تحت الإشراف (SFT)، والتعلم المعزز (RL). ويتناول الفصل الاختيار بين SFT وRL، وRLHF، والمفاضلة بين الخوارزميات والبيانات والبيئات، وتعليم النموذج استدعاء الأدوات، وتحسين كفاءة العينات.
← العودة إلى الملف التمهيدي الرئيسي · 📖 قراءة نص الفصل
المشاريع المصاحبة¶
| التجربة | المشروع | النوع | الوصف |
|---|---|---|---|
| 7-1, 7-2 | learning-from-experience | ✅ | تشغيل Q-learning وAgent LLM في بيئة البحث عن الكنز نفسها للتعلم من الخبرة. |
| 7-8 | prompt-distillation | ✅ | يقطّر أمثلة المعلم إلى prompt للطالب ويقارن الجودة والتكلفة. |
| 7-3، 7-4 | MiniMind-pretrain | 📖 | التدريب المسبق لنموذج لغة صغير من البداية لفهم عملية التدريب المسبق الكاملة والتقنيات الأساسية. |
| 7-5 | تابع التدريب المسبق | ✅ | ينفذ تدريبًا مسبقًا مستمرًا على البيانات الخاصة بالمجال لتحسين أداء النموذج في المجال المستهدف. |
| 7-6 | السمسم | ✅ | خطاب Sesame CSM SFT: ضبط LoRA لنموذج 1B TTS، والتحكم في التعبير باستخدام العلامات غير اللغوية مثل <laugh> و<sigh> |
| 7-6 | أورفيوس | ✅ | خطاب Orpheus 3B SFT: ضبط LoRA الدقيق لنموذج TTS، واستنساخ الصوت عبر الصوت المرجعي من أجل تناسق الصوت عبر الجمل |
| 7-7 | استدلال متعدد اللغات | ✅ | يدرب القدرة الاستدلالية للنماذج في بيئات متعددة اللغات، مما يحسن الأداء في المهام متعددة اللغات. |
| 7-9 | التقطير في المهد | ✅ | يقطر مسارات CoT من النماذج الحدودية مثل Claude عبر OpenRouter؛ تم التحقق من القاعدة وتحويلها إلى بيانات SFT (مصاحب للتجربة 7-9). |
| 7-10 | أدابت ثينك | 📖 | يعلم نماذج الاستدلال كيفية اختيار وضع الاستدلال الخاص بهم بشكل تكيفي (التفكير مقابل عدم التفكير) بناءً على صعوبة المشكلة. من خلال التحسين المقيد وأخذ العينات المهمة، فإنه يقلل بشكل كبير من تكاليف الاستدلال (45-69%) مع تحسين الدقة. استنادًا إلى نموذج DeepSeek-R1-Distill-Qwen، والذي تم تدريبه باستخدام خوارزمية DAPO. |
| 7-11 | SFTvsRL/ |
📖 | يقارن بشكل منهجي فعالية الضبط الدقيق الخاضع للإشراف (SFT) والتعلم المعزز (RL) في المهام المختلفة، ويحلل نقاط القوة والضعف وسيناريوهات التطبيق المناسبة لكلتا الطريقتين. |
| 7-12 | الاستدلال المكاني | 📖 | يركز على تدريب قدرة النماذج على التفكير المكاني للتعامل مع المشكلات التي تتضمن العلاقات المكانية مثل الموضع والاتجاه والمسافة. |
| 7-13 | بسيطVLA-RL | 📖 | يجمع بين الرؤية واللغة والعمل في التدريب على التعلم المعزز، مما يمكّن النماذج من فهم المدخلات المرئية وتنفيذ الإجراءات المقابلة. |
| 7-14 | RLVP | 📖 | بحث ما بعد التدريب لـ RLVP - مكافأة النتيجة، ومعاقبة المسار (مصاحب للتجربة 7-14)؛ يوجد رمز التدريب/التقييم الكامل في مستودع الورق المنفصل 19PINE-AI/rlvp، والذي تحتاج إلى استنساخه بنفسك. |
| 7-15 | إعادة أداة | 📖 | يستخدم حوارًا متعدد المنعطفات وصندوق حماية الشفرة لتعزيز قدرة التفكير الرياضي لنماذج اللغات الكبيرة. ومن خلال عملية التدريب المكونة من مرحلتين SFT وRL، يتعلم النموذج كيفية استخدام بيئة تنفيذ الشفرة للمساعدة في حل المشكلات الرياضية. استنادًا إلى Qwen2.5-32B-Instruct، الذي تم تدريبه على مجموعة بيانات AIME 2024، باستخدام خوارزمية DAPO ووضع الحماية SandboxFusion. |
| 7-16 | AWorld/ · تدريب AWorld |
📖 | يدرّب الوكلاء المتجسدين باستخدام إطار AWorld، بما يمكّنهم من أداء مهام معقدة في بيئة افتراضية والتعلم من الخبرة. |
| — | verl/ |
📖 | verl هو إطار تعليمي معزز فعال مصمم خصيصًا لتدريب نماذج اللغات الكبيرة RLHF، ويدعم خوارزميات مختلفة مثل PPO وGRPO وDAPO. |
| — | الحدس | ✅ | يدرب قدرة النماذج على التفكير البديهي، مما يمكنها من إصدار أحكام سريعة ومعقولة دون الحاجة إلى سلاسل تفكير مفصلة. |
| — | tinker-cookbook/ |
📖 | يجمع العديد من النصائح العملية وأفضل الممارسات للتدريب النموذجي. |
أنواع المشاريع¶
| الأيقونة | النوع | المعنى |
|---|---|---|
| ✅ | مستقل | شفرة كاملة قابلة للتشغيل في هذا المستودع بعد إعداد مفتاح API |
| 📖 | دليل إعادة الإنتاج | وثائق تفصيلية تعتمد على مستودع خارجي يُجلب باستخدام git clone |
| 🚧 | وثيقة التصميم | وثيقة تصميم وخطة تنفيذ؛ أما الشفرة القابلة للتشغيل فما تزال قيد التطوير |