跳转至

அத்தியாயம் 7 · மாதிரி பிந்தைய பயிற்சி

முன்-பயிற்சி, SFT, RL என்ற மூன்று நிலைகளின் முழுக் கண்ணோட்டம். எப்போது SFT, எப்போது RL எனத் தேர்வு செய்வது, RLHF, வழிமுறை ஒப்பீடுகள், தரவு மற்றும் சூழல், மேலும் மாதிரி கருவி அழைப்பைக் கற்றுக்கொள்ளச் செய்தல் மற்றும் மாதிரி செயல்திறனை (sample efficiency) மேம்படுத்துதல் போன்ற எல்லை ஆராய்ச்சிகள்.

முக்கிய README க்குத் திரும்பு · 📖 அத்தியாய உரையைப் படி

துணை திட்டங்கள்

சோதனை Project Type Description
7-1, 7-2 learning-from-experience அனுபவத்திலிருந்து கற்க ஒரே treasure-hunt சூழலில் Q-learning மற்றும் LLM Agent-ஐ இயக்குகிறது.
7-8 prompt-distillation ஆசிரியர் எடுத்துக்காட்டுகளை மாணவர் prompt-ஆக distill செய்து தரம் மற்றும் செலவை ஒப்பிடுகிறது.
7-3, 7-4 MiniMind-pretrain 📖 பூஜ்ஜியத்திலிருந்து சிறிய மொழி மாதிரிகளை முன்-பயிற்றுவித்து, முன்-பயிற்சியின் முழுமையான செயல்முறையையும் முக்கிய தொழில்நுட்பங்களையும் புரிந்துகொள்ளுங்கள்.
7-5 continued-pretraining குறிப்பிட்ட களத் தரவுகளில் தொடர்ச்சியான முன்-பயிற்சியை மேற்கொண்டு, இலக்குக் களத்தில் மாதிரியின் செயல்திறனை மேம்படுத்துகிறது.
7-6 sesame Sesame CSM குரல் SFT: 1B TTS மாதிரியை LoRA முறையில் நுண்சரிவு செய்து, <laugh>, <sigh> போன்ற துணைமொழிக் குறிச்சொற்களால் வெளிப்பாட்டைக் கட்டுப்படுத்துதல்
7-6 orpheus Orpheus 3B குரல் SFT: TTS மாதிரியை LoRA முறையில் நுண்சரிவு செய்து, குறிப்பு ஒலியை இணைத்து வாக்கியங்களுக்கு இடையே ஒரே குரல் ஒலித்தன்மையுடன் குரல் நகலெடுப்பு
7-7 MultilingualReasoning பல மொழிச் சூழல்களில் மாதிரியின் பகுத்தறிவுத் திறனைப் பயிற்றுவித்து, குறுக்கு-மொழிப் பணிகளில் செயல்திறனை மேம்படுத்துகிறது.
7-9 cot-distillation OpenRouter வழியாக Claude போன்ற முன்னணி மாதிரிகளிலிருந்து CoT பாதைகளை திரட்டி, விதி சரிபார்ப்பாளரால் வடிகட்டி SFT தரவை உருவாக்குகிறது (சோதனை 7-9 துணை).
7-10 AdaptThink 📖 பகுத்தறிவு மாதிரிகள் கேள்வியின் சிரமத்திற்கு ஏற்ப பகுத்தறிவு முறையை (Thinking vs NoThinking) தகவமைப்புடன் தேர்ந்தெடுக்கக் கற்றுக்கொடுக்கிறது. கட்டுப்படுத்தப்பட்ட உகப்பாக்கம் மற்றும் முக்கியத்துவ மாதிரியெடுப்பு மூலம், பகுத்தறிவு செலவை (45-69%) பெரிதும் குறைத்த அதே வேளையில் துல்லியத்தையும் மேம்படுத்துகிறது. DeepSeek-R1-Distill-Qwen மாதிரியை அடிப்படையாகக் கொண்டு, DAPO அல்காரிதம் மூலம் பயிற்றுவிக்கப்பட்டது.
7-11 SFTvsRL/ 📖 வெவ்வேறு பணிகளில் மேற்பார்வையிடப்பட்ட நுண்-சரிப்படுத்தல் (SFT) மற்றும் வலுவூட்டல் கற்றல் (RL) ஆகியவற்றின் விளைவுகளை முறையாக ஒப்பிட்டு, இரண்டு முறைகளின் நன்மை தீமைகளையும் பொருந்தும் சூழ்நிலைகளையும் பகுப்பாய்வு செய்கிறது.
7-12 SpatialReasoning 📖 இருப்பிடம், திசை, தூரம் போன்ற இடவியல் உறவுகளை உள்ளடக்கிய கேள்விகளைக் கையாள்வதற்காக மாதிரியின் இடவியல் பகுத்தறிவுத் திறனைப் பயிற்றுவிப்பதில் கவனம் செலுத்துகிறது.
7-13 SimpleVLA-RL 📖 பார்வை, மொழி மற்றும் செயலை இணைக்கும் வலுவூட்டல் கற்றல் பயிற்சி, பார்வை உள்ளீடுகளைப் புரிந்துகொண்டு தொடர்புடைய செயல்களைச் செயல்படுத்த மாதிரியைச் செய்கிறது.
7-14 RLVP 📖 முடிவுக்கு வெகுமதியும் பாதைக்கு தண்டனையும் (RLVP) அளிக்கும் பிந்தைய பயிற்சி ஆராய்ச்சி (சோதனை 7-14 துணை); முழுமையான பயிற்சி/மதிப்பீட்டுக் குறியீடு தனித்த ஆய்வுக் கட்டுரை களஞ்சியமான 19PINE-AI/rlvp-இல் உள்ளது, நீங்களே clone செய்ய வேண்டும்
7-15 retool 📖 பல-சுற்று உரையாடல்கள் மற்றும் குறியீடு மணல் பெட்டியைப் பயன்படுத்தி பெரிய மொழி மாதிரிகளின் கணிதப் பகுத்தறிவுத் திறனை மேம்படுத்துகிறது. SFT மற்றும் RL என்ற இரண்டு-கட்டப் பயிற்சி மூலம், கணிதக் கேள்விகளைத் தீர்ப்பதற்கு உதவும் வகையில் குறியீடு செயல்படுத்தும் சூழலைப் பயன்படுத்த மாதிரி கற்றுக்கொள்கிறது. Qwen2.5-32B-Instruct ஐ அடிப்படையாகக் கொண்டு, AIME 2024 தரவுத்தொகுப்பில் பயிற்றுவிக்கப்பட்டது, DAPO அல்காரிதம் மற்றும் SandboxFusion மணல் பெட்டியைப் பயன்படுத்துகிறது.
7-16 AWorld/ · AWorld-train 📖 AWorld கட்டமைப்பின் அடிப்படையில் உடல்சார் ஏஜென்ட்டுகளைப் பயிற்றுவித்து, ஏஜென்ட்டுகள் மெய்நிகர் சூழலில் சிக்கலான பணிகளைச் செயல்படுத்தவும் அனுபவத்திலிருந்து கற்றுக்கொள்ளவும் செய்கிறது.
verl/ 📖 verl என்பது பெரிய மொழி மாதிரி RLHF பயிற்சிக்காகப் பிரத்யேகமாக வடிவமைக்கப்பட்ட திறமையான வலுவூட்டல் கற்றல் கட்டமைப்பாகும், PPO, GRPO, DAPO உட்படப் பல அல்காரிதங்களை ஆதரிக்கிறது.
Intuitor மாதிரியின் உள்ளுணர்வுப் பகுத்தறிவுத் திறனைப் பயிற்றுவித்து, விரிவான சிந்தனைச் சங்கிலி தேவையில்லாமலேயே மாதிரி விரைவாக நியாயமான தீர்ப்புகளை வழங்கச் செய்கிறது.
tinker-cookbook/ 📖 பல்வேறு மாதிரி பயிற்சிக்கான நடைமுறை நுட்பங்கள் மற்றும் சிறந்த நடைமுறைகளைத் தொகுக்கிறது.

திட்ட வகைகள்

சின்னம் வகை பொருள்
தனித்து இயங்கும் முழு குறியீடு இந்த களஞ்சியத்தில், API Key உள்ளமைத்தவுடன் இயங்கும்
📖 மறு உருவாக்க வழிகாட்டி வெளிப்புற களஞ்சியங்களை git clone செய்ய வேண்டிய விரிவான ஆவணம்
🚧 வடிவமைப்பு ஆவணம் கட்டமைப்பு/செயலாக்கத் திட்டம் மட்டும், இயங்கும் குறியீடு இன்னும் WIP