跳转至

ஏஜெண்ட் சுய-பரிணாமம்

முந்தைய அத்தியாயங்கள் ஏஜெண்டின் திறன் அமைப்பை வெவ்வேறு பரிமாணங்களில் இருந்து உருவாக்கின. சூழல் பொறியியல் பற்றிய அத்தியாயம் 2 தகவல் மேலாண்மைக்கான அடித்தளத்தை அமைத்தது (திறன்கள் வழிமுறை மூலம் தேவைக்கேற்ப ஏற்றுதல் உட்பட); அத்தியாயம் 3 அறிவுத் தளங்கள் மற்றும் பயனர் நினைவகம் பற்றி குறுக்கு-அமர்வு அறிவு நிலைத்தன்மையை அடைந்தது; அத்தியாயம் 5 ஒரு குறியீட்டு ஏஜெண்ட் கோப்பு முறைமை மூலம் அனுபவத்தை எவ்வாறு குவிக்க முடியும் என்பதை நிரூபித்தது; மற்றும் வலுவூட்டல் கற்றல் பிந்தைய பயிற்சி பற்றிய அத்தியாயம் 7 மூலோபாயங்களை மாதிரி அளவுருக்களில் உறுதிப்படுத்தியது. இந்த நுட்பங்கள் ஒவ்வொன்றும் அதன் சொந்த கவனம் கொண்டவை, ஆனால் அவை அனைத்தும் ஒரே கேள்வியை சுட்டிக்காட்டுகின்றன: ஒரு ஏஜெண்ட் எவ்வாறு தொடர்ந்து மேம்பட முடியும்?

மிகவும் மேம்பட்ட மாதிரிகள் கூட, ஒரு குறிப்பிட்ட நிறுவனத்தின் பணத்தைத் திரும்பப் பெறும் செயல்முறை, ஒரு குறிப்பிட்ட கேரியரின் விற்பனை ஸ்கிரிப்ட் அல்லது ஒரு தெளிவற்ற API இன் அழைப்பு மரபு ஆகியவற்றை எதிர்கொள்ளும்போது, முதல் நாளில் ஒரு புதிய பணியாளரைப் போலவே அறியாமையுடன் இருக்கும். மாதிரி எடைகளை மாற்றியமைக்க மிகப்பெரிய அளவிலான தரவு மற்றும் கணக்கீடு தேவைப்படுகிறது, புதுப்பிப்பு சுழற்சிகள் வாரங்களில் அளவிடப்படுகின்றன; இதற்கிடையில், நிஜ உலகில், புதிய APIகள் செயல்பாட்டுக்கு வருகின்றன, பழைய சேவைகள் நிறுத்தப்படுகின்றன, மற்றும் பயனர் தேவைகள் தொடர்ந்து மாறிக்கொண்டே இருக்கின்றன. ஒரு ஏஜெண்டுக்கு இலகுவான, உடனடியான பரிணாம வழிமுறை தேவை—மாதிரி அளவுருக்களை மாற்றாமல் அதன் சொந்த திறன் எல்லைகளை தொடர்ந்து விரிவுபடுத்தக்கூடிய ஒன்று.

இந்த அத்தியாயம் அந்த வழிமுறையை ஆராய்கிறது: ஏஜெண்ட் சுய-பரிணாமம். சுய-பரிணாமம் என்பது வெளிப்புறமயமாக்கப்பட்ட கற்றல் ஆகும், இது இரண்டு பரிமாணங்களை உள்ளடக்கியது—அனுபவத்திலிருந்து அறிவை வடிகட்டுதல், மற்றும் புதிய கருவிகளை முனைப்புடன் கண்டுபிடித்து உருவாக்குதல். மைய யோசனை அறிவு மற்றும் செயல்முறைகளை மாதிரி அளவுருக்கள் மற்றும் நிலையற்ற சூழலில் இருந்து பிரித்து, அவற்றை நிலையான, மீட்டெடுக்கக்கூடிய மற்றும் மீண்டும் பயன்படுத்தக்கூடிய வெளிப்புற வளங்களாக—கருவி நூலகங்கள் மற்றும் அறிவுத் தளங்களாக—வெளிப்புறமயமாக்குவதாகும். இது பிந்தைய பயிற்சிக்கு மாற்றாக அல்ல, ஆனால் ஒரு நிரப்பியாகும்: பிந்தைய பயிற்சி "மாதிரியை எவ்வாறு புத்திசாலியாக்குவது" என்பதைக் கையாள்கிறது, அதே நேரத்தில் சுய-பரிணாமம் "ஏஜெண்டை எவ்வாறு மேலும் திறமையானதாக்குவது" என்பதைக் கையாள்கிறது.

ஏஜெண்டுகள் ஏன் தானாக கற்றுக்கொள்வதில்லை

முந்தைய பகுதி நிஜ உலகத் தேவைகளைப் பற்றி விவாதித்தது. ஆனால் ஒரு அடிப்படையான கேள்வி உள்ளது: சூழல் சாளரம் முடிவில்லாமல் நீளமாக இருக்க முடிந்தால், மற்றும் ஒரு ஏஜெண்ட் இதுவரை அனுபவித்த அனைத்து உரையாடல்கள் மற்றும் கருவி அழைப்பு முடிவுகளையும் அதில் நிரப்பினால், அது தானாகவே எல்லாவற்றையும் கற்றுக்கொள்ளுமா?

பதில் இல்லை, மற்றும் காரணம் அத்தியாயம் 2 இல் விவாதிக்கப்பட்ட கவன வழிமுறையில் உள்ளது. இது இந்த அத்தியாயத்தின் கோட்பாட்டு தொடக்கப் புள்ளியாகும், மேலும் பல அத்தியாயங்களுக்குப் பிறகு, ஒரு சுருக்கமான மறுபார்வை மதிப்புக்குரியது. அத்தியாயம் 2 மீண்டும் மீண்டும் வலியுறுத்தியது: சூழல்-உள்ள கற்றலின் உள் வழிமுறை, பகுத்தறிவை விட மீட்டெடுப்பைப் போன்றது. கவனம் "தேடுவதில்" சிறந்து விளங்குகிறது—"37வது கூண்டில் எந்தப் பூனை உள்ளது?" என்பது ஒரே தேடலில் கிடைக்கும் நேரடி விடை; ஆனால் ஒரு ஒற்றை முன்னோக்கி செல்லும் பாஸில் "தொகுத்தறி புள்ளியியல்" செய்வதில் சிறந்ததல்ல—"100 கூண்டுகளில் எத்தனை கருப்பு பூனைகள் உள்ளன?" பிந்தையதற்கு அனைத்து பதிவுகளையும் கடந்து சென்று எண்ணும் நிலையைப் பராமரிக்க வேண்டும், இது அடிப்படையில் சிந்தனை, மீட்டெடுப்பு அல்ல. வேறு வார்த்தைகளில் சொன்னால், நீங்கள் மூல அனுபவத்தை சூழலில் கொட்டினால், மாதிரி அதை "நினைவில் வைத்துக் கொள்ளும்", ஆனால் அது தானாகவே மீண்டும் பயன்படுத்தக்கூடிய வடிவங்களாக "வடிகட்டப்படாது". சூழல் உண்மையிலேயே முடிவில்லாததாக இருந்தாலும், இந்த இடைவெளி இன்னும் இருக்கும்: தகவல் உள்ளது, ஆனால் "குறிப்பிட்ட பதிவுகளில்" இருந்து "பொதுவான வடிவங்களுக்கு" சுருக்கப் படியை யாரும் மாதிரிக்காகச் செய்யவில்லை. மேலும், அத்தியாயம் 2 இன் "சூழல் சிதைவு" வெளிப்படுத்தியது போல, சூழல் நீளமாகவும், அதில் அதிக சத்தம் இருந்தாலும், கவனம் மேலும் நீர்த்துப்போகிறது, முக்கிய தகவலை மீட்டெடுப்பது கடினமாகிறது—முடிவில்லாத சூழல் தானியங்கி கற்றலைக் கொண்டுவராது; அது மீட்டெடுப்பின் தரத்தை தொடர்ந்து குறைக்கிறது. கார்பதியின் நுண்ணறிவை எதிர்மாறாகப் படிக்கலாம்: மாதிரியின் "மோசமான நினைவாற்றல்" ஒரு அம்சம், பிழை அல்ல; இது நம்மை செயல்பாட்டுடன் மற்றும் வெளிப்படையாக அறிவு வடிகட்டலைச் செய்ய கட்டாயப்படுத்துகிறது, மாதிரி நீண்ட வரலாறுகளிலிருந்து தானாகவே வடிவங்களைக் கண்டுபிடிக்கும் என்று எதிர்பார்ப்பதற்குப் பதிலாக. சுருக்கமாக: கற்றல் தானாக நடக்காது; அது வெளிப்படையாக வடிவமைக்கப்பட வேண்டும்—இதுவே இந்த அத்தியாயம் இருப்பதற்கான காரணம்.

மேலும் "வெளிப்படையாக வடிவமைக்கப்பட்ட கற்றல்" அத்தியாயம் 8 இல் மட்டும் தோன்றவில்லை. முந்தைய அத்தியாயங்கள் ஏற்கனவே பல அடித்தளங்களை அமைத்துள்ளன, இருப்பினும் அவற்றில் பெரும்பாலானவை ஒற்றை அமர்வுக்குள் அல்லது அருகிலுள்ள அமர்வுகளுக்கு இடையே உடனடித் தேவைகளைப் பூர்த்தி செய்கின்றன: அத்தியாயம் 2 இன் சூழல் சுருக்கம், இது கூடுதல் LLM அழைப்பைப் பயன்படுத்தி, பெருத்த மூலப் பதிவுகளை கணக்கிடப்பட்ட முடிவுகளுடன் "மாற்றி", கவனத்தின் காணாமல் போன "வடிகட்டல்" பகுதியை ஈடுசெய்கிறது; அத்தியாயம் 2 இன் ஏஜெண்ட் நிலைப் பட்டை, இது குறியீடு மூலம் சூழலில் முக்கிய முடிவுகளை உறுதியாகப் பராமரிக்கிறது, இது அதே நாணயத்தின் மறுபக்கம்; அத்தியாயம் 3 இன் பயனர் நினைவகம் ஏற்கனவே "கற்றலை" அமர்வுகளுக்கு இடையே தள்ளியுள்ளது—ஏஜெண்ட் பல உரையாடல்களில் பயனரைப் பற்றிய புரிதலைக் குவித்து, ஆஃப்லைன் ஒழுங்கமைப்பு மூலம் மிகவும் துல்லியமாகிறது.

அத்தியாயம் 3 இல் உள்ள பயனர் நினைவகம் தானே ஒரு வகை கற்றல், ஆனால் அது வடிகட்டுவது "பயனர் யார்" என்பதைப் பற்றிய தகவலை (விருப்பங்கள், உண்மைகள், பழக்கங்கள்). அத்தியாயம் 8 மற்ற, நீண்ட கால பாதியை நிரப்புவதை நோக்கமாகக் கொண்டுள்ளது: சிக்கல்-தீர்வு உத்திகள், செயல்பாட்டு நடைமுறைகள், தோல்வி பாடங்கள் மற்றும் ஆய்வின் போது கண்டுபிடிக்கப்பட்ட முற்றிலும் புதிய கருவிகள் ஆகியவற்றை நிலையான, மீட்டெடுக்கக்கூடிய மற்றும் மீண்டும் பயன்படுத்தக்கூடிய திறன்களாக வடிகட்டுதல், இதனால் ஏஜெண்ட் "அதிகமாக நினைவில் வைத்திருப்பது" மட்டுமல்லாமல், "அதிக திறன் பெறுவதாக" மாறுகிறது. இந்த வகை கற்றல் மிகவும் நீண்ட காலமானது மற்றும் ஏஜெண்ட் அதை தானே முனைந்து தொடங்க வேண்டும், எனவே இது ஒரு தனி அத்தியாயத்திற்குத் தகுதியானது—கீழே ஒரு மேக்ரோ-நிலை நிலைப்பாட்டுடன் தொடங்குகிறது.

மூன்று கற்றல் முன்னுதாரணங்கள் மற்றும் சுய-பரிணாமத்தின் நிலைப்பாடு

அத்தியாயம் 1 (படம் 1-1) இல் அறிமுகப்படுத்தப்பட்ட மூன்று முன்னுதாரணங்கள் இங்கு நிலைப்படுத்தல் ஒப்பீட்டிற்கு மட்டுமே பயன்படுத்தப்படுகின்றன. Post-training மாதிரி எடைகளை மாற்றியமைத்து, RL மூலம் "அனுபவத்தை" "தசை நினைவகமாக" உறுதிப்படுத்துகிறது, இது அதிக வெற்றி விகிதங்களையும் குறைந்த தாமதத்தையும் வழங்குகிறது, ஆனால் அதிக புதுப்பிப்பு செலவுகள் மற்றும் நீண்ட சுழற்சிகளைக் கொண்டுள்ளது (அத்தியாயம் 7 இல் விரிவாக); In-Context Learning (ICL) தற்காலிக தழுவலுக்காக prompt இல் விளக்க எடுத்துக்காட்டுகளை வழங்குகிறது, குறைந்த செலவு மற்றும் விரைவான முடிவுகளுடன், ஆனால் அமர்வு முடிவடையும் போது அது மறைந்துவிடும் (அத்தியாயங்கள் 1 மற்றும் 2 ஐப் பார்க்கவும்); Externalized Learning என்பது டெவலப்பர்களால் எளிதில் கவனிக்கப்படாத பாதையாகும்—மாதிரிக்கு வெளியே கோப்புகள், அறிவுத் தளங்கள் மற்றும் கருவிகளில் அறிவை வடிகட்டுதல், இது நிரந்தரமானது, விளக்கக்கூடியது மற்றும் எந்த நேரத்திலும் மாற்றியமைக்கக்கூடியது. இவை மூன்றும் போட்டியிடும் அல்ல, ஒருங்கிணைந்தவை: உண்மை சார்ந்த அறிவு RAG (அத்தியாயம் 3 ஐப் பார்க்கவும்) மற்றும் வெளிப்புற சேமிப்பிற்குச் செல்கிறது, நிலையான நடத்தைகள் மற்றும் வடிவங்கள் post-training மூலம் உறுதிப்படுத்தப்படுகின்றன, மேலும் தற்போதைய நிலையற்ற தகவல்கள் in-context learning மூலம் கையாளப்படுகின்றன.

இந்த அத்தியாயம் மாதிரி எடைகளை மாற்றாத பாதையில் கவனம் செலுத்துகிறது—externalized learning, இது அத்தியாயத்தின் தொடக்கத்தில் குறிப்பிடப்பட்ட இரண்டு பரிமாணங்களுக்கு ஒத்திருக்கிறது: அனுபவத்தை அறிவு மற்றும் திறன்களாக (Skills) வெளிப்படுத்துதல், மற்றும் திறன்களை கருவிகளாக (tools) வெளிப்படுத்துதல். (இது அத்தியாயம் 5 இன் "குறியீடு குறியீட்டை உருவாக்குதல்: ஏஜெண்ட் பூட்ஸ்ட்ராப்பிங்" என்பதிலிருந்து வேறுபடுத்தப்பட வேண்டும், இது ஏஜெண்டுகள் தங்களைப் போன்ற அமைப்புகளை உருவாக்குவது பற்றியது; இந்த அத்தியாயம் எடைகளை மாற்றாமல் திறன் வளர்ச்சி பற்றியது. அத்தியாயம் 3 அறிவுத் தளங்களை "எவ்வாறு சேமிப்பது மற்றும் மீட்டெடுப்பது" என்பதைத் தீர்க்கிறது; இந்த அத்தியாயம் "யார் நிரப்பி புதுப்பிக்கிறது" என்பதைத் தீர்க்கிறது—ஏஜெண்ட் எவ்வாறு முனைப்புடன் அனுபவத்தைக் குவிக்கிறது என்பது.)

இது ஏன் தேவைப்படுகிறது? ஒரு எதிர்மறை சூழ்நிலையைக் கவனியுங்கள். ஒரு வாடிக்கையாளர் சேவை Agent ஒரு குறிப்பிட்ட வங்கியின் பணத்தைத் திரும்பப்பெறும் செயல்முறையை முதல் முறையாகக் கையாள்கிறது என்று வைத்துக்கொள்வோம்: 15 நிமிட ஆய்வுக்குப் பிறகு—3 தொலைபேசி அழைப்புகள் செய்து, 2 வெவ்வேறு ஸ்கிரிப்ட்களை முயற்சித்து—இறுதியில் வெற்றி பெறுகிறது. அதற்கு வெளிப்புறமயமாக்கப்பட்ட கற்றல் திறன் இல்லையென்றால், அடுத்த முறை அதே கோரிக்கையை எதிர்கொள்ளும்போது, அது மீண்டும் 15 நிமிடங்கள் செலவழித்து அதே ஆய்வை புதிதாக மேற்கொள்ள வேண்டியிருக்கும்; இந்த அமர்வில் திரட்டப்பட்ட அனுபவம் அது முடிவடையும் போது இழக்கப்படும். முக்கிய வார்த்தை "தன்னாட்சி" (autonomous): இது ஒரு மனித பொறியாளர் Agent க்காக ஆவணங்களைத் தயாரிப்பது அல்ல, மாறாக Agent தானே அனுபவத்தைச் சுருக்கி, கருவிகளை உருவாக்கி, பணிகளை முடிக்கும்போதே அறிவுத் தளத்தைப் புதுப்பிப்பது—ஒரு அனுபவமுள்ள வாடிக்கையாளர் சேவை பிரதிநிதி சிதறிய பணத்தைத் திரும்பப்பெறும் விதிகளை ஒரு கையேடாக ஒழுங்குபடுத்தி, எந்த நேரத்திலும் ஆலோசிக்கக்கூடியதாகவும், புதிய சூழ்நிலைகளின் அடிப்படையில் தன்னாட்சியாகப் புதுப்பிக்கக்கூடியதாகவும் மாற்றுவதைப் போன்றது. மைய தத்துவம் இதுதான்: மாதிரி எல்லாவற்றையும் நினைவில் வைத்திருக்கும் என்று எதிர்பார்ப்பதற்குப் பதிலாக, பணி முடிந்த பிறகு கூடுதல் கணக்கீட்டைப் பயன்படுத்தி அனுபவத்தைச் சுருக்கி, சுருக்கி, கட்டமைத்து, பின்னர் அதை ஒரு நிலையான, மீட்டெடுக்கக்கூடிய வெளிப்புற அமைப்பில் சேமிக்கவும். அளவுரு கற்றலுடன் ஒப்பிடும்போது, இந்த முறை விளக்கக்கூடிய, சரிபார்க்கக்கூடிய மற்றும் மாற்றியமைக்கக்கூடிய அறிவை விலையுயர்ந்த பயிற்சி இல்லாமல் விரைவாக வடிகட்ட முடியும்; சூழல் கற்றலுடன் ஒப்பிடும்போது, இது செயலில் வடிகட்டுதல் மற்றும் கட்டமைக்கப்பட்ட ஒழுங்கமைப்பு மூலம் பரந்த அளவிலான மூலத் தகவல்களிலிருந்து திறமையற்ற மீட்டெடுப்பைத் தவிர்த்து, குறுக்கு-அமர்வு நிலைத்தன்மையை அடைகிறது.

படம் 8-1: வெளிப்புறமயமாக்கப்பட்ட கற்றல் சுழற்சி

மிக முக்கியமாக, வெளிப்புறமயமாக்கப்பட்ட கற்றல் Agent இன் கற்றல் திறனை "தகவலை நினைவில் வைத்திருப்பதில்" இருந்து "திறன்களை உருவாக்குவதற்கு" உயர்த்துகிறது: இது அனுபவத்தை பொது அறிவாகச் சுருக்கி, எதிர்கால மீட்டெடுப்புக்காக அறிவுத் தளத்தில் சேமிக்க முடியும் (அத்தியாயம் 3 இன் RAG பிரிவில் அறிமுகப்படுத்தப்பட்ட RAPTOR மர அடிப்படையிலான சுருக்கமும் அனுபவத்தின் அடுக்கு-அடுக்கு வடிகட்டலுக்குப் பொருந்தும்—குறிப்பிட்ட செயல்பாட்டுப் பதிவுகளிலிருந்து விதிகளுக்கும், பின்னர் கொள்கைகளுக்கும்), மேலும் மீண்டும் மீண்டும் வரும் செயல்பாட்டு நடைமுறைகளை துல்லியமாக இயக்கக்கூடிய கருவிகளாக உள்ளடக்கி, தொடர்ந்து வளரும் திறன் நூலகத்தை உருவாக்க முடியும். உதாரணமாக, ஒரு வாடிக்கையாளர் சேவை Agent ஒரு வாடிக்கையாளருக்கு பணத்தைத் திரும்பப்பெற உதவும்போது, அது மூன்று வெவ்வேறு வகையான விஷயங்களைக் கற்றுக்கொள்ளலாம். முதலாவது ஒரு குறிப்பிட்ட விதி—"A நிறுவனத்தின் பணத்தைத் திரும்பப்பெற கிரெடிட் கார்டின் கடைசி நான்கு இலக்கங்களைச் சரிபார்க்க வேண்டும்"—இது உண்மை அறிவு, அறிவுத் தளத்தில் சேமிக்கப்படுகிறது; இரண்டாவது ஒரு பொதுவான கருவி—"ஆர்டர் நிலையைத் தானாக விசாரிக்க X API ஐப் பயன்படுத்தவும்"—இது ஒரு நிலையான, மீண்டும் பயன்படுத்தக்கூடிய செயல்பாட்டு வரிசை, இது ஒரு குறியீட்டு கருவியாக வடிகட்டப்படுவது சிறந்தது; மூன்றாவது ஒரு வேலை கையேடு—"பணத்தைத் திரும்பப்பெறும் செயல்முறைக்கான முழுமையான Skill"—இது மூலோபாய தீர்ப்பு மற்றும் அடிக்கடி மாறும் வணிக விதிகளை உள்ளடக்கியது, இது ஒரு Skill ஆவணத்திற்கு மிகவும் பொருத்தமானது. அட்டவணை 8-1 இந்த வெளிப்புறமயமாக்கப்பட்ட கற்றலின் மூன்று விளைபொருட்களைச் சுருக்கமாகக் கூறுகிறது.

அட்டவணை 8-1 வெளிப்புறமயமாக்கப்பட்ட கற்றலின் மூன்று விளைபொருட்கள்

விளைபொருள் வடிவம் உள்ளடக்கம் உதாரணம் பயன்பாட்டு முறை
அறிவுத் தள உள்ளீடு உண்மைகள் மற்றும் விதிகள் "இந்த வங்கிக்குக் கணக்கு தொடங்கிய கிளையின் முகவரி தேவை" சொற்பொருள் தேடல் அல்லது grep துல்லிய மீட்டெடுப்பு
அர்ப்பணிக்கப்பட்ட குறியீட்டு கருவி மீண்டும் செய்யக்கூடிய செயல்பாட்டு நடைமுறைகள் "கணக்கு இருப்பை வினவுவதற்கான API அழைப்பு வரிசை" குறியீடாக உறுதிப்படுத்தப்பட்டு, அளவுருக்கள் மூலம் அழைக்கப்படுகிறது
திறன் ஆவணம் சிக்கலான ஆனால் அடிக்கடி மாறும் பணி உத்திகள் "காப்பீட்டு கோரிக்கைகளை கையாள்வதற்கான சிறந்த நடைமுறைகள்" இயற்கை மொழி ஆவணம், தேவைக்கேற்ப ஏற்றப்படுகிறது

எந்த வடிவத்தைப் பயன்படுத்த வேண்டும் என்பதைத் தீர்மானிக்க ஒரு எளிய கட்டைவிரல் விதி உள்ளது: முற்றிலும் உண்மைத் தகவல்களை அறிவுத் தளத்தில் சேமிக்கவும்; அடிக்கடி பயன்படுத்தப்படும், அளவுரு நிறைந்த நடைமுறைகளை குறியீடாக (கருவிகள்) எழுதவும்; மற்றும் அடிக்கடி மாறும், உத்தி சார்ந்த செயல்முறைகளை ஆவணங்களாக (திறன்கள்) எழுதவும். கடைசி இரண்டும் "கருவி உருவாக்கம்" என்பதன் கீழ் வருகின்றன—இது வெளிப்புறமயமாக்கப்பட்ட கற்றலின் உயர்-வரிசை வடிவமாகும், இது "அறிவை" மட்டுமல்ல, "செயல்முறைகளையும்" குறியீடாக வெளிப்புறமயமாக்குகிறது, "ஒவ்வொரு முறையும் மறுசிந்திப்பதில்" இருந்து "ஒருமுறை உருவாக்கு, பல முறை பயன்படுத்து" என்பதற்கு மாறுகிறது—இது ஒரு சேவையகத்தை முதல் முறையாக கைமுறையாக நிறுவிய பின் ஒரு தானியக்க ஸ்கிரிப்டை எழுதுவதைப் போன்றது. அர்ப்பணிக்கப்பட்ட கருவிகள் மற்றும் திறன்களுக்கு இடையே தேர்ந்தெடுப்பதற்கான கட்டமைப்பை அத்தியாயம் 4 ஏற்கனவே விரிவாக விவாதித்துள்ளது.

கசப்பான பாடத்திற்கு அத்தியாயம் 1 தந்த நிலைப்பாடு—திசையை ஏற்றுக்கொள், வேகத்தில் நடைமுறைவாதியாக இரு—வெளிப்புறமயமாக்கப்பட்ட கற்றலில் மிக முழுமையாக வெளிப்படுகிறது. எல்லா அறிவையும் அளவுருக்களுக்குள் சுருக்குவதுமில்லை, செயல்முறைகளை if-else விதிகளாக உறையச் செய்வதுமில்லை; மாறாக ஏஜெண்ட் தானாகவே வெளிப்புற அறிவு மற்றும் கருவி சூழலமைப்பை உருவாக்கி, திறன் விரிவாக்கத்தின் தர்க்கத்தை மாதிரிக்குள் (அளவுரு அளவு) இருந்து வெளிப்புற உலகிற்கு (கருவிகள் மற்றும் அறிவுத் தளங்களின் அளவு) நீட்டிக்கிறது. அறிவு வாகனத்தின் (knowledge carrier) தேர்வும் இதே தர்க்கத்தைப் பின்பற்றுகிறது: இந்த அத்தியாயத்தில் விவாதிக்கப்படும் நினைவகங்களும் திறன்களும் பெரும்பாலும் Markdown கோப்புகளாகவும் கோப்பு முறைமையாகவும் தங்குகின்றன, கைமுறையாக வடிவமைக்கப்பட்ட அறிவு வரைபடத்தை (knowledge graph) நம்புவதில்லை—பிந்தையது சிறப்புக் களங்களில் மிகத் துல்லியமானது, ஆனால் இயற்கை மொழியே மாதிரிகள் மிகச் சிறப்பாகக் கையாளும் வடிவம்; அதன் மேல் LLM சுருக்கமும் ஒழுங்கமைப்பும் செய்யும்போது, மனித முன்னறிவுக் கட்டமைப்பைச் சாராத, மாதிரி திறனுடன் விரிவாக்கமடையும் பொதுவான பாதை அதுவாகும். நிச்சயமாக, வெளிப்புறமயமாக்கப்பட்ட கற்றலும்—எந்த வடிவில் சேமிப்பது, குறியீட்டை எவ்வாறு ஒழுங்கமைப்பது, எப்போது வடிகட்டுவது—பொறியியல் வடிவமைப்பு தேவை; இதுவே "வேகத்தில் நடைமுறைவாதம்" என்பதன் பொருள்.

ஏஜெண்டுகள் ஏன் அனுபவத்திலிருந்து கற்றுக்கொள்ள வேண்டும்: "புத்திசாலி"யிலிருந்து "திறமையானவர்" வரை

சிதறிய விதிகளை ஒரு கையேடாக ஒழுங்கமைத்த "அனுபவம் வாய்ந்த வாடிக்கையாளர் சேவை பிரதிநிதி", "புத்திசாலி"யிலிருந்து "திறமையானவர்" வரையிலான முக்கிய மாற்றத்தை எடுத்துக்காட்டுகிறார்: இடைவெளி பெரும்பாலும் மாதிரி போதுமான புத்திசாலித்தனமாக இல்லாததால் அல்ல, மாறாக பல வணிக செயல்முறைகள் மற்றும் கள அறிவு மாறும் தன்மை கொண்டவை, பொதுவில் இல்லாதவை, மற்றும் அடிப்படை மாதிரியின் பொதுவான திறன்களை மேம்படுத்துவதன் மூலம் மட்டும் தீர்க்க முடியாதவை—இவை "அனுபவத்தை" சார்ந்த பிரச்சினைகள். ஒரு ஏஜெண்ட் அனுபவத்திலிருந்து கற்றுக்கொள்வது இந்த வகை அறிவுதான்: ஒரு குறிப்பிட்ட சேவையை ரத்து செய்ய, பயனற்ற தொலைபேசி அழைப்பு அல்ல, ஒரு குறிப்பிட்ட படிவத்தை நிரப்ப வேண்டும் என்பது; ஒரு குறிப்பிட்ட விளம்பரத்திற்கான தகுதி நிபந்தனைகளை சுருக்கமாகக் கூறுதல் (எ.கா., முன்னாள் படைவீரர்கள் அல்லது இரண்டு ஆண்டுகளுக்கும் மேலான சேவைக் காலம் கொண்ட வாடிக்கையாளர்கள்); ஒரு குறிப்பிட்ட பிராந்தியத்தில் ஒரு குறிப்பிட்ட கேரியரின் பிராட்பேண்ட் மேற்கோளில் பேச்சுவார்த்தைக்கு இடம் உள்ளதா என்பதை தீர்மானித்தல். இதேபோல், ஒரு குறியீட்டு ஏஜெண்ட் ஒரு திட்டத்தின் தனித்துவமான குறியீட்டு மரபுகள் மற்றும் பயன்பாட்டு செயல்முறைகளை அறியாது, மேலும் ஒரு உலாவி ஏஜெண்ட் ஒரு குறிப்பிட்ட வலைத்தளத்தின் எதிர்ப்பு-ஸ்கிராப்பிங் உத்திகள் அல்லது தளவமைப்பு மாற்றங்களை அறியாது—இவை அனைத்தும் முன்-பயிற்சி தரவுகளில் இல்லாத நிகழ்நேர கள அறிவு.

அனுபவத்திலிருந்து கற்றல்

"ஏன்" என்பதைப் புரிந்துகொண்ட பிறகு, அடுத்த கேள்வி "எப்படி" என்பதாகும். வெளிப்புறமயமாக்கப்பட்ட கற்றலின் பொறியியல் நடைமுறையானது "வெற்றிகரமான அனுபவங்களைப் பதிவுசெய்து மீண்டும் பயன்படுத்துதல்" என்பதிலிருந்து தொடங்குகிறது. பின்வரும் இரண்டு சோதனைகள் அனுபவக் குவிப்புக்கான இரண்டு நிரப்பு அணுகுமுறைகளை நிரூபிக்கின்றன: ஒன்று உயர்-நிலை உத்திகளை மீட்டெடுக்கக்கூடிய அறிவுச் சுருக்கங்களாக (சிக்கல்-தீர்வு குறிப்புகள் போன்றவை) வடிகட்டுகிறது, மற்றொன்று குறிப்பிட்ட செயல்பாட்டு வரிசைகளை மீண்டும் இயக்கக்கூடிய தானியக்க கருவிகளாக (செயல்பாட்டு பதிவுகள் போன்றவை) உறுதிப்படுத்துகிறது. அட்டவணை 8-2, அனுபவக் கற்றல் வழிமுறைகளை அடுக்கு வாரியாக வகைப்படுத்தி, அறிவு வடிகட்டுதல், அறிவு ஒழுங்கமைப்பு, அறிவு பயன்பாடு மற்றும் பொறியியல் ஆதரவு ஆகியவற்றுக்கு இடையேயான உறவுகளை வாசகர்கள் புரிந்துகொள்ள உதவுகிறது.

அட்டவணை 8-2 ஏஜெண்ட் அனுபவக் கற்றல் வழிமுறைகளின் அடுக்குகள்

அடுக்கு வழிமுறை தீர்க்கப்பட்ட பிரச்சனை
அறிவு வடிகட்டுதல் உத்தி சுருக்கம், பணிப்பாய்வு பதிவு, தோல்வி பிரதிபலிப்பு வெற்றிகரமான மற்றும் தோல்வியுற்ற அனுபவங்களிலிருந்து மீண்டும் பயன்படுத்தக்கூடிய அறிவைப் பிரித்தெடுத்தல்
அறிவு ஒழுங்கமைப்பு திறன்கள், தூக்க ஒருங்கிணைப்பு சேமிப்பிற்காக அறிவை கட்டமைத்து அட்டவணைப்படுத்துதல்
அறிவு பயன்பாடு சிஸ்டம் ப்ராம்ப்ட் மேம்படுத்தல் ஏஜெண்ட்டின் நடத்தை முறையில் அறிவை செலுத்துதல்
பொறியியல் ஆதரவு குறுக்கு-அமர்வு தொடர்ச்சி நீண்ட பணிகளை நிலையாக செயல்படுத்த உதவுதல்

இந்த நான்கு அடுக்குகளும் அடுத்தடுத்த உள்ளடக்கத்தில் பின்னிப் பிணைந்துள்ளன—உத்தி சுருக்கம், பணிப்பாய்வு பதிவு மற்றும் தோல்வியிலிருந்து கற்றல் (அறிவு வடிகட்டுதல்) இயற்கையாகவே திறன்கள் மற்றும் தூக்க ஒருங்கிணைப்பு (அறிவு ஒழுங்கமைப்பு) ஆகியவற்றிற்கு மாறுகிறது, அதைத் தொடர்ந்து சிஸ்டம் ப்ராம்ப்ட் மேம்படுத்தல் (அறிவு பயன்பாடு), மற்றும் இறுதியாக நீண்ட பணிகளுக்கான குறுக்கு-அமர்வு தொடர்ச்சி (பொறியியல் ஆதரவு) ஆகியவற்றுடன் முடிவடைகிறது.

படம் 8-2: GAIA சோதனையில் உத்தி சுருக்கம் கற்றல்-பயன்பாட்டு சுழற்சி

சோதனை 8-1 ★★: வெற்றிகரமான அனுபவத்திலிருந்து கற்றல்: உத்தி சுருக்கம்

gaia-experience திட்டம், "உத்தி சுருக்கம்" என்ற கருத்தின் ஒரு பொதுவான செயலாக்கமாகும். ஒரு உத்தி சுருக்கம், வெற்றிகரமான சிக்கல் தீர்க்கும் செயல்முறையை ஒரு கட்டமைக்கப்பட்ட அனுபவக் குறிப்பாகச் சுருக்குகிறது—"என்ன முறைகள் பயன்படுத்தப்பட்டன, என்ன இடர்பாடுகள் சந்திக்கப்பட்டன, முக்கிய படிகள் என்ன" என்பதைப் பதிவு செய்கிறது—இதனால் எதிர்காலத்தில் இதே போன்ற சிக்கல்களைச் சந்திக்கும் போது நேரடியாகக் குறிப்பிட முடியும்.

ஒவ்வொரு இயக்கப் பாதையும் அனுபவமாக வடிகட்டத் தகுந்தது அல்ல; அளவுகோல் மாற்றத்திறன் ஆகும்: தற்போதைய பணியிலிருந்து கற்றுக்கொண்ட பாடத்தை எதிர்காலத்தில் இதே போன்ற பணிகளில் மீண்டும் பயன்படுத்த முடியுமா? ஒரு குறிப்பிட்ட உள்ளீட்டிற்கு மட்டுமே செல்லுபடியாகும் திருத்தங்கள் நீண்டகால நினைவகத்தில் நுழையக்கூடாது.

இந்தச் சோதனை இரண்டு முக்கிய உள்கட்டமைப்புகளைப் பயன்படுத்துகிறது. AWorld கட்டமைப்பு என்பது AI ஏஜெண்டுகளுக்காக வடிவமைக்கப்பட்ட ஒரு திறந்த மூல செயலாக்க மற்றும் மதிப்பீட்டு சூழலாகும், இது ஒரு தரப்படுத்தப்பட்ட கருவித்தொகுப்பை (உலாவி, கோப்பு முறைமை, குறியீடு விளக்கி, போன்றவை) மற்றும் ஒரு தானியங்கி மதிப்பீட்டு குழாய்வழியை வழங்குகிறது—இதை ஏஜெண்டுகளுக்கான "தேர்வு அறை" என்று நினைத்துக்கொள்ளுங்கள். GAIA என்பது மிகவும் சவாலான ஒரு அளவுகோலாகும், இது மனித நுண்ணறிவு தேவைப்படும் சிக்கலான, பல-படி பிரச்சனைகள் மூலம் பொது-நோக்க AI ஏஜெண்ட் திறன்களை மதிப்பிடுகிறது—எடுத்துக்காட்டாக, "ஒரு வலைத்தளத்தில் குறிப்பிட்ட தகவலைக் கண்டுபிடித்து, அதை குறியீடு மூலம் செயலாக்கி, பதிலைக் கணக்கிடுங்கள்," இதற்கு பெரும்பாலும் உலாவி, கோப்பு மேலாளர், குறியீடு விளக்கி மற்றும் சிக்கலான தர்க்கரீதியான பகுத்தறிவு ஆகியவற்றின் ஒருங்கிணைந்த பயன்பாடு தேவைப்படுகிறது.

முக்கிய கண்டுபிடிப்பு என்னவென்றால், AWorld கட்டமைப்பிற்குள் Agent-க்கு ஒரு முழுமையான "கற்றல்-பயன்பாட்டு" சுழற்சியைச் சேர்ப்பதாகும். கற்றல் முறைமையில், Agent ஒரு GAIA பணியை வெற்றிகரமாக முடிக்கும் போதெல்லாம், அமைப்பு தானாகவே அதன் முழுமையான செயல் பாதையைப் பிடித்து, அதை "பிரதிபலிக்க" மற்றும் "சுருக்கமாக்க" ஒரு LLM-ஐப் பயன்படுத்தி, ஒரு கட்டமைக்கப்பட்ட அனுபவச் சுருக்கத்தை உருவாக்குகிறது. இந்தச் சுருக்கம் இறுதி விடையை மட்டுமல்லாமல், சிக்கலைத் தீர்க்கப் பயன்படுத்தப்பட்ட மைய முறை, முக்கிய நுண்ணறிவுகள் மற்றும் பயனுள்ள கருவி வரிசைகளையும் வடிகட்டுகிறது. இந்த அனுபவங்கள் திசையன்மயமாக்கப்பட்டு அறிவுத் தளத்தில் சேமிக்கப்படுகின்றன. அனுபவத்தைப் பயன்படுத்தும் முறைமையில், Agent ஒரு புதிய பணியைப் பெறும்போது, அது முதலில் அனுபவ அறிவுத் தளத்தில் ஒரு சொற்பொருள் தேடலைச் செய்து, மிகவும் ஒத்த வரலாற்று வெற்றி நிகழ்வுகளைக் கண்டறிந்து, இந்த அனுபவங்களை "வெற்றி எடுத்துக்காட்டுகளாக" சிஸ்டம் ப்ராம்ப்ட்டில் (system prompt) செலுத்தி, முடிவெடுப்பதை வழிகாட்டுகிறது. சோதனைகள் இது புதிய சிக்கல்களைத் தீர்ப்பதன் செயல்திறனையும் வெற்றி விகிதத்தையும் கணிசமாக மேம்படுத்துவதாகக் காட்டியுள்ளன—Agent எவ்வளவு அதிகமான பணிகளைத் தீர்க்கிறதோ, அவ்வளவு அதிகமாக அதன் திரட்டப்பட்ட அனுபவம் வளமாகிறது, மேலும் அதன் திறன்கள் வலுவடைகின்றன, இது சுய-பரிணாமத்தின் நேர்மறை பின்னூட்ட வளையத்தை உருவாக்குகிறது.

சோதனை 8-2 ★★: மீண்டும் மீண்டும் வரும் பணிகளிலிருந்து கற்றல்: பணிப்பாய்வு பதிவு மற்றும் மறுஇயக்கம்

browser-use-rpa திட்டம் "பணிப்பாய்வு பதிவு" என்ற கருத்தின் சிறந்த எடுத்துக்காட்டாகும். பணிப்பாய்வு பதிவின் கருத்து, Excel-ன் "மேக்ரோ பதிவு" அம்சத்தைப் போன்றது: முதல் கைமுறை செயல்பாட்டின் போது நீங்கள் படிகளைப் பதிவு செய்கிறீர்கள், பின்னர் ஒரு "மறுஇயக்கம்" கிளிக்கில் அவற்றைத் தானாகவே மீண்டும் செய்யலாம். இந்தத் திட்டம் தீர்க்கும் பிரச்சனை மிகவும் நடைமுறைக்குரியது: உலாவியில் செய்யப்படும் பல மீண்டும் மீண்டும் வரும் செயல்பாடுகள் (எ.கா., ஒரு அறிக்கை மின்னஞ்சலை அனுப்புதல், ஒரு குறிப்பிட்ட வலைத்தளத்தில் தகவலை வினவுதல்), ஒவ்வொரு முறையும் குறிப்பிட்ட அளவுருக்கள் (எ.கா., பெறுநர், தேடல் முக்கியச்சொல்) மாறுபடினும், அவற்றின் மைய செயல்பாட்டு ஓட்டம் நிலையானதாக இருக்கும். ஒவ்வொரு முறையும் Agent-ஐ புதிதாகத் தொடங்க வைத்து, விலையுயர்ந்த மல்டிமாதிரி LLM-ஐப் பயன்படுத்தி இந்த ஓட்டத்தை "மீண்டும் கண்டுபிடிக்க" வைப்பது, வளங்களின் பெரும் விரயமாகும்—இது அடிப்படையில் சூழல் சார்ந்த கற்றலை (in-context learning) மட்டுமே நம்பியுள்ளது, வெற்றிகரமான அனுபவங்களை மீண்டும் பயன்படுத்தக்கூடிய கருவிகளாக வெளிப்படுத்தாமல். இந்தத் திட்டத்தின் மையமானது செயல்திறன் மற்றும் செலவு குறித்த ஒரு தீவிர ஒப்பீட்டு சோதனையாகும்.

கற்றல் கட்டத்தில் (Learning Phase), ஏஜெண்ட் முதல் முறையாக பணியைச் செய்கிறது, மல்டிமோடல் LLM-ன் கவனி-சிந்தி-செயல் சுழற்சி மூலம் மனிதனைப் போலவே செயல்பாட்டை நிறைவு செய்கிறது. LLM ஒரு செயலைச் செயல்படுத்த முடிவு செய்யும் ஒவ்வொரு முறையும், browser-use கட்டமைப்பின் வரலாற்றிலிருந்து இலக்கு உறுப்பின் துல்லியமான நிலைப்பாட்டுத் தகவலை அமைப்பு பிரித்தெடுக்கிறது: வலைப்பக்கம் உலாவியில் DOM மரமாக (Document Object Model) வழங்கப்படுகிறது, அங்கு ஒவ்வொரு பொத்தான், உள்ளீட்டுப் புலம் மற்றும் இணைப்பும் ஒரு முனையாகும்; XPath (XML Path Language) /html/body/div[2]/button[1] போன்ற பாதை அடிப்படையிலான தொடரியலைப் பயன்படுத்தி ஒரு குறிப்பிட்ட முனையைச் சுட்டிக்காட்டுகிறது. செயல் ஒரு கட்டமைக்கப்பட்ட படியாகப் பதிவு செய்யப்படுகிறது: செயல் வகை (கிளிக், உள்ளீடு, போன்றவை), இலக்கு உறுப்பின் XPath, செயல் அளவுருக்கள் மற்றும் செயல்படுத்தலுக்குப் பிந்தைய சரிபார்ப்புத் தகவல் (எ.கா., பக்க URL மாறியதா, எதிர்பார்க்கப்பட்ட உறுப்பு தோன்றியதா). பணி வெற்றிகரமாக முடிந்த பிறகு, LLM ஒரு சொற்பொருள் லேபிளை (எ.கா., "மின்னஞ்சல் அனுப்பு") மற்றும் விளக்கத்தை (எ.கா., "பெறுநர் புலம், பொருள் புலம், உள்ளடக்கப் புலம், அனுப்பு பொத்தான்") உருவாக்குகிறது, அவை படி வரிசையுடன் சேர்த்து அறிவுத் தளத்தில் சேமிக்கப்பட்டு, அளவுருவாக்கப்பட்ட "பணிப்பாய்வு" (workflow) உள்ளீட்டை உருவாக்குகின்றன.

மறுஇயக்க கட்டத்தில் (Replay Phase), ஒரு புதிய பணி வரும்போது, சொற்பொருள் ஒற்றுமை (embedding vectors) மற்றும் முக்கிய உறுப்புச் சரிபார்ப்புகள் இரண்டையும் பயன்படுத்தி, ஏற்கனவே உள்ள பொருந்தக்கூடிய பணிப்பாய்வு உள்ளதா என அமைப்பு சரிபார்க்கிறது. பொருத்தம் கிடைத்தால், அது படிகளை அதிவேகமாக இயக்குகிறது: உறுப்புகள் ஏற்றப்பட்டிருப்பதை உறுதி செய்ய Playwright-ன் (திறந்த மூல உலாவி தானியக்க நூலகம்) காத்திருக்கும் பொறிமுறையை (page.locator(xpath).wait_for(state='visible', timeout=15000)) பயன்படுத்துகிறது; அளவுருவாக்கப்பட்ட வார்ப்புருக்கள் (எ.கா., "பெறுநர் புலத்தில் {{email}} ஐ உள்ளிடவும்") ஒரு இலகுரக LLM அழைப்பு மூலம் தற்போதைய பணி வழிமுறைகளிலிருந்து உண்மையான அளவுரு மதிப்புகளைப் பிரித்தெடுக்கின்றன, முழு காட்சி பகுத்தறிவு தேவையில்லாமல். ஒரு படி தோல்வியுற்றால் (உறுப்பு கிடைக்கவில்லை, காத்திருப்பு நேரம் முடிந்தது), வலைப்பக்க அமைப்பு மாறியிருக்கலாம் என்பதை இது குறிக்கிறது. பணிப்பாய்வு "சாத்தியமான காலாவதியானது" எனக் குறிக்கப்பட்டு, அமைப்பு கற்றல் முறைக்குத் திரும்பி, LLM பகுத்தறிவு மூலம் பணியை மீண்டும் நிறைவு செய்து, பழையதை மாற்ற புதிய பணிப்பாய்வை உருவாக்குகிறது.

ஏற்றுக்கொள்ளல் காட்சி: Gmail வலை இடைமுகத்தில் மின்னஞ்சல் அனுப்புதல்.

  • முதல் செயலாக்கம் (கற்றல் கட்டம்): "test@example.com க்கு 'Test Email' என்ற பொருளுடனும் 'This is a test email.' என்ற உடலுடனும் மின்னஞ்சல் அனுப்பவும்." ஏஜெண்ட் "Compose" பொத்தான், பெறுநர் உள்ளீட்டுப் புலம், பொருள் மற்றும் உடல் உள்ளீட்டுப் புலங்கள் மற்றும் "Send" பொத்தானை அடையாளம் காண மல்டிமோடல் LLM ஐ எவ்வாறு பயன்படுத்துகிறது என்பதைக் கவனிக்கவும். செயல்பாட்டு படிகள், எடுக்கப்பட்ட நேரம் மற்றும் LLM அழைப்புகளின் எண்ணிக்கையைப் பதிவு செய்யவும்.
  • மீண்டும் மீண்டும் செயலாக்கம் (மறுஇயக்க கட்டம்): "another@example.com க்கு 'Follow-up Test' என்ற பொருளுடனும் 'Second test email.' என்ற உடலுடனும் மின்னஞ்சல் அனுப்பவும்." அமைப்பு பொருந்தக்கூடிய பணிப்பாய்வை அடையாளம் கண்டு, புதிய அளவுரு மதிப்புகளைப் பிரித்தெடுத்து, LLM காட்சி பகுத்தறிவு தேவையில்லாமல் நேரடியாக செயல்பாடுகளை மறுஇயக்குகிறது. எடுக்கப்பட்ட நேரம் மற்றும் அழைப்புகளின் எண்ணிக்கை கணிசமாகக் குறைக்கப்பட வேண்டும்.
  • அறிவுப் புதுப்பிப்பு: ஒரு வலைப்பக்க மறுவடிவமைப்பை உருவகப்படுத்தவும் (ஒரு குறிப்பிட்ட பொத்தானின் XPath மாறும் வகையில் HTML கட்டமைப்பை மாற்றவும்), மேலும் ஏஜெண்ட் பணிப்பாய்வு தோல்வியைக் கண்டறிந்து, கற்றல் முறைக்குத் திரும்பிச் சென்று, அறிவுத் தளத்தைப் புதுப்பிக்க ஒரு பணிப்பாய்வை மீண்டும் உருவாக்க முடியும் என்பதைச் சரிபார்க்கவும்.

எதிர்பார்க்கப்படும் அவதானிப்புகள்: மறுஇயக்க கட்டத்தில் பணி செயல்படுத்தும் வேகம் கணிசமாக மேம்படுத்தப்படுகிறது (பல மடங்கு), LLM அழைப்புச் செலவுகள் வெகுவாகக் குறைக்கப்படுகின்றன, மேலும் வெற்றி விகிதம் மிகவும் நிலையானதாக இருக்கும்.

பணிப்பாய்வு பதிவு என்பது ஒரு தனிமைப்படுத்தப்பட்ட பொறியியல் தந்திரம் அல்ல; இது ஒரு பொதுவான வழிமுறையால் ஆதரிக்கப்படுகிறது. NVIDIA குழுவால் முன்மொழியப்பட்ட திறந்த-உலக ஏஜெண்ட் கட்டமைப்பான Voyager (பின்னர் விரிவாக விளக்கப்படும்), Minecraft மெய்நிகர் உலகில் "ஆராய்தல்-ஒருங்கிணைத்தல்" சுழற்சியை முறைப்படுத்துகிறது: பணியைச் செயல்படுத்தவும் → வெற்றியைச் சரிபார்க்கவும் → வெற்றிகரமான செயல் வரிசையை ஒரு திறன் நூலகத்தில் சேமிக்கவும் → ஒத்த பணிகளை எதிர்கொள்ளும்போது மீட்டெடுத்து மீண்டும் பயன்படுத்தவும். சோதனை 8-2 என்பது இந்த அணுகுமுறையை உலாவி தன்னியக்கத்திற்குப் பயன்படுத்துவதாகும்—கற்றல் கட்டம் "ஆராய்தலுக்கு" ஒத்திருக்கிறது, பணிப்பாய்வு அறிவுத் தளம் "திறன் நூலகத்திற்கு" ஒத்திருக்கிறது, மேலும் மறுஇயக்கம் மற்றும் தோல்வியில் பின்னடைவு ஆகியவை "மீட்டெடுப்பு மற்றும் மறுபயன்பாடு" மற்றும் தொடர்ச்சியான முன்னேற்றத்திற்கு ஒத்திருக்கின்றன.

சோதனை 8-2 "பதிவு-மறுஇயக்கத்தில்" உள்ள இரண்டு மிகவும் பலவீனமான இணைப்புகளையும் வெளிப்படுத்துகிறது. இவற்றைச் சுத்தமாகக் கையாள்வது பொறிமுறையை உண்மையிலேயே நம்பகமானதாக ஆக்குகிறது[^preact]. முதல் இணைப்பு எப்போது மறுஇயக்கத்தை நம்புவது என்பதாகும். மிகவும் வலுவான அணுகுமுறை, ஒரு வெற்றிகரமான செயல் வரிசையை ஒரு சிறிய நிலை இயந்திர நிரலாக தொகுப்பதாகும்: ஒவ்வொரு நிலையும் ஒரு "சரிபார்ப்பு முன்கணிப்புடன்" (தற்போதைய உண்மையான திரையில் இருக்க வேண்டிய UI முறை) வருகிறது. மறுஇயக்கத்தின் போது, ஒவ்வொரு செயலுக்கு முன்பும், முன்கணிப்பு நேரடித் திரையில் சரிபார்க்கப்படுகிறது—"முதலில் பார், பிறகு செயல்படு." ஒரு முன்கணிப்பு தோல்வியுற்றால் அல்லது ஒரு செயல் பிழை ஏற்பட்டால், கட்டுப்பாடு முழு ஏஜெண்டிடம் மீண்டும் ஒப்படைக்கப்பட்டு மீண்டும் தொடங்கப்படுகிறது, மேலும் புதிய பாதை மீண்டும் ஒரு நிரலாக தொகுக்கப்படுகிறது. மறுஇயக்கத்திற்கு பூஜ்ஜிய மாதிரி அழைப்புகள் தேவைப்படுவதால், தற்காலிக சேமிப்பில் உள்ள மீண்டும் மீண்டும் வரும் பணிகள் 8.5–13 மடங்கு வேகமாக இருக்கும். இரண்டாவது இணைப்பு கெட்ட நிரல்களைச் சேமிக்காதீர்கள்: தொகுத்த உடனேயே, சூழலை மீட்டமைத்து மீண்டும் புதிதாக மறுஇயக்கவும். உள்ளமைக்கப்பட்ட அளவுகோல் மதிப்பீட்டாளரைப் பயன்படுத்தி "இது உண்மையில் வேலையை முடித்ததா" என்பதை உறுதிப்படுத்திய பின்னரே அதை நூலகத்தில் அனுமதிக்கவும்—இந்த "சேமிப்புக்கு முந்தைய சரிபார்ப்பு" "மறுஇயக்க படிகளை 100% உள்ளடக்கியிருந்தாலும் உண்மையில் பணியை முடிக்காத" நிரல்களைத் தடுக்கிறது (எ.கா., முழு ஓட்டமும் முடிந்து சேமி கிளிக் செய்யப்பட்டது, ஆனால் ஒரு குறிப்பிட்ட புலம் உண்மையில் காலியாக உள்ளது). இந்த வாயில் இல்லாமல், குறைபாடுள்ள நிரல்கள் குவிவதால் நிரல் நூலகம் சிதைகிறது. இது ஒரு தெளிவான கொள்கையாக சுருங்குகிறது: நடைமுறை நினைவகத்திற்கும் ஒரு சரிபார்ப்பு வாயில் தேவை, இல்லையெனில் சுய-முன்னேற்ற சுழற்சி சிதைந்துவிடும்—இதுவே சோதனை 8-2 இல் உள்ள "பணிப்பாய்வு தோல்வியைக் கண்டறிந்து, பின்னடைந்து மீண்டும் கற்றுக்கொள்" என்பதன் கடுமையான பதிப்பாகும்.

[^preact]: வெற்றிகரமான பாதைகளை சரிபார்ப்பு முன்கணிப்புகளுடன் கூடிய நிலை இயந்திர நிரல்களாக தொகுத்து, "சேமிப்பதற்கு முந்தைய சரிபார்ப்பு" வாயிலை அமைப்பதற்கான முழுமையான வழிமுறை Li, Bojie எழுதிய PreAct: Computer-Using Agents that Get Faster on Repeated Tasks. arXiv:2606.17929, 2026 இல் விவரிக்கப்பட்டுள்ளது.

தோல்வியிலிருந்து கற்றல்

உத்தி சுருக்கங்கள் மற்றும் பணிப்பாய்வு பதிவு இரண்டும் வெற்றிகரமான பாதைகளில் இருந்து அனுபவத்தைப் பிரித்தெடுக்கின்றன—சோதனை 8-1 ஒரு பணி வெற்றிபெற்ற பின்னரே பிரதிபலிப்பு மற்றும் சுருக்கத்தைத் தூண்டுகிறது. ஆனால் தோல்வி அனுபவங்களும் சமமாக மதிப்புமிக்கவை, மேலும் பெரும்பாலும் அதிக தகவல்களைக் கொண்டு செல்கின்றன: ஒரு தோல்வி ஒரு பாதையை உறுதியாக நிராகரிக்கிறது, அதேசமயம் வெற்றி என்பது பெரும்பாலும் பல சாத்தியமான பாதைகளில் ஒன்று மட்டுமே. தோல்வி அனுபவங்கள் பொதுவாக இரண்டு வடிவங்களில் படிகமாகின்றன: பிழை முறை நூலகங்கள் ("எந்த சூழ்நிலையில் எந்த முறையைப் பயன்படுத்துவது தோல்வியடைகிறது, மற்றும் தோல்வி சமிக்ஞை என்ன" என்பதைப் பதிவு செய்வது) மற்றும் எதிர்மறை விதிகள் ("Y க்கு இனி X முறையைப் பயன்படுத்த வேண்டாம்"—எ.கா., "இந்த கேரியருடன் சந்தாவை ரத்து செய்ய தொலைபேசி அழைப்பு முறையைப் பயன்படுத்த வேண்டாம்; தொலைபேசி சேனலுக்கு அதைக் கையாள அதிகாரம் இல்லை").

இந்த திசையில் முக்கியமான பணி Reflexion (Shinn et al., 2023)[^reflexion-2023] ஆகும்: ஒரு பணி தோல்வியடைந்த பிறகு, Agent இயற்கை மொழியில் தோல்விக்கான காரணத்தைப் பற்றி பிரதிபலிக்கிறது (எ.கா., "நான் மூன்றாவது படியில் படிவத்தை நேரடியாகச் சமர்ப்பிப்பதற்குப் பதிலாக எனது அடையாளத்தைச் சரிபார்த்திருக்க வேண்டும்") மற்றும் பிரதிபலிப்பு உரையை எபிசோடிக் நினைவகத்தில் சேமிக்கிறது. அடுத்த முறை இதேபோன்ற பணியை முயற்சிக்கும்போது, இந்த பிரதிபலிப்புகள் கூடுதல் சூழலாகப் படிக்கப்படுகின்றன, இதனால் அதே தவறுகளை மீண்டும் செய்வதைத் தவிர்க்கலாம். முழு செயல்முறையும் எந்த மாதிரி அளவுருக்களையும் புதுப்பிக்காது—Reflexion என்பது "எடைகளை மாற்றாமல் பரிணாமம்" என்பதற்கான ஒரு சிறந்த எடுத்துக்காட்டு; இந்த மொழியில் எழுதப்பட்ட பிரதிபலிப்பு ஒரு அளவிடல் வெகுமதியை விட அதிக தகவல்களைக் கொண்டு செல்கிறது, இது பின்னர் சிஸ்டம் ப்ராம்ப்ட் கற்றலைப் பற்றி விவாதிக்கும்போது விரிவாக்கப்படும். தோல்வி அனுபவத்திற்கான மற்றொரு முக்கியமான வெளியீடு சிஸ்டம் ப்ராம்ப்ட் ஆகும்: இந்த அத்தியாயத்தில் பின்னர் விவாதிக்கப்படும் சிஸ்டம் ப்ராம்ப்ட்களின் தானியங்கி மேம்படுத்தல், தோல்வி நிகழ்வுகளிலிருந்து பிரித்தெடுக்கப்பட்ட எதிர்மறை விதிகளை (எ.கா., "கொள்கை தகராறுகள் காரணமாக ஒருபோதும் மனித ஏஜெண்டுக்கு மாற்ற வேண்டாம்") சிஸ்டம் ப்ராம்ப்ட்டில் எழுதுவதாகும், இவை அடுத்தடுத்த அனைத்து பணிகளுக்கும் பயனுள்ள நடத்தை கட்டுப்பாடுகளாக அமைகின்றன.

[^reflexion-2023]: Shinn, N., et al. Reflexion: Language Agents with Verbal Reinforcement Learning. arXiv:2303.11366, 2023.

திறன்கள்: கள அறிவை கட்டமைக்கப்பட்ட திறன்களாக வெளிப்படுத்துதல்

முன்னர் விவாதிக்கப்பட்ட இரண்டு வழிமுறைகள் முறையே "எப்படி சிந்திப்பது" மற்றும் "எப்படி செய்வது" என்பதில் அனுபவத்தை ஒருங்கிணைக்கின்றன. திறன்கள் (Skills) வழிமுறை மூன்றாவது பாதையை எடுக்கிறது—கள செயல்பாட்டு அறிவை முறையாக கட்டமைக்கப்பட்ட திறன் தொகுதிகளாக (capability modules) செம்மைப்படுத்தி, தேவைக்கேற்ப ஏற்றிக்கொள்ள முடியும். ஒரு திறனை (Skill) "வேலை கையேடு" (job manual) போல் நினைத்துக்கொள்ளுங்கள்: ஒரு புதிய ஊழியர் எல்லாவற்றையும் புதிதாக கண்டுபிடிக்க வேண்டியதில்லை; கையேட்டைப் படித்த பிறகு வேலை செய்ய ஆரம்பிக்கலாம். அத்தியாயம் 2, திறன்களின் (Skills) படிப்படியான வெளிப்பாடு வழிமுறை (metadata → core process → details) மற்றும் KV Cache உடனான அவற்றின் இணக்கத்தன்மை வடிவமைப்பு பற்றி விரிவாக விவாதித்தது. இந்தப் பகுதி, திறன்களுக்குப் (Skills) பின்னால் உள்ள அறிவு வெளிப்படுத்தல் தத்துவம் (philosophy of knowledge externalization) மற்றும் அவற்றின் தானியங்கி உருவாக்கம் ஆகியவற்றில் கவனம் செலுத்துகிறது.

திறன்களின் (Skills) முக்கிய மதிப்பு, மனிதர்கள் படிக்கக்கூடிய உரையில் அறிவை எடுத்துச் செல்வதில் உள்ளது: அவை விரைவாக புதுப்பிக்கக்கூடியவை (மாதிரி மறுபயிற்சி தேவையில்லை), தணிக்கை செய்யக்கூடியவை (மனித நிபுணர்கள் நேரடியாக மாற்றி மேம்படுத்தலாம்), மற்றும் மாற்றத்தக்கவை (வெவ்வேறு மாதிரிகள் அல்லது அமைப்புகளில் பயன்படுத்தலாம்). அடிப்படையில், திறன்கள் (Skills) கட்டமைக்கப்படாத ஆவணங்களில் சிக்கியிருக்கும் கள அறிவை, ஏஜெண்டுகளால் (Agents) எளிதாகப் பயன்படுத்தக்கூடிய கட்டமைக்கப்பட்ட வடிவமாக மாற்றுகின்றன—இது ஏஜெண்டுகளை (Agents) குறியீட்டு தர்க்கத்தில் அறிவை வன்குறியீடு செய்வதற்குப் பதிலாக, பொதுவான தேடல் மற்றும் பகுத்தறிவு திறன்கள் மூலம் அறிவைப் பயன்படுத்த அனுமதிக்கிறது.

மேலும் சென்றால், ஆந்த்ரோபிக்கின் (Anthropic) திறன் உருவாக்கி (Skill Creator)[^ch8-1] என்பது மற்ற திறன்களை (Skills) உருவாக்கக்கூடிய ஒரு மீ-திறன் (meta-capability) ஆகும். இது ஏஜெண்டை (Agent) கவனிப்பு, கற்றல் மற்றும் சுருக்கம் மூலம் கள செயல்பாட்டு அறிவை கட்டமைக்கப்பட்ட திறன்களாக (Skills) செம்மைப்படுத்த வழிகாட்டுகிறது. ஒரு குறிப்பிட்ட களத்திற்கான திறனை (Skill) உருவாக்கும்படி கேட்கப்படும்போது, ஏஜெண்ட் (Agent) முதலில் பயனருடன் உரையாடல் மூலம் குறிப்பிட்ட பயன்பாட்டு சூழ்நிலைகளைப் புரிந்துகொள்கிறது, பின்னர் ஒவ்வொரு சூழ்நிலையையும் பகுப்பாய்வு செய்து மீண்டும் பயன்படுத்தக்கூடிய வளங்களை அடையாளம் காண்கிறது, இறுதியாக ஒரு நிலையான கோப்பக அமைப்பு, ஸ்கிரிப்ட்கள், குறிப்புகள், சொத்துக்கள் மற்றும் ஒரு முக்கிய SKILL.md ஆவணத்தைக் கொண்ட முழுமையான திறன் (Skill) தொகுப்பை உருவாக்குகிறது. திறன் உருவாக்கி (Skill Creator), அறிவு மாற்ற செயல்முறையே ஏஜெண்டால் (Agent) முடிக்கப்பட அனுமதிக்கிறது, இது அறிவு குவிப்பின் ஒரு தானியங்கி சுழற்சியை (bootstrapping cycle) உணர்த்துகிறது: ஏஜெண்டுகள் (Agents) திறன்களை (Skills) பயன்படுத்துவது மட்டுமல்லாமல், அவற்றை உருவாக்கவும் முடியும்.

[^ch8-1]: Anthropic, "Skill Creator", 2025. https://github.com/anthropics/skills/blob/main/skill-creator/SKILL.md

கிளாட் குறியீட்டின் (Claude Code) CLAUDE.md வழிமுறை இதேபோன்ற திறனை வெளிப்படுத்துகிறது: ஒரு குறியீட்டு களஞ்சியத்தை (code repository) முதலில் சந்திக்கும்போது, அது முழு குறியீட்டுத் தளத்தையும் முனைப்புடன் படித்து, கட்டமைப்பு வடிவமைப்பு, குறியீட்டு தரநிலைகள் மற்றும் சோதனை முறைகள் போன்ற முக்கிய தகவல்களைக் கொண்ட ஒரு திட்ட வழிகாட்டியை உருவாக்குகிறது, பின்னர் அடுத்தடுத்த மேம்பாட்டின் போது அதை தொடர்ந்து குறிப்பிட்டு புதுப்பிக்கிறது. இந்த தானியங்கி திறன் (Skill) உருவாக்க வழிமுறை என்பது, ஒரு ஏஜெண்டின் (Agent) திறன்களின் விரிவாக்கம் மனித நிபுணர்களின் கிடைக்கும் தன்மை மற்றும் அறிவு வரம்பிற்கு மட்டுப்படுத்தப்படவில்லை என்பதைக் குறிக்கிறது—ஒரு ஏஜெண்ட் (Agent) ஒரு புதிய களத்தில் நுழையும்போது, அது சுயாட்சி ஆய்வு மூலம் கற்றுக்கொள்ளலாம், செயல்பாட்டு வழிகாட்டிகளை உருவாக்கலாம், மேலும் அவற்றை திறன்களாக (Skills) உறுதிப்படுத்தலாம், இது "முன்-நிரலாக்கப்பட்ட அறிவை நம்பியிருப்பதில்" இருந்து "பயிற்சியின் மூலம் கற்று அறிவைக் குவிப்பதற்கு" ஒரு மாற்றத்தை அடைகிறது.

"அனுபவ ஒருங்கிணைப்பு" (experience consolidation) கண்ணோட்டத்தில், கருவி உருவாக்கத்தின் குறிப்பிட்ட வடிவங்களை மேலும் இரண்டாகப் பிரிக்கலாம்: அர்ப்பணிக்கப்பட்ட குறியீட்டு கருவிகள் (dedicated code tools) மற்றும் திறன்கள் (Skills) + பொது செயலாக்கிகள் (general executors). இவற்றுக்கு இடையே தேர்ந்தெடுப்பதற்கான கொள்கைகள் முன்பே கூறப்பட்டுள்ளன, அத்தியாயம் 4 இல் முழுமையான கட்டமைப்பு உள்ளது, எனவே அவை இங்கு மீண்டும் கூறப்படவில்லை. இந்தப் பகுதியின் காட்சிக்குப் பயன்படுத்தினால்: சிக்கலான அளவுருக்கள் மற்றும் அடிக்கடி அழைப்புகள் கொண்ட செயல்பாடுகள் குறியீட்டு கருவிகளாக உறுதிப்படுத்தப்படுகின்றன (எ.கா., Minecraft இல் Voyager இன் திறன் நூலகம், உலாவி பணிப்பாய்வு பதிவிலிருந்து உருவாக்கப்பட்ட அளவுரு மயமாக்கப்பட்ட ஸ்கிரிப்ட்கள்), அதேசமயம் மூலோபாய, மாறக்கூடிய வணிக விதிகள் திறன் ஆவணங்களாக (Skill documents) எழுதப்படுகின்றன (எ.கா., Claude Code இன் CLAUDE.md). நிஜ உலக அமைப்புகள் பெரும்பாலும் இரண்டு வடிவங்களின் கலவையைப் பயன்படுத்துகின்றன.

தூக்கக் கற்றல்: பயனர் நினைவகத்தின் தன்னாட்சி பரிணாமம்

முன்னர் விவாதிக்கப்பட்ட அனுபவ கற்றல் வழிமுறைகள்—உத்தி சுருக்கங்கள், பணிப்பாய்வு பதிவு, திறன் உருவாக்கம்—அனைத்தும் பணி செயல்பாட்டின் போது அல்லது உடனடி பணிக்குப் பிந்தைய சுத்திகரிப்பின் போது நிகழ்கின்றன. ஆனால் மனித கற்றலில் மற்றொரு முக்கியமான கூறு உள்ளது: தூக்கத்தின் போது நினைவக ஒருங்கிணைப்பு (memory consolidation during sleep). அத்தியாயம் 2 இல் சூழல் சுருக்கத்தைப் பற்றி விவாதிக்கும் போது இந்த ஒப்புமை பயன்படுத்தப்பட்டது—மூளை பகல்நேர உணர்வுத் தகவல்களை சிறிய நீண்டகால நினைவகமாக செயலாக்குகிறது; இந்த ஒப்புமை ஒரு ஒற்றை அமர்வுக்குள் சூழல் சுருக்கத்திற்கு மட்டுமல்ல, குறுக்கு-அமர்வு அனுபவ மேலாண்மைக்கும் நீட்டிக்கப்படுகிறது: பகலில் பெறப்பட்ட துண்டு துண்டான அனுபவங்கள் தூக்கத்தின் போது மறுசீரமைக்கப்படுகின்றன, நகல் நீக்கப்படுகின்றன, மற்றும் இருக்கும் அறிவு வலையமைப்புகளுடன் ஒருங்கிணைக்கப்படுகின்றன, மேலும் சிறிய, எளிதில் மீட்டெடுக்கக்கூடிய நீண்டகால நினைவகமாக மாற்றப்படுகின்றன.

இந்த ஆஃப்லைன் ஒருங்கிணைப்பின் மிகவும் பொதுவான பொருள், Agent இன் பயனரைப் பற்றிய நினைவகம் ஆகும்—நீங்கள் யார், உங்கள் விருப்பங்கள், நீங்கள் குறிப்பிட்ட உண்மைகள். இங்கு ஒரு பொதுவான தவறான கருத்தை தெளிவுபடுத்த வேண்டும்: Claude Code போன்ற Agents "தூக்கத்தின்" போது ஒழுங்கமைப்பது முதன்மையாக பயனர் நினைவகம் (user memory) ஆகும், பகிரப்பட்ட அறிவுத் தளங்கள் அல்ல. அறிவுத் தளங்கள் (அத்தியாயம் 3 இலிருந்து RAG) குறிப்பிட்ட பயனர்களுடன் தொடர்பில்லாத கள ஆவணங்களைக் கொண்டு செல்கின்றன, பொதுவாக ஆஃப்லைன் குழாய்கள் மூலம் தொகுதியாக ஏற்றப்படுகின்றன மற்றும் சிறிய மாற்றத்தைக் கொண்டுள்ளன; மறுபுறம், பயனர் நினைவகம், உரையாடல்கள் முழுவதும் துண்டு துண்டாக குவிக்கப்பட்ட "உங்களை நன்றாக அறிந்துகொள்வதன்" மாதிரியாகும்—இதற்குத்தான் மீண்டும் மீண்டும் "தூக்க ஒருங்கிணைப்பு" தேவைப்படுகிறது. இந்தப் பகுதியில் அடுத்து அறிமுகப்படுத்தப்படும் Claude Code மற்றும் Hermes இரண்டும் இந்த வகை பயனர் நினைவகத்தைச் சேமிக்கின்றன; அது எவ்வாறு தன்னாட்சியாகப் பரிணமிக்கிறது என்பதே நமது கவனம்.

அத்தியாயம் 3 உடனான பணிப் பகிர்வையும் தெளிவுபடுத்துவோம்: அத்தியாயம் 3 "எவ்வாறு சேமிப்பது மற்றும் எவ்வாறு வினவுவது" பயனர் நினைவகத்தைப் பற்றி விவாதித்தது, மேலும் நினைவக சேமிப்பு அடுக்குக்கான ஒருங்கிணைப்பு வழிமுறைகளையும் (கிளஸ்டரிங் சுருக்கங்கள், முரண்பாடு பதிப்பாக்கம் போன்றவை) அறிமுகப்படுத்தியது, எனவே அவை இங்கு மீண்டும் கூறப்படவில்லை. இந்தப் பகுதி பொறியியல் மற்றும் பரிணாம சிக்கல்களில் கவனம் செலுத்துகிறது—எப்போது ஒருங்கிணைப்பது, யார் ஒருங்கிணைப்பது, மற்றும் எந்த வடிவத்தில் படிகமாக்குவது, இதனால் நினைவகம் பயன்பாட்டுடன் மிகவும் துல்லியமாக மாறும்.

Claude Code: பயனர் நினைவகத்தை Markdown இல் சேமித்தல். Claude Code பயனர் நினைவகத்தை நேரடியாக மனிதர்கள் படிக்கக்கூடிய Markdown கோப்புகளாக சேமிக்கிறது: ஒவ்வொரு நினைவகமும் மெட்டாடேட்டா (frontmatter) கொண்ட ஒரு சிறிய கோப்பாகும், இது ஒரே ஒரு உண்மையை மட்டுமே பதிவு செய்கிறது, மேலும் ஒரு குறியீட்டு கோப்பு (MEMORY.md) சுருக்க வழிசெலுத்தலை வழங்குகிறது. இந்த வடிவத்தின் நன்மைகள் தெளிவானவை—புதுப்பிக்க விரைவானது (கோப்பை மாற்றினால் போதும், மாதிரியை மீண்டும் பயிற்றுவிக்க தேவையில்லை), தணிக்கை செய்யக்கூடியது (பயனர்கள் நேரடியாகத் திறந்து மாற்றலாம்), மற்றும் மாற்றத்தக்கது (வெவ்வேறு மாதிரிகள் அல்லது அமைப்புகளில் பயன்படுத்தலாம்).

ஆனால் "பதிவு செய்வதை" விட, "ஒழுங்கமைப்பதும்" தேவை. Claude Code, தூக்க ஒருங்கிணைப்பின் (sleep consolidation) அறிவாற்றல் உருவகத்தை, பின்னணியில் அவ்வப்போது இயங்கும் நினைவக ஒருங்கிணைப்பு பொறிமுறையாக பொறியியல் செய்கிறது. (பின்வரும் விளக்கம் பொது பதிப்பின் நடத்தை மற்றும் சமூக பகுப்பாய்வை அடிப்படையாகக் கொண்டது, அதிகாரப்பூர்வ வரையறை அல்ல.) மைய வடிவமைப்பு யோசனை: அனுபவக் குவிப்பு மற்றும் நினைவக ஒருங்கிணைப்பு ஆகியவை ஒரே நேர சாளரத்தில் நிகழக்கூடாத இரண்டு சுயாதீன செயல்முறைகள்—ஏஜெண்டுகளுக்கும் அர்ப்பணிக்கப்பட்ட "மறுஆய்வு நேரம்" தேவை. குறிப்பாக, இரண்டு நிபந்தனைகள் பூர்த்தியாகும்போது (கடைசி ஒருங்கிணைப்புக்குப் பிறகு ஒரு குறிப்பிட்ட நேர இடைவெளி கடந்திருத்தல், மற்றும் அந்த காலகட்டத்தில் போதுமான புதிய அமர்வுகள் குவிந்திருத்தல்), அமைப்பு பின்னணியில் ஒரு சுயாதீன துணை-ஏஜெண்டைத் தொடங்கி நான்கு-நிலை ஒருங்கிணைப்பைச் செய்கிறது: திசை அறிதல் (Orient) (தற்போதைய நினைவக குறியீட்டைப் படித்து ஒட்டுமொத்த அறிவு நிலப்பரப்பைப் புரிந்துகொள்ளுதல்), சேகரித்தல் (Gather) (சமீபத்திய அமர்வுகளில் நிலைத்திருக்கத் தகுந்த புதிய தகவல்களைத் தேடி, தற்போதைய நினைவகத்திற்கு முரணான உண்மைகளைக் கண்டறிதல்), ஒருங்கிணைத்தல் (Consolidate) (புதிய சமிக்ஞைகளை கிட்டத்தட்ட நகல் உள்ளீடுகளை உருவாக்காமல் தற்போதைய தலைப்பு கோப்புகளில் இணைத்தல், உறவினர் தேதிகளை முழுமையான தேதிகளாக மாற்றுதல், பொய்யானவை என நிரூபிக்கப்பட்ட பழைய உண்மைகளை நீக்குதல்), மற்றும் சீரமைத்தல் & குறியீடு (Prune & Index) (குறியீட்டு அளவைக் கட்டுப்படுத்துதல், காலாவதியான சுட்டிகளை அகற்றுதல்).

இந்த பொறிமுறையின் மிக முக்கியமான வடிவமைப்பு முடிவு: நினைவக ஒருங்கிணைப்பு பயனர் தொடர்பின் போது நிகழாமல், பின்னணியில் ஒத்திசைவற்ற முறையில் (asynchronously) முடிக்கப்படுகிறது, இது பயனருக்கு முற்றிலும் வெளிப்படையானது. இரட்டை நிபந்தனை மற்றும் விநியோகிக்கப்பட்ட பூட்டுகள் (distributed locks) ஒரே நேரத்தில் இயங்கும் நிகழ்வுகள் மீண்டும் மீண்டும் ஒருங்கிணைப்பைத் தூண்டுவதைத் தடுக்கின்றன, தோல்வி ஏற்பட்டால் தானாக முன்னிலைக்குத் திரும்பி (rollback) அடுத்த முறை மீண்டும் முயற்சிக்கும்; ஒருங்கிணைப்பு துணை-ஏஜெண்டின் அனுமதிகள் நினைவக கோப்பகத்திற்கு மட்டுமே கண்டிப்பாக வரையறுக்கப்பட்டுள்ளன. பரந்த கண்ணோட்டத்தில், இது பயனர் நினைவக மேலாண்மையின் பரிணாமத்தை "ஒழுங்கமைப்பின்றி பதிவு செய்தல்" என்பதிலிருந்து "பதிவு—ஒருங்கிணைப்பு—சீரமைப்பு" எனும் முழுமையான வாழ்க்கைச் சுழற்சியாகக் குறிக்கிறது. வழக்கமான ஒருங்கிணைப்பு இல்லாமல், நினைவகக் களஞ்சியம் குறைந்த சமிக்ஞை-இரைச்சல் விகிதம் கொண்ட தகவல் குப்பையாக சிதைந்து, மீட்டெடுப்பின் தரத்தைத் தடுக்கிறது; வழக்கமான "தூக்க ஒருங்கிணைப்பு" நினைவகக் களஞ்சியத்தை சுருக்கமாகவும், சீராகவும், எளிதில் வழிசெலுத்தக்கூடியதாகவும் வைத்திருக்கிறது, ஒரு மனித நிபுணரின் அறிவு உண்மைகளின் முடிவற்ற குவிப்பு அல்ல, மாறாக மீண்டும் மீண்டும் ஒழுங்கமைப்பதன் மூலம் செம்மைப்படுத்தப்பட்ட ஒரு கட்டமைக்கப்பட்ட புரிதல் என்பது போல.

Hermes: தன்னாட்சி கற்றலை ஒரு நிரந்தர சேவையாக மாற்றுதல். Nous Research-ன் திறந்த மூல Hermes (2026) இந்த அணுகுமுறையை மேலும் முன்னெடுத்துச் செல்கிறது: இது பயனரின் சொந்த கணினியில் நிரந்தரமாக இயங்கும் ஒரு டீமான் செயல்முறையாகும், இது தொடர்ச்சியாக நினைவகத்தைக் குவித்து, அமர்வுகள் முழுவதும் தன்னாட்சியுடன் பரிணமிக்கிறது. அதன் நினைவகம் நான்கு அடுக்குகளாகப் பிரிக்கப்பட்டுள்ளது[^hermes]: ப்ராம்ப்ட் நினைவகம் (Prompt Memory: MEMORY.md மற்றும் USER.md, அமர்வின் தொடக்கத்தில் செலுத்தப்படும், ஏஜெண்டை முன்னுரிமைப்படுத்த "கட்டாயப்படுத்த" சில ஆயிரம் எழுத்துகளுக்கு வேண்டுமென்றே வரையறுக்கப்பட்டது), அமர்வு மீட்டெடுப்பு (வரலாற்று அமர்வுகளுக்கு SQLite முழு-உரை குறியீட்டு FTS5 ஐப் பயன்படுத்தி, மீட்டெடுக்கப்பட்ட பகுதிகள் செலுத்தப்படுவதற்கு முன் முதலில் ஒரு LLM ஆல் சுருக்கப்பட்டு, தற்போதைய பணிக்குத் தொடர்புடைய பகுதிகளை மட்டுமே கொண்டுவருகிறது), திறன் நூலகம் (செயல்முறை நினைவகம், படிப்படியான வெளிப்பாட்டைப் பயன்படுத்தி, இயல்பாக திறன் பெயர்கள் மற்றும் சுருக்கங்களை மட்டுமே ஏற்றுகிறது), மற்றும் ஒரு விருப்ப Honcho பயனர் மாதிரியாக்க அடுக்கு (பின்னணியில் விருப்பங்கள், தொடர்பு பாணி மற்றும் கள அறிவை செயலற்ற முறையில் கண்காணித்து, அமர்வுகள் முழுவதும் "பயனரும் ஏஜெண்டும் எவ்வாறு இணைந்து பரிணமிக்கிறார்கள்" என்பதை சித்தரிக்கிறது). ஒரு பணி குறிப்பிட்ட நிபந்தனைகளைப் பூர்த்தி செய்யும் போது (எ.கா., ஐந்துக்கும் மேற்பட்ட கருவி அழைப்புகள், பிழையிலிருந்து மீளுதல், பயனர் திருத்தத்தைப் பெறுதல், அல்லது வெளிப்படையாகத் தெரியாத ஒரு பணிப்பாய்வை முழுமையாக நிறைவேற்றுதல்), Hermes தானாகவே அந்த அனுபவத்தை மீண்டும் பயன்படுத்தக்கூடிய திறனாக உறுதிப்படுத்துகிறது; முழுவதுமாக மீண்டும் எழுதுவதற்குப் பதிலாக, சிறுசிறு ஒட்டுத் திருத்தங்களாக (incremental patches) புதுப்பிப்பதையே விரும்புகிறது. Claude Code மற்றும் Hermes ஆகியவை இன்று தன்னாட்சி பயனர் நினைவக பரிணாமத்தின் முக்கிய நீரோட்ட வடிவத்தை பிரதிநிதித்துவப்படுத்துகின்றன—இரண்டும் மனிதனால் படிக்கக்கூடிய Markdown/உரையை கேரியராகப் பயன்படுத்துகின்றன.

[^hermes]: Nous Research, Hermes: A Self-Improving Personal Agent, 2026. https://hermes-agent.nousresearch.com/docs/

சிஸ்டம் ப்ராம்ப்ட்களின் தானியங்கி உகப்பாக்கம்

சிஸ்டம் ப்ராம்ப்ட்களின் முக்கிய இழைக்குத் திரும்புதல்: முந்தைய பிரிவுகளில் உள்ள வழிமுறைகள் அனைத்தும் மாதிரிக்கு வெளியே அனுபவத்தையும் நினைவகத்தையும் ஒருங்கிணைக்கின்றன—அறிவுத் தளங்கள், பணிப்பாய்வுகள், திறன் கோப்புகள், பயனர் நினைவகம். ஆனால் அனுபவத்தின் மற்றொரு, மிகவும் நேரடியான கேரியர் உள்ளது—சிஸ்டம் ப்ராம்ப்ட் தானே. ஆண்ட்ரேஜ் கார்பதி, தற்போதைய LLM பயிற்சியில் ஒரு முக்கியமான கற்றல் முன்னுதாரணம் இல்லை என்று வாதிடுகிறார்: "சிஸ்டம் ப்ராம்ப்ட் கற்றல்." முன்-பயிற்சி அறிவைப் பெறுகிறது, மேலும் நுண்-சரிப்படுத்தல் பழக்கவழக்க நடத்தைகளை வளர்க்கிறது; இரண்டுமே மாதிரி அளவுருக்களை மாற்றுவதை உள்ளடக்குகின்றன. இருப்பினும், மனித கற்றலில் பெரும்பாலானவை ஒரு "சிஸ்டம் ப்ராம்ப்ட்டை" புதுப்பிப்பதை ஒத்திருக்கிறது—ஒரு சிக்கலை எதிர்கொண்ட பிறகு நாம் ஏதாவது ஒன்றைக் கண்டுபிடிக்கும்போது, அதை நமக்காக வெளிப்படையாக எழுதிக் கொள்கிறோம், "அடுத்த முறை இந்த வகை சிக்கலை எதிர்கொண்டால், நான் முதலில் இந்த முறையை முயற்சிக்க வேண்டும்" போன்று. கார்பதி சுட்டிக்காட்டுகிறார், LLM-கள் Memento திரைப்படத்தின் கதாநாயகனைப் போன்றவை—ஒவ்வொரு முறையும் எழுந்திருக்கும்போது முன்பு என்ன நடந்தது என்பதை நினைவில் கொள்ளாமல் இருப்பார்கள், மேலும் நாம் அவர்களுக்கு விஷயங்களைப் பதிவு செய்ய ஒரு நோட்டுப் புத்தகத்தையும் கொடுக்கவில்லை. Claude-ன் சிஸ்டம் ப்ராம்ப்ட்டை (தோராயமாக 17,000 வார்த்தைகள், பதிப்பைப் பொறுத்து மாறுபடும்) படித்த பிறகு, அதில் பல பொதுவான சிக்கல் தீர்க்கும் உத்திகள் இருப்பதைக் கண்டறிந்தார், அவை: "சொற்கள், எழுத்துக்கள் மற்றும் எழுத்துகளை எண்ணச் சொன்னால், Claude பதிலளிப்பதற்கு முன் படிப்படியாக சிந்திக்க வேண்டும், ஒவ்வொரு எழுத்துக்கும் ஒரு எண்ணை ஒதுக்கி வெளிப்படையாக எண்ண வேண்டும்." இந்த விதி, "ஸ்ட்ராபெர்ரியில் எத்தனை 'r' உள்ளன?" போன்ற கேள்விகளைக் கையாள்வதற்காகவே உள்ளது.

இந்த வகை அறிவு மனிதர்களால் கைவினைப்பொருளாக உருவாக்கப்படக் கூடாது, மாறாக சிஸ்டம் ப்ராம்ப்ட் கற்றலில் இருந்து வர வேண்டும் என்று கார்பதி நம்புகிறார். இது வலுவூட்டல் கற்றலுடன் ஒற்றுமைகளைக் கொண்டுள்ளது—இரண்டும் எதிர்கால நடத்தையை மேம்படுத்த தோல்வி நிகழ்வுகளைப் பயன்படுத்துகின்றன. இருப்பினும், அவற்றின் கற்றல் வழிமுறைகள் வேறுபடுகின்றன: சிஸ்டம் ப்ராம்ப்ட் கற்றல் நேரடியாக சிஸ்டம் ப்ராம்ப்ட் உரையை மாற்றியமைக்கிறது, அதேசமயம் வலுவூட்டல் கற்றல் சாய்வு இறக்கத்தின் மூலம் மாதிரி அளவுருக்களை சரிசெய்கிறது. பின்னூட்ட சேனலின் "பரிமாணத்தன்மை"யில் உள்ள வேறுபாடு காரணமாக முந்தையது கணிசமாக அதிக தரவுத் திறனைக் கொண்டுள்ளது. இதுவே விளைவு அடிப்படையிலான வலுவூட்டல் கற்றலில் கார்பதியின் விமர்சனமாகும்: ஒரு ஒற்றை அளவுகோல் விளைவு வெகுமதி (எ.கா., "சரி/தவறு") ஒரு முழுமையான இயற்கை மொழி பின்நோக்கு ஆய்வை விட ("பணத்தைத் திரும்பப்பெறும் செயல்முறையைத் தொடங்குவதற்கு முன் நீங்கள் முதலில் ID-ஐ சரிபார்த்திருக்க வேண்டும்") மிகக் குறைந்த தகவல் அலைவரிசையைக் கொண்டுள்ளது. இதன் விளைவாக, அதே தோல்வியிலிருந்து, சிஸ்டம் ப்ராம்ப்ட் கற்றல் "சரி/தவறு" என்ற ஒற்றை பிட்டை விட அதிக தகவலை உள்வாங்க முடியும்.

என் பார்வையில், சிஸ்டம் ப்ராம்ப்ட் கற்றலின் சாராம்சம், விளிம்பு நிலை நிகழ்வுகள் மூலம் விதி எல்லைகளைக் கூர்மைப்படுத்துவதே ஆகும். பெரும்பாலான விதிகள் வழக்கமான சூழ்நிலைகளில் நன்றாக வேலை செய்கின்றன; உண்மையான சவால் சாம்பல் பகுதிகளில் உள்ளது—"பயனரின் கோரிக்கை உங்கள் திறன்களை மீறும் போது ஒரு மனித ஏஜெண்டுக்கு மாற்றவும்" என்பது தெளிவாகத் தெரிகிறது, ஆனால் "கொள்கையில் பயனர் அதிருப்தி" என்பது திறன்களை மீறுவதாக கணக்கிடப்படுமா? விதிவிலக்குகளுக்கான பயனர் கோரிக்கைகள் பற்றி என்ன? இந்த விளிம்பு நிலை நிகழ்வுகள் விதிகளின் உண்மையான அர்த்தத்தை வரையறுக்கின்றன.

எடைகளை சரிசெய்ய பாரிய தரவுகளில் மீண்டும் மீண்டும் சோதனை மற்றும் பிழை தேவைப்படும் வலுவூட்டல் கற்றலுடன் ஒப்பிடும்போது, சிஸ்டம் ப்ராம்ப்ட் கற்றல் ஒரு அல்லது சில விளிம்பு நிலை நிகழ்வுகளிலிருந்து விரைவாக கற்றுக்கொள்ள முடியும். ஒரு தோல்வி நிகழ்வைச் சந்தித்தவுடன், நுண் சரிப்படுத்தலுக்கு ஆயிரக்கணக்கான ஒத்த மாதிரிகளை சேகரிக்கத் தேவையில்லாமல், சிஸ்டம் ப்ராம்ப்ட்டில் உடனடியாக ஒரு தெளிவான விதியைச் சேர்க்க முடியும். இந்த கற்றல் தரவுத் திறன் கொண்டது மட்டுமல்லாமல் முழுமையாக விளக்கக்கூடியதாகவும் உள்ளது—ஒவ்வொரு விதியும் எளிய உரையில் எழுதப்பட்டுள்ளது, தணிக்கை செய்யக்கூடியது, மாற்றியமைக்கக்கூடியது மற்றும் நீக்கக்கூடியது. விளிம்பு நிலை நிகழ்வுகள் குவிவதால், சிஸ்டம் ப்ராம்ப்ட் படிப்படியாக ஒரு விரிவான "சிக்கல் தீர்க்கும் கையேடாக" உருவாகிறது, ஒரு நிபுணர் வேலையில் தனது குறிப்புகளை தொடர்ந்து செம்மைப்படுத்துவது போல.

இதை எவ்வாறு தானியக்கமாக்குவது? முக்கியமானது ஒரு குறியீட்டு ஏஜெண்ட் (Coding Agent) ஐ அறிமுகப்படுத்துவதாகும். சிஸ்டம் ப்ராம்ப்ட்கள் (System prompts) மற்றும் கருவி விளக்கங்கள் (tool descriptions) ஆகியவை பல கோப்புகளில் சிதறிக்கிடக்கும் ஆவணங்கள் மற்றும் குறியீடுகளாகும். ஒரு விளிம்பு நிலை (edge case) கண்டுபிடிக்கப்படும்போது, குறியீட்டு ஏஜெண்ட்: (1) தற்போதைய சிஸ்டம் ப்ராம்ப்ட்டைப் படித்துப் புரிந்துகொண்டு, விதி அமைப்பு மற்றும் தோல்வி சூழலை பகுப்பாய்வு செய்யலாம்; (2) துல்லியமான குறியீடு-நிலை வேறுபாடுகளை (code-level diffs) உருவாக்கி, எந்த கோப்பு மற்றும் இடத்தை மாற்றியமைக்க வேண்டும், என்ன மாற்றங்களைச் செய்ய வேண்டும் என்பதைக் குறிப்பிடலாம்; (3) நிலைத்தன்மையைப் பேணி, புதிய விதிகள் முரண்பாடுகள் அல்லது தேவையற்ற நகல்களை அறிமுகப்படுத்தாமல் இருப்பதை உறுதி செய்யலாம். இறுதி மதிப்பாய்வு அதிகாரம் மனித நிபுணர்களிடம் உள்ளது, அவர்கள் இந்த வேறுபாடுகளை ஆராய்ந்து அவற்றின் நியாயத்தன்மையை தீர்மானிக்கிறார்கள்.

தானியங்கி சிஸ்டம் ப்ராம்ப்ட் மேம்படுத்தல் (Automated prompt optimization) என்பது கார்பதியின் யோசனை மட்டுமல்ல; இது கல்வியில் நன்கு நிறுவப்பட்ட ஆராய்ச்சிப் பகுதியாகும். DSPy[^dspy-2023] சிஸ்டம் ப்ராம்ப்ட்களை ஒரு நிரலின் மேம்படுத்தக்கூடிய அளவுருக்களாக (optimizable parameters) கருதுகிறது: டெவலப்பர்கள் ஒவ்வொரு தொகுதிக்கும் "என்ன உள்ளே செல்கிறது மற்றும் என்ன வெளியே வருகிறது" என்பதை மட்டுமே அறிவிக்கிறார்கள், மேலும் கட்டமைப்பு (framework) தானாகவே ஒரு மதிப்பீட்டுத் தொகுப்பில் (evaluation set) எடுத்துக்காட்டு சேர்க்கைகள் மற்றும் அறிவுறுத்தல் சொற்றொடர்களைத் தேடுகிறது, இதனால் சிஸ்டம் ப்ராம்ப்ட் பொறியியலை (prompt engineering) கைமுறை பிழைத்திருத்தத்திலிருந்து முறையான மேம்படுத்தலாக மாற்றுகிறது. OPRO[^opro-2023] LLM ஐ மேம்படுத்தியாக (optimizer) செயல்பட அனுமதிக்கிறது: வரலாற்று சிஸ்டம் ப்ராம்ப்ட்கள் மற்றும் அவற்றின் மதிப்பெண்களை சூழலாகப் பயன்படுத்தி, மாதிரி மீண்டும் மீண்டும் சிறந்த மறு எழுத்துக்களை முன்மொழிகிறது, இது கணித பகுத்தறிவு போன்ற பணிகளில் மனித வடிவமைக்கப்பட்ட சிஸ்டம் ப்ராம்ப்ட்களை விட சிறப்பாக செயல்படுகிறது. GEPA[^gepa-2025], 2025 இல் முன்மொழியப்பட்டது, மேலும் முன்னேறுகிறது: இது தோல்வி பாதைகளில் (failure trajectories) இயற்கை மொழி பிரதிபலிப்பை (natural language reflection) செய்கிறது, அதற்கேற்ப சிஸ்டம் ப்ராம்ப்ட்களைப் பரிணமிக்கச் செய்கிறது, மேலும் பல வேட்பாளர்களிடையே (candidates) ஒரு பரேட்டோ முன்னணியை (Pareto frontier) பராமரிக்கிறது (அதாவது, ஒவ்வொன்றும் தனித்துவமான பலங்களைக் கொண்ட வேட்பாளர்களின் தொகுப்பு, அங்கு ஒன்றை மற்றொன்றால் முழுமையாக மிஞ்ச முடியாது, ஒரே ஒரு "உகந்த" தீர்வை மட்டும் வைத்திருப்பதற்கு பதிலாக) நிரப்பு மேம்படுத்தல் திசைகளைப் பாதுகாக்க—பல பணிகளில் GRPO நுண் சரிப்படுத்தலை (GRPO fine-tuning) (அத்தியாயம் 7 இல் அறிமுகப்படுத்தப்பட்டது) விட சிறப்பாக செயல்படுகிறது, அதே நேரத்தில் ஒன்று முதல் இரண்டு அளவு வரிசைகள் குறைவான மாதிரிகள் தேவைப்படுகிறது. GEPA தான் இந்தப் பகுதி "சிஸ்டம் ப்ராம்ப்ட் கற்றல்" (system prompt learning) என்று அழைப்பது, மேலும் அதன் அனுபவ முடிவுகள் பின்னூட்ட தகவல் அளவு (feedback information volume) பற்றிய முந்தைய தீர்ப்பை ஆதரிக்கின்றன.

[^dspy-2023]: Khattab, O., et al. DSPy: Compiling Declarative Language Model Calls into Self-Improving Pipelines. arXiv:2310.03714, 2023.

[^opro-2023]: Yang, C., et al. Large Language Models as Optimizers. arXiv:2309.03409, 2023.

[^gepa-2025]: Agrawal, L. A., et al. GEPA: Reflective Prompt Evolution Can Outperform Reinforcement Learning. arXiv:2507.19457, 2025.

இந்த தானியங்கி கட்டமைப்புகள் "கோடிங் ஏஜெண்ட் டிஃப்களை உருவாக்குகிறது + மனித மதிப்பாய்வு" அணுகுமுறையிலிருந்து மூன்று அம்சங்களில் வேறுபடுகின்றன. முதலாவதாக, ஆஃப்லைன் எதிராக ஆன்லைன்: தானியங்கி கட்டமைப்புகள் பொதுவாக ஆஃப்லைன் மதிப்பீட்டுத் தொகுப்புகளில் தொகுதி உகப்பாக்கத்தைச் செய்கின்றன, அதேசமயம் டிஃப் அணுகுமுறை உற்பத்தி சூழலில் உள்ள விளிம்பு நிகழ்வுகளுடன் படிப்படியாக உருவாகிறது. இரண்டாவதாக, மனித மேற்பார்வையுடன் அல்லது இல்லாமல்: தானியங்கி கட்டமைப்புகள் முழுமையாக தானாகவே எழுதுகின்றன, இது திறமையானது ஆனால் மதிப்பீட்டுத் தொகுப்பிற்கு அதிகமாகப் பொருந்தக்கூடிய "விசித்திரமான" சொற்றொடர்களை உருவாக்கலாம்; டிஃப் அணுகுமுறை மனித மதிப்பாய்வைத் தக்கவைத்துக்கொள்கிறது, ஒவ்வொரு விதியையும் விளக்கக்கூடியதாகவும் பொறுப்புக்கூறக்கூடியதாகவும் ஆக்குகிறது, வாடிக்கையாளர் சேவை போன்ற அதிக ஆபத்துள்ள சூழ்நிலைகளுக்கு மிகவும் பொருத்தமானது. மூன்றாவதாக, மதிப்பீட்டுத் தொகுப்பின் தேவை: DSPy, OPRO மற்றும் GEPA அனைத்தும் தேடலை இயக்க மதிப்பெண் பெற்ற பணித் தொகுப்புகளை நம்பியுள்ளன, அதேசமயம் டிஃப் அணுகுமுறைக்கு ஒரு தோல்வி நிகழ்வு மற்றும் ஒரு மனித கருத்து மட்டுமே தேவை. நடைமுறையில், அவை ஒன்றையொன்று பூர்த்தி செய்யலாம்: தொடக்கக் சிஸ்டம் ப்ராம்ப்ட்டின் தொகுதி உகப்பாக்கத்திற்கு தானியங்கி கட்டமைப்புகளைப் பயன்படுத்தவும், பின்னர் வரிசைப்படுத்தலுக்குப் பிறகு தொடர்ச்சியான பரிணாம வளர்ச்சிக்கு டிஃப் அணுகுமுறையைப் பயன்படுத்தவும்.

சோதனை 8-3 ★★: சிஸ்டம் ப்ராம்ப்ட்களின் தானியங்கி உகப்பாக்கம்

சோதனை இலக்கு: மனித கருத்தின் அடிப்படையில் ஒரு தானியங்கி சிஸ்டம் ப்ராம்ப்ட் கற்றல் பொறிமுறையை செயல்படுத்தவும்.

தொழில்நுட்ப அணுகுமுறை: tau-bench விமான நிறுவன வாடிக்கையாளர் சேவை சூழ்நிலையின் அடிப்படையில் ஒரு சிஸ்டம் ப்ராம்ப்ட் கற்றல் பணிப்பாய்வை வடிவமைக்கவும். ஆரம்ப ஏஜெண்ட்டின் மனித மாற்றல் விதி "உங்கள் செயல் வரம்பிற்குள் கையாள முடியாதபோது மட்டுமே மாற்றவும்" என்பதாகும். மதிப்பீடு, ஏஜெண்ட் அதிகமாக மாற்றுவதை வெளிப்படுத்துகிறது—கொள்கை தகராறை எதிர்கொள்ளும்போது பயனருக்குக் கொள்கையை விளக்க முயற்சிப்பதற்குப் பதிலாக உடனடியாக ஒரு மனிதருக்கு மாற்றுகிறது. மனித நிபுணர் கருத்து, கொள்கை தகராறுகளை மாற்றுவதன் மூலம் அல்ல, பொறுமையாகக் கொள்கையை விளக்குவதன் மூலம் கையாள வேண்டும் என்பதைக் குறிக்கிறது. கோடிங் ஏஜெண்ட் சிஸ்டம் ப்ராம்ப்ட் கோப்பைப் படித்து, தொடர்புடைய விதியைக் கண்டறிந்து, ஒரு துல்லியமான மாற்றத்தை உருவாக்குகிறது: மாற்றல் எல்லையை "பயனர் வெளிப்படையாக ஒரு மனித ஏஜெண்ட்டைக் கோருதல் + அவசர பாதுகாப்பு சூழ்நிலைகள்" என தெளிவுபடுத்துதல், "கொள்கை தகராறு காரணமாக ஒருபோதும் மாற்ற வேண்டாம்" என்ற எதிர்மறை விதியைச் சேர்த்தல் மற்றும் குறியீடு மட்ட மாற்றங்களைச் செயல்படுத்துதல்.

கட்டுப்பாட்டுக் குழு: கைமுறையாகச் சரிசெய்யப்பட்ட சிஸ்டம் ப்ராம்ப்ட்கள் (தானியங்கி உகப்பாக்கம் செயல்முறை இல்லாமல்).

எதிர்பார்க்கப்படும் கவனிப்பு/ஏற்பு அளவுகோல்கள்: உகப்பாக்கப்பட்ட சிஸ்டம் ப்ராம்ப்ட்கள் அசல் தக்கவைக்கப்பட்ட பணித் தொகுப்பில் எந்த செயல்திறன் சரிவையும் காட்டவில்லை (புதிய விதிகள் இருக்கும் சரியான நடத்தைகளை உடைக்கவில்லை), அதேசமயம் அதிக மாற்றலைத் தூண்டும் விளிம்பு நிகழ்வுகளின் தொகுப்பில் துல்லியம் மேம்படுகிறது—அதாவது, கொள்கை தகராறுகளுக்கு, ஏஜெண்ட் இனி உடனடியாக மாற்றாது, மாறாக முதலில் கொள்கையை விளக்க முயற்சிக்கிறது.

நீண்ட பணிகளின் குறுக்கு-அமர்வு தொடர்ச்சி (பொறியியல் ஆதரவு பிற்சேர்க்கை)

கண்டிப்பாகச் சொன்னால், இந்தப் பகுதி அனுபவ வடிகட்டல் (experience distillation) பொறிமுறையைப் பற்றி விவாதிக்கவில்லை, மாறாக சுய-பரிணாமத்திற்கான பொறியியல் ஆதரவு பற்றி விவாதிக்கிறது (அட்டவணை 8-2 இல் உள்ள "பொறியியல் ஆதரவு" அடுக்குடன் தொடர்புடையது): "வெளிப்படுத்துதல்" (externalization) கருத்தை பணி நிலை மேலாண்மைக்குப் பயன்படுத்துவது, "கற்றுக்கொண்ட" அனுபவங்கள் மற்றும் "பகுதியாக முடிக்கப்பட்ட வேலை" ஆகிய இரண்டும் அமர்வுகள் முழுவதும் நீடிக்க அனுமதிக்கிறது. இது அத்தியாயம் 5 இலிருந்து கோடிங் ஏஜெண்ட் பணிப்பாய்வுடன் ஒத்துப்போகிறது மற்றும் இந்த அத்தியாயத்தில் வைக்கப்பட்டுள்ளது, ஏனெனில் இது அதே மைய நுட்பத்தை—மாதிரிக்கு வெளியே நிலையை எழுதுதல்—சார்ந்துள்ளது. பல பணிகள் (எ.கா., புதிதாக ஒரு முழுமையான பயன்பாட்டை உருவாக்குதல்) ஒரு ஒற்றை அமர்வின் சூழல் சாளரத்தை (context window) விட அதிகமாக உள்ளன. சூழல் சுருக்கம் (context compression) இயக்கப்பட்டிருந்தாலும், இரண்டு வகையான சிக்கல்கள் நீடிக்கின்றன: ஒரே அமர்வுக்குள் முழு பயன்பாட்டையும் முடிக்க முயன்றால் சூழல் முதலில் தீர்ந்துவிடும்; அல்லது, அதில் ஒரு பகுதியை மட்டும் முடித்து, அடுத்த அமர்வு முன்னேற்றத்தை துல்லியமாக மீட்டெடுக்க முடியாமல், பணியை முன்கூட்டியே முடிந்ததாக தீர்மானிக்கும்.

மிகவும் நிலையான அணுகுமுறை, நீண்ட பணிகளை இரண்டு பாத்திரங்களாகப் பிரிப்பதாகும்: ஒரு தொடக்க ஏஜெண்ட் (Initializer Agent) மற்றும் ஒரு கோடிங் ஏஜெண்ட் (Coding Agent)—ஒரு திட்ட மேலாளர் முதலில் பணிகளைப் பிரித்து ஒரு சரிபார்ப்புப் பட்டியலை (checklist) எழுதுவதைப் போலவும், பின்னர் ஒரு பொறியாளர் பட்டியலில் உள்ள உருப்படிகளை முடிப்பதைப் போலவும். தொடக்க ஏஜெண்ட் முதல் சுற்றில் ஒருமுறை மட்டுமே இயங்குகிறது, இது ஒரு கட்டமைக்கப்பட்ட அம்சப் பட்டியலை (எ.கா., feature-list.json), ஒரு தொடக்க ஸ்கிரிப்டை, ஒரு ஆரம்ப கிட் கமிட் (initial git commit), மற்றும் ஒரு முன்னேற்றக் கோப்பை (எ.கா., progress.json) உருவாக்கி, பணியை ஒரு நிலையான கோப்பு முறைமை நிலையாக (persistent file system state) மாற்றுகிறது. அடுத்தடுத்த அமர்வுகள் கோடிங் ஏஜெண்ட்டால் ஒரு வளையத்தில் (loop) செயல்படுத்தப்படுகின்றன: ஒவ்வொரு முறையும், அது முன்னேற்றக் கோப்பு மற்றும் கிட் லாக் (git log) ஆகியவற்றிலிருந்து சூழலை மீட்டெடுக்கிறது, செயல்படுத்த வேண்டிய தற்போதைய அம்சத்தைக் கண்டறிகிறது, அதைச் செயல்படுத்தி சோதனைகளை இயக்குகிறது, முன்னேற்றக் கோப்பில் உள்ள passes புலத்தைப் புதுப்பிக்கிறது, குறியீட்டை கமிட் செய்து, வெளியேறுகிறது. முக்கிய கட்டுப்பாடுகள்: முன்னேற்றம் கோப்புகளில் சேமிக்கப்படுகிறது, சூழலில் அல்ல; அம்சப் பட்டியல் மார்க் டவுனுக்குப் பதிலாக JSON ஐப் பயன்படுத்துகிறது (கட்டமைக்கப்பட்ட வடிவங்கள் மாதிரி படிப்பதற்கும் எழுதுவதற்கும் மிகவும் நிலையானவை); அனைத்து அம்சங்களுக்கும் passes: true இருக்கும்போதுதான் பணி முடிந்ததாகக் கருதப்படுகிறது. இந்த வழியில், நடுவில் ஒரு செயலிழப்பு (crash) ஏற்பட்டாலும், பணியை கோப்பு முறைமையில் உள்ள நிலையிலிருந்து நேரடியாகத் தொடரலாம்—ஒரு பணி அரை மணி நேரத்தைத் தாண்டியவுடன், செயலிழப்பு மீட்பு (crash recovery) ஒரு விருப்பமல்ல, ஒரு தேவையாகும்.

கருவி பயனரிடமிருந்து கருவி உருவாக்குநராக

அத்தியாயம் 4 இன் "முனைப்பான கருவி கண்டுபிடிப்பு" பிரிவு "ஏற்கனவே உள்ள கருவிகளிலிருந்து பொருத்தமானதைக் கண்டறிதல்" என்ற பிரச்சினையைத் தீர்க்கிறது. இந்த அத்தியாயம் அடுத்து ஒரு மேலும் மேம்பட்ட திறனைப் பற்றி விவாதிக்கிறது: தேவையான கருவி வெறுமனே இல்லாதபோது, ஒரு ஏஜெண்ட் எவ்வாறு தன்னாட்சியுடன் புதிய கருவிகளைக் கண்டுபிடித்து உருவாக்க முடியும்?

முன்வரையறுக்கப்பட்ட கருவித் தொகுப்புகளின் அடிப்படை வரம்பு

தற்போதைய AI ஏஜெண்ட் அமைப்புகள் பெரும்பாலும் ஒரு மறைமுகமான அனுமானத்தின் அடிப்படையில் கட்டமைக்கப்பட்டுள்ளன: பெரும்பாலான பணிகளைக் கையாள போதுமான முழுமையான கருவித் தொகுப்பை முன்வரையறுக்க முடியும். இது மூடிய களங்களில் பொருந்தக்கூடும்—ஒரு பிரத்யேக வாடிக்கையாளர் சேவை ஏஜெண்ட்டுக்கு ஒரு டஜன் கருவிகள் மட்டுமே தேவைப்படலாம். ஆனால் உண்மையிலேயே பொது-நோக்க ஏஜெண்டை உருவாக்குவதே இலக்கு என்றால், இந்த அனுமானம் வெறும் ஆசைக் கனவே.

அடிப்படை சிரமம் என்னவென்றால், நிஜ உலகில் தேவைப்படும் கருவிகளின் எண்ணிக்கை கிட்டத்தட்ட முடிவில்லாதது மற்றும் முன்கூட்டியே கணக்கிட முடியாது; நூலகத்தில் இதேபோன்ற கருவி இருந்தாலும், அதன் இடைமுகம் மற்றும் அளவுருக்கள் பெரும்பாலும் தற்போதைய தேவையுடன் சரியாகப் பொருந்தாது, இது திறமையின்மை அல்லது பிழைகளுக்கு வழிவகுக்கும்; ஏஜெண்ட்-நட்பு நிலையான இடைமுகங்களாக இல்லாத ஏராளமான பயனுள்ள சேவைகளைக் குறிப்பிடவேண்டியதில்லை, ஒவ்வொரு தழுவலுக்கும் கைமுறை மேம்பாடு தேவைப்படுகிறது. இறுதியில், முன்வரையறுக்கப்பட்ட முன்னுதாரணம், ஏஜெண்ட்டின் திறன் எல்லையை மனித பொறியாளர்களின் முன்கணிப்பு மற்றும் தயாரிப்பிற்குள் பூட்டிவைக்கிறது.

முன்வரையறையிலிருந்து சுய-பரிணாமத்திற்கு

இந்த வரம்பை உடைக்க ஒரு அடிப்படை மாற்றம் தேவைப்படுகிறது: ஏஜெண்ட்டை ஒரு கருவி பயனரிடமிருந்து கருவி உருவாக்குநராக உயர்த்துதல். ஏஜெண்ட் இனி மனிதர்கள் கருவிகளைத் தயாரிக்க காத்திருக்காமல், பணித் தேவைகளின் அடிப்படையில் திறந்த உலகத்திலிருந்து செயலில் கருவிகளைத் தேடி, கற்றுக்கொண்டு, தழுவி, உருவாக்குகிறது—இதுவே இந்த அத்தியாயத்தின் தொடக்கத்தில் குறிப்பிடப்பட்ட சுய-பரிணாமத்தின் இரண்டாவது பரிமாணம்.

மைய யோசனை, ஏஜெண்ட்டுக்கு ஒரு தொடக்கப் புள்ளியாக குறைந்தபட்ச அடிப்படைத் திறன்களை வழங்குவதாகும், இது சூழலுடனான தொடர்பு மற்றும் வெளிப்புற வளங்களைப் பயன்படுத்துவதன் மூலம் அதன் திறன் எல்லைகளை தன்னாட்சியுடன் விரிவுபடுத்த அனுமதிக்கிறது. Alita கட்டுரையில் [^alita-2025] முன்மொழியப்பட்டுள்ளபடி—"குறைந்தபட்ச முன்வரையறை, அதிகபட்ச சுய-பரிணாமம்": கவனமாக வடிவமைக்கப்பட்ட ஒரு சிறிய அடிப்படைக் கருவிகள் தொகுப்பு, உலகத்துடன் தொடர்பு கொள்ளும் அடிப்படைத் திறனை வழங்குகிறது, அதே நேரத்தில் சுய-பரிணாம வழிமுறை இந்த அடித்தளத்தில் வரம்பற்ற விரிவாக்கத் திறனை வழங்குகிறது.

[^alita-2025]: Qiu, J., et al. Alita: Generalist Agent Enabling Scalable Agentic Reasoning with Minimal Predefinition and Maximal Self-Evolution. arXiv:2505.20286, 2025.

சுய-பரிணாமம் முன்வரையறுக்கப்பட்ட கருவிகளின் மதிப்பை மறுக்கவில்லை, மாறாக ஒரு படிநிலை திறன் அமைப்பை உருவாக்குகிறது. இந்த முன்னுதாரண மாற்றத்தின் திறவுகோல், உலகளாவிய திறந்த மூல சுற்றுச்சூழல் அமைப்பை Agent-க்கு கிடைக்கும் வளக் குளமாக மாற்றுவதாகும்—ஒரு புதிய பணியை எதிர்கொள்ளும்போது, மனிதர்கள் கருவிகளைத் தயாரிக்க காத்திருப்பதற்குப் பதிலாக, அது நேரடியாகத் தேவைக்கு மிகவும் பொருந்தக்கூடிய நூலகத்தைத் தேடுகிறது, தேவைப்படும்போது அவற்றை இணைக்க ஒட்டு குறியீட்டை (glue code) எழுதுகிறது. பயன்படுத்தப்பட்ட கருவிகள் குவிக்கப்படுகின்றன, அடுத்த முறை இதேபோன்ற பணி எழும்போது, சக்கரத்தை மீண்டும் கண்டுபிடிக்காமல் நேரடியாக அவற்றை அழைக்கலாம்.

ஏஜெண்ட் தானே இணையத்திலிருந்து கருவிகளைக் கண்டுபிடித்து இயக்குகிறது

படம் 8-3: Agent சுய-பரிணாம குழாய் (தேவை அடையாளம் காண்பதிலிருந்து கருவி பதிவு செய்வது வரை)

MCP (Model Context Protocol, அத்தியாயம் 4 இல் விரிவாக விளக்கப்பட்டுள்ளது) என்பது Agent-கள் கருவிகளைக் கண்டுபிடித்து அழைப்பதற்கான நிலையான நெறிமுறையாகும்—இதை "கருவி சந்தையின் தகவல் தொடர்பு விவரக்குறிப்பு" என்று புரிந்து கொள்ளலாம், இதன் மூலம் Agent கிடைக்கக்கூடிய கருவிகளை உலாவுகிறது, உள்ளீடு/வெளியீடு வடிவங்களைப் புரிந்துகொள்கிறது, மற்றும் நம்பகத்தன்மையுடன் அழைப்புகளைத் தொடங்குகிறது. Alita அமைப்பை உதாரணமாக எடுத்துக்கொண்டு ஒரு குறிப்பிட்ட பணியைப் பார்ப்போம்: "தி லார்ட் ஆஃப் தி ரிங்ஸ் படத்தில் கோலத்திற்குக் குரல் கொடுத்த நடிகர் விவரிக்கும், மார்ச் 2018 இல் வெளியிடப்பட்ட ஒரு YouTube 360 VR வீடியோவில், ஒரு டைனோசர் முதன்முதலில் காட்டப்பட்ட உடனேயே விவரிப்பாளர் எந்த எண்ணைக் குறிப்பிடுகிறார்?" இந்தப் பணிக்கு ஒரு குறிப்பிட்ட டொமைன் திறன் தேவைப்படுகிறது—வீடியோ உள்ளடக்கத்தைப் பிரித்தெடுத்து பகுப்பாய்வு செய்தல். Agent "முடியாது" என்று புகாரளிக்காது, மாறாக பல-நிலை சுய-பரிணாம செயல்முறையைத் தொடங்கும்:

  1. MCP யோசனைத் திரட்டல் (Brainstorming) நிலை: பணித் தேவைகளை பகுப்பாய்வு செய்து, "YouTube வீடியோ வசன பிரித்தெடுப்பான்" தேவையை அடையாளம் காணுதல். குறிப்பிட்ட செயலாக்கமானது, LLM பணித் தேவைகளை பகுப்பாய்வு செய்து, ஒரு தொகுப்பு வேட்பாளர் கருவி விளக்கங்களை (எ.கா., "YouTube வசனங்களைப் பெறக்கூடிய ஒரு கருவி") உருவாக்கி, பின்னர் பொருந்தக்கூடிய தற்போதைய சேவையகங்களுக்காக MCP சேவையகப் பதிவேட்டில் தேடுதல் அல்லது அவற்றை உருவாக்க வேண்டியவை எனக் குறிப்பிடுதல் ஆகியவற்றை உள்ளடக்கியது.
  2. Web Agent செயல்படுத்தும் நிலை: திறந்த மூல களஞ்சியங்களைத் தேடி, Python நூலகமான youtube-transcript-api (GitHub: jdepoix/youtube-transcript-api) ஐக் கண்டறிதல்.
  3. மேலாளர் Agent தொகுப்பு நிலை: GitHub களஞ்சியத்தைப் பார்வையிட்டு, README மற்றும் குறியீடு உதாரணங்களைப் படித்து, முக்கிய API ஐப் புரிந்துகொண்டு, சூழல் கட்டமைப்பு மற்றும் குறியீடு கட்டமைப்பை ஊகித்தல்.
  4. மேலாளர் Agent செயல்படுத்தும் நிலை: கற்றுக்கொண்ட அறிவை MCP நெறிமுறைக்கு இணங்கும் ஒரு கருவியாக உள்ளடக்கி, இலக்கு வீடியோவின் வசனங்களைப் பிரித்தெடுத்து, உள்ளடக்கத்தை பகுப்பாய்வு செய்து, "100000000" என்ற பதிலைக் கண்டறிதல்.

புதிதாக உருவாக்கப்பட்ட கருவி கருவி நூலகத்தில் சேமிக்கப்படுகிறது, எதிர்காலத்தில் இதேபோன்ற வீடியோ பகுப்பாய்வு பணிகளை எதிர்கொள்ளும்போது நேரடியாக மீண்டும் பயன்படுத்தத் தயாராக உள்ளது.

ஏஜெண்ட் புதிய கருவிகளை உருவாக்க குறியீடு எழுதுகிறது

திறந்த மூல சுற்றுச்சூழல் அமைப்பிலிருந்து தற்போதைய கருவிகளை ஒருங்கிணைப்பது முதல் முறையாகும், ஆனால் அனைத்துத் தேவைகளுக்கும் ஆயத்த தீர்வுகள் இருப்பதில்லை. Agent இரண்டாவது திறனையும் வெளிப்படுத்த வேண்டும்: புதிய கருவிகளை உருவாக்க புதிதாக குறியீடு எழுதுதல்.

இந்த அத்தியாயத்தின் தொடக்கத்தில் வரையறுக்கப்பட்டபடி, கருவி உருவாக்கம் என்பது வெளிப்புறமயமாக்கப்பட்ட கற்றலின் உயர்-வரிசை வடிவமாகும்—இங்கே, நாம் ஒரு படி மேலே சென்று, "செயல்முறையையும்" துல்லியமாக செயல்படுத்தக்கூடிய குறியீடு கருவிகளாக வெளிப்புறமயமாக்குகிறோம். இங்கு முக்கிய வேறுபாடு குறியீட்டின் இலக்கில் உள்ளது: பாரம்பரிய ஏஜெண்ட் அமைப்புகளில், குறியீடு இயக்கம் ஒரு முறை மட்டுமே—பைதான் இன்டர்பிரிட்டர் தற்போதைய பணியை முடிக்க ஒரு ஸ்கிரிப்டை இயக்குகிறது, பின்னர் குறியீடு நிராகரிக்கப்படுகிறது. ஆனால் சுய-பரிணாம முன்னுதாரணத்தில், ஏஜெண்ட் மீண்டும் பயன்படுத்தக்கூடிய, தொகுதி சார்ந்த கருவிகளை உருவாக்கும் நோக்கத்துடன் குறியீட்டை எழுதுகிறது, அவை கருவி நூலகத்தில் நிரந்தரமாக சேமிக்கப்படுகின்றன, மேலும் மாதிரியின் தற்காலிக சூழல் அல்லது அளவுரு நினைவகத்தை சார்ந்திருக்காது. இதற்கு இரண்டு நன்மைகள் உள்ளன: அனுபவம் ஒரு அமர்வின் முடிவில் மறைந்துவிடாமல் நிரந்தரமாக குவிந்துகொள்கிறது; குறியீடு கருவிகள் உறுதியான, சோதிக்கக்கூடிய நடத்தையைக் கொண்டுள்ளன, ஒவ்வொரு முறையும் மாதிரி தீர்வை மீண்டும் சிந்திப்பதை விட இது மிகவும் நம்பகமானது.

உருவாக்கும் செயல்முறையே மென்பொருள் பொறியியலின் வழக்கமான தாளத்தைப் பின்பற்றுகிறது—தேவைகள் விவரக்குறிப்பு மற்றும் இடைமுக வடிவமைப்பிலிருந்து, அல்காரிதம் தேர்வு மற்றும் செயலாக்கம் வரை, சோதனை மற்றும் சரிபார்ப்பு வரை, இறுதியாக MCP நெறிமுறைக்கு இணங்கும் ஒரு ஸ்கீமாவை உருவாக்கி கருவி நூலகத்தில் பதிவு செய்வது வரை. மனித பொறியாளர்களுடன் ஒப்பிடும்போது, ஏஜெண்டுகள் தேவைகளைப் புரிந்துகொள்வதில், பிழைத்திருத்த உள்ளுணர்வில் மற்றும் எல்லை நிபந்தனைகளைக் குறிப்பிடுவதில் பிழைகள் ஏற்பட வாய்ப்புள்ளது. எனவே, உற்பத்தி அமைப்புகள் பொதுவாக அதிக கணினி சக்தியை சோதனை மற்றும் சரிபார்ப்பு கட்டத்திற்கு ஒதுக்குகின்றன, முந்தைய படிகளில் உள்ள நிச்சயமற்ற தன்மையை ஈடுசெய்ய விரிவான தானியங்கி சோதனைகளைப் பயன்படுத்துகின்றன.

Voyager: ஒரு மெய்நிகர் உலகில் தொடர்ந்து கற்றுக் கொள்ளும் ஒரு ஏஜெண்ட்

படம் 8-4: Voyager தொடர்ச்சியான கற்றல் கட்டமைப்பு (பாடத்திட்ட உருவாக்கி → மீள்செயல் தூண்டுதல் பொறிமுறை → திறன் நூலகம்)

ஏஜெண்டுகள் எவ்வாறு சுயாதீனமாக கருவிகளைக் கண்டுபிடித்து உருவாக்க முடியும் என்பதை நாம் விவாதித்தோம். Voyager இந்த கருத்தை Minecraft மெய்நிகர் உலகில் அதன் உச்சநிலைக்குத் தள்ளுகிறது: இது கருவிகளைப் பயன்படுத்துவது மட்டுமல்லாமல், வெற்றிகரமான அனுபவங்களிலிருந்து மீண்டும் பயன்படுத்தக்கூடிய ஒரு திறன் நூலகத்தையும் உருவாக்குகிறது, உண்மையிலேயே "எவ்வளவு பயன்படுத்துகிறீர்களோ அவ்வளவு சிறப்பாகிறது" என்ற சுய-பரிணாமத்தை அடைகிறது.

Voyager என்பது ஒரு திறந்த உலகில் வெளிப்புறமயமாக்கப்பட்ட கற்றலின் ஒரு பொதுவான நடைமுறையாகும். இந்த Minecraft ஏஜெண்ட், ஒவ்வொரு வெற்றிகரமான அனுபவத்தையும் இயங்கக்கூடிய குறியீடு கருவிகளாக வடிகட்டி அவற்றை வெளிப்புறமயமாக்குவதன் மூலம் தொடர்ச்சியான கற்றல் மற்றும் சுய-பரிணாமத்தை அடைகிறது.

அதன் கட்டமைப்பு மூன்று முக்கிய கூறுகளை உள்ளடக்கியது:

தானியங்கி பாடத்திட்ட உருவாக்கி, ஏஜெண்ட்டின் தற்போதைய நிலை, தேர்ச்சி பெற்ற திறன்கள் மற்றும் சுற்றுப்புற சூழலின் அடிப்படையில் அடுத்த ஆய்வு இலக்கை முன்மொழிகிறது (எ.கா., "இரும்புத் தாதுவைக் கண்டுபிடி," "இரும்புக் குந்தாலியை (pickaxe) உருவாக்கு"). இலக்கு ஏஜெண்ட்டின் "அருகாமை வளர்ச்சி மண்டலத்தில்" உள்ளது—மிகவும் எளிமையானதாகவோ அல்லது மிகவும் கடினமானதாகவோ இல்லாமல், விளையாட்டுகளில் உள்ள நிலை வடிவமைப்பைப் போல, படிப்படியாக முன்னேறுகிறது.திறன் நூலகம் (Skill Library) என்பது மைய வழிமுறையாகும். ஒரு புதிய பணியை வெற்றிகரமாக முடித்த பிறகு, செயல் வரிசை இயங்கக்கூடிய குறியீடாக சுருக்கப்பட்டு நிரந்தரமாக சேமிக்கப்படும். திறன்கள் படிநிலை மற்றும் இணைக்கக்கூடியவை—எடுத்துக்காட்டாக, "மரக் குந்தாலி செய்வது" என்பது "மரம் வெட்டுவது" மற்றும் "மரப் பலகைகள் செய்வது" போன்ற அடிப்படை திறன்களை அழைக்கிறது. ஒரு புதிய பணியை எதிர்கொள்ளும்போது, ஏற்கனவே உள்ள திறன்களை மீட்டெடுத்து இணைப்பதன் மூலம், ஒவ்வொரு முறையும் LLM பூஜ்ஜியத்திலிருந்து சிந்திக்க வேண்டிய அவசியமின்றி விரைவான தீர்வை அடைய முடியும்.

மீள்செயல் தூண்டுதல் வழிமுறை (Iterative Prompting Mechanism) திறன்களின் தொடர்ச்சியான முன்னேற்றத்திற்கு பொறுப்பாகும். தோல்வி ஏற்பட்டால், கருத்து சேகரிக்கப்படுகிறது (சூழல் அவதானிப்புகள், பிழை செய்திகள், சுய-சரிபார்ப்பு முடிவுகள்), மேம்படுத்தப்பட்ட குறியீட்டை உருவாக்க வழிகாட்டும் வகையில் LLM தூண்டுதலில் ஒருங்கிணைக்கப்பட்டு, நிலைத்தன்மை அடையும் வரை மீண்டும் மீண்டும் செயல்படுத்தப்படும்.

Voyager Minecraft இல் தன்னாட்சியுடன் ஆராய்கிறது, மேலும் அதன் திறன் நூலகம் தொடர்ந்து வளர்கிறது: இந்த ஆய்வறிக்கை, இது முக்கிய தொழில்நுட்ப மர மைல்கற்களை (மரம், கல், இரும்பு, வைரம்) கணிசமாக வேகமாக திறக்கிறது, அடிப்படை முறைகள் கண்டுபிடித்ததைப் போல 3.3 மடங்கு தனித்துவமான பொருட்களைக் கண்டுபிடிக்கிறது என்று தெரிவிக்கிறது. இந்த தொடர்ச்சியான கற்றல் திறனின் சாராம்சம், வெளிப்புறமயமாக்கப்பட்ட கற்றல் மூலம் "தற்காலிக தழுவலில்" இருந்து "நிரந்தர குவிப்புக்கு" ஒரு பாய்ச்சலை அடைவதாகும்—ஒவ்வொரு வெற்றிகரமான ஆய்வும் மீண்டும் பயன்படுத்தக்கூடிய குறியீடு கருவியாக மாற்றப்படுகிறது. இது இந்த முன்னுதாரணத்தின் சாத்தியத்தை நிரூபிக்கிறது, நிஜ உலகில் சுய-வளர்ச்சியடையும் ஏஜெண்டுகளை உருவாக்குவதற்கான முழுமையான முறைமை வரைபடத்தை வழங்குகிறது—பின்வரும் சோதனை அதை ஒரு நிஜ உலக கருவி கண்டுபிடிப்பு சூழ்நிலையில் பயன்படுத்துகிறது.

சோதனை 8-4 ★★★: சுய-வளர்ச்சியை அடைய இணையத்திலிருந்து கருவிகளைக் கண்டறியும் ஏஜெண்ட்

படம் 8-5: சோதனை 8-4 சுய-வளர்ச்சியடையும் ஏஜெண்ட் குழாய் (தேடல் → மதிப்பீடு → சோதனை → உறையிடுதல் → மறுபயன்பாடு)

அடிப்படை கருவி கட்டமைப்பு: web_search, read_webpage, code_interpreter, create_tool, search_tools மட்டுமே. களம் சார்ந்த முன் வரையறுக்கப்பட்ட கருவிகள் எதுவும் இல்லை.

பணி ஒன்று: YouTube வீடியோ உள்ளடக்க புரிதல்—"தி லார்ட் ஆஃப் தி ரிங்ஸ் படத்தில் கோலத்திற்குக் குரல் கொடுத்த நடிகர் விவரிக்கும், மார்ச் 2018 இல் வெளியிடப்பட்ட ஒரு YouTube 360 VR வீடியோவில், ஒரு டைனோசர் முதன்முதலில் காட்டப்பட்ட உடனேயே விவரிப்பாளர் எந்த எண்ணைக் குறிப்பிடுகிறார்?" எதிர்பார்க்கப்படும் செயல்முறை: ஏஜெண்ட் பணியை பகுப்பாய்வு செய்கிறது, YouTube வசனங்களைப் பிரித்தெடுக்கும் திறனின் தேவையை அடையாளம் காட்டுகிறது; தேடல் மூலம் youtube-transcript-api நூலகத்தையும் அதன் GitHub களஞ்சியத்தையும் கண்டுபிடிக்கிறது; நிறுவல் முறை மற்றும் இடைமுகத்தைப் புரிந்துகொள்ள README மற்றும் ஆவணங்களைப் படிக்கிறது; குறியீடு விளக்கியைப் பயன்படுத்தி நூலகத்தை சோதிக்கிறது; வசனம் பிரித்தெடுக்கும் செயல்பாட்டை ஒரு நிலையான கருவியாக தொகுக்க ரேப்பர் குறியீட்டை எழுதுகிறது; இலக்கு வீடியோவின் வசனங்களைப் பிரித்தெடுக்கவும் உள்ளடக்கத்தை பகுப்பாய்வு செய்யவும் புதிய கருவியைப் பயன்படுத்துகிறது. வெற்றி அளவுகோல்: சரியான பதில் "100000000" ஐ வெளியிடுதல்.

பணி இரண்டு: நிகழ்நேர நிதித் தரவு வினவல்—"இன்றைய நிலவரப்படி, NVIDIA (NVDA) பங்கின் சமீபத்திய விலை என்ன? ஒரு வாரத்திற்கு முன்பு இருந்ததை ஒப்பிடும்போது சதவீத மாற்றம் என்ன?" எதிர்பார்க்கப்படும் செயல்முறை: ஏஜெண்ட் நிகழ்நேர பங்குத் தரவு திறன்களின் தேவையை அடையாளம் காண்கிறது; கிடைக்கக்கூடிய நிதித் தரவு APIகளை (yfinance, Alpha Vantage, போன்றவை) தேடுகிறது; பயன்பாட்டின் எளிமை, API விசைகளின் தேவை மற்றும் தரவு முழுமை ஆகியவற்றின் அடிப்படையில் பல விருப்பங்களை மதிப்பீடு செய்கிறது; மிகவும் பொருத்தமான விருப்பத்தைத் தேர்ந்தெடுத்து ஒரு வினவல் கருவியை உருவாக்குகிறது. ஒரு குறிப்பிட்ட API க்கு தானாக முடிக்க முடியாத பதிவு தேவைப்பட்டால், ஏஜெண்ட் மாயத்தோற்றத்தில் பதிலைப் புனைவதோ நேரடியாகக் கைவிடுவதோ இல்லாமல், மாற்றுத் திட்டத்திற்கு மாற வேண்டும்.

கருவி மறுபயன்பாட்டைச் சரிபார்க்கவும்: இதேபோன்ற வகை பணியை மீண்டும் செயல்படுத்தும்போது, ஏஜெண்ட் மீண்டும் தேடல் மற்றும் உருவாக்கும் செயல்முறைக்குச் செல்வதற்குப் பதிலாக, ஏற்கனவே உருவாக்கப்பட்ட கருவியை கருவி நூலகத்திலிருந்து நேரடியாக மீட்டெடுக்க வேண்டும்.

சவால்கள் மற்றும் சிரமங்கள்: தேடல் துல்லியம் (பொருந்தாத நூலகங்கள் அல்லது காலாவதியான தகவல்களைக் கண்டறியலாம்), ஆவணப்படுத்தல் புரிதல் (சில திறந்த மூல திட்டங்களில் முழுமையற்ற ஆவணங்கள் உள்ளன, பல மூலங்களிலிருந்து தொகுக்க வேண்டும்), சூழல் உள்ளமைவு (சில நூலகங்களில் சிக்கலான சார்புகள் அல்லது கணினி தேவைகள் உள்ளன), பிழை மீட்பு (முதல் முயற்சி தோல்வியடையலாம், ஏஜெண்ட் பிழைத்திருத்தம் மற்றும் திருத்தம் செய்ய வேண்டும்), மாயத்தோற்றக் கட்டுப்பாடு (உண்மையான தேடல் முடிவுகள் மற்றும் ஆவணங்களின் அடிப்படையில் வேலை செய்ய வேண்டும்; ஒரு நூலகம் இருப்பதையோ ஓர் API இன் பயன்பாட்டு முறையையோ வெறுமனே கற்பனை செய்யக்கூடாது).

மூன்று அடுக்கு திறன்களின் தொடர்ச்சியான குவிப்பு

தொடர்ச்சியான கற்றல் மூன்று நிலைகளில் வெளிப்படுகிறது:

  • கருவி நிலை: வெற்றிகரமாக உருவாக்கப்பட்ட கருவிகள் கருவி நூலகத்தில் சேமிக்கப்படுகின்றன. புதிய கருவிகள் ஏற்கனவே உள்ளவற்றின் மீது கட்டமைக்கப்படலாம், இது ஒரு படிநிலை அமைப்பை உருவாக்குகிறது. எடுத்துக்காட்டாக, "பங்கு விலையைப் பெறு" கருவி இருந்த பிறகு, இந்த அடித்தளத்தின் மீது ஒரு "போர்ட்ஃபோலியோ பகுப்பாய்வு" கருவியை உருவாக்க முடியும்.
  • அறிவு நிலை: ஒவ்வொரு கருவி உருவாக்கமும் அறிவுக் குவிப்புடன் சேர்ந்தே வருகிறது. எந்த திறந்த மூல நூலகங்கள் எந்தப் பணிகளுக்கு ஏற்றவை, எந்த APIகளுக்கு விசை விண்ணப்பங்கள் தேவையில்லை, மற்றும் எந்த நூலகங்களுக்கு அடிக்கடி கணினி சூழலுடன் பொருந்தக்கூடிய சிக்கல்கள் உள்ளன என்பதை ஏஜெண்ட் படிப்படியாகக் கற்றுக்கொள்கிறது. இந்த அறிவை ஹூரிஸ்டிக் விதிகள் அல்லது வழக்கு நூலகங்களாகப் பிரித்தெடுத்து, அறிவுத் தளத்தில் (சேமிப்பு மற்றும் மீட்டெடுப்பு வழிமுறைகள் அத்தியாயம் 3 இல் விரிவாக விளக்கப்பட்டுள்ளன) வைத்து, எதிர்கால கருவி உருவாக்கத்தை வழிநடத்தப் பயன்படுத்தலாம்.- உத்தி நிலை: தொடர்ச்சியான பயிற்சியின் மூலம், ஏஜெண்ட் படிப்படியாக தனது சுய-பரிணாம உத்தியை மேம்படுத்துகிறது—ஆரம்பத்தில், அது தவறான நூலகத்தைத் தேர்ந்தெடுக்கலாம், மிகவும் சிக்கலான தர்க்கத்தை எழுதலாம், அல்லது முக்கியமான விளிம்பு நிலைகளைத் தவறவிடலாம். இருப்பினும், தோல்விகள் மற்றும் வெற்றிகளின் பின்னூட்டத்தின் மூலம், அது படிப்படியாக திறந்த மூல திட்டங்களின் தரத்தை மிகவும் துல்லியமாக மதிப்பிடவும், செயல்பாடுகளை மிகவும் சுருக்கமாக செயல்படுத்தவும், மற்றும் சோதனைகளை மிகவும் விரிவாக வடிவமைக்கவும் கற்றுக்கொள்கிறது. இந்த மெட்டா-கற்றல் ஏஜெண்டின் சுய-பரிணாம திறனை தானே பரிணமிக்கச் செய்கிறது. குறுகிய காலத்தில், இத்தகைய மெட்டா-அனுபவம் சிஸ்டம் ப்ராம்ப்ட்கள் மற்றும் திறன்களில் (Skills) குவிகிறது; நீண்ட காலத்தில், நிலைத்தன்மை அடைந்தவுடன், அதை வலுவூட்டல் கற்றல் மூலம் எடைகளில் உறுதிப்படுத்த முடியும் (அத்தியாயம் 7 ஐப் பார்க்கவும்)—பிந்தையது இந்த அத்தியாயத்தின் எல்லைக்கு அப்பாற்பட்டது, இது "எடைகளை மாற்றாமல் இருப்பதில்" கவனம் செலுத்துகிறது.

முதல் இரண்டு நிலைகள் வெளிப்புறமயமாக்கப்பட்ட கற்றலின் நேரடி பயன்பாடுகளாகும்—கருவிகள் கருவி நூலகத்தில் படிவு செய்யப்படுகின்றன (இந்த அத்தியாயம்), மற்றும் அறிவு அறிவுத் தளத்தில் படிவு செய்யப்படுகிறது (அத்தியாயம் 3). உத்தி நிலை, வெளிப்புறமயமாக்கப்பட்ட கற்றலுக்கும் பிந்தைய-பயிற்சிக்கும் இடையிலான தொடர் பணிப் பகிர்வை நிரூபிக்கிறது: முதலில், விளக்கக்கூடிய மற்றும் மாற்றியமைக்கக்கூடிய வெளிப்புற கேரியர்களை விரைவான மறு செய்கைக்குப் பயன்படுத்தவும், உத்தி நிலைப்படுத்தப்பட்டவுடன், அதை அளவுருக்களில் உறுதிப்படுத்துவதைக் கருத்தில் கொள்ளவும் (அத்தியாயம் 7).

சுய-பரிணாமத்தின் பாதுகாப்பு எல்லைகள்

சுய-பரிணாமம் ஏஜெண்டுகளுக்கு சக்திவாய்ந்த திறன் விரிவாக்க திறனை வழங்குகிறது, ஆனால் தனித்துவமான பாதுகாப்பு அபாயங்களையும் அறிமுகப்படுத்துகிறது.

விநியோகச் சங்கிலி தாக்குதல் மிகவும் நேரடியான அச்சுறுத்தலாகும்: ஒரு ஏஜெண்ட் இணையத்திலிருந்து திறந்த மூல நூலகங்களைத் தானாகத் தேடி நிறுவும் போது, தீங்கிழைக்கும் PyPI அல்லது npm தொகுப்புகள் தானாகவே பதிவிறக்கம் செய்யப்பட்டு இயக்கப்படலாம். இது ஒரு புதிய ஊழியர் இணையத்திலிருந்து சுதந்திரமாக மென்பொருளைப் பதிவிறக்கம் செய்ய அனுமதிப்பதற்கு ஒப்பானது—கட்டுப்பாடுகள் இல்லாமல், எளிதில் பாதிக்கப்படலாம். தணிப்பு நடவடிக்கைகளில் மணல் பெட்டி சூழலில் கருவிகளை இயக்குதல் மற்றும் புதிதாக உருவாக்கப்பட்ட கருவிகளில் தானியங்கி பாதுகாப்பு ஸ்கேன்களைச் செய்தல் ஆகியவை அடங்கும்.

திறன் நகர்வு மிகவும் நயவஞ்சகமான ஆபத்து: ஒரு ஏஜெண்ட் தொடர்ச்சியான கற்றல் மூலம் குவித்த உத்திகள் மற்றும் கருவிகள் படிப்படியாக வடிவமைப்பாளரின் அசல் நோக்கத்திலிருந்து விலகலாம், குறிப்பாக மனித மேற்பார்வை இல்லாத நீண்ட கால இயக்க சூழ்நிலைகளில். எதிர் நடவடிக்கைகளில் அனுமதிக்கப்பட்ட கருவி வகைகளின் வெள்ளைப் பட்டியலை அமைத்தல், கருவி நூலகத்தின் வளர்ச்சி எல்லையைக் கட்டுப்படுத்துதல் மற்றும் புதிய கருவிகளின் காலமுறை கைமுறை மதிப்பாய்வுகளை நடத்துதல் ஆகியவை அடங்கும்.

கருவி தரச் சிதைவும் கவனம் தேவை: தானாக உருவாக்கப்பட்ட கருவிகள், போதுமான சோதனை இல்லாவிட்டால், விளிம்பு நிலைகளில் தவறான முடிவுகளை உருவாக்கலாம், மேலும் இந்த பிழைகள் கருவி மறுபயன்பாட்டின் மூலம் அடுத்தடுத்த பணிகளுக்குப் பரவலாம்—ஒரு பிழையான கருவி மீண்டும் மீண்டும் அழைக்கப்படுவது, ஒரு முறை ஊகப் பிழையை விட மிகவும் தீங்கு விளைவிக்கும்.

நினைவகம் மற்றும் அனுபவ நச்சூட்டு என்பது சுய-எழுதும் பொறிமுறையின் மிகவும் உள்ளார்ந்த தாக்குதல் மேற்பரப்பு ஆகும். பணி செயல்பாட்டின் போது ஏஜெண்ட் சந்திக்கும் உள்ளடக்கம்—வலைப்பக்க உரை, கருவி வெளியீடுகள்—தீங்கிழைக்கும் வகையில் செலுத்தப்பட்ட வழிமுறைகளை (ப்ராம்ப்ட் இன்ஜெக்ஷன், அத்தியாயங்கள் 2 மற்றும் 4 இல் விரிவாக விளக்கப்பட்டுள்ளது) கொண்டிருக்கலாம். இந்த உள்ளடக்கம் மதிப்பாய்வு இல்லாமல் "அனுபவமாக" நீண்டகால நினைவகம் அல்லது திறன்களில் சேமிக்கப்பட்டால், தாக்குதல் ஒரு முறை மட்டும் என்பதிலிருந்து நிரந்தரமாக மாறுகிறது: மாசுபட்ட உள்ளீடுகள் அமர்வுகள் முழுவதும் செயலில் இருக்கும், ஒவ்வொரு முறை மீட்டெடுக்கப்படும்போதும் அடுத்தடுத்த பணிகளைப் பாதிக்கும். அமர்வுக்குள் நிகழும் ப்ராம்ப்ட் இன்ஜெக்ஷனுடன் ஒப்பிடும்போது, இந்த தாக்குதல் மிகவும் நயவஞ்சகமானது மற்றும் அகற்றுவது கடினமானது—பாதிக்கப்படுவது ஒரு பதில் மட்டுமல்ல, ஏஜெண்டின் "அறிவு" தானே ஆகும். தணிப்பு நடவடிக்கைகள் மூன்று நிலைகளில் செயல்படுகின்றன: எழுதுவதற்கு முந்தைய மதிப்பாய்வு மற்றும் மூலக் குறியிடல் (ஒவ்வொரு அனுபவமும் எந்த பணி மற்றும் தகவல் மூலத்திலிருந்து வந்தது என்பதைப் பதிவு செய்தல், மற்றும் நம்பத்தகாத மூலங்களிலிருந்து வரும் உள்ளடக்கத்தில் சேமிப்பதற்கு முன் இன்ஜெக்ஷன் கண்டறிதலைச் செய்தல்); அனுபவம் மற்றும் வழிமுறை சேனல் தனிமைப்படுத்தல் (மீட்டெடுக்கப்பட்ட அனுபவங்கள் "கட்டளைகளாக" அல்லாமல் "குறிப்புப் பொருட்களாக" சூழலில் செலுத்தப்படுகின்றன, அனுபவ உள்ளடக்கத்திற்கு வழிகாட்டும் அதிகாரம் இல்லை என்பதை மாதிரிக்கு வெளிப்படையாகத் தெரிவித்தல்); மீட்டெடுப்பின் போது இன்ஜெக்ஷன் கண்டறிதல் (மீட்டெடுக்கப்பட்ட அனுபவ உள்ளீடுகளில் இன்ஜெக்ஷன் வடிவங்களுக்கான இலகுரக ஸ்கேனிங் செய்தல், சந்தேகத்திற்குரிய உள்ளடக்கம் காணப்பட்டால் பயன்பாட்டைக் குறைத்தல் அல்லது எச்சரிக்கைகளை எழுப்புதல்). அறிவுப் புதுமைத்தன்மை மற்றும் நச்சு பாதுகாப்பு ஆகியவை ஒரே நாணயத்தின் இரு பக்கங்கள்: புதுமைத்தன்மை இயற்கையான அறிவு வழக்கற்றுப் போவதை எதிர்த்துப் போராடுகிறது, அதே நேரத்தில் நச்சு பாதுகாப்பு தீங்கிழைக்கும் அறிவு மாசுபாட்டை எதிர்த்துப் போராடுகிறது—இரண்டிற்கும் அனுபவ நூலகத்தில் மூலக் கண்டுபிடிப்பு மற்றும் நீக்குதல் வழிமுறைகள் தேவை. (அறிவுப் புதுமைத்தன்மை பொறிமுறை வழக்கற்றுப் போன அனுபவங்களை எவ்வாறு கண்டறிந்து நீக்குகிறது என்பது சிந்தனை கேள்வி 3 இன் நீட்டிப்பாக விடப்பட்டுள்ளது.)

சோதனை 8-5 ★★★: சுய-வளரும் ஏஜெண்டுகளுக்கான மதிப்பீட்டு தரவுத்தொகுப்பை வடிவமைத்தல்

முந்தைய சோதனைகள் ஏஜெண்டுகள் அனுபவத்திலிருந்து எவ்வாறு கற்றுக்கொள்கின்றன, கருவிகளைக் கண்டுபிடிக்கின்றன மற்றும் கருவிகளை உருவாக்குகின்றன என்பதை நிரூபிக்கின்றன. ஆனால் இந்த சுய-வளர்ச்சி திறன்களை நாம் எவ்வாறு மதிப்பீடு செய்வது? இதற்கு சிறப்பாக வடிவமைக்கப்பட்ட மதிப்பீட்டு தரவுத்தொகுப்புகள் தேவை—கருவி கண்டுபிடிப்பு மற்றும் உருவாக்கும் திறன்களை சோதிக்கும், அதே நேரத்தில் நிலையான கருவி பயன்பாட்டு முறைகளை எளிமையாக மனப்பாடம் செய்வதைத் தவிர்க்கும் தரவுத்தொகுப்புகள்.

வெவ்வேறு களங்களில் (மல்டிமீடியா செயலாக்கம், நிதித் தரவு, அறிவியல் கணினி, புவியியல் தகவல், சமூக ஊடகம், IoT சாதனக் கட்டுப்பாடு போன்றவை) 20 கருவி தேவைப்படும் பணிகளை உருவாக்கவும். பணி விளக்கங்கள் கருவி பெயர்களைக் குறிப்பிடாமல் இலக்கை மட்டுமே கூற வேண்டும்—எடுத்துக்காட்டாக, "youtube-transcript-api ஐப் பயன்படுத்து" என்பதற்குப் பதிலாக "YouTube வீடியோவின் வசனங்களைப் பெறு" அல்லது "CoinGecko API ஐப் பயன்படுத்து" என்பதற்குப் பதிலாக "நிகழ்நேர கிரிப்டோகரன்சி விலைப் போக்குகளை வினவு"—ஏஜெண்ட் உண்மையிலேயே கருவிகளைத் தேட வேண்டும் அல்லது உருவாக்க வேண்டும் என்பதை உறுதி செய்கிறது. அடிப்படை கருவித் தொகுப்பில் பொதுவாக இவை அடங்கும்: வலைத் தேடல், வலைப்பக்க வாசிப்பு, குறியீடு விளக்கி, மற்றும் கருவி உருவாக்கம் மற்றும் பதிவு.

நான்கு-அடுக்கு படிநிலை சரிபார்ப்பை வடிவமைக்கவும்:

  1. பணி சரியான தன்மை: வசன உள்ளடக்கம் துல்லியமானது, நிதித் தரவு யதார்த்தத்துடன் பொருந்துகிறது> 2. கருவி கண்டுபிடிப்பு செயல்திறன்: தேடல் முக்கிய வார்த்தைகள், பார்வையிடப்பட்ட வலைப்பக்கங்கள் மற்றும் தேர்ந்தெடுக்கப்பட்ட நூலகங்களை பகுப்பாய்வு செய்து மதிப்பிடுதல்
  2. கருவி உருவாக்க தரம்: பிழை கையாளுதல், அளவுரு சரிபார்ப்பு, ஆவணப்படுத்தல் முழுமை, LLM-as-a-Judge மூலம் ஒரு Rubric ஐப் பயன்படுத்தி மதிப்பெண் வழங்கப்படுகிறது
  3. கருவி மறுபயன்பாட்டு திறன்: ஒத்த பணியின் இரண்டாவது செயல்படுத்தல், தேடலை மீண்டும் செய்வதற்குப் பதிலாக உருவாக்கப்பட்ட கருவியை நேரடியாக மீட்டெடுக்கிறதா என்பது

ஒவ்வொரு பணிக்கும் குறிப்பு தீர்வுகளை (பரிந்துரைக்கப்பட்ட திறந்த மூல நூலகங்கள் மற்றும் வழக்கமான API எடுத்துக்காட்டுகள்) மற்றும் அறியப்பட்ட ஆபத்துகளை (காலாவதியான நூலகங்கள், கட்டணப் பதிவு தேவைப்படும் APIகள் போன்றவை) தயாரிக்கவும்.

அத்தியாயச் சுருக்கம்

இந்த அத்தியாயம், மாதிரி எடைகளை மாற்றாமல் ஏஜெண்டுகள் தொடர்ந்து தங்கள் திறன்களை விரிவுபடுத்துவதற்கான முறையியலை முறையாக ஆராய்கிறது—சுய-பரிணாமம்.

அத்தியாயங்கள் 1 மற்றும் 7 ஐ அடிப்படையாகக் கொண்டு, இந்த அத்தியாயம் முதலில் மூன்று கற்றல் முன்னுதாரணங்களில் சுய-பரிணாமத்தின் நிலைப்பாட்டை தெளிவுபடுத்துகிறது—பிந்தைய-பயிற்சி அளவுருக்களை உறுதிப்படுத்துகிறது (அத்தியாயம் 7 இல் விரிவாக விளக்கப்பட்டுள்ளது, ஒப்பீட்டிற்காக மட்டுமே இங்கு குறிப்பிடப்பட்டுள்ளது), சூழலில் கற்றல் தற்காலிக தழுவலை கையாளுகிறது, மேலும் இந்த அத்தியாயம் மாதிரி எடைகளை மாற்றாமல் பரிணாமப் பாதையில் கவனம் செலுத்துகிறது: வெளிப்புறமயமாக்கப்பட்ட கற்றல் மற்றும் அதன் நீட்டிப்புகள்—பின்னர் அதன் பொறியியல் நடைமுறையில் ஆழமாக ஆராய்கிறது.

அத்தியாயம் சுய-பரிணாமத்தின் இரண்டு பரிமாணங்களைச் சுற்றி விரிகிறது. ஒரு பரிமாணம் அனுபவத்திலிருந்து அறிவு படிதல்: உத்தி சுருக்கங்கள் முடிவெடுக்கும் ஞானத்தை வடிகட்டுகின்றன, பணிப்பாய்வு பதிவு செயல்பாட்டு நடைமுறைகளை உறுதிப்படுத்துகிறது, Reflexion-பாணி பிரதிபலிப்பு தோல்வி பாடங்களை படிகமாக்குகிறது, திறன்கள் கள அறிவை கட்டமைக்கின்றன, மற்றும் சிஸ்டம் ப்ராம்ப்ட் மேம்படுத்தல் விளிம்பு நிலைகளிலிருந்து விதிகளை பிரித்தெடுக்கிறது—இவை அனைத்தும் சேர்ந்து "பயிற்சியால் சிறப்பாக அடைதல்" என்ற குவிப்பு பொறிமுறையை உருவாக்குகின்றன. மற்ற பரிமாணம் முனைப்புடன் கருவி எல்லைகளை உடைத்தல்: அத்தியாயம் 4 இன் "முனைப்பான கருவி கண்டுபிடிப்பு" பிரிவு தீர்த்த "ஏற்கனவே உள்ள கருவிகளிலிருந்து பொருத்தமானதைக் கண்டறிதல்" என்பதற்கு மேலாக, வலையில் தேடி தற்போதுள்ள நூலகங்களை ஒருங்கிணைப்பதிலிருந்து புதிய கருவிகளைப் புதிதாக எழுதுவது வரை, ஏஜெண்ட் ஒரு கருவி பயனரிடமிருந்து கருவி உருவாக்குநராக மாறுகிறது; Voyager திறந்த உலகங்களில் இந்த முன்னுதாரணத்திற்கு ஒரு முழுமையான வரைபடத்தை வழங்குகிறது.

இந்த கட்டத்தில், ஏஜெண்டின் மைய திறன் அமைப்பின் முழு விவாதத்தை நாங்கள் நிறைவு செய்துள்ளோம்—சூழல் பொறியியல், கருவி வடிவமைப்பு, குறியீடு உருவாக்கம், மதிப்பீட்டு முறையியல், மாதிரி பிந்தைய-பயிற்சி முதல் சுய-பரிணாமம் வரை. அடுத்த இரண்டு அத்தியாயங்கள் முன்னோக்கை முன்னணி பயன்பாடுகளுக்கு மாற்றும். அடுத்த அத்தியாயம், ஏஜெண்டுகள் தூய உரை உள்ளீடு/வெளியீட்டிலிருந்து பல்மாதிரி உணர்தல் மற்றும் நிகழ்நேர தொடர்புக்கு எவ்வாறு நகர்கின்றன என்பதை ஆராயும்: குரல் உரையாடல், கணினி பயன்பாடு (GUI தானியக்கம்), மற்றும் ரோபோ கையாளுதல். இந்த காட்சிகள் இரண்டு மைய சவால்களைப் பகிர்ந்து கொள்கின்றன—பல்மாதிரித்தன்மை மற்றும் நிகழ்நேர செயல்திறன்—இவையே ஏஜெண்ட் கட்டமைப்புகளை, தொடர் குழாய்களிலிருந்து இறுதி-முதல்-இறுதி மாதிரிகளை நோக்கிய அடிப்படை பரிணாமத்திற்கு உந்துகின்றன.

சிந்தனை கேள்விகள்

  1. ★★ ஏஜெண்டுகள் திறந்த மூல நூலகங்களை தானாக தேடி ஒருங்கிணைக்கும் திறன் (சுய-பரிணாமம்) மிகவும் சக்தி வாய்ந்தது, ஆனால் விநியோகச் சங்கிலி பாதுகாப்பு அபாயங்களையும் அறிமுகப்படுத்துகிறது. ஒரு தீங்கிழைக்கும் PyPI தொகுப்பு ஏஜெண்டால் தானாக நிறுவப்பட்டு இயக்கப்படலாம். இந்த அபாயத்தை எவ்வாறு குறைப்பீர்கள்?
  2. ★★ Voyager-பாணி அனுபவக் கற்றல், ஏஜெண்டுகள் வெற்றிகரமான கருவிப் பயன்பாட்டு முறைகளை மீண்டும் பயன்படுத்தக்கூடிய திறன்களாக (Skills) குறியாக்கம் செய்ய அனுமதிக்கிறது. இருப்பினும், திறன் நூலகம் வளரும்போது, சரியான திறனை மீட்டெடுப்பதே ஒரு புதிய சவாலாக மாறுகிறது. இது ஒரு சுழல்நிலைச் சிக்கலை உருவாக்குகிறதா—ஒரு ஏஜெண்ட் தனது சொந்த திறன்களை நிர்வகிக்க "திறன் மீட்டெடுப்பு ஏஜெண்ட்" (Skill Retrieval Agent) தேவைப்படுகிறதா?
  3. ★★★ வெளிப்புறமயமாக்கப்பட்ட கற்றல் (Externalized learning) வெற்றிகரமான அனுபவங்களை உத்தி சுருக்கங்கள் அல்லது பணிப்பாய்வு ஸ்கிரிப்ட்களாக குறியாக்கம் செய்கிறது. ஆனால் "வெற்றி" என்பதன் வரையறை காலப்போக்கில் மாறலாம் (எ.கா., வணிக விதி புதுப்பிப்புகள்). காலாவதியான அனுபவங்கள் பயனற்றவை மட்டுமல்ல, தீங்கு விளைவிக்கக்கூடியவையும் கூட. காலாவதியான அனுபவங்களைக் கண்டறிந்து நீக்குவதற்கு நீங்கள் எந்த வகையான "அறிவுப் புதுமைத்தன்மை வழிமுறையை" (knowledge freshness mechanism) வடிவமைப்பீர்கள்?
  4. ★★★ பணிப்பாய்வு பதிவு (Workflow recording) வெற்றிகரமான செயல்பாட்டு வரிசைகளை மீண்டும் இயக்கக்கூடிய தானியங்கி கருவிகளாக மாற்றுகிறது. இருப்பினும், APIகள் புதுப்பிக்கப்படுகின்றன மற்றும் UIகள் மாறுகின்றன, இதனால் பதிவு செய்யப்பட்ட பணிப்பாய்வுகள் காலப்போக்கில் செல்லாது. சூழல் மாறும்போது பணிப்பாய்வுகள் தானாகவே தங்களைச் சரிசெய்துகொள்ள, அல்லது குறைந்தபட்சம் பிழைகள் ஏற்படும்போது பணி முடிந்துவிட்டதாக தவறாகக் கருதுவதைத் தவிர்க்க, எவ்வாறு உருவாக்கலாம்?
  5. ★★★ மூன்று கற்றல் முன்னுதாரணங்கள் (பிந்தைய பயிற்சி, சூழலில் கற்றல், வெளிப்புறமயமாக்கப்பட்ட கற்றல்) மூன்று அறிவு கேரியர்களுக்கு ஒத்திருக்கின்றன: மாதிரி அளவுருக்கள், சூழல் சாளரங்கள் மற்றும் வெளிப்புற சேமிப்பு. அவசரமாக செயல்படுத்தப்பட வேண்டிய வணிக விதி இருந்தால், எந்த முறையைப் பயன்படுத்த வேண்டும்? வாடிக்கையாளர் சேவை போட்டின் பதில்கள் மிகவும் நீளமாக இருந்தால், எந்த முறையைப் பயன்படுத்த வேண்டும்? உருவாக்கப்பட்ட PPT பாணி நிறுவனத்தின் தற்போதைய PPT பாணியுடன் மிகவும் நெருக்கமாக பொருந்த வேண்டும் என்றால், எந்த முறையைப் பயன்படுத்த வேண்டும்? இந்த தொழில்நுட்பத் தேர்வுகள் தற்போது பயன்படுத்தப்படும் மாதிரியின் திறன்களுடன் தொடர்புடையதா?
  6. ★★ ஒரு ஏஜெண்ட் இணையத்தில் கருவிகளைத் தேடும்போது, ஒரு திறந்த மூல நூலகம் "பயன்படுத்த நல்லது" என்பதை எவ்வாறு தீர்மானிக்கிறது? ஏஜெண்ட் தானாகவே திறந்த மூல திட்டங்களின் தரத்தை மதிப்பிட கற்றுக்கொள்ள முடியுமா?
  7. ★★ இந்த அத்தியாயம் ஏஜெண்ட் சுய-பரிணாமத்தை "அளவுருக்களை மாற்றாமல் வலுவாக மாறுவதற்கான" ஒரு பாதையாக நிலைநிறுத்துகிறது. இருப்பினும், அத்தியாயம் 7, மூலோபாய மட்டத்தில் மேம்பாடுகள் இறுதியில் வலுப்படுத்தும் கற்றல் (reinforcement learning) மூலம் உறுதிப்படுத்தப்பட வேண்டும் என்பதை சுட்டிக்காட்டுகிறது. இந்த இரண்டு பாதைகளுக்கும் இடையே உள்ள எல்லை எங்கே—எந்த வகையான திறன் மேம்பாடுகள் வெளிப்புறமயமாக்கலுக்கு ஏற்றது, மற்றும் எந்த வகையானவை அளவுருக்களில் எழுதுவதற்கு ஏற்றது?