அத்தியாயம் 6 · ஏஜென்ட் மதிப்பீடு¶
ஏஜெண்டின் செயல்திறனை ஒப்பிடக்கூடிய சமிக்ஞைகளாக மாற்றுகிறது. மதிப்பீட்டுச் சூழல்கள், தரவுத்தொகுப்பு வடிவமைப்பு, அளவுகோல் அமைப்பு முதல் புள்ளியியல் முக்கியத்துவம், கண்காணிப்புத்தன்மை, மதிப்பீடு-இயக்கப்படும் தேர்வு வரை, மேலும் உற்பத்தி-தர உள் மதிப்பீடு மற்றும் உருவகப்படுத்துதல் சூழல்கள் வரை விவரிக்கிறது.
← முக்கிய README க்குத் திரும்பு · 📖 அத்தியாய உரையைப் படி
துணை திட்டங்கள்¶
| சோதனை | Project | Type | Description |
|---|---|---|---|
| 6-1 | tau2-bench/ |
📖 | கணிப்பு, தேடல் மற்றும் தரவுச் செயலாக்கம் போன்ற சூழ்நிலைகள் உட்பட, கருவிகளைப் பயன்படுத்தி ஏஜென்ட் சிக்கலான பகுத்தறிவு மேற்கொள்ளும் திறனை மதிப்பீடு செய்வதில் கவனம் செலுத்துகிறது. |
| 6-2 | tau2-bench/ |
📖 | தரப்படுத்தப்பட்ட τ²-bench பணிகளை கைமுறையாக முடித்து trajectory-களை பதிவு செய்கிறது. |
| 6-3 | user-memory-evaluation | ✅ | 180 கட்டமைக்கப்பட்ட மதிப்பீடுகளில் நான்கு-நிலை rubric-ஐ ஆதாரங்களுடனும் hallucination veto-வுடனும் இயக்குகிறது. |
| 6-4 | user-memory-system-evaluation | ✅ | முழுமையான செலவுக் கணக்கீட்டுடன் மூன்று அமைப்புகளில் 60 cases-ஐ இயக்குகிறது. |
| 6-10 | user-memory-system-evaluation | 🚧 | 4×3×2×60 component, model மற்றும் evaluator matrix இன்னும் நிறைவடையவில்லை. |
| 6-12 | openvla-robotwin2-eval | ✅ | ஒற்றை GPU அதிகாரப்பூர்வ இயக்கம் ஒவ்வொரு action-chunk குழுவிலும் 256 episode-களை முடித்தது; chunk 1: 0/256, chunk 25: 26/256, மேலும் 512 rollout hash-கள் சேமிக்கப்பட்டன. |
| 6-2 | terminal-bench/ |
📖 | Terminal-Bench என்பது உண்மையான முனையச் சூழலில் AI ஏஜென்ட்டின் செயல்திறனைச் சோதிக்கும் ஒரு தரநிர்ணயம் ஆகும். குறியீட்டைத் தொகுப்பதில் இருந்து மாதிரிகளைப் பயிற்றுவித்தல், சேவையகங்களை அமைத்தல் வரை, ஏஜென்ட் உண்மையான end-to-end பணிகளை எவ்வாறு கையாள்கிறது என்பதை மதிப்பீடு செய்கிறது. சுமார் 100 பணிகள் கொண்ட தரவுத்தொகுப்பு மற்றும் செயல்படுத்தும் கட்டமைப்பை உள்ளடக்கியது, பல ஏஜென்ட் செயலாக்கங்களை ஆதரிக்கிறது. |
| 6-2 | SWE-bench/ |
📖 | SWE-bench என்பது பெரிய மொழி மாதிரிகள் உண்மையான GitHub சிக்கல்களைத் தீர்க்கும் திறனை மதிப்பீடு செய்யும் ஒரு தரநிர்ணயம் ஆகும். குறியீட்டுத் தளமும் சிக்கல் விளக்கமும் கொடுக்கப்பட்டால், மாதிரி சிக்கலைத் தீர்க்கக்கூடிய ஒரு பேட்சை உருவாக்க வேண்டும். SWE-bench, SWE-bench Lite, SWE-bench Verified மற்றும் SWE-bench Multimodal உட்படப் பல பதிப்புகளைக் கொண்டுள்ளது. |
| 6-2 | GAIA/ |
📖 | GAIA என்பது அடுத்த தலைமுறை LLM-களை (கருவி மேம்பாடு, திறமையான அறிவுறுத்தல், தேடல் அணுகல் போன்ற திறன்கள் கொண்ட LLM-கள்) மதிப்பீடு செய்வதை நோக்கமாகக் கொண்டது. வெவ்வேறு அளவிலான கருவிகள் மற்றும் தன்னாட்சி தேவைப்படும் 450+ எளிதல்லாத கேள்விகளைக் கொண்டுள்ளது, பதில்கள் தெளிவானவை மற்றும் இருபொருளற்றவை. 3 சிரம நிலைகளாகப் பிரிக்கப்பட்டுள்ளது. |
| 6-2 | OSWorld/ |
📖 | முழுமையான இயக்க முறைமைச் சூழலில் ஏஜென்ட் சிக்கலான பணிகளைச் செயல்படுத்தும் திறனை மதிப்பீடு செய்கிறது, கோப்பு மேலாண்மை, பயன்பாட்டுச் செயல்பாடுகள் மற்றும் கணினி கட்டமைப்பு ஆகியவை உட்பட. |
| 6-2, 6-11 | android_world/ |
📖 | Android மொபைல் சூழலில் ஏஜென்ட்டின் செயல்திறனை மதிப்பீடு செய்கிறது, பயன்பாட்டு வழிசெலுத்தல், UI தொடர்பு மற்றும் பணி நிறைவு திறன் ஆகியவை உட்பட (வெளிப்புற benchmark களஞ்சியம்). |
| 6-5 | tts-quality-eval | ✅ | பல TTS கட்டமைப்புகளை (வெவ்வேறு model/voice/speed) பயன்படுத்தி ஒரே சவாலான உரைத் தொகுப்பை ஒலியாக்கி, பின்னர் மல்டிமோடல் LLM-as-a-Judge மூலம் Rubric இன்படி ஒவ்வொரு பரிமாணத்திற்கும் (தெளிவுத்தன்மை/இயற்கைத்தன்மை போன்றவை) மதிப்பெண் வழங்கி, மீண்டும் உருவாக்கக்கூடிய கட்டமைப்பு ஒப்பீட்டு அட்டவணையாகத் தொகுக்கிறது. |
| 6-6 | elo-leaderboard | ✅ | ELO மதிப்பீட்டு அமைப்பின் அடிப்படையில் ஏஜென்ட் செயல்திறன் தரவரிசைப் பட்டியலைச் செயல்படுத்துகிறது, ஜோடிவரிசைப் போட்டிகள் மூலம் வெவ்வேறு ஏஜென்ட்டுகளின் ஒப்பீட்டுத் திறன்களை மதிப்பீடு செய்கிறது. |
| 6-7 | model-action-threshold | ✅ | ஒரே நடுநிலையான Coding Harness-இல் GPT-5.6-sol மற்றும் Claude Sonnet 5 ஆகியவை ஆராய்ச்சியிலிருந்து முதல் திருத்தத்துக்கு நகரும் நுழைவுநிலையை ஒப்பிடுகிறது; 18/18 செல்களும் API பிழையின்றி நிறைவடைந்தன, மேலும் manifest செயல்தடங்களையும் சுருக்கங்களையும் சரிபார்க்கக்கூடிய hash-களால் இணைக்கிறது. |
| 6-8 | agent-cost-analysis | ✅ | ஒரு பொதுவான பல-சுற்று ஏஜென்ட் பணிக்கு (வாடிக்கையாளர் சேவை பணம் திரும்பப்பெறுதல்) முழு-சங்கிலி செலவுப் பிரிவை மேற்கொள்கிறது: சுயமாக உருவாக்கிய இலகுரக tracing மூலம் ஒவ்வொரு LLM அழைப்பின் உள்ளீடு/வெளியீடு/கேச் டோக்கன்கள், தாமதம் மற்றும் செலவைப் பதிவு செய்து, "எந்தப் படி அதிக செலவாகிறது" என்பதைத் தொகுத்தறிந்து, பின்னர் A/B சோதனைகள் மூலம் KV-cache நட்பு வடிவமைப்பு + சூழல் சுருக்கம் ஆகியவற்றால் கிடைக்கும் உண்மையான சேமிப்பை அளவிடுகிறது. |
| 6-9 | model-benchmark | ✅ | பல OpenAI-இணக்கமான LLM API வழங்குநர்களுக்கு கிடைமட்ட ஒப்பீட்டுத் தரநிர்ணயம் நடத்துகிறது, நீரோட்ட இடைமுகம் மூலம் முதல் டோக்கன் தாமதத்தை (TTFT) துல்லியமாக அளவிடுகிறது, இணையான சுமையின் கீழ் end-to-end தாமத குவான்டைல்கள் (p50/p95), செயலாக்க விகிதம் (throughput) மற்றும் வெற்றி விகிதம் ஆகியவற்றை அளவிடுகிறது, ஒரே கட்டளையில் பல்-பரிமாண ஒப்பீட்டு அட்டவணையை உருவாக்குகிறது, மேலும் மாதிரி தேர்வு என்பது தரவரிசைப் பட்டியலை மட்டும் பார்ப்பதல்ல, பல்-பரிமாணச் சமநிலை என்பதை விளக்குகிறது. |
| 6-11 | android-world | 📖 | இந்தக் களஞ்சியத்தில் உள்ள AndroidWorld மீதான T3A மதிப்பீட்டு அறிக்கை மற்றும் தோல்வி பகுப்பாய்வு குறிப்புகள் (சோதனை 6-11 தொடக்கம்; benchmark மூலக் குறியீடு அல்ல). |
| — | public-health-reporting-eval | ✅ | செயற்கையான DHIS2-பாணி ஒருங்கிணைந்த தரவைப் பயன்படுத்தி, பொது சுகாதார அறிக்கையிடல் ஏஜென்ட்டின் கருவி அழைப்புகள், கணக்கீட்டுத் துல்லியம், ஆதார மேற்கோள்கள் மற்றும் ஆதாரமற்ற கூற்றுகளைப் புறநிலையாக மதிப்பீடு செய்கிறது. |
📖 Backtick குறியில் உள்ள வெளிப்புற benchmark-களை தனியாக clone செய்ய வேண்டும்.
android-world/(hyphen) என்பது இந்தக் களஞ்சியத்தின் T3A மதிப்பீட்டு பகுப்பாய்வுக் குறிப்புகள் (அதன் README பார்க்க); இது வெளிப்புறandroid_world/benchmark மூலக் குறியீட்டுப் பாதை அல்ல.
திட்ட வகைகள்¶
| சின்னம் | வகை | பொருள் |
|---|---|---|
| ✅ | தனித்து இயங்கும் | முழு குறியீடு இந்த களஞ்சியத்தில், API Key உள்ளமைத்தவுடன் இயங்கும் |
| 📖 | மறு உருவாக்க வழிகாட்டி | வெளிப்புற களஞ்சியங்களை git clone செய்ய வேண்டிய விரிவான ஆவணம் |
| 🚧 | வடிவமைப்பு ஆவணம் | கட்டமைப்பு/செயலாக்கத் திட்டம் மட்டும், இயங்கும் குறியீடு இன்னும் WIP |