பல்முக மற்றும் நிகழ்நேர இடைவினை¶
முந்தைய அத்தியாயங்கள், உரை உலகில் ஏஜெண்டுகளின் வடிவமைப்பை ஆராய்ந்தன—சூழல், கருவிகள் மற்றும் குறியீடு மூலம் டிஜிட்டல் அமைப்புகளுடன் இடைவினை புரிவது. ஆனால் ஒரு ஏஜெண்டின் உலகம் உரையையும் API-களையும் விடப் பெரியது. ஒரு ஏஜெண்ட் பயனரின் குரல் கட்டளைகளைப் புரிந்துகொள்ள வேண்டும், திரையில் சரியான பொத்தானைக் கண்டுபிடித்து கிளிக் செய்ய வேண்டும், அல்லது ஒரு பொருளைப் பிடிக்க ஒரு ரோபோ கையை துல்லியமாகக் கட்டுப்படுத்த வேண்டும் என்றால், அது ஒரு புதிய களத்தில் நுழைகிறது: பல்முக நிகழ்நேர இடைவினை—தூய உரை உள்ளீடு/வெளியீட்டில் இருந்து பல்முக உணர்தல் மற்றும் நிகழ்நேர பதிலளிப்பு வரை விரிவடைதல். ஏஜெண்டுகள் "உரையாடல் பெட்டியில்" இருந்து வெளியேறுவதற்கு இது ஒரு முக்கியமான படியாகும். "பல்முகம்" என்பது ஒரே நேரத்தில் பல வகையான தகவல்களை—உரை, பேச்சு, படங்கள், வீடியோ, செயல்கள்—செயலாக்குவதைக் குறிக்கிறது, வெறும் உரையை மட்டுமல்ல.
முதலில், இந்த அத்தியாயத்தின் எல்லைகளை வரையறுப்போம். நிலையான படம் மற்றும் ஆவண புரிதல்—ஒரு ஸ்கிரீன்ஷாட்டைப் பார்ப்பது, ஒரு விளக்கப்படத்தைப் படிப்பது, ஒரு PDF ஐ பாகுபடுத்துவது—ஏற்கனவே முந்தைய அத்தியாயங்களின் ஏஜெண்ட் நடைமுறைகளில் உணர்தல் கருவிகளாக இயற்கையாக ஒருங்கிணைக்கப்பட்டுள்ளன. இன்றைய பல்முக LLMகளுக்கு, இந்த "ஒரு உள்ளீடு, ஒரு புரிதல்" பணிகள் ஒப்பீட்டளவில் முதிர்ச்சியடைந்தவை மற்றும் சிறப்பு கட்டமைப்பு வடிவமைப்பு தேவையில்லை. இந்த அத்தியாயம் மற்றொரு வகை சிக்கல்களில் கவனம் செலுத்துகிறது: நிகழ்நேர கட்டுப்பாடுகள் பல்முக சிக்கல்களை கடினமாக்கும் மூன்று காட்சிகள்—குரல் உரையாடல், GUI செயல்பாடு மற்றும் ரோபோ கட்டுப்பாடு. இந்த காட்சிகளில், உள்ளீடு தொடர்ச்சியானது, மேலும் வெளியீடு கடுமையான நேர வரம்புகளுக்குள் வழங்கப்பட வேண்டும், இது கட்டமைப்பு வடிவமைப்பில் ஒரு தரமான மாற்றத்தை ஏற்படுத்துகிறது. தொடர்ச்சியான காட்சி ஸ்ட்ரீம்களின் (வீடியோ) நிகழ்நேர புரிதலைப் பொறுத்தவரை, இது எழுதும் நேரத்தில் ஏஜெண்டுகளுக்கு ஒரு திறந்த சிக்கலாகவே உள்ளது—கம்ப்யூட்டர் யூஸ் பிரிவு பிரேம்-பை-பிரேம் ஸ்கிரீன்ஷாட்களின் வரம்புகளை எதிர்கொள்ளும்போது இதற்குத் திரும்புவோம்; அத்தியாய இறுதிக் கேள்விகளிலும் இது மீண்டும் வரும். மற்றொரு எல்லையும் வரையப்பட வேண்டும்: பல்முக உருவாக்கம் (பட உருவாக்கம், வீடியோ உருவாக்கம்) இந்த புத்தகத்தின் கட்டமைப்பில் ஒரு வழக்கமான கருவி அழைப்பு மட்டுமே (அத்தியாயம் 5, மல்டிமீடியா உருவாக்கம் பற்றி விவாதிக்கப்பட்டது). ஏஜெண்ட் அதை ஒரு வெளிப்புற கருவியாகப் பயன்படுத்துகிறது; இது இந்த அத்தியாயம் கையாளும் நிகழ்நேர இடைவினை சவால்களை உள்ளடக்காது, எனவே இது முக்கிய விவாதத்தின் பகுதியாக இல்லை.
குரல் இடைவினை, கம்ப்யூட்டர் யூஸ் மற்றும் ரோபோ செயல்பாடு ஆகியவை மூன்று முற்றிலும் வேறுபட்ட துறைகளை உள்ளடக்கியதாகத் தோன்றினாலும், செயல்படுத்தும்போது, தடைகள் வியக்கத்தக்க வகையில் ஒத்தவை: அவை அனைத்தும் ஒரே நேரத்தில் பல முகங்களின் தகவல்களைச் செயலாக்க வேண்டும் மற்றும் தாமதத்திற்கு மிகவும் உணர்திறன் கொண்டவை. இரண்டு வினாடிகளுக்கு மேல் குரல் இடைநிறுத்தம் விரக்தியை ஏற்படுத்துகிறது, மேலும் ரோபோ கட்டுப்பாட்டில் மில்லி-செகண்ட் அளவிலான ஜிட்டர் மோதல்களுக்கு வழிவகுக்கும். இந்த இரண்டு கட்டுப்பாடுகளும் மூன்று காட்சிகளையும் ஒரே கட்டமைப்பு திசையை நோக்கி தள்ளுகின்றன: தொடர் பைப்லைனில் இருந்து (தொழிற்சாலை அசெம்பிளி லைன் போல, ஒரு படி முடிவதற்கு முன் அடுத்தது தொடங்க முடியாது) எண்ட்-டு-எண்ட் மாதிரிக்கு (உள்ளீட்டிலிருந்து நேரடியாக வெளியீட்டிற்குச் செல்லும் ஒருங்கிணைந்த மாதிரி, இடைநிலை கைமாற்றங்களை நீக்குகிறது) மாறுதல்.
இந்த அத்தியாயம் பின்வரும் வரிசையில் விரிவடைகிறது:
- முதலில், "குரல் கட்டமைப்பின் மூன்று முன்னுதாரணங்கள்"—அடுக்கு (VAD-ASR-LLM-TTS குழாய்), இறுதி-முதல்-இறுதி அனைத்து-முறை (Omni, ஒற்றை மாதிரி ஆனால் இன்னும் திருப்ப-எடுத்தல்), மற்றும் முழு-இருவழி (Moshi, GPT-Live, ஒரே நேரத்தில் கேட்டல் மற்றும் பேசுதல்)—ஆகியவற்றுடன் ஒரு குறிப்புச் சட்டகத்தை (coordinate system) அமைக்கிறோம், மேலும் "VAD இன் திருப்ப அனுமானத்திலிருந்து எவ்வாறு விடுபடுவது" என்ற அச்சில் ஒவ்வொரு இணைப்பின் தாமதம் மற்றும் பரிமாற்றங்களை பகுப்பாய்வு செய்கிறோம். அடுக்கு பகுதி, VAD + ASR ஐ ஸ்ட்ரீமிங் குரல் உணர்வுடன் எவ்வாறு மாற்றுவது என்பதையும் விவாதிக்கும்.
- அடுத்து, சிந்தனை கட்டமைப்பு "நிகழ்நேர பதில்" மற்றும் "ஆழமான சிந்தனை" ஆகியவற்றுக்கு இடையேயான முரண்பாட்டை எவ்வாறு சமரசம் செய்கிறது என்பதை ஆராய்வோம்: வேகமான மற்றும் மெதுவானவற்றின் எளிய இணைநிலைப்படுத்தலில் இருந்து, ஒரு பின்னணி பகுத்தறிவு மாதிரி "மூலோபாயவாதியாக" (GPT-Live பிரதிநிதித்துவம், Pine AI, போன்றவை) செயல்படும் பிரிக்கப்பட்ட அணுகுமுறை வரை, Step-Audio R1 இன் "பேசும்போது சிந்திக்கும்" ஒற்றை மாதிரியில் சிந்தனையை "உள்மயமாக்குதல்" வரை.
- பின்னர், மிகவும் மனிதனைப் போன்ற பேச்சு தொகுப்பு எவ்வாறு செயல்படுத்தல் அடுக்கை மேம்படுத்துகிறது என்பதை விவாதிப்போம்.
- இறுதியாக, கணினி பயன்பாடு (AI ஒரு மனிதனைப் போல கணினித் திரையை இயக்க உதவுதல்) மற்றும் ரோபோ இயக்கம் ஆகியவற்றிற்கு முன்னோக்கை விரிவுபடுத்துகிறோம், இதே தாமதம் மற்றும் பல்முறை சிக்கல்கள் இந்த இரண்டு சூழ்நிலைகளிலும் எவ்வாறு வெளிப்படுகின்றன என்பதைக் கவனிக்கிறோம்.
காட்சிகளுக்கு இடையில் மாற்றத்தக்க இரண்டு கோட்பாட்டு புள்ளிகள் சிறப்பு கவனம் செலுத்த வேண்டியவை: சிந்தனை கட்டமைப்பு (வேகமான மற்றும் மெதுவான சிந்தனை எவ்வாறு ஒத்துழைக்கிறது) மற்றும் அதிலிருந்து பெறப்பட்ட வேக-மெதுவான இடைமுகம் (Latent Bridge, உரையைத் தவிர வேகமான மற்றும் மெதுவான மாதிரிகளுக்கு இடையில் என்ன அனுப்ப முடியும்). குரல் காட்சியில் இருந்து அறிமுகப்படுத்தப்பட்டாலும், அவை குரலுக்கு மட்டும் அல்ல—கணினி பயன்பாடு மற்றும் ரோபோ பகுதிகளும் "எப்போது மெதுவான மூலோபாயவாதியை ஆலோசிப்பது" என்ற கேள்வியை எதிர்கொள்ளும், இதை வாசகர்கள் கவனமாக கவனிக்க வேண்டும்.
குரல்: மிகவும் இயற்கையான மனித-இயந்திர இடைமுகம்¶
ஒரு குரல் ஏஜெண்டின் கட்டமைப்பை பகுப்பாய்வு செய்வதற்கு முன், குரலின் மதிப்பைப் பற்றி சற்று பின்வாங்கி சிந்திப்போம். மனிதர்கள் கணினிகளுடன் தொடர்பு கொள்ளும் பல்வேறு வழிகளில், குரல் அதிக அலைவரிசையைக் கொண்டுள்ளது மற்றும் மிகவும் இயற்கையானது: சாதாரண பேச்சு வேகம் தட்டச்சு செய்வதை விட சுமார் நான்கு மடங்கு வேகமானது, மேலும் இது கைகள் அல்லது கண்களை ஆக்கிரமிக்காது. இந்த காரணத்திற்காக, குரல் ஒரு இரண்டாம் நிலை உள்ளீட்டு முறையிலிருந்து பலருக்கு அவர்களின் அன்றாட வேலையில் முதன்மை தொடர்பு இடைமுகமாக உருவெடுத்து வருகிறது—ஒவ்வொரு வார்த்தையாக தட்டச்சு செய்வதற்குப் பதிலாக, காலை முதல் இரவு வரை நேரடியாக ஒரு ஏஜெண்டிடம் பேசுவது.
கருவி மட்டத்தில், இந்தப் பாதையில் தோராயமாக இரண்டு வகையான தயாரிப்புகள் உள்ளன. ஒன்று குரல் உள்ளீட்டு முறைகள் (எ.கா., Typeless): அவை பேச்சை நிகழ்நேரத்தில் உரையாக மாற்றி எந்தப் பயன்பாட்டிற்கும் அளிக்கின்றன, அடிப்படையில் விசைப்பலகை உள்ளீட்டை மாற்றுகின்றன. மற்றொன்று குரல் ஏஜெண்டுகள் (எ.கா., Pine, ChatGPT Voice): பயனர்கள் நேரடி உரையாடல் மற்றும் ஒத்துழைப்பில் ஈடுபடுகின்றனர், அங்கு குரல் என்பது உள்ளீடு மற்றும் தொடர்பு இரண்டுமே ஆகும். இரண்டிற்குமான மிகவும் பொதுவான மேம்பட்ட பயன்பாடு, அறிமுகத்தில் குறிப்பிடப்பட்டுள்ள விஸ்பர் கோடிங் (whisper coding) ஆகும்—பேசுவதன் மூலம் ஒரு கோடிங் அல்லது ஆராய்ச்சி ஏஜெண்டை இயக்குதல்: டெவலப்பர் தனது நோக்கத்தைக் கூறுகிறார், அதை ஏஜெண்டுடன் முன்னும் பின்னுமாக விவாதிக்கிறார், மேலும் ஏஜெண்ட் கோடிங் மற்றும் பரிசோதனைகளைச் செயல்படுத்துகிறது; இந்த புத்தகத்தின் ஆசிரியர் குழுவின் ஒரு டஜன் கட்டுரைகள் இந்த முறையில் முடிக்கப்பட்டன.
அடுத்து விவாதிக்கப்படும் குரல் கட்டமைப்பு இரண்டு திசைகளுக்கும் சேவை செய்கிறது என்பதைக் கவனத்தில் கொள்ள வேண்டும்: பயனர் ஏஜெண்டிடம் பேசுவது (மனித-இயந்திர இடைமுகமாக), மற்றும் ஏஜெண்ட் பயனர் சார்பாக வெளி உலகத்துடன் பேசுவது (எ.கா., பேச்சுவார்த்தை நடத்த தொலைபேசி அழைப்பு செய்வது). இரண்டும் ஒரே அடிப்படை நிகழ்நேர குரல் தொழில்நுட்பத்தை நம்பியுள்ளன. குரல் கட்டமைப்பின் மூன்று முன்னுதாரணங்களுடன் ஆரம்பிப்போம்.
குரல் கட்டமைப்பின் மூன்று முன்னுதாரணங்கள்¶
குரல் ஏஜெண்டுகளின் தொழில்நுட்ப பரிணாமத்தை தெளிவுபடுத்த, ஒரு தெளிவான குறிப்புச் சட்டகம் என்பது 2026 ஆம் ஆண்டில் GPT-Live ஐ வெளியிட்டபோது OpenAI வழங்கிய மூன்று பகுதி வகைப்பாடு ஆகும்[^ch9-12]—இது ChatGPT Voice தானே கடந்து வந்த மூன்று தலைமுறை கட்டமைப்புகளுடன் ஒத்துப்போகிறது:
- அடுக்கு (Cascaded): மூன்று மாதிரிகளை—தானியங்கி பேச்சு அங்கீகாரம் (ASR), பெரிய மொழி மாதிரி (LLM), மற்றும் உரை-க்கு-பேச்சு (TTS)—ஒரு குழாயில் இணைத்து, ஒன்றிலிருந்து அடுத்ததற்கு பேட்டனை அனுப்புகிறது. ஆரம்பகால ChatGPT Voice இப்படித்தான் இருந்தது. இது மக்கள் முதன்முறையாக ஒரு எல்லை மாதிரியுடன் "பேச" அனுமதித்தது, ஆனால் மாதிரிகளுக்கு இடையே பரிமாற்றத்தின் போது தகவல் இழக்கப்பட்டது, மேலும் பதில்கள் மெதுவாகவும் இறுக்கமாகவும் இருந்தன.
- இறுதி-முதல்-இறுதி அனைத்து-முறை (End-to-End Omnimodal - Omni): ஒற்றை மாதிரியைப் பயன்படுத்தி நேரடியாக "ஆடியோவைக் கேட்டு, பதிலை யோசித்து, அதைப் பேசி," மூன்று நிலைகளையும் ஒன்றாக இணைக்கிறது. இது குறைந்த தாமதத்தை ஏற்படுத்துகிறது மற்றும் உச்சரிப்பு மற்றும் உணர்ச்சி போன்ற உரை அல்லாத தகவல்களைப் பாதுகாக்கிறது. இருப்பினும், இது இன்னும் "திருப்பம் எடுத்தல்" (turn-taking) என்று கருதுகிறது—மாதிரி பயனர் இடைநிறுத்தும் வரை காத்திருந்து பேசுகிறது, மேலும் திருப்ப மாற்றம் அமைதி கண்டறிதலை நம்பியுள்ளது. ஒரு சிறிய இடைநிறுத்தம் அல்லது பின்னணி சத்தம் "பேசி முடித்துவிட்டேன்" என்று தவறாக மதிப்பிடப்படலாம், இதனால் மாதிரி பொருத்தமற்ற முறையில் குறுக்கிடுகிறது. ChatGPT இன் மேம்பட்ட குரல் முறை (Advanced Voice Mode) இந்த தலைமுறையைச் சேர்ந்தது; OpenAI இதை "திருப்பம் சார்ந்த குரல் மாதிரிகள்" (turn-based voice models) என்று அழைக்கிறது, அதேசமயம் தொழில் துறை பொதுவாக அவற்றின் திறனால் "Omni" மாதிரிகள் (எ.கா., Qwen3-Omni) என்று குறிப்பிடுகிறது. இரண்டு பெயர்களும் ஒரே விஷயத்தைக் குறிக்கின்றன.
- முழு-இருவழி / ஊடாடும்: மாதிரி ஒரே நேரத்தில் கேட்டு பேசுகிறது, உள்ளீடு மற்றும் வெளியீட்டை ஒருங்கிணைந்த முறையில் செயலாக்குகிறது, மேலும் "பேசு, கேள், நிறுத்து, குறுக்கிடு அல்லது ஒரு கருவியை அழை" என்பது குறித்து வினாடிக்கு பல முறை முடிவுகளை எடுக்கிறது, இது "திருப்பம் எடுத்தல்" அனுமானத்தை முற்றிலுமாக நீக்குகிறது. 2024 இல் Kyutai இன் Moshi ஒரு ஆராய்ச்சி முன்னோடியாக இருந்தது, மேலும் 2026 இல் OpenAI இன் GPT-Live அதை 150 மில்லியன் பயனர்கள் அளவிற்கு கொண்டு வந்தது.
இந்த மூன்று தலைமுறைகளிலும் இயங்கும் பொதுவான நூல் ஒன்றே: "திருப்பம் எடுத்தல்" அனுமானத்தில் இருந்தும், திருப்பங்கள் குறித்த VAD (Voice Activity Detection) இன் யூகத்தில் இருந்தும் எவ்வாறு விடுபடுவது. அடுக்கு மற்றும் Omni கட்டமைப்புகள் இரண்டும் இன்னும் திருப்பங்களை வரையறுக்க VAD ஐ நம்பியுள்ளன; முழு-இருவழி மட்டுமே திருப்பங்களின் கருத்தை முற்றிலுமாக கலைக்கிறது. பின்வரும் மூன்று பகுதிகள் இந்த அச்சில் விரிவாக்கப்படும். இந்த மூன்று முன்னுதாரணங்களும் புதியது பழையதை மாற்றுவது மட்டுமல்ல, மாறாக வெவ்வேறு தாமதம் மற்றும் செலவு கட்டுப்பாடுகளின் கீழ் உள்ள வடிவமைப்புத் தேர்வுகள் ஆகும், அவை 2026 இல் உற்பத்தி அமைப்புகளில் இணைந்து வாழ்கின்றன.
மேலும், GPT-Live இரண்டாவது கட்டமைப்பு மாற்றத்தை அறிமுகப்படுத்தியது—"நிகழ்நேர தொடர்பு" மற்றும் "ஆழ்ந்த சிந்தனை" ஆகியவற்றைப் பிரித்தல்: தேடல் அல்லது சிக்கலான பகுத்தறிவு தேவைப்படும் ஒரு சிக்கலை எதிர்கொள்ளும்போது, தொடர்பு மாதிரி பணியை ஒரு பின்னணி முன்னணி மாதிரிக்கு (தொடக்கத்தில் GPT-5.5) ஒப்படைக்கிறது, அதே நேரத்தில் உரையாடலைத் தொடர்கிறது. "வேகமான-மெதுவான உழைப்புப் பிரிவு" என்ற இந்த நூல் பின்னர் "சிந்தனை கட்டமைப்பில் உள்ள பரிமாற்றங்கள்" என்ற பகுதியில் விரிவாக ஆராயப்படும்.
[^ch9-12]: OpenAI. Introducing GPT-Live. 2026-07-08. https://openai.com/index/introducing-gpt-live/ . இந்தப் பகுதியில் உள்ள "அடுக்கு / திருப்பம் சார்ந்த / முழு-இருவழி" என்ற மூன்று பகுதி வகைப்பாடு, ChatGPT Voice இன் மூன்று தலைமுறை பரிணாம வளர்ச்சியின் இந்தக் கட்டுரையின் சுருக்கத்திலிருந்து உருவானது; உரையில் உள்ள "End-to-End Omnimodal (Omni)" அதன் "திருப்பம் சார்ந்த குரல் மாதிரிகள்" பிரிவுக்கு ஒத்திருக்கிறது.
முன்னுதாரணம் 1: அடுக்கு குழாய்¶
வணிக குரல் உதவியாளர்களில் பெரும்பாலானவை—ஸ்மார்ட் ஸ்பீக்கர்கள் முதல் வாடிக்கையாளர் சேவை ரோபோக்கள் வரை—ஒரு தொடர் குழாய் அடிப்படையில் உள்ளன (படம் 9-1): Voice Activity Detection (VAD) பயனர் பேசி முடித்ததை தீர்மானிக்கிறது → Automatic Speech Recognition (ASR) ஆடியோவை உரையாக மாற்றுகிறது → ஒரு பெரிய மொழி மாதிரி (LLM) நோக்கத்தைப் புரிந்துகொண்டு பதிலை உருவாக்குகிறது → Text-to-Speech (TTS) பதிலைக் குரலாக்குகிறது. ஒரு தொடர் ஓட்டம் போல, ஒவ்வொரு நிலையும் முந்தையது முடிவடையும் வரை காத்திருக்க வேண்டும், பின்னரே அது தொடங்க முடியும்.
ஆரம்பகால குரல் உதவியாளர்கள் இந்த நான்கு-நிலை தொடர் குழாயை ஒரு எளிய காரணத்திற்காக ஏற்றுக்கொண்டன: எந்த ஒரு மாதிரியாலும் ஒரே நேரத்தில் பேச்சு அங்கீகாரம், மொழி புரிதல், சிந்தனை மற்றும் பேச்சு தொகுப்பு ஆகியவற்றைக் கையாள முடியவில்லை. தொகுதி கட்டமைப்பு ஒவ்வொரு கூறுகளையும் சுயாதீனமாக உருவாக்க மற்றும் மேம்படுத்த அனுமதித்தது. இருப்பினும், தொகுதித்தன்மையின் விலை திரட்டப்பட்ட தாமதம் ஆகும்—ஒவ்வொரு நிலையும் முந்தையது முடிவடையும் வரை காத்திருக்க வேண்டும், பின்னரே அது தொடங்க முடியும்.
VAD என்பது குழாயின் தொடக்கப் புள்ளியாகும், இது ஆடியோ ஸ்ட்ரீமைத் தொடர்ச்சியாகக் கண்காணிக்கிறது. மிக முக்கியமான வடிவமைப்பு பேச்சு முடிவு கண்டறிதல் (End-of-Speech Detection) ஆகும்: பொதுவாக, 500-800 மில்லி விநாடிகள் கொண்ட தொடர்ச்சியான அமைதி வரம்பு நிர்ணயிக்கப்படுகிறது—பயனர் அரை விநாடிக்கும் மேலாகப் பேசுவதை நிறுத்தினால், VAD அந்த உச்சரிப்பு முடிந்துவிட்டதாகக் கருதுகிறது. இது முதல் அடுக்கு தாமதத்தை அறிமுகப்படுத்துகிறது, மேலும் இது ஒரு கடினமான பரிமாற்றமாகும்: வரம்பு மிகவும் குறுகியதாக இருந்தால், சிந்தனைக்கான இடைவெளி முடிவு என்று தவறாகக் கருதப்பட்டு, வாக்கியம் நடுவில் துண்டிக்கப்படும்; அது மிகவும் நீளமாக இருந்தால், பயனர் பேசி முடித்த பிறகு பதில் கிடைக்க கிட்டத்தட்ட ஒரு விநாடி காத்திருக்க வேண்டியிருக்கும்.
ASR ஆடியோ அலைவடிவத்தை உரையாக மாற்றுகிறது. Whisper மற்றும் SenseVoice போன்ற மாதிரிகள், GPU இல் பயன்படுத்தப்படும் சிறிய முதல் நடுத்தர அளவிலான மாதிரியுடன் 5 விநாடிகள் ஆடியோவை படியெடுக்கும்போது, பொதுவாக 50-200 மில்லி விநாடிகள் எடுக்கும்; பெரிய மாதிரிகள் அல்லது வள-கட்டுப்பாடுள்ள பயன்பாடுகள் 200-500 மில்லி விநாடிகள் எடுக்கலாம் (சோதனை 9-3 இல் உள்ள கட்டுப்பாட்டுக் குழு பிந்தைய வகையைச் சேர்ந்தது). மிக முக்கியமான பிரச்சினை என்னவென்றால், முழு VAD காத்திருப்பு மற்றும் ASR படியெடுப்பு செயல்முறையின் போது, அதன் பின்னால் உள்ள LLM முற்றிலும் செயலற்ற நிலையில் உள்ளது, எந்த தகவலையும் பெறவில்லை மற்றும் முன்கூட்டியே சிந்திக்கத் தொடங்க முடியவில்லை.
LLM அனுமானம், உகந்ததாக்கப்பட்டாலும் கூட, சூழல் நீளத்தைப் பொறுத்து பெரும்பாலும் 100-500 மில்லி விநாடிகள் முதல் டோக்கன் நேரம் (Time to First Token - TTFT) கொண்டிருக்கும், மேலும் முதல் வாக்கியத்தை வெளியிட முடிக்க மற்றொரு ~100 மில்லி விநாடிகள் ஆகும். பகுத்தறிதல் இயக்கப்பட்டிருந்தால், நேரம் 5-10 விநாடிகள் வரை நீட்டிக்கப்படலாம். பாரம்பரிய கட்டமைப்பில், TTS ஆனது LLM முழுமையான பதில் உரையை வெளியிடும் வரை காத்திருக்க வேண்டும், பின்னரே அது வேலை செய்யத் தொடங்க முடியும்.
TTS பதில் உரையை பேச்சாக மாற்றுகிறது, பொதுவாக தொகுப்புக்கு 200-500 மில்லி விநாடிகள் எடுக்கும். ஒவ்வொரு இணைப்பின் தாமதத்தையும் (படம் 9-2) கூட்டினால்: VAD (500-800 மி.வி) + ASR (50-200 மி.வி) + LLM (100-500 மி.வி) + TTS (200-500 மி.வி), மொத்தம் தோராயமாக 0.9-2 விநாடிகள் ஆகும்—மேலும் இது அனைத்து சேவைகளும் செயலற்ற நிலையில் மற்றும் வரிசையில் எதுவும் இல்லாத சிறந்த நிலையாகும்.
உற்பத்தி நிலைக்குச் சென்றவுடன், வரிசை தாமதம் நிலைமையை மோசமாக்குகிறது. இது ஒரு உணவகத்தில் வரிசையில் நிற்பதைப் போன்றது: சமையலறை எவ்வளவு பிஸியாக இருக்கிறதோ, அவ்வளவு காத்திருக்கும் நேரம் அதிகமாகும், மேலும் அது நேர்கோட்டில் அதிகரிக்காமல் வெடித்துச் சிதறும் (படம் 9-3). ஒரு சேவையகத்தில் காத்திருப்பு வரிசை இல்லாதபோது (அதாவது, "செயலற்ற நிலை"), ஒரு கோரிக்கையைச் செயலாக்க எடுக்கும் நேரம் செயலற்ற தாமதம் (idle latency) என்று அழைக்கப்படுகிறது. ஆனால் பல கோரிக்கைகள் ஒரே நேரத்தில் வரும்போது, பிந்தைய கோரிக்கைகள் வரிசையில் நிற்க வேண்டும்.
உள்ளுணர்வாக, பயன்பாட்டு விகிதம் (utilization) அதிகமாக இருந்தால், காத்திருக்கும் நேரம் நேர்கோட்டில் அல்லாமல் அதிகரிக்கிறது. குறிப்பிட்ட கணித உறவை வரிசை கோட்பாடு (queuing theory) மூலம் வழங்க முடியும் (இங்கு உள்ளுணர்வு புரிதலுக்காக, கடுமையான வழித்தோன்றல் தேவையில்லை): மொத்த தாமதம் ≈ செயலற்ற தாமதம் × 1/(1-பயன்பாட்டு விகிதம்). பயன்பாட்டு விகிதம் என்பது சேவையகம் பிஸியாக இருக்கும் நேரத்தின் விகிதமாகும்; எடுத்துக்காட்டாக, 50% பயன்பாட்டு விகிதம் என்பது சேவையகம் பாதி நேரம் கோரிக்கைகளைச் செயலாக்குகிறது மற்றும் பாதி நேரம் செயலற்று உள்ளது என்று பொருள். 50% பயன்பாட்டு விகிதத்தில், தாமதம் இரட்டிப்பாகும்; 80% பயன்பாட்டு விகிதத்தில், அது 5 மடங்கு ஆகும்—அதனால்தான் சேவையகங்களை நீண்ட நேரம் அதிக சுமையின் கீழ் இயக்க முடியாது.
சோதனை 9-1 ★: பாரம்பரிய குரல் ஏஜெண்டை உருவாக்குதல்
இந்த சோதனையானது, பயனர்கள் மைக்ரோஃபோன் மூலம் AI உடன் குரல் மூலம் தொடர்பு கொள்ள அனுமதிக்கும் ஒரு முழுமையான நிகழ்நேர குரல் உரையாடல் அமைப்பை உருவாக்குகிறது. இந்த அமைப்பு WebSocket வழியாக நிகழ்நேர தொடர்பைக் கொண்ட முன்பக்கம்/பின்பக்கம் பிரிப்பு கட்டமைப்பைப் பயன்படுத்துகிறது.
மைய செயல்முறை ஒரு கடுமையான தொடர் முறையைப் பின்பற்றுகிறது: முன்பக்கம் மைக்ரோஃபோன் உள்ளீட்டைப் பிடித்து WebSocket வழியாக நிகழ்நேரத்தில் பின்பக்கத்திற்கு அனுப்புகிறது. பின்பக்கம் குரல் செயல்பாட்டைக் கண்டறிய Silero VAD மாதிரியை இயக்குகிறது, இது பாரம்பரிய ஒலி அளவு அடிப்படையிலான கண்டறிதல் முறைகளுடன் ஒப்பிடும்போது அதிக துல்லியத்தையும் சிறந்த சத்தம் எதிர்ப்புத் திறனையும் வழங்குகிறது. தோராயமாக 500ms தொடர்ச்சியான அமைதியைக் கண்டறிந்த பிறகு, அடுத்தடுத்த செயலாக்கத்திற்காக ஆடியோ பகுதி பிரித்தெடுக்கப்படுகிறது.
ASR, LLM மற்றும் TTS நிலைகள் ஒவ்வொன்றும் பல வழங்குநர்களுக்கு இடையே நெகிழ்வான மாற்றத்தை ஆதரிக்கின்றன, இது டெவலப்பர்கள் தாமதம், துல்லியம் மற்றும் பிராந்திய நெட்வொர்க் நிலைமைகளின் அடிப்படையில் உகந்த கலவையைத் தேர்வு செய்ய அனுமதிக்கிறது.
சோதனை 9-2 ★: PineClaw Voice API ஐப் பயன்படுத்தி தொலைபேசி ஏஜெண்டை உருவாக்குதல்
சோதனை 9-1 உலாவியில் இயங்கும் குரல் உரையாடல் அமைப்பை உருவாக்கியது, ஆனால் பல நிஜ உலக ஏஜெண்ட் பணிகளுக்கு உண்மையான தொலைபேசி அழைப்புகளை மேற்கொள்ள வேண்டும்—வாடிக்கையாளர் சேவையைத் தொடர்புகொண்டு பில்களைப் பேச்சுவார்த்தை நடத்துதல், உணவகங்களை முன்பதிவு செய்தல், ஆர்டர்களை உறுதிப்படுத்துதல். அத்தியாயம் 4, PineClaw இன் சேனல் பொறிமுறை மூலம், நிகழ்வு-உந்துதல் கட்டமைப்பு தொலைபேசி அறிவிப்புகளுக்கான பதில் தாமதத்தை நிமிடங்களிலிருந்து வினாடிகளாக எவ்வாறு குறைக்க முடியும் என்பதை நிரூபித்தது. இந்த சோதனை குரல் அழைப்பை உருவாக்குவதில் கவனம் செலுத்துகிறது. PineClaw Voice API (ஆசிரியரின் குழுவால் உருவாக்கப்பட்டது) ஐ உதாரணமாக எடுத்துக்கொண்டால், இத்தகைய உற்பத்தி-தர தொலைபேசி குரல் APIக்கள் பொதுவாக டயலிங், IVR வழிசெலுத்தல் (அதாவது, "விசாரணைகளுக்கு, 1 ஐ அழுத்தவும்; ஆபரேட்டருக்கு, 0 ஐ அழுத்தவும்" தொலைபேசி மெனுக்கள்), உரையாடல் மற்றும் டிரான்ஸ்கிரிப்ஷன் ஆகியவற்றின் முழு செயல்முறையையும் உள்ளடக்கியது: ஏஜெண்ட் தொலைபேசி எண், இலக்கு மற்றும் சூழல் தகவலை வழங்குகிறது, மேலும் குரல் ஏஜெண்ட் முழு அழைப்பையும் முடித்து, கட்டமைக்கப்பட்ட அழைப்பு பதிவைத் தருகிறது.
சோதனை இலக்கு: உண்மையான தொலைபேசி அழைப்புகள் மூலம் பணிகளை முடிக்கும் திறன் கொண்ட ஒரு ஏஜெண்டை உருவாக்குதல், PineClaw Voice ஐ ஒரு கருவியாக ReAct லூப்பில் ஒருங்கிணைத்தல்.
தொழில்நுட்ப அணுகுமுறை: PineClaw Voice Python SDK (
pine-voice) ஐப் பயன்படுத்தி, ஏஜெண்டிற்குmake_phone_callஎன்ற கருவியை வழங்குதல். ஏஜெண்ட் பயனரின் பணி விளக்கத்தைப் பெறுகிறது (எ.கா., "நாளை மதியம் 3 மணிக்கு பல் பரிசோதனைக்கு முன்பதிவு செய்ய உதவுங்கள்"), மேலும் ReAct சிந்தனை மூலம் முடிவு செய்கிறது: (1) எந்த தொலைபேசி எண்ணை அழைக்க வேண்டும்; (2) அழைப்பின் இலக்கு மற்றும் முக்கிய தகவல்; (3) அழைப்பு முடிந்த பிறகு முடிவுகளை பயனருக்கு எவ்வாறு தெரிவிப்பது.ஏஜெண்டின் பணிப்பாய்வு: பயனர் "கிளினிக்கை அழைத்து நாளை சந்திப்பை முன்பதிவு செய்யுங்கள்" என்று கூறுகிறார் → ஏஜெண்ட் என்ன தகவல் தேவை என்பதைப் பற்றி சிந்திக்கிறது (கிளினிக் தொலைபேசி எண், சந்திப்பு நேரம், நோயாளியின் பெயர்) → தகவல் போதுமானதாக இல்லாவிட்டால், பயனரிடம் தெளிவுபடுத்தும்படி கேட்கிறது →
make_phone_callகருவியை அழைக்கிறது → PineClaw எண்ணை டயல் செய்து, மறுபக்கத்துடன் உரையாடி, முன்பதிவை முடிக்கிறது → ஏஜெண்ட் அழைப்பு சுருக்கம் மற்றும் டிரான்ஸ்கிரிப்டைப் பெறுகிறது → முடிவை பயனருக்குத் தெரிவிக்கிறது.ஏற்றுக்கொள்ளும் அளவுகோல்கள்: சோதனை அழைப்பை வெற்றிகரமாக மேற்கொள்ளுதல் (இணைப்பைச் சரிபார்க்க முதலில் உங்கள் சொந்த தொலைபேசிக்கு அழைக்கலாம்). பணி விளக்கத்தின் அடிப்படையில் ஏஜெண்ட் தானாகவே அழைப்பு அளவுருக்களைத் தீர்மானிக்க முடியும். அழைப்பு முடிந்த பிறகு, அது முக்கியத் தகவல்களை (சந்திப்பு நேரம், உறுதிப்படுத்தல் எண் போன்றவை) சரியாகப் பிரித்தெடுத்து, பயனருக்குத் தெரிவிக்கிறது. API ஐ நேரடியாகப் பயன்படுத்துவதற்கும், ஏஜெண்டின் ReAct லூப் மூலம் அழைப்பதற்கும் இடையே உள்ள வேறுபாட்டை ஒப்பிடுக—பிந்தையது முழுமையற்ற தகவல் உள்ள சூழ்நிலைகளைக் கையாள முடியும் (எ.கா., பயனர் வழங்கவில்லை என்றால் தொலைபேசி எண்ணைத் தேடுதல்).
இந்தச் சோதனை குரல் ஏஜெண்டுகளுக்கான ஒரு முக்கியமான பயன்பாட்டுத் திசையை நிரூபிக்கிறது: ஏஜெண்டுகள் பயனர்களுடன் குரல் உரையாடல் நடத்துவது மட்டுமல்லாமல், பயனரின் சார்பாக வெளி உலகத்துடன் தொலைபேசி அழைப்புகள் மூலமும் தொடர்பு கொள்ள முடியும். PineClaw இன் குரல் ஏஜெண்ட் மணிக்கணக்கான காத்திருப்புகள், தொலைபேசி மெனு வழிசெலுத்தல் மற்றும் சிக்கலான பேச்சுவார்த்தைகளைக் கையாள சிறப்பாகப் பயிற்றுவிக்கப்பட்டுள்ளது—உங்களுக்காக உங்கள் தொலைத்தொடர்பு நிறுவனத்தின் வாடிக்கையாளர் சேவைக்கு AI அழைப்பு செய்து, மனித ஆபரேட்டருக்காக வரிசையில் காத்திருப்பதை கற்பனை செய்து பாருங்கள். பாரம்பரிய தொடர் குரல் குழாய்கள் சிரமப்படும் சூழ்நிலைகள் இவைதான்.
அடுக்கு குழாயின் முழு-இணைப்பு ஸ்ட்ரீமிங்¶
ஒரு பொதுவான தவறான கருத்தை தெளிவுபடுத்த வேண்டும்: மேலே குறிப்பிடப்பட்ட 0.9–2 வினாடி தாமத வரவு செலவுத் திட்டமானது, "ஒவ்வொரு இணைப்பும் முடிந்த பின்னரே அடுத்ததற்கு அனுப்பப்படும்" என்ற முழுமையான தொடர் காட்சியைக் கருதுகிறது. இருப்பினும், 2025 இல் உற்பத்தி அமைப்புகள் இனி இந்த வழியில் செயல்படுவதில்லை. பிரதான அணுகுமுறை, தொகுதி அமைப்பைக் கைவிடுவது அல்ல, மாறாக VAD-ASR-LLM-TTS பிரிவைத் தக்க வைத்துக்கொண்டு, ஒவ்வொரு நிலையையும் ஸ்ட்ரீமிங் ஆக்குவதாகும், இதனால் அருகிலுள்ள நிலைகள் நேரத்தில் ஒன்றுடன் ஒன்று இணைய முடியும்:
- ASR கேட்கும்போதே டிரான்ஸ்கிரைப் செய்கிறது: ஸ்ட்ரீமிங் அங்கீகாரத்தைப் பயன்படுத்தி, பயனர் இன்னும் பேசிக்கொண்டிருக்கும்போதே உரை தொடர்ச்சியாக உருவாக்கப்படுகிறது, VAD வாக்கியத்தின் முடிவைத் தீர்மானிக்கும் வரை காத்திருக்காமல், டிரான்ஸ்கிரிப்ஷனைத் தொடங்குகிறது.
- LLM வாக்கியத் துண்டுகளாக வெளியீடு அளிக்கிறது: மாதிரி உருவாக்கும்போது, அது நிறுத்தற்குறிகள் அல்லது சொற்பொருளின் அடிப்படையில் பதிலை சிறிய வாக்கியங்களாகப் பிரிக்கிறது. முதல் வாக்கியம் உருவானதும், முழு பதிலும் எழுதப்படும் வரை காத்திருக்காமல், அது கீழ்நிலைக்கு அனுப்பப்படுகிறது.
- TTS வாக்கிய மட்டத்தில் ஸ்ட்ரீம் செய்கிறது: முதல் சிறிய வாக்கியம் வந்தவுடன் அதை ஒருங்கிணைத்து இயக்கத் தொடங்குகிறது, அடுத்தடுத்த வாக்கியங்கள் உருவாக்கப்பட்டு நிகழ்நேரத்தில் சேர்க்கப்படுகின்றன. இது பயனர் முதல் எழுத்தைக் கேட்கும் நேரத்தை கணிசமாக முன்னேற்றுகிறது.
இதன் விளைவாக, ASR, LLM மற்றும் TTS ஆகிய மூன்று நிலைகளும் இனி ஒரு தொடர் ரிலே போன்ற உறவில் இல்லாமல், ஒரு அசெம்பிளி லைனில் உள்ள மூன்று பணிநிலையங்களைப் போல ஒரே நேரத்தில் செயல்படுகின்றன. LiveKit Agents மற்றும் Pipecat போன்ற திறந்த மூல கட்டமைப்புகள், அத்துடன் பிரதான வணிக அவுட்பவுண்ட் கால் அமைப்புகள் அனைத்தும் இந்த அணுகுமுறையைப் பின்பற்றுகின்றன. முழு-சங்கிலி ஸ்ட்ரீமிங் செய்த பிறகு, இறுதி முதல் இறுதி வரையிலான தாமதத்தை பொதுவாக 600–800ms ஆகக் குறைக்க முடியும், இது முழுமையான தொடர் செயலாக்கத்தின் 0.9–2 வினாடிகளை விட கணிசமாக சிறந்தது.
இருப்பினும், ஸ்ட்ரீமிங் மூலம் "டிரான்ஸ்கிரிப்ஷன், சிந்தனை மற்றும் தொகுப்பு" போன்ற ஒன்றுடன் ஒன்று இணைக்கக்கூடிய பகுதிகளை மட்டுமே சுருக்க முடியும். அதனால் நீக்க முடியாத ஒரு தாமதப் பகுதி உள்ளது: VAD-ன் அமைதி காத்திருப்பு மற்றும் பேச்சு முடிவு தீர்ப்பு. பயனர் பேசி முடித்துவிட்டாரா என்பதை யூகிக்க, கணினி இன்னும் 500–800ms அமைதி வரம்பை நம்பியுள்ளது. இந்த காத்திருப்பு காலம், பைப்லைன் தொடங்குவதற்கான முன்நிபந்தனையாகும், மேலும் இதை ஒன்றுடன் ஒன்று இணைப்பதன் மூலம் நீக்க முடியாது. இந்த தாமதத்தையும் சுருக்க, கவனம் "ஒன்றுடன் ஒன்று இணைக்கும் நிலைகளில்" இருந்து முன்பக்கத்தில் உள்ள உணர்தல் நிலைக்கு மாற வேண்டும்.
ஸ்ட்ரீமிங் குரல் உணர்தல்: VAD + ASR-ஐ மாற்றுதல்¶
இந்த உணர்தல் முன்பக்கம் இரண்டு நிலைகளைக் கொண்டுள்ளது—VAD பயனர் பேசி முடித்துவிட்டாரா என்பதைத் தீர்மானிக்கிறது, மேலும் ASR ஆடியோவை உரையாக மாற்றுகிறது. இவை இரண்டும் சேர்ந்து, முழு பைப்லைன் எப்போது தொடங்கும் மற்றும் அது என்ன உள்ளீட்டைப் பெறும் என்பதைத் தீர்மானிக்கின்றன. பாரம்பரிய VAD + ASR சங்கிலி மூன்று அடிப்படை சிக்கல்களைக் கொண்டுள்ளது:
- தாமதக் குவிப்பு: VAD பயனர் பேசி முடித்துவிட்டதை உறுதிப்படுத்த 500–800ms அமைதிக்காக காத்திருக்க வேண்டும், ஏனெனில் அது எதிர்காலத்தை கணிக்க முடியாது மற்றும் "உண்மையில் முடித்துவிட்டாரா" அல்லது "யோசிப்பதற்காக இடைநிறுத்துகிறாரா" என்பதை வேறுபடுத்த "காத்திருப்பை" மட்டுமே நம்பியிருக்க முடியும்.
- தகவல் இழப்பு: VAD "குரல்/அமைதி" போன்ற இரும நிலை சமிக்ஞையை மட்டுமே வெளியிடுகிறது. அனைத்து ஒலி விவரங்களும்—உணர்ச்சி மாற்றங்கள், குரல் ஏற்ற இறக்கங்கள், தயக்க இடைநிறுத்தங்கள், பின்னணி சூழல்—இழக்கப்படுகின்றன. சிக்கலான சூழல்களில் தவறான தீர்ப்பு சிக்கல்கள் குறிப்பாக முக்கியத்துவம் பெறுகின்றன: பயனரின் சற்று நீண்ட இடைநிறுத்தம் முடிந்ததாக தவறாக தீர்மானிக்கப்பட்டு வாக்கியம் துண்டிக்கப்படுகிறது; பின்னணி இரைச்சல் தவறான தொடக்கங்களைத் தூண்டி, யாரும் பேசாதபோது கணினி செயல்படுகிறது; மேலும் பயனரின் "ஆம்" என்பது குறுக்கீடா அல்லது ஒப்புதலா என்பதை தீர்மானிக்க முடியவில்லை.
- துல்லியம் குறைதல்: VAD தொடர்ச்சியான ஆடியோவை சுயாதீன பகுதிகளாக வெட்டுகிறது, ஒவ்வொன்றும் ASR-க்கு அனுப்பப்பட்டு அங்கீகரிக்கப்படுகிறது, இது சூழல் தொடர்ச்சியை சீர்குலைக்கிறது. சரியான அங்கீகாரத்திற்கு சூழல் தேவைப்படும் உள்ளடக்கங்களில் (மின்னஞ்சல் முகவரிகள், பிராண்ட் பெயர்கள், நபர் பெயர்கள், சரியான பெயர்ச்சொற்கள்) பிழை விகிதங்கள் கணிசமாக அதிகரிக்கின்றன—எடுத்துக்காட்டாக, ஒரு பயனர் "john dot smith at gmail dot com" என்று சொன்னால், "john" மற்றும் "smith" வெவ்வேறு பகுதிகளாக வெட்டப்பட்டால், "smith" என்பது சூழல் இல்லாததால் "miss" என்று தவறாக அங்கீகரிக்கப்படலாம்.
ஸ்ட்ரீமிங் குரல் உணர்வு மாதிரிகள் ஒரு அடிப்படை தீர்வை வழங்குகின்றன. முதலில், "ஸ்ட்ரீமிங்" என்பதன் தொழில்நுட்ப அர்த்தத்தை தெளிவுபடுத்த வேண்டும்: ஒரு குரல் மாதிரியானது ஸ்ட்ரீமிங் செய்ய முடியுமா என்பது, என்கோடர் கார்சல் அல்லது சங்க்-அடிப்படையிலானதா (முழு பதிவையும் பார்க்கத் தேவையில்லாமல், ஏற்கனவே வந்த ஆடியோவை மட்டுமே நம்பியிருப்பது) மற்றும் டிகோடிங் அதிகரிப்பு முறையில் உள்ளதா (ஒவ்வொரு முறை ஒரு சிறிய ஆடியோ சங்க் பெறப்படும்போதும் பகுதி முடிவுகளை வெளியிடுவது) என்பதைப் பொறுத்தது. Whisper ஸ்ட்ரீமிங் செய்ய முடியாது, அதன் டிகோடிங் முறை காரணமாக அல்ல—அதன் டிகோடிங் இயல்பாகவே ஆட்டோரிக்ரசிவ் ஆகும்—மாறாக அதன் என்கோடர் வேலை செய்யத் தொடங்க ஒரு முழுமையான ஆடியோ பகுதி (நிலையான 30 வினாடிகள், சிறியதாக இருந்தால் பேட் செய்யப்படும்) தேவைப்படுவதால். ஸ்ட்ரீமிங் அங்கீகாரம் புதிய தொழில்நுட்பம் அல்ல என்பதையும் கவனத்தில் கொள்ள வேண்டும்: RNN-T மற்றும் ஸ்ட்ரீமிங் Conformer ஆல் பிரதிநிதித்துவப்படுத்தப்படும் பாரம்பரிய ஸ்ட்ரீமிங் ASR, தொழில்துறையில் நீண்ட காலமாக பெரிய அளவில் பயன்படுத்தப்பட்டு வருகிறது—தொலைபேசிகளில் நிகழ்நேர வசனங்கள் மற்றும் உள்ளீட்டு முறைகளுக்கான குரல் உள்ளீடு போன்றவை இந்த மாதிரிகளைப் பயன்படுத்துகின்றன—மேலும் அவை LLM களுடன் எந்த தொடர்பும் இல்லை.
இந்த பகுதி ஒரு புதிய பாதையில் கவனம் செலுத்துகிறது: LLM-அடிப்படையிலான ஸ்ட்ரீமிங் செவிப்புல உணர்வு—திறந்த மூல LLM ஐ பின்-பயிற்சிக்கான முதுகெலும்பாகப் பயன்படுத்தி, தொடர்ச்சியான ஆடியோ ஸ்ட்ரீமில் இருந்து நேரடியாக சொற்பொருள் மட்ட பதில்களை வெளியிட மாதிரியை அனுமதிக்கிறது, "அங்கீகாரம்" மற்றும் "புரிதல்" ஆகியவற்றை ஒரே மாதிரியில் இணைக்கிறது. இது பாரம்பரிய ஸ்ட்ரீமிங் ASR க்கு ஒரு மேம்படுத்தலாகும், ஸ்ட்ரீமிங் தொழில்நுட்பத்தின் கண்டுபிடிப்பு அல்ல: அதிகரிப்பு அங்கீகாரத்தின் தாமதம் ஒற்றை-படி அனுமான நேரத்தின் வரிசையில் (பத்துகள் முதல் சில நூறு மில்லி விநாடிகள் வரை) உள்ளது, ஆனால் மாதிரி இனி VAD ஆல் வெட்டப்பட்ட தனிமைப்படுத்தப்பட்ட துண்டுகளைப் பார்ப்பதில்லை. மாறாக, உரையாடலின் தொடக்கத்திலிருந்து தற்போதைய தருணம் வரையிலான தொடர்ச்சியான ஆடியோ ஸ்ட்ரீமைப் பார்க்கிறது, இது முழுமையான சூழலை அடிப்படையாகக் கொண்ட இன்-காண்டெக்ஸ்ட் கற்றலை செயல்படுத்துகிறது, பயனரின் தனிப்பட்ட தகவல்கள், தொழில்முறை சொற்கள் மற்றும் உச்சரிப்பு பழக்கங்களுக்கான அங்கீகார துல்லியத்தை கணிசமாக மேம்படுத்துகிறது.
இந்த பாதையின் மற்றொரு முக்கிய நன்மை, LLM களின் உலக அறிவு மற்றும் பொது அறிவு பகுத்தறிவு திறன்களைப் பெறுவதாகும்—எல்லாவற்றிற்கும் மேலாக, முதுகெலும்பு மாதிரி ஏராளமான உரையைப் பார்த்துள்ளது. எடுத்துக்காட்டாக, "Apple" ஐத் தொடர்ந்து "event" வந்தால், அது பழத்தை விட நிறுவனத்தைக் குறிக்கும் என்பதை மாதிரி அறியும். இந்த அறிவு மேம்பாடு, தொகைகள், இடப் பெயர்கள் மற்றும் பிராண்ட் பெயர்கள் போன்ற உயர் மதிப்பு தகவல்களுக்கான அங்கீகார துல்லியத்தை பாரம்பரிய ASR ஐ விட மிக அதிகமாக்குகிறது. இந்த பாதையில் ஏற்கனவே பயன்படுத்தக்கூடிய மாதிரிகள் உள்ளன, எடுத்துக்காட்டாக Fixie இன் Ultravox—இது ஆடியோவை நேரடியாக LLM முதுகெலும்பில் செலுத்தி, உரை மற்றும் சொற்பொருள் டோக்கன்களை வெளியிடுகிறது. இந்த பகுதியின் சோதனைகளில் பயன்படுத்தப்படும் Qwen2-Audio, மற்றும் Alibaba இன் Qwen2.5-Omni ஆகியவையும் இந்த ஆடியோ-நேட்டிவ் மாதிரிகள் வகையைச் சேர்ந்தவை.
இருப்பினும், VAD-ஐ மாற்றுவதற்கு முழு அளவிலான ஆடியோ LLM தேவைப்பட வேண்டியதில்லை. முதல் சிக்கலை மட்டும் தீர்க்க வேண்டும் என்றால்—பயனர் பேசி முடித்துவிட்டாரா என்பதை தீர்மானித்தல்—இலகுவான வழி உள்ளது: இந்த "திருப்ப முடிவு" (turn judgment) நேரடியாக அடையாளங்காட்டியிலேயே பொதிந்து வைப்பது[^ch9-11]. இந்த அணுகுமுறையில், ஒரு சிறிய திறந்த மூல ஸ்ட்ரீமிங் அடையாளங்காட்டி மாதிரியில் LoRA சேர்க்கப்பட்டு, அது ஒரே நேரத்தில் பிரதி எடுத்து, சொற்பொருளையும் அமைதியையும் ஒருங்கிணைத்து "இந்த வாக்கியம் முழுமையான பொருளை வெளிப்படுத்தியதா" என்பதை தீர்மானிக்கிறது—ஏனெனில், பேச்சின் இடையேயான இடைநிறுத்தங்கள் (தொலைபேசி எண்ணைச் சொல்லும்போது இடைநிறுத்தம்) பெரும்பாலும் திருப்பங்களுக்கு இடையிலான இடைவெளிகளை விட நீளமாக இருக்கும்; அமைதி வரம்பை மட்டுமே நம்பினால் இரு நிலைகளிலும் தோல்வி ஏற்படும். மிகவும் சுவாரஸ்யமான முடிவு என்னவென்றால், "திருப்பத்தை எடுக்கலாமா வேண்டாமா" என்பதில் மாதிரியின் ஊசலாட்டம் பெரும்பாலும் மாதிரி கட்டமைப்பிலிருந்து அல்ல, மாறாக "தெய்வீகப் பார்வை" (God's eye view) கொண்ட பயிற்சி லேபிள்களிலிருந்து உருவாகிறது—லேபிளிங்கில் முடிவு புள்ளிக்குப் பிறகு தோன்றிய ஆடியோ பயன்படுத்தப்பட்டது, ஆனால் ஆன்லைன் மாதிரியால் எதிர்காலத்தைப் பார்க்க முடியாது. ஒவ்வொரு லேபிளையும் "முடிவு எடுக்கும் தருணத்தில் மட்டுமே கிடைக்கும் தகவலைப் பயன்படுத்தி" லேபிளிடுவதன் மூலம், இந்த தவறான ஊசலாட்டம் மறைந்துவிடும். இது அத்தியாயம் 7 இல் பிந்தைய பயிற்சி (post-training) பற்றிய தீர்ப்பை எதிரொலிக்கிறது: பெரும்பாலும், தரவு கட்டமைப்பை விட முக்கியமானது. இந்த இலகுவான வழியில் உற்பத்தி-தர செயலாக்கங்களும் உள்ளன: Deepgram-ன் Flux மற்றும் AssemblyAI-ன் Universal-Streaming ஆகியவை இறுதிப்புள்ளி மற்றும் திருப்ப முடிவை நேரடியாக ஸ்ட்ரீமிங் அடையாளங்காட்டி மாதிரிகளில் பொதிந்து, குரல் முகவர்களுக்காக வடிவமைக்கப்பட்டுள்ளன; திறந்த மூலப் பக்கத்தில், LiveKit மற்றும் Pipecat ஆகியவை சொற்பொருள் திருப்ப கண்டறிதல் மாதிரிகளை வழங்குகின்றன.
[^ch9-11]: திருப்ப முடிவை அடையாளங்காட்டியில் பொதிந்து வைப்பது மற்றும் லேபிள்களின் "தெய்வீகப் பார்வை" பற்றிய நோயறிதலை Li, Bojie மற்றும் Noah Shi ஆகியோரின் The Trade-off Was in the Labels: Causal Supervision for Turn-Aware Streaming ASR. 2026 (வெளியாகவுள்ளது) இல் காணலாம்.
மாதிரி உரையை மட்டுமல்ல, ஒலி நிகழ்வுகளுக்கான சிறப்பு குறிப்பான்களின் (special markers) தொடரையும் வெளியிடுகிறது—இவை மாதிரி பயிற்சியின் போது அறிமுகப்படுத்தப்பட்ட அர்ப்பணிப்பு டோக்கன்கள். தொடர்புடைய ஒலி நிகழ்வுகளைக் கண்டறியும்போது அவற்றை தானாக வெளியிட மாதிரி கற்றுக்கொள்கிறது. பொதுவான வகைகள் பின்வருமாறு:
<speak_start/end>: எளிய அமைதி கண்டறிதலை விட, சொற்பொருள் மற்றும் ஒலியியலின் விரிவான தீர்ப்பின் அடிப்படையில் பேச்சின் தொடக்கம் மற்றும் முடிவைத் தீர்மானிக்கிறது.<interrupt>: பயனர் உண்மையில் குறுக்கிட விரும்புகிறாரா அல்லது ஒப்புக்கொள்கிறாரா அல்லது பின்னணி இரைச்சலால் பாதிக்கப்படுகிறாரா என்பதை வேறுபடுத்துகிறது.<emotion:happy/frustrated>: உணர்ச்சி குறிப்பான்கள்.<laugh>/<sigh>: சிரிப்பு மற்றும் பெருமூச்சு போன்ற பார்மொழி சமிக்ஞைகள்.<music>/<noise>: சுற்றுச்சூழல் ஒலிகள்.
இந்த குறிப்பான்கள், உரை டோக்கன்களுடன் சேர்ந்து, ஒருங்கிணைந்த நிகழ்வு ஸ்ட்ரீமை உருவாக்கி, சிந்தனை அடுக்குக்கு (thinking layer) அனுப்பப்படுகின்றன.
Input audio: "Um, actually I think... no wait, let me reconsider."
Model output stream:
<speak_start> Um, <emotion:hesitant> actually I think...
<silence:500ms> no wait, <emotion:confident> let me reconsider <speak_end>
குறிப்பு: மாதிரியானது உரை பிரதியெடுப்பை மட்டுமல்லாமல், குரல் நிகழ்வு குறிப்பான்களையும் (பேச்சின் தொடக்கம்/முடிவு, உணர்ச்சி மாற்றங்கள், அமைதி இடைவெளிகள்) வெளியிடுகிறது. ஏஜெண்ட் கட்டமைப்புகள் இந்த குறிப்பான்களை மிகவும் இயற்கையான தொடர்புகளுக்குப் பயன்படுத்தலாம்—எடுத்துக்காட்டாக, பயனரின் தயக்கத்தைக் கண்டறிந்து முன்கூட்டியே விருப்பங்களை வழங்குதல்.
சோதனை 9-3 ★: Qwen2-Audio உடன் ஸ்ட்ரீமிங் குரல் உணர்வை உருவகப்படுத்துதல்
சோதனை வடிவமைப்பிற்கு முதலில் தெளிவுபடுத்துதல் தேவை: Qwen2-Audio என்பது ஒரு ஸ்ட்ரீமிங் அல்லாத மாதிரியாகும், இது முழு பகுதிகளையும் உள்ளீடாக எடுத்துக்கொள்கிறது. இந்த சோதனையானது ஸ்ட்ரீமிங் செயலாக்கத்தை உருவகப்படுத்த துண்டுகளாக்கப்பட்ட உள்ளீட்டைப் பயன்படுத்துகிறது—தொடர்ச்சியான ஆடியோ ஸ்ட்ரீமை நிலையான நீளமுள்ள சிறிய துண்டுகளாக வெட்டி, ஒவ்வொரு துண்டும் திரட்டப்பட்ட ஆடியோ சூழலுடன் சேர்த்து மாதிரிக்கு அனுப்பப்படுகிறது. மாதிரியானது படிப்படியாக உரை மற்றும் ஒலி நிகழ்வு டோக்கன்களை (சிரிப்பு, இடைநிறுத்தங்கள் மற்றும் பிற வாய்மொழி அல்லாத சமிக்ஞைகள் போன்றவை) உருவாக்குகிறது, மேலும் ஒவ்வொரு துண்டையும் உள்ளீடு செய்வதிலிருந்து உரையை உருவாக்குவது வரையிலான தாமதத்தை அளவிடுகிறது. இங்கு ஒரு முக்கிய செலவு உள்ளது: Qwen2-Audio-வின் என்கோடர் அதிகரிக்கும் தன்மை கொண்டது அல்ல. ஒவ்வொரு முறை புதிய துண்டு செயலாக்கப்படும் போதும், முன்னர் திரட்டப்பட்ட அனைத்து ஆடியோவும் புதிதாக மறு-என்கோட் செய்யப்பட வேண்டும். எனவே, உரையாடல் நீளமாகவும், திரட்டப்பட்ட ஆடியோ அதிகமாகவும் இருப்பதால், ஒவ்வொரு துண்டுக்குமான என்கோடிங் தாமதம் அதிகரிக்கிறது—இதுவே "உருவகப்படுத்தப்பட்ட ஸ்ட்ரீமிங்" மற்றும் "உண்மையான ஸ்ட்ரீமிங்" (இது அதிகரிக்கும் அல்லது காரண காரிய என்கோடர்களைப் பயன்படுத்துகிறது, அவை புதிதாக வந்த சிறிய ஆடியோ பகுதியை மட்டுமே அதிகரிக்கும் முறையில் என்கோட் செய்கின்றன) ஆகியவற்றுக்கு இடையேயான அடிப்படை வேறுபாடு ஆகும். இந்த வடிவமைப்பு "முழுமையான சூழலுடன் கூடிய தொடர்ச்சியான உணர்வின்" துல்லிய நன்மைகளை நிரூபிக்க முடியும், ஆனால் தாமத எண்கள் துண்டு நுணுக்கம் மற்றும் அனுமான வேகத்தை மட்டுமே பிரதிபலிக்கின்றன, உண்மையான ஸ்ட்ரீமிங் வடிவமைக்கப்பட்ட மாதிரியின் (துண்டுகளாக்கப்பட்ட என்கோடிங் கொண்ட Qwen3-Omni போன்றவை) முதல்-பாக்கெட் தாமதத்தை அல்ல; ஆர்வமுள்ள வாசகர்கள் பிந்தையதைக் கொண்டு மாற்றி சோதனையை மீண்டும் செய்யலாம். ஒப்பீட்டு அடிப்படை வரி பாரம்பரிய VAD + Whisper ASR குழாய் ஆகும். மூன்று சூழ்நிலைகள் சோதிக்கப்படுகின்றன: சாதாரண உரையாடல், இடைநிறுத்தங்களுடன் கூடிய நீண்ட வாக்கியங்கள், மற்றும் பின்னணி இரைச்சலுடன் கூடிய உரையாடல்.
முடிவுகள்: துண்டுகளாக்கப்பட்ட உருவகப்படுத்துதல் திட்டத்தின் அதிகரிக்கும் அங்கீகார தாமதத்தை ஒன்று முதல் இருநூறு மில்லி விநாடிகள் வரை கட்டுப்படுத்த முடியும் (துண்டு நீளம் மற்றும் வன்பொருளைப் பொறுத்து), அதேசமயம் பாரம்பரிய திட்டமானது VAD முடிவை உறுதிப்படுத்த காத்திருப்பு (600ms) மற்றும் Whisper அனுமானம் (இந்த சோதனை உள்ளமைவின் கீழ் சுமார் 200–500ms) ஆகியவற்றை உள்ளடக்கிய மொத்தம் 800–1100ms தேவைப்படுகிறது. இடைநிறுத்தங்கள் உள்ள சூழ்நிலையில், VAD முதல் நீண்ட இடைநிறுத்தத்தை பேச்சின் முடிவு என்று தவறாக மதிப்பிட்டு, வாக்கியத்தை தனித்தனி அங்கீகாரத்திற்காக இரண்டு பகுதிகளாக வெட்டியது. "大概两点左右" ("சுமார் இரண்டு மணி") என்பது "大概零点左右" ("சுமார் நள்ளிரவு") என தவறாக அங்கீகரிக்கப்பட்டது—சுற்றியுள்ள சூழல் நீக்கப்பட்டதால், ஒத்த ஒலி கொண்ட 两 (liǎng, "இரண்டு") என்பது 零 (líng, "பூஜ்ஜியம்") என தவறாகக் கேட்கப்பட்டது. முழுமையான சூழலைப் பராமரிக்கும் துண்டுகளாக்கப்பட்ட திட்டம், முழு வாக்கியத்தையும் சரியாக அங்கீகரித்தது. பின்னணி இரைச்சல் சூழ்நிலையில், Qwen2-Audio
<|noise|>டோக்கன்களை வெளியிட்டு இரைச்சல் இருப்பதைக் குறிக்கிறது, அங்கீகாரத்தை குறுக்கிடாமல், அதேசமயம் பாரம்பரிய VAD இரைச்சலால் தவறாகத் தூண்டப்பட்டு, அங்கீகார செயல்முறை முன்கூட்டியே தொடங்கியது.
முன்னுதாரணம் 2: இறுதி-முதல்-இறுதி அனைத்து-முறை மாதிரிகள் (Omni)¶
முழு அடுக்கு குழாய் (cascaded pipeline) பற்றி மீண்டும் பார்க்கும்போது: உணர்வு முன்-முனை (perception front-end) ஸ்ட்ரீமிங் குரல் உணர்வால் மாற்றப்பட்டாலும், அது இறுதியில் "கேட்பது, சிந்திப்பது மற்றும் பேசுவது" ஆகியவற்றை மூன்று சுயாதீன மாதிரிகளுக்கு ஒதுக்குகிறது, அவை தனித்துவமான இடைமுகத்தால் இணைக்கப்பட்டுள்ளன. இந்த இடைமுகம் எவ்வளவு அகலமாக இருந்தாலும், அது சில சொற்பொருள் டோக்கன்கள் மற்றும் எப்போதாவது ஒலி குறிப்பான்கள் மட்டுமே - பேச்சாளரின் தற்போதைய உணர்ச்சி, குரல், உச்சரிப்பு மற்றும் பின்னணி சூழல் ஒலிகள் மற்றும் இசை ஆகியவை பெரும்பாலும் கைமாற்றத்தின் போது இழக்கப்படுகின்றன. மேலும், மூன்று பகுதிகளும் சுயாதீனமாக பயிற்சி மற்றும் மேம்படுத்தப்படுகின்றன, இதனால் அவை ஒத்துழைப்பது கடினம். இறுதி-முதல்-இறுதி அனைத்து-முறை மாதிரிகள் (Omni) வேறுபட்ட பாதையை எடுக்கின்றன - ஒற்றை மாதிரியைப் பயன்படுத்தி நேரடியாக ஆடியோவை "கேட்க", பதிலை "சிந்திக்க" மற்றும் அதை "பேச", மூன்று பகுதிகளையும் ஒன்றாக இணைக்கிறது (படம் 9-4). போதுமான பயிற்சி தரவுகளுடன், மாதிரியின் உள் மறைவெளி (latent space), உரையால் தெரிவிக்க முடியாத இந்த பாராலிங்குவிஸ்டிக் சமிக்ஞைகளை நேரடியாக உருவாக்க முனை வரை கொண்டு செல்ல முடியும்: தாமதம் குறைகிறது, உச்சரிப்பும் உணர்ச்சியும் பாதுகாக்கப்படுகின்றன. வர்த்தகம் என்னவென்றால்: அடுக்கு குழாய்கள் (cascaded pipelines) தெளிவான தொகுதிகளைக் கொண்டுள்ளன, ஒவ்வொரு பகுதியும் சுயாதீனமாக சரிசெய்யப்படலாம், மேலும் அவை நல்ல விளக்கத்தன்மையை (interpretability) வழங்குகின்றன; இறுதி-முதல்-இறுதி மாதிரிகள் (end-to-end models) குறைந்த தாமதம் மற்றும் உரை அல்லாத தகவல்களைத் தக்கவைக்க முடியும், ஆனால் அதிக பயிற்சி தரவு தேவை மற்றும் குறைந்த விளக்கத்தன்மை ஆகியவற்றின் விலையில்.
அடிக்கடி கவனிக்கப்படாத ஒரு பரிமாணமும் சேர்க்கப்பட வேண்டும்: இறுதி-முதல்-இறுதியின் நன்மை முக்கியமாக தாமதத்தில் (latency) உள்ளது; இது துல்லியத்தில் (accuracy) அவசியம் ஒரு நன்மையைக் கொண்டிருக்கவில்லை. ஒப்பிடத்தக்க ஒரு திட்டம் சுய-அடுக்கு (self-cascade) ஆகும் - இதில் ஒரே மாதிரி முதலில் ஆடியோவை கட்டமைக்கப்பட்ட உரையாக மாற்றி, பின்னர் அந்த உரையின் அடிப்படையில் பகுத்தறிவை மேற்கொள்கிறது. ஒரே முறையில் இறுதி-முதல்-இறுதியாக பதிலளிப்பதை விட, எது அதிக துல்லியத்தைக் கொண்டுள்ளது என்பது குறிப்பிட்ட பணியைப் பொறுத்தது. இந்த முறையை இவ்வாறு சுருக்கமாகக் கூறலாம்: பதில் முக்கியமாக சொற்பொருள் உள்ளடக்கத்தால் (அதாவது "என்ன சொல்லப்பட்டது") தீர்மானிக்கப்படும்போது மற்றும் இடைநிலை உரை பணி தொடர்பான தகவல்களை போதுமான அளவில் எடுத்துச் செல்ல முடியும்போது, சுய-அடுக்கு இறுதி-முதல்-இறுதிக்கு சமமான அல்லது அதைவிட சிறந்த துல்லியத்தை அடைகிறது, குறிப்பாக பலவீனமான உணர்வு திறன்களைக் கொண்ட மாதிரிகளுக்கு. மாறாக, பதில் உரையில் பிரதிநிதித்துவப்படுத்த கடினமான வாய்மொழி அல்லாத குறிப்புகளை (குரல், உணர்ச்சி, சூழல் ஒலிகள்) அதிகம் சார்ந்திருக்கும்போது, இறுதி-முதல்-இறுதி தெளிவான நன்மையைக் காட்டுகிறது. மிக முக்கியமாக, இரண்டின் ஒப்பீட்டு நன்மைகளை பணியின் தன்மையின் அடிப்படையில் முன்கூட்டியே தீர்மானிக்க முடியும், வெறுமனே "இறுதி-முதல்-இறுதி மிகவும் மேம்பட்டது" என்று காரணம் கூறாமல். இது ஒரு வடிவமைப்பு கொள்கைக்கு வழிவகுக்கிறது: செயல்திறனின் திறவுகோல் பெரும்பாலும் இடைநிலை பிரதிநிதித்துவத்தை ஒரு தடை (bottleneck) ஆக அறிமுகப்படுத்துவதில் இல்லை, மாறாக அந்த தடையால் எடுத்துச் செல்லப்படும் தகவலில் உள்ளது. இடைநிலை உரை ஒரு எளிய படியெடுப்பிலிருந்து பாராலிங்குவிஸ்டிக் குறிப்பான்கள் (உணர்ச்சி, பேச்சு வேகம், சூழல் ஒலிகள்) கொண்ட கட்டமைக்கப்பட்ட பிரதிநிதித்துவமாக மேம்படுத்தப்பட்டால், இறுதி-முதல்-இறுதியின் அசல் துல்லிய நன்மை பெரும்பாலும் குறைகிறது. இது "ஸ்ட்ரீமிங் குரல் உணர்வு" பிரிவில் முன்னர் கூறப்பட்ட "உணர்வு அடுக்கு வெற்று உரையை மட்டும் வெளியிடக்கூடாது"[^ch9-13] என்ற கூற்றுடன் ஒத்துப்போகிறது.
இருப்பினும், Omni எவ்வளவு சக்தி வாய்ந்ததாக இருந்தாலும், அது அடிப்படையில் மூன்று மாதிரிகளை ஒன்றாக இணைக்கிறதே தவிர, "மாறி மாறி பேசும் அனுமானத்தை நீக்கவில்லை" : இது இன்னும் VAD-ஐ நம்பி பேச்சு உரிமையைப் பிரிக்கிறது—பயனர் பேசுவதைக் கண்டறிந்ததும் நிறுத்துதல், மற்றும் பயனர் அமைதியானவுடன் பேசத் தொடங்குதல். இதனால், பழக்கமான பிரச்சனை மீண்டும் எழுகிறது: ஒரு பயனர் எண்களின் வரிசையைச் சொல்லி சிறிது நேரம் இடைவெளி விட்டால், Omni மறுபக்கம் முடித்துவிட்டதாக முடிவு செய்து பலமாக குறுக்கிடுகிறது. முன்பு குறிப்பிடப்பட்ட ஸ்ட்ரீமிங் குரல் உணர்வு, முறை மாற்றத்தை அமைதியின் கால அளவிலிருந்து சொற்பொருள் மட்டத்திற்கு மேம்படுத்தி, இத்தகைய தவறான மதிப்பீடுகளை கணிசமாகக் குறைக்கும், ஆனால் அது இறுதியில் "மாறி மாறி பேசும்" கட்டமைப்பிற்குள் ஒரு உள்ளூர் இணைப்புத் திருத்தமே, மாறி மாறி பேசுவதையே நீக்குவதில்லை. இந்த சிக்கலில் இருந்து அடிப்படையில் தப்பிக்க, "மாறி மாறி பேசும்" கட்டமைப்பிற்குள் இணைப்புத் திருத்தங்களைச் செய்ய முடியாது. அதற்கு பதிலாக, மாதிரி ஒரே நேரத்தில் கேட்டுப் பேச வேண்டும், எப்போது பேச வேண்டும் என்பதை சுயாதீனமாக முடிவு செய்ய வேண்டும், மேலும் "யாருடைய முறை" என்பதற்கான கடினமான மாற்றம் இருக்கக்கூடாது.
[^ch9-13]: கேஸ்கேட் மற்றும் எண்ட்-டு-எண்ட் ஆகியவற்றின் துல்லிய நன்மைகள் எப்போது தலைகீழாக மாறும், மற்றும் பணியின் தன்மையின் அடிப்படையில் (இடைநிலைப் பிரதிநிதித்துவம் பணி தொடர்பான தகவலை போதுமான அளவு எடுத்துச் செல்ல முடியுமா என்பதைப் பொறுத்து) திசையை எவ்வாறு கணிப்பது என்பதற்கான முழுமையான குறுக்கு-மாதிரி அளவீட்டிற்கு, Li, Bojie மற்றும் Noah Shi எழுதிய The Cascade Gap: When and Why Self-Cascades Help Multimodal Agents. 2026 (வெளியாகவுள்ளது) பார்க்கவும்.
OpenAI Realtime API மாதிரி மட்டத்தில் எண்ட்-டு-எண்டிற்கு நெருக்கமாக உள்ளது (மாதிரி பூர்வீகமாக ஆடியோவை செயலாக்குகிறது), ஆனால் தொடர்பு கட்டுப்பாட்டு மட்டத்தில் இன்னும் பாரம்பரிய VAD-ஐ நம்பியுள்ளது, இது முழு எண்ட்-டு-எண்டிற்கு மாறும் ஒரு இடைநிலை தீர்வாக அமைகிறது. இது ஆரம்பத்தில் (2024 முன்னோட்டம்) GPT-4o-வில் இயங்கியது, மேலும் 2025-ல் அதிகாரப்பூர்வ GA-க்குப் பிறகு, இது gpt-realtime என்ற பிரத்யேக குரல் மாதிரிக்கு மாறியது (இனி GPT-4o-வின் ஒரு முறை அல்ல, மாறாக நிகழ்நேர குரலுக்காக சிறப்பாக மேம்படுத்தப்பட்ட மாதிரி). API இயல்புநிலையாக சர்வர் பக்க VAD-ஐ இயக்குகிறது, பயனர் எப்போது பேசத் தொடங்குகிறார் மற்றும் நிறுத்துகிறார் என்பதை தானாகவே தீர்மானிக்கிறது. இது உரையாடலின் போது குறுக்கீட்டை ஆதரிக்கிறது—பயனர் பேசத் தொடங்குவதைக் கண்டறிந்து உடனடியாக தற்போதைய குரல் உருவாக்கத்தை நிறுத்துகிறது, நேருக்கு நேர் உரையாடலில் ஒருவர் குறுக்கிடும்போது மற்றவர் இயற்கையாக நிறுத்துவது போல. gpt-realtime ஒத்திசைவற்ற செயல்பாட்டு அழைப்புகளையும் அறிமுகப்படுத்துகிறது: மாதிரி கருவி முடிவுகளுக்காக காத்திருக்கும்போது பயனருடன் தொடர்ந்து பேச முடியும், கருவி தாமதத்தை உரையாடல் செயல்முறைக்குள் மறைக்கிறது. இந்த மேம்பாடுகள் அனுபவத்தை மேம்படுத்துகின்றன, ஆனால் அவை அடிப்படையில் VAD கட்டமைப்பிற்குள் உள்ள மேம்படுத்தல்களே. Gemini Live API இதேபோன்ற அணுகுமுறையைக் கொண்டுள்ளது, VAD உணர்திறன் உள்ளமைவை ஆதரிக்கிறது மற்றும் குறுக்கீட்டின் போது அனுப்பப்பட்ட தகவலைத் தக்கவைத்து உரையாடல் ஒத்திசைவை உறுதி செய்கிறது.
Qwen3-Omni ஒரு Thinker-Talker கட்டமைப்பைப் பின்பற்றுகிறது: சிந்தனை (புரிதல் மற்றும் பகுத்தறிதல்) மற்றும் வெளிப்பாடு (குரல் உருவாக்கம்) ஆகியவற்றை இரண்டு சிறப்பு தொகுதிகளாகப் பிரித்து, உரை, படங்கள், ஆடியோ மற்றும் வீடியோவிற்கான உணர்வு மற்றும் உருவாக்கத்தை ஒருங்கிணைக்கிறது.
அதிக திறனைப் பராமரிக்கும் அதே வேளையில் கணக்கீட்டுச் செலவைக் கட்டுப்படுத்த, Qwen3-Omni MoE (Mixture of Experts) கட்டமைப்பைப் பின்பற்றுகிறது—இதை "தேவைக்கேற்ப நிபுணர் குழுக்களை அழைப்பது" என்று நினைக்கலாம்: இது உள்நோக்கி பல சிறிய நிபுணர் நெட்வொர்க்குகளைக் கொண்டுள்ளது, மேலும் ஒவ்வொரு அனுமானத்திற்கும், தற்போதைய பணிக்கு மிகவும் பொருத்தமான சில மட்டுமே செயல்படுத்தப்படுகின்றன, மீதமுள்ளவை கணக்கீட்டில் பங்கேற்காது. எடுத்துக்காட்டாக, பேச்சைச் செயலாக்கும்போது, இது முதன்மையாக பேச்சு தொடர்பான நிபுணர்களைச் செயல்படுத்துகிறது; படங்களைச் செயலாக்கும்போது, இது முதன்மையாக பார்வை தொடர்பான நிபுணர்களைச் செயல்படுத்துகிறது. இது மாதிரியானது மிகப் பெரிய மொத்த அளவுரு எண்ணிக்கையைக் கொண்டிருக்க அனுமதிக்கிறது (அதிக திறனை உறுதி செய்கிறது), அதே நேரத்தில் ஒரு டோக்கனுக்கான உண்மையான கணக்கீட்டை மிகச் சிறியதாக வைத்திருக்கிறது, இதன் மூலம் அனுமான செயல்திறனை மேம்படுத்துகிறது மற்றும் அதிக சுமையின் கீழ் வரிசை தாமதத்தைக் குறைக்கிறது.
MoE ஆனது "ஒரு யூனிட் கம்ப்யூட்டில் எத்தனை கோரிக்கைகளை வழங்க முடியும்" என்பதன் செயல்திறன் சிக்கலைத் தீர்க்கிறது என்பதை வேறுபடுத்திப் பார்ப்பது முக்கியம். இது "முதல் ஆடியோ பாக்கெட்டை எவ்வளவு சீக்கிரம் அனுப்ப முடியும்" என்பதை நேரடியாகத் தீர்மானிக்காது—முதல்-பாக்கெட் தாமதம் உருவாக்க கட்டமைப்பைப் பொறுத்தது. Qwen3-Omni இன் குறைந்த முதல்-பாக்கெட் தாமதம் அதன் Talker தொகுதியின் வடிவமைப்பிலிருந்து வருகிறது: இது பல-குறியீட்டு புத்தக தன்னியக்க பின்னடைவு முறையில் படிப்படியாக ஆடியோ டோக்கன்களை உருவாக்குகிறது, மேலும் இந்த டோக்கன்களை படிப்படியாக அலைவடிவங்களாக டிகோட் செய்ய ஒரு காரண கோடெக்கைப் பயன்படுத்துகிறது. எனவே, சிந்தனை தொகுதி உரையை உருவாக்கியவுடன், முழு பதில் உருவாக்கப்படும் வரை காத்திருக்காமல், Talker ஸ்ட்ரீமிங் பேச்சு தொகுப்பைத் தொடங்க முடியும். அதிகாரப்பூர்வ அறிக்கையின்படி, அதன் குளிர்-தொடக்க கோட்பாட்டு முதல்-பாக்கெட் தாமதம் தோராயமாக 234ms ஆகும், இது 19 மொழிகளில் புரிதல் மற்றும் 10 மொழிகளில் உருவாக்கத்தை ஆதரிக்கிறது, மேலும் 36 ஆடியோ-வீடியோ அளவுகோல்களில் 22 இல் முன்னணியில் உள்ளது.
Step-Audio 2 வேறுபட்ட பாதையை எடுக்கிறது: இது நேரடியாக மூல ஆடியோ உள்ளீட்டைச் செயலாக்கி, உரை மற்றும் ஆடியோ இரண்டையும் வெளியிடுகிறது, உண்மையான இறுதி-முதல்-இறுதி குரல் உரையாடலை அடைகிறது. இது சொல்லப்படுவதை (சொற்பொருள் தகவல்) மட்டுமல்லாமல், அது எவ்வாறு சொல்லப்படுகிறது என்பதையும்—பாராலிங்குவிஸ்டிக் தகவல், பேச்சாளரின் உணர்ச்சி மகிழ்ச்சியா அல்லது கோபமா, பேச்சு வேகம் வேகமாகவா அல்லது தயக்கமாகவா உள்ளதா, தொனி ஏறுகிறதா அல்லது இறங்குகிறதா—அத்துடன் பின்னணி சுற்றுச்சூழல் ஒலிகள் மற்றும் இசையையும் உணர முடியும். இது சிந்தனை மற்றும் வலுவூட்டல் கற்றல் மூலம் வெளிப்படையான பதில்களை உருவாக்குகிறது, மேலும் RAG பொறிமுறை மற்றும் வெளிப்புற கருவிகளையும் (வலை தேடல், ஆடியோ தேடல்) ஒருங்கிணைக்கிறது. Step-Audio 2 கட்டுரையின் படி, பாராலிங்குவிஸ்டிக் புரிதலுக்கான அவர்கள் முன்மொழிந்த StepEval-Audio-Paralinguistic அளவுகோலில், Step-Audio 2 83.09% துல்லியத்தை அடைகிறது, இது சமகால திறந்த மூல அனைத்து-முறை மாதிரியான Qwen2.5-Omni (44.18%) ஐ விட முன்னணியில் உள்ளது, மேலும் GPT-4o Audio (43.45%) மற்றும் Kimi-Audio (49.64%) ஆகியவற்றையும் மிஞ்சுகிறது.
Step-Audio R1 என்பது Step-Audio தொடரின் தொடர்ச்சியான பணியாகும். Step-Audio 2-ன் இறுதி-முதல்-இறுதி குரல் உரையாடல் கட்டமைப்பின் மீது கட்டமைக்கப்பட்டு, இது சிந்தனை திறன்களை நேரடியாக ஆடியோ மாதிரியில் உள்வாங்குகிறது. இவை இரண்டும் ஒரே தொழில்நுட்ப பாதையில் முற்போக்கான பரிணாம வளர்ச்சியை பிரதிநிதித்துவப்படுத்துகின்றன.
முன்னுதாரணம் 3: முழு-இருவழி / ஊடாடும் மாதிரிகள்¶
முன்னுதாரணம் 2 மூன்று மாதிரிகளை ஒன்றாக இணைத்தது, ஆனால் "மாறி மாறி பேசுதல்" என்ற அனுமானத்தை இன்னும் பிடித்துக் கொண்டிருந்தது—பயனர் பேசுகிறார் அல்லது மாதிரி பேசுகிறது, மாற்றும் புள்ளி VAD அல்லது சொற்பொருளால் யூகிக்கப்படுகிறது. இருப்பினும், சில சூழ்நிலைகள் "ஒரு நேரத்தில் ஒரு வாக்கியம்" என்ற மாறி மாறி பேசும் முறையை ஏற்றுக்கொள்ள முடியாது. ஒரே நேர மொழிபெயர்ப்பு இதற்கு ஒரு சிறந்த எடுத்துக்காட்டு: மொழிபெயர்ப்பாளர் பேச்சாளர் ஒரு முழு வாக்கியத்தை முடிக்கும் வரை காத்திருக்க மாட்டார்; மாறாக, அவர்கள் ஒரே நேரத்தில் கேட்டு மனதில் ஒழுங்குபடுத்தி, ஒரு பொருள் அலகு தோராயமாக முடிந்தவுடன் மொழிபெயர்க்கிறார்கள், கேட்பதும் மொழிபெயர்ப்பதும் எப்போதும் ஒன்றுடன் ஒன்று இணைந்திருக்கும். இசையுடன் டிரம் பீட்களை அடிக்கும் ரிதம் விளையாட்டுகள் இன்னும் தீவிரமானவை—செவிப்புலன் தடையில்லாத இசை ஸ்ட்ரீமை தொடர்ந்து கண்காணிக்க வேண்டும், கைகள் உடனடியாக பீட்டைத் தாக்க வேண்டும், அதே நேரத்தில் அடுத்த பீட்டை எதிர்பார்க்க வேண்டும். இங்கே, "முறைகள்" என்ற கருத்து கூட இல்லை; உள்ளீடு முடிவில்லாத தொடர்ச்சியான ஸ்ட்ரீம் ஆகும். இத்தகைய பணிகள் மாறி மாறி பேசும் மாதிரிக்கு ஒரு அடிப்படை சவாலை முன்வைக்கின்றன: அவை கேட்பது, சிந்திப்பது மற்றும் செயல்படுவது ஆகியவை ஒரே நேரத்தில் நிகழ வேண்டும், அதேசமயம் மாறி மாறி பேசும் மாதிரியின் அடிப்படை இந்த மூன்றையும் தனித்தனி நேர இடைவெளிகளில் வைப்பதாகும். முழு-இருவழி மாதிரி "VAD-ஐ நீக்குதல்" என்ற தர்க்கரீதியான முடிவை எடுக்கிறது—இது "மாறி மாறி பேசுதல்" என்ற அனுமானத்தை வெறுமனே நிராகரித்து, மாதிரியை ஒரே நேரத்தில் மற்றும் தொடர்ச்சியாக கேட்கவும் பேசவும் அனுமதிக்கிறது.
இங்கு முன்னோடி ஆராய்ச்சிப் பணி Kyutai-ன் Moshi (2024) ஆகும். இது இரண்டு ஆடியோ ஸ்ட்ரீம்களை இணையாக மாதிரியாக்குகிறது (பயனரின் குரல் மற்றும் மாதிரியின் சொந்த குரல்), உருவாக்கப்பட்ட பேச்சின் மொழியியல் தரத்தை மேம்படுத்த "உள் மோனோலாக்" உரை ஸ்ட்ரீம் மூலம் கூடுதலாக வழங்கப்படுகிறது. இது எப்போதும் கேட்டுக் கொண்டிருப்பதால், ஒன்றுடன் ஒன்று பேசுதல் மற்றும் குறுக்கீடுகள் இயற்கையான நடத்தைகளாக மாறுகின்றன, அவற்றுக்கு தனி குறுக்கீடு கண்டறிதல் தர்க்கம் தேவையில்லை. இறுதி-முதல்-இறுதி தாமதம் தோராயமாக 200ms ஆகும், இது மனித உரையாடலின் இயற்கையான தாளத்தை நெருங்குகிறது.
2026-ல், மிரா முராட்டியால் நிறுவப்பட்ட திங்கிங் மெஷின்ஸ் லேப், இன்டராக்ஷன் மாதிரி (Interaction Model)[^ch9-14] என அழைக்கப்படும் ஒரு புதிய வகையை முன்னோட்டமிட்டது, மேலும் முழு-டூப்ளெக்ஸுக்குப் பின்னால் உள்ள கூற்றைத் தெளிவுபடுத்தியது: ஊடாடுதல் என்பது VAD போன்ற வெளிப்புற கட்டுப்பாட்டு அமைப்பாக மாதிரியைச் சுற்றி பொருந்தக்கூடியதாக இருக்கக்கூடாது, மாறாக மாதிரியிலேயே கட்டமைக்கப்பட வேண்டும். அவர்களின் வார்த்தைகளில், "ஊடாடுதல் நுண்ணறிவுடன் அளவிடப்படுவதற்கு, அது மாதிரியின் ஒரு பகுதியாக மாற வேண்டும்." கட்டமைப்பு ரீதியாக, இது மைக்ரோ-டர்ன்களாக (micro-turns) மொழிபெயர்க்கப்படுகிறது: முழு முறையும் முடிவடையும் வரை காத்திருப்பதற்குப் பதிலாக, மாதிரி தொடர்ந்து "200ms-ல் படித்து, 200ms-ல் உருவாக்குகிறது", இது ஆடியோ, வீடியோ மற்றும் உரை ஸ்ட்ரீம்களை ஒன்றோடொன்று இணைத்து ஒன்றாக முன்னேற அனுமதிக்கிறது. இந்த நுணுக்கம் ஒரு வேண்டுமென்றே செய்யப்பட்ட சமரசமாகும்—அமைதி, ஒன்றுடன் ஒன்று சேர்தல் மற்றும் குறுக்கீடு ஆகியவை மாதிரியின் சூழலில் தொடர்ச்சியான ஸ்ட்ரீம்களாகப் பாதுகாக்கப்படும் அளவுக்கு நுணுக்கமானது, எந்தவொரு செயற்கையான முறை எல்லைகளும் இல்லாமல்; இருப்பினும் பல முறைகளை ஒரே நேரத்தில் துண்டுகளாகச் செயலாக்கும் அளவுக்கு கரடுமுரடானது, தாமதத்தை உணர்வு ரீதியான நிகழ்நேர வரம்பிற்குள் வைத்திருக்கும். ஊடாடுதல் மாதிரியில் உள்வாங்கப்படுவதால், முன்பு சிறப்பு கட்டுப்பாட்டு அமைப்புகள் தேவைப்பட்ட "பேசிக்கொண்டே கேட்பது" மற்றும் "பார்த்துக்கொண்டே குறுக்கிடுவது" போன்ற நடத்தைகள் இப்போது மாதிரியின் உள்ளார்ந்த திறன்களாகும், மேலும் மாதிரி மேம்படும்போது அவையும் மேம்படும்: முதல் மாதிரியான TML-Interaction-Small, மூன்று ஸ்ட்ரீம்களையும் ஆரம்பத்திலிருந்து ஒன்றாகப் பயிற்றுவிக்கிறது. ஒரு பயனர் பிழையான குறியீட்டை எழுதுவதையோ அல்லது யாராவது கேமரா எல்லைக்குள் நுழைவதையோ அது கண்டறிந்தவுடன், அது முன்கூட்டியே பேசத் தொடங்கும்.
"மெதுவான சிந்தனை"க்கான அதன் அணுகுமுறையும் பிரதிநிதித்துவமானது. இன்டராக்ஷன் மாதிரி தானே உரையாடலை நிகழ்நிலையில் வைத்திருப்பதற்கு மட்டுமே பொறுப்பாகும். ஆழமான பகுத்தறிவு அல்லது கருவி அழைப்புகள் தேவைப்படும் ஒரு சிக்கலை அது சந்திக்கும் போது, அது பின்னணியில் உள்ள ஒரு வலுவான பகுத்தறிவு மாதிரிக்கு ஒப்படைக்கிறது—அது ஒப்படைப்பது ஒரு தனிமைப்படுத்தப்பட்ட வினவல் அல்ல, மாறாக முழு உரையாடல் சூழலையும் (entire conversation context) ஒப்படைக்கிறது. பின்னணி மாதிரி பகுத்தறியும்போது, முடிவுகள் படிப்படியாக மீண்டும் ஸ்ட்ரீம் செய்யப்படுகின்றன. பின்னர் இன்டராக்ஷன் மாதிரி, பயனருக்கு இடையூறு செய்யாத ஒரு தருணத்தைத் தேர்ந்தெடுத்து, முடிவை இயற்கையாக உரையாடலில் இணைக்கிறது, இவை அனைத்தும் நடக்கும்போதே தொடர்ந்து பதிலளித்து, பின்தொடர் கேள்விகளுக்கு விடையளித்து, உரையாடலைத் தொடர்கிறது. இந்த வழியில், இது "ஒரு பகுத்தறிவு மாதிரியின் திட்டமிடல், கருவி மற்றும் ஏஜெண்ட் திறன்களை" "சிந்திக்காத மாதிரியின் தாமதத்துடன்" வழங்குகிறது. அதிகாரப்பூர்வ அறிக்கையின்படி, TML-Interaction-Small (276B அளவுரு MoE, 12B செயல்படுத்தப்பட்டது) தோராயமாக 0.40 வினாடிகள் வரை குறைந்த முறை-மாற்ற தாமதத்தை (GPT-realtime-2.0 சுமார் 1.18 வினாடிகள்) அடைகிறது, மேலும் காட்சி முன்னெச்சரிக்கைக்கான அளவுகோல்களில் கிட்டத்தட்ட பூஜ்ஜிய மதிப்பெண்களைப் பெறும் போட்டியாளர்களை கணிசமாக விஞ்சுகிறது; இந்த எழுத்தின் நிலவரப்படி, இது இன்னும் ஆராய்ச்சி முன்னோட்ட நிலையில் உள்ளது.
[^ch9-14]: திங்கிங் மெஷின்ஸ் லேப், "இன்டராக்ஷன் மாடல்ஸ்: எ ஸ்கேலபிள் அப்ரோச் டு ஹ்யூமன்-ஏஐ கோலபரேஷன்," 2026-05. https://thinkingmachines.ai/blog/interaction-models/
அதே ஆண்டில், OpenAI இன் GPT-Live ஆனது முழு-இருவழி (full-duplex) தொழில்நுட்பத்தை உற்பத்தி அளவில் கொண்டு வந்து, ChatGPT க்கான புதிய இயல்புநிலை குரல் மாதிரியாக உலகளவில் வெளியிடப்பட்டது. இது உரையாடலை தனித்தனி செய்தி முறைகளின் தொடராக கருதாமல், தொடர்ச்சியாக உள்ளீட்டை செயலாக்கும்போதே தொடர்ச்சியாக வெளியீட்டை உருவாக்குகிறது. எனவே, இது ஒரு நொடிக்கு பல தொடர்பு முடிவுகளை எடுக்க முடியும்: பேசத் தொடங்குவதா, தொடர்ந்து கேட்பதா, இடைநிறுத்துவதா, குறுக்கிடுவதா, அல்லது ஒரு கருவியை அழைப்பதா என்பதை. இதன் விளைவாக, பயனர் யோசிக்கும்போது குறுக்கிடாமல் அமைதியாக காத்திருந்து, "ம்ம்-ஹ்ம்" மற்றும் "சரி" போன்ற ஒப்புதல் சொற்களைப் பயன்படுத்தி கேட்பதைக் காட்டுகிறது, மேலும் ஒரே நேரத்தில் கேட்கவும் பேசவும் தேவைப்படும் நிகழ்நேர மொழிபெயர்ப்பு போன்ற பணிகளையும் செய்ய வல்லது.
GPT-Live, வேகமான மற்றும் மெதுவான செயல்முறைகளைப் பிரிக்கும் அதே பாதையைப் பின்பற்றுகிறது—"நிகழ்நேர தொடர்பு" மற்றும் "ஆழமான சிந்தனை" ஆகியவற்றைப் பிரித்தல்: தேடல், பகுத்தறிவு அல்லது மிகவும் சிக்கலான ஏஜெண்ட் செயல்பாடுகள் தேவைப்படும் பணியை சந்திக்கும்போது, ஊடாடும் GPT-Live அந்த பணியை பின்னணியில் உள்ள ஒரு முன்னணி மாதிரியிடம் (வெளியீட்டின் போது, GPT-5.5) ஒப்படைக்கிறது, அதே நேரத்தில் உரையாடலின் ஓட்டத்தைத் தானே தொடர்ந்து பராமரிக்கிறது. பின்னணி மாதிரி முடிவை உருவாக்கியதும், அதை உரையாடலுக்குள் மீண்டும் கொண்டு வருகிறது. GPT-Live-1 மற்றும் மினி பதிப்பு பின்னணியில் GPT-5.5 Instant ஐப் பயன்படுத்துகின்றன, அதே நேரத்தில் மீடியம் மற்றும் ஹை அடுக்குகள் சிந்தனை-இயக்கப்பட்ட GPT-5.5 ஐ அழைக்கின்றன, இது பயனர்கள் தேவைக்கேற்ப "வேகமான" மற்றும் "ஆழமான" இடையே தேர்வு செய்ய அனுமதிக்கிறது. இந்த "வேக-மெதுவான பணிப்பிரிவு" தான் அடுத்த பகுதியான "சிந்தனை கட்டமைப்புகளில் வர்த்தக-மாற்றங்கள்" இல் விரிவாக விளக்கப்படும் தலைப்பு.
இந்த அத்தியாயத்தின் "VAD ஐ மாற்றுதல்" கதை நூலை மதிப்பாய்வு செய்தல்: VAD அமைதி வரம்புகளின் அடிப்படையில் முறை-மாற்றும் புள்ளியை யூகிக்கிறது; ஸ்ட்ரீமிங் உணர்தல் (முன்னர் "ஸ்ட்ரீமிங் பேச்சு உணர்தல்" பகுதியைப் பார்க்கவும், முன்னுதாரணம் 1) மாற்றும் தீர்ப்பை சொற்பொருள் மட்டத்திற்கு மேம்படுத்துகிறது; மற்றும் முழு-இருவழி மாதிரி "மாற்றம்" என்ற கருத்தையே முற்றிலுமாக கலைக்கிறது—அது எப்போதும் கேட்டுக்கொண்டே இருக்கிறது, எனவே "குறுக்கீடு" என்பது சிறப்பு கவனிப்பு தேவைப்படும் ஒரு நிகழ்வாக இல்லாமல் போகிறது, மேலும் பார்க்-இன் செயலாக்க சங்கிலி கட்டமைப்பு ரீதியாக பெரும்பாலும் நீக்கப்படுகிறது. இது எழுதப்பட்ட நேரத்தில் "VAD ஐ மாற்றுதல்" கதை நூலின் இறுதிப் புள்ளியாகும்.
சிந்தனை கட்டமைப்புகளில் வர்த்தக-மாற்றங்கள்: பிரிப்பிலிருந்து ஒருங்கிணைப்பு வரை¶
தீர்க்க வேண்டிய உண்மையான பிரச்சனை நிகழ்நேர பதில் மற்றும் ஆழமான சிந்தனைக்கு இடையிலான முரண்பாடு ஆகும்: பயனர்கள் மில்லி-செகண்ட் அளவிலான பதில்களை எதிர்பார்க்கிறார்கள், அதே நேரத்தில் சிக்கலான பிரச்சனைகளுக்கு விநாடிகள் கணக்கில் சிந்திக்கும் நேரம் தேவைப்படுகிறது. குறைந்த தாமதத்தை பராமரிக்கும்போது மாதிரி எவ்வாறு போதுமான ஆழமாக சிந்திக்க முடியும்? இந்த முரண்பாடு இறுதி-முதல்-இறுதி கட்டமைப்புகளுக்கு மட்டும் உரியதல்ல; அடுக்கப்பட்ட குழாய்களும் (cascaded pipelines) இதை எதிர்கொள்கின்றன.
கீழே உள்ள மூன்று தீர்வுகள் ஒரு நேர்கோட்டு தொழில்நுட்ப மறு செய்கை அல்ல—அவை வெவ்வேறு கட்டுப்பாடுகளுக்கான வடிவமைப்பு வர்த்தக-பரிமாற்றங்கள் ஆகும், அவை நடைமுறையில் இணைந்து செயல்படுகின்றன. தேர்வு, பயன்பாட்டின் தாமதம் மற்றும் சிந்தனையின் ஆழத்திற்கான தேவைகளைப் பொறுத்தது. முதலில் இந்த மூன்றிற்கும் இடையேயான வேறுபாட்டை தெளிவுபடுத்துவது அவசியம்: தீர்வுகள் 1 மற்றும் 2 அடிப்படையில் இரண்டு சுயாதீன மாதிரிகள் ஒரே நேரத்தில் இயங்கும் "வேக-மெதுவான பணிப் பிரிவு" ஆகும். அவை இறுதி-முதல்-இறுதி சார்ந்தவை அல்ல, மேலும் ஒரு அடுக்கு குழாய்வழியின் மேல் கூட பயன்படுத்தப்படலாம். தீர்வு 3 மட்டுமே உண்மையில் சிந்தனையை இறுதி-முதல்-இறுதி மாதிரியில் உள்வாங்குகிறது.
2026 ஆம் ஆண்டளவில், "வேக-மெதுவான பிரிப்பு" பாதை, முன்னணி குரல் தயாரிப்புகளுக்கான முக்கிய தேர்வாக மாறியுள்ளது மற்றும் ஒரு குறிப்பிட்ட பெயரைப் பெற்றுள்ளது என்பது குறிப்பிடத்தக்கது. Thinking Machines Lab இதை "இன்டராக்ஷன் மாதிரிகள்" என்று அழைக்கிறது—ஒரு நிகழ்நேர தொடர்பு மாதிரி ஒரு ஒத்திசைவற்ற பின்னணி பகுத்தறிவு மாதிரியுடன் இணைக்கப்பட்டுள்ளது; xAI இன் Grok Voice "Think Fast," Pine AI இன் குரல் ஏஜெண்ட், மற்றும் முந்தைய பிரிவின் GPT-Live "delegation" அனைத்தும் "முன்புறத்தில் உரையாடலைப் பராமரிக்க வேகமாக, பின்புறத்தில் ஆழமான பகுத்தறிவுக்கு மெதுவாக" என்ற அதே பாதையைப் பின்பற்றுகின்றன. "ஒரு சர்வ வல்லமை கொண்ட ஒற்றை மாதிரியைப் பயிற்றுவிப்பதை" விட பிரிப்பதைத் தேர்ந்தெடுப்பதற்கு ஒரு நடைமுறை காரணம் உள்ளது: முன்னணி பகுத்தறிவு மாதிரிகள் சில மாதங்களுக்கு ஒருமுறை புதிய பதிப்புகளாக மேம்படுகின்றன, அதே நேரத்தில் நிகழ்நேர தொடர்பு திறன்களுக்கு சிறப்புத் தரவு மற்றும் பயிற்சி நோக்கங்கள் தேவைப்படுகின்றன. இரண்டையும் ஒரே மாதிரியில் திணிப்பது என்பது நகரும் இலக்கைத் துரத்துவதற்கும், மிகவும் மதிப்புமிக்க பகுத்தறிவுத் திறனை நீர்த்துப்போகச் செய்வதற்கும் சமம்[^ch9-8]. மாறாக, வலுவான பகுத்தறிவு மாதிரியை பின்னணியில் அப்படியே வைத்து, முன்புறத்திற்கு ஒரு இலகுரக தொடர்பு மாதிரியை மட்டும் பயிற்றுவிப்பதன் மூலம், எப்போதும் தற்போதைய வலுவான "மூளையை" பயன்படுத்த முடியும்—இதனால்தான் GPT-Live "சமீபத்திய முன்னணி மாதிரிகளுக்கு நிலையான மாற்றத்தை" வலியுறுத்துகிறது. கீழே, மூன்று தீர்வுகளையும் "ஒருங்கிணைப்பு பொறிமுறை பலவீனத்திலிருந்து வலுவானது வரை" என்ற வரிசையில் ஆராய்வோம்.
தீர்வு 1: நிரப்பிகளுக்கு வேகமான சிந்தனை, பதில்களுக்கு மெதுவான சிந்தனை¶
வேகமான மற்றும் மெதுவான சிந்தனை இணையாக செயல்படுகிறது (படம் 9-5): வேகமான சிந்தனை 500ms க்குள் ஒரு சிறிய நிரப்பு பதிலை வழங்குகிறது (ஒரு மனிதன் முதலில் "யோசிக்கிறேன்" என்று சொல்வது போல), அதே நேரத்தில் மெதுவான சிந்தனை பின்னணியில் 5-10 வினாடிகள் ஆழமான பகுத்தறிவுக்காக எடுத்துக்கொண்டு பின்னர் ஒரு முழுமையான பதிலை வழங்குகிறது. மெதுவான சிந்தனை பயன்படுத்தும் தொழில்நுட்பம் "டெஸ்ட்-டைம் ஸ்கேலிங்" என்று அழைக்கப்படுகிறது—எளிமையான சொற்களில், ஒரு கேள்விக்கு பதிலளிக்கும் போது மாதிரியை "இன்னும் கொஞ்சம் நேரம் யோசிக்க வைப்பது" என்று பொருள்: ஒரு படியில் பதில் சொல்வதற்கு பதிலாக, அது முதலில் கருத்துக்களை வரைவது, படிப்படியாக வழித்தோன்றல் செய்வது, மற்றும் முடிவுகளை சரிபார்ப்பது, உயர்தர பதில்களுக்கு ஈடாக அதிக கணக்கீட்டு படிகளைப் பயன்படுத்துகிறது.
சிக்கல் 1: எளிய கேள்விகளை அதிகமாக சிந்தித்தல். பயனர் "இன்று என்ன நாள்?" என்று கேட்கிறார். வேக சிந்தனை 500ms-க்குள் "புதன்கிழமை" என்று சரியாக பதிலளிக்கிறது, ஆனால் மெதுவான சிந்தனை இன்னும் முழு 10 வினாடிகளும் சிந்தித்து பின்னர் "புதன்கிழமை" என்று மீண்டும் சொல்கிறது. இது கணக்கீட்டு வளங்களை வீணாக்குவது மட்டுமல்லாமல், மிக முக்கியமாக, உரையாடலின் தாளத்தை சீர்குலைக்கிறது—பயனர் ஏற்கனவே பதிலைப் பெற்றுவிட்டு அடுத்த கட்டத்திற்குச் செல்லத் தயாராக இருக்கிறார், ஆனால் மீண்டும் ஒரு பதில் வந்து குறுக்கிடுகிறது. சிக்கல் 2: வேக மற்றும் மெதுவான சிந்தனைக்கு இடையே முரண்பாடு. இரண்டும் இணையாக சுயாதீனமாக இயங்குகின்றன. அவை ஒரே சூழலைப் பார்த்தாலும், அவற்றின் பகுத்தறிவு பாதைகள் முற்றிலும் வேறுபட்டதாக இருக்கலாம்—வேக சிந்தனை ஒரு அனுமானத்தின் அடிப்படையில் ஆரம்ப பதிலை அளிக்கிறது, அதே நேரத்தில் மெதுவான சிந்தனை அந்த அனுமானம் தவறானது எனக் கண்டறிந்து எதிர் முடிவுக்கு வருகிறது. பயனர் சில வினாடிகளுக்குள் முரண்பட்ட பதில்களைக் கேட்கிறார், உடனடியாக நம்பிக்கையை இழக்கிறார். இதன் மூல காரணம், தீர்வு 1 உரையாடலை ஒரு ஒருங்கிணைந்த அறிவாற்றல் செயல்பாடாக அல்லாமல் இரண்டு சுயாதீன சிந்தனை செயல்முறைகளாகப் பிரிப்பதும், வேக மற்றும் மெதுவான சிந்தனைக்கு இடையே ஒருங்கிணைப்பு வழிமுறை இல்லாததுமே ஆகும்.
<user>இந்த திட்டம் எனக்கு ஏற்றதா?</user>
<!-- 0.5 வினாடிகளுக்குப் பிறகு வேக சிந்தனை -->
<assistant (fast thinking)>இந்த திட்டம் மிகவும் மலிவானது, இதை வாங்க பரிந்துரைக்கிறேன்.</assistant>
<user>சரி, அப்படியானால் நான்...</user>
<!-- 8 வினாடிகளுக்குப் பிறகு மெதுவான சிந்தனை முடிகிறது -->
<assistant (slow thinking)>காத்திருங்கள், இந்த திட்டத்தில் உங்களுக்குத் தேவையான சர்வதேச ரோமிங் அம்சம் இல்லை என்பதைக் கண்டேன், எனவே இது பொருந்தாது.</assistant>
<user>(கோபமாக) அப்படியானால் வாங்கலாமா வேண்டாமா?!</user>
தீர்வு 2: தொடர்புக்கு வேக சிந்தனை, ஆலோசனைக்கு மெதுவான சிந்தனை¶
தீர்வு 2, மெதுவான சிந்தனை வேக சிந்தனையின் வெளியீட்டைப் பார்க்க அனுமதிக்கிறது. இது ஏஜெண்ட் நிலைப் பட்டை (அத்தியாயம் 2 இல் அறிமுகப்படுத்தப்பட்ட மாறும் மெட்டா-தகவல் செலுத்துதல் பொறிமுறை) மூலம் வேக சிந்தனைக்கு பரிந்துரைகளை வழங்குகிறது, நேரடியாக பயனரிடம் பேசாமல். தீர்வு 1-ஐ ஒப்பிடும்போது, இது இரண்டு வழிகளில் மேம்படுகிறது: மெதுவான சிந்தனை பின்னணியில் ஒத்திசைவற்ற முறையில் இயங்குகிறது, பேச்சு இடைவெளிகளில் தொடர்ந்து சிந்திக்கிறது; மேலும், இது வேக சிந்தனையின் வெளியீட்டைப் பார்க்க முடிவதால், நேரடி மோதலைத் தவிர்த்து, திரைக்குப் பின்னால் ஒரு "ஆலோசகராக" செயல்படுகிறது. முன்னர் குறிப்பிடப்பட்ட GPT-Live பிரதிநிதித்துவம் மற்றும் Pine AI குரல் ஏஜெண்ட் ஆகியவை தீர்வு 2-ன் உற்பத்தி எடுத்துக்காட்டுகளாகும்—பின்னணி பகுத்தறிவு மாதிரியானது அதன் முடிவுகளை ஒரு சுருக்கமான உரை சேனல் மூலம் முன்புற தொடர்பு மாதிரிக்கு அனுப்புகிறது, மேலும் முன்புற மாதிரியானது எப்போது, எப்படி அதை பயனருக்கு வடிவமைத்துச் சொல்வது என்பதை முடிவு செய்கிறது.
இருப்பினும், இந்த தீர்வும் அடிப்படை வரம்புகளைக் கொண்டுள்ளது. வேகமான சிந்தனை வழிமுறைகளைப் பின்பற்றாமல் போகலாம்—இரண்டு சுயாதீன சிந்தனை நிகழ்வுகளுக்கு இடையேயான தொடர்பு மறைமுகமாகவும் தெளிவற்றதாகவும் உள்ளது. வேகமான சிந்தனை, Agent Status Bar-ஐ தவறாகப் புரிந்துகொள்ளலாம், எடுத்துக்காட்டாக, "விலை மீண்டும் உறுதிப்படுத்தப்பட வேண்டும்" என்பதை "விலை கணக்கீடு தவறானது மற்றும் மீண்டும் கணக்கிடப்பட வேண்டும்" என்பதற்குப் பதிலாக "இந்த விலையை பயனர் ஏற்க முடியுமா என்று கேளுங்கள்" என்று புரிந்துகொள்ளலாம். இடைநிலை சிந்தனை முடிவுகளை அணுக இயலாமை—மெதுவான சிந்தனையின் 10 வினாடி பகுத்தறிவின் போது, ஏராளமான மதிப்புமிக்க இடைநிலை முடிவுகள் உருவாக்கப்படுகின்றன, ஆனால் வேகமான சிந்தனை அவற்றைப் பார்க்கவே முடியாது, இறுதி Agent Status Bar-க்காக மட்டுமே காத்திருக்கிறது. மெதுவான சிந்தனை முடிவதற்கு முன்பு பயனர் வேறு ஒரு கேள்வியைக் கேட்டாலோ அல்லது குறுக்கிட்டாலோ, வேகமான சிந்தனை அதன் சொந்த வரையறுக்கப்பட்ட புரிதலைக் கொண்டு மட்டுமே பதிலளிக்க முடியும். இது இரண்டு நபர்கள் ஒரு சிக்கலைத் தீர்க்க ஒத்துழைப்பது போன்றது, ஆனால் சீட்டுகள் அனுப்பியே தொடர்புகொள்வது, ஒருவர் மற்றவரின் கணக்குத் தாளை (scratch paper) ஒருபோதும் பார்க்காமல் இருப்பது போன்றது.
தீர்வு 2 ஒரு அடிப்படை கோட்பாட்டு சிக்கலையும் எதிர்கொள்கிறது: "பேசும்போது சிந்திப்பதை" இது அடைய முடியாது. மனிதர்கள் ஒரு சிக்கலான சிக்கலை எதிர்கொள்ளும்போது, முதலில் முழுமையான பதிலை மனதில் உருவாக்கி, பின்னர் அதை ஒரே முறையில் சொல்ல மாட்டார்கள்; மாறாக, அவர்கள் பகுதிகளாக சிந்தித்துப் பேசுகிறார்கள்—"இது ஒரு சுவாரஸ்யமான கேள்வி... (சிந்திக்க இடைநிறுத்தம்) முதலில், நாம் கருத்தில் கொள்ள வேண்டும்... (தொடர்ந்து சிந்தித்தல்) இரண்டாவதாக..." தீர்வு 2-ல், வேகமான சிந்தனை மெதுவான சிந்தனை முடிவுகளை உருவாக்கும் வரை காத்திருக்கும்போது நிரப்பு வார்த்தைகளை மட்டுமே பேச முடியும், சிந்தனை செயல்முறையை உரையாடலில் இயற்கையாக இடைவெளியிட முடியாது.
தீர்வு 3: சிந்தனை மற்றும் வெளிப்பாட்டின் இறுதி-முதல்-இறுதி ஒருங்கிணைப்பு (Step-Audio R1-ஐ உதாரணமாகக் கொண்டு)¶
தீர்வு 2 மெதுவான சிந்தனைக்கான காத்திருப்பு சிக்கலைத் தீர்த்தாலும், அது கட்டமைப்பு ரீதியாக "முதலில் சிந்தி, பின்னர் பேசு" என்பதாகவே உள்ளது—சிந்தனை மற்றும் வெளிப்பாடு இரண்டு தனித்தனி செயல்முறைகளாகவே உள்ளன, இது மனிதனைப் போன்ற "பேசும்போது சிந்திப்பதை" அடைய முடியாது. இந்த அடிப்படை வரம்பை உடைக்க, சிந்தனை திறன்களை நேரடியாக மாதிரியில் உள்வாங்க வேண்டும்.
Step-Audio R1 இந்த திசையில் ஒரு அடிப்படையில் வேறுபட்ட தீர்வை முன்மொழிகிறது: இது சிந்திக்கும் திறன்களை நேரடியாக எண்ட்-டு-எண்ட் ஆடியோ மொழி மாதிரியில் உள்வாங்கி, இரட்டை-மூளை கட்டமைப்பு (dual-brain architecture) மூலம் உண்மையான "பேசும்போதே சிந்தித்தல்" (thinking while speaking) என்பதை அடைகிறது. இது உண்மையில் இரண்டு நிரப்பு வழிமுறைகளைக் கொண்டுள்ளது, ஒவ்வொன்றும் வெவ்வேறு சிக்கலைத் தீர்க்கிறது: Modal-Grounded Reasoning Distillation (MGRD) முதலில் "சரியாக சிந்திப்பதை" தீர்க்கிறது—மாதிரி உண்மையில் உரை பிரதிகளை விட ஒலியியல் அம்சங்களை (acoustic features) அடிப்படையாகக் கொண்டு காரணம் காண்பதை உறுதி செய்கிறது; MPS Dual-Brain Architecture பின்னர் "சரியான நேரத்தில் பேசுவதை" தீர்க்கிறது—குறைந்த-தாமதத்துடன் பேசும்போதே சிந்திக்க, சிந்தனை மற்றும் வெளிப்பாடு இணையாக இயங்குவதை செயல்படுத்துகிறது. முந்தையது பிந்தையதற்கு ஒரு முன்நிபந்தனை: சிந்தனை ஒலியில் வேரூன்றியிருந்தால் மட்டுமே, பேசும்போதே சிந்திப்பது உண்மையிலேயே மதிப்புமிக்கதாகிறது. இவை கீழே விரிவாக விளக்கப்பட்டுள்ளன.
உரை மாற்று காரணம் (Textual Surrogate Reasoning). ஒரு குரல் மாதிரி, ஒரு பேச்சாளரின் உணர்ச்சி அல்லது நோக்கத்தைப் புரிந்துகொள்ள ஒலியியல் அம்சங்களை (சுருதி, தாளம், உச்சரிப்பு போன்றவை) நேரடியாக பகுப்பாய்வு செய்ய வேண்டும். இருப்பினும், நடைமுறையில் பல மாதிரிகள் ஒரு குறுக்கு வழியை எடுக்கின்றன: தற்போதுள்ள ஆடியோ மொழி மாதிரிகள் ஒரு எதிர்பாராத நிகழ்வை வெளிப்படுத்துகின்றன, அதாவது நீண்ட சிந்தனை சங்கிலிகள் (chains of thought) மோசமான செயல்திறனுக்கு வழிவகுக்கும். Step-Audio R1 குழு, இதன் மூல காரணத்தை "உரை மாற்று காரணம்" (Textual Surrogate Reasoning) என அடையாளம் கண்டது (ஒலியியல் தகவலுக்கு "பதிலாக" உரைத் தகவலைப் பயன்படுத்துதல்): மாதிரி "சிந்திக்கும்" போது, அது உண்மையில் ஒலியியல் அம்சங்களை பகுப்பாய்வு செய்வதற்குப் பதிலாக, உரை பிரதியெடுப்பின் (text transcription) அடிப்படையில் சொற்பொருள் காரணம் (semantic reasoning) காண்கிறது. உதாரணமாக, ஒரு பாடலின் உணர்ச்சியை மதிப்பிடும்படி கேட்கப்படும் போது, மாதிரி "மைனர் சுரக்கோவையிலான மெல்லிசையும் இறங்கு சுருதி வளைவும் (descending pitch contour) சோக உணர்வை வெளிப்படுத்துகின்றன" என்பதை விட, "பாடல் வரிகள் சோகத்தைக் குறிப்பிடுகின்றன" என்பதை பகுப்பாய்வு செய்கிறது. இந்த முறைமை பொருத்தமின்மை (modality mismatch) பயிற்சி தரவுகளிலிருந்து உருவாகிறது: பெரும்பாலான ஆடியோ மாதிரிகளின் CoT (Chain-of-Thought) தரவு உரை மாதிரிகளால் உருவாக்கப்படுகிறது, அவை இயற்கையாகவே ஒரு தூய-உரை சிந்தனை முறையைப் பெறுகின்றன.
Modality-Grounded Reasoning Distillation (MGRD) இந்த சிக்கலை மீள்செயல் சுய-முன்னேற்றம் (iterative self-improvement) மூலம் தீர்க்கிறது (படம் 9-6). பெயர் சற்று நீளமாக இருந்தாலும், மைய யோசனை உள்ளுணர்வுக்கு எளிதானது: "உண்மையில் ஒலியைக் கேட்கும்" சிந்தனை செயல்முறைகளை வடிகட்டி, அவற்றை மாதிரிக்கு பயிற்சி அளிக்கப் பயன்படுத்தி, ஒரு இசை ஆசிரியரைப் போல அதன் காதுகளால் பகுப்பாய்வு செய்ய கற்றுக்கொடுப்பது, ஒரு உரை ஆசிரியரைப் போல வரிகளை மட்டும் படிக்காமல். குறிப்பிட்ட படிகள் மூன்று:
- தற்போதைய மாதிரி, அதே ஆடியோ பகுதிக்கு பல்வேறு சிந்தனை செயல்முறைகளை உருவாக்கச் செய்து, பின்னர் உண்மையில் ஒலியியல் அம்சங்களை அடிப்படையாகக் கொண்டவற்றை வடிகட்டவும். எப்படி வடிகட்டுவது? சிந்தனை உள்ளடக்கம் குறிப்பிட்ட ஒலி அளவுருக்களைக் குறிப்பிடுகிறதா என்பதைச் சரிபார்க்கவும். உதாரணமாக, கோபமான குரல் உள்ளீட்டிற்கு, உரை அடிப்படையிலான சிந்தனை "பயனர் 'மிகவும் மோசமானது' போன்ற எதிர்மறை வார்த்தைகளைச் சொன்னார், எனவே நான் அதை கோபம் என்று மதிப்பிடுகிறேன்" — இது உரை உள்ளடக்கத்தை மட்டுமே பகுப்பாய்வு செய்கிறது; ஒலியியல் அம்சம் சார்ந்த சிந்தனை "பேச்சு விகிதம் இயல்பை விட 40% வேகமாக உள்ளது, ஒலி அளவு கணிசமாக அதிகமாக உள்ளது, மற்றும் சுருதி கூர்மையாக உள்ளது" — இது உண்மையில் ஒலியை "கேட்கிறது". MGRD பிந்தையதைத் தேர்ந்தெடுக்கிறது.
- இந்த உயர்தர சிந்தனைத் தரவுகளைப் பயன்படுத்தி மாதிரியை மீண்டும் பயிற்றுவித்து, அதன் "காதுகளால் சிந்திக்கும்" திறனை வலுப்படுத்தவும்.
- மாதிரியானது சிந்தனை செயல்முறையைத் தவிர்த்துவிட்டு நேரடியாக பதிலை யூகிப்பதன் மூலம் குறுக்கு வழிகளை எடுப்பதைத் தடுக்க, வலுவூட்டல் கற்றல் மூலம் மேலும் மேம்படுத்தவும்.
பல மறு செய்கைகளுக்குப் பிறகு, சிந்தனையின் அடித்தளம் படிப்படியாக உரை சுருக்கத்திலிருந்து ஒலி பகுப்பாய்வுக்கு மாறுகிறது—"பேச்சாளர் மகிழ்ச்சியாக இல்லை என்று தெரிகிறது" என்று தெளிவில்லாமல் கூறுவதற்குப் பதிலாக, மாதிரியானது "1.2 வினாடிகளில் சுருதி வளைவு கூர்மையாக குறைகிறது" என்பதில் கவனம் செலுத்தத் தொடங்குகிறது.
MPS இரட்டை-மூளை கட்டமைப்பு (Mind-Paced Speaking) சிந்தனை மற்றும் பேச்சு வெளியீட்டிற்கு இடையேயான தாமத முரண்பாட்டைக் கையாள்கிறது (படம் 9-6). இதன் உத்வேகம் மனித மூளையில் உள்ள பணிப் பிரிவினையிலிருந்து வருகிறது: சிந்தனைக்கு பொறுப்பான பகுதிகள் மற்றும் மொழியை ஒழுங்கமைப்பதற்கு பொறுப்பான பகுதிகள் தனித்தனியாக உள்ளன மற்றும் இணையாக வேலை செய்ய முடியும்—உங்கள் வாய் முந்தைய வாக்கியத்தைப் பேசிக்கொண்டிருக்கும்போதே நீங்கள் அடுத்த வாக்கியத்தைப் பற்றி சிந்திக்கிறீர்கள். MPS இந்தப் பிரிவினையை உருவகப்படுத்த இரண்டு மாதிரிகளைப் பயன்படுத்துகிறது: உருவாக்கும் மூளை (Formulation Brain) தொடர்ச்சியான சிந்தனைக்கு பொறுப்பாகும், சிந்தனை முடிவுகளின் பகுதிகளை உருவாக்குகிறது; உச்சரிப்பு மூளை (Articulation Brain), சிந்தனை முடிவுகளின் ஒவ்வொரு புதிய பகுதியையும் பெற்றவுடன், அதை முந்தைய சிந்தனைகள் மற்றும் தற்போதைய பதிலுடன் இணைத்து பேச்சு பதிலாக மாற்றுகிறது.
இரண்டும் இணையாக இயங்குகின்றன—உச்சரிப்பு மூளை பேசத் தொடங்கும் முன் உருவாக்கும் மூளை எல்லாவற்றையும் சிந்தித்து முடிக்க வேண்டியதில்லை. உதாரணமாக, t=0ms இல், உருவாக்கும் மூளை பயனரின் கேள்வியை பகுப்பாய்வு செய்யத் தொடங்குகிறது; t=200ms இல், அது சிந்தனை முடிவுகளின் முதல் பகுதியை (உரை டோக்கன்களின் வரிசை) வெளியிடுகிறது; உச்சரிப்பு மூளை t=200ms இல் இந்த முடிவைப் பெற்று, உருவாக்கப்பட்ட பதில் சூழலுடன் இணைத்து, t=350ms இல் தொடர்புடைய பேச்சு டோக்கன்களை வெளியிடத் தொடங்குகிறது—இரண்டு தொகுதிகளும் குழாய் இணை முறையில் செயல்படுகின்றன, மேலும் பயனர் t=350ms இல் முதல் எழுத்தைக் கேட்கிறார்.
சோதனை 9-4 ★★★: முனை-முனை பேச்சு சிந்தனைக்கு Step-Audio R1 ஐப் பயன்படுத்துதல்
இந்த சோதனையானது, பேச்சு சிந்தனை மற்றும் உரையாடல் பணிகளில் வெவ்வேறு உள்ளமைவுகளின் செயல்திறனை ஒப்பிட்டுப் பார்க்க Step-Audio R1 மாதிரியைப் பயன்படுத்துகிறது. Step-Audio R1 ஆனது ஆடியோ என்கோடர், ஆடியோ அடாப்டர் மற்றும் Qwen2.5 32B டிகோடர் ஆகியவற்றைக் கொண்டுள்ளது; இதை இயக்க பல GPU-கள் தேவைப்படுகின்றன.
இந்த சோதனை இரண்டு பணிகளை மதிப்பீடு செய்கிறது: Spoken-MQA (வாய்வழி கணித கேள்விகள்) வாய்வழியாக வழங்கப்பட்ட சிக்கலைக் கேட்ட பிறகு மாதிரியால் பல-படி கணித பகுத்தறிவைச் செய்ய முடியுமா என்பதை சோதிக்கிறது; URO-Bench (சீன வாய்வழி உரையாடல் தரநிலை) திறந்த-முடிவு உரையாடலின் தரத்தை மதிப்பீடு செய்கிறது.
சோதனை உள்ளமைவுகள் இரண்டு பரிமாணங்களாகப் பிரிக்கப்பட்டுள்ளன. முதலாவது சிந்தனை நேரம்: முழுமையான TBS (Think-Before-Speak, தாமதக் கட்டுப்பாடு இல்லாத ஒரு கட்டுப்பாட்டு அடிப்படையாகச் செயல்படுகிறது) பேசுவதற்கு முன் அனைத்து எண்ணங்களையும் உருவாக்குகிறது; தாமதத்தைக் குறைக்க, MPS இரண்டு "பேசும்போது சிந்திக்கும்" மாறுபாடுகளை வழங்குகிறது—Speak-First (spkfirst என்றும் அழைக்கப்படுகிறது, பூஜ்ஜிய தாமதம், பேச்சும் சிந்தனையும் ஒரே நேரத்தில் தொடங்குகின்றன) மற்றும் Think-First (thkfirst என்றும் அழைக்கப்படுகிறது, பேசுவதற்கு முன் சிந்திக்கும் மூளை முதல் பகுதியை உருவாக்கும் வரை காத்திருக்கிறது, சுமார் 80 டோக்கன்கள் தாமதம்). இரண்டாவது பரிமாணம் கட்டமைப்பு: MPS இரட்டை-மூளை இணைநிலை எதிராக பாரம்பரிய ஒற்றை-மாதிரி TBS.
முடிவுகள் அட்டவணை 9-1 இல் காட்டப்பட்டுள்ளன, இது வெவ்வேறு சிந்தனை நேரம் மற்றும் கட்டமைப்பு உள்ளமைவுகளின் செயல்திறனை கணிதத் துல்லியம் மற்றும் உரையாடல் மதிப்பெண்களில் ஒப்பிடப் பயன்படுகிறது.
அட்டவணை 9-1 ஸ்டெப்-ஆடியோ R1 வெவ்வேறு பேச்சு சிந்தனை உள்ளமைவு ஒப்பீடு
உள்ளமைவு Spoken-MQA URO-Bench சிந்திக்காமல் நேரடியாக பதில் (அடிப்படை) 70.6% 77.4 MPS Speak-First (பூஜ்ஜிய தாமதம்) 92.8% 82.5 MPS Think-First (~80 டோக்கன் தாமதம்) 93.9% 84.8 முழுமையான TBS (தாமதக் கட்டுப்பாடு இல்லை) 93.0% — ஒரு சுவாரஸ்யமான கண்டுபிடிப்பு என்னவென்றால், Speak-First சிந்தனைப் பணிகளில் குறைந்தபட்ச தாக்கத்தை ஏற்படுத்துகிறது (92.8% முழுமையான TBS இன் 93.0% க்கு அருகில் உள்ளது). காரணம், ஒரு CoT (Chain-of-Thought) இன் ஆரம்பம் பொதுவாக சிக்கல் உள்ளடக்கத்தை மீண்டும் கூறுவதாகவே இருக்கும்; அது இன்னும் உண்மையான பகுத்தறிவில் நுழைந்திருக்காது. எனவே, மாதிரி பேச்சுடன் ஒரே நேரத்தில் சிந்திக்கத் தொடங்கினாலும், இறுதி துல்லியம் அரிதாகவே பாதிக்கப்படுகிறது. மற்றொரு கவனிக்கத்தக்க விவரம் என்னவென்றால், Think-First (93.9%) தாமதக் கட்டுப்பாடு இல்லாத முழுமையான TBS (93.0%) ஐ விட சற்று அதிகமாக உள்ளது—ஒரு சாத்தியமான விளக்கம் என்னவென்றால், எண்ணங்களை பகுதிகளாக உருவாக்கி அவற்றை பகுதி பகுதியாக பேச்சாக மாற்றுவது படிப்படியான மேற்பார்வை போல் செயல்பட்டு, நேர்மறையான விளைவைக் கொண்டுள்ளது; நிச்சயமாக, இரண்டிற்கும் இடையேயான வேறுபாடு மதிப்பீட்டு பிழை வரம்பிற்குள் உள்ளது மற்றும் அதிகமாக விளக்கப்படக்கூடாது.
தீர்வு 3 சிந்தனையை ஒரு ஒற்றை மாதிரியில் உள்வாங்குகிறது, "பேசும்போது சிந்திப்பதை" மிகவும் நேர்த்தியாக அடைகிறது, ஆனால் இதன் விலை இந்தப் பிரிவின் தொடக்கத்தில் குறிப்பிடப்பட்ட "நகரும் இலக்கு" ஆகும்: இந்த ஒற்றை மாதிரி வலுவான பகுத்தறிவாளராகவும் நிகழ்நேர பேச்சாளராகவும் இருக்க வேண்டும், மேலும் இரண்டு திறன்களும் வேகமாக வளர்ச்சியடைந்து வருகின்றன, எனவே ஒருங்கிணைந்த அணுகுமுறை தொடர்ந்து பயிற்சியை மீண்டும் செய்ய வேண்டும். இது எழுதப்பட்ட நேரத்தில் தொழில் பிளவையும் விளக்குகிறது—"மாற்றக்கூடிய சமீபத்திய மூளைகளை" (GPT-Live, Grok Voice, Pine AI) தேடும் முன்னணி தயாரிப்புகள் பெரும்பாலும் தீர்வு 2-ன் பிரிக்கப்பட்ட அணுகுமுறையை நம்பியுள்ளன, அதே நேரத்தில் தீர்வு 3 இறுதி இயற்கைத்தன்மையை நாடி சிறப்புப் பயிற்சியின் செலவை ஏற்கத் தயாராக இருக்கும் சூழ்நிலைகளுக்கு மிகவும் பொருத்தமானது. இது ஒன்று மற்றொன்றை மாற்றுவது பற்றியது அல்ல, மாறாக "மாற்றக்கூடிய மூளை" மற்றும் "இறுக்கமான பேசும்போது சிந்தித்தல்" ஆகியவற்றுக்கு இடையேயான ஒரு பரிமாற்றம் ஆகும்.
வேகமான மற்றும் மெதுவான இடையேயான இடைமுகம்: உரையைத் தவிர வேறு என்ன அனுப்ப முடியும்¶
(குறிப்பு: இது ஒரு குறுக்கு-காட்சி இடைமுக விவாதம், தற்காலிகமாக குரல் முக்கிய நூலை விட்டு வெளியேறுகிறது.) தீர்வு 2-ஐ திரும்பிப் பார்ப்பது ஒரு புறக்கணிக்கப்பட்ட வடிவமைப்பு பரிமாணத்தை வெளிப்படுத்துகிறது: மெதுவான சிந்தனையிலிருந்து வேகமான சிந்தனைக்கு அனுப்பப்படும் "செய்தி" உரை சேனலைப் பயன்படுத்துகிறது (ஸ்டேட்டஸ் பார் மூலம் ஒரு பரிந்துரையை அனுப்புதல்). உரை புரிந்துகொள்ளவும் பிழைதிருத்தம் செய்யவும் எளிதானது, ஆனால் அது ஒரு குறுகிய உறிஞ்சுகுழாய் போன்றது—மெதுவான சிந்தனையாளரின் வளமான இடைநிலை நிலை சில வாக்கியங்களுக்குள் நெருக்கிச் சுருக்கப்படுகிறது. எனவே, வேகமான மற்றும் மெதுவான சிந்தனைக்கு இடையேயான இந்த இடைமுகம் உரையைப் பயன்படுத்தாமல் இருக்க முடியுமா?
நிகழ்நேர கேமிங்கில், நேரத்தைப் பொறுத்தவரை மிகவும் கோரும் காட்சியில், இந்த பாதை சாத்தியமானது (இதை லேட்டன்ட் பிரிட்ஜ் என்று அழைக்கலாம்) [^ch9-8]: விரைவான எதிர்வினைகளுக்குப் பொறுப்பான ஒரு சிறிய மாதிரியை (வினாடிக்கு டஜன் கணக்கான செயல்களை உருவாக்கும்) மற்றும் பகுத்தறிவுக்குப் பொறுப்பான ஒரு மெதுவான மாதிரியை (வினாடிக்கு ஒரு சிந்தனையை உருவாக்கும்) இரண்டையும் உறைய வைத்து, அவற்றுக்கிடையே சில கோடி அளவுருக்கள் கொண்ட ஒரு சிறிய "பாலத்தை" மட்டும் பயிற்றுவிக்கவும். இந்த பாலம் நேரடியாக மெதுவான மாதிரியின் மறைக்கப்பட்ட அடுக்கு முடிவுகளை சில "லேட்டன்ட் டோக்கன்களாக" திட்டமிடுகிறது, அவை வேகமான மாதிரியின் உள்ளீட்டில் இணைக்கப்படுகின்றன, மல்டிமோடல் மாதிரிகள் காட்சி டோக்கன்களைச் செருகுவதைப் போல—"யோசனை → உரை → மீண்டும் புரிதல்" என்ற சுற்றுப் பயணத்தைத் தவிர்க்கிறது. இதன் விளைவாக, பல அடாரி விளையாட்டுகளில், இந்த லேட்டன்ட் ஸ்பேஸ் சேனல் பாரம்பரிய உரை சேனலை விட கணிசமான வித்தியாசத்தில் சிறப்பாக செயல்படுகிறது (சில விளையாட்டுகளில் +26% முதல் +82% வரை), ஒரு படிக்கு சுமார் 5 மில்லி விநாடிகள் மட்டுமே சேர்த்து, நிகழ்நேர தேவைகளைத் தொடர்ந்து பூர்த்தி செய்கிறது.
இது ஒரு நேர்மையான எல்லையையும் வெளிப்படுத்துகிறது: வேகமான-மெதுவான ஒத்துழைப்பு பயனுள்ளதா என்பது, பணியின் தடையானது "யோசிக்க முடியவில்லை" அல்லது "சரியான நேரத்தில் எதிர்வினையாற்ற முடியவில்லை" என்பதைப் பொறுத்தது—மெதுவான சிந்தனையாளர் இயல்பாகவே வேகமான எதிர்வினையாளரை விட சிறப்பாக இருக்கும்போது மட்டுமே இந்த பாலம் உதவுகிறது (விளையாட்டுகளில் இந்த தொடர்பு r≈0.9 வரை அதிகமாக உள்ளது); மாறாக, பணி முற்றிலும் எதிர்வினை வேகத்தை நம்பியிருந்தால், சிறந்த பாலம் கூட பயனற்றது. இந்த தீர்ப்பு விளையாட்டுகளுக்கு அப்பாலும் பொருந்தும்; இது இந்த அத்தியாயத்தில் பின்னர் கம்ப்யூட்டர் யூஸ் சந்திக்கும் அதே சிக்கலை முன்னறிவிக்கிறது: எப்போது ஒரு "மெதுவான மூலோபாயவாதியை" அழைப்பது மதிப்புக்குரியது, எப்போது அது தாமதத்தை மட்டுமே சேர்க்கிறது?
[^ch9-8]: இரண்டு உறைந்த மாதிரிகளுக்கு இடையே ஒரு லேட்டன்ட் ஸ்பேஸ் பாலத்தை மட்டும் பயிற்றுவிப்பது மற்றும் "எப்போது ஒரு மெதுவான மூலோபாயவாதியை அழைப்பது மதிப்புக்குரியது" என்பதன் முழுமையான பகுப்பாய்வை Li, Bojie மற்றும் Noah Shi எழுதிய The Latent Bridge: A Continuous Slow-Fast Channel for Real-Time Game Agents. arXiv:2606.24470, 2026 இல் காணலாம்.
எண்ட்-டு-எண்ட் அல்லது மாடுலர் எதுவாக இருந்தாலும், உணர்தல் மற்றும் செயல்படுத்தல் அடுக்குகளின் தரம் முக்கியமானதாகவே உள்ளது. எண்ட்-டு-எண்ட் மாதிரிகள் கட்டடக்கலை தாமத சிக்கலைத் தீர்க்கின்றன, ஆனால் "துல்லியமாகக் கேட்பது" மற்றும் "இயற்கையாகப் பேசுவது" ஆகிய அடிப்படைகள் கட்டடக்கலை மாற்றத்தால் தானாகவே தீர்க்கப்படுவதில்லை—"துல்லியமாகக் கேட்பது" என்பது ஸ்ட்ரீமிங் பேச்சு உணர்தலை ஒத்துள்ளது, இது முன்னுதாரணம் ஒன்றில் விவாதிக்கப்பட்டது; இங்கே, "இயற்கையாகப் பேசுவதற்கான" செயல்படுத்தல் அடுக்கைப் பார்க்கிறோம்: மேலும் மனிதனைப் போன்ற பேச்சு தொகுப்பு.
மேலும் மனிதனைப் போன்ற பேச்சு தொகுப்பு¶
பாரம்பரிய TTS-இன் "சரியான தன்மை" தான் சரியான பிரச்சனை: மிகைப்படுத்தப்பட்ட சரளம், இடைவெளிகள் இல்லாமை, நிரப்பு வார்த்தைகள் இல்லாமை ஆகியவை அதை உடனடியாக இயந்திரம் என்று அடையாளம் காட்டுகின்றன. மனிதப் பேச்சில் உள்ள "குறைபாடுகள்" குறைபாடுகள் அல்ல—இடைவெளிகள், நிரப்பு வார்த்தைகள் ("ம்," "ஆ," "உங்களுக்குத் தெரியுமா"), எப்போதாவது மீண்டும் சொல்வது—இவை சிந்தனை செயல்முறையின் இயற்கையான வெளிப்பாடுகளாகும், இது கேட்பவருக்கு "நான் யோசிக்கிறேன்" அல்லது "எனக்கு முழுமையாக உறுதியில்லை" போன்ற முக்கியமான சமிக்ஞைகளை வழங்குகிறது. இருப்பினும், AI-இன் சிந்தனை வேகம் பேச்சு இயக்கத்தை விட மிக வேகமானது, மேலும் அதன் வெளியீடு இயற்கையாகவே சரளமாகவும் முழுமையாகவும் இருக்கும்; அதை நேரடியாக ஒருங்கிணைப்பது அதன் இயந்திரத் தன்மையை வெளிப்படுத்துகிறது.
தீர்வு: "எங்கே இடைவெளி விடுவது மற்றும் எந்த தொனியைப் பயன்படுத்துவது" என்ற முடிவை முதன்மை LLM-க்கு ஒப்படைக்கவும். LLM உரையை மட்டுமல்ல, கட்டுப்பாட்டு டோக்கன்களையும் வெளியிடுகிறது: [THINKING] என்பது 1-2 வினாடி சிந்தனை இடைவெளி மற்றும் நிரப்பு ஒலியை ("ம்...") செருகுவதைக் குறிக்கிறது; [SEARCHING] என்பது குறுகிய இடைவெளி மற்றும் தேடல் நிரப்பு வார்த்தைகளை ("உங்களுக்குத் தெரியுமா...", "எப்படிச் சொல்வது") உருவாக்குகிறது; [EMO:happy] என்பது தொனி மற்றும் உச்சரிப்பை சரிசெய்கிறது; [SPEED:0.8x] என்பது பேச்சு வேகத்தைக் கட்டுப்படுத்துகிறது. LLM-க்கு மட்டுமே தெரியும்—அது இடைவெளி தேவைப்படும் சிக்கலான கேள்விக்கு பதிலளிக்கிறதா, பயனர் பொறுமையிழந்து வேகப்படுத்த வேண்டுமா, அல்லது சாதாரண உரையாடல் மற்றும் உற்சாகமாக இருக்க வேண்டுமா என்பது.
இந்த திட்டத்தில், TTS ஒரு பல்முறை ஜெனரேட்டராக செயல்படுகிறது, உரை + கட்டுப்பாட்டு டோக்கன்களை உள்ளீடாக எடுத்து ஆடியோவை வெளியிடுகிறது. இது வழக்கமான உரைக்கு சாதாரணமாக பேச்சை ஒருங்கிணைக்கிறது, மேலும் கட்டுப்பாட்டு டோக்கன்களுக்கு தொடர்புடைய மொழியற்ற ஆடியோவை உருவாக்குகிறது: [THINKING] நீட்டிக்கப்பட்ட "ம்..." ஐ உருவாக்குகிறது, [SIGH] பெருமூச்சை உருவாக்குகிறது, [LAUGH:small] லேசான சிரிப்பை உருவாக்குகிறது, [BREATH]] மூச்சு இழுக்கும் ஒலியை உருவாக்குகிறது.
இரண்டு செயலாக்கப் பாதைகள் உள்ளன: ஒன்று, கட்டுப்பாட்டு டோக்கன்களுக்கான சொந்த ஆதரவுடன் தனியுரிம TTS ஐ உருவாக்குவது (அதிக நெகிழ்வுத்தன்மை, ஆனால் சிறப்புக் குழு தேவை); மற்றொன்று, குரல் குளோனிங்கைப் பயன்படுத்தி, அதே மெய்நிகர் ஆளுமைக்கு வெவ்வேறு உணர்ச்சிகள், வேகங்கள் மற்றும் பாணிகளை உள்ளடக்கிய டஜன் கணக்கான குறிப்பு ஆடியோ கிளிப்புகளைத் தயாரித்து, கட்டுப்பாட்டு டோக்கனின் அடிப்படையில் மிகவும் பொருத்தமான குறிப்பு ஆடியோவைத் தேர்ந்தெடுத்து TTS API (எ.கா., ElevenLabs, Fish Audio) ஐ அழைப்பது, இது வாரங்களுக்குள் பயன்படுத்தப்படலாம்.
சோதனை 9-5 ★★: Fish Audio அடிப்படையிலான கட்டுப்பாட்டு டோக்கன் இயக்கும் TTS
Fish Audio S1-இன் குரல் குளோனிங் திறனைப் பயன்படுத்தவும் (அதே ஒலி மரத்தின் ஜீரோ-ஷாட் குளோனிங்கிற்கு 3-10 வினாடிகள் குறிப்பு ஆடியோ மட்டுமே தேவை). 24 குறிப்பு ஆடியோ கிளிப்புகளின் நூலகத்தை உருவாக்கவும், இது உணர்ச்சி (நடுநிலை/மகிழ்ச்சி/விரக்தி/சிந்தனை) x வேகம் (சாதாரண/வேகமான/மெதுவான) x பாணி (முறையான/சாதாரண) ஆகியவற்றை உள்ளடக்கியது, ஒவ்வொன்றும் சுமார் 5 வினாடிகள் நீளமானது.
LLM வெளியீட்டு எடுத்துக்காட்டு:
[EMO:happy][SPEED:fast]அருமை! உங்கள் ஆர்டர் உறுதிப்படுத்தப்பட்டுள்ளது.[THINKING]ம், டெலிவரி நேரத்தைப் பார்க்கிறேன்...[EMO:neutral][SPEED:normal]இது நாளை மதியம் வந்து சேரும் என்று எதிர்பார்க்கப்படுகிறது.செயலாக்க அடுக்கு, டோக்கன்களைப் பகுத்து, அவற்றை தொடர்புடைய குறிப்பு ஆடியோவுடன் இணைக்கிறது:
[EMO:happy][SPEED:fast]என்பது "Happy+Fast+Casual" குறிப்புடனும்;[THINKING]என்பது "Thinking+Slow+Formal" குறிப்புடனும் (இடைநிறுத்த ரிதம் மற்றும் தயக்க தொனியுடன்);[EMO:neutral][SPEED:normal]என்பது "Neutral+Normal+Formal" குறிப்புடனும் இணைக்கப்படுகிறது. Fish Audio, வெவ்வேறு குறிப்பு கிளிப்புகளில் நிலையான டிம்பரை உறுதிசெய்து, ப்ரோசோடி மற்றும் உணர்ச்சியை மட்டுமே மாறுபடுத்துகிறது.மூன்று உள்ளமைவுகளை ஒப்பிடுக: கட்டுப்பாட்டு டோக்கன்கள் இல்லை (சரளமாக ஆனால் இயந்திரத்தனமாக, AI போல் ஒலிக்கிறது), ஒற்றை குறிப்பு ஆடியோ (இயற்கையானது ஆனால் உணர்ச்சியற்ற ஒரே தொனியில்), பல-குறிப்பு ஆடியோ நூலகம் (தகவலை உறுதிப்படுத்தும் போது மகிழ்ச்சியாகவும் வேகமாகவும், விளக்கங்களுக்கு முன் இயற்கையான இடைநிறுத்தங்களுடன், ஒட்டுமொத்தமாக ஒரு உண்மையான மனித வாடிக்கையாளர் சேவை பிரதிநிதியின் வெளிப்பாட்டிற்கு மிக நெருக்கமாக).
கணினி பயன்பாடு: GUI ஆட்டோமேஷன் ஏஜெண்ட்¶
இந்த அத்தியாயம், அடுத்தடுத்த இரண்டு காட்சிகளை விட, குரலுக்கு கணிசமாக அதிக இடத்தை ஒதுக்குகிறது என்பதை நீங்கள் இப்போது கவனித்திருக்கலாம்—இது வேண்டுமென்றே செய்யப்பட்டது. நிகழ்நேர மல்டிமோடாலிட்டியின் பரிணாமப் பாதையில், குரல் மிக நீண்ட தூரம் பயணித்துள்ளது, சிறந்த குறிப்புச் சட்டகமாகவும் அமைகிறது: "தொடர் பைப்லைன் தாமதம் மிக அதிகம்" என்ற பிரச்சனையில் இருந்து தொடங்கி, எண்ட்-டு-எண்ட், ஃபுல்-டூப்ளக்ஸ், பேசும்போதே சிந்தித்தல் போன்ற தொடர்ச்சியான தீர்வுகள் வழியாக, இன்றைய ஒப்பீட்டளவில் முதிர்ந்த இறுதி நிலை வரை, பிரச்சனை → தீர்வு → இறுதி நிலை என்ற முழு பயணமும் கடக்கப்பட்டுள்ளது. எனவே, அதை நாம் முழுமையாக விளக்குகிறோம். அடுத்தடுத்த கணினி பயன்பாடு மற்றும் ரோபாட்டிக்ஸ் காட்சிகளை இந்த குரல் பாதையின் அடிப்படையில் பார்க்கலாம்—ஒவ்வொன்றும் இந்த பரிணாம வரிசையில் எங்கு நிற்கிறது, எங்கு சிக்கிக் கொண்டுள்ளது என்பதைப் பார்க்கலாம்.
இந்த மூன்று காட்சிகளும் வித்தியாசமாகத் தோன்றினாலும், ஒரே மைய சவால்களை எதிர்கொள்கின்றன: நிகழ்நேர உணர்தல், குறைந்த-தாமத முடிவெடுத்தல் மற்றும் தொடர்ச்சியான தொடர்பு. அடுத்து, இந்த தொழில்நுட்ப கருப்பொருள்கள் காட்சி தொடர்பு (கணினி பயன்பாடு) மற்றும் இயற்பியல் தொடர்பு (ரோபாட்டிக்ஸ்) ஆகியவற்றில் எவ்வாறு மீண்டும் தோன்றுகின்றன என்பதைப் பார்ப்போம்—முதலில், செவிப்புலன் முறையிலிருந்து காட்சி முறைக்கு முன்னோக்கை விரிவுபடுத்துவோம்: ஒரு ஏஜெண்ட் பேச்சைப் புரிந்துகொள்வது மட்டுமல்லாமல், திரையை "பார்த்து" வரைகலை இடைமுகத்தை இயக்கவும் முடிந்தால் என்ன செய்யும்?
கணினி பயன்பாடு (GUI ஆட்டோமேஷன் ஏஜெண்ட் என்றும் அழைக்கப்படுகிறது) AI ஆனது, திரையைக் கவனித்து, மவுஸ் மற்றும் கீபோர்டை இயக்குவதன் மூலம், ஒரு மனிதனைப் போல மென்பொருளைப் பயன்படுத்த அனுமதிக்கிறது—எடுத்துக்காட்டாக, தகவலைத் தேட ஒரு உலாவியைத் திறப்பது, விரிதாள் பயன்பாட்டில் தரவை நிரப்புவது அல்லது கணினி அமைப்புகளில் உள்ளமைவுகளைச் சரிசெய்வது. இதன் மையமானது ஒரு Perceive-Think-Act சுழற்சி (படம் 9-7) ஆகும்:
- ஏஜெண்ட் தற்போதைய திரையின் ஸ்கிரீன்ஷாட்டை எடுக்கிறது.
- ஒரு மல்டிமோடல் மாதிரி, ஸ்கிரீன்ஷாட் மற்றும் பணி அறிவுறுத்தலைப் பெற்று, ஒரு சிந்தனை மற்றும் ஒரு குறிப்பிட்ட செயலை வெளியிடுகிறது.
- செயலாக்க அடுக்கு, உண்மையான சூழலில் செயலைச் செய்கிறது (மவுஸை நகர்த்துதல், கிளிக் செய்தல், உரையைத் தட்டச்சு செய்தல் போன்றவை).
- இடைமுகம் பதிலளிக்க காத்திருந்து, மற்றொரு ஸ்கிரீன்ஷாட்டை எடுத்து, அடுத்த சுழற்சி மறு செய்கையில் நுழைகிறது.
இந்த வளையத்தில் மூன்று முக்கிய வடிவமைப்பு பரிமாணங்கள் உள்ளன: செயல் இடம் (ஏஜெண்ட் என்ன செயல்பாடுகளைச் செய்ய முடியும்), காட்சி அடிப்படை (ஸ்கிரீன்ஷாட்டில் இலக்கு உறுப்பை எவ்வாறு கண்டுபிடிப்பது), மற்றும் மாதிரி கட்டமைப்பு (ஸ்கிரீன்ஷாட்டில் இருந்து சரியான செயலை எவ்வாறு உருவாக்குவது).
செயல் இட வடிவமைப்பு¶
Anthropic மூன்று வகையான கருவிகளை வரையறுக்கிறது, அவை ஒரு முழுமையான தொடர்பு திறனை உருவாக்குகின்றன (படம் 9-8):
GUI செயல்பாட்டு கருவி (கணினி கருவி): சுட்டி செயல்பாடுகளில் நகர்த்துதல் (mouse_move), இடது/வலது/நடுத்தர கிளிக், இரட்டை-கிளிக்/மூன்று-கிளிக், இழுத்தல் (left_click_drag), மற்றும் மிகவும் துல்லியமான அழுத்துதல்/விடுதல் செயல்கள் (left_mouse_down/up) ஆகியவை அடங்கும். உருட்டுதல் (scroll) நான்கு திசைகளை ஆதரிக்கிறது மற்றும் மாற்றி விசைகளுடன் இணைக்கப்படலாம். விசைப்பலகை செயல்பாடுகளில் எழுத்து எழுத்தாக தட்டச்சு செய்தல் (type, எழுத்துகளுக்கு இடையே 12ms இடைவெளியுடன் உண்மையான தட்டச்சை உருவகப்படுத்த), விசை சேர்க்கைகள் (key, எ.கா., Ctrl+C), மற்றும் ஒரு விசையை அழுத்திப் பிடித்தல் (hold_key) ஆகியவை அடங்கும். உணர்வு செயல்கள்: ஸ்கிரீன்ஷாட், கர்சர் நிலையை மீட்டெடுத்தல் (cursor_position), மற்றும் காத்திருத்தல் (wait).
கட்டளை செயல்பாட்டு கருவி (bash கருவி): 120-வினாடி நேர வரம்புடன் நிரந்தர bash முனைய அமர்வை வழங்குகிறது. கட்டளை நிறைவைக் கண்டறிய ஒரு சென்டினல் சரத்தைப் பயன்படுத்துகிறது மற்றும் பல அழைப்புகளில் சூழல் நிலையைப் பராமரிக்கிறது (எ.கா., ஒரு கோப்பகத்திற்கு cd செய்த பிறகு, அடுத்த அழைப்பு அந்த கோப்பகத்திலேயே இருக்கும்).
கோப்பு திருத்தும் கருவி (str_replace_editor): சரம் பொருத்துதல் மூலம் பாதுகாப்பான திருத்தத்தை செயல்படுத்துகிறது, இது பார்வை, உருவாக்கு, மாற்று, செருகு மற்றும் செயல்தவிர் செயல்பாடுகளை ஆதரிக்கிறது. முழு கோப்பையும் நேரடியாக மேலெழுதுவதை விட இது மிகவும் துல்லியமானது மற்றும் தற்செயலாக மற்ற உள்ளடக்கத்தை மாற்றும் வாய்ப்பு குறைவு.
சோதனை 9-6 ★: Anthropic கணினி பயன்பாட்டு டெமோவை இயக்குதல்
கொள்கலன் ஒரு முழுமையான Ubuntu டெஸ்க்டாப் சூழலை (உலாவி, முனையம் மற்றும் பிற பொதுவான கருவிகள் உட்பட) தொகுக்கிறது. முன்பக்கம் பணி வழிமுறைகளைப் பெறுகிறது, பின்பக்கம் வழிமுறைகளை ஸ்கிரீன்ஷாட்களுடன் Claude க்கு அனுப்புகிறது, மேலும் மாதிரி செயல்பாட்டு வழிமுறைகளை (சுட்டியை நகர்த்து, கிளிக் செய், உரையை தட்டச்சு செய், போன்றவை) திருப்பி அனுப்புகிறது, பின்னர் அவை மெய்நிகர் டெஸ்க்டாப்பில் செயல்படுத்தப்படுகின்றன.
முக்கிய கவனிப்பு: ஒவ்வொரு செயலும் 2-5 வினாடிகள் எடுக்கும் (மனிதனை விட கணிசமாக மெதுவானது), ஆனால் அமைப்பு பொதுவான பணிகளுக்கு நல்ல திட்டமிடல் திறனை வெளிப்படுத்துகிறது, அவற்றை தானாகவே நியாயமான செயல் வரிசைகளாக பிரிக்கிறது.
காட்சி அடிப்படை¶
சுழற்சியின் ஒவ்வொரு மறுமுறையிலும், மாதிரியானது ஸ்கிரீன்ஷாட்டில் உள்ள இலக்கு உறுப்பை துல்லியமாக கண்டறிய வேண்டும்—"தேடல் பெட்டி எங்கே?" "சமர்ப்பி பொத்தானின் ஆயத்தொலைவுகள் என்ன?" இதுதான் காட்சி அடிப்படை சிக்கல் (visual grounding problem). தற்போது, இரண்டு முக்கிய அணுகுமுறைகள் உள்ளன: ஒன்று, உள்ளூர்மயமாக்கலை பல்தேர்வு சிக்கலாக மாற்றுவது—முதலில் இடைமுக உறுப்புகளை எண்களுடன் குறியிடவும், மாதிரி ஒன்றை மட்டும் தேர்ந்தெடுக்க வேண்டும்; மற்றொன்று தூய ஆயத்தொலைவு கணிப்பு—மாதிரியானது ஸ்கிரீன்ஷாட்டை "பார்த்து" நேரடியாக ஆயத்தொலைவுகளைப் புகாரளிக்க அனுமதிப்பது, மனிதனைப் போலவே. பல்தேர்வு அணுகுமுறைக்கு இரண்டு செயலாக்க முறைகள் உள்ளன: தூய காட்சி குறியீடு (அசல் Set-of-Mark, பிக்சல்களில் வேட்பாளர் பகுதிகளை வெட்டுவதற்கு பிரிவு மாதிரியைப் பயன்படுத்துதல்) மற்றும் கட்டமைக்கப்பட்ட உறுப்பு அட்டவணைப்படுத்தல் (DOM/அணுகல்தன்மை மரம், இடைமுகத்தின் உள்ளார்ந்த கட்டமைப்பை நேரடியாகப் படித்தல்). பல்தேர்வு அணுகுமுறையின் பொதுவான நன்மை என்னவென்றால், இது "ஸ்கிரீன்ஷாட்டில் பொத்தானைக் கண்டுபிடித்து அதன் ஆயத்தொலைவுகளைக் கணிக்கவும்" என்ற திறந்த முடிவு சிக்கலை "ஏற்கனவே குறியிடப்பட்ட உறுப்புகளிலிருந்து ஒன்றைத் தேர்ந்தெடுக்கவும்" என்ற மூடிய முடிவு சிக்கலாக மாற்றுகிறது—தேர்வில் நிரப்பு வினாக்களை விட பல்தேர்வு வினாக்களுக்கு பதிலளிப்பது எளிதானது போலவே, மாதிரியானது "திரையின் மேல் இடது மூலையிலிருந்து சுமார் 200 பிக்சல்கள் வலதுபுறத்தில் உள்ள நீல பொத்தானைக் கிளிக் செய்யவும்" என்று சொல்வதற்குப் பதிலாக "கிளிக் [123]" என்று மட்டுமே சொல்ல வேண்டும்.
Set-of-Mark: காட்சி குறியீட்டு முறை.
அசல் Set-of-Mark (SoM) 2023 இல் மைக்ரோசாப்ட் ஆராய்ச்சியால் முன்மொழியப்பட்டது, ஆரம்பத்தில் GPT-4V இன் காட்சி அடிப்படை திறன்களைத் திறக்க. இது ஒரு முற்றிலும் காட்சி முறை: இது படப் பிரிவு மாதிரிகளை (SAM, SEEM, போன்றவை) பயன்படுத்தி ஸ்கிரீன்ஷாட்டில் வேட்பாளர் பகுதிகளை தானாக வெட்டி, ஒவ்வொரு பகுதியிலும் ஒரு எண்ணிடப்பட்ட குறியை மேலெழுதுகிறது, மேலும் மாதிரியானது எண்களுடன் கூடிய படத்தைப் பார்க்கிறது. மாதிரியானது எண்ணை மட்டும் புகாரளிக்க வேண்டும், மேலும் அமைப்பு அதை தொடர்புடைய பகுதியின் மைய ஆயத்தொலைவுகளாக மாற்றுகிறது. முழு செயல்முறைக்கும் DOM அல்லது எந்த உள் இடைமுக கட்டமைப்பும் தேவையில்லை, எனவே இது சொந்த டெஸ்க்டாப் மென்பொருள் மற்றும் விளையாட்டு இடைமுகங்களுக்கும் சமமாக பொருந்தும்—பிரிவு மாதிரியானது வேட்பாளர் பகுதிகளை வெட்ட முடியும் வரை.
கட்டமைக்கப்பட்ட உறுப்பு அட்டவணைப்படுத்தல்: வலையில் SoM யோசனையின் கட்டமைக்கப்பட்ட செயலாக்கம்.
இடைமுகமே கட்டமைக்கப்பட்ட தகவலை வழங்க முடியும்போது, குறியீடு மிகவும் துல்லியமாக இருக்கும். நவீன வலைப்பக்கங்கள் வழங்குவதற்கு முன்பே ஒரு முழுமையான உறுப்பு அமைப்பை (DOM மரம்) மற்றும் சொற்பொருள் பாத்திரங்களை (எது ஒரு பொத்தான், எது ஒரு உள்ளீட்டுப் பெட்டி) வரையறுக்கின்றன, மேலும் அணுகல்தன்மை இடைமுகம் (Accessibility Tree) பல டெஸ்க்டாப் பயன்பாடுகளுக்கு ஒத்த தகவலை வழங்குகிறது. பிக்சல்களில் இருந்து "எந்தப் பகுதி ஒரு பொத்தான்" என்பதை ஒரு பிரிவினை மாதிரி (segmentation model) யூகிப்பதற்குப் பதிலாக, இடைமுகத்தையே நேரடியாகக் கேட்பது நல்லது, "உங்களிடம் என்ன கிளிக் செய்யக்கூடிய உறுப்புகள் உள்ளன?" browser-use திட்டத்தால் பிரதிநிதித்துவப்படுத்தப்படும் வலை முகவர் (Web Agent) அணுகுமுறை, இதைத்தான் செய்கிறது: இது DOM இலிருந்து ஊடாடும் உறுப்புகளை எண்ணி பட்டியலிடுகிறது. இது வலையில் SoM கருத்தின் கட்டமைக்கப்பட்ட செயலாக்கமாகக் கருதப்படலாம் (படம் 9-9). இந்த செயல்முறை நான்கு படிகளைக் கொண்டுள்ளது:
- உலாவி பிழைத்திருத்த இடைமுகம் (CDP, Chrome DevTools Protocol) மூலம் வலைப்பக்கத்தின் கட்டமைக்கப்பட்ட பிரதிநிதித்துவத்தையும் (DOM மரம்) அணுகல்தன்மை தகவலையும் பெறுதல்
- எந்த உறுப்புகள் ஊடாடக்கூடியவை (பொத்தான்கள், உள்ளீட்டுப் பெட்டிகள், இணைப்புகள் போன்றவை) என்பதை தானாகக் கண்டறிதல்
- ஒவ்வொரு ஊடாடும் உறுப்புக்கும் ஒரு தனித்துவமான ID ஐக் குறித்து, ஸ்கிரீன்ஷாட்டில் எல்லைப் பெட்டிகளை (bounding boxes) வரைதல்
- ஒரே நேரத்தில் ஒவ்வொரு ID க்கும் தொடர்புடைய உறுப்பை விவரிக்கும் ஒரு உரை பட்டியலை உருவாக்குதல்
Screenshot: [Key elements in the image are annotated with IDs like [1], [2], [3], [4]]
Elements:
[1] <input type="text" placeholder="Search" aria-label="Search" />
[2] <button id="submit-btn" aria-label="Submit form" />
[3] <input type="text" placeholder="Enter your name" value="" />
[4] <a href="/docs" aria-label="Documentation" />
மாதிரி ஒரு ID எண்ணை மட்டும் வெளியிட வேண்டும், மேலும் கணினி தானாகவே அந்த உறுப்பின் மைய ஆயங்களைப் பயன்படுத்தி கிளிக்கை இயக்கும். இந்த வகை அணுகுமுறை டோக்கன்களைச் சேமிக்காது (ஏனெனில் அனைத்து குறியீட்டுத் தகவலும் மாதிரிக்கு அனுப்பப்பட வேண்டும்), ஆனால் இருப்பிடம் துல்லியமாகவும் நிலையானதாகவும் இருக்கும், மேலும் பிரிவினை மாதிரிகள் அறிமுகப்படுத்தக்கூடிய தவறிய கண்டறிதல்கள் மற்றும் தவறான நேர்மறைகளையும் (false positives) இது தவிர்க்கிறது.
தூய ஆயத்தொலைவு முன்கணிப்பு (Pure Coordinate Prediction).
மூன்றாவது வழி எந்த குறியீட்டையும் செய்யாமல், மாதிரியை நேரடியாக ஆயங்களை வெளியிடுமாறு கேட்கிறது. SeeClick மற்றும் Claude இன் கணினி பயன்பாடு (computer use) ஆகியவற்றால் பிரதிநிதித்துவப்படுத்தப்படும் இந்த அணுகுமுறை, GUI ஸ்கிரீன்ஷாட்கள் மற்றும் உறுப்பு நிலைகளின் பாரிய தரவுத்தொகுப்பில் ஒரு பார்வை மாதிரியை (vision model) பயிற்றுவித்து, இயற்கை மொழி விளக்கங்களை (எ.கா., "சமர்ப்பி பொத்தானைக் கிளிக் செய்க") நேரடியாக ஸ்கிரீன்ஷாட்டில் உள்ள துல்லியமான ஆயங்களுக்கு மேப்பிங் செய்ய கற்றுக்கொடுக்கிறது—ஒரு மனித பயனரைப் போலவே, கிளிக் செய்ய வேண்டிய இடத்தைக் கண்டுபிடிக்க முற்றிலும் "பார்ப்பதை" நம்பியுள்ளது.
ஆயத்தொலைவு முன்கணிப்பு முறைகளில், பயிற்சியின் போது பயன்படுத்தப்படும் தெளிவுத்திறனை (resolution) பொறுத்தே மாதிரியின் ஆயத்தொலைவுகளைப் புரிந்துகொள்ளும் திறன் அதிகம் சார்ந்துள்ளது (படம் 9-10). Claude ஆனது XGA (1024x768), WXGA (1280x800), மற்றும் FWXGA (1366x768) ஆகிய தெளிவுத்திறன்களைப் பயன்படுத்தி பயிற்றுவிக்கப்பட்டது. உள்ளீட்டு ஸ்கிரீன்ஷாட்டின் தெளிவுத்திறன் பொருந்தவில்லை என்றால், மாதிரியின் முன்கணிக்கப்பட்ட ஆயத்தொலைவுகள் முறையாக மாறும் (systematically shift)—இது ஒரு சிறிய வரைபடத்தில் தூரத்தை அளந்து, அதை நேரடியாக ஒரு பெரிய வரைபடத்தில் பயன்படுத்துவதைப் போன்றது. எனவே, கருவி அடுக்கில் (tool layer) இரு-திசை ஆயத்தொலைவு அளவிடுதல் வழிமுறை (bidirectional coordinate scaling mechanism) செயல்படுத்தப்பட வேண்டும், மேலும் இலக்கு தெளிவுத்திறனானது காட்சி விகிதத்தின் (aspect ratio) அடிப்படையில் தேர்ந்தெடுக்கப்பட வேண்டும்—இது சீரற்ற நீட்சி (non-uniform stretching) காரணமாக படம் சிதைந்து, அதன் மூலம் ஆயத்தொலைவு தீர்ப்பில் பிழை ஏற்படுவதைத் தவிர்க்கிறது. உதாரணமாக, உண்மையான திரை தெளிவுத்திறன் 2560×1440 (16:9) ஆக இருந்தால், Claude ஆதரிக்கும் மூன்று விருப்பங்களில் மிகவும் பொருத்தமான இலக்கு FWXGA (1366×768) ஆகும், இதன் காட்சி விகிதம் 16:9 க்கு மிக அருகில் உள்ளது. ஸ்கிரீன்ஷாட் விகிதாசாரமாக 1366×768 க்கு அளவிடப்பட்டு மாதிரிக்கு அளிக்கப்படுகிறது; மாதிரி கிளிக் ஆயத்தொலைவுகளை (683, 384) வெளியிட்ட பிறகு, அவை உண்மையான ஆயத்தொலைவுகளுக்கு (683×2560/1366, 384×1440/768) ≈ (1280, 720) என தலைகீழாக மேப்பிங் செய்யப்படுகின்றன. மாறாக, 16:9 படம் வலுக்கட்டாயமாக 4:3 விகிதமுள்ள 1024×768 க்கு நீட்டப்பட்டால், படம் கிடைமட்டமாக அழுத்தப்பட்டு, மாதிரியின் முன்கணிக்கப்பட்ட ஆயத்தொலைவுகள் முறையாக மாறும்.
மூன்று வழிகளுக்கான தேர்வு தர்க்கத்தை பின்வருமாறு சுருக்கமாகக் கூறலாம்: கட்டமைக்கப்பட்ட தகவல் கிடைக்கும்போது, மிகவும் துல்லியமான மற்றும் நிலையான உள்ளூர்மயமாக்கலுக்கு DOM/அணுகல்தன்மை மர (Accessibility Tree) அட்டவணைப்படுத்தலுக்கு முன்னுரிமை அளிக்கவும்; அது கிடைக்காதபோது (எ.கா., Photoshop போன்ற பூர்வீக டெஸ்க்டாப் மென்பொருள், Canvas/WebGL வழங்கப்பட்ட இடைமுகங்கள், விளையாட்டுகள்), காட்சி குறிப்பு (visual annotation—அசல் SoM வழி) அல்லது ஆயத்தொலைவு முன்கணிப்பு ஆகிய இரண்டையும் பயன்படுத்தலாம். காட்சி குறிப்பு உள்ளூர்மயமாக்கலை பல-தேர்வு சிக்கலாக மாற்றுகிறது, இது குறிப்பாகப் பயிற்றுவிக்கப்படாத பொது-நோக்க மாதிரிகளுக்கு மிகவும் ஏற்றதாக உள்ளது; ஆயத்தொலைவு முன்கணிப்பு குறிப்பு படியை நீக்கி, GUI உள்ளூர்மயமாக்கலுக்காகப் பயிற்றுவிக்கப்பட்ட மாதிரிகளுக்கு மிகவும் நேரடியானதாக உள்ளது. இரண்டிற்கும் சிறிய உறுப்புகள் மற்றும் அடர்த்தியான இடைமுகங்களில் இன்னும் துல்லிய இடைவெளிகள் உள்ளன.
சோதனை 9-7 ★: உலாவி-பயன்பாட்டைப் (browser-use) பயன்படுத்தி தானியங்கி உலாவி செயல்பாடுகளை செயல்படுத்துதல்
Playwright உலாவி தானியக்க கட்டமைப்பின் (உலாவியை குறியீடு மூலம் கட்டுப்படுத்துவதற்கான கருவி நூலகம்) அடிப்படையில், பல்முறை பெரிய மாதிரியுடன் (multimodal large model) இணைந்து, இது இயற்கை மொழி-உந்துதல் உலாவி செயல்பாடுகளை செயல்படுத்துகிறது. SoM காட்சிப்படுத்தல் பயன்முறையை இயக்கவும், ஒவ்வொரு முடிவெடுப்பதற்கு முன்பும் குறிப்பு எல்லைப்பெட்டிகள் (annotated bounding boxes) கொண்ட ஸ்கிரீன்ஷாட்களைச் சேமிக்கவும்.
சோதனைப் பணி "Google ஐத் திறந்து சான் பிரான்சிஸ்கோ வானிலை வினவல்": கணினி துவங்கிய பிறகு, திரைப்பிடிப்பு Google தேடல் பக்கத்தைக் காட்டுகிறது, அனைத்து ஊடாடும் கூறுகளும் சிவப்பு எல்லைப் பெட்டிகள் மற்றும் அடையாள எண்களுடன் (முகவரிப் பட்டை
[1], தேடல் பெட்டி[2], தேடல் பொத்தான்[3], "நான் அதிர்ஷ்டசாலி" பொத்தான்[4], போன்றவை) குறிக்கப்பட்டுள்ளன → மாதிரி பகுப்பாய்வு செய்து[2](தேடல் பெட்டி) ஐ கிளிக் செய்கிறது → தேடல் பெட்டி கவனத்தைப் பெறுகிறது மற்றும் மாதிரி "இன்று சான் பிரான்சிஸ்கோ வானிலை" என தட்டச்சு செய்கிறது → மாதிரி[3](தேடல் பொத்தான்) ஐ கிளிக் செய்கிறது → பக்கம் தேடல் முடிவுகளுக்கு செல்கிறது, புதிய திரைப்பிடிப்பு வானிலை அட்டையில் உள்ள கூறுகளைக் குறிக்கிறது, மேலும் மாதிரி வெப்பநிலை மற்றும் வானிலை நிலைமைகள் போன்ற தகவல்களை அடையாளம் கண்டு பிரித்தெடுக்கிறது. முழு செயல்முறையும் 5 படிகள் மற்றும் சுமார் 20 வினாடிகள் ஆகும்.
வீடியோக்களைப் பார்க்கவும் ஒலிகளைக் கேட்கவும் முடிந்த கணினி பயன்பாட்டு முகவர்¶
இதுவரை, கணினி பயன்பாட்டின் உணர்தல் ஒரு மறைமுகமான அனுமானத்தின் அடிப்படையில் இருந்தது: திரை நிலையானது—ஒரு திரைப்பிடிப்பை எடுக்கவும், ஒரு படிக்கு சிந்திக்கவும், கிளிக் செய்யவும், பின்னர் அடுத்த திரைப்பிடிப்பை எடுக்கவும். ஆனால் உண்மையில், திரைகள் வீடியோக்களை இயக்குகின்றன, சில வினாடிகளில் மறைந்துவிடும் அறிவிப்புகளைக் காட்டுகின்றன, கூட்டங்களின் மனித குரல்களையும் ஒலிக்கின்றன. ஒவ்வொரு 3–5 வினாடிகளுக்கும் "கண்களைத் திறக்கும்" மற்றும் காதுகள் இல்லாத ஒரு முகவர், "இரண்டு பிரேம்களுக்கு இடையில்" நடக்கும் அனைத்திற்கும் குருடாகவும் செவிடாகவும் இருக்கிறது. திரைப் பதிவுகளைப் பார்ப்பது, கூட்டங்களில் சேர்வது, குரல் அறிவுறுத்தலைப் பின்பற்றுவது, மறைவதற்குள் ஒரு உரையாடல் பெட்டியைப் பிடிப்பது—இந்த முழு வகை அன்றாட கணினி செயல்பாடுகளும் இன்றைய கணினி பயன்பாட்டு முகவருக்கு கிட்டத்தட்ட தடைசெய்யப்பட்ட மண்டலமாகும்.
இங்கு உண்மையில் மறுவடிவமைப்பு செய்யப்பட வேண்டியது "செயல் இடைமுகம்" அல்ல, மாறாக "கவனிப்பு இடைமுகம்"[^ch9-9] ஆகும். மையக் கருத்து கவனிப்பை (தொடர்ச்சியான, தகவமைப்பு, பல்முறை) செயலில் இருந்து (தனித்த) பிரிப்பதாகும், இது சூழலுக்கும் எந்தவொரு ஆஃப்-த-ஷெல்ஃப் கணினி பயன்பாட்டு மாதிரிக்கும் இடையில் ஒரு உணர்வு இடைநிலை அடுக்கை (perceptual middleware) உருவாக்குகிறது, மறுபயிற்சி தேவையில்லை (இதை முகவர்-கணினி கவனிப்பு இடைமுகம், AOI என்று அழைக்கலாம்). இது மூன்று "வாயில்" கூறுகளைக் கொண்டுள்ளது: முதலில், இடை-பிரேம் முக்கிய பிரேம் பிடிப்பு—கிட்டத்தட்ட மாறாத பிரேம்களைத் தவிர்க்க மிகவும் மலிவான பிக்சல் வாயிலைப் பயன்படுத்தவும், பின்னர் ஒரு சிறிய மாதிரியைப் பயன்படுத்தி அர்த்தமுள்ள மாற்றம் ஏற்பட்டுள்ளதா என தீர்மானிக்கவும், மாற்றம் இருக்கும்போது மட்டுமே ஒரு பிரேமைப் பிடிக்கவும், இதன் விளைவாக நிலையான திரைகளுக்கு கிட்டத்தட்ட பூஜ்ஜிய செலவு; இரண்டாவதாக, ஒலி-வாயில் பேச்சு படியெடுப்பு—ஒலி இருக்கும்போது மட்டுமே பேச்சு அங்கீகாரத்தை அழைக்கவும், முகவருக்கு முதல் முறையாக "காதுகளை" வழங்கவும்; மூன்றாவதாக, மிக முக்கியமாக, திரையை நிலையான உரையாக விவரித்தல்—மாதிரி பிடிக்கப்பட்ட பிரேமை ஒரு வாக்கியத்தில் விவரிக்கச் செய்யவும் (எ.கா., "பாப்அப் வெளியீட்டு தேதி ஏப்ரல் 28 ஆக மாற்றப்பட்டுள்ளது என்று சொன்னது"), மற்றும் அசல் படம் பின்னர் சூழலில் இருந்து அழிக்கப்பட்டாலும், இந்த உரை நினைவகத்தில் இருக்கும், மாறும் தகவலை உரை வடிவில் முன்னோக்கி எடுத்துச் செல்கிறது. ஒரு எதிர்பாராத கண்டுபிடிப்பு என்னவென்றால், உண்மையில் முக்கியமானது "எந்த பிரேம்களை தேர்ந்தெடுப்பது" அல்ல, மாறாக "பிரேம்களை நீண்ட காலம் நிலைத்திருக்கக்கூடிய உரையாக விவரிப்பது"—உரை என்பது LLM ஏஜெண்டுகள் மிகச் சிறப்பாக கையாளும் முறைமையாகும். 7B முதல் முன்னணி அளவு வரையிலான எட்டு மாதிரிகளில், இந்த இடைநிலை மென்பொருள், எந்த மறுபயிற்சியும் இல்லாமல், +17 முதல் +48 சதவீத புள்ளிகள் வரை முன்னேற்றத்தை அளித்தது, குரல் தொடர்பான பணிகளில் மிகப்பெரிய இடைவெளி காணப்பட்டது: இந்த உணர்வு அடுக்கு சேர்க்கப்பட்டதன் மூலம், முன்பு "கேட்கக்கூடியதாக இருந்தாலும் செயல்படுத்த முடியாத" குரல் பணிகளை ஏஜெண்டால் நிறைவேற்ற முடிந்தது. இருப்பினும், இது அனைவருக்கும் பொருந்தக்கூடிய நிலையான உள்ளமைவு அல்ல—சில புதிய மாதிரிகளில், அதிகமான பட டோக்கன்களை செலுத்துவது பகுத்தறிவை நெருக்கி, செயல்திறனைக் குறைக்கும். எனவே, இந்த கூறுகள் ஒவ்வொரு மாதிரியின் அடிப்படையில் தேர்ந்தெடுக்கப்பட வேண்டும், கண்மூடித்தனமாக இயக்கப்படக்கூடாது. இது Set-of-Mark மற்றும் ஆயத்தொலைவு முன்கணிப்பு இடையேயான பரிமாற்றத்தின் அதே கொள்கையாகும்: உணர்வுத் திட்டங்களுக்கு எந்த வெள்ளி அம்பும் இல்லை; அவை மாதிரியின் குணத்திற்கு ஏற்ப வடிவமைக்கப்பட வேண்டும்.
[^ch9-9]: மூன்று கூறுகளின் முழுமையான பொறிமுறை மற்றும் ஒவ்வொரு மாதிரிக்கான நீக்கல் பகுப்பாய்வு—கேட்டட் கீஃப்ரேம்கள், தேவைக்கேற்ப டிரான்ஸ்கிரிப்ஷன், மற்றும் பிரேம்களை நிலையான உரையாக விவரித்தல்—ஆகியவற்றிற்கு, Li, Bojie மற்றும் Noah Shi எழுதிய Agent-Computer Observation Interfaces Enable Dynamic Computer Use. arXiv:2606.29472, 2026 ஐப் பார்க்கவும்.
மொபைல்: சுற்றுச்சூழல் தடைகள் தொழில்நுட்பத்தை விட கடினமானவை¶
கம்ப்யூட்டர் யூஸ் மொபைல் தளத்திற்கும் விரிவடைகிறது. மொபைலுக்கும் டெஸ்க்டாப்பிற்கும் இடையே தொழில்நுட்ப வேறுபாடுகள் உள்ளன: செயல் இடம் பொதுவாக "மவுஸ் ஆயத்தொலைவுகள் + கீபோர்டு" அல்ல, மாறாக கணினியின் அணுகல்திறன் சேவை API (எ.கா., ஆண்ட்ராய்டின் AccessibilityService) உடன் இடைமுகம் கொண்டு இடைமுக உறுப்புகளைப் படித்து கிளிக்குகள் மற்றும் உரை உள்ளீட்டை வெளியிடுகிறது; தொடர்பு முறையும் மவுஸ் பாயிண்டரிலிருந்து தொடு சைகைகளாக மாறுகிறது, இது ஆயத்தொலைவுகளின் பொருளை மாற்றுகிறது—அதே (x, y) ஒரு விரல் தட்டுதல், நீண்ட அழுத்துதல் அல்லது ஸ்வைப் சைகையின் தொடக்கப் புள்ளியைக் குறிக்கிறதா என்பதை வரையறுக்க கூடுதல் சைகை வகை தேவைப்படுகிறது. அத்தியாயம் 6 இல் அறிமுகப்படுத்தப்பட்ட AndroidWorld போன்ற மொபைல் பெஞ்ச்மார்க்குகள், இந்த செயல் இடத்தில் உண்மையான பயன்பாடுகளில் பணிகளை முடிக்கும் ஏஜெண்டின் திறனை மதிப்பிடுகின்றன.
இருப்பினும், மொபைல் கம்ப்யூட்டர் யூஸை உண்மையில் தடுப்பது பெரும்பாலும் இந்த தொழில்நுட்ப வேறுபாடுகள் அல்ல, மாறாக சுற்றுச்சூழல் தடைகள் ஆகும். சில தொலைபேசி உற்பத்தியாளர்கள் நுகர்வோர் தர தொலைபேசிகளில் AI உதவியாளர்களை ஒருங்கிணைக்க முயன்றனர், அவை WeChat, Taobao மற்றும் Alipay போன்ற அன்றாட பயன்பாடுகளை தானாக இயக்க அனுமதிக்கின்றன, ஆனால் அவை விரைவில் தள கட்டுப்பாடுகளை சந்தித்தன.
இது கணினி பயன்பாட்டிற்கு (Computer Use) ஒரு தனித்துவமான சவாலை வெளிப்படுத்துகிறது: சுற்றுச்சூழல் தடைகள் (ecosystem barriers). இந்தத் தடைகளுக்குப் பின்னால் உள்ள அடிப்படைக் காரணம் வணிக மாதிரிகளின் முரண்பாடு ஆகும். பாரம்பரிய இணைய பயன்பாடுகளின் முக்கிய வருவாய் ஈட்டும் தர்க்கம் போக்குவரத்து மற்றும் கவனம் (traffic and attention) ஆகும்: பயனர்கள் ஊட்டங்களை (feeds) உருட்டும்போது விளம்பரங்களைப் பார்க்கிறார்கள், பொருட்களைத் தேடும்போது பரிந்துரை அல்காரிதங்களைப் பின்பற்றுகிறார்கள், மற்றும் பக்கங்களை உலாவும்போது உந்துதல் வாங்குதல்களைச் செய்கிறார்கள். ஒரு ஏஜெண்ட் (Agent) பயனரின் சார்பில் செயல்படும்போது, இந்த வருவாய் ஈட்டும் சங்கிலி முற்றிலுமாகத் தவிர்க்கப்படுகிறது: AI விளம்பரங்களுக்குக் கவனம் செலுத்துவதில்லை, உந்துதல் வாங்குதல்களைச் செய்வதில்லை, மேலும் பணியை முடிக்க நேரடியாக இலக்கை நோக்கிச் செல்கிறது. விளம்பரம் மற்றும் போக்குவரத்து வருவாயை நம்பியிருக்கும் தளங்களுக்கு, ஒரு ஏஜெண்டின் ஒவ்வொரு செயல்பாடும் அவற்றின் வணிக மாதிரியின் அடித்தளத்தை அரித்துவிடுகிறது.
இதன் பொருள், கணினி பயன்பாடு CAPTCHA போன்ற தொழில்நுட்ப எதிர் நடவடிக்கைகளை மட்டுமல்ல, ஒரு கட்டமைப்பு ரீதியான நலன் முரண்பாட்டையும் (structural conflict of interest) எதிர்கொள்கிறது. இந்த முரண்பாட்டை குறுகிய காலத்தில் சமரசம் செய்வது கடினம், மேலும் இது முற்றிலும் தொழில்நுட்ப சிக்கல்களை விட நுகர்வோர் சூழ்நிலைகளில் கணினி பயன்பாட்டை நிலைநிறுத்துவதற்கு மிகவும் சவாலான தடையாக அமைகிறது.
நிகழ்நேர செயல்திறன்: தீர்க்கப்படாத மைய சவால்¶
OSWorld (அத்தியாயம் 6 அதன் மதிப்பீட்டு முறையை விவரிக்கிறது) என்பது கணினி பயன்பாட்டிற்கான பரவலாகப் பயன்படுத்தப்படும் ஒரு அளவுகோலாகும் (benchmark), இது உண்மையான Ubuntu/Windows/macOS சூழல்களில் பயன்பாடுகளுக்கு இடையேயான பணிகளை முடிக்கும் ஒரு ஏஜெண்டின் திறனைச் சோதிக்கிறது. ஆரம்பகால பொது-நோக்க மாதிரிகள் இந்த அளவுகோலில் சுமார் 20% வெற்றி விகிதத்தை மட்டுமே அடைந்தன. அதைத் தொடர்ந்து வந்த சிறப்பு மாதிரிகள் மற்றும் அதிக சக்திவாய்ந்த பொது-நோக்க மாதிரிகள் தொடர்ந்து துல்லியத்தை அதிகரித்து, இந்த எழுத்தின் நிலவரப்படி படிப்படியாக மனித-நிலை செயல்திறனை நெருங்கி வருகின்றன. இருப்பினும், துல்லியம் மட்டுமே இறுதிக் கோடு அல்ல—உண்மையான இடையூறு "அதைச் சரியாகச் செய்ய முடியுமா?" என்பதிலிருந்து "அதை விரைவாகச் செய்ய முடியுமா?" என்பதற்கு மாறியுள்ளது.
OSWorld-Human திறன் ஆய்வு ஒரு கவலைக்குரிய உண்மையை வெளிப்படுத்துகிறது: ஒரு பணி இறுதியில் வெற்றிகரமாக முடிந்தாலும் கூட, Agent-க்குத் தேவைப்படும் செயல்பாட்டு படிகளின் எண்ணிக்கை மனிதனை விட கணிசமாக அதிகமாக உள்ளது, மேலும் ஒவ்வொரு படிக்குமான inference latency பணி முன்னேறும்போது அதிகரிக்கிறது—சூழல் நீளமாக, மாதிரியின் முடிவெடுக்கும் வேகம் குறைகிறது, மேலும் பிந்தைய படிகளுக்கு எடுக்கும் நேரம் பெரும்பாலும் ஆரம்ப படிகளை விட அதிகமாக இருக்கும். ஒரு மனிதன் சில பத்து வினாடிகளில் முடிக்கக்கூடிய ஒரு ஆவண வடிவமைப்பு சரிசெய்தலை, ஒரு Agent முடிக்க பல நிமிடங்கள் ஆகலாம். மனித அளவிலான துல்லியத்தை அடைவது நடைமுறைக்குரியதாக இருப்பதற்கு சமமானதல்ல—திறன்தான் உண்மையான தடையாகும்.
திறன் பிரச்சினையின் மூல காரணம் பேச்சு சூழ்நிலையைப் போன்றது: தொடர்ச்சியான "திரைப்பிடிப்பு-சிந்தனை-கிளிக்" சுழற்சியில், ஒவ்வொரு படியும் மிகச் சிறப்பாக மேம்படுத்தப்பட்டாலும், படி முதல் படி வரை குவிந்துவரும் தாமதம் இன்னும் ஏற்றுக்கொள்ள முடியாததாக உள்ளது. ஆழமான பிரச்சனை என்னவென்றால், தற்போதைய Computer Use முற்றிலும் "முன்கூட்டியே சிந்திக்கும்" திறன் கொண்டதாக இல்லை. ஒரு agent தற்போதைய செயலைச் செயல்படுத்தும்போதே அடுத்து என்ன செய்ய வேண்டும் என்பதைக் கணிக்க முடிந்தால்—எடுத்துக்காட்டாக, ஒரு பக்கம் ஏற்றப்படும் வரை காத்திருக்கும்போது அடுத்து எங்கு கிளிக் செய்ய வேண்டும் என்பதைப் பற்றி சிந்திப்பது—அது சிந்தனை மற்றும் செயல்பாட்டு நேரத்தை ஒன்றுடன் ஒன்று இணைக்க முடியும், இது மொத்த தாமதத்தை கணிசமாகக் குறைக்கும் (இது இந்த அத்தியாயத்தின் முந்தைய பகுதியில் உள்ள "பேசும்போது சிந்தித்தல்" சூழ்நிலை மற்றும் அத்தியாயம் 4 இல் உள்ள "தொடர்ச்சியான சிந்தனை" ஒத்திசைவற்ற agent ஆகியவற்றின் அதே தேவையாகும், இங்கு "இயக்கும்போது சிந்தித்தல்" என்று மாற்றப்பட்டுள்ளது).
பேச்சுத் துறையைப் போலல்லாமல், கம்ப்யூட்டர் யூஸ்-இன் நிகழ்நேர செயல்திறனை மேம்படுத்துவதற்கு—"ஸ்கிரீன்ஷாட்-சிந்தனை-கிளிக்" சுழற்சியை வேகமாக்குவதற்கு—தற்போது முறையான தீர்வு எதுவும் இல்லை, மேலும் அது பிரேம்-பை-பிரேம் ஸ்கிரீன்ஷாட்களின் தனித்த சுழற்சியில் சிக்கியுள்ளது. இருப்பினும், இந்த அத்தியாயத்தில் மீண்டும் மீண்டும் தோன்றும் வேக-மெதுவான பிரிப்பு (fast-slow decoupling) மூலம் ஒரு மாற்று வழி ஏற்கனவே பயனுள்ளதாக நிரூபிக்கப்பட்டுள்ளது: மெதுவான கம்ப்யூட்டர்-யூஸ் ஏஜெண்டை வேகமாக்குவது கடினம் என்பதால், பயனர் அதற்காக காத்திருக்க வேண்டாம். "பேசுதல்" மற்றும் "கம்ப்யூட்டரை இயக்குதல்" ஆகியவற்றை ஒரே நேரத்தில் இயங்கும் இரண்டு மாதிரிகளாகப் பிரிக்கவும், ஒன்று வேகமானது மற்றும் ஒன்று மெதுவானது[^ch9-10]—ஒரு சிறிய மாதிரி (வேகமானது) நிகழ்நேர குரல் உரையாடலைக் கையாள்கிறது, அதே நேரத்தில் ஒரு அதிநவீன VLM (மெதுவானது) உலாவியில் படிப்படியாக செயல்படுகிறது. இரண்டும் ஒரு குறைந்தபட்ச "எளிய உரை ஒப்பந்தம்" (plain text contract) மூலம் மட்டுமே தொடர்பு கொள்கின்றன: மெதுவான ஏஜெண்ட் ஒவ்வொரு முறையும் ஒரு செயலைச் செய்யும்போதும், அது ஒரு சுழலும் நிலை சுருக்கத்தை ("படிவத்தை நிரப்புகிறேன், உங்கள் பிறந்த தேதி இன்னும் தேவை") இணைக்கிறது. வேகமான ஏஜெண்ட் இதைப் பயன்படுத்தி பயனருக்கு நிகழ்நேரத்தில் பதிலளிக்கிறது மற்றும் பயனர் வாய்மொழியாக வழங்கும் எந்தவொரு புதிய தகவலையும் மெதுவான ஏஜெண்டிற்கு அனுப்புகிறது. முக்கியமாக, நிலை சுருக்கம் முடிந்ததை உறுதிப்படுத்தும் வரை, வேகமான ஏஜெண்ட் "முடிந்தது" என்று ஒருபோதும் சொல்லக்கூடாது. இது "கம்ப்யூட்டரை தானாக இயங்க விட்டுவிட்டு போனில் பேசுவது" போன்ற காட்சியாகும். சோதனைகளில், இந்த பிரிப்பு, "ஒரே மாதிரி ஒரே நேரத்தில் இயங்கி பேசுவதை" விட குரல் பதில்களை சுமார் 15 மடங்கு வேகமாக்கியது (சராசரி தாமதம் 0.58 வினாடிகள் vs. 8.64 வினாடிகள்), பணி வெற்றி விகிதத்தைக் குறைக்காமல். வேகமான மற்றும் மெதுவான மாதிரிகளுக்கு இடையேயான உரை சேனலை அகற்றியவுடன், வெற்றி விகிதம் உடனடியாக 0 ஆகக் குறைந்தது—ஏனெனில் பயனர் வாய்மொழியாக வழங்கிய முக்கிய தகவல் இனி உலாவியை அடைய முடியவில்லை. இது முன்பு விவாதிக்கப்பட்ட லேட்டன்ட் பிரிட்ஜ் மற்றும் பேச்சுக் காட்சியில் உள்ள "சிந்தித்துப் பேசுதல்" ஆகியவற்றின் அதே கருத்தாகும்: ஒரு கூறு இயல்பாகவே மெதுவாக இருக்கும்போது, மற்றொரு வேகமான கூறு பயனரின் காத்திருப்பு நேரத்தை நிரப்பட்டும்—இந்த "எளிய உரை ஒப்பந்தம்" அடிப்படையில் அத்தியாயம் 2 முதல் விவாதிக்கப்பட்ட ஏஜெண்ட் நிலைப் பட்டியாகும் (agent status bar). கம்ப்யூட்டர் யூஸ் சுழற்சியை வேகப்படுத்துவது இன்னும் ஒரு முக்கியமான ஆராய்ச்சி திசையாக இருக்கலாம், ஆனால் "வேக-மெதுவான பிரிப்புடன் மந்தத்தை மறைப்பது" ஏற்கனவே ஒரு சாத்தியமான தீர்வாகும்.
[^ch9-10]: பேச்சு-செயல் வேக-மெதுவான பிரிப்பு மற்றும் "எளிய உரை ஒப்பந்தத்தின்" முழுமையான வடிவமைப்பை Li, Bojie மற்றும் Noah Shi. Talking While Acting: Real-Time Voice for Slow Computer-Use Agents. 2026 (வெளியாகவுள்ளது) இல் காணலாம்.
ரோபோட் மேனிபுலேஷன்: நிகழ்நேரக் கட்டுப்பாடு முதல் பயிற்சி மற்றும் பொதுமைப்படுத்தல் வரை¶
வாசிப்புக் குறிப்பு: இந்தப் பகுதி ரோபோக் கட்டுப்பாட்டைப் பற்றி விவாதிக்கிறது. சோதனை 9-10, சிமுலேஷனில் இருந்து நிஜத்திற்கு மாற்றும் ஒரு முறையை நிரூபிக்கிறது—சிமுலேஷன் பயிற்சிப் பகுதியை (படிகள் 3-4) தூய GPU சர்வரில் வன்பொருள் இல்லாமல் முடிக்க முடியும்; இருப்பினும், முழு பைப்லைனையும் இறுதி முதல் இறுதி வரை மீண்டும் உருவாக்க (நிஜ உலகப் பயன்பாட்டுப் படிகள் உட்பட), SO100 ரோபோ கை போன்ற உண்மையான வன்பொருள் தேவைப்படுகிறது. நீங்கள் தற்போது ரோபாட்டிக்ஸில் ஆர்வம் காட்டவில்லை என்றால், இந்தப் பகுதியைத் தவிர்க்கலாம்; இது மற்ற அத்தியாயங்களைப் படிப்பதைப் பாதிக்காது.
குரல் முகவர்கள் செவிப்புலன் முறைமையில் (auditory modality) தாமதத்தை (latency) எதிர்கொள்கின்றனர், மேலும் கணினி பயன்பாடு (Computer Use) காட்சி முறைமையில் (visual modality) தாமதத்தை எதிர்கொள்கிறது. முகவர்கள் இயற்பியல் உலகில் ரோபோக்களைக் கட்டுப்படுத்த வேண்டியிருக்கும் போது, தாமதம் மற்றும் பன்முக முறைமை (multimodality) ஆகியவற்றின் சவால்கள் மேலும் பெரிதாகின்றன—செயல்களின் விளைவுகள் மீள முடியாதவை, மேலும் ஒரு ஒற்றை மோதல் பொருட்களையோ அல்லது ரோபோவையோ சேதப்படுத்தும். இந்தப் பகுதி முதலில், ரோபோக்கள் எவ்வாறு இரு-அடுக்கு கட்டமைப்பு (two-layer architecture) மற்றும் செயல் துண்டாக்கல் (action chunking) ஆகியவற்றைப் பயன்படுத்தி நிகழ்நேர கட்டுப்பாட்டுச் சிக்கலை (real-time control problem) அடக்குகின்றன என்பதைப் பார்க்கிறது, பின்னர் தற்போதைய கடினமான சவாலுக்கு மாறுகிறது—பயிற்சி மற்றும் பொதுமைப்படுத்தல் (training and generalization): தரவு எங்கிருந்து வருகிறது மற்றும் மாதிரிகள் எவ்வாறு பணிகள் மற்றும் தளங்களுக்கு இடையே மாற்றம் செய்ய முடியும்.
வன்பொருள் தடையல்ல, வழிமுறைகளே தடை¶
பொதுவான திறந்த காட்சிகளில் ரோபோக்கள் ஏன் பரவலாக ஏற்றுக்கொள்ளப்படவில்லை? தடை வன்பொருளா அல்லது வழிமுறைகளா? XLeRobot திட்டம் ஒரு வலுவான எதிர் உதாரணத்தை வழங்குகிறது: $1000 க்கும் குறைவான விலையுள்ள இரட்டை-கை சக்கர ரோபோ, ஒரு மனிதர் VR ஹெட்செட் மூலம் தொலை இயக்கப்படும் போது (teleoperation), ஏற்கனவே பல்வேறு வீட்டு வேலைகளை சீராக செய்ய முடியும். திறமையான கைகள் தேவைப்படும் மிகவும் சிக்கலான வீட்டு வேலைகளுக்கு, Unitree இன் ரோபோக்களும் மனித தொலை இயக்கத்தின் கீழ் சீராக செயல்பட முடியும். தொலை இயக்க தாமதம் சுமார் 100-200ms ஆகும், இது இயற்பியல் தொடர்புக்கான பதில் தேவைகளுக்கு நெருக்கமானது. தற்போதைய குறைந்த-செலவு தளங்களில் உள்ள சென்சார் தெளிவுத்திறன், இயக்கி துல்லியம் மற்றும் கட்டுப்பாட்டு அதிர்வெண் (ஒரு ரோபோ ஒரு நொடிக்கு அதன் செயல் கட்டளைகளைப் புதுப்பிக்கும் எண்ணிக்கை; குறைந்த அதிர்வெண் குறைவான மென்மையான இயக்கம் மற்றும் இலக்கு பாதையில் இருந்து அதிக நடுக்கம் அல்லது விலகலுக்கு வழிவகுக்கிறது) ஆகியவை நடைமுறை பணிகளுக்கு ஏற்கனவே போதுமானவை.
இந்த வாதத்திற்கு ஒரு தெளிவான எல்லை தேவை: தொலை இயக்க எதிர் உதாரணம் உண்மையில் நிரூபிப்பது என்னவென்றால், "தற்போதுள்ள குறைந்த-செலவு வன்பொருள், மனித நுண்ணறிவுடன் இணைந்து, முதன்மையாக காட்சி பின்னூட்டத்தை (visual feedback) நம்பியிருக்கும் இந்த வகை வீட்டு கையாளுதல் பணிகளை முடிக்க போதுமானது." இது வன்பொருள் அனைத்து பரிமாணங்களிலும் போதுமானது என்று அர்த்தமல்ல—தொட்டுணர்வு உணர்தல் (tactile sensing) இல்லாமை, திறமையான கைகளின் நம்பகத்தன்மை மற்றும் செலவு ஆகியவை அங்கீகரிக்கப்பட்ட வன்பொருள் குறைபாடுகளாகவே உள்ளன. ஒரு பணி நுண்ணிய விசை கட்டுப்பாடு மற்றும் தொட்டுணர்வு பின்னூட்டத்தை பெரிதும் சார்ந்திருக்கும் போது, வன்பொருள் உண்மையில் தடையாக மாறக்கூடும். எனவே, கீழே உள்ள "வன்பொருள் தடையல்ல" என்ற கூற்று, இந்தப் பகுதியில் விவாதிக்கப்படும் பணி வகைக்கு மட்டுமே வரையறுக்கப்பட்டுள்ளது.
இந்த பணிகளுக்கு, உண்மையான இடைவெளி வழிமுறை அடுக்கில் (algorithm layer) உள்ளது, இது பின்வரும் இரண்டு துணைப் பிரிவுகளில் விரிவாக விளக்கப்பட்டுள்ளது.
சோதனை 9-8 ★: XLeRobot தொலை இயக்க அனுபவம்
XLeRobot ஆனது விசைப்பலகை, Xbox கட்டுப்படுத்தி, Switch Joycon மற்றும் VR தலைக்கவசம் உள்ளிட்ட பல்வேறு தொலை இயக்க முறைகளை ஆதரிக்கிறது. பொருட்களை எடுப்பது, வைப்பது மற்றும் மேற்பரப்புகளைத் துடைப்பது போன்ற பணிகளை முடிக்க ரோபோவை கைமுறையாகக் கட்டுப்படுத்துவதன் மூலம், பதில் தாமதம், இயக்கத் துல்லியம் மற்றும் பணி நிறைவுத் தரத்தைக் கவனித்து, வன்பொருள் திறன்களின் எல்லைகளைப் பற்றிய உள்ளுணர்வுப் புரிதலை உருவாக்குங்கள்—இதை நேரடியாக அனுபவித்த பிறகு, மனிதனால் கட்டுப்படுத்தப்படும் போது ரோபோவால் கிட்டத்தட்ட எதையும் செய்ய முடியும் என்பதை நீங்கள் காண்பீர்கள், இது தற்போதைய இடையூறு வழிமுறைகள் தான் என்பதைக் குறிக்கிறது, வன்பொருள் அல்ல.[^ch9-1]
[^ch9-1]: XLeRobot, "Teleop ஆவணப்படுத்தல்" . https://xlerobot.readthedocs.io/en/latest/software/getting_started/XLeRobot_teleop.html
இரண்டு-அடுக்கு கட்டமைப்பு: திட்டமிடல் மற்றும் கட்டுப்பாட்டின் பிரிப்பு¶
சிக்கலான வீட்டுப் பணிகளை முடிக்க ரோபோக்கள் இரண்டு வெவ்வேறு நேர அளவீடுகளில் முடிவுகளை எடுக்க வேண்டும். முதல் அடுக்கு மெதுவான நீண்ட-கால திட்டமிடல் ஆகும்: "சமையலறையை சுத்தம் செய்" போன்ற உயர்-நிலை அறிவுறுத்தலை துணை-இலக்குகளின் வரிசையாக (கவுண்டர்டாப்பை சுத்தம் செய், பாத்திரங்கழுவியை ஏற்று, மேற்பரப்புகளைத் துடை) சிதைப்பது. இதற்கு சூழலியல் சொற்பொருள்களைப் புரிந்துகொள்வது, பணி சார்புகளைப் பற்றி சிந்திப்பது மற்றும் பல-படி செயல் வரிசைகளைத் திட்டமிடுவது தேவை—ஒரு நபர் தொடங்குவதற்கு முன் "முதலில் என்ன செய்வது, அடுத்து என்ன செய்வது" என்று சிந்திப்பதைப் போன்றது. இரண்டாவது அடுக்கு வேகமான VLA கட்டுப்பாடு (Vision-Language-Action மாதிரி) ஆகும்: ஒவ்வொரு குறிப்பிட்ட செயல்பாட்டையும் ("சிங்க்கிற்கு நட," "துணியை எடு," "கவுண்டர்டாப்பைத் துடை") செயல்படுத்தி, தற்போதைய காட்சி உள்ளீடு மற்றும் மொழி அறிவுறுத்தலின் அடிப்படையில் தொடர்ச்சியாக கட்டுப்பாட்டு சமிக்ஞைகளை வெளியிட்டு, மென்மையான மற்றும் ஒருங்கிணைந்த ரோபோ இயக்கத்தை உறுதி செய்கிறது.
இந்த இரண்டு-அடுக்கு கட்டமைப்பு சிக்கலை திறம்பட பிரிக்கிறது: நீண்ட-கால திட்டமிடல் "என்ன செய்வது" என்பதைக் கையாள்கிறது, மேலும் VLA கட்டுப்பாடு "எப்படி செய்வது" என்பதைக் கையாள்கிறது. இந்த "மெதுவான உயர்-நிலை முடிவெடுத்தல் + வேகமான கீழ்-நிலை செயலாக்கம்" இரண்டு-அடுக்கு கட்டமைப்பு, முன்பு பேச்சு காட்சியில் இருந்த "வேகமான-மெதுவான சிந்தனை" உடன் கட்டமைப்பு ரீதியாக மிகவும் ஒத்ததாக உள்ளது—இரண்டும் சிக்கலான சிந்தனையை நிகழ்நேர பதிலிலிருந்து வெவ்வேறு தொகுதிகளாகப் பிரிக்கின்றன. இங்கே "திட்டமிடல்/கட்டுப்பாடு" என்பது வேகமான-மெதுவான சிந்தனையில் உள்ள "மெதுவான ஆழமான சிந்தனை / வேகமான நிகழ்நேர பதில்" என்ற பிரிப்பு பரிமாணத்துடன் ஒத்துப்போகிறது என்பதைக் கவனத்தில் கொள்ள வேண்டும், இது தீர்வு 3-ன் MPS "உருவாக்கும் மூளை / உச்சரிப்பு மூளை" என்ற "சிந்தனை/வெளிப்பாடு" பிரிப்பு அல்ல—பிந்தையது "சிந்தனையை" "பேச்சிலிருந்து" பிரிக்கிறது, அதே நேரத்தில் முந்தையது "உலகளாவிய திட்டமிடலை" "நிகழ்நேர செயலாக்கத்திலிருந்து" பிரிக்கிறது. இந்த இரண்டு "இரட்டை-X கட்டமைப்புகளின்" பரிமாணங்கள் வேறுபட்டவை.
இருப்பினும், நிகழ்நேர செயல்திறன் மறைந்துவிடவில்லை; அது VLA கட்டுப்பாட்டு அடுக்குக்கு தள்ளப்பட்டுள்ளது, அங்கு அது ஆக்ஷன் சங்கிங் (Action Chunking) மூலம் குறைக்கப்படுகிறது (கீழே உள்ள "VLA கட்டுப்பாடு" துணைப்பிரிவைப் பார்க்கவும்): மாதிரியானது ஒரு அனுமானத்தில் எதிர்கால செயல்களின் குறுகிய வரிசையை உருவாக்குகிறது, மேலும் கட்டுப்பாட்டு நூல் அவற்றை அதிக அதிர்வெண்ணில் மீண்டும் இயக்குகிறது, ஒரு அனுமானத்தின் தாமதத்தை முழு செயல் வரிசையின் செயல்படுத்தும் நேரத்தில் பரப்புகிறது. ஆனால் இங்கே தவிர்க்க முடியாத ஒரு பரிமாற்றம் உள்ளது—சங்கிங் எதிர்வினைத்திறனை மென்மைக்காக பரிமாறிக்கொள்கிறது: சங்க் நீளமாக இருந்தால், ஒவ்வொரு அனுமானத்தின் தாமதமும் அதிகமாக சராசரியாக்கப்பட்டு இயக்கம் மென்மையாகிறது, ஆனால் இந்த நேரத்தில் மாதிரியானது புதிய காட்சித் தகவல்களுக்கு "குருடாக" இருப்பதால், திடீர் மாற்றங்களுக்கு (ஒரு பொருள் நகர்த்தப்படுதல், ஒரு கை வழியைத் தடுப்பது) குறைவான எதிர்வினை காட்டுகிறது. நிகழ்நேர செயல்திறனுக்கும் மென்மைக்கும் இடையிலான இந்த பரிமாற்றமானது, இரண்டு-அடுக்கு கட்டமைப்பு அகற்றவில்லை, மாறாக மாற்றிய ஒரு பிரச்சனையின் பகுதியாகும்.
இது இந்த அத்தியாயத்தின் முக்கிய நூலில் ஒரு மாற்றத்தையும் குறிக்கிறது: ரோபாட்டிக்ஸ் காட்சியில், நிகழ்நேர முரண்பாடு இரண்டு-அடுக்கு பிரிப்பு மற்றும் ஆக்ஷன் சங்கிங் மூலம் ஓரளவு குறைக்கப்பட்டுள்ளது. தற்போதைய முதன்மை முரண்பாடு பயிற்சி மற்றும் பொதுமைப்படுத்தலுக்கு (training and generalization) மாறியுள்ளது—போதுமான ஆர்ப்பாட்டத் தரவை எவ்வாறு பெறுவது மற்றும் மாதிரிகள் பணிகள் மற்றும் தளங்களில் எவ்வாறு பொதுமைப்படுத்த முடியும் என்பது. பின்வரும் துணைப்பிரிவுகள் இந்த புதிய முரண்பாட்டில் கவனம் செலுத்துகின்றன, இது அத்தியாயம் 6 இன் உருவகப்படுத்துதல் சூழல்கள் மற்றும் அத்தியாயம் 7 இன் வலுவூட்டல் கற்றல் ஆகியவற்றின் கருப்பொருள்களை இயற்பியல் உலகத்திற்கு நீட்டிப்பதாகும்.
இந்த புதிய முரண்பாடு முதன்மையாக VLA கட்டுப்பாட்டு அடுக்கில் எடை போடுகிறது. VLA ஐ "VLM + செயல் வெளியீடு" எனக் காணலாம்: VLM (Vision-Language Model—படங்கள் மற்றும் உரை இரண்டையும் புரிந்துகொள்ளும் திறன் கொண்ட ஒரு பெரிய மாதிரி) "பார்ப்பதையும்" "தெளிவாக சிந்திப்பதையும்" கையாள்கிறது, அதே நேரத்தில் VLA "செயல்படவும்" வேண்டும். உண்மையான சவால் "செயல்படும்" அடுக்கில் உள்ளது. தற்போது, VLA கட்டுப்பாட்டு அடுக்கு முதன்மையாக பின்பற்றுதல் கற்றல் (behavioral cloning) மூலம் பயிற்றுவிக்கப்படுகிறது—அதிக எண்ணிக்கையிலான மனித ஆர்ப்பாட்டங்களிலிருந்து நேரடியாக "ஒன்றைப் பார்த்து, ஒன்றைச் செய்" என்பதைக் கற்றுக்கொள்வது (OpenVLA, RT-2, π₀, போன்றவை அனைத்தும் இந்த வகையைச் சேர்ந்தவை). வலுவூட்டல் கற்றல் என்பது சமீபத்திய ஆண்டுகளில் மேலே சேர்க்கப்பட்ட ஒரு துணை முறையாகும். வலுவூட்டல் கற்றலுடன் பயிற்றுவிக்கப்பட்ட VLA கள் தனிப்பட்ட பணிகளில் நன்றாக செயல்பட முடியும் என்றாலும், அவை பெரும்பாலும் பொதுமைப்படுத்தும் திறனைக் கொண்டிருக்கவில்லை: அத்தியாயம் 7 இலிருந்து SimpleVLA-RL LIBERO இல் அதிக ஒற்றை-பணி முடிவுகளைப் புகாரளித்தாலும், அது ஒவ்வொரு பணிக்கும் தனித்தனியாக RL உடன் பயிற்றுவிக்கப்படுகிறது, அனைத்து பணிகளுக்கும் ஜீரோ-ஷாட் பொதுமைப்படுத்தும் ஒருங்கிணைந்த மாதிரி அல்ல. இந்த "ஒரு பணிக்கு ஒருமுறை பயிற்சி" மாதிரி என்பது ஒவ்வொரு புதிய பணிக்கும் தரவை மீண்டும் சேகரித்து மாதிரியை மீண்டும் பயிற்றுவிக்க வேண்டும் என்பதாகும்.
பின்வரும் இரண்டு பிரிவுகள் முறையே நீண்ட-அடிவான திட்டமிடல் மற்றும் VLA கட்டுப்பாட்டுக்கான குறிப்பிட்ட தொழில்நுட்ப தீர்வுகளை ஆழமாக ஆராய்கின்றன.
நீண்ட-அடிவான திட்டமிடல்: VLM இலிருந்து சிறப்பு உருவகப்படுத்தப்பட்ட பகுத்தறிவு மாதிரிகள் வரை¶
பொது-நோக்க VLMs ஏற்கனவே நல்ல உருவகப்படுத்தப்பட்ட பகுத்தறிவு திறன்களைக் கொண்டுள்ளன. Google DeepMind இன் Gemini Robotics-ER 1.5 குறிப்பாக உருவகப்படுத்தப்பட்ட பகுத்தறிவுக்காக (இயற்பியல் உலகில் உள்ள பொருட்களின் நிலை, இயக்கம் மற்றும் காரண உறவுகளைப் புரிந்துகொள்வது) உகந்ததாக்கப்பட்டுள்ளது. இது 15 கல்வி அளவுகோல்களில் (Point-Bench, RefSpatial, RoboSpatial, BLINK, போன்றவை) சராசரியாக 62.8% மதிப்பெண்ணை அடைந்து, GPT-4o (60.6%) மற்றும் Gemini 2.5 Pro (59.3%) ஆகியவற்றை விஞ்சுகிறது. முக்கிய நன்மைகள் பின்வருமாறு: மேம்பட்ட இடஞ்சார்ந்த புரிதல் மற்றும் பொருள் உள்ளூர்மயமாக்கல், தற்காலிக பகுத்தறிவு (செயல்களின் விளைவுகளை முன்னறிவித்தல், எ.கா., "இந்த கோப்பையை நான் தள்ளினால் என்ன நடக்கும்?"), பணி வரிசைமுறை (உயர்-நிலை அறிவுறுத்தல்களை சிறிய படிகளாகப் பிரித்தல்), மற்றும் சிந்தனை வழிமுறைகள் மற்றும் கருவி அழைப்புகளுக்கான உள்ளார்ந்த ஆதரவு.[^ch9-2]
[^ch9-2]: Google DeepMind, "Gemini Robotics-ER 1.5" . https://deepmind.google/models/gemini-robotics/gemini-robotics-er/
சோதனை 9-9 ★★: XLeRobot தன்னாட்சி வழிசெலுத்தலை இயக்க Gemini Robotics-ER 1.5 ஐப் பயன்படுத்துதல்
Gemini Robotics-ER 1.5 ஐ நீண்ட-கால திட்டமிடல் மாதிரியாகப் பயன்படுத்த, கோண அளவு குறிப்புகளுடன் கூடிய கேமரா படங்களைப் பயன்படுத்தி, RoboCrew நூலகத்தைப் பயன்படுத்தவும். இந்த அமைப்பு மூன்று எளிய கருவிகளை மட்டுமே வழங்குகிறது: முன்னோக்கி நகர்தல், இடதுபுறம் திரும்புதல், வலதுபுறம் திரும்புதல். "சமையலறையைக் கண்டுபிடித்து அங்கு செல்லுங்கள்" என்ற பணி கொடுக்கப்பட்டால், மாதிரி 0.5-1Hz அதிர்வெண்ணில் முடிவுகளை எடுக்கிறது: தாழ்வாரங்கள், கதவுகள் மற்றும் தளபாடங்கள் போன்ற காட்சி அம்சங்களை அடையாளம் காணுதல்; "சமையலறை இடதுபுறத்தில் இருக்கலாம்" என்று முடிவு செய்து இடது திருப்பத்தை செயல்படுத்துதல்; "முன்னால் ஒரு குளிர்சாதனப் பெட்டி" இருப்பதைக் கண்டு தொடர்ந்து முன்னோக்கி நகர்தல். இதை ஒரு குரல் கட்டுப்பாட்டு முறையிலும் (ஒரு விழிப்பு வார்த்தையைப் பயன்படுத்தி புதிய பணிகளைத் தூண்டுதல்) நீட்டிக்க முடியும். இந்த சோதனை, நீண்ட-கால திட்டமிடல் அடுக்கில் VLM களின் திறன் வரம்புகளை வெளிப்படுத்துகிறது: இடஞ்சார்ந்த பகுத்தறிவு மற்றும் பணி சிதைவு ஏற்கனவே நன்றாக உள்ளன, ஆனால் சிக்கலான சூழல்களில் வலிமை மற்றும் பல-படி பகுத்தறிவில் நிலைத்தன்மை ஆகியவை இன்னும் மேம்பாட்டிற்கான இடத்தைக் கொண்டுள்ளன.[^ch9-3]
[^ch9-3]: XLeRobot, "LLM Agent Control" . https://xlerobot.readthedocs.io/en/latest/software/getting_started/LLM_agent.html
VLA கட்டுப்பாடு: செயல்விளக்கத் தரவிலிருந்து குறுக்கு-உருவகப்படுத்தல் பொதுமைப்படுத்தல் வரை¶
இரண்டு-அடுக்கு கட்டமைப்பின் செயலாக்க அடுக்கில், மூன்று பிரதிநிதித்துவ மாதிரிகள்—RT-2, OpenVLA மற்றும் π₀—அனைத்தும் VLA கட்டுப்பாட்டில் கவனம் செலுத்துகின்றன, அதாவது கேமரா படங்கள் மற்றும் மொழி அறிவுறுத்தல்களின் அடிப்படையில் நிகழ்நேரத்தில் ரோபோ செயல்களை வெளியிடுதல் (படம் 9-11). அவை செயல் பிரதிநிதித்துவத்தில் இரண்டு வெவ்வேறு வழிகளைச் சேர்ந்தவை: தனித்த செயல் டோக்கன்கள் மற்றும் தொடர்ச்சியான பாதை உருவாக்கம்.
RT-2 மற்றும் OpenVLA: தனித்த செயல் டோக்கன் வழி.
RT-2 இந்தப் பாதையை முன்னோடியாக அறிமுகப்படுத்தியது: இது ஒரு பெரிய அளவிலான காட்சி-மொழி மாதிரியை நேரடியாக நன்றாகச் சரிசெய்கிறது (fine-tune), ரோபோவின் தொடர்ச்சியான செயல்களை டோக்கன்களாகப் பிரித்து, உரையை உருவாக்குவது போல, அவற்றை ஒவ்வொன்றாக தானியங்கி பின்னடைவு முறையில் (autoregressively) வெளியிடுகிறது. இது முன்-பயிற்சி பெற்ற மாதிரியின் பொதுமைப்படுத்தல் திறனைப் பயன்படுத்தி, புதிய பொருள்கள் மற்றும் வழிமுறைகளுக்கான பூஜ்ஜிய-ஷாட் மாற்றத்தை (zero-shot transfer) மேம்படுத்துகிறது. OpenVLA ஆனது RT-2 இன் செயல் பிரதிநிதித்துவத் திட்டத்தைப் பின்பற்றுகிறது, மொழி மாதிரி மற்றும் காட்சி குறியாக்கியை (vision encoder) ஒரே கட்டமைப்பில் ஒருங்கிணைக்கிறது. இது படங்கள் மற்றும் உரை வழிமுறைகளை உள்ளீடாக எடுத்து, செயல் டோக்கன்களை வெளியீடாக வழங்குகிறது. பயிற்சி இரண்டு நிலைகளில் செய்யப்படுகிறது: முதலில், குறுக்கு-தள தரவுத்தொகுப்பான Open X-Embodiment (20 க்கும் மேற்பட்ட ரோபோ தளங்களில் இருந்து நிஜ-உலக கையாளுதல் நிகழ்வுகளை உள்ளடக்கியது) இல் முன்-பயிற்சி செய்து, பொதுவான கையாளுதல் அறிவைக் கற்றுக்கொள்வது ("பிடி" மற்றும் "வை" போன்ற செயல் முறைகள் வெவ்வேறு ரோபோக்களில் பொதுவானவை); இரண்டாவதாக, ஒரு குறிப்பிட்ட தளத்திற்காக சிறிய அளவிலான தரவுகளுடன் நன்றாகச் சரிசெய்தல். செயல் பிரதிநிதித்துவம் அடிப்படையில் ஒரே மாதிரியாக இருப்பதால், இரண்டிற்கும் இடையேயான உண்மையான வேறுபாடு திறந்தநிலை மற்றும் பொறியியல் தேர்வுகளில் உள்ளது: RT-2 மற்றும் அதன் பயிற்சித் தரவு கூகிளின் உள் தரவு, அதேசமயம் OpenVLA முழுமையாக திறந்த மூலமாகும்—இது ஒரு திறந்த மூல முதுகெலும்பு மாதிரி (Llama 2 மற்றும் ஒரு காட்சி குறியாக்கி) மற்றும் பொது தரவுத்தொகுப்புகளைக் கொண்டுள்ளது, இது முழு சமூகத்திற்கும் முதல் முறையாக அதை மீண்டும் உருவாக்கவும் மேம்படுத்தவும் அனுமதிக்கிறது.
செயல் துண்டாக்கல் (Action Chunking): VLA களத்தில் ஒரு உலகளாவிய அதிர்வெண் ஈடுசெய்யும் நுட்பம்.
LLM அனுமானத்தின் (inference) தாமதம் காரணமாக, VLA இன் கட்டுப்பாட்டு அதிர்வெண் பாரம்பரிய ரோபோ கட்டுப்பாட்டிற்குத் தேவையானதை விட மிகக் குறைவாக உள்ளது (பாரம்பரிய ரோபோ கட்டுப்பாட்டிற்கு பொதுவாக 50-1000Hz தேவைப்படுகிறது, அதேசமயம் VLA ஒற்றை அனுமானம் சுமார் 1-10Hz மட்டுமே—சுமார் 100 மடங்கு வரையிலான வேறுபாடு). அசல் OpenVLA இந்தப் பிரச்சினைக்கு ஒரு பொதுவான உதாரணம்: இது ஒரு அனுமானத்திற்கு ஒரு செயலை மட்டுமே வெளியிடுகிறது (சுமார் 6Hz ஒற்றை-படி தானியங்கி பின்னடைவு முன்கணிப்பு), மேலும் செயலில் உள்ள திடீர் மாற்றங்கள் (action jerkiness) துல்லியமாக அதன் முக்கிய விமர்சிக்கப்பட்ட குறைபாடு ஆகும். செயல் துண்டாக்கல் (Action Chunking) என்பது இந்த இடைவெளியைக் குறைக்க வடிவமைக்கப்பட்ட ஒரு உலகளாவிய நுட்பமாகும்—இது முதலில் ACT (Zhao et al., 2023) ஆல் முன்மொழியப்பட்டது, பின்னர் π₀, OpenVLA-OFT போன்றவற்றால் பரவலாக ஏற்றுக்கொள்ளப்பட்டது: ஒரு அனுமானத்திற்கு ஒரு செயலை மட்டும் வெளியிடுவதற்குப் பதிலாக, மாதிரி எதிர்கால செயல்களின் ஒரு குறுகிய வரிசையை ஒரே நேரத்தில் உருவாக்குகிறது (π₀ இன் பொதுவான உள்ளமைவை உதாரணமாக எடுத்துக் கொண்டால், இது சுமார் 0.5-1 வினாடி நீளமுள்ள ஒரு செயல் துண்டை உருவாக்குகிறது, இது 50Hz கட்டுப்பாட்டு அதிர்வெண்ணில் 25-50 செயல்களாகும்). கட்டுப்பாட்டு நூல் (control thread) அவற்றை அதிக அதிர்வெண்ணில் வரிசையாக இயக்குகிறது, அதே நேரத்தில் மாதிரி பின்னணியில் அடுத்த தொகுப்பை ஒத்திசைவின்றி (asynchronously) உருவாக்குகிறது. மாதிரியின் அனுமான நேரம் இந்த தொகுப்பு செயல்களின் இயக்க நேரத்தை விட குறைவாக இருக்கும் வரை, ரோபோ தொடர்ச்சியான மற்றும் மென்மையான இயக்கத்தை பராமரிக்க முடியும்—இது வீடியோ பஃபரிங் போன்றது, உள்ளடக்கத்தை முன்கூட்டியே ஏற்றுவதால் பிளேபேக் தடுமாறாது.
π₀: தொடர்ச்சியான பாதை உருவாக்கும் வழி (Continuous Trajectory Generation Route).
செயல் பிரதிநிதித்துவத்தில் உண்மையான பிரிவு RT-2 மற்றும் OpenVLA க்கு இடையில் இல்லை, மாறாக தனித்துவமான டோக்கன்கள் மற்றும் தொடர்ச்சியான பாதை உருவாக்கம் ஆகியவற்றுக்கு இடையில் உள்ளது. π₀ பிந்தைய பாதையை பிரதிநிதித்துவப்படுத்துகிறது: தனித்துவமான செயல் டோக்கன்களை ஒவ்வொன்றாக கணிப்பதற்கு பதிலாக, இது ஃப்ளோ மேட்ச்சிங் (diffusion மாதிரிகளின் அதே தோற்றம் கொண்ட ஒரு தொடர்ச்சியான உருவாக்க முறை) ஐப் பயன்படுத்தி சீரற்ற இரைச்சலில் இருந்து தொடங்கி, பல மறுசெயல் "denoising" படிகள் மூலம், நேரடியாக ஒரு மென்மையான, தொடர்ச்சியான செயல் பாதையை உருவாக்குகிறது. இந்த பிரதிநிதித்துவம் இயற்கையாகவே செயல் சங்கிலியுடன் (action chunking) இணைந்து, துல்லியம் மற்றும் மென்மை தேவைப்படும் பணிகளில், அதாவது நுட்பமான கையாளுதல் (dexterous manipulation) போன்றவற்றில், சிறப்பாக செயல்படுகிறது. ஒரு உவமையைப் பயன்படுத்துவதானால்: தனித்துவமான டோக்கன் பாதை என்பது ஒரு மெனுவிலிருந்து "5 டிகிரி இடது," "3 செ.மீ முன்னோக்கி" என படிப்படியாக தேர்ந்தெடுப்பது போன்றது; தொடர்ச்சியான பாதை உருவாக்கம் என்பது ஒரு கலைஞர் முதலில் முழு வளைவையும் வரைந்து, பின்னர் அதை ஒவ்வொரு அடியாக செம்மைப்படுத்துவது போன்றது.
சிம்யூலேஷன்-டு-ரியல் (Sim2Real) மாற்றம்: சிம்யூலேஷனில் இருந்து நிஜத்திற்கான இடைவெளி¶
அத்தியாயம் 6 இன் சிம்யூலேஷன் சூழல் பகுதி ஏற்கனவே சிம்-டு-ரியல் இடைவெளியின் மூலத்தையும் அதைச் சமாளிக்க டொமைன் ரேண்டமைசேஷன் (domain randomization) கொள்கையையும் விளக்கியுள்ளது, எனவே அதை இங்கு மீண்டும் விவரிக்கவில்லை. சுருக்கமாக: சிம்யூலேஷன் நிஜ உலக இயற்பியல், காட்சிகள் மற்றும் வன்பொருள் பண்புகளை முழுமையாக பிரதிபலிக்க முடியாது. எனவே, பயிற்சியின் போது, இந்த அளவுருக்கள் பரந்த அளவில் சீரற்றதாக்கப்படுகின்றன, இது பல்வேறு மாற்றங்களுக்கு உறுதியான ஒரு பொதுவான பிரதிநிதித்துவத்தைக் கற்றுக்கொள்ள கொள்கையை கட்டாயப்படுத்துகிறது (படம் 9-12). கீழே, இந்த கொள்கை ஒரு உண்மையான ரோபோ கையில் எவ்வாறு செயல்படுத்தப்படுகிறது என்பதில் கவனம் செலுத்துகிறோம்.
இந்த அணுகுமுறைக்கு பல வெற்றிகரமான எடுத்துக்காட்டுகள் உள்ளன: OpenAI இன் ரோபோ கையுடன் நுட்பமான கையாளுதல் (Dactyl திட்டம் கையில் கனசதுரத்தை மறுநோக்குநிலைப்படுத்தியது, மற்றும் அடுத்தடுத்த பணிகள் ஆட்டோமேட்டிக் டொமைன் ரேண்டமைசேஷன் (ADR) ஐப் பயன்படுத்தி ஒரு கையால் ரூபிக்ஸ் கனசதுரத்தை தீர்த்தது) மற்றும் ETH சூரிச்சின் ANYmal (பனி மற்றும் சரளை போன்ற சிக்கலான வெளிப்புற நிலப்பரப்புகளில் உறுதியாக நடக்கும் நான்கு கால் ரோபோ) ஆகியவை முக்கிய எடுத்துக்காட்டுகளாகும்.
இந்த அத்தியாயம் கூடுதலாகச் சேர்ப்பது, டொமைன் ரேண்டமைசேஷனை உண்மையான ரோபோவுக்குக் கொண்டு செல்லும்போது தவிர்க்க முடியாத இரண்டு பொறியியல் படிகளாகும். முதலாவது ரேண்டமைசேஷன் வரம்பை அளவீடு செய்தல்: வரம்பை தன்னிச்சையாக அமைக்க முடியாது. அது மிகவும் குறுகலாக இருந்தால், நிஜ உலக மாறுபாடுகளை உள்ளடக்காது; மிகவும் அகலமாக இருந்தால், பயிற்சி சிரமத்தை அதிகரித்து, "எல்லாவற்றையும் கையாளும் ஆனால் எதிலும் தேர்ச்சி பெறாத" ஒரு துணை உகந்த கொள்கைக்கு வழிவகுக்கும். நடைமுறையில், முக்கிய அளவுருக்களின் (எ.கா., உராய்வு குணகம், மோட்டார் பதில் தாமதம்) பரவல் முதலில் நிஜ உலக தரவுகளிலிருந்து அளவிடப்பட்டு அளவீடு செய்யப்படுகிறது, மேலும் மாதிரி எடுப்பது இந்த வரம்பிற்குள் செய்யப்படுகிறது. உருவகப்படுத்துதலில் பயிற்றுவிக்கப்பட்ட கொள்கையானது உண்மையான ரோபோவில் குறிப்பிடத்தக்க செயல்திறன் வீழ்ச்சியைக் காட்டினால், சிம்-டு-ரியல் இடைவெளி ஏற்றுக்கொள்ளக்கூடிய அளவில் ஒருங்கிணையும் வரை ரேண்டமைசேஷன் வரம்பு படிப்படியாக விரிவுபடுத்தப்படுகிறது. இரண்டாவது காட்சி சீரமைப்பு: உருவகப்படுத்துதலுக்கும் நிஜத்திற்கும் இடையே கேமரா போஸை துல்லியமாக அளவீடு செய்தல் (சூழல் சீரமைப்பு) மற்றும் உருவகப்படுத்துதலின் பின்னணியை நிஜ உலக பின்னணி படங்களுடன் தோராயமாக மாற்றுதல் (கிரீன்ஸ்கிரீன் பின்னணி மாற்றீடு) ஆகியவை இதில் அடங்கும். இதன் மூலம் உருவகப்படுத்தப்பட்ட காட்சிகள் உண்மையான ரோபோ பார்ப்பதற்கு முடிந்தவரை நெருக்கமாக இருக்கும். இந்த இரண்டு படிகளும் சோதனை 9-10 இல் நிரூபிக்கப்படும்.
சோதனை 9-10 ★★★: ஜீரோ-ஷாட் RGB சிம்2ரியல் ரோபாட்டிக் கிராஸ்பிங்
LeRobot + ManiSkill உருவகப்படுத்தியைப் பயன்படுத்தி, RGB கேமரா படங்களை மட்டுமே கொண்டு பயிற்சி செய்து (ஆழ உணரிகள் அல்லது விசை உணரிகளை நம்பாமல்), பின்னர் நேரடியாக ஒரு உண்மையான SO100 ரோபாட்டிக் கையில் ஜீரோ-ஷாட் (கூடுதல் சரிசெய்தல் இல்லாமல்) பயன்படுத்தவும். ஐந்து-படி செயல்முறை:
- சூழல் சீரமைப்பு: உருவகப்படுத்துதல் மற்றும் நிஜ சூழலில் கேமரா நிலைகளை சரிசெய்து, காட்சி மேலடுக்கு மூலம் இரு பக்கங்களின் படங்களும் சீரமைக்கப்பட்டுள்ளதா என சரிபார்க்கவும்.
- பின்னணி மாற்றீடு (கிரீன்ஸ்கிரீன்): நிஜ சூழலில் இருந்து பிடிக்கப்பட்ட பின்னணி படங்களை தோராயமாக க்ராப் செய்து, அவற்றை உருவகப்படுத்துதல் ரெண்டரிங் மீது மேலடுக்கி, உருவகப்படுத்துதல் பின்னணியை நிஜத்திற்கு நெருக்கமாக்கவும்.
- டொமைன் ரேண்டமைசேஷன்: ரோபோ நிறம், பொருள் அமைப்பு, விளக்கு நிலைமைகள் மற்றும் கேமரா பார்வைக் களம் போன்ற அளவுருக்களை தோராயமாக மாற்றவும்.
- RL பயிற்சி: பாரிய இணை உருவகப்படுத்துதல் சூழலில் PPO அல்காரிதத்தைப் பயன்படுத்தி பயிற்சி செய்து, உருவகப்படுத்துதலில் வெற்றி விகிதம் 90% ஐ தாண்டும் வரை பயிற்சியளிக்கவும்.
- நிஜ-உலக பயன்பாடு: உண்மையான ரோபோவில் ஜீரோ-ஷாட் மூலம் கிராஸ்பிங் பணியை வெற்றிகரமாக முடிக்கவும்.
முக்கிய வெற்றி காரணிகள்: துல்லியமான சூழல் சீரமைப்பு + காட்சி டொமைன் ரேண்டமைசேஷன் + இயற்பியல் அளவுரு ரேண்டமைசேஷன், இம்மூன்றும் இன்றியமையாதவை. வரம்பு: நிஜ பொருட்களின் வடிவம், அளவு அல்லது பொருள் பயிற்சி பரவலுக்கு வெளியே வரும்போது, வெற்றி விகிதம் கணிசமாகக் குறைகிறது.[^ch9-6]
[^ch9-6]: LeRobot, "Sim2Real Tutorial". https://github.com/StoneT2000/lerobot-sim2real/blob/main/docs/zero_shot_rgb_sim2real.md
![]()
அத்தியாயச் சுருக்கம்¶
மூன்று காட்சிகளும் மேலோட்டமாக மிகவும் வேறுபட்டதாகத் தோன்றினாலும், தாமதம் (latency) மற்றும் பல்முறைமை (multimodality) ஆகிய இரண்டு தடைகளும் எப்போதும் நிலவுகின்றன. குரல், ஒரு தொடர் குழாய் (serial pipeline) அமைப்பிலிருந்து எண்ட்-டு-எண்ட் (end-to-end) மற்றும் முழு-இருவழி (full-duplex) ஆகவும், தனித்தனி வேக மற்றும் மெதுவான சிந்தனையிலிருந்து "பேசும்போதே சிந்தித்தல்" (thinking while speaking) ஆகவும் உருவெடுத்துள்ளது; OSWorld போன்ற அளவுகோல்களில் (benchmarks) கணினி பயன்பாட்டின் (Computer Use) துல்லியம் மனித அளவை நெருங்கி வருகிறது, ஆனால் இதற்கு மனிதர்களை விட கணிசமாக அதிக படிகள் தேவைப்படுகின்றன, மேலும் பணி நீளும்போது ஒவ்வொரு படியும் மேலும் மெதுவாகிறது—இந்தத் திறன் இடைவெளிக்கு (efficiency gap) இன்னும் முறையான தீர்வு இல்லை; காட்சி வழிகாட்டுதலுடன் கூடிய கையாளுதல் பணிகளில் (visually-guided manipulation tasks) ரோபோக்களுக்கு, தடையானது வன்பொருளிலிருந்து VLA கட்டுப்பாட்டு அடுக்கின் (VLA control layer) குறுக்கு-பணி பொதுமைப்படுத்தல் திறனுக்கு (cross-task generalization capability) மாறியுள்ளது (தொட்டுணர்வு உணர்தல் (tactile sensing) மற்றும் திறமையான கைகள் (dexterous hands) ஆகியவை தீர்க்கப்படாத வன்பொருள் வரம்புகளாகவே உள்ளன). அடுத்த அத்தியாயம், பல முகவர்களுக்கு (multiple agents) இடையேயான ஒத்துழைப்பின் மீது கவனத்தைத் திருப்பும், இது வேறுபட்ட பரிமாணத்தின் சவாலாகும்.
சிந்தனை கேள்விகள்¶
- ★★ குரல் முகவர்களுக்கான (voice agents) எண்ட்-டு-எண்ட் மாதிரியானது ASR-LLM-TTS ஐ ஒரே மாதிரியாக இணைத்து, தாமதத்தைக் குறைக்கிறது, ஆனால் தொகுதித்தன்மையை (modularity) இழக்கிறது. எண்ட்-டு-எண்ட் மாதிரியானது ஒரு குறிப்பிட்ட கட்டத்தில் (எ.கா., பேச்சு அங்கீகாரம்) பிழை ஏற்படுத்தினால், அதைப் பிழைத்திருத்தம் செய்து சரிசெய்வது தொடர் குழாய் அமைப்பை விட மிகவும் கடினம். எண்ட்-டு-எண்ட் குரல் முகவருக்கான கண்காணிப்புத் திறன் அமைப்பை (observability system) நீங்கள் எவ்வாறு வடிவமைப்பீர்கள்?
- ★ ஸ்டெப்-ஆடியோ R1 (Step-Audio R1) ஆனது MPS இரட்டை-மூளை கட்டமைப்பின் (MPS dual-brain architecture) மூலம் "பேசும்போதே சிந்தித்தலை" அடைகிறது. இருப்பினும், மனிதர்கள் "பேசும்போதே சிந்திக்கும்போது", பெரும்பாலும் யோசிக்காமல் வார்த்தைகளை உதிர்க்கிறார்கள், தங்களைத் தாங்களே சரிசெய்துகொள்கிறார்கள், அல்லது நிரப்பு வார்த்தைகளை (filler words) பயன்படுத்துகிறார்கள். ஒரு முகவரின் "பேசும்போதே சிந்தித்தல்" இந்த மனிதப் பண்புகளைப் பிரதிபலிக்க வேண்டுமா?
- ★★ SoM (Set-of-Mark) மற்றும் அதன் கட்டமைக்கப்பட்ட மாறுபாடுகள் (DOM உறுப்பு அட்டவணைப்படுத்தல்) கணினி பயன்பாட்டின் காட்சி இருப்பிடத்தை (visual localization) திறந்த-முடிவு ஆயத்தொலைவு கணிப்பிலிருந்து (open-ended coordinate prediction) மூடிய-தொகுப்பு அடையாளத் தேர்வுக்கு (closed-set ID selection) மாற்றுகின்றன, ஆனால் அவை அனைத்திற்கும் முதலில் UI உறுப்புகளைக் கண்டறிந்து குறிப்பிடுதல் தேவைப்படுகிறது—அது ஒரு பிரிவினை மாதிரி (segmentation model) மூலமாகவோ அல்லது DOM மூலமாகவோ இருக்கலாம். இடைமுகத்தில் தரமற்ற கட்டுப்பாடுகள் (non-standard controls) அல்லது மாறும் உறுப்புகள் (dynamically changing elements) இருந்தால், குறிப்புகள் முழுமையற்றதாகவோ அல்லது துல்லியமற்றதாகவோ இருக்கலாம். இதுபோன்ற சந்தர்ப்பங்களில், நாம் ஆயத்தொலைவு கணிப்புக்குத் (coordinate prediction) திரும்ப வேண்டுமா?
- ★★ XLeRobot போன்ற ஆயிரம் டாலர் ரோபோ தளங்கள், தொலை இயக்கத் தரவு சேகரிப்பை (teleoperation data collection) மலிவாக்குகின்றன. இருப்பினும், தொலை இயக்கத் தரவின் தரமானது ஆபரேட்டரின் திறமையைப் பொறுத்தது. திறமையற்ற ஆபரேட்டரிடமிருந்து வரும் குறைந்த தரமான தரவு, VLA மாதிரியின் பயிற்சியை எவ்வாறு பாதிக்கும்? தரவு சேகரிப்பு கட்டத்தின் போது குறைந்த தரமான தரவை தானாக வடிகட்டுவது எப்படி?
- ★★★ இந்த அத்தியாயம் மூன்று தொடர்பு முறைகளை (interaction modalities) உள்ளடக்கியது: குரல், கணினி பயன்பாடு மற்றும் ரோபாட்டிக்ஸ். இந்த முறைகளில் ஒரு பொதுவான போக்கு, தொடர் குழாய்களிலிருந்து எண்ட்-டு-எண்ட் மாதிரிகளுக்கான பரிணாம வளர்ச்சியாகும். இந்தப் போக்கு தொடர்ந்தால், ஐந்து ஆண்டுகளில் முகவர் தொடர்பு அடுக்கு (agent interaction layer) எப்படி இருக்கும்?
- ★★★ தற்போதைய கணினி பயன்பாடு (Computer Use) ஒரு தனித்த "திரைப்பிடிப்பு → செயல் → திரைப்பிடிப்பு" சுழற்சியில் இயங்குகிறது, இதில் ஒவ்வொரு கவனிப்பும் ஒரு நிலையான பிரேம் ஆகும். ஆனால் மனிதர்கள் திரையை தொடர்ச்சியாக உணர்கிறார்கள்—நாம் அசைவூட்டங்கள் இயங்குவதைப் பார்க்கிறோம், ஏற்றுதல் முன்னேற்றத்தைக் கவனிக்கிறோம், மற்றும் வீடியோ உள்ளடக்கத்தைப் புரிந்துகொள்கிறோம். இதன் பொருள், இன்றைய கணினி பயன்பாடு தற்காலிக காட்சி புரிதல் தேவைப்படும் பணிகளைக் கையாள முடியாது. தொடர்ச்சியான காட்சி ஸ்ட்ரீம் புரிதலை ஆதரிக்க, உணர்வு அடுக்கை (perception layer) எவ்வாறு மறுவடிவமைப்பு செய்வீர்கள்?
- ★★ DOM/அணுகல்தன்மை மர உறுப்பு அட்டவணைப்படுத்தல் (DOM/Accessibility Tree element indexing) நிலையான வலை பயன்பாடுகளில் நன்றாக வேலை செய்கிறது, ஆனால் அதிகரித்து வரும் மென்பொருள் இடைமுகங்கள் (Canvas/WebGL ரெண்டரிங், கிராஸ்-பிளாட்ஃபார்ம் தனிப்பயன் வரையப்பட்ட கட்டுப்பாடுகள்) அணுகக்கூடிய கட்டமைக்கப்பட்ட தகவலை வழங்குவதில்லை, அவை முற்றிலும் காட்சி குறிப்பு அல்லது ஒருங்கிணைப்பு முன்கணிப்பை நம்பியுள்ளன. கணினி பயன்பாடு முற்றிலும் காட்சி அணுகுமுறையில் பந்தயம் கட்ட வேண்டுமா, அல்லது கட்டமைக்கப்பட்ட மற்றும் காட்சி பாதைகள் இரண்டையும் பராமரிக்க வேண்டுமா? இரண்டு பாதைகளையும் பராமரிப்பதன் செலவுகள் மற்றும் நன்மைகள் என்ன?
- ★★ VLA மாதிரிகள் செயல் துண்டாக்கலை (action chunking) பயன்படுத்துகின்றன—உரையில் குறிப்பிட்டுள்ளபடி, π₀ இன் வழக்கமான உள்ளமைவு 50Hz இல் 25-50 எதிர்கால செயல்களை உருவாக்குகிறது—இது செயல்படுத்தும் நேரத்திற்குள் அனுமான தாமதத்தை (inference latency) மறைக்கிறது. இருப்பினும், செயல்படுத்தலின் போது சூழல் திடீரென மாறினால் (எ.கா., ஒரு பொருள் நகர்த்தப்பட்டால்), முன் உருவாக்கப்பட்ட செயல் வரிசை செல்லாததாகிவிடும். செயல் துண்டாக்கலின் செயல்திறன் நன்மையை சூழல் மாற்றங்களுக்கு பதிலளிக்கும் தேவையுடன் எவ்வாறு சமநிலைப்படுத்தலாம்?
- ★★★ இந்த அத்தியாயத்தில் உள்ள மூன்று காட்சிகளும் (குரல், கணினி பயன்பாடு, ரோபாட்டிக்ஸ்) "உணர்-சிந்தி-செயல்" சுழற்சியின் தாமதப் பிரச்சினையை எதிர்கொள்கின்றன மற்றும் வேகமான மற்றும் மெதுவான சிந்தனையை இணையாக்கும் திசையில் உருவாகி வருகின்றன. குரலில், இது "தவறாகப் பேசிய பின் திருத்துதல்" ஆக வெளிப்படுகிறது; கணினி பயன்பாட்டில், "முதலில் கிளிக் செய்து, பின்னர் பார்ப்பது" ஆக; ரோபாட்டிக்ஸில், "முதலில் அடி எடுத்து வைத்து, பின்னர் பார்ப்பது" ஆக. வேகமான சிந்தனையின் அடிப்படையிலான இந்த செயல்கள் மீள முடியாத விளைவுகளுக்கு வழிவகுக்காமல் இருப்பதை எவ்வாறு உறுதி செய்யலாம்?