நெட்வொர்க் மறையும் போதே குரல் AI இயல்பாக உணரப்படுகிறது

உலகளாவிய அளவில் குறைந்த-தாமத குரல் AI-யை எவ்வாறு வழங்குகிறது என்பதைப் பற்றி OpenAI ஒரு அரிதான infrastructure-level பார்வையை வெளியிட்டுள்ளது. இதில் ChatGPT voice, Realtime API, மற்றும் பயனர் இன்னும் பேசிக் கொண்டிருக்கும்போதே audio-வை செயலாக்க வேண்டிய agent workflows உள்ளிட்ட தயாரிப்புகளில் real-time speech interactions-ஐ ஆதரிக்க தனது WebRTC stack-ஐ மறுஉருவாக்கிய விதம் விளக்கப்பட்டுள்ளது.

இந்த engineering பிரச்சினையை விவரிப்பது எளிது, ஆனால் தீர்ப்பது கடினம். பேசும் உரையாடலுக்கு பல பிற software interactions-ஐ விட தாமதத்தை ஏற்கும் திறன் மிகவும் குறைவு. ஒரு system தயங்கினால், பயனாளரை இடைமறித்தால், அல்லது interruption-க்கு மிகவும் மெதுவாக பதிலளித்தால், மக்கள் அதை உடனே கவனிக்கிறார்கள். OpenAI இந்த சவாலைக் மூன்று தெளிவான தேவைகளாக வகுக்கிறது: 900 மில்லியனுக்கும் அதிகமான வாராந்திர செயலில் உள்ள பயனாளர்களுக்கான உலகளாவிய reach, session தொடங்கும் உடனே பயனாளர்கள் பேசத் தொடங்கக்கூடிய அளவுக்கு விரைவான connection setup, மற்றும் crisp turn-taking-க்கு குறைந்த jitter மற்றும் packet loss-உடன் குறைந்த, நிலையான media round-trip time.

இந்த இலக்குகள், நிறுவனத்தின் சமீபத்திய பணி model behavior-ஐ மட்டும் விட, speech-ஐ உடனடியாக உணரச் செய்யும் transport systems-ஐ அதிகம் கவனிக்கிறது என்பதைக் காட்டுகிறது. குரல் தயாரிப்புகளில் model-இன் intelligence என்பது அனுபவத்தின் ஒரு பகுதி மட்டுமே. மீதமுள்ளது packets எவ்வளவு வேகமாகவும் நம்பகமாகவும் நகர்கின்றன என்பதையே சார்ந்துள்ளது.

AI தயாரிப்புகளுக்கு WebRTC ஏன் முக்கியம்

OpenAI-யின் பதிவில் WebRTC, client-to-server voice AI-க்கு ஒரு நடைமுறை அடித்தளமாக இருப்பதை வலியுறுத்துகிறது, ஏனெனில் அது interactive media delivery-யின் கடினமான பகுதிகளை standardize செய்கிறது. இதில் ICE மூலம் connectivity establishment மற்றும் NAT traversal, DTLS மற்றும் SRTP மூலம் encrypted transport, codec negotiation, RTCP மூலம் quality control, மேலும் echo cancellation மற்றும் jitter buffering போன்ற client-side திறன்கள் அடங்கும்.

பிரௌசர்கள், மொபைல் apps, மற்றும் server infrastructure-களில் இயங்கும் நிறுவனத்துக்கு, இந்த standardization fragmentation-ஐ குறைக்கிறது. அதுவின்றி, ஒவ்வொரு client சூழலுக்கும் connectivity, encryption, codec support, மற்றும் network adaptation-க்கு தனித் தீர்வுகள் தேவைப்படும். mature standard மற்றும் விரிவான open-source WebRTC ecosystem-ஐ நம்புவதன் மூலம், முழு communications stack-ஐ முற்றிலும் புதிதாக உருவாக்காமல், real-time media streams-ஐ models-க்கு இணைக்கும் infrastructure-இல் தான் engineering effort-ஐ செலுத்த முடியும் என்று OpenAI கூறுகிறது.

இது பரந்த AI துறைக்கு ஒரு நடைமுறைச் செய்தி. Real-time AI என்பது audio-வை வேகமாக உருவாக்குவது மட்டுமல்ல. அறிமுகமான client behavior-ஐ பாதுகாத்தபடி, model-serving systems-ஐ நிறுவப்பட்ட communications protocols-உடன் இணைப்பதே அது.

மறுஉருவாக்கத்தை கட்டாயமாக்கிய scaling கட்டுப்பாடுகள்

OpenAI-யின் படி, அதன் real-time AI team, scale-ல் மூன்று கட்டுப்பாடுகள் மோதத் தொடங்கியதால் system-ஐ மீண்டும் architecture செய்தது. முதலில், ஒரு session-க்கு ஒரு port என்ற media termination முறை OpenAI infrastructure-க்கு நன்றாக பொருந்தவில்லை. இரண்டாவது, stateful ICE மற்றும் DTLS sessions-க்கு நிலையான ownership தேவைப்பட்டது. மூன்றாவது, global routing முதல் hop latency-ஐ குறைவாக வைத்திருக்க வேண்டியது இருந்தது.

இவை ஆழமான operational கவலைகள், ஆனால் அவை பெரிய architectural மாற்றத்தை சுட்டிக்காட்டுகின்றன. ஆரம்ப நிலை அல்லது சிறிய அளவிலான real-time systems பெரும்பாலும் traffic volumes அதிகரிக்கும்போது பலவீனமாகும் design-களை தாங்கிக் கொள்ளும். பல sessions-க்கு வேலைசெய்வது, பல regions மற்றும் network conditions-களில் பகிரப்பட்ட மில்லியன்கணக்கான concurrent interactions-க்கு அவசியம் வேலைசெய்யும் என்பதில்லை.

இதற்கு OpenAI அளித்த பதில் split relay plus transceiver architecture என்று அது விவரிக்கிறது. முக்கிய யோசனை, client பார்வையில் standards-compliant WebRTC behavior-ஐ பாதுகாத்தபடி, நிறுவனத்தின் infrastructure உள்ளே packet routing-ஐ மாற்றுவது. வெளிப்புற interface பரிச்சயமாகவே இருக்கும், ஆனால் உள்ளக பாதை OpenAI-யின் scale, ownership, மற்றும் routing தேவைகளுக்கு மேலும் ஏற்றதாக மாறுகிறது.

இந்த design choice பெரிய infrastructure systems-களில் பொதுவான pattern-ஐ பிரதிபலிக்கிறது: முடிந்தால் clients-ஐ உடைக்க வேண்டாம், சிக்கலை உள்ளே நகர்த்துங்கள். voice APIs-இல் பணிபுரியும் developers-க்கு இதன் பயன் தெளிவாகிறது. edge-இல் standard behavior integration friction-ஐ குறைக்கிறது, service provider-ஆல் global media orchestration-ன் கடினமான சுமை சுமக்கப்படுகிறது.

Latency இப்போது ஒரு product feature

இந்த பதிவு, குரல் AI-யை எவ்வாறு மதிப்பீடு செய்ய வேண்டும் என்பதில் ஏற்பட்டுள்ள மாற்றத்தையும் வலியுறுத்துகிறது. Latency, jitter, மற்றும் packet loss இனி network engineers-க்கு மட்டும் ஒதுக்கப்பட்ட background metrics அல்ல. அவை நேரடியாக product quality-யுடன் இணைந்தவை. பயனாளர்கள் அவற்றை awkward pauses, தாமதமான இடைமறிப்புகள், மற்றும் உரையாடல் ஓட்டத்தின் முறிவு என உணர்கிறார்கள்.

இது பல புதிய பயன்பாடுகளுக்கு முக்கியம். Consumer voice assistants இயல்பான உரையாடலை தொடரும் அளவுக்கு பதிலளிப்புத் திறன் கொண்டதாக இருக்க வேண்டும். Realtime API பயன்படுத்தும் developers-க்கு, விரைவாக தொடங்கி, மோசமான network conditions-இலும் நிலையாக இருக்கும் audio sessions வேண்டும். Interactive agents, பயனர் பேசும் போது கேட்கவும், barge-in behavior-ஐ நிர்வகிக்கவும், உரையாடலின் ஓட்டத்திலிருந்து துண்டிக்கப்பட்டது போல தெரியாமல் பதிலளிக்கவும் வேண்டும்.

OpenAI-யின் framing, speech interfaces இப்போது infrastructure performance-ஐ வேறுபடுத்தும் காரியமாக மாற்றும் கட்டத்தில் நுழைந்துள்ளன என்பதைக் காட்டுகிறது. ஒரு model திறமையானதாக இருந்தாலும் transport layer instability சேர்த்தால், அனுபவம் இன்னும் மோசமாகவே இருக்கும். இதன் விளைவாக, routing, session ownership, மற்றும் media handling குறித்த systems work AI product design-இல் மையமாகிறது; இரண்டாம் நிலை விஷயமாக இல்லை.

இந்த வெளிப்பாடு என்ன சொல்கிறது

இந்த architecture work-ஐ வெளியிட OpenAI எடுத்த முடிவு itself முக்கியமானது. இது real-time voice இனி text systems-க்கு பின்னால் சேர்க்கப்பட்ட niche feature அல்ல என்பதைக் காட்டுகிறது. இப்போது அது தனிப்பட்ட transport engineering மற்றும் பொது விளக்கத்திற்குத் தகுந்த அளவுக்கு முக்கியமும் பெரியதுமானதாகியுள்ளது. ஒரு powerful model behind an API என்பதற்குப் பதிலாக, speech-first interaction-க்காக கட்டப்பட்ட networking stack-ஐ கொண்டு global-scale conversational AI தேவைப்படுகிறது என்பதையே நிறுவனம் சொல்லிக்கொண்டிருக்கிறது.

பதிவில் உள்ள scale figure, 900 மில்லியனுக்கும் அதிகமான வாராந்திர செயலில் உள்ள பயனாளர்கள், இந்த மாற்றங்கள் ஏன் முக்கியம் என்பதற்கான சூழலை தருகிறது. அந்த அளவில், connection setup அல்லது media round-trip time-இல் சிறிய மேம்பாடுகள் கூட மிகுந்த எண்ணிக்கையிலான sessions-ஐ பாதிக்க முடியும். Reliability என்பது இனி தனிப்பட்ட பயனாளர் எரிச்சலின் விஷயம் அல்ல; அது platform-wide operating requirement ஆகிறது.

Developers மற்றும் infrastructure teams-க்கு விரிவான பாடம் என்னவென்றால், voice AI-யின் அடுத்த கட்டம் model serving மற்றும் communications engineering-ன் convergence-ஆல் வடிவமைக்கப்படும். சிறந்த speech interaction இரண்டிலும் சார்ந்துள்ளது. OpenAI-யின் redesign வேகமான pipeline-ஐ மட்டும் விவரிக்கவில்லை. குறைந்த-தாமத குரல் AI என்பது முழுமையான end-to-end systems problem என்பதைக் கூடுதல் வலிமையுடன் காட்டுகிறது.

குரல் interfaces மனித உரையாடலைப் போல உடனடியாக உணர வேண்டுமெனில், AI துறை inference speed-ஐ விட அதிகமானவற்றைத் தீர்க்க வேண்டியிருக்கும். அது network path-ஐயும் தீர்க்க வேண்டும். OpenAI-யின் WebRTC overhaul அதே ஆழமான மாற்றத்தின் ஒரு எடுத்துக்காட்டு; demo-quality voice-இருந்து production-grade conversational infrastructure-க்கு செல்லும் மாற்றம் அது.

இந்த கட்டுரை OpenAI-யின் அறிக்கையை அடிப்படையாகக் கொண்டது. மூலக் கட்டுரையைப் படிக்கவும்.

Originally published on openai.com