AI ஏஜென்ட்களுக்கான முக்கிய பாதுகாப்பு முன்னேற்றம் என Anthropic கூறுகிறது
AI ஏஜென்ட்களில் நீடித்துவரும் பாதுகாப்புச் சிக்கல்களில் ஒன்றான உலாவி-அடிப்படையிலான ப்ராம்ப்ட் இன்ஜெக்ஷனை எதிர்ப்பதில் தனது Opus 5 மாடல் குறிப்பிடத்தக்க முன்னேற்றம் செய்துள்ளதாக Anthropic கூறுகிறது. நிறுவனத்தின் system card-இல் மேற்கோள் காட்டப்பட்ட விவரங்களின்படி, Opus 5-ஐ நிறுவனத்தின் Auto Mode பாதுகாப்புகளுடன் பயன்படுத்தியபோது, 129 சோதனை நிலைகளில் எதிலும் உலாவி ஏஜென்ட்களுக்கு எதிரான ப்ராம்ப்ட் இன்ஜெக்ஷன் தாக்கங்கள் வெற்றி பெறவில்லை.
இந்த முடிவு பரந்த ஆய்விலும் நிலைத்திருந்தால், agentic AI-க்கு அது ஒரு முக்கியமான முன்னேற்றமாக இருக்கும். வலைப்பக்கங்களை உலாவும், ஆவணங்களைப் படிக்கும், அல்லது பயனரின் சார்பில் செயல்களைச் செய்யும் அமைப்புகளை பயன்படுத்துவதில் ப்ராம்ப்ட் இன்ஜெக்ஷன் ஒரு மையத் தடையாக மாறியுள்ளது. அடிப்படை சிக்கல் வெளிப்படையாக எளிதானது: தாக்குநர் ஒரு வலைப்பக்கம் அல்லது பிற உள்ளீட்டில் தீங்கிழைக்கும் வழிமுறைகளை மறைத்து வைக்கிறான், மேலும் மாடல் அது பின்பற்ற வேண்டிய உயர்நிலை விதிகளை விட அவற்றை பின்பற்றி விடுகிறது.
இந்த தோல்வி முறை நம்பகமான AI ஏஜென்ட்கள் பற்றிய எண்ணத்தை நீண்ட காலமாகத் துன்புறுத்தி வருகிறது, ஏனெனில் இந்த தாக்கம் பாரம்பரிய மென்பொருள் எல்லைகளை உடைப்பதில் சார்ந்திருக்காது. இது மொழி மாடல்கள் உரையை எவ்வாறு விளக்குகின்றன என்பதையே பயன்படுத்துகிறது. அதன் விளைவாக, கூடுதல் பாதுகாப்புகள் சுற்றி அமைக்கப்படாவிட்டால், மிக திறன்மிக்க மாடல்கள்கூட தீங்கிழைக்கும் அல்லது தவறாக வழிநடத்தும் உள்ளடக்கத்தால் பாதிக்கப்படலாம்.
Anthropic கூறுவதில் என்ன மாறியது
அறிவிக்கப்பட்ட பூஜ்ய சதவீத வெற்றி விகிதம் Opus 5 மாடலால் மட்டும் கிடைக்கவில்லை. Claude Cowork போன்ற Anthropic தயாரிப்புகளில் Auto Mode இயக்கப்பட்டபோது இந்த முடிவு பொருந்தியது. அந்த அமைப்பில், இரண்டு தனித்த பாதுகாப்பு அடுக்குகள் செயல்பட்டிருந்தன. ஒரு அடுக்கு, மாடல் உள்ளடக்கத்தை செயலாக்குவதற்கு முன் வரும் உள்ளடக்கத்தை மறைந்த அல்லது தீங்கிழைக்கும் வழிமுறைகள் இருக்கிறதா என்று ஸ்கேன் செய்கிறது. மற்றொரு அடுக்கு, ஆபத்தான செயல்களை செயல்படுத்துவதற்கு முன்பே தடுக்கிறது.
இந்த வேறுபாடு முக்கியமானது. Anthropic-ன் சொந்த கணக்குகள் காட்டுவது, அந்த கூடுதல் பாதுகாப்புகள் இல்லாமல் Opus 5 இன்னும் உலாவி-ஏஜென்ட் சூழலில் 3.7 சதவீத தாக்க வெற்றி விகிதத்தை காட்டியது என்பதாகும். எனவே அறிவிக்கப்பட்ட முன்னேற்றம், மாடல் மட்டத்தில் ப்ராம்ப்ட் இன்ஜெக்ஷன் முழுவதுமாக தீர்ந்துவிட்டது என்பதற்கான சான்றாக அல்ல, மாறாக ஒரு system-level மேம்பாடாகத் தோன்றுகிறது.
இந்த system பார்வை விரிவான துறைக்கு முக்கியமானது. AI ஏஜென்ட்களில் பாதுகாப்புப் பிரச்சினைகள் இப்போது மாடல் பிரச்சினைகளாக மட்டும் அல்ல, stack பிரச்சினைகளாகவும் கருதப்படுகின்றன. மாடல் மேம்படலாம், ஆனால் input filtering, policy enforcement, permissioning, மற்றும் action gating அனைத்தும் ஒரு தாக்குதல் உண்மையில் வெற்றி பெறுமா என்பதை தீர்மானிக்கின்றன.
Benchmark முடிவுகள் முன்னேற்றத்தை காட்டுகின்றன, ஆனால் இறுதி தீர்வை அல்ல
மூலத்தில் பாதுகாப்பு நிறுவனமான Gray Swan-இன் ப்ராம்ப்ட் இன்ஜெக்ஷன் benchmark முடிவுகளும் மேற்கோள் காட்டப்படுகின்றன. ஒரு பொது சோதனையில், 15 முயற்சிகளுக்குப் பிறகு தாக்குநர் வெற்றி விகிதம் Opus 4.8-இல் 5.5 சதவீதத்திலிருந்து Opus 5-இல் 2.0 சதவீதமாகக் குறைந்ததாக தெரிவிக்கப்படுகிறது. இதனால் ஒப்பிடப்பட்ட பிற மாடல்களில் பெயரிடப்பட்ட Mythos 5 (2.6 சதவீதம்) மற்றும் Fable 5 (2.8 சதவீதம்) ஆகியவற்றை விட Opus 5 முன்னிலையில் இருந்தது.
இந்த எண்ணிக்கைகள் உண்மையான முன்னேற்றத்தைக் காட்டுகின்றன, ஆனால் “தீர்க்கப்பட்டது” என்ற தலைப்பு-கோரிக்கையின் வரம்புகளையும் வெளிப்படுத்துகின்றன. Anthropic-ன் சொந்த விளக்கத்திலும் கூட, மிகத் தூய்மையான முடிவு பல பாதுகாப்புகள் இயக்கப்பட்ட ஒரு குறிப்பிட்ட தயாரிப்பு அமைப்பை சார்ந்துள்ளது. அவை இல்லாமல் தாக்க வெற்றி பூஜ்யமாக குறையாது. மேலும் மூலத்தில் மேற்கோள் காட்டப்பட்ட குறைந்தது ஒரு ஒப்பீட்டில், பாதுகாப்பு இல்லாத உலாவி-ஏஜென்ட் நிலையில் Sonnet 5, Opus 5-ஐ விட சிறப்பாக செயல்பட்டு, 3.7 சதவீதத்துக்கு எதிராக 0.93 சதவீத விகிதத்தை பதிவு செய்தது.

மற்றொரு வார்த்தையில், ஒரு மாடல் மட்டும் பிரச்சினையை முற்றிலும் நீக்கியது என்பதே மிகவும் பாதுகாப்பான முடிவு அல்ல. மாறாக, Anthropic இதற்கு முன் கிடைத்ததைவிட உலாவி ஏஜென்ட்களுக்கான வலுவான நடைமுறை பாதுகாப்பு தொகுப்பை அமைத்திருக்கலாம் என்பதே அதிக வாய்ப்புள்ள முடிவு.
ஏஜென்ட் போட்டிக்கு இது ஏன் முக்கியம்
ப்ராம்ப்ட் இன்ஜெக்ஷன் ஒரு சிறிய பாதுகாப்பு கவலை அல்ல. இது agentic AI-யின் மிக மதிப்புமிக்க வாக்குறுதியான, குறைந்த மேற்பார்வையுடன் ஆன்லைன் கருவிகள் மற்றும் தகவல் மூலங்களில் நகரும் அமைப்புகள் என்பதையே நேரடியாக பாதிக்கிறது. அந்த அமைப்புகள் மறைந்த உரை, கைப்பற்றப்பட்ட வழிமுறைகள், அல்லது எதிர்மறை வடிவமைப்பால் வழிமாற்றப்பட முடிந்தால், வாங்குதல், நிர்வாகம், குறியீட்டாக்கம், ஆய்வு, அல்லது வாடிக்கையாளர் செயல்பாடுகள் போன்ற நிஜ வேலைப்பாடுகளில் அவற்றை நம்புவது கடினமாகிறது.
அதனால்தான் தாக்க வெற்றி விகிதங்களில் ஏற்படும் சிறிய குறைப்பு கூட முக்கியம். வெற்றிகரமான கையாளுதல் குறைவாகும் சாத்தியம், நிறுவனங்கள் தானியங்காக்கத் தயாராக இருக்கும் பணிகளின் வரம்பை விரிவுபடுத்த முடியும். விற்பனையாளர்களுக்காக, இது ஒரு போட்டி வேறுபாடாகவும் மாறலாம், குறிப்பாக மாடல் திறன்கள் ஒன்றுக்கொன்று நெருக்கமாகும் போது, வாங்குபவர்கள் raw benchmark செயல்திறனை விட செயல்பாட்டு நம்பகத்தன்மையில் அதிக கவனம் செலுத்தத் தொடங்கும் போது.
இந்த பிரச்சினை OpenAI டிசம்பரில் ப்ராம்ப்ட் இன்ஜெக்ஷன் ஒருபோதும் முழுமையாகத் தீர்க்கப்படாமலும் இருக்கலாம் என்று ஒப்புக்கொண்ட அளவுக்கு தீவிரமாக இருந்தது. அந்த பார்வை பரந்த துறை கவலையை பிரதிபலிக்கிறது: மொழி மாடல்கள் இயற்கை மொழி உள்ளீடுகளை ஏற்றுக்கொண்டு அவற்றின் மீது செயல்பட வடிவமைக்கப்பட்டதால், சில வகையான வழிமுறை மோதல்களுக்கு அவை உள்ளார்ந்த முறையில் வெளிப்படையாக இருக்கலாம். பாதுகாப்பு பொறியியல் ஆபத்தை குறைக்கலாம், ஆனால் திறந்த-முடிவு சூழல்களில் முழுமையான எதிர்ப்பை உறுதிப்படுத்துவது கடினமாக இருக்கலாம்.
அடுத்து கவனிக்க வேண்டியது
அடுத்த கேள்வி Anthropic-ன் முடிவுகளை மீண்டும் உருவாக்க முடியுமா, அவற்றை பொதுப்படுத்த முடியுமா என்பதே. உள்நாட்டு system-card தரவு தகவலளிக்கக்கூடும், ஆனால் வெளிப்புற சரிபார்ப்பே பொதுவாக ஒரு பாதுகாப்பு முன்னேற்றக் கூற்று தொழில் நடைமுறையாக நம்பப்படுமா என்பதை தீர்மானிக்கிறது. 129 browser-agent நிலைகள் எவ்வாறு அமைக்கப்பட்டன, எந்த வகை தாக்குதல்கள் சேர்க்கப்பட்டன, அவை நிஜ உலக adversarial tactics-ஐ எவ்வளவு பிரதிநிதித்துவப்படுத்தின, மேலும் தாக்குநர்கள் தங்களைச் சரிசெய்துகொள்ளும்போது பாதுகாப்புகள் எப்படி நடக்கின்றன என்பதைக் குறித்து ஆராய்ச்சியாளர்கள் அறிய விரும்புவார்கள்.
மற்றொரு திறந்த பிரச்சினை பயன்பாடு. வலுவான AI பாதுகாப்பு அமைப்புகள் பெரும்பாலும் கூடுதல் இடையூறுகளை ஏற்படுத்துகின்றன; அது குழப்பமான செயல்களைத் தடுப்பதாலோ அல்லது ஒரு ஏஜென்ட் சுயமாக செய்யக்கூடியதை குறைப்பதாலோ இருக்கலாம். Auto Mode-ன் பாதுகாப்புகள் மிகச் செயல்திறனாக இருந்தாலும், சட்டபூர்வமான பணிகளில் அடிக்கடி இடையூறு செய்தால், நிறுவனங்கள் பாதுகாப்பு மற்றும் உற்பத்தித்திறன் இடையே சமநிலை காண வேண்டியிருக்கும். மூல உரையில் அந்த செயல்பாட்டு பின்னணி வழங்கப்படவில்லை; எனவே உடனடி எடுத்துக்கொள்ள வேண்டிய கருத்து, முழுமையான தயாரிப்பு செயல்திறன் அல்ல, தாக்க எதிர்ப்பு பற்றியே ஆகும்.
அப்படியிருந்தாலும், திசை தெளிவாக உள்ளது. பாதுகாப்பான ஏஜென்ட்களை உருவாக்கும் பாதை என்பது வெறும் புத்திசாலியான base model மட்டும் அல்ல, மாறாக எதிர்மறை உள்ளீட்டை வழக்கமான நிலையாகக் கருதும் அடுக்கமைப்பான architecture ஆகும் என Anthropic வாதிடுகிறது. இது முதிர்ந்த மென்பொருள் பாதுகாப்பு எவ்வாறு வளர்ந்தது என்பதுடன் ஒத்துப்போகிறது: ஒரே perfect barrier-ஐச் சுற்றி அல்ல, மாறாக compromise-ஐ படிப்படியாக கடினமாக்கும் பல சோதனைச் சாவடிகளைச் சுற்றி.
AI துறைக்குப் பார்ப்பதற்கு, இதுவே இங்குள்ள உண்மையான மைல்கல்லாக இருக்கக்கூடும். ப்ராம்ப்ட் இன்ஜெக்ஷன் முழுமையாக மறைந்துவிடவில்லை என்றாலும், மாடல் முன்னேற்றங்களும் நெருக்கமாக ஒருங்கிணைக்கப்பட்ட பாதுகாப்பு கருவிகளும் இணைந்து அதை ஒரு அடிப்படைத் தடையிலிருந்து மேலாண்மை செய்யக்கூடிய engineering பிரச்சினையாக மாற்றத் தொடங்கியிருக்கலாம்.
இந்த கட்டுரை The Decoder-இன் செய்தியளிப்பை அடிப்படையாகக் கொண்டது. மூல கட்டுரையைப் படிக்கவும்.
Originally published on the-decoder.com


