AI ஏஜென்ட்களுக்கான முக்கிய பாதுகாப்பு முன்னேற்றம் என Anthropic கூறுகிறது

AI ஏஜென்ட்களில் நீடித்துவரும் பாதுகாப்புச் சிக்கல்களில் ஒன்றான உலாவி-அடிப்படையிலான ப்ராம்ப்ட் இன்ஜெக்‌ஷனை எதிர்ப்பதில் தனது Opus 5 மாடல் குறிப்பிடத்தக்க முன்னேற்றம் செய்துள்ளதாக Anthropic கூறுகிறது. நிறுவனத்தின் system card-இல் மேற்கோள் காட்டப்பட்ட விவரங்களின்படி, Opus 5-ஐ நிறுவனத்தின் Auto Mode பாதுகாப்புகளுடன் பயன்படுத்தியபோது, 129 சோதனை நிலைகளில் எதிலும் உலாவி ஏஜென்ட்களுக்கு எதிரான ப்ராம்ப்ட் இன்ஜெக்‌ஷன் தாக்கங்கள் வெற்றி பெறவில்லை.

இந்த முடிவு பரந்த ஆய்விலும் நிலைத்திருந்தால், agentic AI-க்கு அது ஒரு முக்கியமான முன்னேற்றமாக இருக்கும். வலைப்பக்கங்களை உலாவும், ஆவணங்களைப் படிக்கும், அல்லது பயனரின் சார்பில் செயல்களைச் செய்யும் அமைப்புகளை பயன்படுத்துவதில் ப்ராம்ப்ட் இன்ஜெக்‌ஷன் ஒரு மையத் தடையாக மாறியுள்ளது. அடிப்படை சிக்கல் வெளிப்படையாக எளிதானது: தாக்குநர் ஒரு வலைப்பக்கம் அல்லது பிற உள்ளீட்டில் தீங்கிழைக்கும் வழிமுறைகளை மறைத்து வைக்கிறான், மேலும் மாடல் அது பின்பற்ற வேண்டிய உயர்நிலை விதிகளை விட அவற்றை பின்பற்றி விடுகிறது.

இந்த தோல்வி முறை நம்பகமான AI ஏஜென்ட்கள் பற்றிய எண்ணத்தை நீண்ட காலமாகத் துன்புறுத்தி வருகிறது, ஏனெனில் இந்த தாக்கம் பாரம்பரிய மென்பொருள் எல்லைகளை உடைப்பதில் சார்ந்திருக்காது. இது மொழி மாடல்கள் உரையை எவ்வாறு விளக்குகின்றன என்பதையே பயன்படுத்துகிறது. அதன் விளைவாக, கூடுதல் பாதுகாப்புகள் சுற்றி அமைக்கப்படாவிட்டால், மிக திறன்மிக்க மாடல்கள்கூட தீங்கிழைக்கும் அல்லது தவறாக வழிநடத்தும் உள்ளடக்கத்தால் பாதிக்கப்படலாம்.

Anthropic கூறுவதில் என்ன மாறியது

அறிவிக்கப்பட்ட பூஜ்ய சதவீத வெற்றி விகிதம் Opus 5 மாடலால் மட்டும் கிடைக்கவில்லை. Claude Cowork போன்ற Anthropic தயாரிப்புகளில் Auto Mode இயக்கப்பட்டபோது இந்த முடிவு பொருந்தியது. அந்த அமைப்பில், இரண்டு தனித்த பாதுகாப்பு அடுக்குகள் செயல்பட்டிருந்தன. ஒரு அடுக்கு, மாடல் உள்ளடக்கத்தை செயலாக்குவதற்கு முன் வரும் உள்ளடக்கத்தை மறைந்த அல்லது தீங்கிழைக்கும் வழிமுறைகள் இருக்கிறதா என்று ஸ்கேன் செய்கிறது. மற்றொரு அடுக்கு, ஆபத்தான செயல்களை செயல்படுத்துவதற்கு முன்பே தடுக்கிறது.

இந்த வேறுபாடு முக்கியமானது. Anthropic-ன் சொந்த கணக்குகள் காட்டுவது, அந்த கூடுதல் பாதுகாப்புகள் இல்லாமல் Opus 5 இன்னும் உலாவி-ஏஜென்ட் சூழலில் 3.7 சதவீத தாக்க வெற்றி விகிதத்தை காட்டியது என்பதாகும். எனவே அறிவிக்கப்பட்ட முன்னேற்றம், மாடல் மட்டத்தில் ப்ராம்ப்ட் இன்ஜெக்‌ஷன் முழுவதுமாக தீர்ந்துவிட்டது என்பதற்கான சான்றாக அல்ல, மாறாக ஒரு system-level மேம்பாடாகத் தோன்றுகிறது.

இந்த system பார்வை விரிவான துறைக்கு முக்கியமானது. AI ஏஜென்ட்களில் பாதுகாப்புப் பிரச்சினைகள் இப்போது மாடல் பிரச்சினைகளாக மட்டும் அல்ல, stack பிரச்சினைகளாகவும் கருதப்படுகின்றன. மாடல் மேம்படலாம், ஆனால் input filtering, policy enforcement, permissioning, மற்றும் action gating அனைத்தும் ஒரு தாக்குதல் உண்மையில் வெற்றி பெறுமா என்பதை தீர்மானிக்கின்றன.

Benchmark முடிவுகள் முன்னேற்றத்தை காட்டுகின்றன, ஆனால் இறுதி தீர்வை அல்ல

மூலத்தில் பாதுகாப்பு நிறுவனமான Gray Swan-இன் ப்ராம்ப்ட் இன்ஜெக்‌ஷன் benchmark முடிவுகளும் மேற்கோள் காட்டப்படுகின்றன. ஒரு பொது சோதனையில், 15 முயற்சிகளுக்குப் பிறகு தாக்குநர் வெற்றி விகிதம் Opus 4.8-இல் 5.5 சதவீதத்திலிருந்து Opus 5-இல் 2.0 சதவீதமாகக் குறைந்ததாக தெரிவிக்கப்படுகிறது. இதனால் ஒப்பிடப்பட்ட பிற மாடல்களில் பெயரிடப்பட்ட Mythos 5 (2.6 சதவீதம்) மற்றும் Fable 5 (2.8 சதவீதம்) ஆகியவற்றை விட Opus 5 முன்னிலையில் இருந்தது.

இந்த எண்ணிக்கைகள் உண்மையான முன்னேற்றத்தைக் காட்டுகின்றன, ஆனால் “தீர்க்கப்பட்டது” என்ற தலைப்பு-கோரிக்கையின் வரம்புகளையும் வெளிப்படுத்துகின்றன. Anthropic-ன் சொந்த விளக்கத்திலும் கூட, மிகத் தூய்மையான முடிவு பல பாதுகாப்புகள் இயக்கப்பட்ட ஒரு குறிப்பிட்ட தயாரிப்பு அமைப்பை சார்ந்துள்ளது. அவை இல்லாமல் தாக்க வெற்றி பூஜ்யமாக குறையாது. மேலும் மூலத்தில் மேற்கோள் காட்டப்பட்ட குறைந்தது ஒரு ஒப்பீட்டில், பாதுகாப்பு இல்லாத உலாவி-ஏஜென்ட் நிலையில் Sonnet 5, Opus 5-ஐ விட சிறப்பாக செயல்பட்டு, 3.7 சதவீதத்துக்கு எதிராக 0.93 சதவீத விகிதத்தை பதிவு செய்தது.

Opus 5 schneidet im Gray Swan IPI-Benchmark am besten ab: Nach 15 Versuchen liegt die Erfolgsrate für Angreifer bei 2,0 %, gefolgt von Mythos 5 (2,6 %) und Fable 5 (2,8 %). | Bild: Anthropic
Gray Swan IPI benchmark-இல் Opus 5 முன்னிலை வகிக்கிறது. 15 முயற்சிகளுக்குப் பிறகு, தாக்குநர் வெற்றி விகிதம் 2.0 சதவீதமாக உள்ளது; அதனைத் தொடர்ந்து Mythos 5 (2.6 சதவீதம்) மற்றும் Fable 5 (2.8 சதவீதம்) உள்ளன. | Image: Anthropic

மற்றொரு வார்த்தையில், ஒரு மாடல் மட்டும் பிரச்சினையை முற்றிலும் நீக்கியது என்பதே மிகவும் பாதுகாப்பான முடிவு அல்ல. மாறாக, Anthropic இதற்கு முன் கிடைத்ததைவிட உலாவி ஏஜென்ட்களுக்கான வலுவான நடைமுறை பாதுகாப்பு தொகுப்பை அமைத்திருக்கலாம் என்பதே அதிக வாய்ப்புள்ள முடிவு.

ஏஜென்ட் போட்டிக்கு இது ஏன் முக்கியம்

ப்ராம்ப்ட் இன்ஜெக்‌ஷன் ஒரு சிறிய பாதுகாப்பு கவலை அல்ல. இது agentic AI-யின் மிக மதிப்புமிக்க வாக்குறுதியான, குறைந்த மேற்பார்வையுடன் ஆன்லைன் கருவிகள் மற்றும் தகவல் மூலங்களில் நகரும் அமைப்புகள் என்பதையே நேரடியாக பாதிக்கிறது. அந்த அமைப்புகள் மறைந்த உரை, கைப்பற்றப்பட்ட வழிமுறைகள், அல்லது எதிர்மறை வடிவமைப்பால் வழிமாற்றப்பட முடிந்தால், வாங்குதல், நிர்வாகம், குறியீட்டாக்கம், ஆய்வு, அல்லது வாடிக்கையாளர் செயல்பாடுகள் போன்ற நிஜ வேலைப்பாடுகளில் அவற்றை நம்புவது கடினமாகிறது.

அதனால்தான் தாக்க வெற்றி விகிதங்களில் ஏற்படும் சிறிய குறைப்பு கூட முக்கியம். வெற்றிகரமான கையாளுதல் குறைவாகும் சாத்தியம், நிறுவனங்கள் தானியங்காக்கத் தயாராக இருக்கும் பணிகளின் வரம்பை விரிவுபடுத்த முடியும். விற்பனையாளர்களுக்காக, இது ஒரு போட்டி வேறுபாடாகவும் மாறலாம், குறிப்பாக மாடல் திறன்கள் ஒன்றுக்கொன்று நெருக்கமாகும் போது, வாங்குபவர்கள் raw benchmark செயல்திறனை விட செயல்பாட்டு நம்பகத்தன்மையில் அதிக கவனம் செலுத்தத் தொடங்கும் போது.

இந்த பிரச்சினை OpenAI டிசம்பரில் ப்ராம்ப்ட் இன்ஜெக்‌ஷன் ஒருபோதும் முழுமையாகத் தீர்க்கப்படாமலும் இருக்கலாம் என்று ஒப்புக்கொண்ட அளவுக்கு தீவிரமாக இருந்தது. அந்த பார்வை பரந்த துறை கவலையை பிரதிபலிக்கிறது: மொழி மாடல்கள் இயற்கை மொழி உள்ளீடுகளை ஏற்றுக்கொண்டு அவற்றின் மீது செயல்பட வடிவமைக்கப்பட்டதால், சில வகையான வழிமுறை மோதல்களுக்கு அவை உள்ளார்ந்த முறையில் வெளிப்படையாக இருக்கலாம். பாதுகாப்பு பொறியியல் ஆபத்தை குறைக்கலாம், ஆனால் திறந்த-முடிவு சூழல்களில் முழுமையான எதிர்ப்பை உறுதிப்படுத்துவது கடினமாக இருக்கலாம்.

அடுத்து கவனிக்க வேண்டியது

அடுத்த கேள்வி Anthropic-ன் முடிவுகளை மீண்டும் உருவாக்க முடியுமா, அவற்றை பொதுப்படுத்த முடியுமா என்பதே. உள்நாட்டு system-card தரவு தகவலளிக்கக்கூடும், ஆனால் வெளிப்புற சரிபார்ப்பே பொதுவாக ஒரு பாதுகாப்பு முன்னேற்றக் கூற்று தொழில் நடைமுறையாக நம்பப்படுமா என்பதை தீர்மானிக்கிறது. 129 browser-agent நிலைகள் எவ்வாறு அமைக்கப்பட்டன, எந்த வகை தாக்குதல்கள் சேர்க்கப்பட்டன, அவை நிஜ உலக adversarial tactics-ஐ எவ்வளவு பிரதிநிதித்துவப்படுத்தின, மேலும் தாக்குநர்கள் தங்களைச் சரிசெய்துகொள்ளும்போது பாதுகாப்புகள் எப்படி நடக்கின்றன என்பதைக் குறித்து ஆராய்ச்சியாளர்கள் அறிய விரும்புவார்கள்.

மற்றொரு திறந்த பிரச்சினை பயன்பாடு. வலுவான AI பாதுகாப்பு அமைப்புகள் பெரும்பாலும் கூடுதல் இடையூறுகளை ஏற்படுத்துகின்றன; அது குழப்பமான செயல்களைத் தடுப்பதாலோ அல்லது ஒரு ஏஜென்ட் சுயமாக செய்யக்கூடியதை குறைப்பதாலோ இருக்கலாம். Auto Mode-ன் பாதுகாப்புகள் மிகச் செயல்திறனாக இருந்தாலும், சட்டபூர்வமான பணிகளில் அடிக்கடி இடையூறு செய்தால், நிறுவனங்கள் பாதுகாப்பு மற்றும் உற்பத்தித்திறன் இடையே சமநிலை காண வேண்டியிருக்கும். மூல உரையில் அந்த செயல்பாட்டு பின்னணி வழங்கப்படவில்லை; எனவே உடனடி எடுத்துக்கொள்ள வேண்டிய கருத்து, முழுமையான தயாரிப்பு செயல்திறன் அல்ல, தாக்க எதிர்ப்பு பற்றியே ஆகும்.

அப்படியிருந்தாலும், திசை தெளிவாக உள்ளது. பாதுகாப்பான ஏஜென்ட்களை உருவாக்கும் பாதை என்பது வெறும் புத்திசாலியான base model மட்டும் அல்ல, மாறாக எதிர்மறை உள்ளீட்டை வழக்கமான நிலையாகக் கருதும் அடுக்கமைப்பான architecture ஆகும் என Anthropic வாதிடுகிறது. இது முதிர்ந்த மென்பொருள் பாதுகாப்பு எவ்வாறு வளர்ந்தது என்பதுடன் ஒத்துப்போகிறது: ஒரே perfect barrier-ஐச் சுற்றி அல்ல, மாறாக compromise-ஐ படிப்படியாக கடினமாக்கும் பல சோதனைச் சாவடிகளைச் சுற்றி.

AI துறைக்குப் பார்ப்பதற்கு, இதுவே இங்குள்ள உண்மையான மைல்கல்லாக இருக்கக்கூடும். ப்ராம்ப்ட் இன்ஜெக்‌ஷன் முழுமையாக மறைந்துவிடவில்லை என்றாலும், மாடல் முன்னேற்றங்களும் நெருக்கமாக ஒருங்கிணைக்கப்பட்ட பாதுகாப்பு கருவிகளும் இணைந்து அதை ஒரு அடிப்படைத் தடையிலிருந்து மேலாண்மை செய்யக்கூடிய engineering பிரச்சினையாக மாற்றத் தொடங்கியிருக்கலாம்.

இந்த கட்டுரை The Decoder-இன் செய்தியளிப்பை அடிப்படையாகக் கொண்டது. மூல கட்டுரையைப் படிக்கவும்.

Originally published on the-decoder.com