AI ఏజెంట్లకు పెద్ద రక్షణాత్మక పురోగతి వచ్చిందని Anthropic చెబుతోంది
AI ఏజెంట్లలో అత్యంత స్థిరంగా ఎదురయ్యే భద్రతా సమస్యలలో ఒకటైన బ్రౌజర్-ఆధారిత ప్రాంప్ట్ ఇంజెక్షన్ను ఎదుర్కొనే విషయంలో తన Opus 5 మోడల్ గణనీయమైన ముందడుగు వేసిందని Anthropic చెబుతోంది. కంపెనీ system card నుండి ఉదహరించిన వివరాల ప్రకారం, Opus 5 ను కంపెనీ Auto Mode రక్షణలతో ఉపయోగించినప్పుడు బ్రౌజర్ ఏజెంట్లపై చేసిన ప్రాంప్ట్ ఇంజెక్షన్ దాడులు 129 పరీక్ష సందర్భాల్లో ఏదీ విజయవంతం కాలేదు.
ఈ ఫలితం విస్తృత పరిశీలనలో కూడా నిలబడితే, అది agentic AIకి ముఖ్యమైన అభివృద్ధి అవుతుంది. వెబ్ను బ్రౌజ్ చేసే, పత్రాలను చదివే, లేదా వినియోగదారి తరఫున చర్యలు తీసుకునే వ్యవస్థలను అమలు చేయడంలో ప్రాంప్ట్ ఇంజెక్షన్ ప్రధాన అడ్డంకిగా మారింది. ప్రాథమిక సమస్య చాలా సులభంగా కనిపిస్తుంది: దాడి చేసే వ్యక్తి ఒక వెబ్పేజీ లేదా ఇతర input లో దుష్ట సూచనలను దాచిపెడతాడు, మరియు మోడల్ వాటిని అది పాటించాల్సిన అధిక-ప్రాధాన్య నియమాల కంటే అనుసరిస్తుంది.
ఈ failure mode నమ్మదగిన AI ఏజెంట్ల ఆలోచనను చాలా కాలంగా వెంటాడుతోంది, ఎందుకంటే ఈ దాడి సంప్రదాయ software boundaries ను చెరిపివేయడంపై ఆధారపడదు. ఇది language models వచనాన్ని ఎలా అర్థం చేసుకుంటాయో దానిని దుర్వినియోగం చేస్తుంది. ఫలితంగా, అదనపు safeguards లేకుండా అగ్రశ్రేణి సామర్థ్యం ఉన్న మోడళ్లు కూడా శత్రుత్వపూరిత లేదా తప్పుదారి పట్టించే కంటెంట్ ద్వారా ప్రభావితమవుతాయి.
Anthropic ప్రకారం ఏమి మారింది
నివేదించిన శూన్య శాతం విజయ రేటు Opus 5 మోడల్ నుంచే రాలేదు. Claude Cowork వంటి Anthropic ఉత్పత్తుల్లో Auto Mode ఆన్ చేసినప్పుడు ఈ ఫలితం వర్తించింది. ఆ సెటప్లో రెండు వేర్వేరు రక్షణ పొరలు క్రియాశీలంగా ఉన్నాయి. ఒక పొర, మోడల్ ఆ కంటెంట్ను ప్రాసెస్ చేసే ముందు వచ్చే కంటెంట్లో దాగి ఉన్న లేదా దుష్ట సూచనల కోసం స్కాన్ చేస్తుంది. రెండోది ప్రమాదకర చర్యలు అమలు కాకముందే అడ్డుకుంటుంది.
ఆ తేడా ముఖ్యమైనది. Anthropic యొక్క స్వంత గణాంకాలు చూపిస్తున్నదేమిటంటే, ఆ అదనపు రక్షణలు లేకుండా Opus 5 ఇంకా browser-agent సెట్టింగ్లో 3.7 శాతం దాడి విజయ రేటును చూపింది. అందువల్ల నివేదించిన breakthrough, model layer లో ప్రాంప్ట్ ఇంజెక్షన్ పూర్తిగా పరిష్కారమైందన్న సాక్ష్యం కాకుండా, system-level మెరుగుదలగా కనిపిస్తోంది.
ఈ system framing విస్తృత పరిశ్రమకు ముఖ్యమైనది. AI ఏజెంట్లలో భద్రతా సమస్యలను increasingly stack problems గా చూస్తున్నారు, కేవలం model problems గా కాదు. మోడల్ మెరుగుపడవచ్చు, కానీ input filtering, policy enforcement, permissioning, మరియు action gating అన్నీ దాడి నిజంగా పనిచేస్తుందా లేదా అన్నదాన్ని ప్రభావితం చేస్తాయి.
Benchmark ఫలితాలు పురోగతిని సూచిస్తున్నాయి, కానీ తుది పరిష్కారం కాదు
మూలం Gray Swan అనే security firm యొక్క ప్రాంప్ట్ ఇంజెక్షన్ benchmark నుండి వచ్చిన ఫలితాలను కూడా పేర్కొంటుంది. సాధారణ పరీక్షలో, 15 ప్రయత్నాల తర్వాత attacker success rate Opus 4.8 తో 5.5 శాతం నుంచి Opus 5 తో 2.0 శాతానికి తగ్గిందని నివేదించబడింది. దీంతో పోలికలో పేర్కొన్న ఇతర మోడళ్లైన Mythos 5 (2.6 శాతం) మరియు Fable 5 (2.8 శాతం) కంటే Opus 5 ముందంజలో నిలిచింది.
ఆ సంఖ్యలు నిజమైన మెరుగుదలను సూచిస్తున్నాయి, కానీ ప్రాంప్ట్ ఇంజెక్షన్ “పరిష్కరించబడింది” అనే headline claim పరిమితులను కూడా స్పష్టం చేస్తాయి. Anthropic యొక్క స్వంత ప్రదర్శనలో కూడా, అత్యంత శుభ్రమైన ఫలితం అనేక రక్షణలు ఆన్ చేసిన నిర్దిష్ట product configuration మీద ఆధారపడి ఉంటుంది. అవి లేకుండా attack success zero కి పడిపోదు. అలాగే మూలంలో పేర్కొన్న కనీసం ఒక పోలికలో, unprotected browser-agent పరిస్థితిలో Sonnet 5, Opus 5 కంటే మెరుగ్గా పనిచేసి, 3.7 శాతానికి مقابل 0.93 శాతం రేటు సాధించింది.

ఇంకొక మాటలో చెప్పాలంటే, ఒకే మోడల్ సమస్యను పూర్తిగా తొలగించిందన్నది అత్యంత రక్షణాత్మకమైన నిర్ధారణ కాదు. మరింత బలమైన practical defense package ను Anthropic browser agents కోసం గతంలో అందుబాటులో ఉన్న దానికంటే మెరుగ్గా సమీకరించిందన్నదే మరింత సరైన నిర్ణయం.
ఏజెంట్ పోరులో ఇది ఎందుకు కీలకం
ప్రాంప్ట్ ఇంజెక్షన్ చిన్న భద్రతా సమస్య కాదు. ఇది agentic AI యొక్క అత్యంత వాణిజ్యపరంగా విలువైన వాగ్దానాన్ని నేరుగా తాకుతుంది: పరిమిత పర్యవేక్షణతో online tools మరియు information sources లో కదలగల వ్యవస్థలు. ఆ వ్యవస్థలు hidden text, compromised instructions, లేదా adversarial formatting ద్వారా మళ్లించబడగలిగితే, purchasing, administration, coding, research, లేదా customer operations వంటి నిజ జీవిత workflows లో వాటిని నమ్మడం కష్టమవుతుంది.
అందుకే attack success rates లోని చిన్న తగ్గుదల కూడా ముఖ్యం. విజయవంతమైన manipulation probability తగ్గితే, కంపెనీలు ఆటోమేట్ చేయడానికి సిద్ధంగా ఉండే పనుల పరిధి విస్తరించవచ్చు. vendors కు కూడా ఇది ఒక competitive differentiator గా మారొచ్చు, ముఖ్యంగా model capabilities దగ్గరవుతున్నప్పుడు మరియు కొనుగోలుదారులు raw benchmark performance కంటే operational reliability పై ఎక్కువ దృష్టి పెట్టడం ప్రారంభించినప్పుడు.
ఈ సమస్య అంత తీవ్రంగా ఉంది కాబట్టి OpenAI డిసెంబరులో ప్రాంప్ట్ ఇంజెక్షన్ పూర్తిగా ఎప్పటికీ పరిష్కారమవకపోవచ్చని అంగీకరించింది. ఈ అభిప్రాయం విస్తృత పరిశ్రమ ఆందోళనను ప్రతిబింబిస్తుంది: language models natural-language inputs ను గ్రహించి వాటిపై చర్య తీసుకునేందుకు రూపొందించబడినందున, అవి కొన్ని రకాల instruction conflict కి సహజంగానే గురి కావచ్చు. Defensive engineering ప్రమాదాన్ని తగ్గించగలదు, కానీ open-ended environments అంతటా పూర్తి immunity ని హామీ ఇవ్వడం కష్టం కావచ్చు.
తరువాత ఏమి గమనించాలి
తదుపరి ప్రశ్న Anthropic ఫలితాలను తిరిగి పొందగలమా, సాధారణీకరించగలమా అన్నదే. Internal system-card data ఉపయోగకరంగా ఉండొచ్చు, కానీ external validation సాధారణంగా ఒక claimed security step పరిశ్రమలో నమ్మదగిన practice గా మారుతుందా లేదా అన్నదాన్ని నిర్ణయిస్తుంది. 129 browser-agent scenarios ఎలా నిర్మించబడ్డాయి, ఎలాంటి attacks చేర్చబడ్డాయి, అవి real-world adversarial tactics ను ఎంతవరకు ప్రతినిధ్యం వహించాయి, మరియు attackers అనుకూలించుకున్నప్పుడు protections ఎలా ప్రవర్తిస్తాయి అన్నది పరిశోధకులు తెలుసుకోవాలనుకుంటారు.
మరో ఓపెన్ issue usability. బలమైన AI security systems తరచుగా friction ను పెంచుతాయి, είτε ambiguous actions ను block చేయడం ద్వారా లేదా ఒక agent ఏమి autonomously చేయగలదో పరిమితం చేయడం ద్వారా. Auto Mode protections అత్యంత ప్రభావవంతంగా ఉన్నా, legitimate tasks లో తరచూ ఆటంకం కలిగిస్తే, enterprises safety మరియు productivity మధ్య సమతుల్యం చేయాల్సి రావచ్చు. మూల text ఆ operational context ను ఇవ్వలేదు, కాబట్టి తక్షణ takeaway attack resistance వరకే పరిమితం, పూర్తి product performance వరకూ కాదు.
అయినా, దిశ స్పష్టంగా ఉంది. సురక్షిత agents కు మార్గం కేవలం smarter base model మాత్రమే కాదు, hostile input ను సాధారణ పరిస్థితిగా పరిగణించే layered architecture కూడా అని Anthropic వాదిస్తోంది. ఇది mature software security ఎలా అభివృద్ధి చెందిందో దానితో సరిపోతుంది: ఒక perfect barrier చుట్టూ కాదు, compromise ను క్రమంగా మరింత కష్టతరం చేసే బహుళ checkpoints చుట్టూ.
AI పరిశ్రమకు, ఇదే అసలు మైలురాయి కావచ్చు. ప్రాంప్ట్ ఇంజెక్షన్ పూర్తిగా పోకపోయినా, model improvements మరియు tightly integrated defensive tooling కలయిక దానిని ఒక fundamental blocker నుంచి మరింత నిర్వహించదగిన engineering problem గా మార్చివుండవచ్చు.
ఈ వ్యాసం The Decoder యొక్క నివేదికలపై ఆధారపడి ఉంది. మూల వ్యాసాన్ని చదవండి.
Originally published on the-decoder.com


