ఒక శక్తివంతమైన మోడల్ వెంటనే ఉపయోగయోగ్యత సమస్యతో వచ్చింది

Anthropic కొత్తగా విడుదల చేసిన Claude Fable 5ను కంపెనీ యొక్క అత్యంత సామర్థ్యవంతమైన public model‌గా పరిచయం చేసింది, కానీ కొన్ని రోజుల్లోనే developers వేరే నిర్వచనాత్మక లక్షణాన్ని నివేదించడం ప్రారంభించారు: ఇది apparently benign prompts‌ను తిరస్కరిస్తోంది లేదా వాటి నాణ్యతను తగ్గిస్తోంది. ఈ ఫిర్యాదులు frontier-modelలకు సంబంధించిన పునరావృత సమస్యను సూచిస్తున్నాయి. సామర్థ్యాలు మెరుగుపడుతున్నకొద్దీ, high-risk వినియోగాన్ని నియంత్రించడానికి నిర్మించిన safeguards సాధారణ పనిలో జోక్యం చేసుకునేంత intrusively మారవచ్చు.

మూలం ప్రకారం, Fable 5 అనేది Anthropic యొక్క Mythos family నుండి ఉద్భవించిన తొలి public model. ఈ lineage ముఖ్యమైనది, ఎందుకంటే training సమయంలో Mythos software bugs‌ను కనుగొని, వాటిని systems‌ను అంతరాయం కలిగించడానికి లేదా నియంత్రించడానికి ఉపయోగించడంలో అసాధారణ నైపుణ్యాన్ని చూపిందని reported. అందుకే Anthropic cybersecurity‌ను biology మరియు chemistryతో పాటు ఇతర high-risk domainsలో చేర్చింది, Mythos-derived public model ఏమి చేయగలదో నిర్ణయించేటప్పుడు.

Fable 5 కోసం, Anthropic పరిష్కారం ఆ ప్రాంతాల్లో sensitive‌గా flagged అయిన prompts‌ను Claude Opus 4.8కి route చేయడం, ఇది తక్కువ సామర్థ్యం ఉన్న కానీ తన own guardrails కలిగిన model. fallback సుమారు 0.05% queries‌ను ప్రభావితం చేస్తుందని, అది జరిగినప్పుడు users‌కు తెలియజేస్తామని కంపెనీ చెబుతోంది. కాగితంపై అది తక్కువగా అనిపిస్తుంది. కానీ ఆచరణలో, user complaints system యొక్క అంచులు Anthropic ఉద్దేశించిన దానికంటే విస్తృతంగా ఉండవచ్చని సూచిస్తున్నాయి.

False positives కథగా ఎందుకు మారాయి

ప్రారంభ backlash స్పష్టమైన దుష్ట వినియోగం వల్ల కాక, legitimate tasks‌ను అడ్డుకున్నట్లు వచ్చిన నివేదికల వల్ల వచ్చింది. మూలంలో sheep కోసం RNA sequencing data నుంచి resume editing మరియు shopping lists వరకు ఉదాహరణలు ఉన్నాయి. ఒక quoted user “cancer” అనే పదమే biosecurity risk‌గా flag అయిందని ఫిర్యాదు చేశారు. ప్రతి anecdote పూర్తిగా representative failure mode‌ను చూపుతుందా లేదా అనేది పక్కన పెడితే, pattern స్పష్టంగా ఉంది: సాధారణ professional లేదా consumer queries‌లో safety system జోక్యం చేస్తోందని users భావించారు.

Anthropic యొక్క సవాలు వివరించడం సులభం, పరిష్కరించడం కష్టం. కంపెనీ పూర్తిగా దాగి ఉన్న safeguards కాకుండా కనిపించే safeguards‌ను కోరింది, కానీ users వాటిని సులభంగా work around చేయలేనంత బలంగా కూడా అవి ఉండాలని కోరింది. ఒక visible classifier సాధారణంగా wider net వేయాల్సి వస్తుంది, ఎందుకంటే adversaries దాన్ని probe చేయగలరు. ఆ wider net, తిరిగి, మరిన్ని false positives‌ను సృష్టిస్తుంది. Anthropic వాస్తవానికి ముందు caution‌ను ఎంచుకుంది, developers అది వెంటనే గమనించారు.

classifiers రూపకల్పనలో కంపెనీ “caution వైపు తప్పింది” అని మూలం చెబుతోంది. ఆ పదబంధం ముఖ్యమైనది, ఎందుకంటే ఇది సమస్యను అనూహ్య bug‌గా కాకుండా tradeoff‌గా చూపిస్తుంది. stricter screening కొంతమంది legitimate users‌కు అసౌకర్యం కలిగిస్తుందని Anthropic‌కు తెలిసి ఉండే అవకాశం ఉంది. ఆ సమతౌల్యం highly capable మరియు broadly useful model‌గా నిలిచినదానికి ఆమోదయోగ్యమా అన్నదే చర్చ.

సేఫ్‌గార్డ్ నిర్మాణం ముఖ్యమైంది

సాధారణ refusal system‌కు భిన్నంగా, Fable 5 యొక్క guardrail architectureలో model switching ఉంది. sensitive‌గా పరిగణించిన prompts‌ను Fable 5 తానే నిర్వహించకుండా Opus 4.8కి route చేస్తారు. ఇది ముఖ్యమైన design choice. అంటే Anthropic requests‌ను filter చేయడమే కాక, వాటిని ఏ model handle చేయాలో కూడా active‌గా పరిమితం చేస్తోంది. సాంకేతిక, శాస్త్రీయ లేదా security-related domains అంచుల్లో పని చేసే users‌కు, legitimate request అయినా ఇది capabilityలో ఒక silent downgrade‌గా అనిపించవచ్చు.

fallback జరిగితే users‌కు తెలియజేస్తామని కంపెనీ చెబుతోంది, ఇది invisible substitution కంటే మంచిది. కానీ system ఇంకా సాధారణ పనిని అడ్డుకుంటే transparency frustration‌ను తొలగించదు. Developers సాధారణంగా safety boundaries స్పష్టంగా, సంకుచితంగా, మరియు ఊహించదగినవిగా ఉన్నప్పుడు వాటిని ఎక్కువగా సహిస్తారు. harmless tasks, చాలా భిన్నమైన risk profile కోసం రూపొందించిన rules‌లో చిక్కుకున్నప్పుడు వారు వాటిని వ్యతిరేకిస్తారు.

ఇక్కడ Anthropic ఎందుకు ప్రత్యేకంగా జాగ్రత్తగా ఉంది

Mythos-derived systems cybersecurity‌లో అంతర్గత ఆందోళన కలిగించేంత బలంగా ఉన్నాయని భావించబడినదే Anthropic యొక్క conservative వైఖరికి కారణమని మూలం చెబుతోంది. దాంతో cyber risk‌ను release policy పరంగా biology మరియు chemistryతో ఒకే bracket‌లో ఉంచారు. ఒక lab అలాంటి నిర్ణయం తీసుకున్నాక, public deployment engineering problem మాత్రమే కాక governance problem కూడా అవుతుంది.

Anthropic దృష్టిలో, ఆ domains‌లో బలమైన constraints లేకుండా highly capable model‌ను విడుదల చేయడం బాధ్యతారహితంగా ఉండొచ్చు. వినియోగదారుల దృష్టిలో, benign work‌ను పదేపదే dangerous activityగా తప్పుగా భావించే model‌పై production‌లో నమ్మకం పెట్టుకోవడం కష్టం. ఈ రెండు స్థానాలు పరస్పర విరుద్ధమైనవి కావు. అవి advanced AI products‌ను ఆకృతీకరిస్తున్న కేంద్ర tension‌ను ప్రతిబింబిస్తాయి: model మెరుగుపడినకొద్దీ దానిని restrict చేయాల్సిన ఒత్తిడి పెరుగుతుంది, అదే restrictions model‌ను మొదట విలువైనదిగా 만든 user experience‌ను కూడా ప్రమాదంలోకి నెడతాయి.

కంపెనీ వివరణ విస్తృత పరిశ్రమ సమస్యను సూచిస్తోంది

మూలం ఉటంకించిన ప్రకటనలో, hidden safeguard‌ను probe చేయడం మరియు దాన్ని work around చేయడం కష్టం కావడంతో దాన్ని మరింత narrowly target చేయవచ్చని, visible safeguard robust‌గా ఉండాలంటే wider net వేయాల్సిందేనని Anthropic చెబుతోంది. ఈ వివరణ ఒక్క launch decision‌కు రక్షణ కంటే, industry-wide dilemma యొక్క వివరణ. User trust మరియు accountability కోసం transparency సాధారణంగా మంచిది. కానీ transparency defensive systems‌ను adversarial testing‌కు సులభతరం చేస్తుంది. ఫలితం ఒక అసౌకర్యకరమైన సమన్వయం: overblock చేసే visible controls.

frontier models sensitive workflows‌లో deploy అవుతున్న కొద్దీ ఈ tradeoff మరింత సాధారణం కావచ్చు. Developers నిజమైన technical complexityను నిర్వహించగల highly capable assistants‌ను కోరుకుంటున్నారు. Labs cyber, bio లేదా సంబంధిత ప్రాంతాల్లో risk‌ను గణనీయంగా పెంచగల tools‌ను handing out చేయకుండా ఉండాలని చూస్తున్నాయి. Models expert performance‌కు దగ్గరయ్యేకొద్దీ, safety failure‌కు అనుమతించదగిన margin మరింత సంకుచితమవుతుంది.

AI products తదుపరి దశ గురించి Fable 5 ఏమి వెల్లడిస్తోంది

Fable 5 launch సూచిస్తోంది कि తదుపరి competitive frontier కేవలం raw capability మాత్రమే కాదు. అది constraintsలో capability. ఒక model benchmark-adjacent termsలో అద్భుతంగా ఉండొచ్చు, కానీ దాని guardrails చాలా తరచుగా లేదా చాలా అప్రత్యక్షంగా trigger అయితే users‌ను నిరాశపరుస్తుంది. ఆ వాతావరణంలో product quality model ఏమి చేయగలదో మాత్రమే కాక, vendor risky intent‌ను ordinary use నుంచి ఎంత సరిగ్గా వేరు చేయగలదో మీద ఆధారపడి ఉంటుంది.

Fable 5పై ప్రారంభ ప్రతిస్పందన Anthropic ఇంకా ఆ precision‌ను కనుగొనలేదని సూచిస్తోంది. fallback queriesలో చిన్న భాగానికే ప్రభావం చూపుతుందని కంపెనీ చెబుతున్నప్పటికీ, blocked prompts స్పష్టంగా harmlessగా అనిపించినప్పుడు reputational impact ఎంత పెద్దదైపోవచ్చో user reports చూపిస్తున్నాయి. Developers consistency‌పై ఆధారపడతారు కాబట్టి ఈ విషయానికి ప్రత్యేకంగా సున్నితంగా ఉంటారు. పనిని unpredictably reroute చేసే లేదా context-critical terms‌ను refuse చేసే system, serious workflows‌లో integrate చేయడం త్వరగా కష్టమవుతుంది.

కఠినమైన భాగం ఇంకా ముందుంది

ఈ సమస్యపై పని చేస్తున్నామని Anthropic చెబుతోంది. అదే వాస్తవికమైన ముందడుగు. Mythos-derived model కోసం safeguards‌ను వదిలేయడం కంపెనీకి సాధ్యం కాదు, అలాగే users శాశ్వతంగా overbroad screening regime‌ను అంగీకరించే అవకాశమూ తక్కువ. కాబట్టి technical మరియు policy సవాలు classifiers‌ను false positives తగ్గేంత వరకు narrow చేయడం, కానీ వాటిని evade చేయడం సులభం కాకుండా ఉంచడమే.

ఇది కేవలం patching exercise కాదు. frontier AI companies safety principles‌ను scale‌లో కూడా usable‌గా ఉండే product behavior‌గా మార్చగలవా అన్నదానికి ఇది పరీక్ష. Fable 5 ఇంకా అందుబాటులో ఉన్న బలమైన public modelsలో ఒకటిగా నిరూపితమయ్యే అవకాశం ఉంది. కానీ దాని launch model safety ఇక side issue కాదని కూడా చూపుతోంది. అది product‌లో భాగం, మరియు అది చాలా blunt‌గా ఉంటే, users దాన్ని product failureగా పరిగణిస్తారు.

ఈ వ్యాసం Fast Company నివేదిక ఆధారంగా ఉంది. మూల వ్యాసాన్ని చదవండి.

Originally published on fastcompany.com