ఒక శక్తివంతమైన మోడల్ వెంటనే ఉపయోగయోగ్యత సమస్యతో వచ్చింది
Anthropic కొత్తగా విడుదల చేసిన Claude Fable 5ను కంపెనీ యొక్క అత్యంత సామర్థ్యవంతమైన public modelగా పరిచయం చేసింది, కానీ కొన్ని రోజుల్లోనే developers వేరే నిర్వచనాత్మక లక్షణాన్ని నివేదించడం ప్రారంభించారు: ఇది apparently benign promptsను తిరస్కరిస్తోంది లేదా వాటి నాణ్యతను తగ్గిస్తోంది. ఈ ఫిర్యాదులు frontier-modelలకు సంబంధించిన పునరావృత సమస్యను సూచిస్తున్నాయి. సామర్థ్యాలు మెరుగుపడుతున్నకొద్దీ, high-risk వినియోగాన్ని నియంత్రించడానికి నిర్మించిన safeguards సాధారణ పనిలో జోక్యం చేసుకునేంత intrusively మారవచ్చు.
మూలం ప్రకారం, Fable 5 అనేది Anthropic యొక్క Mythos family నుండి ఉద్భవించిన తొలి public model. ఈ lineage ముఖ్యమైనది, ఎందుకంటే training సమయంలో Mythos software bugsను కనుగొని, వాటిని systemsను అంతరాయం కలిగించడానికి లేదా నియంత్రించడానికి ఉపయోగించడంలో అసాధారణ నైపుణ్యాన్ని చూపిందని reported. అందుకే Anthropic cybersecurityను biology మరియు chemistryతో పాటు ఇతర high-risk domainsలో చేర్చింది, Mythos-derived public model ఏమి చేయగలదో నిర్ణయించేటప్పుడు.
Fable 5 కోసం, Anthropic పరిష్కారం ఆ ప్రాంతాల్లో sensitiveగా flagged అయిన promptsను Claude Opus 4.8కి route చేయడం, ఇది తక్కువ సామర్థ్యం ఉన్న కానీ తన own guardrails కలిగిన model. fallback సుమారు 0.05% queriesను ప్రభావితం చేస్తుందని, అది జరిగినప్పుడు usersకు తెలియజేస్తామని కంపెనీ చెబుతోంది. కాగితంపై అది తక్కువగా అనిపిస్తుంది. కానీ ఆచరణలో, user complaints system యొక్క అంచులు Anthropic ఉద్దేశించిన దానికంటే విస్తృతంగా ఉండవచ్చని సూచిస్తున్నాయి.
False positives కథగా ఎందుకు మారాయి
ప్రారంభ backlash స్పష్టమైన దుష్ట వినియోగం వల్ల కాక, legitimate tasksను అడ్డుకున్నట్లు వచ్చిన నివేదికల వల్ల వచ్చింది. మూలంలో sheep కోసం RNA sequencing data నుంచి resume editing మరియు shopping lists వరకు ఉదాహరణలు ఉన్నాయి. ఒక quoted user “cancer” అనే పదమే biosecurity riskగా flag అయిందని ఫిర్యాదు చేశారు. ప్రతి anecdote పూర్తిగా representative failure modeను చూపుతుందా లేదా అనేది పక్కన పెడితే, pattern స్పష్టంగా ఉంది: సాధారణ professional లేదా consumer queriesలో safety system జోక్యం చేస్తోందని users భావించారు.
Anthropic యొక్క సవాలు వివరించడం సులభం, పరిష్కరించడం కష్టం. కంపెనీ పూర్తిగా దాగి ఉన్న safeguards కాకుండా కనిపించే safeguardsను కోరింది, కానీ users వాటిని సులభంగా work around చేయలేనంత బలంగా కూడా అవి ఉండాలని కోరింది. ఒక visible classifier సాధారణంగా wider net వేయాల్సి వస్తుంది, ఎందుకంటే adversaries దాన్ని probe చేయగలరు. ఆ wider net, తిరిగి, మరిన్ని false positivesను సృష్టిస్తుంది. Anthropic వాస్తవానికి ముందు cautionను ఎంచుకుంది, developers అది వెంటనే గమనించారు.
classifiers రూపకల్పనలో కంపెనీ “caution వైపు తప్పింది” అని మూలం చెబుతోంది. ఆ పదబంధం ముఖ్యమైనది, ఎందుకంటే ఇది సమస్యను అనూహ్య bugగా కాకుండా tradeoffగా చూపిస్తుంది. stricter screening కొంతమంది legitimate usersకు అసౌకర్యం కలిగిస్తుందని Anthropicకు తెలిసి ఉండే అవకాశం ఉంది. ఆ సమతౌల్యం highly capable మరియు broadly useful modelగా నిలిచినదానికి ఆమోదయోగ్యమా అన్నదే చర్చ.
సేఫ్గార్డ్ నిర్మాణం ముఖ్యమైంది
సాధారణ refusal systemకు భిన్నంగా, Fable 5 యొక్క guardrail architectureలో model switching ఉంది. sensitiveగా పరిగణించిన promptsను Fable 5 తానే నిర్వహించకుండా Opus 4.8కి route చేస్తారు. ఇది ముఖ్యమైన design choice. అంటే Anthropic requestsను filter చేయడమే కాక, వాటిని ఏ model handle చేయాలో కూడా activeగా పరిమితం చేస్తోంది. సాంకేతిక, శాస్త్రీయ లేదా security-related domains అంచుల్లో పని చేసే usersకు, legitimate request అయినా ఇది capabilityలో ఒక silent downgradeగా అనిపించవచ్చు.
fallback జరిగితే usersకు తెలియజేస్తామని కంపెనీ చెబుతోంది, ఇది invisible substitution కంటే మంచిది. కానీ system ఇంకా సాధారణ పనిని అడ్డుకుంటే transparency frustrationను తొలగించదు. Developers సాధారణంగా safety boundaries స్పష్టంగా, సంకుచితంగా, మరియు ఊహించదగినవిగా ఉన్నప్పుడు వాటిని ఎక్కువగా సహిస్తారు. harmless tasks, చాలా భిన్నమైన risk profile కోసం రూపొందించిన rulesలో చిక్కుకున్నప్పుడు వారు వాటిని వ్యతిరేకిస్తారు.
ఇక్కడ Anthropic ఎందుకు ప్రత్యేకంగా జాగ్రత్తగా ఉంది
Mythos-derived systems cybersecurityలో అంతర్గత ఆందోళన కలిగించేంత బలంగా ఉన్నాయని భావించబడినదే Anthropic యొక్క conservative వైఖరికి కారణమని మూలం చెబుతోంది. దాంతో cyber riskను release policy పరంగా biology మరియు chemistryతో ఒకే bracketలో ఉంచారు. ఒక lab అలాంటి నిర్ణయం తీసుకున్నాక, public deployment engineering problem మాత్రమే కాక governance problem కూడా అవుతుంది.
Anthropic దృష్టిలో, ఆ domainsలో బలమైన constraints లేకుండా highly capable modelను విడుదల చేయడం బాధ్యతారహితంగా ఉండొచ్చు. వినియోగదారుల దృష్టిలో, benign workను పదేపదే dangerous activityగా తప్పుగా భావించే modelపై productionలో నమ్మకం పెట్టుకోవడం కష్టం. ఈ రెండు స్థానాలు పరస్పర విరుద్ధమైనవి కావు. అవి advanced AI productsను ఆకృతీకరిస్తున్న కేంద్ర tensionను ప్రతిబింబిస్తాయి: model మెరుగుపడినకొద్దీ దానిని restrict చేయాల్సిన ఒత్తిడి పెరుగుతుంది, అదే restrictions modelను మొదట విలువైనదిగా 만든 user experienceను కూడా ప్రమాదంలోకి నెడతాయి.
కంపెనీ వివరణ విస్తృత పరిశ్రమ సమస్యను సూచిస్తోంది
మూలం ఉటంకించిన ప్రకటనలో, hidden safeguardను probe చేయడం మరియు దాన్ని work around చేయడం కష్టం కావడంతో దాన్ని మరింత narrowly target చేయవచ్చని, visible safeguard robustగా ఉండాలంటే wider net వేయాల్సిందేనని Anthropic చెబుతోంది. ఈ వివరణ ఒక్క launch decisionకు రక్షణ కంటే, industry-wide dilemma యొక్క వివరణ. User trust మరియు accountability కోసం transparency సాధారణంగా మంచిది. కానీ transparency defensive systemsను adversarial testingకు సులభతరం చేస్తుంది. ఫలితం ఒక అసౌకర్యకరమైన సమన్వయం: overblock చేసే visible controls.
frontier models sensitive workflowsలో deploy అవుతున్న కొద్దీ ఈ tradeoff మరింత సాధారణం కావచ్చు. Developers నిజమైన technical complexityను నిర్వహించగల highly capable assistantsను కోరుకుంటున్నారు. Labs cyber, bio లేదా సంబంధిత ప్రాంతాల్లో riskను గణనీయంగా పెంచగల toolsను handing out చేయకుండా ఉండాలని చూస్తున్నాయి. Models expert performanceకు దగ్గరయ్యేకొద్దీ, safety failureకు అనుమతించదగిన margin మరింత సంకుచితమవుతుంది.
AI products తదుపరి దశ గురించి Fable 5 ఏమి వెల్లడిస్తోంది
Fable 5 launch సూచిస్తోంది कि తదుపరి competitive frontier కేవలం raw capability మాత్రమే కాదు. అది constraintsలో capability. ఒక model benchmark-adjacent termsలో అద్భుతంగా ఉండొచ్చు, కానీ దాని guardrails చాలా తరచుగా లేదా చాలా అప్రత్యక్షంగా trigger అయితే usersను నిరాశపరుస్తుంది. ఆ వాతావరణంలో product quality model ఏమి చేయగలదో మాత్రమే కాక, vendor risky intentను ordinary use నుంచి ఎంత సరిగ్గా వేరు చేయగలదో మీద ఆధారపడి ఉంటుంది.
Fable 5పై ప్రారంభ ప్రతిస్పందన Anthropic ఇంకా ఆ precisionను కనుగొనలేదని సూచిస్తోంది. fallback queriesలో చిన్న భాగానికే ప్రభావం చూపుతుందని కంపెనీ చెబుతున్నప్పటికీ, blocked prompts స్పష్టంగా harmlessగా అనిపించినప్పుడు reputational impact ఎంత పెద్దదైపోవచ్చో user reports చూపిస్తున్నాయి. Developers consistencyపై ఆధారపడతారు కాబట్టి ఈ విషయానికి ప్రత్యేకంగా సున్నితంగా ఉంటారు. పనిని unpredictably reroute చేసే లేదా context-critical termsను refuse చేసే system, serious workflowsలో integrate చేయడం త్వరగా కష్టమవుతుంది.
కఠినమైన భాగం ఇంకా ముందుంది
ఈ సమస్యపై పని చేస్తున్నామని Anthropic చెబుతోంది. అదే వాస్తవికమైన ముందడుగు. Mythos-derived model కోసం safeguardsను వదిలేయడం కంపెనీకి సాధ్యం కాదు, అలాగే users శాశ్వతంగా overbroad screening regimeను అంగీకరించే అవకాశమూ తక్కువ. కాబట్టి technical మరియు policy సవాలు classifiersను false positives తగ్గేంత వరకు narrow చేయడం, కానీ వాటిని evade చేయడం సులభం కాకుండా ఉంచడమే.
ఇది కేవలం patching exercise కాదు. frontier AI companies safety principlesను scaleలో కూడా usableగా ఉండే product behaviorగా మార్చగలవా అన్నదానికి ఇది పరీక్ష. Fable 5 ఇంకా అందుబాటులో ఉన్న బలమైన public modelsలో ఒకటిగా నిరూపితమయ్యే అవకాశం ఉంది. కానీ దాని launch model safety ఇక side issue కాదని కూడా చూపుతోంది. అది productలో భాగం, మరియు అది చాలా bluntగా ఉంటే, users దాన్ని product failureగా పరిగణిస్తారు.
ఈ వ్యాసం Fast Company నివేదిక ఆధారంగా ఉంది. మూల వ్యాసాన్ని చదవండి.
Originally published on fastcompany.com



