ஒரு சக்திவாய்ந்த மாதிரி உடனடி பயன்பாட்டு சிக்கலுடன் வந்தது

Anthropic புதிதாக வெளியிட்ட Claude Fable 5, நிறுவனத்தின் மிகத் திறமையான public model என்று அறிமுகப்படுத்தப்பட்டது; ஆனால் சில நாட்களுக்குள் developers வேறொரு முக்கிய அம்சத்தைப் பற்றி புகாரளிக்கத் தொடங்கினர்: அது apparently benign prompts-ஐ நிராகரித்தது அல்லது அதன் தரத்தைக் குறைத்தது. இந்த புகார்கள் frontier-model-களில் மீண்டும் மீண்டும் தோன்றும் ஒரு பிரச்சினையை சுட்டிக்காட்டுகின்றன. திறன்கள் மேம்படும் போது, உயர்-ஆபத்து பயன்பாட்டை கட்டுப்படுத்த உருவாக்கப்பட்ட safeguards, சாதாரண பணிகளில் தலையிடும் அளவிற்கு intrusively ஆகிவிடலாம்.

மூலத்தின் படி, Fable 5 என்பது Anthropic-இன் Mythos குடும்பத்திலிருந்து உருவான முதல் public model. இந்த lineage முக்கியமானது, ஏனெனில் Mythos training போது software bugs-ஐ கண்டறிந்து, அவற்றை systems-ஐ பாதிக்க அல்லது கட்டுப்பாட்டில் எடுக்க பயன்படுத்துவதில் அசாதாரண திறனை காட்டியதாகக் கூறப்படுகிறது. அதனால் Anthropic, cybersecurity-ஐ biology மற்றும் chemistry உட்பட பிற உயர்-ஆபத்து துறைகளுடன் சேர்த்து, Mythos-derived public model என்ன செய்ய அனுமதிக்கப்பட வேண்டும் என்பதை நிர்ணயித்தது.

Fable 5-க்கு, Anthropic-இன் தீர்வு அந்தப் பகுதிகளில் sensitive என அடையாளம் காணப்பட்ட prompts-ஐ Claude Opus 4.8-க்கு route செய்வதாகும்; இது குறைந்த திறன் கொண்ட, தன் சொந்த guardrails உடைய model. இந்த fallback சுமார் 0.05% queries-ஐ பாதிக்கும் என்றும், அது நடந்தால் users-க்கு அறிவிக்கப்படும் என்றும் நிறுவனம் கூறுகிறது. காகிதத்தில் இது குறுகலாகத் தெரிகிறது. நடைமுறையில், user புகார்கள் system-இன் எல்லைகள் Anthropic நினைத்ததைவிட பரந்திருக்கலாம் என்பதைச் சுட்டிக்காட்டுகின்றன.

False positives ஏன் கதையாக மாறின

ஆரம்ப எதிர்வினை வெளிப்படையான தீய பயன்பாட்டினால் அல்ல, மாறாக legitimate tasks தடுக்கப்பட்டதாக வந்த புகார்களால் இயக்கப்பட்டது. மூலத்தில் sheep-க்கான RNA sequencing data முதல் resume editing மற்றும் shopping lists வரை எடுத்துக்காட்டுகள் பட்டியலிடப்பட்டுள்ளன. ஒரு quoted user, “cancer” என்ற சொல்லே biosecurity risk என்று flag செய்யப்பட்டதாகக் கூறினார். ஒவ்வொரு anecdote-ம் முழுமையாக representative failure mode-ஐ காட்டுகிறதா இல்லையா என்பது வேறு விஷயம்; ஆனால் pattern தெளிவானது: safety system வழக்கமான தொழில்முறை அல்லது consumer queries-இல் தலையிடுகிறது என்று users உணர்ந்தனர்.

Anthropic-இன் சவாலைக் கூறுவது எளிது, தீர்ப்பது கடினம். நிறுவனம் முற்றிலும் மறைக்கப்பட்ட safeguards அல்ல, காணக்கூடிய safeguards-ஐ விரும்பியது; அதே நேரத்தில், users அவற்றை எளிதில் bypass செய்ய முடியாத அளவுக்கு வலுவானவையாகவும் அவை இருக்க வேண்டும் என்று விரும்பியது. ஒரு visible classifier பொதுவாக wider net-ஐ வீச வேண்டும், ஏனெனில் adversaries அதைக் probe செய்ய முடியும். ஆனால் அந்த wider net, மேலும் பல false positives-ஐ உருவாக்குகிறது. Anthropic நடைமுறையில் caution-ஐ முதலில் தேர்ந்தெடுத்தது, developers அதை உடனே கவனித்தனர்.

classifiers வடிவமைக்கும்போது நிறுவனம் “caution-இன் பக்கம் சாய்ந்தது” என்று மூலத்தில் கூறப்பட்டுள்ளது. இந்தச் சொற்றொடர் முக்கியமானது, ஏனெனில் இது பிரச்சினையை எதிர்பாராத bug ஆக அல்ல, ஒரு tradeoff ஆக வடிவமைக்கிறது. கடுமையான screening சில legitimate users-க்கு தொந்தரவை ஏற்படுத்தும் என்பதை Anthropic அறிந்திருக்க வாய்ப்புள்ளது. அந்த சமநிலை, மிகத் திறமையான மற்றும் பரவலாக பயனுள்ள model என நிலைநிறுத்தப்பட்ட ஒன்றுக்கு ஏற்றதா என்பதே விவாதம்.

Safeguard-இன் அமைப்பு முக்கியமானது

ஒரு எளிய refusal system-இற்கு மாறாக, Fable 5-இன் guardrail architecture-ல் model switching உள்ளது. Sensitive என கருதப்படும் prompts Fable 5-ஆல் நேரடியாகக் கையாளப்படுவதற்குப் பதிலாக Opus 4.8-க்கு route செய்யப்படுகின்றன. இது முக்கியமான design choice. இதனால் Anthropic requests-ஐ filter செய்வதோடு மட்டுமல்லாமல், அவற்றை எந்த model கையாள வேண்டும் என்பதையும் செயலில் கட்டுப்படுத்துகிறது. தொழில்நுட்ப, அறிவியல் அல்லது security-related துறைகளின் எல்லையில் பணிபுரியும் users-க்கு, legitimate request இருந்தாலும் இது திறனில் அமைதியான downgrade போல இருக்கலாம்.

fallback நடந்தால் users-க்கு அறிவிக்கப்படும் என நிறுவனம் கூறுகிறது; இது invisible substitution-ஐவிட சிறந்தது. ஆனால் system இன்னும் சாதாரண பணியைத் தடுக்கிறதானால், transparency frustration-ஐ நீக்காது. Developers safety boundaries தெளிவாக, குறுகலாக, மற்றும் முன்னறிவிக்கக்கூடியவையாக இருக்கும் போது அவற்றை அதிகம் சகிக்கிறார்கள். harmless tasks, முற்றிலும் வேறொரு risk profile-க்காக உருவாக்கப்பட்ட rules-இல் சிக்கும்போது அவர்கள் அவற்றை எதிர்க்கிறார்கள்.

Anthropic ஏன் இங்கு குறிப்பாக எச்சரிக்கையாக உள்ளது

Mythos-derived systems cybersecurity-யில் உள்ளக கவலை ஏற்படும் அளவிற்கு வலுவானவை என்று கருதப்பட்டதே Anthropic-இன் conservative அணுகுமுறையின் அடிப்படை காரணம் என்று source வழங்குகிறது. அதனால் cyber risk, release policy-க்கான நோக்கில் biology மற்றும் chemistry உடன் ஒரே bracket-இல் வைக்கப்பட்டது. ஒரு lab இப்படியொரு தீர்மானத்தை எடுக்கும் போது, public deployment engineering problem என்பதற்கும் மேலாக governance problem ஆகிவிடுகிறது.

Anthropic-இன் பார்வையில், அந்தத் துறைகளில் வலுவான constraints இல்லாமல் மிகத் திறமையான model-ஐ வெளியிடுவது பொறுப்பற்றதாக இருக்கலாம். Users-இன் பார்வையில், benign work-ஐத் தொடர்ந்து dangerous activity என்று தவறாகக் கருதும் model-ஐ production-இல் நம்புவது கடினம். இந்த இரண்டு நிலைகளும் ஒன்றுக்கொன்று முரணானவை அல்ல. அவை advanced AI products-ஐ வடிவமைக்கும் மைய tension-ஐ பிரதிபலிக்கின்றன: model மேம்படும் போதெல்லாம் அதைக் கட்டுப்படுத்த அழுத்தம் அதிகரிக்கிறது, அதே நேரத்தில் அந்த restrictions, model-ஐ மதிப்புமிக்கதாக மாற்றிய user experience-ஐ ஆபத்துக்குள்ளாக்குகின்றன.

நிறுவனத்தின் விளக்கம் பரந்த தொழில் பிரச்சினையைக் காட்டுகிறது

மூலத்தில் மேற்கோளிடப்பட்ட அறிக்கையில், hidden safeguard-ஐ probe செய்வதும் அதைத் தாண்டிச் செயல்படுவதும் கடினம் என்பதால் அதை இன்னும் குறுகலாக target செய்ய முடியும்; visible safeguard-க்கு robust ஆக இருக்க wider net தேவைப்படுகிறது என்று Anthropic கூறுகிறது. இந்த விளக்கம் ஒரு launch decision-ஐ காக்கும் விடையாக அல்ல, ஒரு industry-wide dilemma-வின் விவரிப்பாகும். User trust மற்றும் accountability-க்காக transparency பொதுவாக மேலானது. ஆனால் transparency defensive systems-ஐ adversarial testing-க்கு எளிதாக்கலாம். அதன் விளைவு ஒரு சிரமமான சமரசம்: overblock செய்யும் visible controls.

frontier models संवेदनशील workflows-இல் deploy செய்யப்படுவதால் இந்த tradeoff அதிகமாகலாம். Developers உண்மையான தொழில்நுட்ப சிக்கல்களை கையாளக்கூடிய highly capable assistants-ஐ விரும்புகிறார்கள். Labs cyber, bio அல்லது தொடர்புடைய பகுதிகளில் risk-ஐ குறிப்பிடத்தக்க வகையில் உயர்த்தக்கூடிய tools-ஐ வழங்காமல் இருக்க விரும்புகின்றன. Models expert performance-க்கு அருகே செல்லும்போது, safety failure-க்கான ஏற்ற margin மேலும் குறுகுகிறது.

AI products-இன் அடுத்த கட்டம் பற்றி Fable 5 என்ன காட்டுகிறது

Fable 5-இன் launch, அடுத்த போட்டித்துறையின் மையம் raw capability மட்டும் அல்ல என்பதைக் காட்டுகிறது. அது constraints உடனான capability. ஒரு model benchmark-adjacent terms-இல் அற்புதமாக இருக்கலாம்; ஆனால் அதன் guardrails மிக அதிகமாக அல்லது மிகத் தெளிவற்ற முறையில் trigger ஆனால் users-ஐ frustrate செய்யலாம். அந்த சூழலில் product quality, model என்ன செய்ய முடியும் என்பதிலேயே அல்ல, vendor risky intent-ஐ ordinary use-இலிருந்து எவ்வளவு துல்லியமாக வேறுபடுத்த முடியும் என்பதிலும் निर्भर செய்கிறது.

Fable 5-க்கு வந்த ஆரம்ப எதிர்வினை, Anthropic இன்னும் அந்தத் துல்லியத்தைப் பெறவில்லை என்பதை உணர்த்துகிறது. fallback queries-இன் மிகச் சிறிய பகுதியை மட்டுமே பாதிக்கிறது என்று நிறுவனம் கூறினாலும், blocked prompts வெளிப்படையாக harmless போல தெரிந்தால் reputational impact எவ்வளவு பெரியதாக இருக்கலாம் என்பதை user reports காட்டுகின்றன. Developers consistency-ஐ நம்பியிருப்பதால் இதற்குப் புறக்கணிக்க முடியாத உணர்திறன் அவர்களிடம் உள்ளது. வேலைகளை முன்னறிவிக்க முடியாதவாறு reroute செய்யும் அல்லது context-critical terms-ஐ refuse செய்யும் system, தீவிர workflows-இல் இணைக்க கடினமாகிவிடுகிறது.

கடினமான பகுதி இன்னும் முன்னால் உள்ளது

இந்த பிரச்சினையில் பணியாற்றி வருவதாக Anthropic கூறுகிறது. அதுவே ஒரே நடைமுறை வழி. Mythos-derived model-க்கு safeguards-ஐ கைவிடும் வாய்ப்பு நிறுவனத்துக்கு இல்லை, மேலும் users நிரந்தரமாக மிகை-விரிவான screening regime-ஐ ஏற்றுக்கொள்வார்கள் என்பதும் சாத்தியமில்லை. எனவே technical மற்றும் policy challenge, false positives-ஐ குறைக்கும் அளவுக்கு classifier-ஐ narrow செய்வதும், அதே நேரத்தில் அதை எளிதாக evade செய்ய முடியாதவாறு வைத்திருப்பதுமாகும்.

இது வெறும் patching exercise அல்ல. இது frontier AI நிறுவனங்கள் safety principles-ஐ scale-இல் கூட பயன்படக்கூடிய product behavior-ஆக மாற்ற முடியுமா என்பதற்கான சோதனை. Fable 5 இன்னும் கிடைக்கும் மிக வலுவான public models-இல் ஒன்றாக நிரூபிக்கப்படலாம். ஆனால் அதன் launch, model safety இனி பக்க விஷயமல்ல என்பதையும் காட்டுகிறது. அது product-இன் ஒரு பகுதி, மற்றும் அது மிகத் தட்டையாக இருந்தால், users அதை product failure எனக் கருதுவார்கள்.

இந்த கட்டுரை Fast Company செய்தியறிக்கையை அடிப்படையாகக் கொண்டது. மூலக் கட்டுரையைப் படிக்கவும்.

Originally published on fastcompany.com