తదుపరి AI బాటిల్‌నెక్ మోడల్ పరిమాణం కాకుండా డేటా కావచ్చు

ఓ మాజీ OpenAI పరిశోధకుడు, తదుపరి ప్రధాన AI ఆయుధ పోరాటం స్కేలింగ్ కంటే శిక్షణ డేటా చుట్టూ కేంద్రీకృతమవుతుందని బలంగా వాదిస్తున్నారు. The Decoder నివేదిక ప్రకారం, ఆండ్రూ హో ఎనిమిది నెలల తర్వాత OpenAIని విడిచి, అధిక నాణ్యత గల, ప్రత్యేకీకరించిన డేటాసెట్‌లను తయారు చేయడంపై దృష్టి పెట్టే కంపెనీని నిర్మిస్తున్నారు. పెద్ద భాషా మోడళ్లు ఆర్థికంగా ముఖ్యమైన పనుల్లో ఇంకా బాగా సాధారణీకరించలేకపోతున్నాయని ఆయన అభిప్రాయం దీనికి ప్రేరణ.

ఈ వాదన ఆధునిక AIలో నిలకడగా ఉన్న ఒక ప్రధాన ఊహకు వ్యతిరేకం: ఎక్కువ కంప్యూట్‌తో శిక్షణ పొందిన పెద్ద మోడళ్లు, అన్ని డొమైన్‌లలో తమ సామర్థ్యాన్ని విస్తరించుకుంటూ పోతాయని. హో అభిప్రాయం ప్రకారం, ఇది సరిపోదు. అనేక విలువైన పనులు అధికంగా సందర్భానుసారమైనవి, ప్రస్తుతం ఉన్న డేటాసెట్‌లలో సరిగా ప్రతినిధ్యం పొందని‌వి, లేదా మూల్యాంకనం చేయడానికి చాలా కష్టమైనవి; అందువల్ల నేటి స్కేలింగ్ పద్ధతి వాటిని విశ్వసనీయంగా పట్టుకోలేదని ఆయన భావిస్తున్నారు.

ఈ వాదన ముఖ్యమైనది, ఎందుకంటే ఇది ముందువరుస మోడల్ ప్రయోగశాలల మధ్య కనబడే పోటీ నుండి, తక్కువ ఆకర్షణీయమైన కానీ పెరుగుతున్న వ్యూహాత్మక విలువ గల డేటా సృష్టి వ్యాపారానికి దృష్టిని మళ్లిస్తుంది. హో సరిగ్గా ఉంటే, AIలో తదుపరి స్థిరమైన ఆధిక్యం, పరిశ్రమ స్థాయిలో పనికి ప్రత్యేకమైన ఉదాహరణలను ఎవరు సేకరించగలరు, నిర్మించగలరు, మరియు ధృవీకరించగలరో వారికి దక్కుతుంది.

ప్రస్తుత డేటాసెట్‌లు ఎందుకు సరిపోకపోవచ్చు

మూల నివేదిక ప్రకారం, ఆర్థికపరంగా అర్థవంతమైన చాలా నైపుణ్యాలు ప్రస్తుత శిక్షణ కార్పస్‌లలో చాలా తక్కువగా మాత్రమే ప్రతిఫలిస్తున్నాయని హో నమ్ముతున్నారు. ఇంటర్నెట్-స్థాయి టెక్స్ట్ సామర్థ్యవంతమైన చాట్‌బాట్‌లు, కోడ్ అసిస్టెంట్‌లు, మరియు పరిశోధనా సాధనాలను సృష్టించడానికి సరిపోయింది. కానీ ప్రత్యేక పనులను స్థిరమైన నమ్మకతతో చేయడం నేర్పడానికి అది సరిపోకపోవచ్చు.

హో విమర్శ మరింత పదునుగా ఉంది, ఎందుకంటే అది బయటి అనుమానించేవారి నుండి కాకుండా, ముందువరుస మోడల్ వ్యవస్థలోపల నుంచే వస్తోంది. ఒక పనిలో మానవులు “గోల్డెన్ పాత్”ను గమనించగలిగినా, ప్రత్యామ్నాయ మార్గాలు కూడా మంచివా, చెడ్డవా, లేదా అసంపూర్ణమా అన్నది తెలుసుకోవడం కష్టం అని ఆయన వాదిస్తున్నారు. ఆ అస్పష్టత అనేక నిజ ప్రపంచ నైపుణ్యాలను సరైన బెంచ్‌మార్క్ వాతావరణాల్లో కోడ్ చేయడాన్ని కష్టతరం చేస్తుంది.

అంటే, సవాలు మరింత టెక్స్ట్ సేకరించడం మాత్రమే కాదు. తప్పులు ఖరీదైనవి, సరైన పనితీరు మౌన జ్ఞానంపై ఆధారపడే రంగాల్లో, సందర్భం, ఫలితాలు, ఎడ్జ్ కేసులు, మరియు నాణ్యత సంకేతాలను నిలుపుకునే డేటాసెట్‌లను నిర్మించడం. అది ప్రజా వెబ్‌ను స్క్రాప్ చేయడం కంటే చాలా కఠినమైన డేటా సమస్య.

విస్తృత AI ఆశయం నుంచి సన్నని డొమైన్ అమలుకు

కేంబ్రిడ్జ్ పరిశోధకుడు ఆడమ్ హంట్ చేసిన పని, అలాగే Google DeepMind పరిశోధకుల మద్దతు ద్వారా హో సిద్ధాంతం బలపడిందని నివేదిక చెబుతోంది. ప్రస్తుత వ్యవస్థలు మరింత విశ్వవ్యాప్త సామర్థ్యం గలవిగా కాకుండా, మరింత ప్రత్యేకీకరించబడుతున్నాయని దీని అర్థం. కొన్ని హెడ్లైన్ పురోగతులు, మౌలికంగా ఉన్న అసమాన దృశ్యాన్ని కప్పిపుచ్చవచ్చు: మోడళ్లు కొన్ని ఎంపిక చేసిన ప్రాంతాల్లో మెరుగుపడుతుండగా, ఇతర ప్రాంతాల్లో స్థిరపడిపోవచ్చు లేదా మసకబారవచ్చు.

ప్రయోగశాలలు, ఆరోగ్య సంరక్షణ వర్క్‌ఫ్లోలు, శాస్త్రీయ విశ్లేషణ, లేదా ఇతర అధిక విలువ గల సెట్టింగ్‌లలో AIని ప్రవేశపెట్టాలనుకునే వ్యాపారాలకు ఈ తేడా ముఖ్యమైనది. డెమోలలో ఆకట్టుకునే కానీ నిజ జీవిత వాతావరణాల్లో అసమానంగా పనిచేసే మోడల్ సరిపోదు. విస్తృతమైన కానీ ఉపరితల నైపుణ్యంకన్నా విశ్వసనీయత, పునరావృతత, మరియు డొమైన్-నిర్దిష్ట సామర్థ్యం ఎక్కువ ముఖ్యం.

మోడల్ డెవలపర్లు సృజనాత్మక సమస్య పరిష్కారం లేదా సాధారణ బదిలీలో ఒక పరిమితికి చేరుకుంటే, లక్ష్యిత డేటా వాస్తవంగా ముఖ్యమైన చోట సామర్థ్యాన్ని ముందుకు నెట్టే మార్గం అవుతుంది. ఇదే హో వేసిన పందెం: స్కేలింగ్ నిరుపయోగమని కాదు, కానీ దాన్ని నిర్దిష్ట పనుల చుట్టూ రూపకల్పన చేసిన డేటాతో జత చేయకపోతే దాని లాభాలు తగ్గుతాయని.

AI అభివృద్ధి రెండు మార్గాలు: అన్ని పనుల్లో క్రమంగా, విస్తృతంగా మెరుగుదల (పై) vs కొన్ని సామర్థ్యాలు ఎగబాకి, మౌలిక నైపుణ్యాలు స్థిరపడే లేదా తగ్గే తీవ్రమైన ప్రత్యేకీకరణ (క్రింది). | Image: via Adam Hun
AI అభివృద్ధి రెండు మార్గాలు: అన్ని పనుల్లో క్రమంగా, విస్తృతంగా మెరుగుదల (పై) vs కొన్ని సామర్థ్యాలు ఎగబాకి, మౌలిక నైపుణ్యాలు స్థిరపడే లేదా తగ్గే తీవ్రమైన ప్రత్యేకీకరణ (క్రింది). | Image: via Adam Hun

మొదటి లక్ష్యాలు: బయోఇన్ఫర్మాటిక్స్ మరియు సాధారణ ల్యాబ్ పని

హో ప్రారంభిస్తున్న కంపెనీ రెండు రంగాలతో మొదలవుతుందని నివేదించబడింది. ఒకటి బయోఇన్ఫర్మాటిక్స్, అక్కడ OpenAIలో హో చేసిన ముందరి పనికి సంబంధించిన సంక్లిష్ట శాస్త్రీయ విశ్లేషణలపై GPT-5.6 Sol వంటి ప్రస్తుత మోడళ్లు కేవలం 30 శాతం విజయవంతత మాత్రమే సాధిస్తున్నాయని వ్యాసం చెబుతోంది. రెండవది సాధారణ ల్యాబ్ పని, ఇందులో పరిశోధకులు ప్రయోగాల చిత్రాలను AI వ్యవస్థలకు మూల్యాంకన కోసం సమర్పించే సందర్భాలు ఉన్నాయి.

ఆ ఆరంభ బిందువులు స్పష్టమైనవి. రెండింటిలోనూ ఉపయోగపడే AIకి భాషా అనుకరణ కంటే ఎక్కువ అవసరం. బయోఇన్ఫర్మాటిక్స్ తరచుగా బహుళ దశల తర్కం, డొమైన్ సంప్రదాయాలు, శాస్త్రీయ సందర్భం, మరియు పొరపాటు సున్నితతను కలిగి ఉంటుంది. ల్యాబ్ వర్క్‌ఫ్లోలు పాఠ్యపుస్తక సమాధానాల కంటే దృశ్య తీర్పు, విధానాత్మక అవగాహన, మరియు ప్రాక్టికల్ వ్యాఖ్యానంపై ఆధారపడవచ్చు. ఇవే తక్కువ నాణ్యత గల లేదా సాధారణ డేటా, సమిష్టి మెట్రిక్‌లలో మోడళ్లను సామర్థ్యవంతంగా చూపినా, కీలక ఉపయోగంలో విఫలమయ్యే వాతావరణాలు.

రసాయన శాస్త్రం, మెటీరియల్స్ సైన్స్, ఆరోగ్య సంరక్షణ, మరియు విస్తృత జ్ఞాన పనులు తరువాత ప్రణాళికలో ఉన్నాయని నివేదిక చెబుతోంది. ఆ రోడ్‌మ్యాప్, తప్పులకు ఖర్చు ఉన్న మరియు ప్రత్యేక డేటా రక్షణాత్మక మౌలిక సదుపాయంగా మారగల పరిశ్రమల చుట్టూ నిర్మితమైన వాణిజ్య వ్యూహాన్ని సూచిస్తుంది.

ఫ్రంట్ియర్-ల్యాబ్ ఆర్థిక నమూనాకు సవాలు

ఫ్రంట్ియర్ AI ల్యాబ్‌లకు ఇవ్వబడే భారీ విలువలపై కూడా హో సందేహంతో ఉన్నట్లు కనిపిస్తోంది. The Decoder సారాంశం ప్రకారం, OpenAI మరియు Anthropic వంటి కంపెనీలు దీర్ఘకాలంగా లాభదాయకంగా లేవు, ఎందుకంటే Qwen లేదా Kimi వంటి తక్కువ-ఖర్చు ప్రత్యర్థులను ముందుండేందుకు వారు కొత్త మోడళ్లపై భారీగా ఖర్చు చేయాల్సి వస్తోంది. ఈ నిర్ధారణను పూర్తిగా అంగీకరించినా లేకపోయినా, ఇది మార్కెట్‌లో పెరుగుతున్న ఉద్రిక్తతను సూచిస్తోంది.

ఫ్రంట్ియర్ స్కేలింగ్ యొక్క మార్జినల్ ఖర్చు అధికంగానే ఉండి, ఓపెన్ లేదా చౌకైన పోటీదారులు గ్యాప్‌ను తగ్గిస్తే, స్వంత ఆధిక్యం మోడల్ పరిమాణం కంటే కాపీ చేయడం కష్టమైన దాని నుంచే రావాలి. క్యూయరేటెడ్ డేటాసెట్‌లు, ప్రైవేట్ వర్క్‌ఫ్లోలు, ధృవీకరించిన ఫలితాలు, మరియు డొమైన్-నిర్దిష్ట ఫీడ్‌బ్యాక్ లూపులు ఈ అవసరానికి రా స్కేల్ కంటే బాగా సరిపోతాయి. అవి నిర్మించడానికి నెమ్మదిగా, కాపీ చేయడానికి కష్టం, మరియు చాలా సార్లు కస్టమర్ వినియోగ సందర్భాలకు మరింత దగ్గరగా ఉంటాయి.

అది పునాది మోడళ్లు ప్రాధాన్యం కోల్పోతున్నాయన్న అర్థం కాదు. వాటి భేదం పెరుగుతున్న కొద్దీ వాటిని చుట్టుముట్టిన డేటా నాణ్యతపై ఆధారపడవచ్చు. ఆ పరిస్థితిలో, డేటా కంపెనీలు మోడల్ ల్యాబ్‌ల కింద నిలిచేవి కావు; అవి సామర్థ్య స్టాక్‌లో కీలక భాగంగా మారుతాయి.

$100 బిలియన్ డేటా మార్కెట్ ఏమి సూచిస్తుంది

వచ్చే సంవత్సరాల్లో AI ల్యాబ్‌లు లక్ష్యిత డేటా సేకరణపై $100 బిలియన్ కంటే ఎక్కువ ఖర్చు చేస్తాయని హో అంచనా వేయడం ఒక ధైర్యమైన అంచనా, కానీ దాని వ్యూహాత్మక లాజిక్ సులభంగా అర్థమవుతుంది. సులభంగా లభించే లాభాల మూలంగా సాధారణ వెబ్ డేటా ఖాళీ అయితే, పరిశ్రమకు కొత్త ముడి పదార్థం అవసరం. ఆ ముడి పదార్థం లేబుల్ చేసిన శాస్త్రీయ పనులు, ధృవీకరించిన ఎంటర్‌ప్రైజ్ వర్క్‌ఫ్లోలు, మల్టీమోడల్ ల్యాబ్ రికార్డులు, లేదా ప్రస్తుత మోడళ్లు శిక్షణలో తక్కువగా చూసే ఇతర నిర్మిత అనుభవం కావచ్చు.

అటువంటి ఖర్చు AI బూమ్ నుండి ఎవరు లాభపడతారో కూడా మారుస్తుంది. విలువ ప్రధానంగా చిప్ తయారీదారులు, హైపర్‌స్కేలర్లు, మరియు ముందువరుస మోడల్ డెవలపర్లలో కేంద్రీకృతమయ్యే బదులు, డేటా కేంద్రిత చక్రం డొమైన్ నిపుణులు, లేబెలింగ్ సిస్టమ్‌లు, సింథటిక్-డేటా టూలింగ్, ఎంటర్‌ప్రైజ్ డేటా భాగస్వామ్యాలు, మరియు ప్రత్యేక వాతావరణాల్లో నాణ్యతను కొలిచే సంస్థలను ప్రోత్సహిస్తుంది.

మొత్తం తీసుకుంటే, AI పోటీ మరింత కనిపించని కానీ మరింత పునాదియైన దశలోకి ప్రవేశిస్తున్నట్లుగా ఉంది. తదుపరి పెద్ద దూకుడు కేవలం మోడళ్లను పెద్దగా చేయడం వల్ల రాకపోవచ్చు. ఇప్పటికీ ఆటోమేషన్‌ను ప్రతిఘటిస్తున్న గందరగోళమైన, సందర్భానుసారమైన, అధిక-ప్రమాద పనుల కోసం నిర్మించిన డేటాతో వాటిని మెరుగుగా నేర్పడం వల్ల రావచ్చు. హో ఈ మార్పు ఉపకథ కాదని పందెం వేస్తున్నారు. అది తదుపరి AI చక్రాన్ని నిర్వచించే మార్కెట్లలో ఒకటిగా మారుతుందని ఆయన పందెం.

ఈ వ్యాసం The Decoder నివేదిక ఆధారంగా ఉంది. మూల వ్యాసాన్ని చదవండి.

Originally published on the-decoder.com