తదుపరి AI బాటిల్నెక్ మోడల్ పరిమాణం కాకుండా డేటా కావచ్చు
ఓ మాజీ OpenAI పరిశోధకుడు, తదుపరి ప్రధాన AI ఆయుధ పోరాటం స్కేలింగ్ కంటే శిక్షణ డేటా చుట్టూ కేంద్రీకృతమవుతుందని బలంగా వాదిస్తున్నారు. The Decoder నివేదిక ప్రకారం, ఆండ్రూ హో ఎనిమిది నెలల తర్వాత OpenAIని విడిచి, అధిక నాణ్యత గల, ప్రత్యేకీకరించిన డేటాసెట్లను తయారు చేయడంపై దృష్టి పెట్టే కంపెనీని నిర్మిస్తున్నారు. పెద్ద భాషా మోడళ్లు ఆర్థికంగా ముఖ్యమైన పనుల్లో ఇంకా బాగా సాధారణీకరించలేకపోతున్నాయని ఆయన అభిప్రాయం దీనికి ప్రేరణ.
ఈ వాదన ఆధునిక AIలో నిలకడగా ఉన్న ఒక ప్రధాన ఊహకు వ్యతిరేకం: ఎక్కువ కంప్యూట్తో శిక్షణ పొందిన పెద్ద మోడళ్లు, అన్ని డొమైన్లలో తమ సామర్థ్యాన్ని విస్తరించుకుంటూ పోతాయని. హో అభిప్రాయం ప్రకారం, ఇది సరిపోదు. అనేక విలువైన పనులు అధికంగా సందర్భానుసారమైనవి, ప్రస్తుతం ఉన్న డేటాసెట్లలో సరిగా ప్రతినిధ్యం పొందనివి, లేదా మూల్యాంకనం చేయడానికి చాలా కష్టమైనవి; అందువల్ల నేటి స్కేలింగ్ పద్ధతి వాటిని విశ్వసనీయంగా పట్టుకోలేదని ఆయన భావిస్తున్నారు.
ఈ వాదన ముఖ్యమైనది, ఎందుకంటే ఇది ముందువరుస మోడల్ ప్రయోగశాలల మధ్య కనబడే పోటీ నుండి, తక్కువ ఆకర్షణీయమైన కానీ పెరుగుతున్న వ్యూహాత్మక విలువ గల డేటా సృష్టి వ్యాపారానికి దృష్టిని మళ్లిస్తుంది. హో సరిగ్గా ఉంటే, AIలో తదుపరి స్థిరమైన ఆధిక్యం, పరిశ్రమ స్థాయిలో పనికి ప్రత్యేకమైన ఉదాహరణలను ఎవరు సేకరించగలరు, నిర్మించగలరు, మరియు ధృవీకరించగలరో వారికి దక్కుతుంది.
ప్రస్తుత డేటాసెట్లు ఎందుకు సరిపోకపోవచ్చు
మూల నివేదిక ప్రకారం, ఆర్థికపరంగా అర్థవంతమైన చాలా నైపుణ్యాలు ప్రస్తుత శిక్షణ కార్పస్లలో చాలా తక్కువగా మాత్రమే ప్రతిఫలిస్తున్నాయని హో నమ్ముతున్నారు. ఇంటర్నెట్-స్థాయి టెక్స్ట్ సామర్థ్యవంతమైన చాట్బాట్లు, కోడ్ అసిస్టెంట్లు, మరియు పరిశోధనా సాధనాలను సృష్టించడానికి సరిపోయింది. కానీ ప్రత్యేక పనులను స్థిరమైన నమ్మకతతో చేయడం నేర్పడానికి అది సరిపోకపోవచ్చు.
హో విమర్శ మరింత పదునుగా ఉంది, ఎందుకంటే అది బయటి అనుమానించేవారి నుండి కాకుండా, ముందువరుస మోడల్ వ్యవస్థలోపల నుంచే వస్తోంది. ఒక పనిలో మానవులు “గోల్డెన్ పాత్”ను గమనించగలిగినా, ప్రత్యామ్నాయ మార్గాలు కూడా మంచివా, చెడ్డవా, లేదా అసంపూర్ణమా అన్నది తెలుసుకోవడం కష్టం అని ఆయన వాదిస్తున్నారు. ఆ అస్పష్టత అనేక నిజ ప్రపంచ నైపుణ్యాలను సరైన బెంచ్మార్క్ వాతావరణాల్లో కోడ్ చేయడాన్ని కష్టతరం చేస్తుంది.
అంటే, సవాలు మరింత టెక్స్ట్ సేకరించడం మాత్రమే కాదు. తప్పులు ఖరీదైనవి, సరైన పనితీరు మౌన జ్ఞానంపై ఆధారపడే రంగాల్లో, సందర్భం, ఫలితాలు, ఎడ్జ్ కేసులు, మరియు నాణ్యత సంకేతాలను నిలుపుకునే డేటాసెట్లను నిర్మించడం. అది ప్రజా వెబ్ను స్క్రాప్ చేయడం కంటే చాలా కఠినమైన డేటా సమస్య.
విస్తృత AI ఆశయం నుంచి సన్నని డొమైన్ అమలుకు
కేంబ్రిడ్జ్ పరిశోధకుడు ఆడమ్ హంట్ చేసిన పని, అలాగే Google DeepMind పరిశోధకుల మద్దతు ద్వారా హో సిద్ధాంతం బలపడిందని నివేదిక చెబుతోంది. ప్రస్తుత వ్యవస్థలు మరింత విశ్వవ్యాప్త సామర్థ్యం గలవిగా కాకుండా, మరింత ప్రత్యేకీకరించబడుతున్నాయని దీని అర్థం. కొన్ని హెడ్లైన్ పురోగతులు, మౌలికంగా ఉన్న అసమాన దృశ్యాన్ని కప్పిపుచ్చవచ్చు: మోడళ్లు కొన్ని ఎంపిక చేసిన ప్రాంతాల్లో మెరుగుపడుతుండగా, ఇతర ప్రాంతాల్లో స్థిరపడిపోవచ్చు లేదా మసకబారవచ్చు.
ప్రయోగశాలలు, ఆరోగ్య సంరక్షణ వర్క్ఫ్లోలు, శాస్త్రీయ విశ్లేషణ, లేదా ఇతర అధిక విలువ గల సెట్టింగ్లలో AIని ప్రవేశపెట్టాలనుకునే వ్యాపారాలకు ఈ తేడా ముఖ్యమైనది. డెమోలలో ఆకట్టుకునే కానీ నిజ జీవిత వాతావరణాల్లో అసమానంగా పనిచేసే మోడల్ సరిపోదు. విస్తృతమైన కానీ ఉపరితల నైపుణ్యంకన్నా విశ్వసనీయత, పునరావృతత, మరియు డొమైన్-నిర్దిష్ట సామర్థ్యం ఎక్కువ ముఖ్యం.
మోడల్ డెవలపర్లు సృజనాత్మక సమస్య పరిష్కారం లేదా సాధారణ బదిలీలో ఒక పరిమితికి చేరుకుంటే, లక్ష్యిత డేటా వాస్తవంగా ముఖ్యమైన చోట సామర్థ్యాన్ని ముందుకు నెట్టే మార్గం అవుతుంది. ఇదే హో వేసిన పందెం: స్కేలింగ్ నిరుపయోగమని కాదు, కానీ దాన్ని నిర్దిష్ట పనుల చుట్టూ రూపకల్పన చేసిన డేటాతో జత చేయకపోతే దాని లాభాలు తగ్గుతాయని.

మొదటి లక్ష్యాలు: బయోఇన్ఫర్మాటిక్స్ మరియు సాధారణ ల్యాబ్ పని
హో ప్రారంభిస్తున్న కంపెనీ రెండు రంగాలతో మొదలవుతుందని నివేదించబడింది. ఒకటి బయోఇన్ఫర్మాటిక్స్, అక్కడ OpenAIలో హో చేసిన ముందరి పనికి సంబంధించిన సంక్లిష్ట శాస్త్రీయ విశ్లేషణలపై GPT-5.6 Sol వంటి ప్రస్తుత మోడళ్లు కేవలం 30 శాతం విజయవంతత మాత్రమే సాధిస్తున్నాయని వ్యాసం చెబుతోంది. రెండవది సాధారణ ల్యాబ్ పని, ఇందులో పరిశోధకులు ప్రయోగాల చిత్రాలను AI వ్యవస్థలకు మూల్యాంకన కోసం సమర్పించే సందర్భాలు ఉన్నాయి.
ఆ ఆరంభ బిందువులు స్పష్టమైనవి. రెండింటిలోనూ ఉపయోగపడే AIకి భాషా అనుకరణ కంటే ఎక్కువ అవసరం. బయోఇన్ఫర్మాటిక్స్ తరచుగా బహుళ దశల తర్కం, డొమైన్ సంప్రదాయాలు, శాస్త్రీయ సందర్భం, మరియు పొరపాటు సున్నితతను కలిగి ఉంటుంది. ల్యాబ్ వర్క్ఫ్లోలు పాఠ్యపుస్తక సమాధానాల కంటే దృశ్య తీర్పు, విధానాత్మక అవగాహన, మరియు ప్రాక్టికల్ వ్యాఖ్యానంపై ఆధారపడవచ్చు. ఇవే తక్కువ నాణ్యత గల లేదా సాధారణ డేటా, సమిష్టి మెట్రిక్లలో మోడళ్లను సామర్థ్యవంతంగా చూపినా, కీలక ఉపయోగంలో విఫలమయ్యే వాతావరణాలు.
రసాయన శాస్త్రం, మెటీరియల్స్ సైన్స్, ఆరోగ్య సంరక్షణ, మరియు విస్తృత జ్ఞాన పనులు తరువాత ప్రణాళికలో ఉన్నాయని నివేదిక చెబుతోంది. ఆ రోడ్మ్యాప్, తప్పులకు ఖర్చు ఉన్న మరియు ప్రత్యేక డేటా రక్షణాత్మక మౌలిక సదుపాయంగా మారగల పరిశ్రమల చుట్టూ నిర్మితమైన వాణిజ్య వ్యూహాన్ని సూచిస్తుంది.
ఫ్రంట్ియర్-ల్యాబ్ ఆర్థిక నమూనాకు సవాలు
ఫ్రంట్ియర్ AI ల్యాబ్లకు ఇవ్వబడే భారీ విలువలపై కూడా హో సందేహంతో ఉన్నట్లు కనిపిస్తోంది. The Decoder సారాంశం ప్రకారం, OpenAI మరియు Anthropic వంటి కంపెనీలు దీర్ఘకాలంగా లాభదాయకంగా లేవు, ఎందుకంటే Qwen లేదా Kimi వంటి తక్కువ-ఖర్చు ప్రత్యర్థులను ముందుండేందుకు వారు కొత్త మోడళ్లపై భారీగా ఖర్చు చేయాల్సి వస్తోంది. ఈ నిర్ధారణను పూర్తిగా అంగీకరించినా లేకపోయినా, ఇది మార్కెట్లో పెరుగుతున్న ఉద్రిక్తతను సూచిస్తోంది.
ఫ్రంట్ియర్ స్కేలింగ్ యొక్క మార్జినల్ ఖర్చు అధికంగానే ఉండి, ఓపెన్ లేదా చౌకైన పోటీదారులు గ్యాప్ను తగ్గిస్తే, స్వంత ఆధిక్యం మోడల్ పరిమాణం కంటే కాపీ చేయడం కష్టమైన దాని నుంచే రావాలి. క్యూయరేటెడ్ డేటాసెట్లు, ప్రైవేట్ వర్క్ఫ్లోలు, ధృవీకరించిన ఫలితాలు, మరియు డొమైన్-నిర్దిష్ట ఫీడ్బ్యాక్ లూపులు ఈ అవసరానికి రా స్కేల్ కంటే బాగా సరిపోతాయి. అవి నిర్మించడానికి నెమ్మదిగా, కాపీ చేయడానికి కష్టం, మరియు చాలా సార్లు కస్టమర్ వినియోగ సందర్భాలకు మరింత దగ్గరగా ఉంటాయి.
అది పునాది మోడళ్లు ప్రాధాన్యం కోల్పోతున్నాయన్న అర్థం కాదు. వాటి భేదం పెరుగుతున్న కొద్దీ వాటిని చుట్టుముట్టిన డేటా నాణ్యతపై ఆధారపడవచ్చు. ఆ పరిస్థితిలో, డేటా కంపెనీలు మోడల్ ల్యాబ్ల కింద నిలిచేవి కావు; అవి సామర్థ్య స్టాక్లో కీలక భాగంగా మారుతాయి.
$100 బిలియన్ డేటా మార్కెట్ ఏమి సూచిస్తుంది
వచ్చే సంవత్సరాల్లో AI ల్యాబ్లు లక్ష్యిత డేటా సేకరణపై $100 బిలియన్ కంటే ఎక్కువ ఖర్చు చేస్తాయని హో అంచనా వేయడం ఒక ధైర్యమైన అంచనా, కానీ దాని వ్యూహాత్మక లాజిక్ సులభంగా అర్థమవుతుంది. సులభంగా లభించే లాభాల మూలంగా సాధారణ వెబ్ డేటా ఖాళీ అయితే, పరిశ్రమకు కొత్త ముడి పదార్థం అవసరం. ఆ ముడి పదార్థం లేబుల్ చేసిన శాస్త్రీయ పనులు, ధృవీకరించిన ఎంటర్ప్రైజ్ వర్క్ఫ్లోలు, మల్టీమోడల్ ల్యాబ్ రికార్డులు, లేదా ప్రస్తుత మోడళ్లు శిక్షణలో తక్కువగా చూసే ఇతర నిర్మిత అనుభవం కావచ్చు.
అటువంటి ఖర్చు AI బూమ్ నుండి ఎవరు లాభపడతారో కూడా మారుస్తుంది. విలువ ప్రధానంగా చిప్ తయారీదారులు, హైపర్స్కేలర్లు, మరియు ముందువరుస మోడల్ డెవలపర్లలో కేంద్రీకృతమయ్యే బదులు, డేటా కేంద్రిత చక్రం డొమైన్ నిపుణులు, లేబెలింగ్ సిస్టమ్లు, సింథటిక్-డేటా టూలింగ్, ఎంటర్ప్రైజ్ డేటా భాగస్వామ్యాలు, మరియు ప్రత్యేక వాతావరణాల్లో నాణ్యతను కొలిచే సంస్థలను ప్రోత్సహిస్తుంది.
మొత్తం తీసుకుంటే, AI పోటీ మరింత కనిపించని కానీ మరింత పునాదియైన దశలోకి ప్రవేశిస్తున్నట్లుగా ఉంది. తదుపరి పెద్ద దూకుడు కేవలం మోడళ్లను పెద్దగా చేయడం వల్ల రాకపోవచ్చు. ఇప్పటికీ ఆటోమేషన్ను ప్రతిఘటిస్తున్న గందరగోళమైన, సందర్భానుసారమైన, అధిక-ప్రమాద పనుల కోసం నిర్మించిన డేటాతో వాటిని మెరుగుగా నేర్పడం వల్ల రావచ్చు. హో ఈ మార్పు ఉపకథ కాదని పందెం వేస్తున్నారు. అది తదుపరి AI చక్రాన్ని నిర్వచించే మార్కెట్లలో ఒకటిగా మారుతుందని ఆయన పందెం.
ఈ వ్యాసం The Decoder నివేదిక ఆధారంగా ఉంది. మూల వ్యాసాన్ని చదవండి.
Originally published on the-decoder.com



