సాధారణ ప్రయోజనాల AI, ప్రత్యేక క్లినికల్ టూల్స్ను మించి ప్రదర్శించింది
Nature Medicineలో ప్రచురితమైన ఒక కొత్త స్వతంత్ర మూల్యాంకనం ప్రకారం, ఫ్రంటియర్ సాధారణ ప్రయోజనాల పెద్ద భాషా మోడళ్లు మూడు వేర్వేరు వైద్య బెంచ్మార్క్లలో రెండు ప్రత్యేక క్లినికల్ AI ఉత్పత్తులను అధిగమించాయి. ఈ అధ్యయనం OpenEvidence మరియు UpToDate Expert AIలను GPT-5.2, Gemini 3.1 Pro Preview, మరియు Claude Opus 4.6తో పోల్చింది.
ఈ ఫలితం పరిశ్రమలో సాధారణంగా ఉన్న ఒక అంచనాకు విరుద్ధంగా ఉంది: వైద్యానికి ప్రత్యేకంగా నిర్మించిన క్లినికల్ ఉత్పత్తులు, డొమైన్-స్పెసిఫిక్ శిక్షణ లేదా రిట్రీవల్ వ్యవస్థల కారణంగా, విస్తృత మోడళ్లను నమ్మదగిన రీతిలో మించుతాయని భావించడం. ఈ మూల్యాంకనంలో అది జరగలేదు.
ఆ పేపర్ ఈ కనుగొనడాన్ని ఆసుపత్రులు, వైద్యులు, మరియు ఆరోగ్య వ్యవస్థల కోసం ఒక ప్రాయోగిక హెచ్చరికగా చూపుతుంది, వీరు బలమైన బాహ్య ధృవీకరణ లేకుండా స్వంత వైద్య AIని వేగంగా అమలు చేయాలని ఆలోచించవచ్చు. అంతర్గత నిర్మాణాలు మరియు శిక్షణ పైప్లైన్లు ప్రజలకు అందుబాటులో లేని సందర్భంలో, ఉన్నత క్లినికల్ పనితీరు గురించి చేసే వాదనలను స్వతంత్రంగా పరీక్షించాల్సిందే అని రచయితలు అంటున్నారు.
పోలికను ఎలా నిర్వహించారు
ఈ మూల్యాంకనంలో మూడు దశలు ఉన్నాయి. మొదట, పరిశోధకులు వైద్య జ్ఞానాన్ని పరీక్షించడానికి 500 MedQA ప్రశ్నలను ఉపయోగించారు. రెండవది, మోడల్ అవుట్పుట్లు వైద్యులతో ఎంత దగ్గరగా సరిపోతున్నాయో కొలవడానికి 500 HealthBench అంశాలను ఉపయోగించారు. మూడవది, ప్రత్యక్ష క్లినికల్ వాతావరణంలో సాధారణ ప్రయోజనాల భాషా మోడల్ను వైద్యులు అడిగిన 100 గుర్తింపు తీసివేసిన ప్రశ్నల నుండి ఒక నిజ క్లినికల్ ప్రశ్నల బెంచ్మార్క్ను రూపొందించారు.
ఆ మూడవ దశనే ఈ పేపర్లో అత్యంత గమనించదగిన భాగం, ఎందుకంటే అది సారాంశ బెంచ్మార్క్ స్కోర్లను దాటి వెళ్లడానికి ప్రయత్నిస్తుంది. నిజ క్లినికల్ ప్రశ్నల సెట్ కోసం, 12 అమెరికా వైద్యులు మోడల్ అవుట్పుట్లను యాదృచ్ఛిక, బ్లైండెడ్ సమీక్షలు చేసి, 1,800 మోడల్-ప్రశ్న వ్యాఖ్యానాలను తయారు చేశారు.
మూడు మూల్యాంకనాల్లోనూ, ఫ్రంటియర్ సాధారణ ప్రయోజనాల మోడళ్లు ఆ రెండు క్లినికల్ AI టూల్స్ను మించి ప్రదర్శించాయి. నిజ క్లినికల్ ప్రశ్నల బెంచ్మార్క్లో క్లినికల్ టూల్స్ Google Search AI Overviewతో సమానంగా ప్రదర్శించాయని కూడా పేపర్ చెబుతుంది.
ఈ ఫలితం ఎందుకు ముఖ్యమైనది
ప్రత్యేక క్లినికల్ AI ఇప్పటికే వైద్య ప్రాక్టీస్లోకి ప్రవేశిస్తోంది, కానీ స్వతంత్ర నిజజీవిత మూల్యాంకనం ఇంకా అరుదుగా ఉందని పేపర్ చెబుతుంది. ఆ ఖాళీ ముఖ్యమైనది, ఎందుకంటే ఆరోగ్య వ్యవస్థలు అంతర్గత రూపకల్పన, శిక్షణ డేటా, మరియు మోడల్ ఎంపికలు తరచుగా స్పష్టంగా లేని టూల్స్ను నమ్మమని అడుగబడుతున్నాయి.
సాధారణ ప్రయోజనాల మోడళ్లు పర్యవేక్షణ లేకుండా వైద్య వినియోగానికి ఆటోమేటిక్గా సురక్షితమని ఈ అధ్యయనం చెప్పదు. బదులుగా, దీని కేంద్ర బిందువు మరింత సంకుచితమైనది మరియు మరింత ముఖ్యమైనది: ప్రత్యేకీకరణనే మెరుగైన పనితీరుకు రుజువుగా భావించకూడదు. ఒక ఉత్పత్తి తాను వైద్యానికి అనుకూలంగా తయారుచేయబడిందని మార్కెట్ చేస్తే, క్లినికల్గా ప్రాసంగిక పనులపై అది నిజంగా మెరుగుగా పనిచేస్తుందని చూపించాల్సిన భారం ఇంకా విక్రేతలు మరియు కొనుగోలుదారులపైనే ఉంటుంది.
దానికి కొనుగోలు మరియు పాలనపై ప్రత్యక్ష ప్రభావాలు ఉన్నాయి. ఒక ఆసుపత్రి బ్రాండెడ్ క్లినికల్ అసిస్టెంట్ మరియు సంస్థాగత భద్రతలతో కూడిన ఫ్రంటియర్ మోడల్ మధ్య ఎంచుకుంటుంటే, అది స్పష్టంగా వేరు వేరు పనితీరు స్థాయిల మధ్య ఎంచుకుంటున్నట్లే కాకపోవచ్చు. ఈ మూల్యాంకనం ప్రకారం, మరింత సాధారణ వ్యవస్థలు అర్థవంతమైన ప్రమాణాలపై ప్రత్యేక వ్యవస్థలను సమానంగా లేదా మించి ప్రదర్శించగలవు.
స్వంత ప్రయోజనంపై సవాలు
ఈ పేపర్ AIలో జరుగుతున్న విస్తృత మార్పును కూడా సూచిస్తుంది. ఫ్రంటియర్ మోడళ్లు చాలా పెద్ద శిక్షణ కార్పస్లు మరియు విస్తృత సమలేఖన పనుల ద్వారా లాభపడ్డాయి. ఆ లాభాలు ఇప్పుడు ప్రత్యేక డొమైన్ ఉత్పత్తులను సన్నని మళ్లీ-శిక్షణ లేకుండానే సవాలు చేసేంత బలంగా ఉండవచ్చని రచయితలు సూచిస్తున్నారు.
దీని అర్థం ప్రతి సాధారణ ప్రయోజనాల మోడల్ ప్రతి సందర్భంలో ప్రతి క్లినికల్ టూల్ను మించుతుందని కాదు. కానీ, నైపుణ్యం తప్పనిసరిగా నిర్ణాయక ఆధిక్యతను సృష్టిస్తుందనే పాత వాదన, చాలామంది కొనుగోలుదారులు అనుకున్నదానికంటే బలహీనంగా కనిపిస్తున్నదని దీని అర్థం.
ఈ పోలిక మరింత ముఖ్యమైనది, ఎందుకంటే క్లినికల్ టూల్స్ ఇప్పటికే పెద్ద స్థాయిలో వైద్య ప్రాక్టీస్ కోసం ఉత్పత్తులుగా ప్రదర్శించబడుతున్నాయి. ఆ సందర్భంలో, తక్కువ పనితీరు కేవలం అకడమిక్ ఫలితం కాదు. అది భద్రత, విలువ, మరియు నైపుణ్యంపై ఆధారపడిన బ్రాండింగ్ సాక్ష్యానికి మించి వెళ్తుందా అనే ప్రశ్నలను లేవనెత్తుతుంది.
ఆరోగ్య వ్యవస్థలు దీని నుంచి ఏమి తీసుకోవాలి
ఈ అధ్యయనం నుంచి తీసుకోవాల్సిన అత్యంత సమర్థనీయం అయిన పాఠం, వైద్యం ప్రత్యేక AIని వదిలేయాలన్నది కాదు. బదులుగా, మూల్యాంకన ప్రమాణాలు మరింత కఠినంగా ఉండాలి. వాస్తవిక క్లినికల్ పనులపై స్వతంత్ర పరీక్షలు, ఏ వ్యవస్థనైనా ప్రాక్టీస్లో నమ్మే ముందు అవసరమైనవిగా కనిపిస్తున్నాయి.
అది ఈ పేపర్ యొక్క బలమైన సహకారం. ఇది మార్కెటింగ్ వర్గీకరణల కంటే నిజజీవిత ఆధారాలను ముందుకు తెస్తుంది, మరియు మోడల్పై ఉన్న లేబల్ కంటే కొలిచిన పనితీరు తక్కువ లేదా ఎక్కువ ముఖ్యమవుతుందని కొనుగోలుదారులకు గుర్తుచేస్తుంది. తప్పులు తీవ్రమైన పరిణామాలు తెచ్చే రంగంలో, ఆ తేడా సిద్ధాంతపరమైనది కాదు.
- Nature Medicine రెండు ప్రత్యేక క్లినికల్ AI టూల్స్ను మూడు ఫ్రంటియర్ సాధారణ ప్రయోజనాల మోడళ్లతో మూల్యాంకనం చేసింది.
- ఫ్రంటియర్ మోడళ్లు MedQA, HealthBench, మరియు ఒక నిజ క్లినికల్ ప్రశ్నల బెంచ్మార్క్లో క్లినికల్ టూల్స్ను మించి ప్రదర్శించాయి.
- అధ్యయనంలోని నిజ ప్రపంచ దశలో 100 గుర్తింపు తొలగించిన వైద్యుల ప్రశ్నలు మరియు 1,800 వైద్యుల వ్యాఖ్యానాలు ఉపయోగించబడ్డాయి.
- క్లినికల్ AI ప్రాక్టీస్లోకి రాకముందు మరింత బలమైన స్వతంత్ర మూల్యాంకనం అవసరమని రచయితలు అంటున్నారు.
ఈ వ్యాసం Nature Medicine నివేదిక ఆధారంగా ఉంది. మూల వ్యాసాన్ని చదవండి.
Originally published on nature.com

