సాధారణ ప్రయోజనాల AI, ప్రత్యేక క్లినికల్ టూల్స్‌ను మించి ప్రదర్శించింది

Nature Medicineలో ప్రచురితమైన ఒక కొత్త స్వతంత్ర మూల్యాంకనం ప్రకారం, ఫ్రంటియర్ సాధారణ ప్రయోజనాల పెద్ద భాషా మోడళ్లు మూడు వేర్వేరు వైద్య బెంచ్‌మార్క్‌లలో రెండు ప్రత్యేక క్లినికల్ AI ఉత్పత్తులను అధిగమించాయి. ఈ అధ్యయనం OpenEvidence మరియు UpToDate Expert AIలను GPT-5.2, Gemini 3.1 Pro Preview, మరియు Claude Opus 4.6తో పోల్చింది.

ఈ ఫలితం పరిశ్రమలో సాధారణంగా ఉన్న ఒక అంచనాకు విరుద్ధంగా ఉంది: వైద్యానికి ప్రత్యేకంగా నిర్మించిన క్లినికల్ ఉత్పత్తులు, డొమైన్-స్పెసిఫిక్ శిక్షణ లేదా రిట్రీవల్ వ్యవస్థల కారణంగా, విస్తృత మోడళ్లను నమ్మదగిన రీతిలో మించుతాయని భావించడం. ఈ మూల్యాంకనంలో అది జరగలేదు.

ఆ పేపర్ ఈ కనుగొనడాన్ని ఆసుపత్రులు, వైద్యులు, మరియు ఆరోగ్య వ్యవస్థల కోసం ఒక ప్రాయోగిక హెచ్చరికగా చూపుతుంది, వీరు బలమైన బాహ్య ధృవీకరణ లేకుండా స్వంత వైద్య AIని వేగంగా అమలు చేయాలని ఆలోచించవచ్చు. అంతర్గత నిర్మాణాలు మరియు శిక్షణ పైప్‌లైన్‌లు ప్రజలకు అందుబాటులో లేని సందర్భంలో, ఉన్నత క్లినికల్ పనితీరు గురించి చేసే వాదనలను స్వతంత్రంగా పరీక్షించాల్సిందే అని రచయితలు అంటున్నారు.

పోలికను ఎలా నిర్వహించారు

ఈ మూల్యాంకనంలో మూడు దశలు ఉన్నాయి. మొదట, పరిశోధకులు వైద్య జ్ఞానాన్ని పరీక్షించడానికి 500 MedQA ప్రశ్నలను ఉపయోగించారు. రెండవది, మోడల్ అవుట్‌పుట్‌లు వైద్యులతో ఎంత దగ్గరగా సరిపోతున్నాయో కొలవడానికి 500 HealthBench అంశాలను ఉపయోగించారు. మూడవది, ప్రత్యక్ష క్లినికల్ వాతావరణంలో సాధారణ ప్రయోజనాల భాషా మోడల్‌ను వైద్యులు అడిగిన 100 గుర్తింపు తీసివేసిన ప్రశ్నల నుండి ఒక నిజ క్లినికల్ ప్రశ్నల బెంచ్‌మార్క్‌ను రూపొందించారు.

ఆ మూడవ దశనే ఈ పేపర్‌లో అత్యంత గమనించదగిన భాగం, ఎందుకంటే అది సారాంశ బెంచ్‌మార్క్ స్కోర్లను దాటి వెళ్లడానికి ప్రయత్నిస్తుంది. నిజ క్లినికల్ ప్రశ్నల సెట్ కోసం, 12 అమెరికా వైద్యులు మోడల్ అవుట్‌పుట్‌లను యాదృచ్ఛిక, బ్లైండెడ్ సమీక్షలు చేసి, 1,800 మోడల్-ప్రశ్న వ్యాఖ్యానాలను తయారు చేశారు.

మూడు మూల్యాంకనాల్లోనూ, ఫ్రంటియర్ సాధారణ ప్రయోజనాల మోడళ్లు ఆ రెండు క్లినికల్ AI టూల్స్‌ను మించి ప్రదర్శించాయి. నిజ క్లినికల్ ప్రశ్నల బెంచ్‌మార్క్‌లో క్లినికల్ టూల్స్ Google Search AI Overviewతో సమానంగా ప్రదర్శించాయని కూడా పేపర్ చెబుతుంది.

ఈ ఫలితం ఎందుకు ముఖ్యమైనది

ప్రత్యేక క్లినికల్ AI ఇప్పటికే వైద్య ప్రాక్టీస్‌లోకి ప్రవేశిస్తోంది, కానీ స్వతంత్ర నిజజీవిత మూల్యాంకనం ఇంకా అరుదుగా ఉందని పేపర్ చెబుతుంది. ఆ ఖాళీ ముఖ్యమైనది, ఎందుకంటే ఆరోగ్య వ్యవస్థలు అంతర్గత రూపకల్పన, శిక్షణ డేటా, మరియు మోడల్ ఎంపికలు తరచుగా స్పష్టంగా లేని టూల్స్‌ను నమ్మమని అడుగబడుతున్నాయి.

సాధారణ ప్రయోజనాల మోడళ్లు పర్యవేక్షణ లేకుండా వైద్య వినియోగానికి ఆటోమేటిక్‌గా సురక్షితమని ఈ అధ్యయనం చెప్పదు. బదులుగా, దీని కేంద్ర బిందువు మరింత సంకుచితమైనది మరియు మరింత ముఖ్యమైనది: ప్రత్యేకీకరణనే మెరుగైన పనితీరుకు రుజువుగా భావించకూడదు. ఒక ఉత్పత్తి తాను వైద్యానికి అనుకూలంగా తయారుచేయబడిందని మార్కెట్ చేస్తే, క్లినికల్‌గా ప్రాసంగిక పనులపై అది నిజంగా మెరుగుగా పనిచేస్తుందని చూపించాల్సిన భారం ఇంకా విక్రేతలు మరియు కొనుగోలుదారులపైనే ఉంటుంది.

దానికి కొనుగోలు మరియు పాలనపై ప్రత్యక్ష ప్రభావాలు ఉన్నాయి. ఒక ఆసుపత్రి బ్రాండెడ్ క్లినికల్ అసిస్టెంట్ మరియు సంస్థాగత భద్రతలతో కూడిన ఫ్రంటియర్ మోడల్ మధ్య ఎంచుకుంటుంటే, అది స్పష్టంగా వేరు వేరు పనితీరు స్థాయిల మధ్య ఎంచుకుంటున్నట్లే కాకపోవచ్చు. ఈ మూల్యాంకనం ప్రకారం, మరింత సాధారణ వ్యవస్థలు అర్థవంతమైన ప్రమాణాలపై ప్రత్యేక వ్యవస్థలను సమానంగా లేదా మించి ప్రదర్శించగలవు.

స్వంత ప్రయోజనంపై సవాలు

ఈ పేపర్ AIలో జరుగుతున్న విస్తృత మార్పును కూడా సూచిస్తుంది. ఫ్రంటియర్ మోడళ్లు చాలా పెద్ద శిక్షణ కార్పస్‌లు మరియు విస్తృత సమలేఖన పనుల ద్వారా లాభపడ్డాయి. ఆ లాభాలు ఇప్పుడు ప్రత్యేక డొమైన్ ఉత్పత్తులను సన్నని మళ్లీ-శిక్షణ లేకుండానే సవాలు చేసేంత బలంగా ఉండవచ్చని రచయితలు సూచిస్తున్నారు.

దీని అర్థం ప్రతి సాధారణ ప్రయోజనాల మోడల్ ప్రతి సందర్భంలో ప్రతి క్లినికల్ టూల్‌ను మించుతుందని కాదు. కానీ, నైపుణ్యం తప్పనిసరిగా నిర్ణాయక ఆధిక్యతను సృష్టిస్తుందనే పాత వాదన, చాలామంది కొనుగోలుదారులు అనుకున్నదానికంటే బలహీనంగా కనిపిస్తున్నదని దీని అర్థం.

ఈ పోలిక మరింత ముఖ్యమైనది, ఎందుకంటే క్లినికల్ టూల్స్ ఇప్పటికే పెద్ద స్థాయిలో వైద్య ప్రాక్టీస్ కోసం ఉత్పత్తులుగా ప్రదర్శించబడుతున్నాయి. ఆ సందర్భంలో, తక్కువ పనితీరు కేవలం అకడమిక్ ఫలితం కాదు. అది భద్రత, విలువ, మరియు నైపుణ్యంపై ఆధారపడిన బ్రాండింగ్ సాక్ష్యానికి మించి వెళ్తుందా అనే ప్రశ్నలను లేవనెత్తుతుంది.

ఆరోగ్య వ్యవస్థలు దీని నుంచి ఏమి తీసుకోవాలి

ఈ అధ్యయనం నుంచి తీసుకోవాల్సిన అత్యంత సమర్థనీయం అయిన పాఠం, వైద్యం ప్రత్యేక AIని వదిలేయాలన్నది కాదు. బదులుగా, మూల్యాంకన ప్రమాణాలు మరింత కఠినంగా ఉండాలి. వాస్తవిక క్లినికల్ పనులపై స్వతంత్ర పరీక్షలు, ఏ వ్యవస్థనైనా ప్రాక్టీస్‌లో నమ్మే ముందు అవసరమైనవిగా కనిపిస్తున్నాయి.

అది ఈ పేపర్ యొక్క బలమైన సహకారం. ఇది మార్కెటింగ్ వర్గీకరణల కంటే నిజజీవిత ఆధారాలను ముందుకు తెస్తుంది, మరియు మోడల్‌పై ఉన్న లేబల్ కంటే కొలిచిన పనితీరు తక్కువ లేదా ఎక్కువ ముఖ్యమవుతుందని కొనుగోలుదారులకు గుర్తుచేస్తుంది. తప్పులు తీవ్రమైన పరిణామాలు తెచ్చే రంగంలో, ఆ తేడా సిద్ధాంతపరమైనది కాదు.

  • Nature Medicine రెండు ప్రత్యేక క్లినికల్ AI టూల్స్‌ను మూడు ఫ్రంటియర్ సాధారణ ప్రయోజనాల మోడళ్లతో మూల్యాంకనం చేసింది.
  • ఫ్రంటియర్ మోడళ్లు MedQA, HealthBench, మరియు ఒక నిజ క్లినికల్ ప్రశ్నల బెంచ్‌మార్క్‌లో క్లినికల్ టూల్స్‌ను మించి ప్రదర్శించాయి.
  • అధ్యయనంలోని నిజ ప్రపంచ దశలో 100 గుర్తింపు తొలగించిన వైద్యుల ప్రశ్నలు మరియు 1,800 వైద్యుల వ్యాఖ్యానాలు ఉపయోగించబడ్డాయి.
  • క్లినికల్ AI ప్రాక్టీస్‌లోకి రాకముందు మరింత బలమైన స్వతంత్ర మూల్యాంకనం అవసరమని రచయితలు అంటున్నారు.

ఈ వ్యాసం Nature Medicine నివేదిక ఆధారంగా ఉంది. మూల వ్యాసాన్ని చదవండి.

Originally published on nature.com