பொதுப் பயன்பாட்டு AI, சிறப்பு மருத்துவ கருவிகளை மிஞ்சியது

Nature Medicine-இல் வெளியான ஒரு புதிய சுயாதீன மதிப்பீடு, முன்னணி பொதுப் பயன்பாட்டு பெரிய மொழி மாதிரிகள் மூன்று தனித்த மருத்துவ தரநிலைகளில் இரண்டு சிறப்பு மருத்துவ AI தயாரிப்புகளை மிஞ்சியதாக தெரிவிக்கிறது. இந்த ஆய்வு OpenEvidence மற்றும் UpToDate Expert AI-ஐ GPT-5.2, Gemini 3.1 Pro Preview, மற்றும் Claude Opus 4.6 உடன் ஒப்பிட்டது.

இந்த முடிவு தொழில்துறையில் பொதுவாகக் காணப்படும் ஒரு கருத்துக்கு எதிராக செல்கிறது: மருத்துவத்திற்காக குறிப்பாக உருவாக்கப்பட்ட கிளினிக்கல் தயாரிப்புகள், துறை-சார்ந்த பயிற்சி அல்லது மீட்டெடுப்பு அமைப்புகள் காரணமாக, பரந்த மாதிரிகளை நம்பத்தகுந்த வகையில் மிஞ்சும் என்பதான கருத்து. இந்த மதிப்பீட்டில் அது நடக்கவில்லை.

உள்நிலை வடிவமைப்பு மற்றும் பயிற்சி குழாய்கள் வெளிப்படையாக இல்லாத சொந்த மருத்துவ AI-யை வேகமாகப் பயன்படுத்துவது குறித்து யோசிக்கும் மருத்துவமனைகள், மருத்தவர்கள், மற்றும் சுகாதார அமைப்புகளுக்கு இது ஒரு நடைமுறை எச்சரிக்கையாக இந்தக் கட்டுரை அமைக்கிறது. உயர்ந்த மருத்துவ செயல்திறன் குறித்த கூற்றுகள் சுயாதீனமாக சோதிக்கப்பட வேண்டும் என்று ஆசிரியர்கள் வலியுறுத்துகிறார்கள், குறிப்பாக அடிப்படை கட்டமைப்புகளும் பயிற்சி செயல்முறைகளும் பொதுவாக வெளிப்படையாக இல்லாதபோது.

ஒப்பீடு எவ்வாறு நடத்தப்பட்டது

இந்த மதிப்பீடு மூன்று கட்டங்களைக் கொண்டிருந்தது. முதலில், மருத்துவ அறிவைச் சோதிக்க ஆராய்ச்சியாளர்கள் 500 MedQA கேள்விகளை பயன்படுத்தினர். இரண்டாவது, மாதிரி வெளியீடுகள் மருத்தவர்களின் கருத்துகளுடன் எவ்வளவு நெருக்கமாக ஒத்துள்ளன என்பதை அளவிட 500 HealthBench உருப்படிகளை பயன்படுத்தினர். மூன்றாவது, ஒரு பொதுப் பயன்பாட்டு மொழி மாதிரியை நேரடி மருத்துவச் சூழலில் மருத்தவர்கள் கேட்ட 100 அடையாள நீக்கப்பட்ட கேள்விகளிலிருந்து ஒரு நிஜ மருத்துவக் கேள்விகள் தரநிலையை உருவாக்கினர்.

அந்த மூன்றாவது கட்டமே இந்தக் கட்டுரையின் மிகவும் குறிப்பிடத்தக்க பகுதி, ஏனெனில் அது அப்ஸ்ட்ராக்ட் தரநிலை மதிப்பெண்களைத் தாண்டிச் செல்ல முயல்கிறது. நிஜ மருத்துவக் கேள்விகள் தொகுப்புக்காக, 12 அமெரிக்க மருத்தவர்கள் மாதிரி வெளியீடுகளை சீரற்ற, மறைவு மதிப்பாய்வு செய்து, 1,800 மாதிரி-கேள்வி குறிப்பு பதிவுகளை உருவாக்கினர்.

மூன்று மதிப்பீடுகளிலும், முன்னணி பொதுப் பயன்பாட்டு மாதிரிகள் இரண்டு மருத்துவ AI கருவிகளையும் மிஞ்சின. நிஜ மருத்துவக் கேள்விகள் தரநிலையில் மருத்துவ கருவிகள் Google Search AI Overview-க்கு இணையான செயல்திறன் காட்டின என்றும் கட்டுரை கூறுகிறது.

இந்த முடிவு ஏன் முக்கியம்

சிறப்பு மருத்துவ AI ஏற்கனவே மருத்துவ நடைமுறையில் நுழைந்து கொண்டிருக்கிறது, ஆனால் சுயாதீனமான நிஜ உலக மதிப்பீடு இன்னும் மிகக் குறைவாகவே உள்ளது என இந்தக் கட்டுரை கூறுகிறது. அந்த இடைவெளி முக்கியமானது, ஏனெனில் சுகாதார அமைப்புகள் உள்ளமைவு வடிவமைப்பு, பயிற்சி தரவு, மற்றும் மாதிரி தேர்வுகள் பற்றி தெளிவில்லாத கருவிகளை நம்புமாறு கேட்கப்படுகின்றன.

பொதுப் பயன்பாட்டு மாதிரிகள் மேற்பார்வையில்லாத மருத்துவப் பயன்பாட்டிற்கு தானாகவே பாதுகாப்பானவை என்று இந்த ஆய்வு கூறவில்லை. மாறாக, இதன் மையக் கருத்து குறுகியதும் இன்னும் முக்கியமானதும்: சிறப்பு தன்மையை மேம்பட்ட செயல்திறனுக்கான சான்றாகக் கருதக் கூடாது. ஒரு தயாரிப்பு தன்னை மருத்துவத்திற்குத் தகுந்தவாறு அமைக்கப்பட்டது என்று விற்பனை செய்தால், அது உண்மையில் மருத்துவ ரீதியாக பொருத்தமான பணிகளில் சிறப்பாக செயல்படுகிறது என்பதை நிரூபிக்கும் பொறுப்பு இன்னும் விற்பனையாளர்களுக்கும் வாங்குபவர்களுக்கும் இருக்கிறது.

இதற்கு கொள்முதல் மற்றும் நிர்வாகத்தில் நேரடி விளைவுகள் உள்ளன. ஒரு மருத்துவமனை, பிராண்டட் கிளினிக்கல் உதவியாளர் மற்றும் நிறுவன பாதுகாப்புகளுடன் கூடிய முன்னணி மாதிரி ஆகியவற்றில் ஒன்றைத் தேர்வுசெய்யும் போது, தெளிவாக வேறுபட்ட செயல்திறன் மட்டங்களுக்கு இடையே தேர்வு செய்கிறோம் என்று அர்த்தமில்லை. இந்த மதிப்பீட்டின்படி, பொதுவான அமைப்புகள் பொருத்தமான அளவுகோள்களில் சிறப்பு அமைப்புகளைச் சமமாக அல்லது அதற்கும் மேலாக செயல்பட முடியும்.

சொந்த நன்மைக்கு சவால்

இந்தக் கட்டுரை AI-யில் நடைபெறும் ஒரு பரந்த மாற்றத்தையும் பேசுகிறது. முன்னணி மாதிரிகள் மிகப் பெரிய பயிற்சி தரவுத் தொகுப்புகளும் விரிவான ஒத்திசைவு பணிகளும் மூலம் பயனடைந்துள்ளன. இப்போது அந்த முன்னேற்றங்கள், குறுகிய மறுபயிற்சி இல்லாமல்கூட துறை-சார்ந்த தயாரிப்புகளை சவால் செய்யும் அளவு வலுவாக இருக்கலாம் என்று ஆசிரியர்கள் கருதுகின்றனர்.

இதன் பொருள் ஒவ்வொரு பொதுப் பயன்பாட்டு மாதிரியும் ஒவ்வொரு சூழலிலும் ஒவ்வொரு மருத்துவ கருவியையும் மிஞ்சும் என்பதல்ல. ஆனால், நிபுணத்துவம் இயல்பாகவே ஒரு தீர்மானமான முன்னிலை உருவாக்கும் என்ற பழைய வாதம், பல வாங்குபவர்கள் நினைத்ததைவிட பலவீனமாகத் தெரிகிறது என்பதைக் குறிக்கிறது.

மருத்துவப் பயன்பாட்டிற்கான அளவிலான தயாரிப்புகளாக இந்த மருத்துவ கருவிகள் ஏற்கனவே விளம்பரப்படுத்தப்படுவதால், இந்த ஒப்பீடு குறிப்பாக முக்கியமானது. அந்த சூழலில், குறைந்த செயல்திறன் வெறும் கல்விசார் முடிவு அல்ல. அது பாதுகாப்பு, மதிப்பு, மற்றும் நிபுணத்துவத்தைச் சுற்றிய பிராண்டிங் சான்றுகளை முந்துகிறதா என்பதுபோன்ற கேள்விகளை எழுப்புகிறது.

சுகாதார அமைப்புகள் இதிலிருந்து என்ன எடுத்துக்கொள்ள வேண்டும்

இந்த ஆய்வில் இருந்து மிகவும் பாதுகாக்கக்கூடிய முடிவு, மருத்துவம் சிறப்பு AI-யை கைவிட வேண்டும் என்பதல்ல. மாறாக, மதிப்பீட்டு தரநிலைகள் உயர வேண்டும் என்பதே. நடைமுறையில் எந்த அமைப்பும் நம்பப்படும் முன், உண்மையான மருத்துவப் பணிகளில் சுயாதீன சோதனை அவசியமாகத் தெரிகிறது.

அதுவே இந்தக் கட்டுரையின் மிக வலுவான பங்களிப்பு. இது சந்தைப்படுத்தல் வகைப்பாடுகளை விட நிஜ உலக ஆதாரத்தை முன்னிலைப்படுத்துகிறது, மேலும் மாதிரியின் பெயர்ப்பலகையை விட அளக்கப்பட்ட செயல்திறன் முக்கியமானதாக இருக்கலாம் என்பதை வாங்குபவர்களுக்கு நினைவூட்டுகிறது. கடுமையான விளைவுகளை ஏற்படுத்தும் பிழைகள் உள்ள துறையில், அந்த வேறுபாடு கோட்பாடானது அல்ல.

  • Nature Medicine, இரண்டு சிறப்பு மருத்துவ AI கருவிகளை மூன்று முன்னணி பொதுப் பயன்பாட்டு மாதிரிகளுடன் ஒப்பிட்டது.
  • முன்னணி மாதிரிகள் MedQA, HealthBench, மற்றும் ஒரு நிஜ மருத்துவக் கேள்விகள் தரநிலையில் மருத்துவ கருவிகளை மிஞ்சின.
  • ஆய்வின் நிஜ உலக பகுதி 100 அடையாள நீக்கப்பட்ட மருத்துவர் கேள்விகள் மற்றும் 1,800 மருத்துவர் குறிப்புகளை பயன்படுத்தியது.
  • நடைமுறை பயன்பாட்டுக்கு வரும் மருத்துவ AI-க்கு வெளியீட்டுக்கு முன் வலுவான சுயாதீன மதிப்பீடு தேவை என்று ஆசிரியர்கள் கூறுகிறார்கள்.

இந்தக் கட்டுரை Nature Medicine-இன் செய்தியினை அடிப்படையாகக் கொண்டது. அசல் கட்டுரையைப் படிக்கவும்.

Originally published on nature.com