ट्यूटरिंग रणनीतियों को परखने का सस्ता तरीका
अनुकूली AI ट्यूटर्स उतने ही अच्छे होते हैं जितना उन्हें बनाने में इस्तेमाल किया गया फ़ीडबैक। कोई ट्यूटर तब बेहतर होता है जब शोधकर्ता देख सकें कि कौन-सी व्याख्या किसी संघर्षरत शिक्षार्थी को उबारती है और कौन-सी उसे अटका हुआ छोड़ देती है। इस चक्र के लिए सामान्यतः वास्तविक लोगों की ज़रूरत होती है: ऐसे छात्र जो समस्याएँ हल करते हैं, गलतियाँ करते हैं, संकेत पाते हैं, और फिर या तो खुद को सुधार लेते हैं या फिर असफल हो जाते हैं। ऐसा चक्र बड़े पैमाने पर चलाना महँगा है, और StudentSim के पीछे के शोधकर्ताओं का तर्क है कि यही लागत ट्यूटरिंग सिस्टमों को पीछे खींचने वाली मुख्य बाधा बन गई है।
उनका उत्तर है शिक्षार्थियों का अनुकरण। माइक्रोसॉफ्ट और इलिनॉय विश्वविद्यालय के सहयोग से बना StudentSim किसी अध्ययन के प्रत्येक छात्र के लिए एक अलग डिजिटल प्रतिकृति बनाता है, और फिर ट्यूटर को ट्यून किए जाने के दौरान उन प्रतिकृतियों को वास्तविक चीज़ की जगह इस्तेमाल करने देता है। चूँकि प्रतिकृतियाँ तुरंत प्रतिक्रिया देती हैं और उन्हें चलाने की लागत लगभग शून्य होती है, शोधकर्ता कक्षा-अध्ययन की तुलना में कहीं अधिक ट्यूटरिंग रणनीतियाँ परख सकते हैं। पेपर के लेखकों ने लक्ष्य को इस रूप में बताया है कि AI ट्यूटर्स को उस धीमे और महँगे फ़ीडबैक चैनल की जगह एक तेज़, कम लागत वाला फ़ीडबैक चैनल दिया जाए जिस पर वे अभी निर्भर हैं।
दो कौशल जो पहले कभी नहीं जोड़े गए
शोधकर्ताओं का तर्क है कि छात्रों के मॉडलिंग के पुराने प्रयासों ने समस्या का केवल आधा हिस्सा हल किया था। उनके विश्लेषण के अनुसार, मौजूदा सिस्टम दो शिविरों में से एक में पड़ते हैं, और प्रत्येक शिविर में कुछ आवश्यक चीज़ की कमी है।
- व्यवहारिक प्रतिकृतियाँ: ये मॉडल वास्तविक छात्र डेटा पर प्रशिक्षित होते हैं और किसी विशेष शिक्षार्थी के उत्तरों को उचित सटीकता के साथ दोहराते हैं, जिसमें वह शिक्षार्थी आमतौर पर जो गलतियाँ करता है वे भी शामिल हैं। जो ये नहीं कर सकते वह है ट्यूटर की व्याख्या पर प्रतिक्रिया देना।
- प्रॉम्प्ट किए गए भाषा मॉडल: ये सामान्य-उद्देश्य वाले मॉडल होते हैं जिन्हें छात्र की तरह व्यवहार करने का निर्देश दिया जाता है। ये संकेतों का स्वेच्छा से पालन करते हैं और इशारे पर उत्तर संशोधित करते हैं, लेकिन वे उस शिक्षार्थी से वास्तव में मिलते-जुलते नहीं हैं जिसका वे प्रतिनिधित्व करने के लिए supposed हैं।
एक AI ट्यूटर को एक ही समय में दोनों गुणों की आवश्यकता होती है। उसे एक यथार्थवादी प्रारंभिक बिंदु चाहिए, यानी ऐसी प्रतिकृति जो वही समस्याएँ उन्हीं कारणों से गलत करे जिन कारणों से कोई वास्तविक छात्र करेगा। उसे यह भी चाहिए कि मदद आने पर वह प्रतिकृति अपना मन बदले। जो छात्र कभी सुधरता ही नहीं, वह यह नहीं दिखा सकता कि किसी संकेत ने काम किया या नहीं, और जो छात्र गलत कारणों से सुधरता है, वह भ्रामक साक्ष्य पैदा करता है।
दोनों गुणों को मापने योग्य लक्ष्यों में बदलना
StudentSim प्रत्येक गुण को एक धुँधली आकांक्षा के बजाय अनुकूलन योग्य स्कोर मानता है। एक माप यह दर्ज करता है कि किसी प्रतिकृति के उत्तर वास्तविक छात्र से कितने मेल खाते हैं, गलतियों सहित। दूसरा माप यह दर्ज करता है कि ट्यूटर के हस्तक्षेप के बाद प्रतिकृति कितनी सहजता से उत्तर संशोधित करती है। साथ मिलकर, ये दो मेट्रिक्स यह परिभाषित करते हैं कि ट्यूटर प्रशिक्षण के लिए एक अनुकरणित छात्र का उपयोगी होना क्या मायने रखता है, न कि केवल बातचीत में विश्वसनीय लगना।

अड़चन: प्रति छात्र लगभग कोई डेटा नहीं
टीम के सामने सबसे कठिन बाधा कमी थी। उनका अंग्रेज़ी लेखन डेटासेट इस समस्या को स्पष्ट रूप से दर्शाता है: औसत छात्र ने केवल तीन निबंध लिखे थे, और दो-तिहाई से अधिक छात्रों ने पाँच या उससे कम लिखे थे। इतने छोटे नमूने पर सीधे प्रतिकृति फिट करना काम नहीं करता। इतने कम उदाहरणों के साथ, मॉडल लेखक के बारे में कुछ सामान्य सीखने के बजाय सामने मौजूद विशिष्ट निबंधों को रट लेता है, जिस विफलता मोड को शोधकर्ता ओवरफिटिंग कहते हैं।
इससे एक दुविधा बनती है। एक छात्र के मुट्ठी भर सबमिशन पर प्रशिक्षित मॉडल भरोसे के लिए बहुत नाज़ुक होता है, फिर भी एक विश्वसनीय प्रतिकृति प्रशिक्षित करने के लिए प्रत्येक व्यक्ति से पर्याप्त काम जुटाने का मतलब वही डेटा इकट्ठा करना होगा जिसकी आवश्यकता से बचने के लिए सिस्टम बनाया गया है। दूसरे शब्दों में, कमी की समस्या को केवल अधिक छात्र सबमिशन माँगकर हल नहीं किया जा सकता।
दो-चरणीय प्रशिक्षण सीमित डेटा को और आगे तक खींचता है
पहला चरण: छात्रों में क्या साझा है, यह सीखना
पहला चरण पूलिंग के ज़रिए कमी से बचता है। एक आधार मॉडल किसी विषय के प्रत्येक छात्र के संयुक्त काम पर प्रशिक्षित होता है, और समूह भर में लागू होने वाले पैटर्न सीखता है: शिक्षार्थियों की आम गलतियाँ, और ट्यूटर द्वारा संकेत देने पर वे अपने उत्तर कैसे संशोधित करते हैं। यह चरण उस क्षेत्र में सीखने का सामान्य ज्ञान प्रदान करता है।
दूसरा चरण: व्यक्ति के अनुकूल बनना
दूसरा चरण व्यक्तिगत बनाता है। पूल किए गए आधार से शुरू करके, सिस्टम किसी एक छात्र के अनुकूल उस व्यक्ति द्वारा छोड़े गए जो भी कुछ रिकॉर्ड हैं, उनका उपयोग करके ढल जाता है, उदाहरण के लिए तीन निबंध। चूँकि मॉडल पहले से ही विषय को व्यापक रूप से समझता है, व्यक्तिगत डेटा को इसे शुरू से सब कुछ सिखाने के बजाय केवल एक विशेष शिक्षार्थी की प्रवृत्तियों की ओर थोड़ा धकेलना होता है।
नतीजा ऐसी प्रतिकृति है जो किसी डेटासेट के लगभग हर छात्र के लिए बनाई जा सकती है, न कि केवल उन उत्पादक छात्रों के लिए जिन्होंने अपने दम पर मॉडल प्रशिक्षित करने लायक काम जमा किया। मूल्यांकन अध्ययनों के लिए यह बहुत मायने रखता है। जो सिस्टम किसी कक्षा के केवल सबसे सक्रिय तिहाई हिस्से को मॉडल करेगा, वह यह विकृत तस्वीर देगा कि कोई ट्यूटर शिक्षार्थियों की पूरी श्रेणी में कैसा प्रदर्शन करता है।

शतरंज और लेखन में परीक्षण
शोधकर्ताओं ने इस दृष्टिकोण को शतरंज और अंग्रेज़ी लेखन सहित कई विषयों के 60 छात्रों पर मान्य ठहराया। ये दो क्षेत्र सिस्टम पर अलग-अलग दबाव डालते हैं। शतरंज चाल-दर-चाल रिकॉर्ड देता है जिनमें सही और गलत उत्तर स्पष्ट होते हैं, जबकि लेखन में तर्क, संरचना और संशोधन पर निर्णय की माँग होती है। उन सेटिंग्स में लक्ष्य यह दिखाना था कि प्रतिकृतियाँ किसी छात्र की सामान्य गलतियों की नकल भी कर सकें और उस छात्र की तरह मार्गदर्शन पर प्रतिक्रिया भी दे सकें।
प्रशिक्षण चक्र के लिए दोनों आवश्यकताएँ अनिवार्य हैं। यदि कोई प्रतिकृति गलतियों को ईमानदारी से दोहराती ही है लेकिन संकेतों को अनदेखा करती है, तो ट्यूटर को इस बारे में कोई संकेत नहीं मिलता कि उसकी व्याख्याओं ने मदद की या नहीं। यदि वह हर संकेत पर उत्साह से प्रतिक्रिया देती है लेकिन वास्तविक शिक्षार्थी से कभी मिलती-जुलती नहीं, तो परिणामी माप उन छात्रों के बारे में कुछ नहीं बताती जिनसे तैनात ट्यूटर अंततः मिलेगा।
यह एक शोध पत्र से आगे क्यों मायने रखता है
AI ट्यूटरिंग ने प्रत्येक शिक्षार्थी की कमजोरियों के अनुरूप शिक्षण के वादे पर भारी निवेश आकर्षित किया है, लेकिन व्यक्तिगतकरण इस बात के साक्ष्य पर निर्भर करता है कि किसके लिए क्या काम करता है। यदि साक्ष्य की पाइपलाइन छात्रों की भर्ती की लागत से अवरुद्ध है, तो प्रगति बजट के हिसाब से बँट जाती है। अनुकरणित छात्र बड़े भाषा मॉडलों की तेज़ी से आगे बढ़ती क्षमताओं और उनके ऊपर बने धीमी गति से चलने वाले ट्यूटरिंग सिस्टमों के बीच की खाई को पाटने का एक तरीका देते हैं।
- ट्यूटरिंग रणनीतियों की तुलना बहुत तेज़ी से की जा सकती है, क्योंकि प्रतिकृतियाँ हफ्तों के बजाय सेकंडों में फ़ीडबैक देती हैं।
- शोधकर्ता ऐसे प्रयोग चला सकते हैं जो वास्तविक शिक्षार्थियों को शामिल करते हुए अव्यावहारिक या नैतिक रूप से जटिल होंगे।
- असामान्य छात्र, जिनमें असामान्य त्रुटि पैटर्न वाले या बहुत कम दर्ज काम वाले छात्र शामिल हैं, अदृश्य रहने के बजाय परीक्षण योग्य हो जाते हैं।
- मूल्यांकन पूरी कक्षा को कवर कर सकता है, न कि उन मुट्ठी भर छात्रों को जो संयोग से सबसे ज़्यादा काम जमा करते हैं।
डिज़ाइन में निहित सीमाएँ भी हैं। प्रतिकृतियाँ पूल किए गए डेटा में मौजूद जो भी कमियाँ और पूर्वाग्रह हैं, उन्हें विरासत में लेती हैं, और एक अनुकरणित शिक्षार्थी उतना ही विश्वसनीय हो सकता है जितने विश्वसनीय वे रिकॉर्ड हैं जिनसे उसे आकार दिया गया। तीन निबंधों द्वारा प्रस्तुत एक छात्र अभी भी तीन निबंधों द्वारा ही प्रस्तुत होता है, चाहे मॉडल को कितनी ही चतुराई से अनुकूलित किया गया हो।
पेपर की अपनी रूपरेखा क्षेत्र के लिए अगला प्रश्न सुझाती है: यह साबित करना कि अनुकरणित छात्रों के सापेक्ष मापे गए सुधार उन कक्षाओं में भी लागू होते हैं जिनका उन छात्रों को प्रतिनिधित्व करना है। जब तक वह स्थानांतरण प्रदर्शित नहीं हो जाता, StudentSim को बेहतर ट्यूटरिंग की खोज को तेज़ करने के तरीके के रूप में समझना सबसे उपयुक्त है, न कि उन शिक्षार्थियों के प्रतिस्थापन के रूप में जिनके व्यवहार की वह नकल करता है।
यह लेख The Decoder की रिपोर्टिंग पर आधारित है। मूल लेख पढ़ें।
Originally published on the-decoder.com




