गुगलचे TimesFM-3 वक्राच्या पलीकडे पाहते
गुगल रिसर्चने TimesFM-3 सादर केले आहे, हे एक अंदाज लावणारे मॉडेल आहे जे टाइम सीरीजमधील भविष्यातील मूल्यांचा अंदाज लावण्यासाठी तयार केले आहे — दैनंदिन विक्री आकडे, वाहतूक गणना किंवा सेन्सर रीडिंग्ज म्हणून दिसणाऱ्या संख्यांच्या क्रमबद्ध प्रवाहांचा — तसेच त्या संख्यांभोवतीच्या संदर्भाचाही विचार करते. हे प्रकाशन प्रत्येक डेटासेटसाठी पुन्हा तयार केल्या जाणाऱ्या विशेष अभियांत्रिकी प्रकल्पाऐवजी अंदाज लावण्याला सामान्य-उद्देश क्षमता बनवण्याच्या प्रयत्नातील आणखी एक पाऊल आहे.
मुख्य गृहीतक हे आहे की खरे अंदाज क्वचितच एकाच चलावर अवलंबून असतात. गुगल हा मुद्दा आइस्क्रीमच्या विक्रीचा अंदाज लावू पाहणाऱ्या किरकोळ साखळीच्या उदाहरणाने स्पष्ट करते. केवळ पूर्वीच्या आइस्क्रीम खरेदीकडे पाहणारे मॉडेल बरेच काही दुर्लक्षित करेल: वॅफल कोन आणि सिरपसारख्या संबंधित वस्तूंची विक्री, स्टोअरजवळील ऐतिहासिक पादचारी वाहतूक, हवामानाची परिस्थिती, नियोजित सवलत मोहिमा आणि सुट्ट्या या सर्वांचा मागणीवर परिणाम होतो. TimesFM-3 हे प्रत्येकाला स्वतंत्र समस्या मानण्याऐवजी ती सर्व संकेत एका अंदाजात समाविष्ट करण्यासाठी तयार केले आहे.
पॅचेस, नॉर्मलायझेशन आणि द्वि-दिशात्मक ट्रान्सफॉर्मर
स्थापत्यरचनेच्या दृष्टीने TimesFM-3 ट्रान्सफॉर्मर कुटुंबातच राहते, जे त्याच्या पूर्ववर्तींनी वापरलेलेच मूळ डिझाइन आहे. परंतु टाइम सीरीज डेटा नेटवर्कमध्ये कसा प्रवेश करतो याबाबत ते जाणीवपूर्वक निवडी करते. मॉडेलला एका वेळी एक डेटा पॉइंट देण्याऐवजी ते 32 सलग पॉइंट्स एका पॅचमध्ये गटबद्ध करते. तो पॅच मॉडेल विचार करतो ते एकक बनतो, ज्यामुळे क्रम लहान होतो आणि नेटवर्कला स्थानिक आकाराचे व्यापक दृश्य मिळते.
गुगल प्रत्येक सीरीजला एका समान प्रमाणात नॉर्मलाइझ देखील करते. हे महत्त्वाचे आहे कारण टाइम सीरीज अत्यंत भिन्न परिमाणांमध्ये येतात — दररोज विकल्या जाणाऱ्या मोजक्या युनिट्स ते औद्योगिक सेन्सरमधील लाखो रीडिंग्ज — आणि त्यांची थेट तुलना करणे निरर्थक ठरेल. प्रत्येक सीरीजला सामायिक आधाररेषेवर आणल्याने मॉडेलला अत्यंत भिन्न क्षेत्रांतील नमुन्यांना तुलनीय मानता येते.
त्यानंतर प्रक्रिया दोन आलटून पालटून येणाऱ्या दिशांमध्ये चालते. काल-अक्षावर, मॉडेल एकाच सीरीजमधील नमुने शोधते आणि ते केवळ पूर्वीच्या मूल्यांचाच वापर करते जेणेकरून भविष्यातील माहिती अंदाजात गळती करू शकणार नाही. सीरीजमध्ये, ते दिलेल्या क्षणी प्रत्येक चलाची तुलना करते आणि त्यांचा परस्पर संबंध शिकते. हे आंतर-सीरीज दृश्यच मॉडेलला एका उत्पादनावरील सवलतीमुळे दुसऱ्याची विक्री बदलण्यासारखे परिणाम ओळखू देते — हा असा संबंध जो एकल-सीरीज मॉडेल कधीही पाहू शकणार नाही.

गुगलचे इनपुट सेटअपचे चित्रण डेटाला रंग-कोड देते: एक निळी लक्ष्य सीरीज, केवळ इतिहासातून ज्ञात जांभळी चले, आणि ज्ञात भविष्यातील घटनांसाठी हिरवी टोकन्स ज्यांच्या प्रतिनिधित्वात आगामी पॅचेस आधीच समाविष्ट आहेत.
अतिरिक्त संकेताच्या तीन जाती
गुगलच्या मते, TimesFM-3 तीन वेगळ्या प्रकारचा पूरक डेटा स्वीकारते.
- ते संयुक्तपणे अंदाज लावते असे कोव्हेरिएट्स. मॉडेल एकाच वेळी अनेक संबंधित चलांचा अंदाज लावू शकते, जसे की वेगवेगळ्या आइस्क्रीम फ्लेवर्सची मागणी, प्रत्येकाला वेगळे न मानता.
- ऐतिहासिकदृष्ट्या ज्ञात चले. पूर्वीच्या पादचारी वाहतुकीसारखे घटक वर्तमानापर्यंत उपलब्ध असतात पण त्यापुढे नाहीत, आणि मॉडेल त्यांना संदर्भ म्हणून समाविष्ट करते.
- ज्ञात भविष्यातील घटना. नियोजित जाहिराती, सवलत वेळापत्रके आणि हवामानाचे अंदाज अशा घटना आहेत ज्यांची वेळ आधीच माहीत असते, त्यामुळे मॉडेल त्यांना केवळ इतिहासातून अनुमान न काढता पुढे पाहणारे इनपुट म्हणून वापरू शकते.
ही तिसरी श्रेणीच TimesFM-3 शास्त्रीय सांख्यिकीय अंदाजापासून सर्वाधिक तीव्रपणे वेगळे होते ते ठिकाण आहे. जाहिरात दिनदर्शिका हा शोधला जाण्याची वाट पाहणारा नमुना नाही — ती भविष्याबद्दलची वस्तुस्थिती आहे. हे मॉडेल अशा वस्तुस्थिती इनपुट म्हणून स्वीकारण्यासाठी अभियांत्रिक केलेले आहे.
टप्प्याटप्प्याने ऐवजी एकाच फेरीत
मॉडेलच्या पूर्वीच्या आवृत्त्या एका वेळी एक ब्लॉक अंदाज तयार करत. प्रत्येक नवीन ब्लॉक मागील अंदाजावर उभारला जात असे, ही पद्धत गुगल संथ, गणन-जड आणि चक्रवाढ त्रुटीस बळी पडणारी अशी वर्णन करते: क्रमाच्या सुरुवातीची छोटी चूक त्यानंतरच्या सर्व गोष्टी विकृत करू शकते. ऑटोरेग्रेसिव्ह अंदाजात हा परिचित अपयशाचा प्रकार आहे, जिथे मॉडेल प्रत्यक्षात स्वतःच्याच आउटपुटवर पोसले जाते.
TimesFM-3 ते चक्र सोडून देते. ते प्रत्येक भविष्यातील काल-टप्प्याला रिकामे प्लेसहोल्डर नेमून देते आणि ती एकाच झोतात पूर्ण करते. गुगल ह्याला वन-शॉट अंदाज म्हणते, आणि व्यावहारिक फरक आइस्क्रीमच्या परिस्थितीत दिसून येतो. केवळ पूर्वीची विक्री जाणणारे मॉडेल प्रस्थापित साप्ताहिक लय सहज चालू ठेवेल, अजून न घडलेल्या जाहिरातीकडे दुर्लक्ष करून. TimesFM-3 ला सवलत वेळापत्रक मिळाल्यावर, ते टप्प्याटप्प्याने पुढे न जाता एकाच फेरीत अंदाज समायोजित करू शकते.
प्रत्येक टप्प्याला नऊ मूल्ये: अनिश्चितता अंगभूत
प्रत्येक काल-टप्प्यासाठी एकच बिंदू अंदाज देण्याऐवजी, TimesFM-3 प्रत्येक टप्प्याला नऊ मूल्ये देते. ती मूल्ये अंदाजाची श्रेणी आणि अनिश्चितता टिपण्यासाठी आहेत — असा अंदाज जो केवळ काय घडण्याची शक्यता आहे हेच नाही तर मॉडेल किती आत्मविश्वासू आहे हेही सांगतो. नियोजनाच्या दृष्टीने, हा फरक केवळ कोरड्या संख्येपेक्षा बऱ्याचदा अधिक उपयुक्त ठरतो, कारण त्यामुळे पुढील प्रणालींना जोखमीबद्दल विचार करणे, मालसाठा बफर करणे किंवा क्षमता राखून ठेवणे शक्य होते.

ट्रिलियन-पॉइंट प्रमाणात प्रशिक्षित, झीरो-शॉट तैनात
मॉडेलमध्ये 330 दशलक्ष पॅरामीटर्स आहेत आणि गुगलच्या मते ते एकूण एक ट्रिलियनहून अधिक डेटा पॉइंट्स असलेल्या वास्तविक व कृत्रिम टाइम सीरीजच्या मिश्रणावर प्रशिक्षित केले गेले आहे. त्याच्या पूर्ववर्तींप्रमाणेच ते झीरो-शॉट चालते: नवीन कार्यासाठी त्याला अतिरिक्त प्रशिक्षणाची आवश्यकता नाही. हा गुणधर्म या प्रस्तावाचा केंद्रबिंदू आहे. प्रत्येक नवीन अंदाज समस्येसाठी लेबल केलेला डेटासेट जमवून मॉडेल फिट करण्याऐवजी, एखादा व्यावसायिक TimesFM-3 ला एका सीरीजकडे आणि तिच्याशी संबंधित संकेतांकडे वळवू शकतो आणि उपयुक्त आउटपुटची अपेक्षा करू शकतो.
झीरो-शॉट कामगिरीच अंदाजासाठी फाउंडेशन-मॉडेल दृष्टिकोन आकर्षक का बनवते हे देखील ठरवते. अंदाजाच्या समस्या सर्वत्र आहेत — मालसाठा, ऊर्जा भार, कर्मचारी नियोजन, लॉजिस्टिक्स, क्षमता नियोजन — पण ऐतिहासिकदृष्ट्या प्रत्येकासाठी स्वतःची पाइपलाइन, स्वतःची वैशिष्ट्ये आणि स्वतःची पडताळणी व्यवस्था आवश्यक होती. त्यांच्यात सामान्यीकरण करणारे एकच मॉडेल अंदाज प्रणाली कोण बनवू शकतो आणि किती वेगाने हे बदलते.
प्रशिक्षण डेटाची व्याप्ती येथे पॅरामीटर संख्येइतकीच महत्त्वाची आहे. कृत्रिम सीरीज वास्तविक सीरीजमध्ये मिसळून, गुगल कोणत्याही एका क्षेत्राला पुरवता येण्यापेक्षा अधिक विविध आकार, ऋतुचक्राची लय आणि धक्का-नमुने मॉडेलसमोर ठेवू शकते. ही विविधताच सामान्यीकरणाचा कच्चा माल आहे, आणि झीरो-शॉट दावा अखेरीस त्यावरच आधारित आहे.
संख्यांसाठी फाउंडेशन मॉडेल्सवरील व्यापक पैज
TimesFM-3 दोन प्रवृत्तींच्या छेदनबिंदूवर बसते: मजकूर व प्रतिमांच्या पलीकडे फाउंडेशन मॉडेल्सचे विस्तारीकरण, आणि चांगल्या कार्यात्मक अंदाजाची दीर्घकालीन मागणी. गुगलचे मांडणे असे आहे की संदर्भच भोळसट बहिर्वेशन आणि उपयुक्त अंदाज यांत फरक करतो, आणि स्थापत्यरचना या दाव्याला थेट प्रतिसाद आहे — कार्यक्षमतेसाठी पॅचेस, तुलनीयतेसाठी नॉर्मलायझेशन, संबंधांसाठी काळ व चले दोन्हींवर अटेंशन, आणि सुसंगतीसाठी वन-शॉट डिकोडर.
गोंधळलेल्या वास्तववादी डेटावर हे संयोजन टिकते का हा खुला प्रश्न राहतो, जसा तो कोणत्याही झीरो-शॉट प्रणालीसाठी राहतो. पण दिशा स्पष्ट आहे: अंदाजाकडे सांख्यिकीय कामापेक्षा सामान्य तर्क-कार्य म्हणून अधिक पाहिले जात आहे, ज्यामध्ये विक्री डेटा, हवामान आणि सवलत दिनदर्शिका सर्व एकाच इनपुटमध्ये बसतात. जाहिराती चालवणाऱ्या किरकोळ विक्रेत्यांसाठी, भार संतुलित करणाऱ्या उपयोगितांसाठी आणि क्षमता नियोजन करणाऱ्या ऑपरेटरांसाठी, आकर्षण सरळ आहे — मॉडेलला आधीच दिनदर्शिकेवर असलेल्या घटनांचा अंदाज लावण्यास सांगितले जाते, केवळ गेल्या वर्षाची रेषा वाढवण्यास नाही.
हा लेख The Decoder च्या अहवालावर आधारित आहे. मूळ लेख वाचा.
Originally published on the-decoder.com




