Google का TimesFM-3 वक्र से आगे देखता है
Google Research ने TimesFM-3 पेश किया है, एक पूर्वानुमान मॉडल जो टाइम सीरीज़ — यानी संख्याओं की क्रमबद्ध धाराएँ, जो दैनिक बिक्री के आँकड़ों, ट्रैफ़िक गणनाओं या सेंसर रीडिंग के रूप में सामने आती हैं — में भविष्य के मूल्यों का अनुमान लगाने के लिए बनाया गया है, और साथ ही उन संख्याओं के आसपास के संदर्भ को भी तौलता है। यह रिलीज़ पूर्वानुमान को हर डेटासेट के लिए दोबारा बनाए जाने वाले विशेष इंजीनियरिंग प्रोजेक्ट के बजाय एक सामान्य-उद्देश्य क्षमता में बदलने की दिशा में एक और कदम है।
इसका मुख्य आधार यह है कि असली पूर्वानुमान शायद ही कभी किसी एक चर पर निर्भर होता है। Google इस बात को एक रिटेल चेन के उदाहरण से समझाता है जो आइसक्रीम की बिक्री का अनुमान लगाने की कोशिश कर रही है। केवल पिछली आइसक्रीम खरीद को देखने वाला मॉडल बहुत कुछ चूक जाएगा: वफ़ल कोन और सिरप जैसी संबंधित वस्तुओं की बिक्री, स्टोर के पास का ऐतिहासिक फुट ट्रैफ़िक, मौसम की स्थिति, नियोजित छूट अभियान और छुट्टियाँ — ये सब मांग को आकार देते हैं। TimesFM-3 को इन संकेतों को एक ही भविष्यवाणी में समेटने के लिए डिज़ाइन किया गया है, न कि हर एक को अलग समस्या की तरह देखने के लिए।
पैच, नॉर्मलाइज़ेशन और दो-दिशात्मक Transformer
आर्किटेक्चर के लिहाज़ से TimesFM-3 Transformer परिवार में ही बना हुआ है, वही आधार डिज़ाइन जो इसके पूर्ववर्तियों ने इस्तेमाल किया था। लेकिन यह इस बारे में जानबूझकर चुनाव करता है कि टाइम सीरीज़ डेटा नेटवर्क में कैसे प्रवेश करता है। मॉडल को एक बार में एक डेटा पॉइंट देने के बजाय, यह 32 लगातार पॉइंट को एक पैच में समूहित करता है। यही पैच वह इकाई बन जाता है जिस पर मॉडल विचार करता है, जिससे अनुक्रम छोटा हो जाता है और नेटवर्क को स्थानीय आकृति का व्यापक दृश्य मिलता है।
Google हर सीरीज़ को एक साझा पैमाने पर भी नॉर्मलाइज़ करता है। यह इसलिए मायने रखता है क्योंकि टाइम सीरीज़ बेहद अलग-अलग परिमाणों में आती हैं — प्रति दिन बिकी कुछ इकाइयाँ बनाम किसी औद्योगिक सेंसर से आने वाली लाखों रीडिंग — और उनकी सीधी तुलना करना अर्थहीन होगा। हर सीरीज़ को एक साझा आधार पर स्केल करने से मॉडल बहुत अलग-अलग क्षेत्रों के पैटर्न को तुलनीय मान सकता है।
इसके बाद प्रोसेसिंग दो बारी-बारी दिशाओं में चलती है। समय अक्ष के साथ, मॉडल एक ही सीरीज़ के भीतर पैटर्न खोजता है, और यह केवल पिछले मूल्यों का उपयोग करता है ताकि भविष्य की जानकारी भविष्यवाणी में रिस न सके। सीरीज़ों के आर-पार, यह किसी दिए गए क्षण पर हर चर की तुलना करता है और सीखता है कि वे कैसे संबंधित हैं। यही क्रॉस-सीरीज़ दृश्य मॉडल को ऐसे प्रभावों को पकड़ने देता है जैसे एक उत्पाद पर छूट दूसरे की बिक्री को बदल देती है — ऐसा संबंध जो एकल-सीरीज़ मॉडल कभी नहीं देख पाएगा।

Google का इनपुट सेटअप का चित्रण डेटा को रंग-कोडित करता है: एक नीली लक्ष्य सीरीज़, बैंगनी वे चर जो केवल इतिहास से ज्ञात हैं, और हरे टोकन ज्ञात भविष्य की घटनाओं के लिए जिनके प्रतिनिधित्व में आने वाले पैच पहले से शामिल हैं।
अतिरिक्त संकेत के तीन प्रकार
Google के अनुसार, TimesFM-3 तीन अलग-अलग प्रकार के पूरक डेटा स्वीकार करता है।
- वे कोवेरिएट जिन्हें यह संयुक्त रूप से अनुमानित करता है। मॉडल एक साथ कई संबंधित चरों का पूर्वानुमान लगा सकता है, जैसे आइसक्रीम के अलग-अलग फ्लेवर की मांग, बजाय हर एक को अलग-अलग देखने के।
- ऐतिहासिक रूप से ज्ञात चर। पिछले फुट ट्रैफ़िक जैसे कारक वर्तमान तक उपलब्ध होते हैं लेकिन उससे आगे नहीं, और मॉडल उन्हें संदर्भ के रूप में शामिल करता है।
- ज्ञात भविष्य की घटनाएँ। नियोजित प्रमोशन, छूट कार्यक्रम और मौसम पूर्वानुमान ऐसी घटनाएँ हैं जिनका समय पहले से ज्ञात है, इसलिए मॉडल उन्हें केवल इतिहास से अनुमान लगाने के बजाय भविष्य-उन्मुख इनपुट के रूप में उपयोग कर सकता है।
यही तीसरी श्रेणी वह जगह है जहाँ TimesFM-3 शास्त्रीय सांख्यिकीय पूर्वानुमान से सबसे तेज़ी से अलग होता है। प्रमोशन कैलेंडर कोई ऐसा पैटर्न नहीं है जिसकी खोज बाकी हो — यह भविष्य के बारे में एक तथ्य है। यह मॉडल ऐसे तथ्यों को इनपुट के रूप में स्वीकार करने के लिए इंजीनियर किया गया है।
चरण-दर-चरण के बजाय एक ही शॉट
मॉडल के पहले के संस्करण एक बार में एक ब्लॉक के हिसाब से भविष्यवाणियाँ बनाते थे। हर नया ब्लॉक पिछली भविष्यवाणी पर आधारित होता था, जिसे Google धीमा, कंप्यूट-भारी और संचयी त्रुटि के प्रति संवेदनशील बताता है: अनुक्रम में शुरुआती एक छोटी गलती आगे आने वाली हर चीज़ को विकृत कर सकती थी। यह ऑटोरिग्रेसिव पूर्वानुमान में एक परिचित विफलता मोड है, जहाँ मॉडल असल में अपने ही आउटपुट पर निर्भर हो जाता है।
TimesFM-3 इस लूप को छोड़ देता है। यह हर भविष्य के समय चरण को खाली प्लेसहोल्डर सौंपता है और उन्हें एक ही झाड़ू में पूरा करता है। Google इसे वन-शॉट पूर्वानुमान कहता है, और व्यावहारिक अंतर आइसक्रीम परिदृश्य में दिखता है। जो मॉडल केवल पिछली बिक्री जानता है, वह बस स्थापित साप्ताहिक लय को जारी रखेगा, उस प्रमोशन से अनजान जो अभी हुआ ही नहीं। जैसे ही TimesFM-3 को छूट कार्यक्रम मिलता है, यह एक ही पास में पूर्वानुमान को समायोजित कर सकता है, बजाय कदम-दर-कदम आगे बढ़ने के।
हर चरण पर नौ मान: अनिश्चितता अंतर्निहित
हर समय चरण के लिए एक ही बिंदु अनुमान देने के बजाय, TimesFM-3 प्रति चरण नौ मान देता है। ये मान भविष्यवाणी की सीमा और अनिश्चितता को पकड़ने के लिए हैं — ऐसा पूर्वानुमान जो न केवल यह बताता है कि क्या होने की संभावना है, बल्कि यह भी कि मॉडल कितना आश्वस्त है। योजना बनाने के उद्देश्यों के लिए, यह अंतर अक्सर एक खाली संख्या से अधिक उपयोगी होता है, क्योंकि यह डाउनस्ट्रीम सिस्टम को जोखिम, बफ़र इन्वेंटरी या अतिरिक्त क्षमता के बारे में सोचने देता है।

ट्रिलियन-पॉइंट स्केल पर प्रशिक्षित, ज़ीरो-शॉट पर तैनात
Google के अनुसार, मॉडल में 330 मिलियन पैरामीटर हैं और इसे असली व सिंथेटिक टाइम सीरीज़ के मिश्रण पर प्रशिक्षित किया गया है, जो कुल मिलाकर एक ट्रिलियन से अधिक डेटा पॉइंट हैं। अपने पूर्ववर्तियों की तरह, यह ज़ीरो-शॉट काम करता है: किसी नए कार्य के लिए इसे अतिरिक्त प्रशिक्षण की ज़रूरत नहीं होती। यही गुण इसके प्रस्ताव का केंद्र है। हर नई पूर्वानुमान समस्या के लिए लेबल किया गया डेटासेट जुटाने और मॉडल फिट करने के बजाय, एक प्रैक्टिशनर TimesFM-3 को किसी सीरीज़ और उससे जुड़े संकेतों की ओर इंगित कर सकता है और उपयोगी आउटपुट की अपेक्षा कर सकता है।
ज़ीरो-शॉट प्रदर्शन ही वह चीज़ है जो पूर्वानुमान के लिए फाउंडेशन-मॉडल दृष्टिकोण को शुरू से आकर्षक बनाती है। पूर्वानुमान की समस्याएँ हर जगह हैं — इन्वेंटरी, ऊर्जा लोड, स्टाफिंग, लॉजिस्टिक्स, क्षमता योजना — लेकिन ऐतिहासिक रूप से हर एक के लिए अपनी पाइपलाइन, अपनी विशेषताएँ और अपनी मान्यता व्यवस्था की ज़रूरत पड़ती थी। एक ही मॉडल जो इन सबमें सामान्यीकरण करता है, यह बदल देता है कि पूर्वानुमान प्रणाली कौन बना सकता है और कितनी जल्दी।
यहाँ प्रशिक्षण डेटा की व्यापकता पैरामीटर संख्या जितनी ही मायने रखती है। सिंथेटिक सीरीज़ को असली सीरीज़ के साथ मिलाकर, Google मॉडल को किसी भी एक क्षेत्र की तुलना में अधिक विविध आकृतियों, मौसमी लय और झटके के पैटर्न से परिचित करा सकता है। यही विविधता सामान्यीकरण की कच्ची सामग्री है, और ज़ीरो-शॉट दावा अंततः इसी पर टिका है।
संख्याओं के लिए फाउंडेशन मॉडल पर व्यापक दांव
TimesFM-3 दो प्रवृत्तियों के संगम पर बैठता है: टेक्स्ट और इमेज से आगे फाउंडेशन मॉडल का स्केलिंग, और बेहतर परिचालन पूर्वानुमान की लंबे समय से चली आ रही मांग। Google का ढाँचा यह है कि संदर्भ ही एक भोले एक्सट्रपोलेशन को उपयोगी भविष्यवाणी से अलग करता है, और आर्किटेक्चर उस दावे की सीधी प्रतिक्रिया है — दक्षता के लिए पैच, तुलनीयता के लिए नॉर्मलाइज़ेशन, संबंधों के लिए समय और चर दोनों पर ध्यान, और सुसंगति के लिए वन-शॉट डिकोडर।
क्या यह संयोजन गंदे असली दुनिया के डेटा में टिक पाता है, यह खुला सवाल बना हुआ है, जैसा किसी भी ज़ीरो-शॉट सिस्टम के लिए होता है। लेकिन दिशा स्पष्ट है: पूर्वानुमान को अब एक सांख्यिकीय काम से कम और एक सामान्य तर्क कार्य के रूप में अधिक देखा जा रहा है, ऐसा कार्य जिसमें बिक्री डेटा, मौसम और छूट कैलेंडर सब एक ही इनपुट में आते हैं। प्रमोशन चलाने वाले रिटेलरों, लोड संतुलित करने वाली यूटिलिटीज़ और क्षमता की योजना बनाने वाले ऑपरेटरों के लिए आकर्षण सीधा है — मॉडल से उन घटनाओं का पूर्वानुमान लगाने को कहा जाता है जो पहले से कैलेंडर पर हैं, न कि केवल पिछले साल की रेखा को आगे बढ़ाने के लिए।
This article is based on reporting by The Decoder. Read the original article.
Originally published on the-decoder.com





