Google का TimesFM-3 वक्र से आगे देखता है

Google Research ने TimesFM-3 पेश किया है, एक पूर्वानुमान मॉडल जो टाइम सीरीज़ — यानी संख्याओं की क्रमबद्ध धाराएँ, जो दैनिक बिक्री के आँकड़ों, ट्रैफ़िक गणनाओं या सेंसर रीडिंग के रूप में सामने आती हैं — में भविष्य के मूल्यों का अनुमान लगाने के लिए बनाया गया है, और साथ ही उन संख्याओं के आसपास के संदर्भ को भी तौलता है। यह रिलीज़ पूर्वानुमान को हर डेटासेट के लिए दोबारा बनाए जाने वाले विशेष इंजीनियरिंग प्रोजेक्ट के बजाय एक सामान्य-उद्देश्य क्षमता में बदलने की दिशा में एक और कदम है।

इसका मुख्य आधार यह है कि असली पूर्वानुमान शायद ही कभी किसी एक चर पर निर्भर होता है। Google इस बात को एक रिटेल चेन के उदाहरण से समझाता है जो आइसक्रीम की बिक्री का अनुमान लगाने की कोशिश कर रही है। केवल पिछली आइसक्रीम खरीद को देखने वाला मॉडल बहुत कुछ चूक जाएगा: वफ़ल कोन और सिरप जैसी संबंधित वस्तुओं की बिक्री, स्टोर के पास का ऐतिहासिक फुट ट्रैफ़िक, मौसम की स्थिति, नियोजित छूट अभियान और छुट्टियाँ — ये सब मांग को आकार देते हैं। TimesFM-3 को इन संकेतों को एक ही भविष्यवाणी में समेटने के लिए डिज़ाइन किया गया है, न कि हर एक को अलग समस्या की तरह देखने के लिए।

पैच, नॉर्मलाइज़ेशन और दो-दिशात्मक Transformer

आर्किटेक्चर के लिहाज़ से TimesFM-3 Transformer परिवार में ही बना हुआ है, वही आधार डिज़ाइन जो इसके पूर्ववर्तियों ने इस्तेमाल किया था। लेकिन यह इस बारे में जानबूझकर चुनाव करता है कि टाइम सीरीज़ डेटा नेटवर्क में कैसे प्रवेश करता है। मॉडल को एक बार में एक डेटा पॉइंट देने के बजाय, यह 32 लगातार पॉइंट को एक पैच में समूहित करता है। यही पैच वह इकाई बन जाता है जिस पर मॉडल विचार करता है, जिससे अनुक्रम छोटा हो जाता है और नेटवर्क को स्थानीय आकृति का व्यापक दृश्य मिलता है।

Google हर सीरीज़ को एक साझा पैमाने पर भी नॉर्मलाइज़ करता है। यह इसलिए मायने रखता है क्योंकि टाइम सीरीज़ बेहद अलग-अलग परिमाणों में आती हैं — प्रति दिन बिकी कुछ इकाइयाँ बनाम किसी औद्योगिक सेंसर से आने वाली लाखों रीडिंग — और उनकी सीधी तुलना करना अर्थहीन होगा। हर सीरीज़ को एक साझा आधार पर स्केल करने से मॉडल बहुत अलग-अलग क्षेत्रों के पैटर्न को तुलनीय मान सकता है।

इसके बाद प्रोसेसिंग दो बारी-बारी दिशाओं में चलती है। समय अक्ष के साथ, मॉडल एक ही सीरीज़ के भीतर पैटर्न खोजता है, और यह केवल पिछले मूल्यों का उपयोग करता है ताकि भविष्य की जानकारी भविष्यवाणी में रिस न सके। सीरीज़ों के आर-पार, यह किसी दिए गए क्षण पर हर चर की तुलना करता है और सीखता है कि वे कैसे संबंधित हैं। यही क्रॉस-सीरीज़ दृश्य मॉडल को ऐसे प्रभावों को पकड़ने देता है जैसे एक उत्पाद पर छूट दूसरे की बिक्री को बदल देती है — ऐसा संबंध जो एकल-सीरीज़ मॉडल कभी नहीं देख पाएगा।

Architectural diagram of TimesFM-3, showing four time series in patches of 32 points each, a token grid consisting of causal temporal attention and full variate attention, and the predicted target series T1 and T2.
Blue marks the target series, purple a variable known only historically, and green a known future event whose tokens already include upcoming patches. | Image: Google

Google का इनपुट सेटअप का चित्रण डेटा को रंग-कोडित करता है: एक नीली लक्ष्य सीरीज़, बैंगनी वे चर जो केवल इतिहास से ज्ञात हैं, और हरे टोकन ज्ञात भविष्य की घटनाओं के लिए जिनके प्रतिनिधित्व में आने वाले पैच पहले से शामिल हैं।

अतिरिक्त संकेत के तीन प्रकार

Google के अनुसार, TimesFM-3 तीन अलग-अलग प्रकार के पूरक डेटा स्वीकार करता है।

  • वे कोवेरिएट जिन्हें यह संयुक्त रूप से अनुमानित करता है। मॉडल एक साथ कई संबंधित चरों का पूर्वानुमान लगा सकता है, जैसे आइसक्रीम के अलग-अलग फ्लेवर की मांग, बजाय हर एक को अलग-अलग देखने के।
  • ऐतिहासिक रूप से ज्ञात चर। पिछले फुट ट्रैफ़िक जैसे कारक वर्तमान तक उपलब्ध होते हैं लेकिन उससे आगे नहीं, और मॉडल उन्हें संदर्भ के रूप में शामिल करता है।
  • ज्ञात भविष्य की घटनाएँ। नियोजित प्रमोशन, छूट कार्यक्रम और मौसम पूर्वानुमान ऐसी घटनाएँ हैं जिनका समय पहले से ज्ञात है, इसलिए मॉडल उन्हें केवल इतिहास से अनुमान लगाने के बजाय भविष्य-उन्मुख इनपुट के रूप में उपयोग कर सकता है।

यही तीसरी श्रेणी वह जगह है जहाँ TimesFM-3 शास्त्रीय सांख्यिकीय पूर्वानुमान से सबसे तेज़ी से अलग होता है। प्रमोशन कैलेंडर कोई ऐसा पैटर्न नहीं है जिसकी खोज बाकी हो — यह भविष्य के बारे में एक तथ्य है। यह मॉडल ऐसे तथ्यों को इनपुट के रूप में स्वीकार करने के लिए इंजीनियर किया गया है।

चरण-दर-चरण के बजाय एक ही शॉट

मॉडल के पहले के संस्करण एक बार में एक ब्लॉक के हिसाब से भविष्यवाणियाँ बनाते थे। हर नया ब्लॉक पिछली भविष्यवाणी पर आधारित होता था, जिसे Google धीमा, कंप्यूट-भारी और संचयी त्रुटि के प्रति संवेदनशील बताता है: अनुक्रम में शुरुआती एक छोटी गलती आगे आने वाली हर चीज़ को विकृत कर सकती थी। यह ऑटोरिग्रेसिव पूर्वानुमान में एक परिचित विफलता मोड है, जहाँ मॉडल असल में अपने ही आउटपुट पर निर्भर हो जाता है।

TimesFM-3 इस लूप को छोड़ देता है। यह हर भविष्य के समय चरण को खाली प्लेसहोल्डर सौंपता है और उन्हें एक ही झाड़ू में पूरा करता है। Google इसे वन-शॉट पूर्वानुमान कहता है, और व्यावहारिक अंतर आइसक्रीम परिदृश्य में दिखता है। जो मॉडल केवल पिछली बिक्री जानता है, वह बस स्थापित साप्ताहिक लय को जारी रखेगा, उस प्रमोशन से अनजान जो अभी हुआ ही नहीं। जैसे ही TimesFM-3 को छूट कार्यक्रम मिलता है, यह एक ही पास में पूर्वानुमान को समायोजित कर सकता है, बजाय कदम-दर-कदम आगे बढ़ने के।

हर चरण पर नौ मान: अनिश्चितता अंतर्निहित

हर समय चरण के लिए एक ही बिंदु अनुमान देने के बजाय, TimesFM-3 प्रति चरण नौ मान देता है। ये मान भविष्यवाणी की सीमा और अनिश्चितता को पकड़ने के लिए हैं — ऐसा पूर्वानुमान जो न केवल यह बताता है कि क्या होने की संभावना है, बल्कि यह भी कि मॉडल कितना आश्वस्त है। योजना बनाने के उद्देश्यों के लिए, यह अंतर अक्सर एक खाली संख्या से अधिक उपयोगी होता है, क्योंकि यह डाउनस्ट्रीम सिस्टम को जोखिम, बफ़र इन्वेंटरी या अतिरिक्त क्षमता के बारे में सोचने देता है।

Scatter plot for the Gift-Eval benchmark showing the average rank for point and probability forecasts; TimesFM-3 is shown in orange at the bottom left, ahead of Chronos-2, Toto-2.0, TiRex-2, and TimesFM-2.5.
Lower left is better. TimesFM-3 leads Gift-Eval by a wide margin, even when limited to a single variable. | Image: Google

ट्रिलियन-पॉइंट स्केल पर प्रशिक्षित, ज़ीरो-शॉट पर तैनात

Google के अनुसार, मॉडल में 330 मिलियन पैरामीटर हैं और इसे असली व सिंथेटिक टाइम सीरीज़ के मिश्रण पर प्रशिक्षित किया गया है, जो कुल मिलाकर एक ट्रिलियन से अधिक डेटा पॉइंट हैं। अपने पूर्ववर्तियों की तरह, यह ज़ीरो-शॉट काम करता है: किसी नए कार्य के लिए इसे अतिरिक्त प्रशिक्षण की ज़रूरत नहीं होती। यही गुण इसके प्रस्ताव का केंद्र है। हर नई पूर्वानुमान समस्या के लिए लेबल किया गया डेटासेट जुटाने और मॉडल फिट करने के बजाय, एक प्रैक्टिशनर TimesFM-3 को किसी सीरीज़ और उससे जुड़े संकेतों की ओर इंगित कर सकता है और उपयोगी आउटपुट की अपेक्षा कर सकता है।

ज़ीरो-शॉट प्रदर्शन ही वह चीज़ है जो पूर्वानुमान के लिए फाउंडेशन-मॉडल दृष्टिकोण को शुरू से आकर्षक बनाती है। पूर्वानुमान की समस्याएँ हर जगह हैं — इन्वेंटरी, ऊर्जा लोड, स्टाफिंग, लॉजिस्टिक्स, क्षमता योजना — लेकिन ऐतिहासिक रूप से हर एक के लिए अपनी पाइपलाइन, अपनी विशेषताएँ और अपनी मान्यता व्यवस्था की ज़रूरत पड़ती थी। एक ही मॉडल जो इन सबमें सामान्यीकरण करता है, यह बदल देता है कि पूर्वानुमान प्रणाली कौन बना सकता है और कितनी जल्दी।

यहाँ प्रशिक्षण डेटा की व्यापकता पैरामीटर संख्या जितनी ही मायने रखती है। सिंथेटिक सीरीज़ को असली सीरीज़ के साथ मिलाकर, Google मॉडल को किसी भी एक क्षेत्र की तुलना में अधिक विविध आकृतियों, मौसमी लय और झटके के पैटर्न से परिचित करा सकता है। यही विविधता सामान्यीकरण की कच्ची सामग्री है, और ज़ीरो-शॉट दावा अंततः इसी पर टिका है।

संख्याओं के लिए फाउंडेशन मॉडल पर व्यापक दांव

TimesFM-3 दो प्रवृत्तियों के संगम पर बैठता है: टेक्स्ट और इमेज से आगे फाउंडेशन मॉडल का स्केलिंग, और बेहतर परिचालन पूर्वानुमान की लंबे समय से चली आ रही मांग। Google का ढाँचा यह है कि संदर्भ ही एक भोले एक्सट्रपोलेशन को उपयोगी भविष्यवाणी से अलग करता है, और आर्किटेक्चर उस दावे की सीधी प्रतिक्रिया है — दक्षता के लिए पैच, तुलनीयता के लिए नॉर्मलाइज़ेशन, संबंधों के लिए समय और चर दोनों पर ध्यान, और सुसंगति के लिए वन-शॉट डिकोडर।

क्या यह संयोजन गंदे असली दुनिया के डेटा में टिक पाता है, यह खुला सवाल बना हुआ है, जैसा किसी भी ज़ीरो-शॉट सिस्टम के लिए होता है। लेकिन दिशा स्पष्ट है: पूर्वानुमान को अब एक सांख्यिकीय काम से कम और एक सामान्य तर्क कार्य के रूप में अधिक देखा जा रहा है, ऐसा कार्य जिसमें बिक्री डेटा, मौसम और छूट कैलेंडर सब एक ही इनपुट में आते हैं। प्रमोशन चलाने वाले रिटेलरों, लोड संतुलित करने वाली यूटिलिटीज़ और क्षमता की योजना बनाने वाले ऑपरेटरों के लिए आकर्षण सीधा है — मॉडल से उन घटनाओं का पूर्वानुमान लगाने को कहा जाता है जो पहले से कैलेंडर पर हैं, न कि केवल पिछले साल की रेखा को आगे बढ़ाने के लिए।

This article is based on reporting by The Decoder. Read the original article.

Originally published on the-decoder.com