نموذج TimesFM-3 من جوجل ينظر إلى ما هو أبعد من المنحنى

قدّمت Google Research نموذج TimesFM-3، وهو نموذج تنبؤي مصمم لتوقع القيم المستقبلية في السلاسل الزمنية — تلك التدفقات المرتبة من الأرقام التي تظهر في صورة أرقام المبيعات اليومية أو أعداد حركة المرور أو قراءات المستشعرات — مع الأخذ في الاعتبار أيضاً السياق المحيط بهذه الأرقام. ويمثل هذا الإصدار خطوة أخرى في مسعى تحويل التنبؤ إلى قدرة عامة الأغراض بدلاً من كونه مشروعاً هندسياً مخصصاً يُعاد بناؤه لكل مجموعة بيانات.

وتقوم الفرضية المركزية على أن التنبؤات الحقيقية نادراً ما تعتمد على متغير واحد. وتوضح جوجل هذه النقطة بمثال سلسلة متاجر تجزئة تحاول توقع مبيعات الآيس كريم. فالنموذج الذي ينظر فقط إلى مشتريات الآيس كريم السابقة سيفوته الكثير: فمبيعات العناصر المرتبطة مثل أكواز الوافل والشراب، وحركة المشاة التاريخية قرب المتجر، والظروف الجوية، وحملات الخصم المخطط لها، والعطلات، كلها تشكّل الطلب. وقد صُمم TimesFM-3 لدمج هذه الإشارات في تنبؤ واحد بدلاً من التعامل مع كل منها كمشكلة منفصلة.

الرقع والتطبيع ومحوّل ثنائي الاتجاه

من الناحية المعمارية، يظل TimesFM-3 ضمن عائلة Transformer، وهي التصميم الأساسي نفسه الذي استخدمته إصداراته السابقة. لكنه يتخذ خيارات مدروسة بشأن كيفية دخول بيانات السلاسل الزمنية إلى الشبكة. فبدلاً من تغذية النموذج بنقطة بيانات واحدة في كل مرة، يجمع 32 نقطة متتالية في رقعة واحدة. وتصبح تلك الرقعة هي الوحدة التي يستدل عليها النموذج، مما يقصّر التسلسل ويمنح الشبكة رؤية أوسع للشكل المحلي.

كما تقوم جوجل بتطبيع كل سلسلة إلى مقياس موحد. وهذا مهم لأن السلاسل الزمنية تأتي بمقادير متباينة للغاية — بضع وحدات تُباع يومياً مقابل ملايين القراءات من مستشعر صناعي — ومقارنتها مباشرة ستكون بلا معنى. ويسمح تحجيم كل سلسلة إلى أساس مشترك للنموذج بالتعامل مع الأنماط من مجالات مختلفة جداً على أنها قابلة للمقارنة.

ثم تجري المعالجة في اتجاهين متناوبين. فعلى محور الزمن، يبحث النموذج عن أنماط داخل سلسلة واحدة، ولا يستعين إلا بالقيم السابقة حتى لا تتسرب معلومات المستقبل إلى التنبؤ. وعبر السلاسل، يقارن كل متغير في لحظة معينة ويتعلم كيف ترتبط ببعضها. وهذه الرؤية العابرة للسلاسل هي ما يسمح للنموذج بالتقاط تأثيرات مثل تحوّل مبيعات منتج بسبب خصم على منتج آخر — وهي علاقة لن يلاحظها نموذج أحادي السلسلة أبداً.

Architectural diagram of TimesFM-3, showing four time series in patches of 32 points each, a token grid consisting of causal temporal attention and full variate attention, and the predicted target series T1 and T2.
Blue marks the target series, purple a variable known only historically, and green a known future event whose tokens already include upcoming patches. | Image: Google

ويُلوّن توضيح جوجل لإعداد المدخلات البيانات وفق رمز لوني: سلسلة هدف زرقاء، ومتغيرات بنفسجية معروفة من التاريخ فقط، ووحدات رمزية خضراء لأحداث مستقبلية معروفة يتضمن تمثيلها بالفعل الرقع القادمة.

ثلاثة أنواع من الإشارات الإضافية

وفقاً لجوجل، يقبل TimesFM-3 ثلاثة أنواع متميزة من البيانات التكميلية.

  • المتغيرات المشتركة التي يتنبأ بها. يستطيع النموذج التنبؤ بعدة متغيرات مرتبطة في آن واحد، مثل الطلب على نكهات مختلفة من الآيس كريم، بدلاً من التعامل مع كل منها بمعزل عن الآخر.
  • المتغيرات المعروفة تاريخياً. عوامل مثل حركة المشاة السابقة تكون متاحة حتى الحاضر ولكن ليس بعده، ويدرجها النموذج كسياق.
  • الأحداث المستقبلية المعروفة. العروض الترويجية المخطط لها وجداول الخصم وتوقعات الطقس هي أحداث معروفة التوقيت مسبقاً، فيستطيع النموذج استخدامها كمدخلات استشرافية بدلاً من استنتاجها من التاريخ وحده.

وهذه الفئة الثالثة هي حيث يختلف TimesFM-3 اختلافاً حاداً عن التنبؤ الإحصائي الكلاسيكي. فتقويم العروض الترويجية ليس نمطاً ينتظر الاكتشاف — بل هو حقيقة عن المستقبل. وقد هُندس هذا النموذج ليقبل مثل هذه الحقائق كمدخلات.

طلقة واحدة بدلاً من خطوة بخطوة

كانت الإصدارات السابقة من النموذج تولّد التنبؤات كتلة تلو الأخرى. وكانت كل كتلة جديدة تُبنى على التنبؤ السابق، وهو نهج تصفه جوجل بأنه بطيء ومكثّف حسابياً وعرضة لتراكم الخطأ: فقد تشوّه خطأ صغير في وقت مبكر من التسلسل كل ما يليه. وهذا نمط فشل مألوف في التنبؤ الانحدار الذاتي، حيث يتغذى النموذج فعلياً على مخرجاته الخاصة.

ويتخلى TimesFM-3 عن تلك الحلقة. فهو يخصص عناصر نائبة فارغة لكل خطوة زمنية مستقبلية ويكملها في مسحة واحدة. وتصف جوجل ذلك بالتنبؤ بطلقة واحدة، ويظهر الفرق العملي في سيناريو الآيس كريم. فالنموذج الذي يعرف المبيعات السابقة فقط سيواصل ببساطة الإيقاع الأسبوعي القائم، أعمى عن عرض ترويجي لم يحدث بعد. وبمجرد أن يتلقى TimesFM-3 جدول الخصم، يستطيع تعديل التنبؤ في تمريرة واحدة بدلاً من السير قدماً خطوة بخطوة.

تسع قيم لكل خطوة: عدم اليقين مدمج

بدلاً من إصدار تقدير نقطي واحد لكل خطوة زمنية، يُخرج TimesFM-3 تسع قيم لكل خطوة. والغرض من هذه القيم هو التقاط نطاق التنبؤ وعدم يقينه — تنبؤ ينقل ليس فقط ما يُرجح حدوثه، بل مدى ثقة النموذج. ولأغراض التخطيط، غالباً ما يكون هذا التمييز أكثر فائدة من رقم مجرد، لأنه يتيح للأنظمة اللاحقة التفكير في المخاطر أو تكديس المخزون أو الطاقة الاحتياطية.

Scatter plot for the Gift-Eval benchmark showing the average rank for point and probability forecasts; TimesFM-3 is shown in orange at the bottom left, ahead of Chronos-2, Toto-2.0, TiRex-2, and TimesFM-2.5.
Lower left is better. TimesFM-3 leads Gift-Eval by a wide margin, even when limited to a single variable. | Image: Google

تدريب على نطاق تريليون نقطة، ونشر بدون تدريب مسبق

يحمل النموذج 330 مليون معامل، ودُرّب على مزيج من السلاسل الزمنية الحقيقية والاصطناعية يبلغ إجمالاً أكثر من تريليون نقطة بيانات، وفقاً لجوجل. وكسابقيه، يعمل بدون تدريب مسبق: فهو لا يحتاج إلى تدريب إضافي لمهمة جديدة. وهذه الخاصية محورية في الطرح. فبدلاً من تجميع مجموعة بيانات موسومة وملاءمة نموذج لكل مشكلة تنبؤ جديدة، يستطيع الممارس توجيه TimesFM-3 نحو سلسلة وإشاراتها المرتبطة ويتوقع مخرجات قابلة للاستخدام.

كما أن الأداء بدون تدريب مسبق هو ما يجعل نهج النموذج التأسيسي في التنبؤ جاذباً في المقام الأول. فمشكلات التنبؤ موجودة في كل مكان — المخزون، وحمل الطاقة، والكوادر، والخدمات اللوجستية، وتخطيط السعة — لكن كل واحدة منها تطلبت تاريخياً خط أنابيب خاصاً بها وميزاتها الخاصة ونظام تحقق خاصاً بها. أما نموذج واحد يعمّم عبر هذه المجالات فيغيّر من يستطيع بناء نظام تنبؤ ومدى السرعة.

ويتسم اتساع بيانات التدريب هنا بأهمية توازي عدد المعاملات. فبخلط السلاسل الاصطناعية بالحقيقية، تستطيع جوجل تعريض النموذج لتنوع أوسع من الأشكال والإيقاعات الموسمية وأنماط الصدمات مما قد يوفره أي مجال واحد. وهذا التنوع هو المادة الخام للتعميم، وهو ما يستند إليه ادعاء العمل بدون تدريب مسبق في نهاية المطاف.

الرهان الأوسع على النماذج التأسيسية للأرقام

يقع TimesFM-3 عند تقاطع اتجاهين: توسّع النماذج التأسيسية إلى ما هو أبعد من النصوص والصور، والطلب الطويل الأمد على تنبؤ تشغيلي أفضل. وتتمثل صياغة جوجل في أن السياق هو ما يفصل الاستقراء الساذج عن التنبؤ المفيد، والمعمارية استجابة مباشرة لهذا الادعاء — رقع للكفاءة، وتطبيع للمقارنة، وانتباه عبر الزمن والمتغيرات معاً للعلاقات، ومفكك ترميز بطلقة واحدة للتماسك.

ويبقى السؤال المفتوح هو ما إذا كان هذا المزيج يصمد عبر بيانات العالم الحقيقي الفوضوية، كما هو الحال مع أي نظام يعمل بدون تدريب مسبق. لكن الاتجاه واضح: يُعامل التنبؤ بوصفه مهمة استدلال عامة أكثر من كونه عملاً إحصائياً روتينياً، مهمة تنتمي فيها بيانات المبيعات والطقس وتقويم الخصومات جميعاً إلى المدخل نفسه. وبالنسبة لتجار التجزئة الذين يديرون عروضاً ترويجية، وشركات المرافق التي توازن الأحمال، والمشغلين الذين يخططون للسعة، فإن الجاذبية واضحة — يُطلب من النموذج توقع أحداث موجودة بالفعل على التقويم، لا مجرد تمديد خط العام الماضي.

This article is based on reporting by The Decoder. Read the original article.

Originally published on the-decoder.com