أحدث إطار عمل من جوجل يركز على الاستمرارية، وليس إعادة التدريب

قدمت Google Research نظامًا يسمى WikiSkill يحاول حل ضعف مألوف في وكلاء الذكاء الاصطناعي: غالبًا ما ينهون المهمة، ويتجاهلون التجربة، ويبدأون التشغيل التالي بذاكرة عملية قليلة لما حدث خطأ من قبل. يعالج WikiSkill ذلك من خلال إقران الوكيل بقاعدة معرفة دائمة تشبه الويكي تسجل الإخفاقات والنجاحات وتستخدم هذا السجل لتحسين الأداء المستقبلي.

المبدأ واضح ومباشر. بدلاً من التعامل مع كل تشغيل على أنه قابل للاستهلاك، يلتقط الإطار ما حدث أثناء التنفيذ، ويستخلص تلك النتائج في معرفة منظمة، ويحول الدروس الأكثر فائدة إلى إرشادات سلوكية قابلة لإعادة الاستخدام. يتم تغليف التعليمات الناتجة فيما يصفه المصدر باسم "مهارات الوكيل"، وهي وحدات يمكنها تشكيل سلوك الوكيل دون تغيير التدريب الأصلي للنموذج.

هذا التمييز مهم. لا يتم تقديم WikiSkill كتعلم مستمر حقيقي على مستوى النموذج. يلاحظ المصدر صراحةً أن التعلم المستمر لا يزال مشكلة غير محلولة. ما يقدمه WikiSkill بدلاً من ذلك هو ذاكرة خارجية وحلقة تحسين ذاتي: يكتب الوكيل تعليمات أفضل لنفسه، ويخزنها، ويستشيرها لاحقًا. إنه حل بديل، لكن التقرير يصفه بأنه فعال.

بنية من ثلاث طبقات تفصل السجلات والمعرفة والعمل

ينظم WikiSkill مساحة عمل الوكيل في ثلاث طبقات. في الأسفل توجد الطبقة الخام، التي تخزن آثار التنفيذ الكاملة، بما في ذلك استدعاءات الأدوات ونتائجها. هذه الطبقة غير قابلة للتغيير، وتعمل كسجل أساسي لما فعله الوكيل بالفعل. وفوق ذلك توجد طبقة الويكي، حيث يتم تحويل تلك الآثار الخام إلى ملاحظات منظمة مثل الاستراتيجيات الناجحة وأنماط الفشل المتكررة. في الأعلى توجد طبقة المهارات، التي تحتوي على التعليمات الإجرائية النشطة التي يستخدمها الوكيل أثناء تنفيذ المهام.

هذا الفصل هو أحد أقوى خيارات التصميم في الإطار. الآثار الخام تحافظ على الأدلة. تحول الويكي الأدلة إلى معرفة تراكمية. تترجم المهارات المعرفة إلى سلوك تشغيلي. من خلال تقسيم النظام بهذه الطريقة، يتجنب WikiSkill انهيار كل شيء في مخزن ذاكرة واحد غير شفاف.

دورة WikiSkill في أربع خطوات. يولد وكيل الاستدلال آثار التنفيذ (الطبقة الخام)، ويستخلص مشرف الويكي الأنماط في الويكي الدائم، ويقترح مقترح المهارات تحديثات المهارات، وتتحقق آلية البوابة مما إذا كان التغيير مفيدًا بالفعل. تنمو الويكي باستمرار، بينما يمكن التراجع عن المهارات إذا انخفض الأداء. | الصورة: تانغ وآخرون، 2026
دورة WikiSkill في أربع خطوات. يولد وكيل الاستدلال آثار التنفيذ (الطبقة الخام)، ويستخلص مشرف الويكي الأنماط في الويكي الدائم، ويقترح مقترح المهارات تحديثات المهارات، وتتحقق آلية البوابة مما إذا كان التغيير مفيدًا بالفعل. تنمو الويكي باستمرار، بينما يمكن التراجع عن المهارات إذا انخفض الأداء. | الصورة: تانغ وآخرون، 2026

كما يتعامل مع المراجعة بعناية. وفقًا للمصدر، طبقة الويكي تنمو فقط ولا تتم إعادة تعيينها عبر التكرارات. طبقة المهارات أكثر مؤقتة. إذا كان تحديث المهارة الجديد يضر بالأداء، فيمكن التراجع عنه. هذا يعني أن الإطار يعامل المعرفة الدائمة والسياسة النشطة بشكل مختلف: المعرفة تتراكم، لكن السلوك يبقى قابلًا للاختبار والعكس.

كيف تعمل حلقة التحسين

تتكون دورة التحديث من أربعة أجزاء. أولاً، ينفذ وكيل الاستدلال المهام باستخدام مجموعة المهارات الحالية ويولد آثار التنفيذ. ثم يقوم مكون يسمى مشرف الويكي بتحليل تلك الآثار، وتحديد أنماط الفشل والتكتيكات الفعالة، وكتابة النتائج في الويكي. يستخدم مقترح المهارات كلاً من الويكي المحدث وبيانات التنفيذ لاقتراح تغييرات مستهدفة على مهارات الوكيل. أخيرًا، تقوم آلية البوابة بتقييم التحديث المقترح على مجموعة تحقق منفصلة ولا تحتفظ بالتغيير إلا إذا كان مفيدًا.

هذه الخطوة الأخيرة ضرورية. الأنظمة التي تسمح للوكلاء بإعادة كتابة إجراءاتهم الخاصة يمكن أن تتدهور بسرعة إذا تم قبول كل مراجعة. تم تصميم بوابة التحقق في WikiSkill لوقف هذا الانجراف. إذا فشل اقتراح المهارة في الاختبار، يتجاهل النظام تحديث المهارة ولكنه يحافظ على المعرفة الأساسية المسجلة في الويكي.

حتى الاقتراحات الفاشلة تصبح مدخلات مفيدة. يقول المصدر إن الويكي يوثق ما تمت تجربته ولماذا فشل، مما يعطي التكرارات اللاحقة مزيدًا من السياق. في الواقع، لا يتذكر النظام التكتيكات الناجحة فحسب، بل يتذكر أيضًا الاتجاهات غير المنتجة ويمكنه تجنب تكرارها بشكل أعمى.

لماذا يمكن أن تكون ذاكرة الفشل مهمة لموثوقية الوكيل

الأهمية الأوسع لـ WikiSkill ليست مجرد أن الوكلاء يمكنهم تجميع الملاحظات. بل أن الفشل يصبح معلومات من الدرجة الأولى. في العديد من خطوط أنابيب الوكلاء، يظهر الفشل فقط كنتيجة سيئة فورية: مهمة ضائعة، أو أداة مساء استخدامها، أو سلسلة تعليمات تنهار. ما لم يقم المطورون بفحص السجلات يدويًا ومراجعة المطالبات، لا يتم تحويل هذه الأخطاء إلى معرفة تشغيلية دائمة.

يحاول WikiSkill أتمتة هذا التحويل. من خلال توثيق أنماط الفشل والاستراتيجيات الناجحة في طبقة دائمة، يمنح الإطار الوكيل طريقة لتحسين السلوك بمرور الوقت دون الحاجة إلى جولة جديدة من تدريب النموذج. يمكن أن يكون هذا مهمًا بشكل خاص في البيئات التي يواجه فيها الوكلاء مهامًا متشابهة بشكل متكرر وحيث يكون استخدام الأدوات والتسلسل ومعالجة الاستثناءات مهمًا بقدر القدرة اللغوية الخام.

يتفوق WikiSkill (الأصفر) باستمرار على جميع طرق تطور المهارات الأخرى وخط الأساس بدون مهارات. الفجوة إلى خط الأساس تنمو مع حجم النموذج، مما يظهر أن النماذج الأكبر تستفيد أكثر من المهارات المتطورة. | الصورة: تانغ وآخرون، 2026
يتفوق WikiSkill (الأصفر) باستمرار على جميع طرق تطور المهارات الأخرى وخط الأساس بدون مهارات. الفجوة إلى خط الأساس تنمو مع حجم النموذج، مما يظهر أن النماذج الأكبر تستفيد أكثر من المهارات المتطورة. | الصورة: تانغ وآخرون، 2026

يعكس الإطار أيضًا اتجاهًا متزايدًا في تصميم أنظمة الذكاء الاصطناعي: دفع المزيد من الذكاء إلى السقالات حول النموذج بدلاً من أوزان النموذج نفسها. الذاكرة والتحقق والتراجع والتوثيق الذاتي المنظم كلها أشكال من الهندسة التشغيلية. إنها لا تحل مشكلة التعلم الأصعب، لكنها قد تحقق مكاسب قابلة للقياس.

"ويكي LLM" ينتقل من الفكرة إلى التنفيذ

يستند العمل إلى مفهوم مرتبط في المصدر بأندريه كارباثي: فكرة "LLM Wiki"، وهو مخزن تراكمي للتجربة يمكن لنظام الذكاء الاصطناعي بناؤه والرجوع إليه بمرور الوقت. يطبق WikiSkill هذه الفكرة تحديدًا على تطوير الوكلاء. بدلاً من تفريغ ذاكرة عام، فإنه ينشئ عملية لتحويل الآثار إلى إجراءات قابلة لإعادة الاستخدام وقابلة للاختبار.

هذا التركيز على الإجراء مهم. لا يحتاج الوكيل إلى الحقائق فقط؛ بل يحتاج إلى إحساس أفضل بكيفية التصرف. أي أداة يجب أن يستخدمها أولاً؟ ما هي أنماط الفشل التي يجب أن تؤدي إلى مسار مختلف؟ ما هي الاستراتيجية التي نجحت من قبل في موقف مشابه؟ إجابة WikiSkill هي إضفاء الطابع الرسمي على تلك الدروس كمهارات مع الحفاظ على قاعدة الأدلة تحتها.

لا تزال هناك مقايضات. يلاحظ المصدر أن الطريقة ربما تكون أكثر عرضة للخطأ من التعلم الحقيقي. يمكن لمخازن المعرفة الخارجية ترميز تفسيرات خاطئة، ويمكن أن تنحرف التعليمات الذاتية إلى استدلالات هشة إذا لم يتم التحقق منها بعناية. لكن آلية البوابة ونموذج التراجع يظهران أن الباحثين يعاملون هذا الخطر كجزء من مشكلة التصميم.

في الوقت الحالي، الرسالة واضحة: الذاكرة الدائمة قد تكون واحدة من أكثر الطرق العملية لتحسين الوكلاء قبل حل التعلم المستمر الحقيقي. يشير WikiSkill إلى أن الوكلاء لا يحتاجون إلى إعادة التدريب ليتحسنوا في العمل المتكرر. قد يحتاجون ببساطة إلى طريقة منظمة لتذكر ما حدث، وما فشل، وما يجب تجربته في المرة القادمة.

هذا المقال مبني على تقرير من The Decoder. اقرأ المقال الأصلي.

Originally published on the-decoder.com