Google का नवीनतम agent framework retraining से अधिक persistence पर ध्यान देता है

Google Research ने WikiSkill नाम का एक system पेश किया है, जो AI agents की एक जानी-पहचानी कमजोरी को हल करने की कोशिश करता है: वे अक्सर एक task पूरा करते हैं, उस अनुभव को छोड़ देते हैं, और अगला run पिछली बार क्या गलत हुआ था इसकी बहुत कम practical स्मृति के साथ शुरू करते हैं। WikiSkill एक agent को एक persistent, wiki-like knowledge base से जोड़कर इसे संबोधित करता है, जो विफलताओं और सफलताओं को दर्ज करता है और उस रिकॉर्ड का उपयोग भविष्य के performance को बेहतर बनाने में करता है।

मूल विचार सीधा है। हर run को disposable मानने के बजाय, framework execution के दौरान क्या हुआ, उसे पकड़ता है, उन परिणामों को structured knowledge में संक्षेपित करता है, और सबसे उपयोगी सबकों को reusable behavioral guidance में बदलता है। बनने वाले instructions source में वर्णित “Agent Skills” के रूप में पैकेज किए जाते हैं, जो model की मूल training को बदले बिना agent के व्यवहार को आकार दे सकते हैं।

यह अंतर महत्वपूर्ण है। WikiSkill को model स्तर पर true continuous learning के रूप में प्रस्तुत नहीं किया गया है। source स्पष्ट रूप से नोट करता है कि continuous learning अभी भी एक अनसुलझी समस्या है। WikiSkill इसके बजाय बाहरी memory और self-improvement loop देता है: agent अपने लिए बेहतर instructions लिखता है, उन्हें संग्रहीत करता है, और बाद में उनसे परामर्श करता है। यह एक workaround है, लेकिन रिपोर्ट के अनुसार प्रभावी है।

तीन-स्तरीय architecture logs, knowledge, और action को अलग करता है

WikiSkill agent के workspace को तीन layers में व्यवस्थित करता है। सबसे नीचे Raw Layer है, जिसमें tool calls और results सहित पूरे execution traces संग्रहीत होते हैं। यह layer immutable है; यह इस बात का आधार रिकॉर्ड है कि agent ने वास्तव में क्या किया। इसके ऊपर Wiki Layer है, जहाँ उन raw traces को सफल strategies और बार-बार दोहराए जाने वाले failure patterns जैसी structured observations में बदला जाता है। सबसे ऊपर Skill Layer है, जिसमें tasks करते समय agent द्वारा उपयोग किए जाने वाले active procedural instructions होते हैं।

यह विभाजन framework के सबसे मजबूत design choices में से एक है। Raw traces सबूत सुरक्षित रखते हैं। wiki सबूत को cumulative knowledge में बदलती है। skills ज्ञान को operational behavior में अनुवादित करती हैं। इस तरह system को बाँटकर WikiSkill हर चीज़ को एक opaque memory store में समेटने से बचता है।

WikiSkill cycle चार चरणों में। inference agent execution traces (Raw Layer) उत्पन्न करता है, Wiki Maintainer patterns को persistent wiki में संक्षेपित करता है, Skill Proposer skill updates बनाता है, और gating mechanism जाँचता है कि बदलाव वास्तव में मदद करता है या नहीं। wiki लगातार बढ़ता है, और performance गिरने पर skills rollback किए जा सकते हैं। | Image: Tang et al., 2026
WikiSkill cycle चार चरणों में। inference agent execution traces (Raw Layer) उत्पन्न करता है, Wiki Maintainer patterns को persistent wiki में संक्षेपित करता है, Skill Proposer skill updates बनाता है, और gating mechanism जाँचता है कि बदलाव वास्तव में मदद करता है या नहीं। wiki लगातार बढ़ता है, और performance गिरने पर skills rollback किए जा सकते हैं। | Image: Tang et al., 2026

यह revision को भी सावधानी से संभालता है। source के अनुसार, Wiki Layer केवल बढ़ता है और iterations के बीच reset नहीं होता। Skill Layer अधिक provisional है। यदि कोई नया skill update performance को नुकसान पहुँचाता है, तो उसे rollback किया जा सकता है। इसका मतलब है कि framework टिकाऊ knowledge और सक्रिय policy को अलग-अलग देखता है: knowledge जमा होता रहता है, लेकिन behavior परीक्षण योग्य और वापस बदला जा सकने योग्य रहता है।

सुधार loop कैसे काम करता है

update cycle के चार हिस्से हैं। पहले, एक inference agent मौजूदा skill set का उपयोग करके tasks निष्पादित करता है और execution traces बनाता है। फिर Wiki Maintainer नामक एक component उन traces का विश्लेषण करता है, failure modes और प्रभावी tactics की पहचान करता है, और निष्कर्षों को wiki में लिखता है। Skill Proposer updated wiki और execution data दोनों का उपयोग करके agent के skills में लक्षित बदलाव सुझाता है। अंत में, एक gating mechanism प्रस्तावित update का अलग validation set पर मूल्यांकन करता है और केवल तब बदलाव रखता है जब वह मदद करता है।

वह आख़िरी चरण आवश्यक है। यदि agents को अपनी procedures खुद फिर से लिखने दिया जाए और हर revision स्वीकार कर ली जाए, तो system तेज़ी से खराब हो सकता है। WikiSkill का validation gate इस drift को रोकने के लिए बनाया गया है। यदि प्रस्तावित skill test में विफल हो जाए, तो system skill update को त्याग देता है, लेकिन wiki में दर्ज आधारभूत knowledge को सुरक्षित रखता है।

इसलिए विफल प्रस्ताव भी उपयोगी input बन जाते हैं। source कहता है कि wiki यह दर्ज करता है कि क्या आजमाया गया और वह क्यों विफल हुआ, जिससे बाद की iterations को अधिक context मिलता है। व्यवहार में, system सिर्फ सफल tactics को याद नहीं रखता। यह अनुत्पादक दिशाओं को भी याद रखता है और उन्हें अंधाधुंध दोहराने से बच सकता है।

विफलता स्मृति agent reliability के लिए क्यों मायने रख सकती है

WikiSkill का व्यापक महत्व केवल यह नहीं है कि agents नोट्स जमा कर सकते हैं। बात यह है कि विफलता first-class information बनती है। कई agent pipelines में, विफलता केवल एक तुरंत खराब परिणाम के रूप में सामने आती है: कोई task छूट जाता है, कोई tool गलत इस्तेमाल होता है, या कोई instruction chain टूट जाती है। जब तक developers logs को manually देख कर prompts संशोधित नहीं करते, वे गलतियाँ स्थायी operational knowledge में नहीं बदलतीं।

WikiSkill इस रूपांतरण को स्वचालित करने की कोशिश करता है। विफलता patterns और सफल strategies को एक टिकाऊ layer में दस्तावेज़ित करके, framework agent को बिना नए model training के समय के साथ व्यवहार सुधारने का तरीका देता है। यह खास तौर पर उन वातावरणों में महत्वपूर्ण हो सकता है जहाँ agents बार-बार समान tasks का सामना करते हैं और जहाँ tool use, sequencing, और exception handling raw language ability जितने ही महत्वपूर्ण होते हैं।

WikiSkill (yellow) लगातार अन्य सभी skill evolution methods और no-skill baseline को पछाड़ता है। model size बढ़ने के साथ baseline से अंतर बढ़ता है, जिससे पता चलता है कि बड़े models evolved skills से अधिक लाभ पाते हैं। | Image: Tang et al., 2026
WikiSkill (yellow) लगातार अन्य सभी skill evolution methods और no-skill baseline को पछाड़ता है। model size बढ़ने के साथ baseline से अंतर बढ़ता है, जिससे पता चलता है कि बड़े models evolved skills से अधिक लाभ पाते हैं। | Image: Tang et al., 2026

यह framework AI system design में बढ़ती हुई प्रवृत्ति को भी दर्शाता है: model weights के बजाय model के आसपास के scaffolding में अधिक intelligence डालना। Memory, validation, rollback, और structured self-documentation सभी operational engineering के रूप हैं। वे सबसे कठिन learning problem को हल नहीं करते, लेकिन फिर भी measurable gains दे सकते हैं।

एक “LLM Wiki” विचार से implementation तक

यह काम source में Andrej Karpathy से जुड़ी एक concept पर आधारित है: “LLM Wiki” का विचार, यानी अनुभव का एक समेकित भंडार जिसे AI system समय के साथ बना और परामर्श कर सकता है। WikiSkill उस विचार को विशेष रूप से agent development पर लागू करता है। सामान्य memory dump के बजाय, यह traces को पुन: उपयोग योग्य, परीक्षण योग्य procedures में बदलने की प्रक्रिया बनाता है।

procedure पर यह ध्यान महत्वपूर्ण है। एक agent को सिर्फ facts नहीं चाहिए; उसे यह बेहतर समझ चाहिए कि कैसे कार्य करना है। उसे कौन सा tool पहले उपयोग करना चाहिए? कौन से failure patterns उसे अलग रास्ते की ओर ले जाने चाहिए? समान स्थिति में पहले कौन सी strategy काम कर चुकी है? WikiSkill का जवाब है उन सबकों को skills के रूप में औपचारिक बनाना, जबकि उनके नीचे evidence base को सुरक्षित रखना।

अभी भी tradeoffs हैं। source नोट करता है कि यह method वास्तविक learning की तुलना में अधिक error-prone हो सकती है। बाहरी knowledge stores गलत interpretations को एन्कोड कर सकते हैं, और self-authored instructions, यदि सावधानी से validate न की जाएँ, तो brittle heuristics में बदल सकती हैं। लेकिन gating mechanism और rollback model दिखाते हैं कि शोधकर्ता उस जोखिम को design problem का हिस्सा मान रहे हैं।

अभी के लिए संदेश स्पष्ट है: true continuous learning हल होने से पहले persistent memory एजेंटों को बेहतर बनाने के सबसे व्यावहारिक तरीकों में से एक हो सकती है। WikiSkill सुझाव देता है कि repeated work में बेहतर होने के लिए agents को retrain होने की आवश्यकता नहीं है। उन्हें बस यह याद रखने का एक structured तरीका चाहिए कि क्या हुआ, क्या विफल हुआ, और अगली बार क्या आज़माना चाहिए।

This article is based on reporting by The Decoder. Read the original article.

Originally published on the-decoder.com