Googleの最新エージェントフレームワークは再トレーニングではなく永続性に焦点を当てる

Google Researchは、WikiSkillと呼ばれるシステムを発表した。これは、AIエージェントのよく知られた弱点、つまりタスクを完了した後、その経験を破棄し、次回の実行時に以前の失敗についての実用的な記憶をほとんど持たずに開始するという問題を解決しようとするものである。WikiSkillは、エージェントを永続的なWikiのような知識ベースと組み合わせることでこれに対処する。この知識ベースは失敗と成功を記録し、その記録を将来のパフォーマンス向上に利用する。

その前提は単純明快だ。毎回の実行を使い捨てとして扱う代わりに、このフレームワークは実行中に何が起こったかをキャプチャし、それらの結果を構造化された知識に蒸留し、最も有用な教訓を再利用可能な行動ガイダンスに変換する。結果として得られる指示は、ソースが「Agent Skills」と表現するモジュールにパッケージ化される。これは、モデルの元のトレーニングを変更することなく、エージェントの動作を形成できるモジュールである。

この区別は重要である。WikiSkillは、モデルレベルでの真の継続学習として提示されているわけではない。ソースは、継続学習は未解決の問題のままであると明言している。WikiSkillが提供するのは、外部メモリと自己改善ループである。エージェントは自分自身のためにより良い指示を書き、それを保存し、後で参照する。これは回避策だが、レポートはそれを効果的であると説明している。

3層アーキテクチャがログ、知識、行動を分離

WikiSkillはエージェントのワークスペースを3つの層に整理する。最下層はRaw Layerで、ツール呼び出しや結果を含む完全な実行トレースを保存する。この層は不変であり、エージェントが実際に行ったことの基本記録として機能する。その上はWiki Layerで、生のトレースは成功した戦略や繰り返し発生する失敗パターンなどの構造化された観察結果に変換される。最上位はSkill Layerで、タスク実行中にエージェントが使用するアクティブな手続き的指示が含まれる。

この分離は、フレームワークの最も強力な設計上の選択の1つである。生のトレースは証拠を保持する。Wikiは証拠を累積的な知識に変換する。スキルは知識を運用上の行動に変換する。システムをこのように分割することで、WikiSkillはすべてを1つの不透明なメモリストアにまとめることを回避している。

WikiSkillのサイクルを4つのステップで示す図。推論エージェントが実行トレース(Raw Layer)を生成し、Wiki Maintainerがパターンを永続的なWikiに蒸留し、Skill Proposerがスキル更新を導出し、ゲーティングメカニズムが変更が実際に役立つかどうかをチェックする。Wikiは継続的に成長し、スキルはパフォーマンスが低下した場合にロールバックできる。| 画像: Tang et al., 2026
WikiSkillのサイクルを4つのステップで示す図。推論エージェントが実行トレース(Raw Layer)を生成し、Wiki Maintainerがパターンを永続的なWikiに蒸留し、Skill Proposerがスキル更新を導出し、ゲーティングメカニズムが変更が実際に役立つかどうかをチェックする。Wikiは継続的に成長し、スキルはパフォーマンスが低下した場合にロールバックできる。| 画像: Tang et al., 2026

また、リビジョンも慎重に処理される。ソースによると、Wiki Layerは成長するだけで、反復間でリセットされない。Skill Layerはより暫定的である。新しいスキル更新がパフォーマンスを損なう場合、ロールバックできる。つまり、このフレームワークは永続的な知識とアクティブなポリシーを異なる方法で扱う。知識は蓄積されるが、行動はテスト可能で可逆的なままである。

改善ループの仕組み

更新サイクルには4つの部分がある。まず、推論エージェントが現在のスキルセットを使用してタスクを実行し、実行トレースを生成する。次に、Wiki Maintainerと呼ばれるコンポーネントがそれらのトレースを分析し、失敗モードと効果的な戦術を特定し、調査結果をWikiに書き込む。Skill Proposerは、更新されたWikiと実行データの両方を使用して、エージェントのスキルへの対象を絞った変更を提案する。最後に、ゲーティングメカニズムが提案された更新を別の検証セットで評価し、役立つ場合にのみ変更を保持する。

この最後のステップは不可欠である。エージェントが自分自身の手順を書き換えることを許可するシステムは、すべてのリビジョンが受け入れられると急速に劣化する可能性がある。WikiSkillの検証ゲートは、そのドリフトを止めるように設計されている。提案されたスキルがテストに失敗した場合、システムはスキル更新を破棄するが、Wikiに記録された基礎となる知識は保持する。

したがって、失敗した提案でさえも有用な入力になる。ソースは、Wikiが試みられたことと失敗した理由を文書化し、後の反復により多くのコンテキストを提供すると述べている。実際には、システムは成功した戦術を覚えているだけではない。また、非生産的な方向性も覚えており、盲目的に繰り返すことを避けることができる。

失敗の記憶がエージェントの信頼性にとって重要となる理由

WikiSkillのより広い意義は、エージェントがメモを蓄積できることだけではない。失敗が第一級の情報になることである。多くのエージェントパイプラインでは、失敗は即時の悪い結果としてのみ現れる。タスクの失敗、ツールの誤用、指示チェーンの崩壊などである。開発者が手動でログを検査し、プロンプトを修正しない限り、これらの間違いは永続的な運用知識に変換されない。

WikiSkillはその変換を自動化しようとしている。失敗パターンと成功した戦略を永続的な層に文書化することで、フレームワークはエージェントにモデルのトレーニングをやり直すことなく時間の経過とともに行動を改善する方法を提供する。これは、エージェントが繰り返し同様のタスクに直面し、ツールの使用、シーケンス、例外処理が生の言語能力と同じくらい重要である環境で特に重要になる可能性がある。

WikiSkill(黄色)は、他のすべてのスキル進化方法とスキルなしのベースラインを一貫して上回る。ベースラインとの差はモデルサイズとともに拡大し、より大きなモデルが進化したスキルからより多くの恩恵を受けることを示している。| 画像: Tang et al., 2026
WikiSkill(黄色)は、他のすべてのスキル進化方法とスキルなしのベースラインを一貫して上回る。ベースラインとの差はモデルサイズとともに拡大し、より大きなモデルが進化したスキルからより多くの恩恵を受けることを示している。| 画像: Tang et al., 2026

このフレームワークはまた、AIシステム設計における成長傾向を反映している。モデルの重み自体ではなく、モデルを囲む足場により多くのインテリジェンスを押し込むことである。メモリ、検証、ロールバック、構造化された自己文書化はすべて、運用エンジニアリングの一形態である。それらは最も難しい学習問題を解決するわけではないが、それでも測定可能な利益をもたらす可能性がある。

「LLM Wiki」がアイデアから実装へ

この研究は、ソースでAndrej Karpathyに関連する概念、つまりAIシステムが時間の経過とともに構築し参照できる経験の累積ストアである「LLM Wiki」のアイデアに基づいている。WikiSkillはそのアイデアをエージェント開発に具体的に適用している。一般的なメモリダンプではなく、トレースを再利用可能でテスト可能な手順に変換するプロセスを作成する。

その手順への焦点は重要である。エージェントは単に事実を必要とするだけでなく、どのように行動するかについてのより良い感覚を必要とする。どのツールを最初に使用すべきか?どの失敗パターンが別の経路をトリガーすべきか?同様の状況で以前にどの戦略が機能したか?WikiSkillの答えは、それらの教訓をスキルとして形式化し、その下にある証拠ベースを保持することである。

まだトレードオフはある。ソースは、この方法はおそらく真の学習よりもエラーが発生しやすいと述べている。外部知識ストアは誤った解釈をエンコードする可能性があり、自己作成の指示は注意深く検証されない場合、脆いヒューリスティックにドリフトする可能性がある。しかし、ゲーティングメカニズムとロールバックモデルは、研究者がそのリスクを設計問題の一部として扱っていることを示している。

今のところ、メッセージは明確である。永続的なメモリは、真の継続学習が解決される前にエージェントを改善する最も実用的な方法の1つである可能性がある。WikiSkillは、エージェントが繰り返しの作業で上達するために再トレーニングする必要はないことを示唆している。彼らは単に、何が起こったか、何が失敗したか、次回何を試すべきかを覚えるための構造化された方法を必要とするかもしれない。

この記事はThe Decoderの報道に基づいています。元の記事を読む

Originally published on the-decoder.com