Anthropic は Claude Code をより自律的な利用へ移行

Anthropic は、8月14日から多くの有料ユーザーに対して Auto Mode をデフォルト設定にすることで、開発者が Claude Code とやり取りする方法を変えようとしている。元資料によると、この変更は Pro、Max、Team の各プランに適用され、Enterprise 顧客は引き続き個別に有効化する必要がある。実際には、Claude Code は各ステップごとに人間の承認を待たずに動作する場面が増え、危険または巻き戻しが難しいと安全システムが判断した場合にのみ停止することになる。

これは単なる製品調整以上の意味を持つ。大手 AI 企業がコーディング支援ツールをどう使うべきかについての立場表明でもある。つまり、単なるオートコンプリートやチャット画面ではなく、限定的な監督の下で長時間の開発作業をこなせる半自律エージェントとして捉えているということだ。Anthropic はこの変更を監督の削減ではなく安全性の向上として位置づけ、手動で一つずつ承認するよりも、自社の分類器のほうが危険なコマンドをより一貫して検出できると主張している。

Anthropic が Auto Mode をより安全だとする理由

同社の主張は、元テキストに含まれる一連の試験結果に基づいている。1,053 人の有料テスターを対象とした管理下の調査では、人間のレビュアーが危険なコマンドを検出できたのは 13.6 パーセントにとどまった一方、Auto Mode は 89 パーセントを検出した。Anthropic はさらに、社内のレッドチーミングでも Auto Mode は手動承認と少なくとも同等の安全性を示し、しばしばそれ以上だったと述べている。また、Auto Mode を使うチームは pull request の数が約 25 パーセント増えたともしており、より高い自律性が生産性向上にもつながったことを示唆している。

その仕組みは概念的には単純だ。各ステップで許可を求める代わりに、Claude Code は継続的に動作し、分類器が確認のために一時停止すべきかどうかを判断する。システムは、ある操作が危険または不可逆に見える場合に介入するよう設計されている。Anthropic は、この分類器自体はユーザーに token 料金を追加しないと述べているが、より広いワークフローでは、より長く生産的なコーディングセッションを可能にすることで総使用量が増える可能性はある。

これは、エージェント型ソフトウェアツールで承認疲れが現実的な問題だからだ。ほぼすべてのコマンドの承認を求められれば、多くのユーザーは反射的に通してしまうか、あるいは安全策を完全に無効化してしまう。Anthropic の狙いは、一律の承認プロンプトよりも選択的な介入のほうが現実的であり、モデル支援のフィルターは繰り返しのレビュー場面で人間の注意力を上回り得る、という点にある。

プロンプトインジェクションは依然として中心的な懸念

元資料の最も重要な主張の一つは、Auto Mode が prompt injection 攻撃への防御にも役立つよう設計されているという点だ。こうした攻撃は、作業中にエージェントが遭遇するコード、ファイル、その他の素材に埋め込まれた指示を使って AI エージェントを操作しようとする。エージェント型のコーディング環境では、システムがコマンド、リポジトリ、プロセス、場合によっては機密データにもアクセスできるため、このリスクは受動的なチャットボットより深刻だ。

Anthropic は、Trajectory Labs による独立監査を引用し、72 の攻撃シナリオをそれぞれ 10 回実行したと述べた。元テキストによれば、720 回の試行のうち、Claude の現在のモデルを Auto Mode で突破できたものは一つもなかった。また、OpenAI の GPT-5.6 Sol を Codex Auto-Review モードで評価した引用ベンチマークでは、5.83 パーセントの試行が通過したとも対比している。Developments Today は提供されたテキスト以上の方法論は検証できないが、この比較は、ベンダー間の競争が今やコード品質だけでなく、エージェントの安全性においても激化していることを示している。

1,053 人の有料テスターを対象とした管理下の調査では、人間のレビュアーが危険なコマンドを検出できたのは 13.6 パーセントにとどまった一方、Auto Mode は 89 パーセントを検出した。 | 画像: Anthropic
1,053 人の有料テスターを対象とした管理下の調査では、人間のレビュアーが危険なコマンドを検出できたのは 13.6 パーセントにとどまった一方、Auto Mode は 89 パーセントを検出した。 | 画像: Anthropic

Anthropic は、何が問われているのかを示す内部例も挙げている。同社によると、Auto Mode は Claude が機密データを公開ページにアップロードするのを防ぎ、ある長時間セッションでは、進行中の GPU 学習ジョブを妨害しかねなかった約 2,000 のプロセスを停止した。これらの例は、同社が実際の開発・インフラ環境でこうしたシステムを試しており、誤りがセキュリティ、稼働率、高価な計算負荷に影響しうることを示している。

出力は増えるが、開発者の役割は変わる

生産性の主張が重要なのは、ソフトウェア開発のより広い変化を示しているからだ。Auto Mode を使うチームがより多くの pull request を生み出しているなら、開発者の仕事もそれに伴って変化する。元テキストは、役割が逐次的な行単位のコーディングからさらに離れ、AI が生成した出力の監督、レビュー、検証に近づいていると明確に述べている。

ただし、それは人間の判断の必要性をなくすものではない。Anthropic 自身も、分類器はリスクを下げるが、なくすわけではないと警告している。同社は、本番インフラに対する高リスクの変更では、ユーザー自身が Claude の動作を確認することを引き続き勧めている。この注意書きは重要だ。Auto Mode の最も強い適用先は、遅延コストが高く、単一の操作に伴うリスクが比較的限定される日常的な開発ワークフローだろう。逆に、1 回の誤ったコマンドでデータ漏えい、本番障害、取り返しのつかない運用上の損害につながる環境では、説得力は弱い。

その意味で、Anthropic の発表は製品リリースであると同時に行動変容を促すものでもある。Auto Mode をデフォルトにすることで、同社は開発者がコーディングエージェントをより長時間、自律的に動かすことを標準化しようとしている。デフォルト設定は重要だ。これまで自発的にはより自律的な設定を有効にしなかった多くのユーザーが、今ではそれをツールの標準的な動作として体験することになる。

AI コーディング市場にとっての意味

この変更は、コーディング支援市場が成熟段階に入ったことも示している。競争はもはや、誰が最良のコード断片を書けるか、誰が最も整ったリファクタリングを説明できるかだけではない。いまや、いつ動くか、いつ止まるか、実行中に遭遇する悪意あるあるいは意図しない指示にどう耐えるか、といった自律性の安全な管理がより大きな焦点になっている。

Anthropic は、この運用上の判断層が中核的な差別化要因になると見ているようだ。その賭けが正しければ、次の AI コーディングツールの評価軸は、プロンプトからどれだけ頻繁にコードを生成できるかではなく、現実の荒れたリポジトリ内で損害を出さずにどれだけ確実に動作できるかになる。Auto Mode をデフォルトにすることは、業界が今まさにその方向へ進んでいる具体的な兆候だ。

この記事は The Decoder の報道に基づいています。元記事を読む

Originally published on the-decoder.com