Anthropic orienta Claude Code hacia un uso más autónomo

Anthropic está cambiando la forma en que los desarrolladores interactúan con Claude Code al hacer de Auto Mode la configuración predeterminada para la mayoría de los usuarios de pago a partir del 14 de agosto. Según el material de origen, la medida se aplica a los planes Pro, Max y Team, mientras que los clientes Enterprise seguirán teniendo que activarla por separado. En términos prácticos, el cambio significa que Claude Code actuará con más frecuencia sin esperar a que una persona apruebe cada paso individual, y solo se detendrá cuando su sistema de seguridad considere que una acción parece peligrosa o difícil de revertir.

Eso convierte esto en algo más que un ajuste de producto. Es una declaración sobre cómo una gran empresa de IA cree que deben usarse los asistentes de programación: no solo como herramientas de autocompletado o interfaces de chat, sino como agentes semiautónomos capaces de llevar a cabo trabajo de desarrollo prolongado con supervisión limitada. Anthropic presenta el cambio como una mejora de seguridad y no como una reducción de supervisión, y sostiene que su clasificador puede detectar comandos de riesgo con más consistencia que los usuarios aprobándolos manualmente uno por uno.

Por qué Anthropic dice que Auto Mode es más seguro

El caso de la empresa se apoya en una serie de resultados de pruebas citados en el texto original. En un estudio controlado con 1.053 evaluadores de pago, los revisores humanos detectaron solo el 13,6 por ciento de los comandos peligrosos, mientras que Auto Mode detectó el 89 por ciento. Anthropic también dijo que las pruebas internas de red teaming mostraron que Auto Mode funcionaba al menos con la misma seguridad que las aprobaciones manuales y, a menudo, mejor. La empresa añadió que los equipos que usaban Auto Mode generaron alrededor de un 25 por ciento más de pull requests, lo que sugiere que el mayor nivel de autonomía también se tradujo en más producción.

El mecanismo descrito es sencillo en concepto. En lugar de pedir permiso en cada paso, Claude Code funciona de manera continua y depende de un clasificador para determinar cuándo una acción debe pausarse para confirmación. El sistema está diseñado para intervenir cuando una acción parece peligrosa o irreversible. Anthropic dice que el clasificador en sí no añade cargos por tokens para el usuario, aunque el flujo de trabajo más amplio todavía podría aumentar el uso total al permitir sesiones de programación más largas y productivas.

Eso importa porque la fatiga de aprobación es un problema real en las herramientas de software agénticas. Si se pide a los usuarios que aprueben casi todos los comandos, muchos terminarán aceptando por reflejo o desactivando por completo las salvaguardas. La propuesta de Anthropic es que una intervención selectiva es más realista que los avisos de aprobación general, y que un filtro asistido por modelo puede superar a la vigilancia humana en situaciones de revisión repetitiva.

La inyección de prompts sigue siendo una preocupación central

Una de las afirmaciones más importantes del material de origen es que Auto Mode también está pensado para ayudar a defenderse de ataques de prompt injection. Esos ataques intentan manipular a un agente de IA mediante instrucciones incrustadas en código, archivos u otros materiales que encuentra mientras trabaja. En un entorno de programación agéntica, ese riesgo es más serio que en un chatbot pasivo porque el sistema puede tener acceso a comandos, repositorios, procesos y, en algunos casos, datos sensibles.

Anthropic citó una auditoría independiente de Trajectory Labs que cubría 72 escenarios de ataque, cada uno ejecutado 10 veces. Según el texto, ninguna de las 720 intentonas logró superar los modelos actuales de Claude en Auto Mode. El texto también contrastó eso con un benchmark citado para GPT-5.6 Sol de OpenAI en el modo Codex Auto-Review, donde supuestamente el 5,83 por ciento de los intentos consiguió pasar. Developments Today no puede verificar la metodología más allá de lo que aparece en el texto proporcionado, pero la comparación muestra hasta qué punto los proveedores están compitiendo ahora en seguridad de agentes, no solo en calidad de código.

En un estudio controlado con 1.053 evaluadores de pago, los revisores humanos detectaron solo el 13,6 por ciento de los comandos peligrosos, mientras que Auto Mode detectó el 89 por ciento. | Imagen: Anthropic
En un estudio controlado con 1.053 evaluadores de pago, los revisores humanos detectaron solo el 13,6 por ciento de los comandos peligrosos, mientras que Auto Mode detectó el 89 por ciento. | Imagen: Anthropic

Anthropic también ofreció ejemplos internos para ilustrar lo que está en juego. La empresa dijo que Auto Mode impidió que Claude subiera datos confidenciales a una página pública y que, durante una sesión larga, detuvo alrededor de 2.000 procesos que de otro modo habrían interrumpido trabajos de entrenamiento con GPU en curso. Esos ejemplos sugieren que la empresa está probando estos sistemas en entornos reales de desarrollo e infraestructura, donde los errores pueden afectar la seguridad, la disponibilidad y cargas de trabajo de cómputo costosas.

Más producción, pero un rol cambiante para los desarrolladores

La afirmación sobre productividad es significativa porque apunta a un cambio más amplio en el trabajo de software. Si los equipos que usan Auto Mode producen más pull requests, entonces el trabajo del desarrollador cambia con ello. El texto original señala explícitamente que el rol se aleja aún más de la codificación activa línea por línea y se acerca a supervisar, revisar y validar el resultado generado por IA.

Eso no elimina la necesidad del juicio humano. La propia Anthropic advierte que el clasificador reduce el riesgo, pero no lo elimina. La empresa sigue recomendando que los usuarios revisen por sí mismos las acciones de Claude cuando se trate de cambios de alto impacto en infraestructura de producción. Esa salvedad es importante. El caso más sólido para Auto Mode quizá esté en flujos de trabajo de desarrollo rutinarios, donde el coste del retraso es alto y el riesgo de cualquier acción individual es relativamente contenido. El caso más débil es el de entornos en los que un solo comando erróneo podría exponer datos, romper sistemas de producción o causar daños operativos irreversibles.

Visto así, el anuncio de Anthropic es tanto un lanzamiento de producto como un empujón conductual. Al hacer de Auto Mode la opción predeterminada, la empresa está normalizando la idea de que los desarrolladores deberían dejar que los agentes de programación funcionen por sí solos durante periodos más largos. Los valores predeterminados importan. Muchos usuarios que no habrían activado de forma voluntaria un ajuste más autónomo ahora lo vivirán como la manera estándar en que funciona la herramienta.

Qué significa para el mercado de programación con IA

El cambio también refleja una fase de maduración en el mercado de asistentes de programación. La competencia ya no trata solo de quién escribe el mejor fragmento o explica la refactorización más limpia. Cada vez más, se trata de quién puede gestionar con seguridad la autonomía: elegir cuándo actuar, cuándo pausar y cómo resistir instrucciones maliciosas o no deseadas encontradas durante la ejecución.

Anthropic parece apostar a que esta capa de juicio operativo se convertirá en un diferenciador central. Si esa apuesta es correcta, la próxima fase de las herramientas de programación con IA se medirá menos por la frecuencia con la que pueden generar código a partir de un prompt y más por la fiabilidad con la que pueden operar dentro de repositorios reales y desordenados sin causar daños. Que Auto Mode pase a ser el valor predeterminado es una señal concreta de que la industria se mueve en esa dirección ahora.

Este artículo se basa en una cobertura de The Decoder. Leer el artículo original.

Originally published on the-decoder.com