Una nueva capa de red para clústeres de IA más grandes
OpenAI ha introducido Multipath Reliable Connection, o MRC, un protocolo de red diseñado para sistemas de entrenamiento de IA a gran escala en los que los retrasos entre GPU pueden ralentizar todo un trabajo. La empresa afirmó que desarrolló el protocolo junto con AMD, Broadcom, Intel, Microsoft y NVIDIA, y luego publicó la especificación a través de Open Compute Project para que otros operadores puedan adoptarla.
La medida apunta a uno de los cuellos de botella menos visibles en el desarrollo de modelos de frontera. Las ejecuciones de entrenamiento dependen de enormes volúmenes de datos que se mueven entre aceleradores, y una sola transferencia tardía puede dejar costoso hardware esperando sin hacer nada. OpenAI sostiene que, a medida que los clústeres crecen, la congestión, los fallos de enlace y los problemas de enrutamiento se vuelven lo bastante frecuentes como para que el diseño de la red sea en sí mismo un determinante central de la velocidad y la fiabilidad del entrenamiento.
Qué pretende solucionar MRC
En su descripción del sistema, OpenAI dijo que el protocolo se basa en tres ideas: redes de alta velocidad multipista para redundancia, dispersión adaptativa de paquetes para reducir la congestión en el núcleo y enrutamiento estático de origen para sortear fallos. La empresa presentó estas decisiones como una forma de reducir la complejidad a la vez que mejora la resiliencia.
El problema básico es la escala. Un paso de entrenamiento moderno puede requerir millones de transferencias de datos a través del tejido de un superordenador. Si una ruta de red se congestiona o un dispositivo falla, esa interrupción puede propagarse y detener el trabajo sincronizado en muchas GPU. OpenAI dijo que MRC tiene la intención de evitar que esos problemas se extiendan distribuyendo el tráfico de forma más eficaz y permitiendo que los fallos se eludan sin depender de un comportamiento de enrutamiento más frágil.
Tres decisiones clave de diseño
- La red multipista está pensada para ofrecer redundancia usando menos componentes y menos energía que algunas alternativas.
- La dispersión adaptativa de paquetes reparte el tráfico entre rutas para reducir puntos calientes en el núcleo de la red.
- El enrutamiento estático de origen se usa en el despliegue para sortear fallos y evitar por completo ciertas clases de fallos de enrutamiento.
Por qué importa más allá de una sola empresa
OpenAI vinculó el lanzamiento con su estrategia más amplia de computación y con las exigencias de una infraestructura a escala Stargate. La empresa dijo que los estándares compartidos en capas clave de infraestructura pueden ayudar a que los sistemas de IA escalen de forma más eficiente en un ecosistema de socios más amplio. Publicar la especificación a través de OCP también indica que el diseño de redes para clústeres de IA empieza a tratarse como un problema compartido de la industria y no como un detalle privado de implementación.
Eso importa porque la economía del entrenamiento de modelos no solo está determinada por los chips y la energía, sino por la eficacia con la que los operadores pueden mantener ocupados los clústeres. Un protocolo que reduzca la variabilidad y facilite rodear los fallos podría mejorar la utilización en grandes despliegues, lo que a su vez afecta la rapidez con la que se pueden entrenar nuevos modelos y cuánta infraestructura debe construirse para alcanzar un objetivo dado.
La lista de socios también subraya lo amplio que se ha vuelto el problema. Con proveedores de semiconductores, operadores de infraestructura en la nube y fabricantes de sistemas implicados, el lanzamiento sugiere que la red de IA se está convirtiendo en su propia capa competitiva importante. El hecho de que OpenAI eligiera una especificación abierta en lugar de un enfoque puramente propietario implica una apuesta por que la interoperabilidad y la adopción del ecosistema ahora valen más que mantener cerrada esta parte de la pila.
La señal de infraestructura más amplia
El anuncio es notable menos por una sola característica del protocolo que por mostrar dónde se está acumulando la presión en la infraestructura de IA. Durante años, la conversación pública sobre la escalabilidad de los modelos se ha centrado en las GPU. MRC destaca la siguiente restricción: una vez que el número de aceleradores se vuelve masivo, la red entre ellos puede decidir si la capacidad teórica de cómputo se convierte realmente en trabajo útil.
OpenAI está argumentando, en la práctica, que el camino hacia sistemas de entrenamiento más grandes y más fiables pasa por tejidos de red más simples y más tolerantes a fallos. Si MRC rinde como se describe en implementaciones reales, podría ayudar a marcar las expectativas sobre cómo se construirán los futuros clústeres de IA a escala hipermasiva. Como mínimo, marca otro paso en la industrialización de la infraestructura de IA, donde los avances proceden cada vez más de la ingeniería de sistemas tanto como de la arquitectura de modelos.
Este artículo se basa en la cobertura de OpenAI. Leer el artículo original.
Originally published on openai.com







