Nvidia demuestra que el arnés, no el modelo de IA, es el verdadero héroe

Una investigación de Nvidia logra que Claude Opus 5 consiga un 100% en el benchmark ARC-AGI-3 gracias a un arnés personalizado con un 'supervisor'. La conclusión: el modelo importa, pero el andamiaje que lo rodea importa más.
Nvidia ha publicado una investigación que da la vuelta a la conversación sobre la inteligencia artificial: para tareas de largo recorrido, el arnés (el conjunto de herramientas, memoria y estructura que rodea al modelo) pesa más que el propio modelo. En sus pruebas, los investigadores consiguieron que Claude Opus 5 alcanzara un 100% en el benchmark interactivo ARC-AGI-3 simplemente usando un arnés personalizado con un componente 'supervisor'. Sin ese arnés, el mismo modelo se quedaba en un 30%, que era el mejor resultado entre todos los modelos probados.
¿Qué es exactamente el arnés? Adel El Hallack, vicepresidente de producto en la unidad de IA de Nvidia, lo explica en cristiano: la gente tiende a ver un agente de IA como si fuera solo el modelo, una especie de API. Pero un agente real es más que eso: es el modelo, sí, pero también el andamiaje que lo rodea, las herramientas a las que tiene acceso, el runtime y las librerías. Ese andamiaje es lo que convierte a un modelo en un agente capaz de encadenar decisiones durante días sin perderse por el camino, algo conocido como tareas de largo horizonte.
La elección del benchmark no es casualidad. ARC-AGI-3 es un conjunto de juegos 2D sin instrucciones donde el modelo tiene que descubrir cómo jugar y ganar. OpenAI, que ha obtenido resultados inferiores al 10% en esa prueba, se sintió tan molesta que el mes pasado hizo su propia investigación: ajustando solo dos parámetros del arnés, sus modelos triplicaron la puntuación. Pero ninguno llegó al 100% que consiguieron los de Nvidia. La clave, según El Hallack, fue añadir un agente supervisor que actúa como un CEO: observa al agente principal y lo reencamina si se desvía o se mete en un callejón sin salida.
La investigación de Nvidia se suma a otras evidencias en la misma dirección. En abril, Microsoft probó 19 modelos en tareas de largo horizonte y todos, incluidos los frontera, llenaron los documentos de errores. En julio, Databricks demostró que el arnés puede duplicar el coste de usar un mismo modelo. Nvidia, que no ha lanzado un producto nuevo sino piezas abiertas bajo su marca Nemo, defiende que los arneses abiertos dan al usuario mucho más control del que cree. La conclusión para el inversor es clara: la carrera de la IA no se juega solo en los modelos, sino en todo lo que los envuelve.
El análisis de Salseo
- La investigación refuerza la tesis de que el valor en IA no está solo en los modelos, sino en la infraestructura y el software que los rodea. Para Nvidia, eso significa que su ecosistema (Nemo, runtime, herramientas) puede ser tan estratégico como sus chips, y eso justifica su apuesta por vender 'paquetes completos' y no solo hardware.
- El hallazgo del agente supervisor como un 'CEO' que corrige al agente principal apunta a una nueva capa de software que podría convertirse en estándar. Las empresas que construyan buenos arneses con supervisión tendrán ventaja, y eso abre un mercado nuevo para herramientas de orquestación de agentes.
- La elección de ARC-AGI-3 es un golpe indirecto a OpenAI: si un arnés bien diseñado puede llevar a Claude Opus 5 al 100%, el debate sobre qué modelo es 'más inteligente' pierde peso. La señal a vigilar es si OpenAI responde con mejoras en su propio arnés o si sigue centrándose solo en escalar los modelos.
- El dato de Databricks de que un arnés equivocado puede duplicar el coste es clave para las empresas: el coste total de la IA no depende solo del precio del modelo, sino de cómo se usa. Eso significa que las compañías que optimicen arneses podrán ofrecer ahorros significativos, y las que los ignoren pagarán más por resultados peores.