Nvidia anuncia producción completa de Groq 3 LPX

Nvidia ha anunciado que su acelerador de inferencia de IA Groq 3 LPX ya está en producción completa, prometiendo un gran salto en velocidad de generación de tokens para sistemas de agentes.
La compañía estadounidense Nvidia ha anunciado que su acelerador de inferencia de IA interactiva Groq 3 LPX ya está en producción completa. Se trata de una extensión de la plataforma Vera Rubin, diseñada para ofrecer un gran impulso en la inferencia de IA al permitir una generación ultrarrápida de tokens, algo esencial para los sistemas de agentes que requieren razonamiento y acción en tiempo real.
El Groq 3 LPX se integra en los sistemas Vera Rubin NVL72, que proporcionan una plataforma versátil tanto para entrenamiento como para inferencia. Según Nvidia, este acelerador multiplica la velocidad de generación de tokens, lo que mejora la experiencia del usuario en cargas de trabajo con mucho contexto y permite que los agentes actúen a velocidades extremas.
En pruebas de referencia de Artificial Analysis, el Groq 3 LPX logró un récord de 3.400 tokens de salida por segundo ejecutando el modelo Gemma 4 31B, un modelo de código abierto para agentes, con un contexto de 100.000 tokens. Según la compañía, esta es la velocidad más rápida jamás registrada para ese modelo. Esto se traduce en que tareas como la codificación pueden completarse en minutos en lugar de horas, y ofrece una capacidad de respuesta cuatro veces superior a la de la plataforma alternativa más cercana.
Con esta producción completa, Nvidia refuerza su apuesta por la inferencia de IA, un mercado que crece rápidamente con el auge de los agentes autónomos. La disponibilidad del Groq 3 LPX podría acelerar la adopción de estas tecnologías en empresas que necesitan procesar grandes volúmenes de tokens en tiempo real.
El análisis de Salseo
- La producción completa de Groq 3 LPX marca un hito en la estrategia de Nvidia para dominar no solo el entrenamiento de IA, sino también la inferencia, un mercado en plena expansión con el auge de los agentes de IA.
- El récord de 3.400 tokens por segundo con Gemma 4 31B demuestra que Nvidia está optimizando su hardware para cargas de trabajo de agentes, donde la latencia es crítica. Esto podría presionar a competidores como AMD o startups de chips especializados.
- Aunque el benchmark es impresionante, hay que tomarlo con cautela: los resultados de Artificial Analysis son selectivos y pueden no reflejar el rendimiento en todos los casos de uso. La adopción real dependerá de la integración con los sistemas de los clientes.