Cerebras se alía con Gimlet Labs para inferencia ultrarrápida de 3.000 tokens por segundo

Cerebras y Gimlet Labs unen su hardware y su nube para ofrecer respuestas de IA hasta 3.000 tokens por segundo, con el primer centro de datos conjunto previsto para finales de año.
Cerebras Systems (NASDAQ: CBRS) y Gimlet Labs han anunciado este 28 de septiembre una colaboración para ofrecer una nueva categoría de inferencia de IA ultrarrápida a gran escala. La idea es juntar el compute de oblea (wafer-scale) de Cerebras con Gimlet Cloud para construir una nube de inferencia "desagregada" que vaya desde la infraestructura del centro de datos hasta las APIs que usan los desarrolladores. El objetivo que ponen sobre la mesa: velocidades de hasta 3.000 tokens por segundo para aplicaciones que necesitan respuesta inmediata, y el primer centro de datos de Gimlet equipado con Cerebras debería estar operativo a finales de este año.
Para entender lo que se juegan, conviene aclarar dos términos. Un "token" es cada fragmento de texto que un modelo genera, así que los tokens por segundo miden la velocidad a la que la IA responde; la "inferencia" es justo ese momento en el que el modelo ya entrenado contesta a una petición. En aplicaciones en tiempo real (voz, vídeo, agentes y asistentes) la latencia marca la diferencia entre una interacción que se siente fluida y otra que parece atascada. El comunicado lo resume con una idea: cuando la IA responde al instante, el usuario la usa más, se queda más tiempo y ejecuta tareas de mayor valor. Dicho de otro modo, los tokens rápidos son tokens más caros.
Técnicamente, Gimlet Cloud combina el Wafer Scale Engine de Cerebras con GPUs en una única solución de inferencia y utiliza tecnología de "desagregación" para repartir cada fase del proceso en el chip que mejor le viene. Es decir: no se trata de sustituir una pieza por otra, sino de aprovechar que Cerebras aporta velocidad punta y las GPUs aportan volumen de procesamiento, y de enrutar cada tarea al silicio más adecuado. Ese enfoque híbrido es el que permitiría llegar a los 3.000 tokens por segundo en producción.
Las declaraciones dejan claro el reparto de papeles. Zain Asgar, cofundador y consejero delegado de Gimlet Labs, insiste en que "la velocidad de inferencia importa" porque determina la productividad real de la IA y abre mercados nuevos. Sean Lie, cofundador y director de tecnología de Cerebras, añade que juntar los "tokens más rápidos" de Cerebras con GPUs de alto rendimiento da "la mejor economía de centro de datos para todos" y confirma que Gimlet será socio de lanzamiento del CS-4, la nueva generación de su tecnología. La colaboración no arranca de cero: ambas compañías trabajan con clientes conjuntos desde el año pasado y ya sirven tokens en despliegues privados. Ahora el plan es ampliar el acuerdo a software, diseño de infraestructura, APIs, herramientas para desarrolladores, optimización, validación y operaciones.
Para el inversor, el detalle relevante es que Cerebras es una compañía que cotiza en bolsa y que este movimiento le abre un canal de distribución en la nube de un tercero, sin obligar al cliente a comprar hardware propio. Gimlet Labs es una startup no cotizada, con sede en San Francisco y respaldada por Andreessen Horowitz y Menlo Ventures. Eso sí, el anuncio no incluye ni una sola cifra económica: ni capacidad contratada, ni ingresos estimados, ni duración del acuerdo.
El análisis de Salseo
- El negocio de Cerebras se juega cada vez más en la inferencia, no solo en entrenar modelos. Cuanto más rápido responde el chip, más puede cobrar por uso y más difícil es que el cliente se vaya a la competencia. Este acuerdo le da una vía para llegar a desarrolladores que nunca comprarían su hardware: consumen velocidad a través de la nube de otro.
- El titular esconde un lanzamiento de producto: Gimlet será socio de lanzamiento del CS-4, la próxima generación de chip de Cerebras. Es decir, la noticia sirve también como plataforma para presentar en sociedad su nueva tecnología ante clientes reales. La señal a vigilar es cuándo se confirma la disponibilidad general del CS-4 y si aparecen clientes con nombre y apellidos.
- El matiz que el titular no cuenta: el comunicado no incluye ni un euro de cifras, ni capacidad contratada, ni ingresos esperados, ni duración del acuerdo. Y los 3.000 tokens por segundo son un "hasta" en condiciones que no se detallan. Todo depende de que el primer centro de datos esté realmente operativo a finales de año, algo que aún está por ver.
- El modelo híbrido (Cerebras más GPUs) es una lectura estratégica interesante: Cerebras no aspira a desbancar a Nvidia, se coloca como el chip "rápido" que convive con el chip "masivo". Eso reduce la resistencia a adoptarlo en clientes que ya tienen GPUs, pero también pone techo a cuánto puede facturar por cada instalación.