Snowflake lanza enrutamiento automático de IA que reduce costes hasta 3 veces

Snowflake presenta el enrutamiento dinámico de modelos en su Cortex AI Gateway, permitiendo a las empresas ahorrar hasta 3x en costes de tokens al asignar cada tarea al modelo más adecuado, sin perder control ni gobernanza.
Las empresas que ejecutan agentes de IA a gran escala se enfrentan a un problema común: usar un solo modelo para todo es ineficiente. Un modelo demasiado potente para preguntas simples encarece y ralentiza las respuestas, mientras que uno demasiado limitado falla en tareas complejas. Snowflake ha lanzado una solución con su Cortex AI Gateway: el enrutamiento dinámico de modelos. Al seleccionar la opción "auto" en lugar de un modelo fijo, el sistema dirige cada tarea al modelo que ofrece la mejor combinación de calidad y coste. Según pruebas internas de Snowflake, esto puede reducir los costes de tokens hasta 3 veces en algunas cargas de trabajo.
El funcionamiento se apoya en dos mecanismos. Primero, un modelo pequeño intenta resolver la tarea; si no puede, llama a un modelo más grande como herramienta y continúa desde ahí. Segundo, un clasificador entrenado con consultas pasadas asigna automáticamente preguntas sencillas a modelos simples. Los clientes pueden restringir el enrutamiento a un modelo o conjunto de modelos, y no hay tarifa adicional: Snowflake factura solo por uso de tokens, por lo que usar un modelo más barato resulta en una factura más baja. La gobernanza también se refuerza: los controles de acceso siguen a la tarea, no solo a los datos, y los modelos abiertos pueden ejecutarse en la región del cliente para cumplir con requisitos de residencia de datos.
Snowflake complementa esta función con herramientas de contexto como Horizon Context y Cortex Sense, que permiten empaquetar información previa para que modelos más simples y baratos puedan realizar tareas sin necesidad de explorar desde cero. Además, la reciente adquisición de Natoma aporta más de 100 conectores MCP con acceso gobernado, lo que permite a los agentes tener permisos limitados (por ejemplo, solo lectura en un correo). La compañía busca diferenciarse no solo por el ahorro, sino por integrar el enrutamiento dentro de su entorno de datos y cumplimiento normativo.
El movimiento de Snowflake se enmarca en una tendencia del sector hacia el enrutamiento automático de modelos. Competidores como Databricks, AWS, Google Cloud y Nvidia han anunciado tecnologías similares. Sin embargo, analistas como Sanjeev Mohan señalan que Snowflake no vende solo enrutamiento, sino un enrutamiento que nunca sale de su perímetro de datos gobernado, con controles de acceso y atribución de costes ya integrados. Para empresas que ya centralizan sus datos y cumplimiento en Snowflake, esta es una palanca real para optimizar gastos en IA. Para otras, un gateway neutral podría ofrecer más flexibilidad a costa de menos integración.
El análisis de Salseo
- El verdadero valor de este lanzamiento no es solo el ahorro, sino que Snowflake ata el enrutamiento a su sistema de gobernanza de datos. Las empresas que ya usan Snowflake para cumplimiento normativo pueden aplicar las mismas reglas de acceso a los modelos, evitando fugas de información y simplificando auditorías.
- El mecanismo 'advisor pattern' (modelo pequeño que prueba primero) es una solución elegante: no descarta los modelos grandes, sino que los usa solo cuando es necesario. Esto evita el sobrecoste de las consultas simples sin sacrificar la capacidad de respuesta en las complejas.
- La competencia en enrutamiento de modelos se está intensificando, pero la clave está en la diferenciación. Databricks apuesta por la gobernanza desde el ML y la ingeniería de datos, mientras que Snowflake lo hace desde el análisis y el control de acceso. La decisión final dependerá de dónde tenga el cliente su centro de gravedad de datos.
- Esta funcionalidad es una señal de que los costes de inferencia de IA se están convirtiendo en un problema real para las empresas. El enrutamiento dinámico deja de ser un lujo para convertirse en una necesidad, y quienes lo integren con su stack de datos tendrán ventaja competitiva.