Google crea un modelo que predice sobre tablas sin entrenar: adiós a las semanas de ingeniería de datos

TabFM, el nuevo modelo fundacional de Google Research, hace predicciones sobre tablas nunca vistas en un solo paso, eliminando la necesidad de entrenar modelos desde cero para cada conjunto de datos.
Google Research ha presentado TabFM, un modelo fundacional que promete cambiar la forma en que las empresas extraen valor de sus datos tabulares. La gran mayoría de la información corporativa —desde registros financieros hasta bases de datos de clientes— vive en tablas, pero hasta ahora, cada vez que se quería construir un modelo predictivo sobre esos datos, tocaba empezar de cero: limpiar, codificar variables, diseñar características y ajustar hiperparámetros. Un proceso que podía llevar semanas.
TabFM aborda el problema desde otro ángulo: en lugar de entrenar un modelo específico para cada tabla, aprende sobre la marcha a partir del contexto que se le proporciona. Basta con darle un conjunto de ejemplos históricos (filas con sus etiquetas conocidas) y los nuevos datos que se quieren predecir, todo en un mismo "prompt" unificado. En una sola pasada, el modelo devuelve predicciones. Para un analista que quiera estimar la probabilidad de fuga de clientes, esto significa pasar de construir tuberías de datos complejas a una simple llamada API.
¿Por qué no usar directamente un gran modelo de lenguaje (LLM) para esto? Porque los LLM están entrenados con texto, no con datos estructurados, y se atragantan con las tablas. Sus límites de contexto se quedan cortos con miles de filas, parten los números en tokens de forma ineficiente y pierden la noción de qué valor pertenece a qué fila y columna. El investigador de Google Weihao Kong lo resume: hoy es más efectivo pedirle a un LLM que escriba el código para llamar a XGBoost que pedirle que lea la tabla él mismo.
TabFM supera estas limitaciones tratando los datos como una cuadrícula, no como una secuencia de texto. Su arquitectura combina lo mejor de dos enfoques previos: la contextualización profunda de características de TabPFN y la compresión eficiente de filas de TabICL. Primero, un módulo de atención alterna entre columnas y filas para capturar interacciones complejas sin intervención humana. Luego, comprime cada fila en un vector denso, reduciendo drásticamente el coste computacional. Finalmente, un Transformer causal opera sobre esa secuencia comprimida para generar la predicción.
El modelo se entrenó íntegramente con cientos de millones de conjuntos de datos sintéticos, generados mediante modelos causales estructurales que incorporan funciones aleatorias. Esto le ha permitido aprender los patrones matemáticos fundamentales de cómo interactúan las características tabulares, sin necesidad de ver datos reales durante el entrenamiento. Para los desarrolladores empresariales, la promesa es clara: reducir el tiempo de puesta en producción de semanas a segundos.
El análisis de Salseo
- TabFM ataca un cuello de botella real: el 80% del tiempo de los científicos de datos se va en limpiar y preparar datos tabulares. Si el modelo funciona como promete, el ahorro en costes de personal y tiempo de desarrollo puede ser enorme para empresas con muchos casos de uso predictivo.
- El hecho de que se entrene solo con datos sintéticos es un arma de doble filo. Por un lado, evita problemas de privacidad y sesgos de datos reales. Por otro, su rendimiento en tablas del mundo real —con ruido, valores faltantes extraños o relaciones no lineales— está por ver. La prueba de fuego será en competiciones como Kaggle.
- Esto no jubila a XGBoost ni a los modelos de gradient boosting. TabFM está pensado para predicciones rápidas en contextos cambiantes, pero los métodos tradicionales probablemente sigan siendo superiores cuando se dispone de tiempo y datos masivos para afinar un modelo a medida. La clave será vigilar los benchmarks comparativos que publique Google.
- Para Alphabet, esta no es solo una mejora técnica: es una forma de meter la cabeza en el negocio del machine learning empresarial, compitiendo con Databricks, DataRobot o los propios equipos internos de ciencia de datos. Si integran TabFM en Vertex AI, podrían capturar un mercado que hasta ahora se les resistía frente a AWS y Azure.