Introducción
¿Una empresa de datos realmente crece?
Esta semana lo que habría sido noticia hace un año ya no lo es. Snowflake invirtió en AtScale, un proveedor de servicios de capa semántica en una inversión estratégica en la decadente historia de la empresa. Un movimiento extraño, dado el compromiso con el intercambio semántico abierto o “OSI” (otro acrónimo más o .yaa) que parece ser un flujo métrico disfrazado de otra cosa.
Mientras tanto, Databricks, la empresa de datos e inteligencia artificial, invirtió en Loveable, ganadora de la IA y amante del capital de riesgo integral, Loveable, la empresa sueca de codificación de vibraciones de rápido crecimiento.
Iniciar una rama de riesgo es una ruta probada para las empresas. Todo el mundo, desde Walmart e Hitachi hasta bancos como JPMorgan y Goldman Sachs y, por supuesto, los hiperescaladores (MSFT, GOOG) tienen brazos de riesgo (aunque, curiosamente, no AWS).
Los beneficios son claros. Una inversión en una ronda puede otorgar el derecho de tanteo. Ofrece a ambas partes influencia en torno a características complementarias de la hoja de ruta, así como claras ventajas de distribución. “Sinergia” es la palabra que se usa en las salas de juntas, aunque es el hermano menor, menos insidioso y amigable, del recorte de costos centralizado tan frecuente en las empresas de capital riesgo en lugar de en las empresas respaldadas por capital de riesgo.
Por lo tanto, no debería sorprender que Databricks se esté expandiendo fuera de Data. Después de todo (y Ali ha sido muy abierto al respecto), el equipo entiende que la forma de hacer crecer la empresa es a través de nuevos casos de uso, sobre todo la IA. Si bien Dolly fue un fracaso, la asociación con OpenAI no está clara. AI/BI, así como las aplicaciones Databricks, son iniciativas prometedoras diseñadas para atraer más amigos a la tienda, fuera de los administradores centrales del clúster SYSADMIN.
Mientras tanto, Snowflake puede estar intentando una táctica similar pero con diferentes niveles de éxito. Aparte de Streamlit, no está claro qué valor aportan realmente sus adquisiciones. Openflow, el Nifi neolítico bajo el capó, no es bien recibido. Más bien, son los desarrollos internos, como la integración del núcleo dbt en la plataforma Snowflake, los que parecen estar ganando más terreno.
En este artículo, profundizaremos en los diferentes factores en juego y haremos algunas predicciones para 2026. ¡Vamos a seguir adelante!
Crecimiento a través de casos de uso
Los ladrillos de datos tienen un problema. Un gran problema. Y eso es equidad.
Como cuarta empresa privada más grande del mundo, sus empleados necesitan liquidez a la tierna edad de 12 años. Y la liquidez es cara (consulte este excelente artículo).
Para cumplir con sus compromisos internos, Databricks necesitaba quizás más de 5 mil millones de dólares cuando realizó este aumento. La cantidad que necesita al año es significativa. Por lo tanto, simplemente no es una opción dejar de recaudar dinero sin despedir empleados y reducir costos.
El crecimiento es asombroso. En la última serie L (!), la empresa cita un crecimiento interanual del 55%, lo que lleva a una valoración de más de 130.000 millones de dólares. La empresa debe seguir recaudando dinero para pagar sus gastos operativos y su capital, pero existe otra limitación que es la valoración. En este punto, la capacidad de Databricks para recaudar dinero es prácticamente un referente para la industria, por lo que todos los involucrados tienen un gran interés (la lista es enorme) en mantener las cosas así.
El sueño es seguir haciendo crecer la empresa, ya que esto sustentará la valoración: las valoraciones están ligadas al crecimiento de los ingresos. Lo que nos lleva de nuevo a los casos de uso.
Los casos de uso claros, como se muestran aquí, son aproximadamente:
Procesamiento de big data y chispa Dentro de esto, cargas de trabajo de aprendizaje automático Cargas de trabajo de IA Almacenamiento de datos Ingestión o Lakeflow (sospechamos que Arcion fue un poco temprano) Aplicaciones de inteligencia empresarial
Vale la pena señalar que se pronostica que todos estos sectores crecerán entre un 15% y un 30% en total, según la gran mayoría de los informes de mercado (un ejemplo aquí). Esto refleja la demanda subyacente de más datos, más automatización y más eficiencia que, en mi opinión, en última instancia está justificada, especialmente en la era de la IA.
Parecería indicar, por lo tanto, que el fondo o “piso” para Databricks sería alrededor de un crecimiento del 15% al 30%, y con él tal vez un recorte del 40% a los múltiplos de valoración (suponiendo una correlación lineal; sí, sí, suposiciones, suposiciones; más información aquí), salvo, por supuesto, cualquier shock exógeno al sistema, como la quiebra de OpenAI o la guerra.
Esto no es preocupante como un caso bajista, lo que me hace preguntarme: ¿qué es el toro?
El toro está en las dos A: casos de uso y aplicaciones de IA.
La IA como salida
Si Databricks puede asociarse exitosamente con los proveedores de modelos y convertirse en el motor de facto para alojar modelos y ejecutar los flujos de trabajo asociados, podría ser enorme.
Matemáticas del pañuelo: los ingresos son de 4.800 millones de dólares RR y crecen al 55%. Digamos que estamos creciendo al 30% en estado estacionario, nos falta el 25%. El 25% de 4,8 dólares son 1.200 millones de dólares. ¿De dónde puede venir esto? Los productos de IA supuestamente existentes y el almacenamiento existente ya superan los 2 mil millones de dólares (ver aquí). ¿Qué pasará el próximo año cuando Databricks alcance los 6 mil millones de dólares y necesitemos crecer un 50% y, por lo tanto, necesitemos 3 mil millones de dólares? ¿El negocio va a duplicar la parte de IA?
Confluent es un referente. Es la mayor empresa de procesamiento Kafka/stream, con unos ingresos de alrededor de 1.100 millones de dólares anualizados. Crece alrededor del 25% interanual, pero se comercializa a aproximadamente 8 veces los ingresos y se vende a IBM por 11 mil millones de dólares, es decir, aproximadamente 11 veces los ingresos. Incluso con su base de seguidores leales y su fuerte adopción de casos de uso de IA (ver, por ejemplo, la arquitectura de mercado de Sean Falconer), aún tendría dificultades para generar otros 250 millones de dólares de crecimiento anual cada año.
Las aplicaciones son otra historia. Aquellos que crean aplicaciones con uso intensivo de datos no son los que generalmente crean productos internos, una tarea que a menudo llevan a cabo equipos internos de ingenieros o consultores de software. Estos son equipos que ya saben cómo hacer esto, y saben cómo hacerlo bien, con tecnología existente diseñada específicamente para su propósito, es decir, primitivas de ingeniería centrales como React, Postgres (autohospedado) y Fast API.
Un ingeniero de datos podría iniciar sesión en Loveable, activar Neon-Postgres, una canalización ETL de chispa declarativa y una interfaz en Databricks. Podrían. ¿Pero querrán agregar esto a su creciente cartera de pedidos? No estoy seguro.
La cuestión es que el negocio principal no está creciendo lo suficientemente rápido como para sostener la valoración actual, por lo que se requieren líneas de negocio adicionales. Databricks es como una gallina de los dados en la mesa de dados, que sigue evitando sacar el número indescriptible. Ahora pueden seguir haciendo más y más apuestas, mientras todos los que están alrededor de la mesa siguen beneficiándose.
Databricks se destaca como una empresa exclusivamente de datos.
Hemos escrito antes sobre las formas en que podrían haber salido de esto. La transmisión estructurada por Spark era una opción obvia, pero el barco zarpó y son empresas como Aiven y Veverica las que ahora están en la pole position para la carrera de Flink.
📚 Leer: Lo que no te puedes perder en Datos en tiempo real e IA en 2025 📚
Convertirse en una empresa modelo o en una 'Nube de IA' también parece una tarea difícil. Coreweave, Lambda y, por supuesto, Nebius están en camino de desafiar realmente a los hiperescaladores aquí.
Una nube de IA está impulsada fundamentalmente por una alta disponibilidad de computación optimizada para GPU. Esto no significa simplemente alquilar instancias EC2 a Jeff Bezos. Significa ingresar a los mensajes directos de Jensen Huang y comprar una tonelada de GPU.
Nebius tiene alrededor de 20.000, y otros 30.000 están en camino; este informe de Yahoo cree que las cifras son mayores. Todas las nubes de IA alquilan espacio en centros de datos y construyen los suyos propios. La inferencia, a diferencia de Spark, no es una mercancía debido a los inmensos desafíos de software, hardware y logística necesarios.
No olvidemos que Nebius posee poco más del 25% de Clickhouse; ambos equipos están muy dirigidos por la ingeniería de software y son rusos; el Club de Antiguos Alumnos de Yandex.
Si algo hemos aprendido es que es más fácil subir en la cadena de valor que bajarla. Escribí sobre este embudo hace quizás dos años, pero parece más cierto que nunca.
El copo de nieve devora fácilmente el dbt. Databricks se ha comido fácilmente los ingresos del almacén de Snowflake. "Microsoft se comerá los Databricks". Y a su vez, con la potencia bruta del centro de datos, las asociaciones entre NVIDIA y Meta y un ejército de los mejores desarrolladores del sector, Nebius puede devorar a los hiperescaladores.
El almacenamiento de datos bajo ataque
Cada día que pasa, parece cada vez más improbable que las plataformas de almacenamiento de datos patentadas sean el fin técnico de la inteligencia artificial y la infraestructura de datos.
Salesforce está aumentando los impuestos, las bases de datos admiten capacidades de consultas cruzadas y los CDO ejecutan Duck DB en el propio Snowflake.
¡Incluso Bill Inmon reconoce que las empresas de almacenamiento se perdieron el almacenamiento!
Si bien es conveniente, existe una escala en la que las empresas e incluso las empresas emergentes en etapa avanzada exigen mayor apertura, mayor flexibilidad y computación más barata.
En Orchestra lo hemos visto de primera mano. Las empresas que buscan tecnologías como Iceberg son abrumadoramente masivas. Desde los mayores proveedores de telecomunicaciones hasta Booking.com de este mundo (que casualmente usan y aman Snowflake; hablaremos de esto más adelante), es poco probable que el almacenamiento de datos tradicional siga dominando la proporción del presupuesto que ha tenido durante la última década.
Hay algunas formas en las que Snowflake también ha intentado ampliar su oferta principal:
Soporte para iceberg gestionado; motor de computación abierto Catalogación de datos (Seleccionar *) Aplicaciones (streamlit) Spark y otras formas de computación como contenedores Agentes de IA para analistas También conocido como inteligencia de copo de nieve Transformación (es decir, dbt)
Irónicamente, para un proveedor de motores patentado, parecería que Iceberg es una gran vía de crecimiento, al igual que la IA. Vea más de TT aquí.
A los clientes de Snowflake les encanta.
Pangea de datos
Creo que las definiciones de pioneros, primeros en adoptar, últimos en adoptar y rezagados están cambiando.
Los primeros usuarios ahora incluyen un componente pesado en tiempo real y un enfoque de la pila que prioriza la IA. Es probable que esto vuelva al aprendizaje automático a medida que la gente se dé cuenta de que la IA no es un martillo para cada clavo.
Estas empresas quieren asociarse con algunos proveedores importantes y tienen un gran apetito por crear y comprar software. Tendrán al menos un proveedor en el espacio de streaming/IA, motor de consultas y análisis. Un buen ejemplo es booking.com, o quizás Fresha, que usa Snowflake, Starrocks y Kafka (me encantó el artículo siguiente).
📚 Leer: Explorando cómo las herramientas de transmisión modernas impulsan la próxima generación de análisis con StarRocks. 📚
Los primeros usuarios tendrán la pila de análisis tradicional y luego otra área. Carecen de la escala necesaria para aceptar plenamente una estrategia de datos e inteligencia artificial para toda la empresa, por lo que deben centrarse en aquellos casos de uso que saben que funcionan. Automatización, Informes.
Los antiguos “early adopters” habrían tenido la pila de datos de Andreesen Horowitz. Eso, me temo, ya no está de moda ni está de moda. Esa era la antigua arquitectura. Los usuarios tardíos tienen la pila general.
¿Los rezagados? Quién sabe. Probablemente elegirán a quien mejor conozca su CTO. Ya sea Informatica (vea esta increíble publicación de Reddit), Fabric o incluso GCP.
El siguiente paso: caos para los proveedores más pequeños
Muchas empresas están cambiando de rumbo. Secoda fue adquirida por Atlassian, Select Star fue adquirida por Snowflake. Arch.dev, los creadores de Meltano, cerraron y pasaron el proyecto a Matatika. Desde las grandes empresas hasta las pequeñas, el lento crecimiento de los ingresos combinado con la presión masiva de las infladas rondas de capital de riesgo hacen que la construcción de una empresa al estilo de una “pila de datos moderna” sea un enfoque insostenible.
📚 Leer: El viaje final de la pila de datos moderna | ¿Puede la capa de contexto para IA proporcionar catálogos con el último helicóptero que sale de Saigón? 📚
¿Qué pasaría cuando las cifras de crecimiento de Databricks y Snowflake finalmente comiencen a desacelerarse, como sostenemos que deberían hacerlo aquí?
¿Qué pasaría si hubiera un gran shock exógeno en el mercado o si OpenAI se quedara sin dinero más rápido de lo esperado?
¿Qué sucede cuando Salesforce aumenta los impuestos y, por lo tanto, herramientas como Fivetran y dbt aumentan aún más de precio?
Se está gestando una tormenta perfecta para las migraciones y la re-arquitectura. La infraestructura de datos es extremadamente rígida, lo que significa que en tiempos difíciles las empresas suben los precios. Las instancias spot EC2 realmente no han cambiado mucho en precio a lo largo de los años, al igual que tampoco lo ha hecho la infraestructura de datos y, sin embargo, incluso AWS está aumentando los precios de las GPU.
El coste marginal de incorporar una herramienta adicional se está volviendo muy alto. Solíamos construir todo nosotros mismos porque era la única manera. Pero tener una herramienta para cada problema tampoco funciona.
No debemos olvidar que la ley de Parkinson también se aplica a los presupuestos de TI. Cualquiera que sea el presupuesto, se gastará. Imagínese si tuviera una herramienta que le ayudara a automatizar más cosas con IA y al mismo tiempo redujera su factura de almacenamiento y sus licencias de BI (normalmente una gran línea presupuestaria de pérdidas y ganancias del 25 % al 50 %), ¿qué haría?
No te das una palmadita en la espalda: lo gastas. Lo gastas en más cosas, haciendo más cosas. Probablemente volverá a subir su factura de Databricks y Snowflake. Pero tendrás más que mostrar.
La consolidación está haciendo que los fondos vuelvan al centro de gravedad. Se trata de Snowflake, Databricks, GCP, AWS y Microsoft (y, en menor medida, palantir). Esto significa caos para la mayoría de los proveedores más pequeños.
Conclusión: prepárese para una arquitectura más simple
El Impuesto Salesforce es un momento crucial en nuestra industria. Empresas como Salesforce, SAP y ServiceNow tienen una inmensa cantidad de datos y suficiente influencia para mantenerlos ahí.
Como Data People, cualquiera que haya realizado una migración de Salesforce a Netsuite sabe que migrar estas herramientas es probablemente el paso más grande, más costoso y más doloroso que cualquiera enfrenta en sus carreras profesionales.
Salesforce cobrar tarifas a los proveedores de servicios de infraestructura aumentará los precios, lo que a su vez, combinado con el castillo de naipes cada vez más precario que vemos en la inteligencia artificial y los datos, todo apunta hacia una consolidación masiva.
Creo que la adquisición de Data.World por parte de ServiceNow proporciona cierta claridad sobre por qué veremos que los equipos de datos harán más uso de las herramientas existentes, simplificando la arquitectura en el proceso. Data.World es un proveedor de ontologías y gráficos de conocimiento. Al asignar el esquema de datos de ServiceNow a una ontología, una tarea gigantesca, ServiceNow podría terminar con una IA y agentes medio decentes ejecutándose dentro de ServiceNow.
AgentForce y Data360 son el intento de Salesforce y supuestamente ya tienen 1.400 millones de dólares en ingresos, aunque sospechamos que también incluye mucho legado.
Estos proveedores realmente no quieren que los datos se ejecuten como casos de uso de IA en Snowflake o Databricks. Quieren que los especialistas en adquisiciones, los profesionales financieros y los gurús del marketing permanezcan en sus plataformas, y tienen los medios para lograr que se queden.
Este no es un consejo financiero ni una predicción descabellada. Predecir que Snowflake y Databricks terminarán creciendo más según el consenso de los analistas no es un desafío.
Pero la idea de que el crecimiento de las mayores empresas de datos esté a punto de desacelerarse es un desafío. Desafía la retórica. Desafía el discurso maximalista de la IA.
Estamos entrando en la era del Gran Cierre de Datos. Si bien los maximalistas de la IA sueñan con un futuro sin fronteras, la realidad es un pesado techo construido por la gravedad de los actuales. En este nuevo panorama, el ganador no es el que tiene el mejor conjunto de herramientas, sino las personas que aprovechan al máximo lo que tienen.
Acerca de mí
Soy el director ejecutivo de Orchestra. Ayudamos a Data People a construir, ejecutar y monitorear sus canalizaciones fácilmente.
Puedes encontrarme en Linkedin aquí.