Seismora reparte la IA entre dispositivos y nubes

Seismora reparte la IA entre dispositivos y nubes

A medida que las aplicaciones de IA se extienden por móviles, servidores en el borde y distintos proveedores de nube, alguien tiene que decidir dónde se ejecuta cada parte del trabajo. Seismora Inc. quiere que esa decisión se tome de forma automática. La startup está desarrollando lo que denomina un plano de control inteligente: una capa de red que coordina las cargas de trabajo de IA entre dispositivos, infraestructura en el borde y proveedores de nube, para que los desarrolladores no tengan que programar esa lógica en cada aplicación.

Su fundador y consejero delegado, Vito Palermo, explicó el proyecto en una entrevista con John Furrier para la serie theCUBE + NYSE Wired: AI Luminaries, producida por theCUBE, el estudio de retransmisiones en directo de SiliconANGLE Media. Neo4j patrocinó la cobertura de la serie por parte de theCUBE, aunque SiliconANGLE asegura que los patrocinadores no tienen control editorial sobre sus contenidos.

Del tráfico humano al tráfico entre máquinas

El punto de partida de Palermo es un cambio en quién habla con quién en la red. "El auge de la IA crea un escenario en el que pasamos de la comunicación entre personas y sistemas a la comunicación entre máquinas", afirmó.

Su respuesta es un plano de control que permite que el tráfico de IA circule "independientemente de la red, independientemente de quién sea la neocloud o el hiperescalador, o incluso de los propios dispositivos". Las neoclouds son los proveedores de nube más recientes y centrados en la IA que alquilan capacidad de GPU, a diferencia de los hiperescaladores, es decir, las grandes nubes públicas ya consolidadas.

La idea de fondo es sencilla. Las distintas partes de una misma aplicación de IA pueden necesitar recursos de computación muy diferentes. Algunas tareas pueden ejecutarse en local, en el móvil. Otras encajan mejor en el borde, más cerca del usuario. Los trabajos más pesados pueden requerir hardware especializado en la nube.

Cómo debería funcionar el enrutamiento

Palermo puso un ejemplo concreto. En función de lo que el usuario intente hacer en una aplicación, el sistema podría decidir ejecutar parte del trabajo en un iPhone y otra parte en el borde. Una tarea más exigente, como crear un gemelo digital con Omniverse de Nvidia, podría enviarse a una neocloud.

"Y el plano de control toma esas decisiones automáticamente y, además, optimiza el coste", señaló.

Seismora llama a este enfoque "enrutamiento cognitivo". El sistema elige dónde se ejecuta el trabajo de IA a partir de cuatro factores:

  1. Capacidad: lo que el hardware o el modelo pueden hacer realmente.
  2. Coste: lo que cobra cada opción.
  3. Latencia: con qué rapidez deben llegar los resultados.
  4. Restricciones de políticas: las normas sobre adónde pueden ir el trabajo y los datos.

La parte que se ejecuta en el dispositivo encaja con una tendencia más amplia a dar a los agentes de IA personales más contexto local, dejando la nube para las tareas que realmente la necesitan.

Pensado para desarrolladores, no para usuarios finales

Seismora no vende a consumidores. Según Palermo, sus clientes potenciales son los desarrolladores que crean aplicaciones agénticas para usuarios finales. Esos desarrolladores se conectarían al plano de control en lugar de diseñar sus propios sistemas de enrutamiento.

Palermo sostiene que la heterogeneidad es ya un hecho en la IA empresarial. "Te interesa ser heterogéneo porque, sinceramente, estoy seguro de que las empresas hoy trabajan con varias neoclouds y con varios modelos", dijo. "Mi problema es el enrutamiento entre todos estos proveedores, y ahí es donde nos centramos".

Esbozó un esquema en el que los modelos de pesos abiertos proceden de proveedores como Fireworks.ai, el conocimiento contextual lo aporta la tecnología de grafos de Neo4j, y la computación y el almacenamiento se reparten entre el borde y la empresa. El objetivo, en sus palabras, es "poder llevar la inteligencia allí donde tenga sentido".

Una señal: el acuerdo entre Stripe y OpenRouter

Para demostrar que este mercado existe, Palermo citó el acuerdo de Stripe Inc. para adquirir OpenRouter Inc., una plataforma que enruta peticiones entre modelos de IA. La operación se anunció en agosto, por un importe que rondaría los 7.500 millones de dólares. Para Palermo, es una prueba del creciente interés por la infraestructura para transacciones entre máquinas.

OpenRouter trabaja a nivel de modelo, enviando peticiones a distintos modelos de IA. Seismora apunta a una capa más amplia que también tiene en cuenta dónde se encuentra físicamente la computación, desde el móvil del usuario hasta un centro de datos de terceros.

Nuestra opinión

La propuesta de Seismora encaja en una tendencia que venimos siguiendo: a medida que se multiplican los agentes, los problemas interesantes se alejan del modelo en sí y se desplazan hacia la fontanería que lo rodea. El enrutamiento, el control de costes y la ubicación de las cargas se están convirtiendo en productos por derecho propio. Los trabajos recientes sobre modelos de decisión rápida para agentes de IA y sobre controles para cargas de trabajo de agentes en neoclouds apuntan en la misma dirección.

El precio de la operación entre Stripe y OpenRouter sugiere que los inversores ven valor en controlar esta capa de tráfico. Aun así, Seismora por ahora ha descrito un enfoque, sin dar a conocer clientes, pruebas de rendimiento ni precios. Habrá que ver si el "enrutamiento cognitivo" es capaz de hacer cumplir las restricciones de políticas de forma fiable entre proveedores que no controla, y si los desarrolladores confiarán en un tercero para tomar esas decisiones de ubicación. Un plano de control que ve todas las peticiones de IA es también un punto único de fallo muy atractivo, así que su modelo de seguridad importará tanto como el ahorro de costes.