Seismora : un plan de contrôle pour l'IA, du mobile au cloud

Seismora : un plan de contrôle pour l'IA, du mobile au cloud

Les applications d'IA se déploient désormais sur les téléphones, les serveurs edge et chez plusieurs fournisseurs de cloud. Il faut donc bien que quelqu'un décide où chaque tâche doit s'exécuter. Seismora Inc. veut automatiser ce choix. La start-up développe ce qu'elle appelle un plan de contrôle intelligent : une couche réseau qui coordonne les charges de travail d'IA entre les appareils, l'infrastructure edge et les fournisseurs de cloud, pour que les développeurs n'aient pas à coder eux-mêmes cette logique dans chaque application.

Son fondateur et PDG, Vito Palermo, a présenté le projet lors d'un entretien avec John Furrier pour la série theCUBE + NYSE Wired: AI Luminaries, produite par theCUBE, le studio de diffusion en direct de SiliconANGLE Media. Neo4j a sponsorisé la couverture de la série par theCUBE, mais SiliconANGLE précise que ses sponsors n'exercent aucun contrôle éditorial sur ses contenus.

Du trafic humain au trafic entre machines

Le point de départ de Palermo, c'est un changement d'interlocuteurs sur le réseau. "Le boom de l'IA crée une situation où l'on passe d'une communication entre humains et systèmes à une communication de machine à machine", explique-t-il.

Sa réponse : un plan de contrôle qui permet au trafic d'IA de circuler "quel que soit le réseau, quel que soit le néocloud ou l'hyperscaler, et même quels que soient les appareils". Les néoclouds sont ces nouveaux fournisseurs de cloud spécialisés dans l'IA qui louent de la capacité GPU, par opposition aux hyperscalers, ces grands clouds publics bien établis.

L'idée de base est simple. Les différentes briques d'une même application d'IA peuvent nécessiter des ressources de calcul très différentes. Certaines tâches peuvent tourner localement sur un téléphone. D'autres ont leur place en edge, plus près de l'utilisateur. Les traitements les plus lourds peuvent exiger du matériel cloud spécialisé.

Comment l'aiguillage est censé fonctionner

Palermo donne un exemple concret. Selon ce que l'utilisateur cherche à faire dans une application, le système pourrait choisir d'exécuter une partie du travail sur un iPhone et une autre en edge. Une tâche plus exigeante, comme la création d'un jumeau numérique avec Omniverse de Nvidia, pourrait être envoyée vers un néocloud.

"Et le plan de contrôle prend automatiquement ces décisions, tout en optimisant les coûts", ajoute-t-il.

Seismora appelle cette approche le "routage cognitif". Le système choisit où s'exécute le travail d'IA en fonction de quatre critères :

  1. Capacités : ce dont le matériel ou le modèle est réellement capable.
  2. Coût : le prix de chaque option.
  3. Latence : la rapidité avec laquelle les résultats doivent arriver.
  4. Contraintes de politique : les règles qui déterminent où le travail et les données ont le droit d'aller.

Le volet embarqué de ce schéma rejoint une tendance plus large qui consiste à donner davantage de contexte local aux agents d'IA personnels, le cloud étant réservé aux tâches qui en ont besoin.

Conçu pour les développeurs, pas pour le grand public

Seismora ne vise pas les consommateurs. D'après Palermo, ses clients cibles sont les développeurs qui conçoivent des applications agentiques destinées aux utilisateurs finaux. Ces développeurs se brancheraient sur le plan de contrôle au lieu de concevoir leurs propres systèmes de routage.

Pour Palermo, l'hétérogénéité est désormais une donnée de base de l'IA en entreprise. "Il faut être hétérogène parce que, franchement, les entreprises aujourd'hui, j'en suis sûr, travaillent avec plusieurs néoclouds, avec plusieurs modèles", affirme-t-il. "Mon problème, c'est le routage entre tous ces fournisseurs, et c'est là-dessus que nous nous concentrons."

Il esquisse une architecture dans laquelle les modèles à poids ouverts proviennent de fournisseurs comme Fireworks.ai, la connaissance contextuelle de la technologie de graphes de Neo4j, tandis que le calcul et le stockage sont répartis entre l'edge et l'entreprise. L'objectif, selon ses mots : "pouvoir déplacer l'intelligence là où c'est pertinent".

Un signal venu du rachat d'OpenRouter par Stripe

Pour montrer que ce marché est bien réel, Palermo cite l'accord de Stripe Inc. pour racheter OpenRouter Inc., une plateforme qui aiguille les requêtes entre différents modèles d'IA. L'opération a été annoncée en août, pour un montant qui avoisinerait 7,5 milliards de dollars. Pour Palermo, c'est la preuve d'un intérêt croissant pour les infrastructures dédiées aux transactions de machine à machine.

OpenRouter opère au niveau des modèles, en envoyant les requêtes vers différents modèles d'IA. Seismora vise une couche plus large, qui prend aussi en compte l'emplacement physique du calcul, du téléphone de l'utilisateur jusqu'au centre de données d'un tiers.

Notre analyse

Le discours de Seismora s'inscrit dans une tendance que nous suivons de près : à mesure que les agents se multiplient, les problèmes intéressants se déplacent du modèle lui-même vers la tuyauterie qui l'entoure. Le routage, la maîtrise des coûts et le placement des charges deviennent des produits à part entière. Des travaux récents sur des modèles de décision rapides pour les agents d'IA et sur des contrôles pour les charges de travail agentiques sur les néoclouds vont dans le même sens.

Le prix payé par Stripe pour OpenRouter laisse penser que les investisseurs voient de la valeur dans le contrôle de cette couche de trafic. Reste que Seismora n'a pour l'instant présenté qu'une approche, sans dévoiler ni clients, ni benchmarks, ni tarifs. Il faudra voir si le "routage cognitif" parvient à faire respecter de manière fiable des contraintes de politique chez des fournisseurs qu'il ne contrôle pas, et si les développeurs accepteront de confier ces décisions de placement à un tiers. Un plan de contrôle qui voit passer chaque requête d'IA constitue aussi un point de défaillance unique particulièrement tentant : son modèle de sécurité comptera donc autant que les économies qu'il promet.