ZML
Pile d'inférence LLM haute performance de l'écosystème Scaleway, pour servir des modèles ouverts en souveraineté.
Servir des modèles ouverts en souveraineté
ZML est une pile d'inférence haute performance associée à l'écosystème Scaleway, destinée à servir des modèles de langage ouverts sur une infrastructure européenne. Elle s'inscrit dans l'effort de souveraineté : faire tourner l'inférence chez soi, sur du matériel maîtrisé, plutôt que via des API extraterritoriales.
Questions fréquentes
À quoi sert une pile d'inférence comme ZML ?
À exécuter des modèles de langage efficacement sur sa propre infrastructure : c'est la couche qui transforme des poids de modèle en service utilisable. Pour la souveraineté, disposer d'une inférence performante hébergée en Europe évite de dépendre d'API soumises à un droit extraterritorial.
Articles liés
ZML/LLMD : et si le « Docker des LLM » était français ?
Le 8 juillet 2026, la startup parisienne ZML publie LLMD, un serveur d'inférence qui fait tourner les LLM sur cinq familles de puces (NVIDIA, AMD, Google, Intel, Apple) depuis une seule base de code. Décryptage technique et lecture souveraineté du « Docker des LLM ».
« On n'aime pas le mot souveraineté » : ce que le choix de Scaleway par LVMH révèle de la nouvelle géopolitique du cloud
À VivaTech, le DSI de LVMH a expliqué pourquoi son groupe choisit Scaleway, et pourquoi il se méfie du mot « souveraineté ». Derrière l'anecdote, une doctrine : l'autonomie stratégique comme portefeuille multi-régional plutôt que comme repli.
Souveraineté : exécution 100 % locale d'Hermès avec des modèles open weight (Qwen, Nemotron) sur NVIDIA RTX / DGX Spark
Pour une DSI soumise à des exigences de souveraineté ou de confidentialité, Hermès Agent peut fonctionner sans aucun appel cloud : agent model-agnostic, modèles open weight (Qwen 3.6, NVIDIA Nemotron), inférence locale via vLLM, Ollama ou LM Studio sur NVIDIA RTX ou DGX Spark.