Databricks
Plateforme lakehouse unifiant data engineering, analytique et IA ; référence de la stack data moderne aux côtés de Snowflake et BigQuery.
SFEIR AI · Mis à jour le 28 août 2026
Le lakehouse unifié
Databricks a popularisé le lakehouse, qui réunit la souplesse du data lake et la rigueur du data warehouse. La plateforme couvre le data engineering, l'analytique et l'entraînement de modèles sur un socle commun. Elle figure, avec Snowflake et BigQuery, parmi les fondations de la stack data moderne.
Fondée par les créateurs d'Apache Spark
La société est fondée en 2013 à San Francisco par sept chercheurs de l'AMPLab de l'université de Californie à Berkeley : Ali Ghodsi, Ion Stoica, Matei Zaharia, Patrick Wendell, Reynold Xin, Andy Konwinski et Arsalan Tavakoli-Shiraji. Ce sont les créateurs d'Apache Spark, projet né en 2009 dans ce même laboratoire, ouvert en 2010 et donné à l'Apache Software Foundation en 2013, l'année de la création de l'entreprise.
Des projets ouverts sous Apache 2.0
Les projets open source portés par Databricks sont publiés sous licence Apache 2.0 : Delta Lake pour le format de table transactionnel, MLflow pour le cycle de vie des modèles, Unity Catalog pour la gouvernance, comme Apache Spark lui-même. Cette homogénéité de licence est vérifiable sur les dépôts et distingue la couche ouverte de la plateforme managée, qui reste commerciale.
Une valorisation en forte progression, annoncée par l'éditeur
Databricks a annoncé en septembre 2025 un tour de série K d'environ un milliard de dollars valorisant la société au-delà de 100 milliards, puis en décembre 2025 une série L de plus de 4 milliards à une valorisation de 134 milliards, assortie d'un revenu annualisé dépassant 4,8 milliards de dollars en croissance de plus de 55 %. Un nouveau tour a été annoncé le 16 juillet 2026 à 188 milliards de dollars, au stade du term sheet. Tous ces chiffres émanent de l'entreprise et ne font l'objet d'aucun audit indépendant.
Questions fréquentes
Qu'est-ce qu'un lakehouse ?
Un lakehouse combine le data lake (stockage brut, souple, économique) et le data warehouse (schéma, gouvernance, performance SQL) sur une seule plateforme. Databricks en est le promoteur historique : un socle unique pour l'ingénierie de données, l'analytique et l'IA.
Qui a fondé Databricks ?
Sept chercheurs de l'AMPLab de Berkeley, en 2013 : Ali Ghodsi, Ion Stoica, Matei Zaharia, Patrick Wendell, Reynold Xin, Andy Konwinski et Arsalan Tavakoli-Shiraji. Ce sont les créateurs d'Apache Spark, projet issu du même laboratoire.
Quelle différence entre Databricks et Apache Spark ?
Spark est le moteur open source de calcul distribué. Databricks est la plateforme cloud managée qui l'entoure : espace de travail collaboratif, Delta Lake, MLflow, Unity Catalog, moteur Photon et gouvernance. L'un est une brique, l'autre un environnement complet.
Sous quelle licence sont Delta Lake, MLflow et Unity Catalog ?
Sous licence Apache 2.0, comme Apache Spark. Cette homogénéité vaut pour la couche ouverte du projet ; la plateforme Databricks elle-même reste un produit commercial distinct de ces composants.
Quelle est la valorisation de Databricks ?
134 milliards de dollars au tour de décembre 2025, puis 188 milliards annoncés le 16 juillet 2026 au stade du term sheet. Ces montants sont communiqués par l'entreprise, qui n'est pas cotée et ne publie pas de comptes audités.
Sources
Articles liés
Snowflake, Databricks, BigQuery : comparer les lakehouses en 2026
L'ère du lakehouse : pourquoi 2026 marque un tournant Il y a encore quelques années, la question du stockage et du traitement de la donnée se posait en termes binaires : entrepôt de données structurées d'un côté, lac de données brutes de l'autre. Ce cloisonnement architectural a...
dbt et la transformation moderne des données
De l'ETL monolithique au contrat de données : pourquoi dbt change la donne Pendant des années, la transformation des données en entreprise a rhymé avec des pipelines ETL opaques, des scripts SQL éparpillés sur des dizaines de serveurs, et des équipes data condamnées à jo...
Data Shift Left : intégrer la donnée dès la conception
Quand la donnée cesse d'être une afterthought Pendant des années, la donnée a vécu dans les marges du développement logiciel. On construisait d'abord, on pensait à la donnée ensuite — au moment de brancher la base de données, d'écrire les migrations, ou pire, au moment o...