Pendant trente ans, intégrer des données a voulu dire la même chose : les copier d’un endroit à un autre. L’ETL les extrait et les recharge dans un entrepôt, l’ESB les fait transiter par un hub central, le data lake les déverse toutes au même endroit « au cas où ». Trois générations d’outils, un seul réflexe : capturer, dupliquer, stocker. Mais en 2026, la donnée est devenue temps réel, distribuée et réglementée. Et le vieux postulat « stocker pour intégrer » se paie désormais en latence, en coûts cachés et en surface d’attaque.
ETL, ESB, Data Lake : trois réponses, un même postulat
Les trois piliers historiques de l’intégration répondent au même problème, à des époques différentes. L’ETL (Extract, Transform, Load) est né avec les entrepôts de données : il extrait la donnée des systèmes sources, la transforme, puis la recharge dans une base centrale, le plus souvent la nuit, par lots. L’ESB (Enterprise Service Bus) a généralisé le hub d’intégration : un bus central par lequel tout transite, avec ses files de messages et ses copies intermédiaires. Le data lake, enfin, a poussé la logique à l’extrême : déverser l’intégralité des données brutes dans un réservoir unique, en pariant qu’on saura les exploiter plus tard.
Le point commun saute aux yeux : dans les trois cas, pour faire circuler la donnée, on commence par la recopier et la poser quelque part. Ce marché reste massif et en croissance. L’intégration de données pesait 17,58 milliards de dollars en 2025 et devrait atteindre 33,24 milliards en 2030, soit une croissance annuelle de 13,6 % (source : MarketsandMarkets). Mais à l’intérieur de ce marché, le centre de gravité se déplace.
Le segment qui explose, c’est l’intégration cloud et temps réel. Le marché de l’iPaaS (Integration Platform as a Service) a dépassé 9 milliards de dollars de revenus en 2024, contre 7,8 milliards en 2023 et 5,9 milliards en 2022, et Gartner le voit franchir les 17 milliards d’ici 2028 (source : Gartner, via Informatica). À titre de comparaison, l’ensemble du marché du middleware applicatif a progressé de 11,9 % en 2024 pour atteindre 64,1 milliards de dollars (source : Gartner) : l’intégration moderne croît environ deux fois plus vite que le middleware classique. La direction est claire, même quand les vieux outils restent en place.
Le batch ne suit plus : la donnée est devenue temps réel
Le modèle ETL repose sur une hypothèse devenue fausse : que la donnée peut attendre. Or elle n’attend plus. IDC estimait que le volume mondial de données passerait de 33 zettaoctets en 2018 à 175 zettaoctets en 2025, et surtout que près de 30 % de cette donnée devrait être consommée en temps réel (source : IDC, Data Age 2025). Une donnée qui se décide à la seconde s’accommode mal d’un traitement nocturne par lots.
Cette donnée n’est pas seulement plus rapide, elle est aussi ailleurs. Gartner prévoyait dès 2018 que 75 % des données d’entreprise seraient créées et traitées en dehors d’un data center centralisé ou d’un cloud traditionnel d’ici 2025, contre environ 10 % à l’époque (source : Gartner). Ramener mécaniquement toute cette donnée vers un entrepôt central pour la traiter devient un contresens géographique autant qu’économique.
Le marché valide cette bascule. L’analytique en streaming, c’est à dire le traitement de la donnée pendant qu’elle circule, doit passer de 29,53 milliards de dollars en 2024 à 125,85 milliards en 2029, soit une croissance annuelle de 33,6 % (source : MarketsandMarkets). Côté terrain, plus de 80 % des entreprises du Fortune 100 utilisent déjà Apache Kafka pour faire circuler leurs flux en événementiel (source : Apache Kafka). Et la pression continue de monter : Gartner prévoit que l’adoption du streaming de données pour l’IA agentique dépassera 60 % d’ici 2028, contre moins de 15 % en 2025 (source : Gartner).
L’écart entre la valeur perçue et la réalité reste pourtant énorme. Une enquête menée pour Solace montrait que 85 % des organisations reconnaissent la valeur métier de l’architecture orientée événements, mais que seulement 13 % estiment avoir atteint sa pleine maturité (source : Coleman Parkes pour Solace). Le temps réel est compris et désiré. Ce qui manque, c’est une façon de l’atteindre sans rebâtir un entrepôt de plus.
Le data lake, du réservoir au marécage
Le data lake promettait de résoudre le problème en supprimant les silos : un seul endroit pour tout stocker, et on verra plus tard. Gartner avait pourtant prévenu dès 2014 avec sa « data lake fallacy » : sans métadonnées descriptives ni gouvernance, un lac de données se transforme en « data swamp », un marécage où l’information existe mais devient introuvable et inexploitable (source : Gartner).
Dix ans plus tard, le diagnostic se confirme dans les chiffres. La donnée stockée reste très largement dormante.
- 55 % des données d’une organisation sont des « dark data » : elles existent mais ne sont ni trouvées, ni préparées, ni analysées (Splunk, The State of Dark Data)
- 68 % des données dont disposent les entreprises ne sont jamais exploitées, selon une enquête menée auprès de 1 500 dirigeants (Seagate et IDC, Rethink Data)
- 60 à 73 % de l’ensemble des données d’une entreprise restent inutilisées pour l’analytique (Forrester)
Le problème n’est pas le volume, c’est la gouvernance de tout ce qui dort. Gartner prédit d’ailleurs que 80 % des initiatives de gouvernance des données et de l’analytique échoueront d’ici 2027 (source : Gartner). Accumuler n’a jamais été synonyme d’exploiter. Plus le réservoir grossit, plus il coûte cher à maintenir, à sécuriser et à gouverner, pour une fraction de valeur réellement utilisée.
Ce que coûte vraiment le déplacement des données
Copier et stocker n’est pas neutre, ni financièrement, ni en matière de risque. Chaque copie qui quitte un cloud est facturée : le transfert sortant standard d’AWS démarre à 0,09 dollar par gigaoctet au delà des 100 Go gratuits mensuels (source : AWS). Anodin à l’unité, ce coût devient structurel à l’échelle : Gartner estime que la plupart des clients consacrent 10 à 15 % de leur facture cloud aux seuls frais d’egress (source : Gartner, via Fierce Network). Sur une dépense mondiale en cloud public prévue à 723,4 milliards de dollars en 2025 (source : Gartner), l’addition donne le vertige. Le législateur s’en est saisi : le Data Act européen supprimera totalement les frais de changement de fournisseur, frais d’egress compris, à compter du 12 janvier 2027 (source : Commission européenne).
Le coût caché le plus dangereux n’est toutefois pas sur la facture, il est dans le risque. Chaque copie est une cible de plus. Le rapport d’IBM sur le coût des violations de données indique que 35 % des fuites impliquent des « shadow data », ces données dupliquées hors du périmètre de sécurité, et que ces violations coûtent en moyenne 16 % plus cher (source : IBM, Cost of a Data Breach 2024). Sachant que le coût moyen mondial d’une violation a atteint un pic de 4,88 millions de dollars en 2024 (source : IBM), chaque réplique inutile devient une dette de sécurité.
Reste la souveraineté. Les trois géants américains concentrent 70 % du marché cloud européen, quand la part des fournisseurs européens est tombée à environ 15 % (source : Synergy Research Group). Or beaucoup d’outils d’intégration et d’iPaaS sont des services américains, soumis au Cloud Act. Dans leur évaluation juridique commune, l’EDPB et l’EDPS concluent qu’en l’absence d’accord international, un fournisseur soumis au droit de l’Union ne peut légalement transférer des données vers les États Unis sur la base de telles demandes, en contradiction directe avec l’article 48 du RGPD (source : EDPB et EDPS). Faire transiter ses données par un hub d’intégration américain, c’est exposer chaque octet copié. Comme nous l’expliquions à propos de la souveraineté numérique, la nationalité du fournisseur prime sur la localisation des serveurs.
L’orchestration en transit : intégrer sans stocker
Si copier et stocker est la source du problème, la solution consiste à ne plus le faire. C’est le principe de l’orchestration en transit : traiter la donnée pendant qu’elle circule, au moment précis de son passage, sans jamais la poser ni la dupliquer. La donnée n’est plus aspirée vers un réservoir central, elle est transformée à la volée puis libérée vers sa destination.
C’est l’approche d’iD4Connect. Chaque DataCell est une unité de traitement autonome qui nettoie, transforme, enrichit, anonymise ou route la donnée pendant son transit, puis ne garde rien. L’orchestration de ces DataCells, organisée en DataGraph, permet de bâtir des flux complexes entre n’importe quelles applications, sur site, en cloud ou en hybride. Le Connecteur Universel prend en charge l’ingestion via tous les protocoles standards (REST, SQL, MQTT, Kafka, OPC-UA, SFTP…), sans imposer son propre format.
Le bénéfice est triple. La surface d’exposition tombe à zéro, puisqu’aucune donnée n’est stockée au passage. La souveraineté est garantie par construction, l’architecture étant conçue en Europe et exécutée dans le périmètre du client. Et le coût devient prévisible, sans entrepôt à maintenir ni egress à payer pour des copies que personne n’utilise. Là où l’ETL, l’ESB et le data lake ajoutent une couche de stockage entre vos systèmes, l’orchestration en transit la supprime. Pour aller plus loin, nous détaillons ce positionnement face aux outils existants.
L’ETL, l’ESB et le data lake n’ont pas démérité : ils ont résolu les problèmes de leur époque. Mais cette époque supposait une donnée lente, centralisée et peu réglementée. En 2026, la donnée est rapide, partout et sous surveillance juridique. La vraie question n’est plus « où stocker pour intégrer », mais « comment intégrer sans stocker ». Et la meilleure copie reste celle qu’on n’a jamais faite.
Découvrez comment iD4Connect orchestre vos données sans stockage intermédiaire →