Certification active — échéance 30/04/2029RNCP 42149

Data engineer

Tout ce qu'un organisme de formation doit savoir pour proposer, préparer et gérer cette certification : référentiel, habilitation, obligations réglementaires — et pilotage dans Loop.

Niveau7 (Bac+5)
CertificateurInstitut Europeen F 2I
Blocs de compétences4 blocs
Éligible CPFOui

📋L'essentiel de la fiche RNCP 42149

IntituléData engineer
Code RNCPRNCP42149
Niveau de qualificationNiveau 7 (Bac+5)
CertificateurInstitut Europeen F 2I +1 co-certificateur
Date d'échéance30 avril 2029
Début des parcours30 avril 2026
Code NSF326 — Informatique, traitement de l'information, réseaux de transmission
Code ROMEsM1802 — Expertise et support en systèmes d'informationM1803 — Direction des systèmes d'informationM1805 — Études et développement informatiqueM1806 — Conseil et maîtrise d'ouvrage en systèmes d'informationM1810 — Production et exploitation de systèmes d'information

🎯Objectifs de la certification

Les technologies Big Data sont en plein essor et les emplois, qui en découlent, croissent également. Les entreprises ont besoin d’une structure informatique solide pour stocker leurs données. Dans ce cadre le Data engineer ou l’Ingénieur Data occupe un rôle substantiel, et ce quelque soit le secteur d'activité ou la taille de l'organisation. De fait, le Data engineer conçoit et développe les infrastructures et outils nécessaires au traitement des données massives et au déploiement de solutions d'Intelligence Artificielle. Le Data engineer a pour mission de mettre en place la collecte et la mise à disposition des données au sein de l’entreprise. Il est également en charge d’industrialiser et mettre en production des traitements sur les données (par exemple : mise à disposition de tableaux de bord, intégration de modèles statistiques) en lien avec les équipes métiers et les équipes qui les analysent.

Activités visées

Mise en œuvre d’un processus de veilles technologique, éthique, environnementale, socio-économique et réglementaire dans le domaine de l’IA et des données massives.
Analyse des besoins d'architectures issus des fonctionnalités attendues par les parties prenantes et de la capitalisation de l’expérience acquise.
Définition du projet de développement d’infrastructures de données massives adapté au contexte (environnements cloud, multi-cloud, edge et hybrides).
Rédaction du cahier des charges du projet de développement d’infrastructures de données massives.
Evaluation des compétences nécessaires adaptées au projet et aux nouveaux enjeux du secteur de l’intelligence artificielle.
Conception de l'architecture de données massives adaptée (Data Lake, Data Warehouse) à partir des propositions validées par les parties prenantes.
Définition d’une base de données massive automatisée (Cloud-native / infrastructure as Code (IaC)) responsable.
Pilotage de l’implémentation de l'architecture de données massives avec les parties prenantes.
Animation et management de l’équipe projet d’intelligence artificielle.
Conception et communication de la stratégie d’ingestion dynamique et la proposition de l’architecture d’entrepôt de données massives responsable (Data Lake, Data Warehouse).
Coordination des équipes mobilisées dans le déploiement des architectures Big Data.
Collecte et ingestion des ensembles volumineux de données structurées et non structurées provenant de différentes sources.
Développement des composants de l’intelligence artificielle responsable.
Evaluation des solutions de formatage et de stockage des données massives responsable.
Optimisation du traitement et de la visualisation des données.
Identification des usages et conditions d'utilisation sur la durée de vie de la solution ou de l'équipement d’intelligence artificielle.
Rédaction d'un protocole de maintenance et la documentation technique/technologique d’exploitation mis à disposition des entités utilisatrices.
Maintenance de l’infrastructure de données massives garantissant sa fiabilité.
Animation et management des équipes techniques impliquées dans la maintenance et l’évolution de l’architecture de données massives.

🧩Les 4 blocs de compétences

La certification peut être obtenue en une fois ou bloc par bloc (formation ou VAE). Pour l'organisme, cela implique un suivi des acquisitions par bloc pour chaque candidat.

RNCP42149BC01

Analyser les besoins en matière d'infrastructures de données adaptés au projet d'intelligence artificielle

Voir les compétences du bloc (6)
  • Mettre en place un processus de veilles technologique, éthique, environnementale, socio-économique et réglementaire (IA Act, ISO, sobriété numérique) en matière d’intelligence artificielle en s’appuyant sur des sources dédiées afin d’anticiper l’évolution des normes et règlements applicables à la ce
  • Analyser les cas d'usage en data et en intelligence artificielle déjà implémentés, en s’appuyant sur la réalisation d’une cartographie des exigences normatives et règlementaires de l’entreprise, des contraintes opérationnelles pour les évaluer, les enrichir et en créer de nouveaux en capitalisant su
  • Définir le projet de développement d’infrastructures de données massives à réaliser en interaction avec les parties prenantes, en procédant par itérations successives, en vue d’établir une liste exhaustive de ses attentes et prenant en compte les situations de handicap, les risques éthiques et envir
  • Identifier les besoins métiers et les outils de data science applicables selon le contexte et les objectifs attendus en présentant des préconisations et en intégrant des outils inclusifs IA/Data science adaptés à la problématique métier ainsi qu’à la politique RSE de la structure afin de rédiger le
  • Evaluer toutes les compétences nécessaires à la réalisation du projet d’intelligence artificielle, à la conduite du changement, en s’appuyant sur la cartographie des profils nécessaires au projet et prenant en compte les situations de handicap, en vue de constituer une équipe inclusive de développem
  • Intégrer les profils recrutés en favorisant l’inclusion des personnes en situation de handicap, en collaborant avec le référent handicap de l’entreprise et en identifiant les besoins en formation, d'assurer leur montée en compétences opérationnelle dans un délai de 12 mois.
RNCP42149BC02

Concevoir le projet de développement de l'infrastructure de données massives

Voir les compétences du bloc (8)
  • Superviser la rédaction du cahier des charges fonctionnels et techniques, en justifiant les choix opérés, et spécifier les livrables afin de déterminer les budgets et les ressources alloués pour la réalisation du projet.
  • Définir la structure générale d’une architecture de données event-driven, flux temps réel en ayant recours à la méthodologie de conception et en respectant les cahiers des charges afin de mettre en place une solution d’intelligence artificielle.
  • Vérifier la cohérence, la performance et la qualité de la base de données définie et des formats en s’appuyant sur la méthodologie de conception des bases de données (optimisation des pipelines de données) dans le but de les rendre exploitables par une solution d’intelligence artificielle et de mini
  • Définir et mettre en place des indicateurs de mesure de la cohérence, de la performance et de la qualité des données sécurisées à partir opérations des tests et des processus de maintenance curative/préventive dans le but de monitorer le retour sur investissement des projets applicatifs et anticiper
  • Gérer les données historiques en utilisant des indicateurs de performance afin de garantir la disponibilité, la qualité et l’amélioration continue de la fiabilité des données sécurisées et responsables.
  • Etablir un plan d’investissement annuel et mobiliser les financements en se basant sur les plans d’évolution du système d’information afin de réaliser un plan global et de valorisation des données sécurisées.
  • Mobiliser les techniques et outils de conduite de projets inclusifs en mobilisant la culture DevOps et mettant en place des indicateurs de suivi afin de produire les livrables du projet dans le temps imparti, au niveau de qualité attendu.
  • Motiver et fédérer les équipes projet d’intelligence artificielle en les sensibilisant à la prévention en matière de santé et de sécurité au travail, aux principes de sécurité informatique, au processus d’amélioration continue afin de construire des objectifs individuels ou collectifs à travers le d
RNCP42149BC03

Déployer les architectures Big Data valorisant les données sécurisées et responsables

Voir les compétences du bloc (11)
  • Concevoir une stratégie d’ingestion des données massives et une architecture d’entrepôt de données massives responsable dans un environnement cloud, multi-cloud, edge et hybrides en mobilisant une expertise des solutions de manipulation des données (ETL/ELT) pour optimiser la rapidité (run-time), le
  • Communiquer la stratégie de mise en œuvre de l’architecture d’entrepôt de données massives (Data lineage, Data warehouse, Data Lake, Data Mesh, Data vault) et ses résultats aux parties prenantes en respectant le cahier des charges ainsi que la réglementation en matière de sécurité informatique afin
  • Coordonner les équipes mobilisées dans le déploiement des architectures Big Data, en planifiant les activités, en facilitant la circulation de l’information entre les parties prenantes techniques et métiers, et en arbitrant les choix opérationnels nécessaires afin de garantir l’intégration, la sécur
  • Collecter des ensembles volumineux de données structurées et non structurées issues de sources internes et externes de l’entreprise à l’aide de solutions adaptées de manipulation de données afin d’en dégager des résultats visualisables sur des interfaces de visualisation et/ou modélisation.
  • Développer les composants de l’intelligence artificielle en langage de programmation approprié en respectant les normes du domaine et les principes déontologiques établis afin de respecter la démarche d’assurance qualité du code produit dans une logique de ‘Green coding’.
  • Développer des algorithmes tels que les forêts aléatoires, les arbres de décision, l’algorithme K-Nearest Neighbors, la régression linéaire, l’algorithme de Naïve Bayes, la machine à vecteurs de support (SVM), régression logistique et boosting de gradient, IA générative, NLP avancé, multimodalité et
  • Mettre en œuvre les technologies reposant sur les réseaux de neurones et prenant en compte les principes éthiques selon les normes en vigueur en vue d’automatiser le traitement de données non structurées.
  • Evaluer différentes solutions de formatage et de stockage en se basant sur les solutions de chiffrements, de monitoring post-déploiement et de pare-feux ainsi qu’en prenant en compte les contraintes éthiques et légales en vue de favoriser leur traitement, leur centralisation, leur sécurisation et la
  • Créer ou identifier les différents algorithmes d’optimisation du traitement et de la visualisation des données (dont les green algorithmes) pour évaluer leur capacité à résoudre des problèmes spécifiques prendre des décisions plus “vertes”.
  • Présenter les résultats d’analyses de données massives sous la forme d’infographies en mettant en la configuration des requêtes de manière à faciliter la prise de décision managériale ou opérationnelle.
  • Etablir le schéma général des accès à l’application développée prenant en compte le référentiel d’accessibilité (RGAA), en vue d’assurer leur cohérence avec l’organisation de l’entreprise utilisatrice et les différentes parties prenantes.
RNCP42149BC04

Piloter la maintenance et la gouvernance de l'architecture de données massives sécurisées et durables

Voir les compétences du bloc (8)
  • Auditer régulièrement la production de la solution d’intelligence artificielle en s’appuyant sur le retour d’expérience des utilisateurs en interne et en externe (logs, métriques) afin d’adapter les fonctionnalités et les caractéristiques techniques du projet d’intelligence artificielle.
  • Assurer la pérennité de la solution informatique en surveillant l’évolution des données de travail afin d’éviter la dégradation des performances des modèles d’intelligence artificielle mis en production et assurer un niveau de sécurisation des données optimal défini par la DSI.
  • Rédiger les protocoles de maintenance et les procédures techniques/technologiques d'exploitation à destination des entités utilisatrices, en configurant les éléments nécessaires garantissant la sécurisation des données (cybersécurité) et des systèmes afin de mener à bien tout projet de développement
  • Identifier le cycle de vie des cas d’usage de l’intelligence artificielle en monitorant le modèle en production afin d’assurer la maintenance de l’infrastructure et d’en anticiper les évolutions prenant en compte les enjeux environnementaux.
  • Concevoir un ensemble de tests de surveillance des pipelines d’intégration continue et de déploiement continu (CI/CD) en se basant sur un traitement des données par flux et par lot afin de sécuriser les investissements IT sur 3 ans.
  • Reproduire une chaîne de modélisation à partir du versionnage des différents types d’application (modèles prédictifs) afin de gérer le déploiement sur un serveur ou un cloud.
  • Mesurer et détecter la dérive des données en se basant sur des indicateurs-clés afin d’appliquer des correctifs dans le cadre de la résolution de bugs techniques et/ou fonctionnels.
  • Animer les équipes techniques (data, IT, sécurité, DevOps) impliquées dans la maintenance et l’évolution de l’architecture de données massives, en définissant les rôles, en planifiant les activités et en assurant la circulation fluide de l’information afin de garantir la performance, la sécurité, la

💡 Comment suivre les blocs de compétences RNCP dans un logiciel de gestion

💼Secteurs et débouchés

Secteurs d'activité

Selon la taille de projet, le Data engineer interviendra sur un ou plusieurs projets avec des équipes projet de différentes tailles. Il travaille en équipe selon la taille du projet et de l'équipe et est lié aux autres métiers de la Data.
* Type et taille d'entreprise :
En tant qu'indépendant, il intervient majoritairement sur des projets de plusieurs clients différents. Ses missions sont plus larges, son expertise est couplée avec les missions du Data Scientist et Data Analyst.
Dans une PME / TPE, chez un éditeur de logiciel, il joue un rôle clé dans la définition et l'évolution du produit/système. La demande de compétences sera ici plus variée et les projets de taille inférieure, en règle générale. Il sera aussi amené à travailler avec des partenaires extérieurs et ainsi maîtriser les règles de fonctionnement de ce type de relation. Dans les petites et moyennes entreprises, le métier est couplé avec celui de Data Scientist et Data Analyst.
Dans une grande Entreprise de Service Numérique, il apporte son expertise technique sur les infrastructures. Il sera ici focalisé sur son périmètre de projet et son expertise métier, souvent de plus grande taille et interne. Le besoin d'expertise métier y sera équivalent dans une structure moyenne ou grande et va intervenir sur des missions en interne et externe.

Types d'emplois accessibles

* Data engineer ;
* Ingénieur en développement big data ;
* Ingénieur data/big data ;
* Ingénieur de données ;
* Data Pipeline engineer ;
* Développeur data ;
* Machine learning engineer ;
* Big data architecte ;
* Big data consultant ;
* Ingénieur en développement big data.

🏫Proposer cette certification dans votre organisme

  1. Être habilité par le certificateur. La préparation et la délivrance de cette certification supposent une habilitation délivrée par Institut Europeen F 2I — modalités sur la fiche officielle France Compétences.
  2. Être certifié Qualiopi. Indispensable pour mobiliser les financements publics et mutualisés (CPF, France Travail, OPCO) au titre des actions de formation. Automatiser votre conformité Qualiopi.
  3. Structurer le parcours par blocs. Référentiel d'activités, d'évaluation et suivi par bloc de compétences : votre dossier et vos preuves doivent refléter le référentiel officiel de la fiche.
  4. Déclarer votre activité. Le Bilan Pédagogique et Financier annuel doit ventiler les heures et effectifs — y compris sur ce type de parcours certifiant.

🔄Gérer cette certification dans Loop

Loop est un logiciel de gestion pour organismes de formation. Voici concrètement ce qu'il automatise pour un parcours certifiant comme celui-ci :

Sessions et convocationsPlanification des sessions, convocations et relances automatiques des candidats.
Émargement numériqueFeuilles d'émargement dématérialisées, conformes aux exigences de preuve Qualiopi.
Suivi par blocs de compétencesProgression de chaque candidat bloc par bloc, attestations d'acquisition.
Documents automatiquesConventions, programmes, certificats de réalisation générés depuis vos modèles.
BPF pré-rempliLes heures et effectifs de vos sessions alimentent automatiquement votre Bilan Pédagogique et Financier.
Preuves d'audit centraliséesTous les documents d'une session archivés et retrouvables en un clic pour l'audit Qualiopi.

Essayer Loop gratuitement

Questions fréquentes

Comment proposer cette certification dans mon organisme de formation ?
Pour préparer et délivrer cette certification, votre organisme doit être habilité par le certificateur (Institut Europeen F 2I) — les modalités d'habilitation figurent sur la fiche officielle France Compétences. La certification Qualiopi est requise pour mobiliser des financements publics ou mutualisés (CPF, France Travail, OPCO).
La certification RNCP 42149 est-elle éligible au CPF ?
Oui. Les formations sanctionnées par une certification active enregistrée au RNCP sont éligibles au Compte Personnel de Formation, dans le respect des conditions d'habilitation du certificateur.
Peut-on valider la certification bloc de compétences par bloc de compétences ?
Oui. La fiche comporte 4 blocs de compétences qui peuvent être acquis séparément, par la formation ou par la VAE. L'organisme doit alors suivre les acquisitions par bloc pour chaque candidat.
Jusqu'à quand la fiche RNCP 42149 est-elle valable ?
La fiche est active jusqu'au 30 avril 2029, date d'échéance de son enregistrement au RNCP, sauf renouvellement par le certificateur.

🔗Autres certifications RNCP

Toutes les certifications RNCP →

Source des données : France Compétences — Répertoire national des certifications professionnelles (Licence Ouverte / Open Licence Etalab). Fiche officielle : francecompetences.fr. Dernière synchronisation : 6 juillet 2026. Cette page s'adresse aux organismes de formation ; elle ne constitue pas une offre de formation.