IA & Data - Introduction to Data Engineering on Google Cloud
Un parcours pratique consacré à Introduction to Data Engineering on Google Cloud. Les participants structurent leurs acquis autour de trois priorités : Tâches et composants de l’ingénierie des données, Réplication et migration des données, Le modèle de pipeline Extract and Load.
Programme détaillé
Tâches et composants de l’ingénierie des données
- Comprendre le rôle d’un ingénieur de données.
- Comprendre les différences entre une source de données et un puits de données.
- Découvrir les différents types de formats de données.
- Expliquez les options de solution de stockage sur Google Cloud.
- Découvrir les options de gestion des métadonnées sur Google Cloud.
- Découvrir comment partager facilement des ensembles de données à l’aide d’Analytics Hub.
- Découvrir comment charger des données dans BigQuery à l’aide de la console Google Cloud ou de la gcloud CLI.
Travaux pratiques
- Lab : chargement de données dans BigQuery.
Réplication et migration des données
- Découvrir l’architecture de base de réplication et de migration des données de Google Cloud.
- Comprendre les options et les cas d’utilisation de l’outil de ligne de commande gcloud.
- Découvrir les fonctionnalités et les cas d’utilisation de Storage Transfer Service.
- Découvrir les fonctionnalités et les cas d’utilisation de Transfer Appliance.
- Découvrir les fonctionnalités et le déploiement de Datastream.
Travaux pratiques
- Lab : Réplication PostgreSQL vers BigQuery.
Le modèle de pipeline Extract and Load
- Extraire et charger l’architecture.
- Comprendre les options de l’outil de ligne de commande bq.
- Découvrir les fonctionnalités et les cas d’utilisation du service de transfert de données BigQuery.
- Découvrir les fonctionnalités et les cas d’utilisation de BigLake en tant que modèle de chargement sans extraction.
Travaux pratiques
- Lab : Introduction à BigLake.
Le modèle de pipeline Extract, Load and Transform
- Expliquer le diagramme de base d’architecture d’extraction, de chargement et de transformation.
- Comprendre un pipeline ELT courant sur Google Cloud.
- Découvrir les fonctionnalités de programmation et de script SQL de BigQuery.
- Expliquer les fonctionnalités et les cas d’utilisation de Dataform.
Travaux pratiques
- Lab : Créer et exécuter un workflow SQL dans Dataform.
Modèle de pipeline Extract, Transform and Load
- Découvrir le diagramme d’architecture d’extraction, de transformation et de chargement de base.
- Découvrir les outils d’interface utilisateur graphique sur Google Cloud utilisés pour les pipelines de données ETL.
- Expliquer le traitement de données par lots à l’aide de Dataproc.
- Utiliser Dataproc Serverless pour Spark pour ETL..
- Explorer les options de traitement de données en streaming.
- Comprendre le rôle que joue Bigtable dans les pipelines de données.
Travaux pratiques
- Lab : Utiliser Dataproc Serverless pour Spark pour charger BigQuery. Lab :
- Créer un pipeline de données en continu pour un tableau de bord en temps réel avec Dataflow.
Techniques d’automatisation
- Découvrir les modèles et options d’automatisation disponibles pour les pipelines.
- Découvrir Cloud Scheduler et Workflows.
- Découvrir Cloud Composer.
- Découvrir les fonctions de Cloud Run.
- Découvrir les cas d’utilisation des fonctionnalités et de l’automatisation pour Eventarc.
Travaux pratiques
- Lab : Utiliser les fonctions Cloud Run pour charger BigQuery.
Parlez-nous de votre projet
Nos bureaux
- Exceev Consulting
61 Rue de Lyon
75012, Paris, France - Exceev Technology
332 Bd Brahim Roudani
20330, Casablanca, Maroc