Développement, test & web - Data Science avec Python, certification API Society
Un parcours pratique consacré à Data Science avec Python. Les participants structurent leurs acquis autour de trois priorités : L’écosystème Python scientifique, La bibliothèque NumPy, La bibliothèque Pandas.
Programme détaillé
L’écosystème Python scientifique
- Présentation des packages Python de data science.
- Installation de bibliothèques en environnement virtuel : pip et le module venv, miniconda, mamba, miniforge, WinPython.
- Environnement de développement.
- Utiliser les environnements IPython, Jupyter Notebook, JupyterLab, IDE :
- l'exemple de Spyder.
- Découvrir l’éditeur de texte : VS Code.
La bibliothèque NumPy
- Introduction et création de tableaux.
- Présentation de la librairie NumPy.
- Avantages des tableaux (performance, manipulation des données).
- Création de tableaux avec array(), zeros(), ones(), full(), arange(), linspace(), logspace().
- Multiplication matricielle avec np.dot et l'opérateur @.
- Initialisation avec des données aléatoires (module random).
- Manipuler des tableaux et opérations.
- Indexation, slicing, et indexation avancée.
- Transposer et changer de dimensions de tableaux (transpose(), reshape()).
- Concaténer et découper des tableaux (concatenate(), split()).
- Manipuler les fonctions classiques et mathématiques (sum(), min(), max(), median().
- Comparer et masquer des données avec des masques booléens.
- Gestion des données et visualisation.
- Charger et sauvegarder des tableaux (loadtxt(), save(), load()).
- Utiliser l'option axis dans les fonctions.
- Extraire les informations des données.
- Utiliser les pratiques de visualisation : choix des modules et types de graphiques.
- Générer de graphiques interactifs.
La bibliothèque Pandas
- Introduction et structures de données.
- Présentation de la bibliothèque Pandas.
- Création de séries avec la classe series.
- Création de tableaux 2D ou DataFrame avec la classe DataFrame.
- Extraction des indices de ligne et de colonne (attributs index et columns).
- Lire et exporter des données dans différents formats (csv, xls).
- Mettre en œuvre les méthodes de base : head() et tail().
- Indexation et slicing : implicite, explicite, et utilisation des indexeurs loc et iloc.
- Sélectionner des données et utiliser des expressions booléennes.
- Manipulation et transformation des données.
- Insérer et modifier des données.
- Renommer des colonnes avec rename().
- Concaténer des données avec concat() et fusion/jointure avec merge() et join().
- Copier des données : copie superficielle ou profonde (copy()).
- Traiter des données manquantes (isna(), isnull(), notna(), notnull(), dropna(), fillna(), interpolate()).
- Manipuler des indices : set_index(), sort_index().
- Trier les valeurs avec sort_values().
- Transposer des données avec transpose().
Analyse et agrégation des données
- Agrégation des données : sum(), cumsum(), min(), max(), count(), mean(), median(), var(), std(), quantile(), describe() Groupement et analyse avec groupby().
- Utiliser des fonctions aggregate(), apply(), filter(), transform().
- Créer de tableaux croisés dynamiques avec pivot_table().
- Segmenter les données avec qcut() et cut().
- Calculer des moyennes glissantes avec rolling(), expanding(), ewm().
- Traiter des données temporelles à travers to_datetime(), to_timedelta(), date_range(), period_range()...
La bibliothèque Matplotlib
- Introduction et création de graphiques.
- Présentation de la bibliothèque.
- Afficher des graphiques depuis un script Python (plt.show()) ou depuis un notebook.
- Utiliser le style MATLAB ou le style orienté objet pour afficher les graphiques.
- Modifier le style des graphiques.
- Objets figure et axes.
- Tracer des courbes avec plot().
- Types de graphiques et interactions.
- Afficher des nuages de points avec scatter().
- Afficher des barres d'erreurs avec error_bar().
- Remplir la surface entre deux lignes avec fill_between().
- Tracer des histogrammes avec hist().
- Tracer des graphiques en 3D avec mplot3d.
- Interagir avec les graphiques dans Jupyter notebook avec le widget interact.
- Utiliser pandas plot pour créer des tracés rapidement : plot(), bar(), barh(), hist(), box(), scatter(), pie().
La bibliothèque Seaborn
- Introduction à Seaborn et fonctionnalités de base.
- Fonctionnement de l'API Seaborn : distinction entre les plots de niveau figure et de niveau axes.
- Relational Plots : utiliser des fonctions pour tracer des relations entre variables.
- Tracer des distributions : utiliser des fonctions pour visualiser des distributions de données.
- Données qualitatives : tracer des données catégorielles.
- Cartes thermiques : utiliser la fonction heatmap() pour tracer des cartes thermiques.
- Modèles de régression linéaire : tracer des modèles de régression avec lmplot().
- Personnalisation des graphiques : changer le rendu de la figure avec les fonctions.
La bibliothèque Plotly
- Présentation de la librairie Plotly et de Kaleido : introduction et exploration de Plotly Express.
- Tracer des courbes avec line() : modification de la figure avec les options title, width, height, marker, labels, etc..
- Créer des graphiques en aires avec area() : ajout de motifs avec pattern_shape.
- Créer des nuages de points avec scatter() : utilisation des options size, size_max, opacity, symbol, color_continuous_ Graphiques en 3D : utilisation de scatter_3d() et line_3d().
- Mettre en forme des diagrammes en barres avec bar() et des histogrammes avec histogram().
- Tracer des cartes avec line_map(), scatter_map(), line_geo(), scatter_geo(), et choropleth().
Parlez-nous de votre projet
Nos bureaux
- Exceev Consulting
61 Rue de Lyon
75012, Paris, France - Exceev Technology
332 Bd Brahim Roudani
20330, Casablanca, Maroc