Long Nguyen
Date d'abonnement : 2022
Ligue d'Or
7005 points
Date d'abonnement : 2022
Dans bien des services informatiques, il existe des divergences entre les avantages souhaités par les développeurs, à savoir l'agilité, et ceux des opérateurs, qui recherchent la stabilité. L'ingénierie de la fiabilité des sites (SRE) permet à Google d'aligner les mesures incitatives entre le développement et les opérations, et de proposer une assistance à la production critique. Adopter des pratiques techniques et culturelles de l'ingénierie SRE permet d'améliorer la collaboration entre les équipes métiers et informatiques. Ce cours présente les pratiques clés de l'ingénierie SRE façon Google, ainsi que le rôle déterminant que jouent les responsables IT et les chefs d'entreprise dans la réussite de son adoption au sein de leur organisation.
Dans ce deuxième volet de la série de cours sur Dataflow, nous allons nous intéresser de plus près au développement de pipelines à l'aide du SDK Beam. Nous allons commencer par passer en revue les concepts d'Apache Beam. Nous allons ensuite parler du traitement des données par flux à l'aide de fenêtres, de filigranes et de déclencheurs. Nous passerons ensuite aux options de sources et de récepteurs dans vos pipelines, aux schémas pour présenter vos données structurées, et nous verrons comment effectuer des transformations avec état à l'aide des API State et Timer. Nous aborderons ensuite les bonnes pratiques qui vous aideront à maximiser les performances de vos pipelines. Vers la fin du cours, nous présentons le langage SQL et les DataFrames pour représenter votre logique métier dans Beam, et nous expliquons comment développer des pipelines de manière itérative à l'aide des notebooks Beam.
Ce cours est le premier d'une série en trois volets sur le traitement des données sans serveur avec Dataflow. Dans ce premier cours, nous allons commencer par rappeler ce qu'est Apache Beam et sa relation avec Dataflow. Ensuite, nous aborderons la vision d'Apache Beam et les avantages de son framework de portabilité, qui permet aux développeurs d'utiliser le langage de programmation et le backend d'exécution de leur choix. Nous vous montrerons aussi comment séparer le calcul du stockage et économiser de l'argent grâce à Dataflow, puis nous examinerons les interactions entre les outils de gestion de l'identification et des accès avec vos pipelines Dataflow. Enfin, nous verrons comment implémenter le modèle de sécurité adapté à votre cas d'utilisation sur Dataflow.
Intégrer le machine learning à des pipelines de données renforce la capacité à dégager des insights des données. Ce cours passera en revue plusieurs façons d'intégrer le machine learning à des pipelines de données sur Google Cloud. Vous découvrirez AutoML pour les cas ne nécessitant que peu de personnalisation (voire aucune), ainsi que Notebooks et BigQuery ML pour les situations qui requièrent des capacités de machine learning plus adaptées. Enfin, vous apprendrez à utiliser des solutions de machine learning en production avec Vertex AI.
Le traitement de flux de données est une pratique de plus en plus courante, car elle permet aux entreprises d'obtenir des métriques sur leurs activités commerciales en temps réel. Ce cours explique comment créer des pipelines de flux de données sur Google Cloud et présente Pub/Sub, une solution qui permet de gérer des données de flux entrants. Par ailleurs, vous verrez comment appliquer des agrégations et des transformations à des flux de données à l'aide de Dataflow, mais aussi comment stocker des enregistrements traités dans BigQuery ou Bigtable pour qu'ils puissent être analysés. Les participants mettront en pratique les connaissances qu'ils auront acquises en créant des composants de pipelines de flux de données sur Google Cloud à l'aide de Qwiklabs.
Les pipelines de données s'inscrivent généralement dans l'un des paradigmes EL (extraction et chargement), ELT (extraction, chargement et transformation) ou ETL (extraction, transformation et chargement). Ce cours indique quel paradigme utiliser pour le traitement de données par lot en fonction du contexte. Il présente également plusieurs technologies Google Cloud de transformation des données, y compris BigQuery, l'exécution de Spark sur Dataproc, les graphiques de pipelines dans Cloud Data Fusion et le traitement des données sans serveur avec Dataflow. Les participants mettront en pratique les connaissances qu'ils auront acquises en créant des composants de pipelines de données sur Google Cloud à l'aide de Qwiklabs.
Terminez le cours d'introduction Préparer les données à utiliser pour les tableaux de bord et rapports Looker pour recevoir un badge démontrant vos compétences dans les domaines suivants : le filtrage, le tri et le croisement de données ; la fusion des résultats de différentes explorations Looker ; et l'utilisation de fonctions et d'opérateurs pour créer des tableaux de bord et des rapports Looker en vue de l'analyse et de la visualisation des données.
Dans ce cours, nous définirons ce qu'est le machine learning et ce qu'il peut apporter à votre entreprise. Vous verrez quelques démonstrations de l'utilisation du ML et découvrirez ses termes clés, comme instances, caractéristiques et étiquettes. Lors des ateliers interactifs, vous vous entraînerez à appeler les API de ML préentrainées disponibles et à construire vos propres modèles de machine learning en utilisant simplement SQL avec BigQuery ML.
Le troisième cours de cette série s'intitule "Achieving Advanced Insights with BigQuery". Notre objectif est ici d'approfondir vos connaissances en SQL en abordant en détail les fonctions avancées et en vous apprenant à décomposer les requêtes complexes en étapes faciles à gérer. Nous allons étudier l'architecture interne de BigQuery (stockage segmenté basé sur des colonnes), ainsi que des concepts SQL avancés tels que les champs imbriqués et répétés, en utilisant pour cela des objets ARRAY et STRUCT. Pour finir, nous verrons comment optimiser les performances de vos requêtes et sécuriser vos données à l'aide des vues autorisées.Une fois que vous aurez terminé ce cours, inscrivez-vous au cours "Applying Machine Learning to Your Data with Google Cloud".
Ceci est le deuxième cours de la série "Data to Insights". Ici, nous verrons comment ingérer de nouveaux ensembles de données externes dans BigQuery et les visualiser avec Looker Studio. Nous aborderons également des concepts SQL intermédiaires, tels que les jointures et les unions de plusieurs tables, qui vous permettront d'analyser les données de différentes sources. Remarque : Même si vous avez des connaissances en SQL, certaines spécificités de BigQuery (comme la gestion du cache de requêtes et des caractères génériques de table) peuvent ne pas vous être familières.Une fois que vous aurez terminé ce cours, inscrivez-vous au cours "Achieving Advanced Insights with BigQuery".
Ce cours décrit les problématiques courantes auxquelles se confrontent les analystes de données et explique comment les résoudre à l'aide des outils de big data disponibles sur Google Cloud. Vous découvrirez quelques notions de SQL et apprendrez comment utiliser BigQuery et Dataprep pour analyser et transformer vos ensembles de données. Il s'agit du premier cours de la série "From Data to Insights with Google Cloud". Après l'avoir terminé, inscrivez-vous au cours "Creating New BigQuery Datasets and Visualizing Insights".
This course empowers you to develop scalable, performant LookML (Looker Modeling Language) models that provide your business users with the standardized, ready-to-use data that they need to answer their questions. Upon completing this course, you will be able to start building and maintaining LookML models to curate and manage data in your organization’s Looker instance.
In this course, you learn how to do the kind of data exploration and analysis in Looker that would formerly be done primarily by SQL developers or analysts. Upon completion of this course, you will be able to leverage Looker's modern analytics platform to find and explore relevant content in your organization’s Looker instance, ask questions of your data, create new metrics as needed, and build and share visualizations and dashboards to facilitate data-driven decision making.
Les lacs de données et les entrepôts de données sont les deux principaux composants des pipelines de données. Ce cours présente des cas d'utilisation de chaque type de stockage, ainsi que les détails techniques des solutions de lacs et d'entrepôts de données disponibles sur Google Cloud. Il décrit également le rôle des ingénieurs de données et les avantages d'un pipeline de données réussi sur les opérations commerciales, avant d'expliquer pourquoi il est important de procéder à l'ingénierie des données dans un environnement cloud. Il s'agit du premier cours de la série "Ingénierie des données sur Google Cloud". Après l'avoir terminé, inscrivez-vous au cours "Créer des pipelines de données en batch sur Google Cloud".
Ce cours présente les produits et services Google Cloud pour le big data et le machine learning compatibles avec le cycle de vie "des données à l'IA". Il explore les processus, défis et avantages liés à la création d'un pipeline de big data et de modèles de machine learning avec Vertex AI sur Google Cloud.