Non esitare a chiedere per ulteriori date, modalità o lingua di erogazione diversa dall'italiano.
| Modalità | Durata | Data di inzio |
|---|---|---|
| Virtual Class | Intensivo | Su richiesta |
Cosa imparerai
Il corso Google Cloud Dataproc & Big Data Engineering offre un percorso formativo progettato per insegnare a progettare, sviluppare e gestire pipeline di elaborazione dati su larga scala sfruttando la potenza di Apache Spark, Hadoop e dei servizi cloud-native di Google Cloud.
L’itinerario didattico guida i partecipanti attraverso l’intero ciclo di vita del dato: dai fondamenti dell’ecosistema open-source (Spark, PySpark, Hadoop) alla gestione operativa dei cluster gestiti e serverless con Dataproc. Durante il corso vengono approfondite le tecniche di sviluppo tramite Dataproc Notebooks, l’ottimizzazione e il monitoraggio delle prestazioni, nonché l’integrazione profonda con il Modern Data Stack di Google Cloud (BigQuery, Cloud Storage, Bigtable, Pub/Sub, Cloud Composer e Vertex AI). Attraverso casi di studio ed esercitazioni su scenari d’uso avanzati, come l’analisi di dati in tempo reale, il Machine Learning distribuito e la containerizzazione, il corso fornisce le competenze necessarie per orchestrare, proteggere e migrare con successo architetture Big Data verso il cloud.
Area tecnologica
- Cloud
Destinatari
- Data Engineer e Big Data Developer
- Data Architect e Cloud Architect
- Data Scientist e Machine Learning Engineer
- Sistemisti e Cloud Engineer
Panoramica del corso
Obiettivi
-
Padroneggiare l’architettura di Dataproc: creare, configurare e gestire cluster gestiti Hadoop/Spark ed eseguire job in modalità Dataproc Serverless.
-
Sviluppare ed ottimizzare applicazioni PySpark: scrivere ed eseguire codice PySpark ad alte prestazioni utilizzando Dataproc Notebooks, implementando tecniche di debugging, monitoring e tuning delle prestazioni.
-
Integrare l’ecosistema storage e analytics di GCP: connettere e scambiare dati in modo efficiente tra Dataproc e i servizi Cloud Storage, BigQuery, Bigtable, Spanner e Pub/Sub.
-
Orchestrare workflow e pipeline complesse: integrare l’elaborazione dei dati con Cloud Composer (Apache Airflow) e implementare flussi di elaborazione sia in batch che in streaming.
-
Applicare il Machine Learning su scala: utilizzare le librerie MLlib di Spark e integrare i modelli sviluppati su Dataproc con Vertex AI.
Prerequisiti
Per fruire al meglio del corso è consigliato possedere:
-
Conoscenze base di Big Data, database relazionali e NoSQL.
- Conoscenza di un linguaggio di programmazione
-
Conoscenza base di Google Cloud: consigliato il possesso della certificazione Associate Cloud Engineer o esperienza equivalente sui concetti fondamentali della piattaforma (IAM, uso della Console GCP e CLI, storage)
Course Outline
| Modulo 1: Fondamenti di Big Data e Cloud Computing | Apache Hadoop, Spark e PySpark, Introduzione a Google Cloud e Dataproc |
| Modulo 2: Sviluppo e Gestione Applicazioni Dataproc | Sviluppo applicazioni PySpark, Dataproc Notebooks, Monitoraggio e ottimizzazione |
| Modulo 3: Integrazione con Servizi Cloud | BigQuery e Cloud Storage, Pub/Sub e Cloud Composer, BigTable, Spanner, Vertex AI |
| Modulo 4: Casi d’Uso Avanzati | Machine Learning con Dataproc, Analisi dei flussi di dati, Utilizzo Container, Dataproc Serverless |
| Modulo 5: Sicurezza e Migrazione | Sicurezza, Strategie di migrazione, Best practices, Casi di Studio |


