# PySpark - Elaborazione su larga scala (Data Engineering) > SparkSession, RDD vs DataFrame, transformations, actions, partitioning, broadcast variables, UDF, Spark SQL, caching - 20 domande da colloquio - Senior - [Domande da colloquio: Data Engineering](https://sharpskill.dev/it/technologies/data-engineering/domande-colloquio.md) ## 1. Qual è il punto di ingresso principale per creare un'applicazione PySpark? **Risposta** SparkSession è il punto di ingresso unificato introdotto in Spark 2.0. Sostituisce i vecchi SparkContext, SQLContext e HiveContext con un singolo oggetto. SparkSession consente di creare DataFrame, eseguire query SQL e configurare l'applicazione Spark in modo centralizzato. ## 2. Qual è la differenza fondamentale tra un RDD e un DataFrame in PySpark? **Risposta** Un DataFrame ha uno schema strutturato con colonne tipizzate e con nome, permettendo a Spark di ottimizzare le query tramite Catalyst. Un RDD è una collezione distribuita non strutturata in cui Spark non conosce la struttura interna dei dati, limitando le possibili ottimizzazioni. ## 3. Qual è la differenza tra una transformation e un'action in PySpark? **Risposta** Le transformations sono valutate in modo lazy e costruiscono un piano di esecuzione senza scatenare il calcolo. Le actions scatenano l'effettiva esecuzione del piano sul cluster e restituiscono un risultato al driver. Questa distinzione permette a Spark di ottimizzare il piano prima dell'esecuzione. ## Altre 17 domande disponibili - Tra le seguenti operazioni, quale è un'action di PySpark? - Come creare un DataFrame da un file Parquet in PySpark? Registrati gratis: https://sharpskill.dev/it/login ## Altri argomenti di colloquio Data Engineering - [Linux & Shell - Fondamenti](https://sharpskill.dev/it/technologies/data-engineering/domande-colloquio/linux-shell-basics.md): 20 domande, Junior - [Git & GitHub - Fondamenti](https://sharpskill.dev/it/technologies/data-engineering/domande-colloquio/git-github-fundamentals.md): 20 domande, Junior - [Python avanzato per Data Engineering](https://sharpskill.dev/it/technologies/data-engineering/domande-colloquio/python-advanced-de.md): 25 domande, Junior - [Docker - Fondamenti](https://sharpskill.dev/it/technologies/data-engineering/domande-colloquio/docker-fundamentals.md): 25 domande, Junior - [Google Cloud Platform - Fondamenti](https://sharpskill.dev/it/technologies/data-engineering/domande-colloquio/gcp-fundamentals.md): 20 domande, Junior - [CI/CD e qualità del codice](https://sharpskill.dev/it/technologies/data-engineering/domande-colloquio/ci-cd-code-quality.md): 20 domande, Mid-Level - [Docker Compose](https://sharpskill.dev/it/technologies/data-engineering/domande-colloquio/docker-compose.md): 20 domande, Mid-Level - [FastAPI - API per dati](https://sharpskill.dev/it/technologies/data-engineering/domande-colloquio/fastapi.md): 20 domande, Mid-Level - [SQL avanzato per il Data Engineering](https://sharpskill.dev/it/technologies/data-engineering/domande-colloquio/sql-advanced-de.md): 20 domande, Mid-Level - [Data Lake - Architettura e ingestione](https://sharpskill.dev/it/technologies/data-engineering/domande-colloquio/data-lake.md): 20 domande, Mid-Level - [BigQuery per il Data Engineering](https://sharpskill.dev/it/technologies/data-engineering/domande-colloquio/bigquery-de.md): 20 domande, Mid-Level - [PostgreSQL - Amministrazione](https://sharpskill.dev/it/technologies/data-engineering/domande-colloquio/postgresql-admin.md): 20 domande, Mid-Level - [Data Modeling per Data Engineering](https://sharpskill.dev/it/technologies/data-engineering/domande-colloquio/data-modeling-de.md): 20 domande, Mid-Level - [Fivetran & Airbyte - Ingestione dati](https://sharpskill.dev/it/technologies/data-engineering/domande-colloquio/fivetran-airbyte.md): 20 domande, Mid-Level - [dbt - Fondamenti](https://sharpskill.dev/it/technologies/data-engineering/domande-colloquio/dbt-fundamentals-de.md): 20 domande, Mid-Level - [Apache Airflow - Fondamenti](https://sharpskill.dev/it/technologies/data-engineering/domande-colloquio/airflow-fundamentals.md): 20 domande, Mid-Level - [Kubernetes - Fondamenti](https://sharpskill.dev/it/technologies/data-engineering/domande-colloquio/kubernetes-fundamentals.md): 20 domande, Mid-Level - [dbt - Funzionalità avanzate](https://sharpskill.dev/it/technologies/data-engineering/domande-colloquio/dbt-advanced-de.md): 20 domande, Senior - [Pattern ETL / ELT / ETLT](https://sharpskill.dev/it/technologies/data-engineering/domande-colloquio/etl-elt-patterns.md): 20 domande, Senior - [Apache Airflow - Avanzato](https://sharpskill.dev/it/technologies/data-engineering/domande-colloquio/airflow-advanced.md): 20 domande, Senior - [Airflow + dbt - Orchestrazione delle pipeline](https://sharpskill.dev/it/technologies/data-engineering/domande-colloquio/airflow-dbt-integration.md): 20 domande, Senior - [Google Pub/Sub - Streaming di dati](https://sharpskill.dev/it/technologies/data-engineering/domande-colloquio/pubsub-streaming.md): 20 domande, Senior - [Apache Beam & Dataflow](https://sharpskill.dev/it/technologies/data-engineering/domande-colloquio/apache-beam-dataflow.md): 20 domande, Senior - [Kubernetes - Produzione e scaling](https://sharpskill.dev/it/technologies/data-engineering/domande-colloquio/kubernetes-advanced.md): 20 domande, Senior - [Terraform - Infrastructure as Code](https://sharpskill.dev/it/technologies/data-engineering/domande-colloquio/terraform.md): 20 domande, Senior - [Database NoSQL](https://sharpskill.dev/it/technologies/data-engineering/domande-colloquio/nosql-databases.md): 20 domande, Senior - [Data Architecture moderna](https://sharpskill.dev/it/technologies/data-engineering/domande-colloquio/data-architecture.md): 20 domande, Senior - [Monitoraggio e osservabilità](https://sharpskill.dev/it/technologies/data-engineering/domande-colloquio/monitoring-observability.md): 20 domande, Senior - [IAM e sicurezza dei dati](https://sharpskill.dev/it/technologies/data-engineering/domande-colloquio/iam-security-de.md): 20 domande, Senior --- Source: SharpSkill (https://sharpskill.dev), tech interview preparation for your real stack. HTML version of this page: https://sharpskill.dev/it/technologies/data-engineering/domande-colloquio/pyspark