# PySpark - Verarbeitung im großen Maßstab (Data Engineering) > SparkSession, RDD vs DataFrame, Transformations, Actions, Partitioning, Broadcast Variables, UDFs, Spark SQL, Caching - 20 Interview-Fragen - Senior - [Interview-Fragen: Data Engineering](https://sharpskill.dev/de/technologies/data-engineering/interviewfragen.md) ## 1. Was ist der Haupteinstiegspunkt für die Erstellung einer PySpark-Anwendung? **Antwort** SparkSession ist der einheitliche Einstiegspunkt, der in Spark 2.0 eingeführt wurde. Er ersetzt die alten SparkContext, SQLContext und HiveContext durch ein einziges Objekt. SparkSession ermöglicht das Erstellen von DataFrames, das Ausführen von SQL-Abfragen und die zentralisierte Konfiguration der Spark-Anwendung. ## 2. Was ist der grundlegende Unterschied zwischen einem RDD und einem DataFrame in PySpark? **Antwort** Ein DataFrame hat ein strukturiertes Schema mit benannten und typisierten Spalten, wodurch Spark Abfragen über Catalyst optimieren kann. Ein RDD ist eine unstrukturierte verteilte Sammlung, bei der Spark die interne Datenstruktur nicht kennt, was mögliche Optimierungen einschränkt. ## 3. Was ist der Unterschied zwischen einer Transformation und einer Action in PySpark? **Antwort** Transformations werden lazy ausgewertet und erstellen einen Ausführungsplan, ohne eine Berechnung auszulösen. Actions lösen die tatsächliche Ausführung des Plans auf dem Cluster aus und liefern ein Ergebnis an den Driver zurück. Diese Unterscheidung ermöglicht es Spark, den Plan vor der Ausführung zu optimieren. ## 17 weitere Fragen verfügbar - Welche der folgenden Operationen ist eine PySpark-Action? - Wie erstellt man ein DataFrame aus einer Parquet-Datei in PySpark? Kostenlos registrieren: https://sharpskill.dev/de/login ## Weitere Data Engineering-Interviewthemen - [Linux & Shell - Grundlagen](https://sharpskill.dev/de/technologies/data-engineering/interviewfragen/linux-shell-basics.md): 20 Fragen, Junior - [Git & GitHub - Grundlagen](https://sharpskill.dev/de/technologies/data-engineering/interviewfragen/git-github-fundamentals.md): 20 Fragen, Junior - [Fortgeschrittenes Python für Data Engineering](https://sharpskill.dev/de/technologies/data-engineering/interviewfragen/python-advanced-de.md): 25 Fragen, Junior - [Docker - Grundlagen](https://sharpskill.dev/de/technologies/data-engineering/interviewfragen/docker-fundamentals.md): 25 Fragen, Junior - [Google Cloud Platform - Grundlagen](https://sharpskill.dev/de/technologies/data-engineering/interviewfragen/gcp-fundamentals.md): 20 Fragen, Junior - [CI/CD und Codequalität](https://sharpskill.dev/de/technologies/data-engineering/interviewfragen/ci-cd-code-quality.md): 20 Fragen, Mid-Level - [Docker Compose](https://sharpskill.dev/de/technologies/data-engineering/interviewfragen/docker-compose.md): 20 Fragen, Mid-Level - [FastAPI - Daten-APIs](https://sharpskill.dev/de/technologies/data-engineering/interviewfragen/fastapi.md): 20 Fragen, Mid-Level - [Fortgeschrittenes SQL für Data Engineering](https://sharpskill.dev/de/technologies/data-engineering/interviewfragen/sql-advanced-de.md): 20 Fragen, Mid-Level - [Data Lake - Architektur und Ingestion](https://sharpskill.dev/de/technologies/data-engineering/interviewfragen/data-lake.md): 20 Fragen, Mid-Level - [BigQuery für Data Engineering](https://sharpskill.dev/de/technologies/data-engineering/interviewfragen/bigquery-de.md): 20 Fragen, Mid-Level - [PostgreSQL - Administration](https://sharpskill.dev/de/technologies/data-engineering/interviewfragen/postgresql-admin.md): 20 Fragen, Mid-Level - [Data Modeling für Data Engineering](https://sharpskill.dev/de/technologies/data-engineering/interviewfragen/data-modeling-de.md): 20 Fragen, Mid-Level - [Fivetran & Airbyte - Daten-Ingestion](https://sharpskill.dev/de/technologies/data-engineering/interviewfragen/fivetran-airbyte.md): 20 Fragen, Mid-Level - [dbt - Grundlagen](https://sharpskill.dev/de/technologies/data-engineering/interviewfragen/dbt-fundamentals-de.md): 20 Fragen, Mid-Level - [Apache Airflow - Grundlagen](https://sharpskill.dev/de/technologies/data-engineering/interviewfragen/airflow-fundamentals.md): 20 Fragen, Mid-Level - [Kubernetes - Grundlagen](https://sharpskill.dev/de/technologies/data-engineering/interviewfragen/kubernetes-fundamentals.md): 20 Fragen, Mid-Level - [dbt - Erweiterte Funktionen](https://sharpskill.dev/de/technologies/data-engineering/interviewfragen/dbt-advanced-de.md): 20 Fragen, Senior - [ETL- / ELT- / ETLT-Patterns](https://sharpskill.dev/de/technologies/data-engineering/interviewfragen/etl-elt-patterns.md): 20 Fragen, Senior - [Apache Airflow - Fortgeschritten](https://sharpskill.dev/de/technologies/data-engineering/interviewfragen/airflow-advanced.md): 20 Fragen, Senior - [Airflow + dbt - Pipeline-Orchestrierung](https://sharpskill.dev/de/technologies/data-engineering/interviewfragen/airflow-dbt-integration.md): 20 Fragen, Senior - [Google Pub/Sub - Daten-Streaming](https://sharpskill.dev/de/technologies/data-engineering/interviewfragen/pubsub-streaming.md): 20 Fragen, Senior - [Apache Beam & Dataflow](https://sharpskill.dev/de/technologies/data-engineering/interviewfragen/apache-beam-dataflow.md): 20 Fragen, Senior - [Kubernetes - Produktion und Skalierung](https://sharpskill.dev/de/technologies/data-engineering/interviewfragen/kubernetes-advanced.md): 20 Fragen, Senior - [Terraform - Infrastructure as Code](https://sharpskill.dev/de/technologies/data-engineering/interviewfragen/terraform.md): 20 Fragen, Senior - [NoSQL-Datenbanken](https://sharpskill.dev/de/technologies/data-engineering/interviewfragen/nosql-databases.md): 20 Fragen, Senior - [Moderne Data Architecture](https://sharpskill.dev/de/technologies/data-engineering/interviewfragen/data-architecture.md): 20 Fragen, Senior - [Monitoring und Observability](https://sharpskill.dev/de/technologies/data-engineering/interviewfragen/monitoring-observability.md): 20 Fragen, Senior - [IAM und Datensicherheit](https://sharpskill.dev/de/technologies/data-engineering/interviewfragen/iam-security-de.md): 20 Fragen, Senior --- Source: SharpSkill (https://sharpskill.dev), tech interview preparation for your real stack. HTML version of this page: https://sharpskill.dev/de/technologies/data-engineering/interviewfragen/pyspark