# Data Analyst Vorstellungsgespräch Italien 2026: SQL, Python und Analytics Fragen > Umfassender Leitfaden für Data Analyst Interviews in Italien 2026. SQL-Abfragen, Python-Datenanalyse, Business Analytics und branchenspezifische Fragen für den italienischen Arbeitsmarkt. - Published: 2026-08-26 - Updated: 2026-08-26 - Author: Anthony Fillion-Maillet - Tags: data-analytics, sql, python, interview, italy - Reading time: 12 min --- Data Analyst Vorstellungsgespräche in Italien für 2026 konzentrieren sich stark auf SQL-Kenntnisse, Python-Datenmanipulation und die Fähigkeit, Geschäftsprobleme in analytische Lösungen zu übersetzen. Mit über 600 offenen Stellen in Mailand, Rom und Bologna erwarten Unternehmen wie Prometeia, Bending Spoons und ABB von Kandidaten sowohl technische Tiefe als auch Geschäftsverständnis. > **Besonderheiten des italienischen Marktes** > > Italienische Arbeitgeber priorisieren SQL- und Power BI-Kenntnisse. Python-Kompetenz mit pandas hebt Kandidaten hervor, besonders bei Technologieunternehmen in Mailand. Einstiegsgehälter liegen zwischen 28.000 € und 39.000 €, während Senior-Positionen über 80.000 € erreichen können. ## SQL-Fragen in jedem Data Analyst Interview SQL bleibt das Fundament von Data Analyst Interviews in Italien. Personalverantwortliche bei Unternehmen wie Italgas und Philip Morris testen Kandidaten zu JOINs, Aggregationen und Window-Funktionen. Diese Fragen bewerten, ob ein Kandidat aussagekräftige Erkenntnisse aus relationalen Datenbanken extrahieren kann. ### Frage 1: Erklären Sie den Unterschied zwischen INNER JOIN und LEFT JOIN mit einem praktischen Beispiel **Erwartete Antwort:** INNER JOIN gibt nur Zeilen zurück, bei denen Übereinstimmungen in beiden Tabellen existieren. LEFT JOIN gibt alle Zeilen der linken Tabelle plus übereinstimmende Zeilen der rechten Tabelle zurück, mit NULL-Werten wo keine Übereinstimmung besteht. ```sql -- orders_analysis.sql -- Alle Kunden und ihre Bestellungen finden (einschließlich Kunden ohne Bestellungen) SELECT c.customer_id, c.customer_name, o.order_id, o.order_total FROM customers c LEFT JOIN orders o ON c.customer_id = o.customer_id; -- Ergebnis: Kunden ohne Bestellungen erscheinen mit NULL order_id und order_total -- INNER JOIN würde diese Kunden komplett ausschließen ``` Interviewer achten darauf, ob Kandidaten verstehen, wann NULL-Werte erscheinen und den Geschäftskontext für die Wahl eines Join-Typs erklären können. ### Frage 2: Schreiben Sie eine Abfrage, um das zweithöchste Gehalt in einer Tabelle zu finden Diese Frage testet Kenntnisse über Subqueries, DISTINCT und Ergebnisbegrenzung. Es existieren mehrere gültige Ansätze. ```sql -- salary_analysis.sql -- Ansatz 1: Verwendung von Subquery mit MAX SELECT MAX(salary) AS second_highest FROM employees WHERE salary < (SELECT MAX(salary) FROM employees); -- Ansatz 2: Verwendung der DENSE_RANK Window-Funktion SELECT salary AS second_highest FROM ( SELECT salary, DENSE_RANK() OVER (ORDER BY salary DESC) AS rank FROM employees ) ranked WHERE rank = 2; ``` Der Window-Funktions-Ansatz behandelt Gleichstände korrekt. Wenn drei Mitarbeiter das höchste Gehalt teilen, gibt DENSE_RANK dennoch den tatsächlichen zweithöchsten Wert zurück. Die Verwendung von ROW_NUMBER würde unterschiedliche Ergebnisse liefern. ### Frage 3: Wie identifizieren und behandeln Sie doppelte Datensätze? **Erwartete Antwort:** Verwenden Sie GROUP BY mit HAVING COUNT(*) > 1 zur Identifikation von Duplikaten. Der Ansatz hängt von der Geschäftsregel ab: den ersten Datensatz behalten, den aktuellsten oder Informationen zusammenführen. ```sql -- duplicate_detection.sql -- Doppelte E-Mail-Adressen finden SELECT email, COUNT(*) AS occurrence_count FROM users GROUP BY email HAVING COUNT(*) > 1; -- Nur den frühesten Datensatz für jede E-Mail behalten DELETE FROM users WHERE id NOT IN ( SELECT MIN(id) FROM users GROUP BY email ); ``` ### Frage 4: Erklären Sie CTEs und wann man sie anstelle von Subqueries verwendet Common Table Expressions verbessern die Lesbarkeit von Abfragen und ermöglichen rekursive Abfragen. Italienische Interviewer bitten Kandidaten oft, eine komplexe Subquery in ein CTE umzustrukturieren. ```sql -- revenue_analysis.sql -- CTE für monatliche Umsatzberechnung WITH monthly_revenue AS ( SELECT DATE_TRUNC('month', order_date) AS month, SUM(order_total) AS revenue FROM orders WHERE order_date >= '2025-01-01' GROUP BY DATE_TRUNC('month', order_date) ), revenue_growth AS ( SELECT month, revenue, LAG(revenue) OVER (ORDER BY month) AS prev_month_revenue, revenue - LAG(revenue) OVER (ORDER BY month) AS growth FROM monthly_revenue ) SELECT * FROM revenue_growth WHERE growth > 0; ``` CTEs sind innerhalb derselben Abfrage wiederverwendbar, im Gegensatz zu Subqueries, die wiederholt werden müssen. Dies ist wichtig für komplexe analytische Abfragen, die in Data Analyst Positionen üblich sind. ### Frage 5: Was ist der Unterschied zwischen WHERE und HAVING? **Erwartete Antwort:** WHERE filtert Zeilen vor der Aggregation; HAVING filtert Gruppen nach der Aggregation. WHERE kann nicht auf Aggregatfunktionen verweisen; HAVING kann es. ```sql -- sales_filter.sql -- WHERE filtert einzelne Zeilen SELECT region, SUM(sales) AS total_sales FROM transactions WHERE transaction_date >= '2026-01-01' -- Zeilen zuerst filtern GROUP BY region HAVING SUM(sales) > 100000; -- Dann aggregierte Gruppen filtern ``` ## Python und Pandas Fragen für Data Analyst Positionen Technologieunternehmen in Mailand, insbesondere Bending Spoons und Amazon Italien, erwarten Python-Kenntnisse. Diese Fragen bewerten Datenmanipulationsfähigkeiten mit pandas und grundlegende Visualisierung. ### Frage 6: Wie gehen Sie mit fehlenden Werten in einem pandas DataFrame um? **Erwartete Antwort:** Der Ansatz hängt vom Datentyp und Geschäftskontext ab. Optionen umfassen das Löschen von Zeilen, Auffüllen mit Mittelwert/Median/Modus, Forward-Filling für Zeitreihen oder Interpolation. ```python # missing_values.py import pandas as pd import numpy as np df = pd.DataFrame({ 'date': pd.date_range('2026-01-01', periods=5), 'sales': [100, np.nan, 150, np.nan, 200], 'category': ['A', 'B', np.nan, 'A', 'B'] }) # Fehlende Werte pro Spalte prüfen print(df.isnull().sum()) # Numerische Werte mit Median auffüllen (robust gegen Ausreißer) df['sales'] = df['sales'].fillna(df['sales'].median()) # Kategorische Werte mit Modus auffüllen df['category'] = df['category'].fillna(df['category'].mode()[0]) # Für Zeitreihen: Forward Fill df['sales_ffill'] = df['sales'].ffill() ``` Interviewer bewerten, ob Kandidaten verstehen, dass blindes Löschen von Zeilen Informationen verliert und dass die Füllstrategie mit dem analytischen Ziel übereinstimmen muss. ### Frage 7: Erklären Sie den Unterschied zwischen merge, join und concat in pandas **Erwartete Antwort:** `merge()` kombiniert DataFrames anhand von Spalten oder Indizes (SQL-artige Joins). `join()` ist eine Komfortmethode für indexbasierte Joins. `concat()` stapelt DataFrames vertikal oder horizontal ohne Abgleich. ```python # dataframe_combining.py import pandas as pd orders = pd.DataFrame({'order_id': [1, 2], 'customer_id': [101, 102]}) customers = pd.DataFrame({'customer_id': [101, 103], 'name': ['Alice', 'Bob']}) # merge: SQL-artiger Join auf Spalte merged = pd.merge(orders, customers, on='customer_id', how='left') # concat: DataFrames stapeln df1 = pd.DataFrame({'A': [1, 2]}) df2 = pd.DataFrame({'A': [3, 4]}) stacked = pd.concat([df1, df2], ignore_index=True) ``` ### Frage 8: Wie führen Sie eine Group-by-Operation mit mehreren Aggregationen durch? ```python # groupby_aggregation.py import pandas as pd df = pd.DataFrame({ 'region': ['North', 'North', 'South', 'South'], 'product': ['A', 'B', 'A', 'B'], 'sales': [100, 150, 200, 50], 'quantity': [10, 15, 20, 5] }) # Mehrere Aggregationen mit benannten Spalten result = df.groupby('region').agg( total_sales=('sales', 'sum'), avg_sales=('sales', 'mean'), total_quantity=('quantity', 'sum'), transaction_count=('sales', 'count') ).reset_index() ``` Diese Syntax (benannte Aggregation) wurde in pandas 1.0+ zum Standard und bleibt in pandas 3.0 aktuell. Interviewer erwarten, dass Kandidaten sie anstelle des älteren dict-basierten Ansatzes verwenden. ### Frage 9: Schreiben Sie Code zur Berechnung der Monat-über-Monat-Wachstumsrate ```python # mom_growth.py import pandas as pd df = pd.DataFrame({ 'month': pd.date_range('2026-01-01', periods=6, freq='MS'), 'revenue': [10000, 12000, 11500, 14000, 15500, 16000] }) # Prozentuale Änderung berechnen df['mom_growth'] = df['revenue'].pct_change() * 100 # Alternative: manuelle Berechnung für Klarheit df['prev_revenue'] = df['revenue'].shift(1) df['growth_manual'] = ((df['revenue'] - df['prev_revenue']) / df['prev_revenue']) * 100 ``` ### Frage 10: Wie pivotieren Sie Daten in pandas? ```python # pivot_example.py import pandas as pd df = pd.DataFrame({ 'date': ['2026-01', '2026-01', '2026-02', '2026-02'], 'region': ['North', 'South', 'North', 'South'], 'sales': [100, 150, 120, 180] }) # Pivot: rows=date, columns=region, values=sales pivot_table = df.pivot(index='date', columns='region', values='sales') # pivot_table für Aggregation bei Duplikaten agg_pivot = pd.pivot_table(df, values='sales', index='date', columns='region', aggfunc='sum') ``` ## Business Analytics und Problemlösungsfragen Italienische Unternehmen, besonders im Finanzwesen (Prometeia) und in der Fertigung (ABB), testen analytisches Denken über reines Coding hinaus. Diese Fragen bewerten, wie Kandidaten Probleme strukturieren und Erkenntnisse kommunizieren. ### Frage 11: Wie würden Sie den Erfolg einer Marketingkampagne messen? **Erwartete Antwort:** KPIs vor Kampagnenstart definieren. Übliche Metriken umfassen Konversionsrate, Kosten pro Akquisition (CPA), Return on Ad Spend (ROAS) und Customer Lifetime Value (CLV). Vergleich mit einer Kontrollgruppe oder historischer Baseline. Eine starke Antwort beinhaltet: - Baseline-Metriken vor Kampagnenstart - Wahl des Attributionsmodells (First-Touch, Last-Touch, Multi-Touch) - Statistische Signifikanztests für Ergebnisse - Segmentierung nach Kanal, Zielgruppe oder Geografie ### Frage 12: Ein Produktmanager meldet, dass der Umsatz diesen Monat um 15% gesunken ist. Wie untersuchen Sie das? **Erwartete Antwort:** Das Problem systematisch zerlegen: 1. **Daten verifizieren**: Auf Datenqualitätsprobleme, fehlende Datensätze oder Reporting-Verzögerungen prüfen 2. **Segmentanalyse**: Nach Produkt, Region, Kundensegment, Kanal aufschlüsseln 3. **Variable isolieren**: Bestimmen, ob Volumen gesunken, Preis geändert oder Mix verschoben wurde 4. **Externe Faktoren**: Saisonalität, Wettbewerberaktionen, wirtschaftliche Ereignisse prüfen 5. **Mit anderen Metriken korrelieren**: Website-Traffic, Konversionsrate, Warenkorbabbruch ### Frage 13: Erklären Sie A/B-Testing und wann es nicht verwendet werden sollte **Erwartete Antwort:** A/B-Testing vergleicht zwei Varianten (Kontrolle vs. Treatment), um kausale Auswirkungen zu messen. Es erfordert zufällige Zuweisung, ausreichende Stichprobengröße und eine einzelne Zielmetrik. A/B-Testing sollte nicht verwendet werden, wenn: - Die Stichprobengröße für statistische Power unzureichend ist - Die Änderung alle Nutzer betrifft (Infrastruktur, Preisgestaltung) - Netzwerkeffekte existieren (soziale Features, bei denen Nutzer sich gegenseitig beeinflussen) - Ethische Bedenken das Vorenthalten einer vorteilhaften Änderung verhindern ### Frage 14: Wie erklären Sie statistische Signifikanz einem nicht-technischen Stakeholder? **Erwartete Antwort:** Statistische Signifikanz bedeutet, dass der beobachtete Unterschied wahrscheinlich nicht durch Zufall entstanden ist. Ein p-Wert unter 0,05 zeigt weniger als 5% Wahrscheinlichkeit an, dass das Ergebnis zufällig entstanden ist. Analogie: Eine Münze 10 Mal werfen und 7 Mal Kopf bekommen könnte Zufall sein. 95 Mal Kopf bei 100 Würfen ist statistisch signifikant, weil Zufall allein dies nicht erklären kann. ### Frage 15: Was ist der Unterschied zwischen Korrelation und Kausalität? **Erwartete Antwort:** Korrelation misst, wie zwei Variablen sich zusammen bewegen. Kausalität bedeutet, dass eine Variable die andere direkt beeinflusst. Eisverkauf und Ertrinkungstode korrelieren (beide steigen im Sommer), aber Eis verursacht kein Ertrinken. Kausalität zu etablieren erfordert: - Zeitliche Priorität (Ursache geht Wirkung voraus) - Korrelation - Eliminierung von Störvariablen (randomisiertes kontrolliertes Experiment) ## Fragen zur Bewertung technischer Fähigkeiten Diese Fragen testen spezifische Werkzeugkenntnisse, die auf dem italienischen Markt erwartet werden. ### Frage 16: Vergleichen Sie Power BI und Tableau für Enterprise Analytics Italienische Unternehmen, insbesondere im Bankwesen und bei Versorgungsunternehmen, nutzen stark Power BI aufgrund der Microsoft-Ökosystem-Integration. Wichtige Unterschiede: | Aspekt | Power BI | Tableau | |--------|----------|--------| | Kosten | Niedriger (Office 365 enthalten) | Höhere Lizenzierung | | Lernkurve | Einfacher für Excel-Nutzer | Steiler, leistungsfähiger | | Datenvorbereitung | Power Query integriert | Prep erfordert separates Tool | | Visualisierung | Gut, verbessert sich | Best-in-Class | | Enterprise-Adoption | Höher in Italien | Üblich bei multinationalen Firmen | ### Frage 17: Was ist DAX und geben Sie ein Beispiel für ein Measure **Erwartete Antwort:** DAX (Data Analysis Expressions) ist Power BIs Formelsprache für Berechnungen. Measures berechnen Werte dynamisch basierend auf dem Filterkontext. ``` // Jahr-über-Jahr-Wachstum Measure in DAX YoY Growth % = VAR CurrentYearSales = SUM(Sales[Amount]) VAR PreviousYearSales = CALCULATE( SUM(Sales[Amount]), DATEADD(Calendar[Date], -1, YEAR) ) RETURN DIVIDE(CurrentYearSales - PreviousYearSales, PreviousYearSales, 0) ``` ### Frage 18: Erklären Sie ETL und seine Bedeutung in der Analytik **Erwartete Antwort:** ETL steht für Extract, Transform, Load. Daten bewegen sich von Quellsystemen (ERP, CRM, Web-Logs) durch Transformation (Bereinigung, Aggregation, Verknüpfung) in ein Data Warehouse zur Analyse. Moderne Alternativen umfassen ELT (erst Rohdaten laden, dann im Warehouse transformieren) und Tools wie dbt, die Transformationslogik von Orchestrierung trennen. ### Frage 19: Was sind die Unterschiede zwischen OLTP- und OLAP-Systemen? | Aspekt | OLTP | OLAP | |--------|------|------| | Zweck | Transaktionsverarbeitung | Analytische Abfragen | | Datenmodell | Normalisiert (3NF) | Denormalisiert (Star/Snowflake) | | Abfragetyp | Einfach, häufig | Komplex, aggregiert | | Datenvolumen pro Abfrage | Klein | Groß | | Beispiele | Auftragseingabe, Banking | Data Warehouse, BI-Reports | ### Frage 20: Wie optimieren Sie eine langsame SQL-Abfrage? **Erwartete Antwort:** Systematischen Ansatz verfolgen: 1. **Ausführungsplan analysieren**: Full Table Scans, fehlende Indizes identifizieren 2. **Geeignete Indizes hinzufügen**: Auf Spalten in WHERE, JOIN, ORDER BY 3. **Ineffiziente Muster umschreiben**: Korrelierte Subqueries durch JOINs ersetzen 4. **Daten früh begrenzen**: Vor dem Joinen großer Tabellen filtern 5. **Query Hints sparsam verwenden**: Nur wenn Optimizer schlechte Entscheidungen trifft ```sql -- query_optimization.sql -- Vorher: korrelierte Subquery (langsam) SELECT * FROM orders o WHERE o.total > (SELECT AVG(total) FROM orders WHERE customer_id = o.customer_id); -- Nachher: Window-Funktion (schneller) SELECT * FROM ( SELECT *, AVG(total) OVER (PARTITION BY customer_id) AS avg_total FROM orders ) sub WHERE total > avg_total; ``` ## Verhaltens- und Szenario-basierte Fragen Italienische Interviewer bewerten kulturelle Passung und Kommunikationsfähigkeiten neben technischen Fähigkeiten. ### Frage 21: Beschreiben Sie eine Situation, in der Ihre Analyse dem widersprach, was Stakeholder erwartet hatten **Starke Antwortstruktur:** - Situation: was die Stakeholder glaubten - Analyse: was die Daten tatsächlich zeigten - Kommunikation: wie Erkenntnisse diplomatisch präsentiert wurden - Ergebnis: welche Entscheidung getroffen wurde und deren Auswirkung Verhaltensweisen, auf die Interviewer achten: intellektuelle Ehrlichkeit, diplomatische Kommunikation und Standhaftigkeit bei datengesteuerten Schlussfolgerungen. ### Frage 22: Wie priorisieren Sie mehrere dringende Datenanfragen? **Erwartete Antwort:** - Geschäftliche Auswirkung jeder Anfrage bewerten - Fristen klären und wo möglich verhandeln - Quick Wins vs. tiefgreifende Analyse identifizieren - Realistische Zeitrahmen proaktiv kommunizieren - Ressourcenengpässe an das Management eskalieren ### Frage 23: Wie stellen Sie Datenqualität in Ihren Analysen sicher? **Erwartete Antwort:** - Quelldaten vor der Analyse validieren (Null-Checks, Bereichsprüfungen, referentielle Integrität) - Annahmen explizit dokumentieren - Mehrere Datenquellen gegenprüfen - Automatisierte Datenqualitätsprüfungen implementieren - Ausreißer manuell überprüfen, bevor sie ausgeschlossen werden ### Frage 24: Beschreiben Sie Ihren Ansatz zum Erlernen eines neuen Tools oder einer neuen Technologie **Erwartete Antwort:** - Mit offizieller Dokumentation und Tutorials beginnen - Ein kleines Projekt zum Anwenden der Konzepte erstellen - Communities beitreten (Reddit, Stack Overflow, lokale Meetups) - Anderen beibringen, um das Verständnis zu festigen ## Branchenspezifische Fragen für den italienischen Markt ### Frage 25: Welche Vorschriften betreffen Data Analytics in Italien? **Erwartete Antwort:** Die DSGVO ist die primäre Verordnung. Wichtige Anforderungen umfassen: - Ausdrückliche Einwilligung zur Verarbeitung personenbezogener Daten - Recht auf Löschung (Datenlöschungsanfragen) - Datenminimierung (nur notwendige Daten erheben) - Datenschutz-Folgenabschätzungen für risikoreiche Verarbeitung Branchenspezifisch: Italienisches Bankwesen (Vorschriften der Bank of Italy), Gesundheitswesen (italienische HIPAA-Äquivalente), öffentlicher Sektor (CAD- und AGID-Richtlinien). ### Frage 26: Wie gehen Sie mit personenbezogenen Daten in analytischen Datensätzen um? **Erwartete Antwort:** - Pseudonymisierung: Identifikatoren durch Tokens ersetzen - Aggregation: auf Gruppenebene berichten, nicht individuell - Datenmaskierung: sensible Teile verbergen (E-Mail: a***@gmail.com) - Zugriffskontrollen: rollenbasierte Berechtigungen für sensible Daten - Aufbewahrungsrichtlinien: Daten löschen, wenn nicht mehr benötigt ### Frage 27: Welche Erfahrung haben Sie mit Cloud-Datenplattformen? Italienische Unternehmen nutzen zunehmend Cloud-Plattformen. Verbreitet auf dem Markt: - Google BigQuery (Google Cloud) - Amazon Redshift (AWS) - Azure Synapse (Microsoft-Ökosystem-Integration) - Snowflake (Cloud-agnostisch) ### Frage 28: Wie kommunizieren Sie analytische Erkenntnisse an Führungskräfte? **Erwartete Antwort:** - Mit der Empfehlung beginnen, nicht mit der Methodik - Visualisierungen verwenden, die Führungskräfte in Sekunden interpretieren können - Geschäftliche Auswirkung quantifizieren (Umsatz, Kosten, Risiko) - Fragen antizipieren und Backup-Folien vorbereiten - Fachjargon vermeiden; technische Begriffe übersetzen ### Frage 29: Welche Metriken würden Sie für ein E-Commerce-Unternehmen verfolgen? **Erwartete Antwort:** - **Akquisition**: Traffic-Quellen, Kosten pro Akquisition - **Verhalten**: Absprungrate, Seiten pro Sitzung, Verweildauer - **Konversion**: Konversionsrate nach Funnel-Stufe, Warenkorbabbruch - **Retention**: Wiederkaufrate, Customer Lifetime Value - **Umsatz**: Durchschnittlicher Bestellwert, Umsatz pro Besucher ### Frage 30: Wie bleiben Sie bei Data Analytics-Trends auf dem Laufenden? **Erwartete Antwort:** - Branchenpublikationen folgen: Towards Data Science, Analytics Vidhya - An Kaggle-Wettbewerben teilnehmen - Konferenzen besuchen: PyData, lokale Data Science Meetups in Mailand oder Rom - Dokumentation für neue Tool-Releases lesen - Mit neuen Technologien an persönlichen Projekten experimentieren ## Vorbereitungsstrategie für Data Analyst Interviews in Italien 2026 - **SQL-Meisterschaft**: Auf LeetCode Database-Problemen und StrataScratch üben. Italienische Unternehmen testen JOINs, Window-Funktionen und CTEs intensiv - **Python-Kenntnisse**: Pandas-Übungen auf Kaggle absolvieren. Fokus auf Datenbereinigung und Aggregation - **Tool-Vertrautheit**: Power BI-Kenntnisse werden in italienischen Unternehmen hoch geschätzt. Tableau ist bei multinationalen Unternehmen üblich - **Geschäftskontext**: Beispiele aus früherer Arbeit vorbereiten, die demonstrieren, wie Geschäftsfragen in analytische Ansätze übersetzt werden - **Italienische Sprache**: Während viele Technologieunternehmen auf Englisch arbeiten, verbessern Italienischkenntnisse die Chancen in traditionellen Branchen (Bankwesen, Fertigung, Versorgungsunternehmen) --- Source: SharpSkill (https://sharpskill.dev), tech interview preparation for your real stack. HTML version of this page: https://sharpskill.dev/de/blog/data-analytics/data-analyst-interview-questions-italy-2026