# Perguntas de Entrevista Data Analyst Itália 2026: SQL, Python e Analytics > As perguntas de entrevista para data analyst na Itália em 2026 abrangem SQL, Python pandas e análise de negócios. Este guia apresenta 30 questões técnicas com respostas detalhadas e exemplos de código. - Published: 2026-08-26 - Updated: 2026-08-26 - Author: Anthony Fillion-Maillet - Reading time: 5 min --- As entrevistas para data analyst na Itália em 2026 focam fortemente no domínio de SQL, manipulação de dados com Python e na capacidade de traduzir problemas de negócio em soluções analíticas. Com mais de 600 vagas abertas em Milão, Roma e Bolonha, empresas como Prometeia, Bending Spoons e ABB esperam que os candidatos demonstrem profundidade técnica e compreensão do negócio. > **Especificidades do mercado italiano** > > Os empregadores italianos priorizam habilidades em SQL e Power BI. O domínio de Python com pandas diferencia os candidatos, especialmente em empresas de tecnologia de Milão. Os salários iniciais variam entre €28.000 e €39.000, com cargos seniores alcançando €80.000+. ## Perguntas SQL que aparecem em toda entrevista de Data Analyst SQL permanece como a base das entrevistas de data analyst na Itália. Os gestores de contratação em empresas como Italgas e Philip Morris avaliam os candidatos em JOINs, agregações e window functions. Essas perguntas determinam se um candidato consegue extrair insights significativos de bancos de dados relacionais. ### Pergunta 1: Explicar a diferença entre INNER JOIN e LEFT JOIN com um exemplo prático **Resposta esperada:** INNER JOIN retorna apenas as linhas onde existem correspondências em ambas as tabelas. LEFT JOIN retorna todas as linhas da tabela esquerda mais as linhas correspondentes da tabela direita, com valores NULL onde não existe correspondência. ```sql -- orders_analysis.sql -- Encontrar todos os clientes e seus pedidos (incluindo clientes sem pedidos) SELECT c.customer_id, c.customer_name, o.order_id, o.order_total FROM customers c LEFT JOIN orders o ON c.customer_id = o.customer_id; -- Resultado: Clientes sem pedidos aparecem com order_id e order_total NULL -- INNER JOIN excluiria completamente esses clientes ``` Os entrevistadores buscam candidatos que compreendam quando os valores NULL aparecem e possam explicar o contexto de negócio para escolher um tipo de join em vez de outro. ### Pergunta 2: Escrever uma query para encontrar o segundo maior salário em uma tabela Esta pergunta testa o conhecimento de subconsultas, DISTINCT e limitação de resultados. Existem múltiplas abordagens válidas. ```sql -- salary_analysis.sql -- Abordagem 1: Usando subconsulta com MAX SELECT MAX(salary) AS second_highest FROM employees WHERE salary < (SELECT MAX(salary) FROM employees); -- Abordagem 2: Usando a window function DENSE_RANK SELECT salary AS second_highest FROM ( SELECT salary, DENSE_RANK() OVER (ORDER BY salary DESC) AS rank FROM employees ) ranked WHERE rank = 2; ``` A abordagem com window function lida corretamente com empates. Se três funcionários compartilham o maior salário, DENSE_RANK ainda retorna o verdadeiro segundo maior valor. Usar ROW_NUMBER daria resultados diferentes, o que demonstra compreensão das [funções de janela SQL](/technologies/data-analytics/interview-questions/sql-window-functions). ### Pergunta 3: Como identificar e tratar registros duplicados? **Resposta esperada:** Usar GROUP BY com HAVING COUNT(*) > 1 para identificar duplicados. A abordagem depende da regra de negócio: manter o primeiro registro, o mais recente, ou mesclar as informações. ```sql -- duplicate_detection.sql -- Encontrar endereços de email duplicados SELECT email, COUNT(*) AS occurrence_count FROM users GROUP BY email HAVING COUNT(*) > 1; -- Manter apenas o primeiro registro para cada email DELETE FROM users WHERE id NOT IN ( SELECT MIN(id) FROM users GROUP BY email ); ``` ### Pergunta 4: Explicar as CTEs e quando usá-las em vez de subconsultas As Common Table Expressions melhoram a legibilidade das queries e permitem consultas recursivas. Os entrevistadores italianos frequentemente pedem aos candidatos que reestruturem uma subconsulta complexa em uma CTE. ```sql -- revenue_analysis.sql -- CTE para cálculo de receita mensal WITH monthly_revenue AS ( SELECT DATE_TRUNC('month', order_date) AS month, SUM(order_total) AS revenue FROM orders WHERE order_date >= '2025-01-01' GROUP BY DATE_TRUNC('month', order_date) ), revenue_growth AS ( SELECT month, revenue, LAG(revenue) OVER (ORDER BY month) AS prev_month_revenue, revenue - LAG(revenue) OVER (ORDER BY month) AS growth FROM monthly_revenue ) SELECT * FROM revenue_growth WHERE growth > 0; ``` As CTEs são reutilizáveis dentro da mesma query, diferentemente das subconsultas que precisam ser repetidas. Isso importa para queries analíticas complexas comuns em funções de data analyst. ### Pergunta 5: Qual é a diferença entre WHERE e HAVING? **Resposta esperada:** WHERE filtra linhas antes da agregação; HAVING filtra grupos após a agregação. WHERE não pode referenciar funções de agregação; HAVING pode. ```sql -- sales_filter.sql -- WHERE filtra linhas individuais SELECT region, SUM(sales) AS total_sales FROM transactions WHERE transaction_date >= '2026-01-01' -- Filtrar linhas primeiro GROUP BY region HAVING SUM(sales) > 100000; -- Depois filtrar grupos agregados ``` ## Perguntas de Python e Pandas para cargos de Data Analyst As empresas de tecnologia de Milão, particularmente Bending Spoons e Amazon Italy, esperam domínio de Python. Essas perguntas avaliam habilidades de manipulação de dados com pandas e visualização básica. ### Pergunta 6: Como tratar valores ausentes em um DataFrame pandas? **Resposta esperada:** A abordagem depende do tipo de dado e do contexto de negócio. As opções incluem remover linhas, preencher com média/mediana/moda, forward-fill para séries temporais, ou interpolação. ```python # missing_values.py import pandas as pd import numpy as np df = pd.DataFrame({ 'date': pd.date_range('2026-01-01', periods=5), 'sales': [100, np.nan, 150, np.nan, 200], 'category': ['A', 'B', np.nan, 'A', 'B'] }) # Verificar valores ausentes por coluna print(df.isnull().sum()) # Preencher numéricos com mediana (robusto a outliers) df['sales'] = df['sales'].fillna(df['sales'].median()) # Preencher categóricos com moda df['category'] = df['category'].fillna(df['category'].mode()[0]) # Para séries temporais: forward fill df['sales_ffill'] = df['sales'].ffill() ``` Os entrevistadores avaliam se os candidatos compreendem que remover linhas cegamente perde informação, e que a estratégia de preenchimento deve estar alinhada com o objetivo analítico. ### Pergunta 7: Explicar a diferença entre merge, join e concat no pandas **Resposta esperada:** `merge()` combina DataFrames em colunas ou índices (joins estilo SQL). `join()` é um método conveniente para joins baseados em índice. `concat()` empilha DataFrames vertical ou horizontalmente sem corresponder. ```python # dataframe_combining.py import pandas as pd orders = pd.DataFrame({'order_id': [1, 2], 'customer_id': [101, 102]}) customers = pd.DataFrame({'customer_id': [101, 103], 'name': ['Alice', 'Bob']}) # merge: join estilo SQL em coluna merged = pd.merge(orders, customers, on='customer_id', how='left') # concat: empilhar DataFrames df1 = pd.DataFrame({'A': [1, 2]}) df2 = pd.DataFrame({'A': [3, 4]}) stacked = pd.concat([df1, df2], ignore_index=True) ``` ### Pergunta 8: Como realizar uma operação group-by com múltiplas agregações? ```python # groupby_aggregation.py import pandas as pd df = pd.DataFrame({ 'region': ['North', 'North', 'South', 'South'], 'product': ['A', 'B', 'A', 'B'], 'sales': [100, 150, 200, 50], 'quantity': [10, 15, 20, 5] }) # Múltiplas agregações com colunas nomeadas result = df.groupby('region').agg( total_sales=('sales', 'sum'), avg_sales=('sales', 'mean'), total_quantity=('quantity', 'sum'), transaction_count=('sales', 'count') ).reset_index() ``` Esta sintaxe (agregação nomeada) tornou-se o padrão no pandas 1.0+ e permanece atual no [pandas 3.0](/blog/data-analytics/pandas-3-new-apis-breaking-changes-interview). Os entrevistadores esperam que os candidatos a utilizem em vez da abordagem anterior baseada em dicionários. ### Pergunta 9: Escrever código para calcular a taxa de crescimento mês a mês ```python # mom_growth.py import pandas as pd df = pd.DataFrame({ 'month': pd.date_range('2026-01-01', periods=6, freq='MS'), 'revenue': [10000, 12000, 11500, 14000, 15500, 16000] }) # Calcular variação percentual df['mom_growth'] = df['revenue'].pct_change() * 100 # Alternativa: cálculo manual para maior clareza df['prev_revenue'] = df['revenue'].shift(1) df['growth_manual'] = ((df['revenue'] - df['prev_revenue']) / df['prev_revenue']) * 100 ``` ### Pergunta 10: Como pivotar dados no pandas? ```python # pivot_example.py import pandas as pd df = pd.DataFrame({ 'date': ['2026-01', '2026-01', '2026-02', '2026-02'], 'region': ['North', 'South', 'North', 'South'], 'sales': [100, 150, 120, 180] }) # Pivot: linhas=date, colunas=region, valores=sales pivot_table = df.pivot(index='date', columns='region', values='sales') # pivot_table para agregação quando existem duplicados agg_pivot = pd.pivot_table(df, values='sales', index='date', columns='region', aggfunc='sum') ``` ## Perguntas de Analytics de Negócios e Resolução de Problemas As empresas italianas, especialmente em finanças (Prometeia) e manufatura (ABB), avaliam o pensamento analítico além do código puro. Essas perguntas determinam como os candidatos formulam problemas e comunicam descobertas. ### Pergunta 11: Como medir o sucesso de uma campanha de marketing? **Resposta esperada:** Definir KPIs antes do lançamento da campanha. As métricas comuns incluem taxa de conversão, custo por aquisição (CPA), retorno sobre gasto publicitário (ROAS), e valor vitalício do cliente (CLV). Comparar com um grupo de controle ou linha de base histórica. Uma resposta sólida inclui: - Métricas de base antes do lançamento da campanha - Escolha do modelo de atribuição (first-touch, last-touch, multi-touch) - Testes de significância estatística para resultados - Segmentação por canal, audiência ou geografia ### Pergunta 12: Um product manager reporta que a receita caiu 15% neste mês. Como investigar? **Resposta esperada:** Decompor o problema sistematicamente: 1. **Verificar os dados**: Procurar problemas de qualidade de dados, registros ausentes, ou atraso em relatórios 2. **Análise por segmentos**: Detalhar por produto, região, segmento de cliente, canal 3. **Isolar a variável**: Determinar se o volume caiu, o preço mudou, ou o mix se alterou 4. **Fatores externos**: Verificar sazonalidade, ações de concorrentes, eventos econômicos 5. **Correlacionar com outras métricas**: Tráfego do site, taxa de conversão, abandono de carrinho ### Pergunta 13: Explicar A/B testing e quando não deveria ser usado **Resposta esperada:** O A/B testing compara duas variantes (controle vs. tratamento) para medir impacto causal. Requer atribuição aleatória, tamanho de amostra suficiente, e uma métrica de interesse única. O A/B testing não deveria ser usado quando: - O tamanho da amostra é insuficiente para poder estatístico - A mudança afeta todos os usuários (infraestrutura, preços) - Existem efeitos de rede (funcionalidades sociais onde usuários se influenciam mutuamente) - Preocupações éticas impedem de reter uma mudança benéfica ### Pergunta 14: Como explicar significância estatística para um stakeholder não técnico? **Resposta esperada:** Significância estatística significa que a diferença observada é improvável de ter ocorrido por acaso. Um p-value abaixo de 0,05 indica menos de 5% de probabilidade de que o resultado ocorreu aleatoriamente. Analogia: jogar uma moeda 10 vezes e obter 7 caras poderia ser acaso. Obter 95 caras de 100 lançamentos é estatisticamente significativo porque o acaso sozinho não pode explicar. ### Pergunta 15: Qual é a diferença entre correlação e causalidade? **Resposta esperada:** Correlação mede como duas variáveis se movem juntas. Causalidade significa que uma variável influencia diretamente a outra. Vendas de sorvete e afogamentos se correlacionam (ambos aumentam no verão), mas sorvete não causa afogamentos. Estabelecer causalidade requer: - Precedência temporal (a causa precede o efeito) - Correlação - Eliminação de variáveis confundidoras (experimento controlado randomizado) ## Perguntas de Avaliação de Habilidades Técnicas Essas perguntas avaliam o domínio de ferramentas específicas esperado no mercado italiano. ### Pergunta 16: Comparar Power BI e Tableau para analytics empresarial As empresas italianas, particularmente em bancos e serviços públicos, usam intensivamente Power BI devido à integração com o ecossistema Microsoft. Diferenças chave: | Aspecto | Power BI | Tableau | |---------|----------|--------| | Custo | Menor (incluído no Office 365) | Licença mais alta | | Curva de aprendizado | Mais fácil para usuários de Excel | Mais íngreme, mais poderoso | | Preparação de dados | Power Query integrado | Prep requer ferramenta separada | | Visualização | Boa, melhorando | Melhor da categoria | | Adoção empresarial | Maior na Itália | Comum em multinacionais | ### Pergunta 17: O que é DAX e fornecer um exemplo de medida? **Resposta esperada:** DAX (Data Analysis Expressions) é a linguagem de fórmulas do Power BI para cálculos. As medidas calculam valores dinamicamente com base no contexto de filtro. ``` // Medida de crescimento Year-over-Year em DAX YoY Growth % = VAR CurrentYearSales = SUM(Sales[Amount]) VAR PreviousYearSales = CALCULATE( SUM(Sales[Amount]), DATEADD(Calendar[Date], -1, YEAR) ) RETURN DIVIDE(CurrentYearSales - PreviousYearSales, PreviousYearSales, 0) ``` ### Pergunta 18: Explicar ETL e sua importância em analytics **Resposta esperada:** ETL significa Extract, Transform, Load. Os dados se movem de sistemas fonte (ERP, CRM, logs web) através de transformação (limpeza, agregação, joins) para um data warehouse para análise. As alternativas modernas incluem ELT (carregar dados brutos primeiro, transformar no warehouse) e ferramentas como [dbt](/blog/data-analytics/dbt-data-analysts-modeling-testing-interview-2026) que separam a lógica de transformação da orquestração. ### Pergunta 19: Quais são as diferenças entre sistemas OLTP e OLAP? | Aspecto | OLTP | OLAP | |---------|------|------| | Propósito | Processamento de transações | Queries analíticas | | Modelo de dados | Normalizado (3NF) | Desnormalizado (star/snowflake) | | Tipo de query | Simples, frequente | Complexa, agregada | | Volume de dados por query | Pequeno | Grande | | Exemplos | Entrada de pedidos, banco | Data warehouse, relatórios BI | ### Pergunta 20: Como otimizar uma query SQL lenta? **Resposta esperada:** Seguir uma abordagem sistemática: 1. **Analisar o plano de execução**: Identificar full table scans, índices ausentes 2. **Adicionar índices apropriados**: Em colunas em WHERE, JOIN, ORDER BY 3. **Reescrever padrões ineficientes**: Substituir subconsultas correlacionadas por JOINs 4. **Limitar dados cedo**: Filtrar antes de unir tabelas grandes 5. **Usar hints com moderação**: Apenas quando o otimizador toma decisões ruins ```sql -- query_optimization.sql -- Antes: subconsulta correlacionada (lenta) SELECT * FROM orders o WHERE o.total > (SELECT AVG(total) FROM orders WHERE customer_id = o.customer_id); -- Depois: window function (mais rápida) SELECT * FROM ( SELECT *, AVG(total) OVER (PARTITION BY customer_id) AS avg_total FROM orders ) sub WHERE total > avg_total; ``` ## Perguntas Comportamentais e Baseadas em Cenários Os entrevistadores italianos avaliam o ajuste cultural e as habilidades de comunicação além da capacidade técnica. ### Pergunta 21: Descrever uma situação onde a análise contradisse as expectativas dos stakeholders **Estrutura de resposta sólida:** - Situação: o que os stakeholders acreditavam - Análise: o que os dados realmente mostravam - Comunicação: como as descobertas foram apresentadas diplomaticamente - Resultado: qual decisão foi tomada e seu impacto Comportamentos chave que os entrevistadores buscam: honestidade intelectual, comunicação diplomática, e defesa de conclusões baseadas em dados. ### Pergunta 22: Como priorizar múltiplas solicitações de dados urgentes? **Resposta esperada:** - Avaliar o impacto de negócio de cada solicitação - Esclarecer prazos e negociar onde possível - Identificar quick wins vs. análises profundas - Comunicar prazos realistas proativamente - Escalar restrições de recursos para a gerência ### Pergunta 23: Como garantir a qualidade de dados nas análises? **Resposta esperada:** - Validar dados fonte antes da análise (verificações de nulos, intervalos, integridade referencial) - Documentar premissas explicitamente - Cruzar múltiplas fontes de dados - Implementar verificações automatizadas de qualidade de dados - Revisar outliers manualmente antes de excluí-los ### Pergunta 24: Descrever a abordagem para aprender uma nova ferramenta ou tecnologia **Resposta esperada:** - Começar com documentação oficial e tutoriais - Construir um pequeno projeto para aplicar conceitos - Participar de comunidades (Reddit, Stack Overflow, meetups locais) - Ensinar outros para consolidar o entendimento ## Perguntas Específicas da Indústria para o Mercado Italiano ### Pergunta 25: Quais regulamentações afetam o analytics de dados na Itália? **Resposta esperada:** GDPR é a regulamentação principal. Requisitos chave: - Consentimento explícito para processamento de dados pessoais - Direito ao esquecimento (solicitações de exclusão de dados) - Minimização de dados (coletar apenas dados necessários) - Avaliações de impacto de privacidade para processamento de alto risco Específicos do setor: Bancário italiano (regulamentações do Banco da Itália), saúde (equivalente italiano ao HIPAA), setor público (CAD e diretrizes AGID). ### Pergunta 26: Como tratar PII em datasets analíticos? **Resposta esperada:** - Pseudonimização: substituir identificadores por tokens - Agregação: reportar em nível de grupo, não individual - Mascaramento de dados: ocultar porções sensíveis (email: a***@gmail.com) - Controles de acesso: permissões baseadas em papéis para dados sensíveis - Políticas de retenção: excluir dados quando não são mais necessários ### Pergunta 27: Qual experiência possui com plataformas de dados na nuvem? As empresas italianas usam cada vez mais plataformas cloud. Comuns no mercado: - [Google BigQuery](/technologies/data-analytics/interview-questions/bigquery-advanced) (Google Cloud) - Amazon Redshift (AWS) - Azure Synapse (integração ecossistema Microsoft) - Snowflake (cloud-agnóstico) ### Pergunta 28: Como comunicar descobertas analíticas para executivos? **Resposta esperada:** - Liderar com a recomendação, não a metodologia - Usar visualizações que executivos possam interpretar em segundos - Quantificar impacto de negócio (receita, custos, riscos) - Antecipar perguntas e preparar slides de backup - Evitar jargão; traduzir termos técnicos ### Pergunta 29: Quais métricas rastrear para um negócio e-commerce? **Resposta esperada:** - **Aquisição**: fontes de tráfego, custo por aquisição - **Comportamento**: taxa de rejeição, páginas por sessão, tempo no site - **Conversão**: taxa de conversão por etapa do funil, abandono de carrinho - **Retenção**: taxa de recompra, valor vitalício do cliente - **Receita**: valor médio do pedido, receita por visitante ### Pergunta 30: Como se manter atualizado com as tendências em data analytics? **Resposta esperada:** - Seguir publicações da indústria: Towards Data Science, Analytics Vidhya - Participar de competições Kaggle - Comparecer a conferências: PyData, meetups locais de data science em Milão ou Roma - Ler documentação de novas versões de ferramentas - Experimentar com novas tecnologias em projetos pessoais ## Estratégia de Preparação para Entrevistas de Data Analyst na Itália 2026 - **Domínio de SQL**: Praticar em [problemas do LeetCode Database](https://leetcode.com/problemset/database/) e StrataScratch. As empresas italianas avaliam fortemente JOINs, window functions e CTEs - **Domínio de Python**: Completar exercícios de pandas no [Kaggle](https://www.kaggle.com/learn/pandas). Focar em limpeza de dados e agregação - **Familiaridade com ferramentas**: Habilidades em Power BI são muito valorizadas em empresas italianas. Tableau é comum em multinacionais - **Contexto de negócio**: Preparar exemplos de trabalhos anteriores que demonstrem tradução de questões de negócio em abordagens analíticas - **Idioma italiano**: Embora muitas empresas de tecnologia operem em inglês, a fluência em italiano melhora oportunidades em indústrias tradicionais (banco, manufatura, serviços públicos) --- Source: SharpSkill (https://sharpskill.dev), tech interview preparation for your real stack. HTML version of this page: https://sharpskill.dev/pt/blog/data-analytics/data-analyst-interview-questions-italy-2026