# ML Pipelines & Validatie (Data Science & ML) > Scikit-learn pipelines, cross-validation, GridSearchCV, RandomizedSearchCV, data leakage, stratificatie - 22 gespreksvragen - Mid-Level - [Gespreksvragen: Data Science & ML](https://sharpskill.dev/nl/technologies/data-science/sollicitatievragen.md) ## 1. Wat is het belangrijkste voordeel van het gebruik van een scikit-learn Pipeline in plaats van handmatig transformaties toe te passen? **Antwoord** Een Pipeline zorgt ervoor dat dezelfde transformaties consistent worden toegepast op zowel trainings- als testdata. Het kapselt alle preprocessing- en modelleerstappen in één object, wat de code vereenvoudigt, data leakage voorkomt en het gemakkelijker maakt om het model in productie te deployen. ## 2. Welke methode moet worden aangeroepen op een Pipeline om alle stappen te trainen en een voorspelling te doen? **Antwoord** De fit_predict methode bestaat niet voor regressie- of classificatie-Pipelines. U moet eerst fit() aanroepen om de pipeline te trainen, dan predict() om voorspellingen te krijgen. Als alternatief kunnen fit() gevolgd door predict() apart worden aangeroepen voor meer controle. ## 3. Wat is data leakage in een machine learning context? **Antwoord** Data leakage treedt op wanneer informatie uit de testset of toekomstige data per ongeluk wordt gebruikt tijdens de training. Dit kan gebeuren tijdens preprocessing (gemiddelde berekenen over de hele dataset voor de split) of via features die het target indirect bevatten. Het resulteert in kunstmatig hoge prestaties die niet generaliseren. ## Nog 19 vragen beschikbaar - Wat is de rol van ColumnTransformer in scikit-learn? - Wat is K-Fold cross-validation? Meld je gratis aan: https://sharpskill.dev/nl/login ## Andere Data Science & ML-sollicitatieonderwerpen - [Python-basisbeginselen](https://sharpskill.dev/nl/technologies/data-science/sollicitatievragen/python-basics.md): 25 vragen, Junior - [Python Objectgeoriënteerd Programmeren](https://sharpskill.dev/nl/technologies/data-science/sollicitatievragen/python-oop.md): 20 vragen, Junior - [Python-datastructuren](https://sharpskill.dev/nl/technologies/data-science/sollicitatievragen/python-data-structures.md): 20 vragen, Junior - [Git-Fundamenten](https://sharpskill.dev/nl/technologies/data-science/sollicitatievragen/git-fundamentals.md): 18 vragen, Junior - [SQL-basisbeginselen](https://sharpskill.dev/nl/technologies/data-science/sollicitatievragen/sql-basics.md): 20 vragen, Junior - [NumPy-grondbeginselen](https://sharpskill.dev/nl/technologies/data-science/sollicitatievragen/numpy-fundamentals.md): 22 vragen, Junior - [Pandas-basis](https://sharpskill.dev/nl/technologies/data-science/sollicitatievragen/pandas-basics.md): 22 vragen, Junior - [Jupyter & Google Colab](https://sharpskill.dev/nl/technologies/data-science/sollicitatievragen/jupyter-colab.md): 16 vragen, Junior - [SQL Joins & geavanceerde queries](https://sharpskill.dev/nl/technologies/data-science/sollicitatievragen/sql-joins-advanced.md): 22 vragen, Mid-Level - [Geavanceerd Pandas](https://sharpskill.dev/nl/technologies/data-science/sollicitatievragen/pandas-advanced.md): 24 vragen, Mid-Level - [Visualisatie met Matplotlib & Seaborn](https://sharpskill.dev/nl/technologies/data-science/sollicitatievragen/matplotlib-seaborn.md): 20 vragen, Mid-Level - [Interactieve visualisaties met Plotly](https://sharpskill.dev/nl/technologies/data-science/sollicitatievragen/plotly-interactive.md): 18 vragen, Mid-Level - [Beschrijvende statistiek](https://sharpskill.dev/nl/technologies/data-science/sollicitatievragen/statistics-descriptive.md): 20 vragen, Mid-Level - [Inferentiële statistiek](https://sharpskill.dev/nl/technologies/data-science/sollicitatievragen/statistics-inferential.md): 24 vragen, Mid-Level - [Web Scraping](https://sharpskill.dev/nl/technologies/data-science/sollicitatievragen/web-scraping.md): 18 vragen, Mid-Level - [BigQuery & Cloud Data](https://sharpskill.dev/nl/technologies/data-science/sollicitatievragen/bigquery-cloud.md): 18 vragen, Mid-Level - [Feature Engineering](https://sharpskill.dev/nl/technologies/data-science/sollicitatievragen/feature-engineering.md): 22 vragen, Mid-Level - [Supervised ML: Regressie](https://sharpskill.dev/nl/technologies/data-science/sollicitatievragen/ml-supervised-regression.md): 24 vragen, Mid-Level - [Supervised ML: Classificatie](https://sharpskill.dev/nl/technologies/data-science/sollicitatievragen/ml-supervised-classification.md): 24 vragen, Mid-Level - [Beslissingsbomen & Ensembles](https://sharpskill.dev/nl/technologies/data-science/sollicitatievragen/ml-trees-ensembles.md): 24 vragen, Mid-Level - [Ongesuperviseerd ML](https://sharpskill.dev/nl/technologies/data-science/sollicitatievragen/ml-unsupervised.md): 22 vragen, Mid-Level - [Tijdreeksen & Voorspelling](https://sharpskill.dev/nl/technologies/data-science/sollicitatievragen/time-series-forecasting.md): 22 vragen, Mid-Level - [Fundamenten van Deep Learning](https://sharpskill.dev/nl/technologies/data-science/sollicitatievragen/deep-learning-fundamentals.md): 24 vragen, Senior - [TensorFlow & Keras](https://sharpskill.dev/nl/technologies/data-science/sollicitatievragen/tensorflow-keras.md): 22 vragen, Senior - [CNN en beeldclassificatie](https://sharpskill.dev/nl/technologies/data-science/sollicitatievragen/cnn-image-classification.md): 24 vragen, Senior - [RNN & Reeksen](https://sharpskill.dev/nl/technologies/data-science/sollicitatievragen/rnn-sequences.md): 22 vragen, Senior - [Transformers & Attention](https://sharpskill.dev/nl/technologies/data-science/sollicitatievragen/transformers-attention.md): 24 vragen, Senior - [NLP & Hugging Face](https://sharpskill.dev/nl/technologies/data-science/sollicitatievragen/nlp-huggingface.md): 24 vragen, Senior - [GenAI & LangChain](https://sharpskill.dev/nl/technologies/data-science/sollicitatievragen/genai-langchain.md): 24 vragen, Senior - [MLOps en Deployment](https://sharpskill.dev/nl/technologies/data-science/sollicitatievragen/mlops-deployment.md): 24 vragen, Senior --- Source: SharpSkill (https://sharpskill.dev), tech interview preparation for your real stack. HTML version of this page: https://sharpskill.dev/nl/technologies/data-science/sollicitatievragen/ml-pipelines-validation