# ML-Pipelines & Validierung (Data Science & ML) > Scikit-learn-Pipelines, Cross-Validation, GridSearchCV, RandomizedSearchCV, Data Leakage, Stratifizierung - 22 Interview-Fragen - Mid-Level - [Interview-Fragen: Data Science & ML](https://sharpskill.dev/de/technologies/data-science/interviewfragen.md) ## 1. Was ist der Hauptvorteil der Verwendung einer scikit-learn Pipeline gegenüber dem manuellen Anwenden von Transformationen? **Antwort** Eine Pipeline stellt sicher, dass dieselben Transformationen konsistent auf Trainings- und Testdaten angewendet werden. Sie kapselt alle Preprocessing- und Modellierungsschritte in einem einzigen Objekt, was den Code vereinfacht, Data Leakage verhindert und die Bereitstellung des Modells in der Produktion erleichtert. ## 2. Welche Methode sollte auf einer Pipeline aufgerufen werden, um alle Schritte zu trainieren und eine Vorhersage zu treffen? **Antwort** Die fit_predict-Methode existiert nicht für Regressions- oder Klassifikations-Pipelines. Sie müssen zuerst fit() aufrufen, um die Pipeline zu trainieren, und dann predict() für die Vorhersagen. Alternativ können fit() gefolgt von predict() separat für mehr Kontrolle aufgerufen werden. ## 3. Was ist Data Leakage im Kontext des Machine Learning? **Antwort** Data Leakage tritt auf, wenn Informationen aus dem Testset oder zukünftigen Daten versehentlich während des Trainings verwendet werden. Dies kann während des Preprocessings (Berechnung des Mittelwerts über den gesamten Datensatz vor dem Split) oder durch Features auftreten, die das Ziel indirekt enthalten. Dies führt zu künstlich hoher Leistung, die nicht generalisiert. ## 19 weitere Fragen verfügbar - Welche Rolle spielt ColumnTransformer in scikit-learn? - Was ist K-Fold-Cross-Validation? Kostenlos registrieren: https://sharpskill.dev/de/login ## Weitere Data Science & ML-Interviewthemen - [Python-Grundlagen](https://sharpskill.dev/de/technologies/data-science/interviewfragen/python-basics.md): 25 Fragen, Junior - [Python Objektorientierte Programmierung](https://sharpskill.dev/de/technologies/data-science/interviewfragen/python-oop.md): 20 Fragen, Junior - [Python-Datenstrukturen](https://sharpskill.dev/de/technologies/data-science/interviewfragen/python-data-structures.md): 20 Fragen, Junior - [Git-Grundlagen](https://sharpskill.dev/de/technologies/data-science/interviewfragen/git-fundamentals.md): 18 Fragen, Junior - [SQL-Grundlagen](https://sharpskill.dev/de/technologies/data-science/interviewfragen/sql-basics.md): 20 Fragen, Junior - [NumPy-Grundlagen](https://sharpskill.dev/de/technologies/data-science/interviewfragen/numpy-fundamentals.md): 22 Fragen, Junior - [Pandas-Grundlagen](https://sharpskill.dev/de/technologies/data-science/interviewfragen/pandas-basics.md): 22 Fragen, Junior - [Jupyter & Google Colab](https://sharpskill.dev/de/technologies/data-science/interviewfragen/jupyter-colab.md): 16 Fragen, Junior - [SQL Joins & fortgeschrittene Abfragen](https://sharpskill.dev/de/technologies/data-science/interviewfragen/sql-joins-advanced.md): 22 Fragen, Mid-Level - [Fortgeschrittenes Pandas](https://sharpskill.dev/de/technologies/data-science/interviewfragen/pandas-advanced.md): 24 Fragen, Mid-Level - [Visualisierung mit Matplotlib & Seaborn](https://sharpskill.dev/de/technologies/data-science/interviewfragen/matplotlib-seaborn.md): 20 Fragen, Mid-Level - [Interaktive Visualisierungen mit Plotly](https://sharpskill.dev/de/technologies/data-science/interviewfragen/plotly-interactive.md): 18 Fragen, Mid-Level - [Deskriptive Statistik](https://sharpskill.dev/de/technologies/data-science/interviewfragen/statistics-descriptive.md): 20 Fragen, Mid-Level - [Inferenzstatistik](https://sharpskill.dev/de/technologies/data-science/interviewfragen/statistics-inferential.md): 24 Fragen, Mid-Level - [Web Scraping](https://sharpskill.dev/de/technologies/data-science/interviewfragen/web-scraping.md): 18 Fragen, Mid-Level - [BigQuery & Cloud Data](https://sharpskill.dev/de/technologies/data-science/interviewfragen/bigquery-cloud.md): 18 Fragen, Mid-Level - [Feature Engineering](https://sharpskill.dev/de/technologies/data-science/interviewfragen/feature-engineering.md): 22 Fragen, Mid-Level - [Überwachtes ML: Regression](https://sharpskill.dev/de/technologies/data-science/interviewfragen/ml-supervised-regression.md): 24 Fragen, Mid-Level - [Überwachtes ML: Klassifikation](https://sharpskill.dev/de/technologies/data-science/interviewfragen/ml-supervised-classification.md): 24 Fragen, Mid-Level - [Entscheidungsbäume & Ensembles](https://sharpskill.dev/de/technologies/data-science/interviewfragen/ml-trees-ensembles.md): 24 Fragen, Mid-Level - [Unüberwachtes ML](https://sharpskill.dev/de/technologies/data-science/interviewfragen/ml-unsupervised.md): 22 Fragen, Mid-Level - [Zeitreihen & Prognosen](https://sharpskill.dev/de/technologies/data-science/interviewfragen/time-series-forecasting.md): 22 Fragen, Mid-Level - [Grundlagen des Deep Learning](https://sharpskill.dev/de/technologies/data-science/interviewfragen/deep-learning-fundamentals.md): 24 Fragen, Senior - [TensorFlow & Keras](https://sharpskill.dev/de/technologies/data-science/interviewfragen/tensorflow-keras.md): 22 Fragen, Senior - [CNN und Bildklassifizierung](https://sharpskill.dev/de/technologies/data-science/interviewfragen/cnn-image-classification.md): 24 Fragen, Senior - [RNN & Sequenzen](https://sharpskill.dev/de/technologies/data-science/interviewfragen/rnn-sequences.md): 22 Fragen, Senior - [Transformers & Attention](https://sharpskill.dev/de/technologies/data-science/interviewfragen/transformers-attention.md): 24 Fragen, Senior - [NLP & Hugging Face](https://sharpskill.dev/de/technologies/data-science/interviewfragen/nlp-huggingface.md): 24 Fragen, Senior - [GenAI & LangChain](https://sharpskill.dev/de/technologies/data-science/interviewfragen/genai-langchain.md): 24 Fragen, Senior - [MLOps und Deployment](https://sharpskill.dev/de/technologies/data-science/interviewfragen/mlops-deployment.md): 24 Fragen, Senior --- Source: SharpSkill (https://sharpskill.dev), tech interview preparation for your real stack. HTML version of this page: https://sharpskill.dev/de/technologies/data-science/interviewfragen/ml-pipelines-validation