# NLP & Hugging Face (Data Science & ML) > Tokenization, Embeddings, BERT, GPT, Hugging Face Transformers, Fine-Tuning, Pipelines, Inferenz - 24 Interview-Fragen - Senior - [Interview-Fragen: Data Science & ML](https://sharpskill.dev/de/technologies/data-science/interviewfragen.md) ## 1. Was ist die Hauptfunktion der Tokenization in der natürlichen Sprachverarbeitung? **Antwort** Tokenization teilt Rohtext in kleinere Einheiten namens Tokens auf, die Wörter, Subwörter oder Zeichen sein können. Dieser Schritt ist essentiell, da Sprachmodelle Rohtext nicht direkt verarbeiten können. Jedes Token wird dann in einen numerischen Identifier umgewandelt, den das Modell verarbeiten kann. ## 2. Was ist der Hauptvorteil des BPE-Algorithmus (Byte Pair Encoding) gegenüber der Tokenization auf Wortebene? **Antwort** BPE handhabt unbekannte Wörter (out-of-vocabulary), indem es sie in bekannte Untereinheiten zerlegt. Anders als die Tokenization auf Wortebene, die unbekannte Wörter durch ein spezielles [UNK]-Token ersetzt, kann BPE jedes Wort als Kombination von im Vokabular vorhandenen Subwörtern darstellen, was die Verallgemeinerung auf Wörter ermöglicht, die während des Trainings nie gesehen wurden. ## 3. Was ist der grundlegende Unterschied zwischen WordPiece und BPE bei der Vokabularkonstruktion? **Antwort** BPE fusioniert die häufigsten Token-Paare, während WordPiece Fusionen wählt, die die Likelihood des Trainingskorpus maximieren. WordPiece verwendet somit ein probabilistisches Kriterium statt eines rein häufigkeitsbasierten, was leicht unterschiedliche Aufteilungen erzeugen kann, die möglicherweise besser für das endgültige Sprachmodell geeignet sind. ## 21 weitere Fragen verfügbar - Was ist der Hauptunterschied zwischen statischen Word Embeddings (Word2Vec) und kontextuellen Embeddings (BERT)? - Was sind die beiden Pre-Training-Aufgaben, die BERT verwendet? Kostenlos registrieren: https://sharpskill.dev/de/login ## Weitere Data Science & ML-Interviewthemen - [Python-Grundlagen](https://sharpskill.dev/de/technologies/data-science/interviewfragen/python-basics.md): 25 Fragen, Junior - [Python Objektorientierte Programmierung](https://sharpskill.dev/de/technologies/data-science/interviewfragen/python-oop.md): 20 Fragen, Junior - [Python-Datenstrukturen](https://sharpskill.dev/de/technologies/data-science/interviewfragen/python-data-structures.md): 20 Fragen, Junior - [Git-Grundlagen](https://sharpskill.dev/de/technologies/data-science/interviewfragen/git-fundamentals.md): 18 Fragen, Junior - [SQL-Grundlagen](https://sharpskill.dev/de/technologies/data-science/interviewfragen/sql-basics.md): 20 Fragen, Junior - [NumPy-Grundlagen](https://sharpskill.dev/de/technologies/data-science/interviewfragen/numpy-fundamentals.md): 22 Fragen, Junior - [Pandas-Grundlagen](https://sharpskill.dev/de/technologies/data-science/interviewfragen/pandas-basics.md): 22 Fragen, Junior - [Jupyter & Google Colab](https://sharpskill.dev/de/technologies/data-science/interviewfragen/jupyter-colab.md): 16 Fragen, Junior - [SQL Joins & fortgeschrittene Abfragen](https://sharpskill.dev/de/technologies/data-science/interviewfragen/sql-joins-advanced.md): 22 Fragen, Mid-Level - [Fortgeschrittenes Pandas](https://sharpskill.dev/de/technologies/data-science/interviewfragen/pandas-advanced.md): 24 Fragen, Mid-Level - [Visualisierung mit Matplotlib & Seaborn](https://sharpskill.dev/de/technologies/data-science/interviewfragen/matplotlib-seaborn.md): 20 Fragen, Mid-Level - [Interaktive Visualisierungen mit Plotly](https://sharpskill.dev/de/technologies/data-science/interviewfragen/plotly-interactive.md): 18 Fragen, Mid-Level - [Deskriptive Statistik](https://sharpskill.dev/de/technologies/data-science/interviewfragen/statistics-descriptive.md): 20 Fragen, Mid-Level - [Inferenzstatistik](https://sharpskill.dev/de/technologies/data-science/interviewfragen/statistics-inferential.md): 24 Fragen, Mid-Level - [Web Scraping](https://sharpskill.dev/de/technologies/data-science/interviewfragen/web-scraping.md): 18 Fragen, Mid-Level - [BigQuery & Cloud Data](https://sharpskill.dev/de/technologies/data-science/interviewfragen/bigquery-cloud.md): 18 Fragen, Mid-Level - [Feature Engineering](https://sharpskill.dev/de/technologies/data-science/interviewfragen/feature-engineering.md): 22 Fragen, Mid-Level - [Überwachtes ML: Regression](https://sharpskill.dev/de/technologies/data-science/interviewfragen/ml-supervised-regression.md): 24 Fragen, Mid-Level - [Überwachtes ML: Klassifikation](https://sharpskill.dev/de/technologies/data-science/interviewfragen/ml-supervised-classification.md): 24 Fragen, Mid-Level - [Entscheidungsbäume & Ensembles](https://sharpskill.dev/de/technologies/data-science/interviewfragen/ml-trees-ensembles.md): 24 Fragen, Mid-Level - [Unüberwachtes ML](https://sharpskill.dev/de/technologies/data-science/interviewfragen/ml-unsupervised.md): 22 Fragen, Mid-Level - [ML-Pipelines & Validierung](https://sharpskill.dev/de/technologies/data-science/interviewfragen/ml-pipelines-validation.md): 22 Fragen, Mid-Level - [Zeitreihen & Prognosen](https://sharpskill.dev/de/technologies/data-science/interviewfragen/time-series-forecasting.md): 22 Fragen, Mid-Level - [Grundlagen des Deep Learning](https://sharpskill.dev/de/technologies/data-science/interviewfragen/deep-learning-fundamentals.md): 24 Fragen, Senior - [TensorFlow & Keras](https://sharpskill.dev/de/technologies/data-science/interviewfragen/tensorflow-keras.md): 22 Fragen, Senior - [CNN und Bildklassifizierung](https://sharpskill.dev/de/technologies/data-science/interviewfragen/cnn-image-classification.md): 24 Fragen, Senior - [RNN & Sequenzen](https://sharpskill.dev/de/technologies/data-science/interviewfragen/rnn-sequences.md): 22 Fragen, Senior - [Transformers & Attention](https://sharpskill.dev/de/technologies/data-science/interviewfragen/transformers-attention.md): 24 Fragen, Senior - [GenAI & LangChain](https://sharpskill.dev/de/technologies/data-science/interviewfragen/genai-langchain.md): 24 Fragen, Senior - [MLOps und Deployment](https://sharpskill.dev/de/technologies/data-science/interviewfragen/mlops-deployment.md): 24 Fragen, Senior --- Source: SharpSkill (https://sharpskill.dev), tech interview preparation for your real stack. HTML version of this page: https://sharpskill.dev/de/technologies/data-science/interviewfragen/nlp-huggingface