# NLP e Hugging Face (Data Science & ML) > Tokenization, embeddings, BERT, GPT, Hugging Face Transformers, fine-tuning, pipeline, inference - 24 domande da colloquio - Senior - [Domande da colloquio: Data Science & ML](https://sharpskill.dev/it/technologies/data-science/domande-colloquio.md) ## 1. Qual è la funzione principale della tokenization nell'elaborazione del linguaggio naturale? **Risposta** La tokenization divide il testo grezzo in unità più piccole chiamate token, che possono essere parole, sub-parole o caratteri. Questo passaggio è essenziale perché i modelli linguistici non possono elaborare direttamente il testo grezzo. Ogni token viene poi convertito in un identificatore numerico che il modello può elaborare. ## 2. Qual è il principale vantaggio dell'algoritmo BPE (Byte Pair Encoding) rispetto alla tokenization a livello di parole? **Risposta** BPE gestisce le parole sconosciute (out-of-vocabulary) decomponendole in sub-unità conosciute. A differenza della tokenization a livello di parole che sostituisce le parole sconosciute con un token speciale [UNK], BPE può rappresentare qualsiasi parola come combinazione di sub-parole presenti nel vocabolario, consentendo così la generalizzazione a parole mai viste durante l'addestramento. ## 3. Qual è la differenza fondamentale tra WordPiece e BPE per la costruzione del vocabolario? **Risposta** BPE fonde le coppie di token più frequenti, mentre WordPiece sceglie le fusioni che massimizzano la verosimiglianza del corpus di addestramento. WordPiece utilizza quindi un criterio probabilistico anziché puramente frequenziale, il che può produrre divisioni leggermente diverse e potenzialmente più adatte al modello linguistico finale. ## Altre 21 domande disponibili - Qual è la principale differenza tra word embeddings statici (Word2Vec) ed embeddings contestuali (BERT)? - Quali sono i due task di pre-training utilizzati da BERT? Registrati gratis: https://sharpskill.dev/it/login ## Altri argomenti di colloquio Data Science & ML - [Fondamenti di Python](https://sharpskill.dev/it/technologies/data-science/domande-colloquio/python-basics.md): 25 domande, Junior - [Programmazione Orientata agli Oggetti in Python](https://sharpskill.dev/it/technologies/data-science/domande-colloquio/python-oop.md): 20 domande, Junior - [Strutture dati Python](https://sharpskill.dev/it/technologies/data-science/domande-colloquio/python-data-structures.md): 20 domande, Junior - [Fondamenti di Git](https://sharpskill.dev/it/technologies/data-science/domande-colloquio/git-fundamentals.md): 18 domande, Junior - [Fondamenti di SQL](https://sharpskill.dev/it/technologies/data-science/domande-colloquio/sql-basics.md): 20 domande, Junior - [Fondamenti di NumPy](https://sharpskill.dev/it/technologies/data-science/domande-colloquio/numpy-fundamentals.md): 22 domande, Junior - [Fondamenti di Pandas](https://sharpskill.dev/it/technologies/data-science/domande-colloquio/pandas-basics.md): 22 domande, Junior - [Jupyter & Google Colab](https://sharpskill.dev/it/technologies/data-science/domande-colloquio/jupyter-colab.md): 16 domande, Junior - [SQL Joins e query avanzate](https://sharpskill.dev/it/technologies/data-science/domande-colloquio/sql-joins-advanced.md): 22 domande, Mid-Level - [Pandas avanzato](https://sharpskill.dev/it/technologies/data-science/domande-colloquio/pandas-advanced.md): 24 domande, Mid-Level - [Visualizzazione con Matplotlib & Seaborn](https://sharpskill.dev/it/technologies/data-science/domande-colloquio/matplotlib-seaborn.md): 20 domande, Mid-Level - [Visualizzazioni interattive con Plotly](https://sharpskill.dev/it/technologies/data-science/domande-colloquio/plotly-interactive.md): 18 domande, Mid-Level - [Statistica descrittiva](https://sharpskill.dev/it/technologies/data-science/domande-colloquio/statistics-descriptive.md): 20 domande, Mid-Level - [Statistica inferenziale](https://sharpskill.dev/it/technologies/data-science/domande-colloquio/statistics-inferential.md): 24 domande, Mid-Level - [Web Scraping](https://sharpskill.dev/it/technologies/data-science/domande-colloquio/web-scraping.md): 18 domande, Mid-Level - [BigQuery & Cloud Data](https://sharpskill.dev/it/technologies/data-science/domande-colloquio/bigquery-cloud.md): 18 domande, Mid-Level - [Feature Engineering](https://sharpskill.dev/it/technologies/data-science/domande-colloquio/feature-engineering.md): 22 domande, Mid-Level - [ML Supervisionato: Regressione](https://sharpskill.dev/it/technologies/data-science/domande-colloquio/ml-supervised-regression.md): 24 domande, Mid-Level - [ML Supervisionato: Classificazione](https://sharpskill.dev/it/technologies/data-science/domande-colloquio/ml-supervised-classification.md): 24 domande, Mid-Level - [Alberi Decisionali e Ensembles](https://sharpskill.dev/it/technologies/data-science/domande-colloquio/ml-trees-ensembles.md): 24 domande, Mid-Level - [ML Non Supervisionato](https://sharpskill.dev/it/technologies/data-science/domande-colloquio/ml-unsupervised.md): 22 domande, Mid-Level - [Pipeline ML e Validazione](https://sharpskill.dev/it/technologies/data-science/domande-colloquio/ml-pipelines-validation.md): 22 domande, Mid-Level - [Serie Temporali e Previsione](https://sharpskill.dev/it/technologies/data-science/domande-colloquio/time-series-forecasting.md): 22 domande, Mid-Level - [Fondamenti di Deep Learning](https://sharpskill.dev/it/technologies/data-science/domande-colloquio/deep-learning-fundamentals.md): 24 domande, Senior - [TensorFlow & Keras](https://sharpskill.dev/it/technologies/data-science/domande-colloquio/tensorflow-keras.md): 22 domande, Senior - [CNN e classificazione di immagini](https://sharpskill.dev/it/technologies/data-science/domande-colloquio/cnn-image-classification.md): 24 domande, Senior - [RNN e Sequenze](https://sharpskill.dev/it/technologies/data-science/domande-colloquio/rnn-sequences.md): 22 domande, Senior - [Transformers e Attention](https://sharpskill.dev/it/technologies/data-science/domande-colloquio/transformers-attention.md): 24 domande, Senior - [GenAI e LangChain](https://sharpskill.dev/it/technologies/data-science/domande-colloquio/genai-langchain.md): 24 domande, Senior - [MLOps e Deployment](https://sharpskill.dev/it/technologies/data-science/domande-colloquio/mlops-deployment.md): 24 domande, Senior --- Source: SharpSkill (https://sharpskill.dev), tech interview preparation for your real stack. HTML version of this page: https://sharpskill.dev/it/technologies/data-science/domande-colloquio/nlp-huggingface