Area BIGDATA — Big Data e Intelligenza Artificiale

5V del Big Data, machine learning, overfitting/underfitting, framework distribuiti (Hadoop, Spark), BI e analytics.

6 domande disponibili in questa area — Pratica solo questa area →

Domande del paniere

1. Rif. INF-0114 · Tipo: profilo

Le '5 V' del Big Data includono Volume, Velocity, Variety, Veracity e:

[A] Visualization
[B] Value ✓
[C] Virtualization
[D] Validation
Spiegazione

Le 5V del Big Data: Volume (quantità), Velocity (velocità), Variety (formati eterogenei), Veracity (qualità/affidabilità), Value (valore estraibile).

2. Rif. INF-0115 · Tipo: profilo

In Machine Learning, cosa si intende per 'overfitting'?

[A] Il modello non riesce ad apprendere i pattern del training set
[B] Il modello performa bene sul training set ma generalizza male su dati nuovi ✓
[C] Il modello impiega troppo tempo per la fase di training
[D] Il dataset di training è troppo piccolo per l'algoritmo scelto
Spiegazione

L'overfitting si verifica quando il modello memorizza i dati di training (incluso il rumore) invece di apprendere pattern generalizzabili, risultando in alta accuracy sul training e bassa su dati nuovi. Il contrario è underfitting.

3. Rif. INF-0116 · Tipo: profilo

Quale framework è specificamente progettato per l'elaborazione distribuita di grandi dataset (batch processing)?

[A] Apache Kafka
[B] Apache Hadoop MapReduce ✓
[C] Apache NiFi
[D] Redis
Spiegazione

Apache Hadoop MapReduce è il framework classico per batch processing distribuito su grandi dataset (HDFS + job MapReduce). Kafka è un message broker per streaming. NiFi è per data flow/ETL. Redis è un in-memory data store.

4. Rif. INF-0117 · Tipo: profilo

Cosa fa un 'data lake' rispetto a un data warehouse tradizionale?

[A] Memorizza solo dati strutturati con schema rigido predefinito
[B] Memorizza dati in formato grezzo (strutturati, semi-strutturati, non strutturati) con schema applicato alla lettura ✓
[C] Esegue solo query OLAP su cubi multidimensionali
[D] Sostituisce completamente il database transazionale OLTP
Spiegazione

Il data lake memorizza dati in formato nativo/grezzo senza imporre uno schema (schema-on-read), a differenza del data warehouse che richiede schema predefinito (schema-on-write) e dati strutturati.

5. Rif. INF-0118 · Tipo: profilo

In un sistema di raccomandazione basato su 'collaborative filtering', le raccomandazioni si basano su:

[A] Le caratteristiche intrinseche degli oggetti raccomandati
[B] Il comportamento di utenti simili per preferenze ✓
[C] Regole predefinite dall'amministratore del sistema
[D] L'analisi del testo dei contenuti
Spiegazione

Il collaborative filtering analizza i comportamenti e le preferenze di utenti simili ('chi ha apprezzato X ha anche apprezzato Y') senza analizzare le caratteristiche degli oggetti.

6. Rif. INF-0119 · Tipo: profilo

Apache Spark rispetto a Hadoop MapReduce è generalmente:

[A] Più lento ma più affidabile
[B] Più veloce grazie all'elaborazione in-memory ✓
[C] Adatto solo a dati strutturati
[D] Impossibile da usare con HDFS
Spiegazione

Apache Spark elabora i dati in-memory (RAM) invece di scrivere su disco tra ogni step come MapReduce, risultando generalmente 10-100x più veloce per molti workload.