Percentuali schiaccianti ma invisibilizzate

le attività di preparazione e ingegneria dei dati rappresentano oltre l’80% del tempo impiegato nella maggior parte dei progetti di intelligenza artificiale e apprendimento automatico. Sulla base delle interazioni con un gran numero di aziende, agenzie e organizzazioni di utenti finali, la grande quantità di tempo trascorso in una tipica macchina (“Data Engineering, Prep, and Labeling for AI 2020“, rapporto prodotto da Cognilytica)

Panoramica

Il libro bianco di Cognilytica fornisce una checklist dettagliata per il ciclo di vita dell’ingegneria dei dati nell’ambito dell’intelligenza artificiale (IA). Sottolinea l’importanza di avere dati puliti, accurati e ben etichettati per addestrare modelli di apprendimento automatico. Le attività di ingegneria dei dati rappresentano oltre l’80% del tempo speso nei progetti di IA, evidenziando la necessità di un approccio strutturato e iterativo. Il ciclo di vita dei dati comprende fasi come la raccolta, la pulizia, la preparazione e l’etichettatura dei dati. È fondamentale monitorare e riaddestrare i modelli anche dopo la loro implementazione, poiché i dati del mondo reale possono cambiare rapidamente. Inoltre, il documento discute le tecnologie e le pratiche migliori per gestire i dati, come l’uso di strumenti ETL e l’orchestrazione delle pipeline di dati. Infine, Cognilytica offre consulenze e formazione per aiutare le aziende a navigare nel complesso panorama dell’IA e dell’ingegneria dei dati.

Le fasi principali del ciclo di vita dei dati includono la raccolta dei dati, la preparazione e pulizia dei dati, la trasformazione dei dati, la governance dei dati, e l’orchestrazione delle pipeline di dati. Queste fasi sono fondamentali per garantire che i dati siano pronti per l’analisi e l’addestramento dei modelli di intelligenza artificiale, assicurando che siano puliti, accurati e ben etichettati.