Dati strutturati per l'intelligenza artificiale: perché i formati sporchi sprecano token, perché vince Markdown e un piano pratico per i file.
Ogni azienda che ha adottato l'intelligenza artificiale negli ultimi due anni sta sbattendo contro lo stesso muro, e non è il modello. Sono i file. I grandi modelli linguistici ragionano sul testo. Dategli testo pulito e ben strutturato e rispondono con precisione. Dategli un PDF scansionato, un foglio di calcolo esportato in HTML o una presentazione fatta di caselle di testo fluttuanti, e bruceranno token per ricostruire quello che il documento avrebbe dovuto dire, riempiendo i buchi con supposizioni. Ecco cosa significano in pratica i dati strutturati per l'intelligenza artificiale. Non un lusso da data scientist: la differenza tra un assistente che cita correttamente il tuo listino prezzi e uno che si inventa uno sconto. Ed è misurabile. Lo stesso contenuto costa circa il 16 per cento di token in più serializzato in JSON rispetto al Markdown, e le tabelle piatte costano circa il 61 per cento in meno in…