Données structurées et IA : pourquoi vos LLM gaspillent des tokens sur des formats sales, pourquoi Markdown gagne, et un plan pour vos fichiers.
Toutes les entreprises qui ont déployé de l'IA ces deux dernières années butent sur le même mur, et ce n'est pas le modèle. Ce sont les fichiers. Les grands modèles de langage raisonnent sur du texte. Donnez-leur du texte propre et bien structuré, ils répondent avec précision. Donnez-leur un PDF scanné, un tableur exporté en HTML ou des slides remplies de zones de texte flottantes, et ils brûlent des tokens à reconstruire ce que votre document aurait dû dire, puis comblent les trous en devinant. Voilà ce que « données structurées pour l'IA » veut dire en pratique. Pas un luxe de data scientist : la différence entre un assistant qui cite correctement votre grille tarifaire et un assistant qui invente une remise. Et c'est mesurable. Le même contenu coûte environ 16 % de tokens en plus sérialisé en JSON qu'en Markdown, et des tableaux plats coûtent environ 61 %…