Faites tourner un LLM en local en 2026 : matériel réaliste, Ollama et LM Studio, les bons modèles ouverts, RAG local et premier agent.
Faire tourner un vrai modèle de langage sur sa propre machine, mi-2026, demande un après-midi, un outil gratuit et un ordinateur avec au moins 8 Go de mémoire. Pas de compte, pas de clé API, pas une donnée qui quitte votre bureau. Les modèles téléchargeables aujourd'hui (Qwen3.5, Gemma 4, gpt-oss d'OpenAI, Mistral Small) valent à peu près ce que valait le haut de gamme payant il y a dix-huit mois : largement assez pour résumer, rédiger, extraire, traduire et interroger vos documents internes. Ceci est un tutoriel, pas un manifeste. Je vais vous dire précisément dans quelle catégorie de matériel vous êtes, laquelle des deux portes d'entrée choisir (Ollama ou LM Studio), quels modèles tiennent vraiment dans votre RAM, comment appeler tout cela depuis un script, comment lui donner vos documents, puis comment en faire un premier petit agent. Je vous dirai aussi franchement où l'IA locale perd encore face…