Ce billet explique comment optimiser l'hébergement d'un grand modèle de langage (LLM) en détaillant le mécanisme du KV Cache, essentiel pour gérer l'attention dans les transformers. L'auteur revient sur le fonctionnement des matrices Query, Key et Value (QKV), qui permettent de calculer les relations entre tokens et d'ajuster leur représentation contextuelle. Le KV Cache stocke les vecteurs Key et Value des tokens actifs, réduisant ainsi la charge computationnelle lors des inférences, mais nécessitant une mémoire GPU significative, comme illustré par les 20,77 GiB utilisés pour 209 456 tokens.
L'article aborde ensuite les solutions techniques comme vLLM et KServe, conçues pour améliorer l'efficacité des LLM en production. Ces outils optimisent la gestion des ressources, notamment via des techniques comme le Grouped Query Attention (utilisé par Mistral), qui réduit la redondance des calculs. L'objectif est de concilier performance et scalabilité, permettant aux entreprises de déployer des modèles toujours plus grands tout en maintenant des temps de réponse acceptables pour un grand nombre d'utilisateurs.
Mistral Vibe est un assistant de codage en ligne de commande open source développé par Mistral AI, conçu pour interagir avec les projets via une interface conversationnelle en langage naturel. Il permet d'explorer, modifier et gérer un codebase grâce à des outils intégrés comme la manipulation de fichiers, l'exécution de commandes shell ou la recherche de code, tout en s'appuyant sur le contexte du projet (structure des fichiers, statut Git, etc.). L'outil cible principalement les environnements UNIX, bien qu'il soit compatible avec Windows.
L'installation se fait via une commande simple (curl ou uv tool install), et l'assistant propose plusieurs modes d'utilisation : interactif, programmatique ou vocal. Il inclut aussi un système de skills (compétences personnalisables) et des slash commands pour étendre ses fonctionnalités, avec une gestion avancée des sessions et des configurations.
Disponible sous licence Apache 2.0, Mistral Vibe se distingue par son approche modulaire, son intégration avec des modèles comme Mistral Medium 3.5 (pour le multimodal) et ses thèmes personnalisables, tout en garantissant une expérience CLI fluide avec historique et autocomplétion.
L’article détaille les essais de l’auteur, les outils testés (Ollama, Jan avec Vulkan/llama.cpp), et les astuces pour configurer un backend compatible afin d’obtenir de bonnes performances sans dépendre de serveurs distants.
Devstral est un modèle LLM agentique open source développé par Mistral AI, spécialement optimisé pour les tâches de développement logiciel. Il se distingue par sa capacité à résoudre des problèmes complexes de programmation, comme la navigation dans de grandes bases de code, la modification de plusieurs fichiers et la correction de bugs, en agissant de manière autonome. Avec seulement 24 milliards de paramètres, il surpasse certains modèles fermés et open source plus volumineux sur le benchmark SWE-Bench Verified, tout en restant léger et utilisable en local sur des machines avec 32 Go de RAM ou une RTX 4090. Sous licence Apache 2.0, il s’intègre facilement à des frameworks comme OpenHands ou SWE-Agent.
L’article détaille son installation (via Ollama, plugins IDE ou OpenHands) et ses cas d’usage : génération de documentation, refactoring de code, création de projets structurés (ex. Spring Boot en DDD), ou amélioration de projets existants. Bien que performant, son efficacité dépend de la qualité des prompts et de l’environnement fourni. Devstral représente une solution prometteuse pour les développeurs souhaitant un assistant local, sécurisé et puissant, malgré quelques limites comme la génération occasionnelle de code inutile ou trop complexe. Une version "Large" est annoncée pour l’avenir.
Tout est dans le titre