Ce billet explique comment optimiser l'hébergement d'un grand modèle de langage (LLM) en détaillant le mécanisme du KV Cache, essentiel pour gérer l'attention dans les transformers. L'auteur revient sur le fonctionnement des matrices Query, Key et Value (QKV), qui permettent de calculer les relations entre tokens et d'ajuster leur représentation contextuelle. Le KV Cache stocke les vecteurs Key et Value des tokens actifs, réduisant ainsi la charge computationnelle lors des inférences, mais nécessitant une mémoire GPU significative, comme illustré par les 20,77 GiB utilisés pour 209 456 tokens.
L'article aborde ensuite les solutions techniques comme vLLM et KServe, conçues pour améliorer l'efficacité des LLM en production. Ces outils optimisent la gestion des ressources, notamment via des techniques comme le Grouped Query Attention (utilisé par Mistral), qui réduit la redondance des calculs. L'objectif est de concilier performance et scalabilité, permettant aux entreprises de déployer des modèles toujours plus grands tout en maintenant des temps de réponse acceptables pour un grand nombre d'utilisateurs.
L’auteure relate son expérience à la conférence Google Cloud Next, où l’observabilité des agents IA est devenue un sujet central. Elle souligne l’essor des systèmes autonomes capables d’enchaîner des tâches complexes, tout en pointant un défi majeur : comment diagnostiquer leurs dysfonctionnements, notamment en production nocturne.
Elle explore ensuite l’observabilité appliquée aux serveurs d’inférence comme vLLM, un outil open source populaire pour héberger des modèles IA en local. vLLM intègre des mécanismes de monitoring natifs, permettant de tracer les requêtes, les temps de réponse et les goulots d’étranglement sans instrumentation lourde.
Enfin, elle compare l’observabilité IA à une cuisine de restaurant, illustrant comment suivre l’état des requêtes en temps réel pour identifier les ralentissements ou erreurs. L’objectif est de passer d’une surveillance basique (disponibilité) à une visibilité fine des processus internes, essentielle pour des systèmes de plus en plus complexes.