L’article explique comment faire tourner un modèle de langage (LLM) en local sur un GPU AMD, en utilisant la pile logicielle ROCm, le serveur Ollama et l’agent OpenCode. L’auteur détaille les étapes pour configurer ROCm, éviter les pièges courants (comme l’utilisation involontaire de l’iGPU) et optimiser l’utilisation de la VRAM, notamment sur une carte RX 7900 XTX dotée de 24 Go de mémoire.
Le texte aborde aussi les concepts clés comme ROCm (l’alternative open source à CUDA pour AMD), Ollama (qui gère automatiquement le backend GPU) et OpenCode (un agent de codage IA en ligne de commande). Il souligne les défis liés à la gestion du contexte et du KV-cache, ainsi que l’importance de choisir un modèle adapté à la VRAM disponible.
Enfin, l’auteur partage son expérience pratique, en insistant sur la maturité actuelle de ROCm et sa compatibilité avec les dépôts Arch/CachyOS, tout en mettant en garde contre les erreurs fréquentes lors de la configuration. L’objectif est de permettre une utilisation autonome et locale d’un agent de codage IA, sans dépendre de solutions cloud ou propriétaires.
Hermes Agent est un agent IA autonome et open source développé par Nous Research, conçu pour automatiser une veille technique auto-hébergée. Contrairement à un simple chatbot, il intègre une mémoire persistante, un système de skills auto-apprenantes et un gateway de messagerie supportant plus de 20 plateformes, dont Matrix. Son architecture repose sur des outils modulaires (terminal, web, code) et une boucle d’apprentissage qui améliore ses compétences au fil du temps, idéal pour filtrer l’information technique de manière autonome.
L’auteur détaille son installation sur un serveur bare metal, intégrant Hermes Agent avec FreshRSS pour l’agrégation de flux, Firecrawl pour l’extraction d’articles, et des modèles comme Ollama ou Claude pour le traitement. Le tout est connecté via Matrix (Synapse) et utilise des outils comme OpenCode pour des tâches locales, formant un écosystème 24/7 dédié à la veille. L’article souligne la flexibilité du système, tout en mentionnant ses limites, notamment la complexité de configuration et la nécessité d’un ajustement manuel pour des résultats optimaux.
Le projet se distingue par son approche généraliste et son potentiel pour une veille technique quotidienne, bien que son utilité dépende de l’usage prolongé et de la personnalisation. L’auteur conclut en questionnant son adoption en 2026, entre autonomie et contrôle utilisateur, tout en partageant son expérience concrète après plusieurs mois d’utilisation.
Stanislas a développé une interface en mode texte (TUI) pour indexer et rechercher ses sessions avec des agents de codage locaux comme Claude Code, Codex, OpenCode, et Copilot. Face aux limitations des fonctionnalités de reprise de session des agents (recherche limitée, sessions liées à un répertoire), il a créé un outil permettant de rechercher dans le contenu des sessions et de les reprendre rapidement. L'outil utilise Tantivy pour l'indexation et orjson pour le parsing rapide des fichiers JSON, et offre des fonctionnalités comme la recherche incrémentale, la navigation intuitive, et des statistiques. Le projet, nommé fast-resume, est disponible pour essai.