Ce tutoriel présente la mise en place d'un système de synthèse vocale sous Linux, principalement destiné aux utilisateurs d'Archlinux mais adaptable à d'autres distributions. L'objectif est de permettre la lecture de textes par des logiciels, notamment les lecteurs d'écran comme Orca ou la fonction "Mode Lecture" de Firefox. La configuration proposée utilise Speech-Dispatcher comme interface centrale pour gérer les différentes voix et moteurs de synthèse.
L'installation repose sur deux composants principaux : Speech-Dispatcher, l'outil d'interfaçage, et un moteur de synthèse vocale. L'auteur recommande Piper-TTS et détaille l'installation des paquets nécessaires via l'AUR, incluant les voix françaises. La configuration de Speech-Dispatcher implique la génération d'un fichier de configuration initial puis son édition pour spécifier l'utilisation du module générique "piper", le réglage de la langue par défaut en français et l'utilisation de Pipewire pour la sortie audio.
La configuration spécifique de Piper-TTS se fait dans un fichier piper.conf qui définit comment Speech-Dispatcher doit appeler le moteur pour générer la voix. Cela inclut la sélection de la voix souhaitée, le réglage du débit et la gestion des paramètres de sortie. Après chaque modification des fichiers de configuration, le service Speech-Dispatcher doit être relancé pour que les changements prennent effet, et des tests peuvent être effectués avec la commande spd-say.
Voicebox est un studio de synthèse vocale open-source et local-first, offrant des fonctionnalités similaires à un DAW pour une synthèse vocale professionnelle. Il permet de cloner des voix, générer de la parole et construire des applications vocales, le tout en local sur votre machine. Contrairement aux services cloud, Voicebox garantit la confidentialité des données, propose des outils professionnels, une flexibilité des modèles (actuellement Qwen3-TTS, avec d'autres modèles en développement), une API pour intégration, et des performances natives grâce à Tauri (Rust). Disponible pour macOS et Windows, il offre des fonctionnalités comme le clonage vocal instantané, une haute fidélité, et une gestion des profils vocaux.
L'article explique comment utiliser l'API SpeechSynthesis pour permettre à un navigateur de lire du texte à voix haute. L'API est accessible via window.speechSynthesis et permet de créer des objets SpeechSynthesisUtterance pour spécifier le texte à lire. L'exemple de code montre comment faire parler le navigateur avec une simple ligne de code. Bien que cette API ne remplace pas les outils d'accessibilité natifs, elle peut les compléter pour améliorer l'expérience utilisateur, notamment pour les personnes malvoyantes.