Aide & conseils · IA
Modèles IA audio et voix gratuits
Musique, bruitages, voix de synthèse : quatre modèles gratuits, leurs limites réelles, et deux pièges — l’un interdit l’usage commercial, l’autre travaille mal le français.
La réponse en une phrase : Stable Audio Open pour les bruitages et les ambiances, VibeVoice ou Qwen3-TTS pour la voix — mais aucun des deux n’est simple en français.
Deux choses à savoir avant de commencer. La première : la plupart de ces modèles ont été entraînés sur des descriptions en anglais, et se comportent moins bien dans les autres langues. La seconde : l’un des plus connus interdit l’usage commercial.
MusicGen medium — Meta
- À quoi il sert : Générer de la musique depuis une description textuelle.
- Ce qu’il fait bien : Entraîné sur de la musique possédée ou licenciée par Meta, pas sur du contenu aspiré — ce qui lui évite l'incertitude juridique de beaucoup de concurrents.
- Ce qu’il fait mal : La qualité musicale est en retrait par rapport aux modèles plus récents.
- Il tourne sur : Une carte graphique modeste.
- Licence : ATTENTION : code sous MIT, mais POIDS sous CC-BY-NC 4.0 — usage commercial INTERDIT. Beaucoup de listes « gratuites » omettent ce point.
Qwen3-TTS 1.7B CustomVoice — Alibaba
- À quoi il sert : Synthèse vocale et clonage de voix, avec le français parmi les langues annoncées.
- Ce qu’il fait bien : Explicitement multilingue, avec un pilotage de la langue, là où beaucoup de concurrents sont anglophones par défaut.
- Ce qu’il fait mal : Le clonage en français est laborieux, et c'est documenté. Un extrait de référence de plus de dix secondes dérive, et la voix peut basculer vers un timbre masculin sur les passages courts. Il faut figer la graine aléatoire pour obtenir deux résultats identiques, et adapter la consigne de style à chaque langue.
- Il tourne sur : Une carte graphique de milieu de gamme.
- Licence : La famille Qwen est publiée sous Apache 2.0 ; à confirmer pour cette variante.
Stable Audio Open 1.0 — Stability AI
- À quoi il sert : Produire des sons, des bruitages et de courtes ambiances musicales depuis une description.
- Ce qu’il fait bien : Les effets sonores et les enregistrements d'ambiance, où il est meilleur que sur la musique proprement dite.
- Ce qu’il fait mal : Il ne sait pas chanter ni parler — toute demande de voix échoue ou produit du charabia. Limité à environ 47 secondes. Faible sur le rock et le rythme, et ses descriptions d'entrée sont pensées en anglais.
- Il tourne sur : Une carte graphique modeste suffit, c'est un petit modèle.
- Licence : Licence communautaire Stability — gratuite, y compris commercialement, sous un seuil de chiffre d'affaires annuel de l'ordre du million de dollars.
VibeVoice Realtime 0.5B — Microsoft
- À quoi il sert : Transformer un texte en voix parlée, en temps réel.
- Ce qu’il fait bien : La capture du timbre d'une voix de référence, et la rapidité.
- Ce qu’il fait mal : Il est pensé pour l'anglais. La qualité varie fortement d'une langue à l'autre, et Microsoft avertit lui-même que le résultat dans une langue non officiellement prise en charge peut être inintelligible, voire choquant. À tester sur du français avant de compter dessus.
- Il tourne sur : 12 à 20 Go de VRAM selon la variante.
- Licence : À confirmer sur la fiche du modèle.
Retour au sommaire de tous les modèles.
Avant de partir : des abonnements IA à moins de 10 €
Quatre offres tirées au hasard parmi celles que nous suivons, au prix mensuel annoncé par l’éditeur, au .
- 8,30 €/mois — Monica, Plateforme (version gratuite en ligne)
- 9,99 €/mois — Adobe Firefly, Adobe, Generative Image
- 8 €/mois — ChatGPT Go, OpenAI, Abonnement
- 5 €/mois — ElevenLabs, Generative Audio (version gratuite en ligne)