Comment enregistrer un livre audio (audiobook) avec l'IA de synthèse vocale d'ElevenLabs

Une IA lit un livre audio e1729692031751

L'IA bouleverse la création de livres audios

L'intelligence artificielle est en train de bouleverser l'économie et les modes de production du marché du livre audio (audiobook). Depuis deux ans que je suis ces outils au quotidien, je vois très concrètement la différence dans la façon dont les auteurs, éditeurs indépendants et même certains studios pro organisent leur chaîne de production.

Le processus de création d'un livre audio nécessite généralement une grande quantité de temps, d'effort et de ressources. C'était longtemps un travail presque artisanal, très coûteux, réservé aux maisons d'édition disposant d'un budget solide.

Aujourd'hui, grâce aux progrès de l'IA, on peut créer des livres audio de haute qualité à moindre coût en utilisant des outils de synthèse vocale avancés - parmi lesquels l'excellente IA d'ElevenLabs, qui permet de créer des voix synthétiques réalistes et naturelles. Entre 2023 et 2025, la qualité des voix générées a encore fait un bond : moins de glitches, moins de "robotisation", et une prosodie beaucoup plus crédible, surtout pour la narration longue.

Visiter le site d'ElevenLabs

Néanmoins, ne vous faites pas d'illusions : ElevenLabs a certes le pouvoir de vous faire gagner beaucoup de temps, mais vous devrez quand même consacrer quelques heures à y travailler, car l'IA ne marche pas toute seule magiquement. Il faut apprendre à la prendre en main, la guider, lui fournir des éléments de qualité pour qu'elle fonctionne au mieux, et ça demande un minimum d'effort. C'est un outil de production audio, pas une baguette magique : je le répète parce que je vois encore beaucoup de gens déçus, qui espéraient un export parfait en trois minutes.

Pour donner un ordre d'idée, en imaginant que vous cherchiez à produire un livre audio de 100 pages, sans IA vous y passeriez des dizaines voire des centaines d'heures - à enregistrer et réenregistrer, corriger, faire du montage audio ; avec IA vous pourrez réduire ce temps à peut-être une dizaine d'heures. Une sérieuse économie donc, mais pas un résultat "en 3 clics sans rien faire". Dans mes propres projets, on tombe régulièrement à 8–12 heures de travail pour un manuscrit qui aurait demandé, honnêtement, deux ou trois semaines de studio avant.

Entre-temps, le paysage concurrentiel s’est aussi étoffé : des solutions comme Play.ht, Murf, Speechki ou même les voix IA intégrées chez Amazon et Apple Books progressent vite. Mais sur la combinaison qualité des voix, ergonomie et fonctionnalités orientées audiobooks, ElevenLabs reste encore très bien placé à l’heure où j’écris ces lignes (décembre 2025).

Les étapes pour créer un livre audio avec Eleven Labs

Voici un exemple concret qui montre comment enregistrer un livre audio en utilisant ElevenLabs. C’est la méthode que j’utilise encore aujourd’hui, avec quelques ajustements acquis à force de faire des tests et de rattraper des erreurs un peu pénibles après coup.

Étape 1 : préparation du texte

Avant de commencer l'enregistrement, la première étape consiste à préparer le texte du livre que vous souhaitez convertir en audio. C’est la partie la plus ingrate, mais aussi la plus importante si vous voulez une narration propre, fluide et agréable à écouter.

Formats de fichier

ElevenLabs peut prendre en entrée les formats de fichier texte suivants :

  • PDF
  • TXT
  • DOCX
  • EPUB
  • HTML

Fournir un texte propre, nettoyé

Cependant, la qualité du travail de la synthèse vocale dépend absolument de la qualité du texte. Donc, assurez-vous que le texte est bien édité et exempt de fautes pour éviter les erreurs de prononciation. Les coquilles, les sauts de ligne étranges, les tirets intempestifs, tout ça ressort affreusement à la lecture vocale, beaucoup plus qu’à l’écran.

J'ai fait un test en créant un "projet ElevenLabs" en choisissant l'option d'import de fichier, en fournissant le fichier PDF de l'oeuvre littéraire "Les chants de Maldoror". ElevenLabs a importé tout le texte et l'a découpé en chapitres... de manière incorrecte : il a répété plusieurs fois plusieurs chapitres, de sorte qu'il faut faire un nettoyage à la main pour retrouver le texte original. Cette expérience m’a servi de leçon : depuis, j’évite le PDF dès que je peux, surtout pour les manuscrits complexes.

De même, le texte importé par Eleven Labs contient les numéros de page du PDF original... qui n'ont évidemment plus aucun sens dans un livre audio. Il faut donc éliminer à la main des centaines de numéros de page... Et croyez-moi, après avoir supprimé le 213e numéro de page, on se promet de ne plus jamais sauter l’étape de nettoyage en amont.

Regardez sur la copie d'écran ci-dessous :

  • à gauche, on voit le texte importé, de manière assez correcte, sauf les numéros de page un peu partout...
  • à droite, on voit que l'IA a dupliqué plusieurs fois les mêmes chapitres...
Interface projet ElevenLabs
Interface projet d'ElevenLabs

Après ce test qui montre quelques insuffisances du logiciel, je dirais qu'une clé de la réussite consiste à fournir d'office un fichier parfaitement adapté à l'usage qu'on veut en faire - et donc, probablement pas un PDF parce que ce format est peu malléable. C’est vraiment un point de productivité : un bon fichier source, c’est des dizaines de petites frustrations en moins ensuite.

J'ai réessayé avec un fichier .epub : le résultat est meilleur, les numéros de page ont disparu... mais cette fois le texte est truffé de notes ! Certaines étaient même lues au milieu d’une phrase, ce qui rend l’écoute complètement confuse. Pour un roman ou un essai narratif, c’est catastrophique.

Bref, vous avez compris l'idée : il faut fournir un texte parfaitement propre et utilisable, sans numéros de page, sans notes, sans parasitage : le texte à lire et rien que le texte ! Le mieux est de le faire en amont. Personnellement je passe désormais par un fichier DOCX ou TXT mis au propre, avec une feuille de style simple, avant de l’envoyer dans ElevenLabs. Ça prend une heure, parfois deux, mais on les regagne largement derrière.

Étape 2 : choix de la voix synthétique

Vous devez maintenant décider quelle voix ou quelles voix va ou vont interpréter votre texte. C’est là que le projet prend vie, qu’un simple fichier texte devient réellement une expérience audio, une histoire racontée à quelqu’un.

Une ou plusieurs voix

En effet, il est possible de faire lire tout le texte par une seule et même voix, ou par une multiplicité de voix.

Dans l'interface il est possible de sélectionner un paragraphe, et de l'attribuer à telle ou telle voix.

On pourrait par exemple créer un livre audio du Petit Prince de Saint-Exupéry, et attribuer une voix au narrateur / aviateur, une voix d'enfant au petit prince, une voix de femme ou de fille à la rose, une autre au renard, etc. Il faudrait ensuite attribuer chaque réplique à chaque voix - un travail long et fastidieux que l'IA ne sait pas, malheureusement, automatiser. Pour les romans avec beaucoup de dialogues, je conseille souvent de rester raisonnable : deux ou trois voix bien choisies suffisent, sinon on se perd dans la gestion.

Voix synthétique ou voix clonée

Choisir la bonne voix est crucial car elle doit correspondre au ton du livre et être agréable pour l'auditeur. Vous pouvez écouter des extraits des différentes voix disponibles pour sélectionner celle qui convient le mieux à votre projet. N’hésitez pas à faire plusieurs essais sur le même paragraphe test, ça change vraiment tout.

Une force d'ElevenLabs tient à sa grande richesse de voix. Certaines sont synthétiques, créées de toutes pièces ; d'autres clonées à partir de voix humaines réelles.

En effet, dans sa "Voice Library", bibliothèque de voix, Eleven Labs propose des dizaines de voix - beaucoup plus que la plupart de ses concurrents, mais pourtant pas autant qu'on pourrait en rêver. En l'occurrence, l'IA propose à ce jour 29 voix françaises d'homme, et 10 voix françaises de femme. Ce n’est pas encore la diversité infinie qu’on imagine parfois quand on parle d’IA, mais pour la production de livres audio en français, on a déjà de quoi couvrir beaucoup de registres : corporate, documentaire, roman, jeunesse, etc.

Voice Library bibliothèque de voix d Eleven Labs
Voice Library, la bibliothèque de voix d'Eleven Labs

Cependant, nul doute que la situation va changer rapidement car ElevenLabs propose une fonctionnalité qui me plaît beaucoup : on peut y vendre sa voix, après avoir fait un clonage de type professionnel. Il est évident que cette fonctionnalité va attirer des acteurs vocaux et actrices vocales, ou tout simplement des gens qui ont de belles voix ou des voix typées. On commence d’ailleurs à voir émerger de vrais "catalogues" de comédiens IA, qui se font connaître spécifiquement pour la narration de romans, de podcasts narratifs, de livres pratiques, etc.

Bref, avant d'utiliser une voix il faut d'abord la sélectionner et cliquer sur "Add to VoiceLab" : dès lors, elle apparaitra dans les menus déroulants dans l'interface quand il est question de vocaliser du texte. Cela paraît anodin, mais quand on gère plusieurs séries de livres audio, cette organisation par VoiceLab fait gagner pas mal de temps.

De mon côté, j’ai aussi testé des alternatives comme les voix neuronales de Microsoft Azure ou des moteurs plus récents comme TTS de OpenAI pour comparer. La conclusion, pour l’instant : pour un usage spécifique "livre audio long format", ElevenLabs reste l’un des plus constants sur la durée d’écoute. Moins de fatigue auditive, moins d’artefacts bizarres après une heure de narration continue.

Étape 3 : création d'un projet

Maintenant que vous avez les éléments requis, vous pouvez créer votre "projet".

Le "projet" est un concept d'ElevenLabs pour désigner un espace de travail spécifiquement conçu pour traiter les textes longs, divisés en parties.

On a donc un écran qui liste tous nos projets et, dans chaque projet, une interface qui montre le texte et le découpage en chapitres, et qui permet d'écouter la synthèse vocale et de faire des réglages. Pour la production d’une série de romans ou d’une collection de guides pratiques, cette gestion par projet est très pratique : on s’y retrouve tout de suite.

Pour créer un projet il faut remplir ce formulaire et faire quelques choix - nom du projet, voix par défaut, modèle, qualité, métadonnées :

Créer un projet ElevenLabs
Créer un projet ElevenLabs

Un des choix est celui du type de modèle d'IA à utiliser. Il faut actuellement choisir le modèle Eleven Multilingual v2 pour avoir accès aux fonctionnalités text-to-speech en français. Les nouveaux modèles multilingues gèrent d’ailleurs beaucoup mieux les mélanges de langues dans un même texte (citations en anglais, noms propres étrangers, etc.), ce qui était un vrai problème en 2023.

Choix du modèle Eleven Multilingual v2
Choix du modèle Eleven Multilingual v2

Une autre option concerne la possibilité de normaliser le son à l'échelle du projet entier, de manière à ce que le résultat se cale sur les normes en vigueur en matière de livre audio : normalisation du volume de -18dB à -23dB avec un "maximum peak level" de -3dB. Pour ceux qui veulent publier sur Audible, Kobo, Apple ou même Spotify, respecter ces normes de mastering audio est crucial.

Attention : certains de ces réglages fondamentaux - notamment le modèle et la qualité audio - ne peuvent ensuite plus être modifiés dans ce projet.

Le réglage de qualité va de 128 à 705.6 kbpbs. Chaque niveau de qualité coûte un peu plus de puissance de calcul, donc un peu plus cher (tout est calculé en "nombre de caractères" avec une majoration pour les options coûteuses). Pour un audiobook professionnel, je trouve qu’il ne faut pas trop mégoter : viser au moins le milieu de gamme en bitrate est un bon compromis, surtout si vous prévoyez une diffusion sur des plateformes exigeantes.

Utilisation

L'utilisation de l'interface de projet est simple et intuitive.

On édite son texte, on sélectionne chaque bloc pour lui attribuer une voix, on clique sur le bouton Play pour générer et jouer un paragraphe, et sur >> pour tout générer et lire. Avec l’habitude, on adopte un vrai "workflow" : édition rapide du texte, attribution des voix principales, écoute des passages sensibles (dialogues, passages émouvants, explications techniques) puis génération en lot.

Dictionnaire de prononciation

On peut fournir au projet un dictionnaire de prononciation, impérativement au format .PLS et avec les objets Phoneme et Alias. C’est un outil sous-estimé : pour les noms propres, les termes techniques, les sigles ou les mots étrangers récurrents, un bon dictionnaire fait gagner un temps fou et évite d’avoir à corriger manuellement chaque occurence. Au début je l’ignorais complètement ; maintenant je le prépare presque systématiquement pour les livres audio de non-fiction.

Étape 4 : conversion et export d'un projet

Une fois que vous avez fini d'attribuer les voix aux paragraphes, vous pouvez exporter tout ou partie de votre projet :

  • soit un chapitre
  • soit le projet entier en un seul audio
  • soit le projet entier découpé en chapitres

Pour cela, il faut d'abord "convertir" le texte en audio : clique sur le bouton "Convert", choisissez ce que vous voulez convertir. L'IA travaille quelques secondes et vous affiche un bouton "Download".

Pour télécharger un seul audio de tout le projet, choisissez Project Download.

Pour télécharger tout le projet en chapitres audios séparés, choisissez ZIP Download.

Pour exporter un seul chapitre en audio, choisissez Chapter Download.

ElevenLabs permet aussi d'enregistrer des versions différentes de chaque chapitre. Chaque conversion donne lieu à une version.

Vous pouvez exporter, puis continuer à éditer votre texte, puis le convertir et l'exporter à nouveau. Dans la pratique, je finis souvent avec 2 ou 3 versions de certains chapitres clés (préface, conclusion, scènes très émotionnelles) pour trouver le bon rythme et la bonne intonation.

Un usage possible consiste à transformer votre livre audio en vidéo Youtube pour le monétiser, en y ajoutant de l'image ou de la vidéo générée par IA. De plus en plus d’auteurs exploitent aussi ces exports pour créer des podcasts narratifs, des séries sur Spotify ou des "book trailers" audio-visuels sur les réseaux sociaux, ce qui ouvre de nouveaux canaux de diffusion sans travail supplémentaire énorme.

Exemples de récitations de texte par les voix clonées par IA d'ElevenLabs

Voici deux exemples de récitations de texte interprétées par les voix françaises clonées d'ElevenLabs.

J'ai choisi une voix d'homme et une voix de femme, dans la catégorie Narration, pour lire le début du Chant IV des Chants de Maldoror, du Comte de Lautréamont.

Voix de Martin

Voix de Maélys

Ces résultats me semblent tout à fait acceptables, malgré quelques petits défauts - certains mots sont mal prononcés, par exemple Martin a rajouté un "s" sonore sur le mot corps alors que ce s devrait être muet. Il est probable qu'ElevenLabs corrigera rapidement ces petits défauts. D’ailleurs, plusieurs mises à jour depuis la première rédaction de cet article ont déjà corrigé pas mal de bizarreries dans la diction française.

Et vous, qu'en pensez-vous ? De mon côté, au bout de quelques heures d’écoute continue, j’entends encore parfois une légère rigidité, une façon un peu trop "lisse" de certains passages. Mais pour beaucoup d’usages éditoriaux – livres pratiques, essais, contenus éducatifs – le rapport qualité/prix reste bluffant. Pour les romans très sensibles ou littéraires, j’avoue que je continue à préférer, quand c’est possible, une vraie interprétation humaine, au moins pour les projets les plus importants.

Conclusion

Par rapport à une production humaine en studio, la création de livre audio par IA avec ElevenLabs s'avère considérablement plus rapide et moins chère. Pour les auteurs autoédités, les petites maisons d’édition, les créateurs de contenu audio, c’est même parfois la seule façon réaliste d’entrer sur le marché du livre audio numérique.

Il reste cependant des heures de travail pour préparer les fichiers, corriger les défauts, attribuer les voix, contrôler le résultat, exporter les fichiers puis les utiliser. C’est un nouveau métier qui émerge : une sorte de "réalisateur de livres audio IA", à mi-chemin entre l’éditeur, le technicien son et le directeur artistique.

Le gain de temps est probablement de l'ordre de 90% au moins. Sur plusieurs projets suivis depuis 2023, les délais de production ont été divisés par dix, parfois plus, sans sacrifier totalement la qualité éditoriale – à condition de prendre au sérieux la phase de relecture audio.

Bémol : la voix générée par IA, même sur la base d'une voix clonée, reste un peu plus mécanique et moins naturelle que la voix humaine naturelle. Il y a encore cette petite distance émotionnelle, difficile à décrire, mais qu’on ressent, surtout dans les moments de forte intensité. En 2025, l’écart s’est réduit, mais il n’a pas complètement disparu.

Visiter le site d'ElevenLabs


Info : cet article contient des liens d'affiliation. Le site Synthographie perçoit une commission si le service promu est acheté après avoir cliqué sur un lien affilié. Cette méthode de monétisation finance les heures passées à tester, rédiger, illustrer et publier les tests. Le site Synthographie ne promeut que des services qu'il apprécie.

Laisser un commentaire

Votre adresse e-mail ne sera pas publiée. Les champs obligatoires sont indiqués avec *

Inscrivez-vous à nos newsletters
Retour en haut