À propos

Amselya — la voix retrouvée

L'histoire d'une voix de synthèse kabyle, construite avec les enregistrements de milliers de Kabyles anonymes, pour des enfants qui ne parlent pas encore la langue de leurs grands-parents, et pour des anciens que la technologie a oubliés.

I. Le silence dans la maison

Il y a des silences qui ne font pas de bruit. Celui-là s'est installé chez moi sans que je le remarque, entre deux repas, entre deux devoirs, entre deux écrans.

Mes enfants ne parlent pas kabyle.

Ils le comprennent un peu, par morceaux, comme on devine une chanson dans une pièce voisine. Mais les mots ne viennent pas. Quand leur grand-mère leur parle, ils sourient, hochent la tête, et répondent en français. Elle sourit aussi. Entre eux, il y a une porte entrouverte que personne ne franchit tout à fait.

J'ai cherché de l'aide là où cherchent tous les parents d'aujourd'hui : sur YouTube. Pour le français, l'anglais, l'arabe, il y a des montagnes de contenu. Pour le kabyle, quelques vidéos, souvent anciennes, rarement pensées pour des enfants. Et, de plus en plus, des vidéos fabriquées par des machines qui prétendent parler ma langue.

La première fois que j'en ai écouté une, j'ai cru à une plaisanterie. La voix disait Azul avec un u français, pincé, comme dans « azur ». Pas Azoul. Un quart des mots étaient méconnaissables.

Ce jour-là, j'ai compris que ma langue n'existait pas pour les machines. Ou pire : qu'elle existait, déformée.

II. Ceux que la technologie a oubliés

Dans nos villages, et jusque dans nos appartements de France, vivent des femmes et des hommes dont le kabyle est la seule langue. Ils ont traversé des guerres, des exils, des hivers. Aujourd'hui, ils se heurtent à un téléphone : les messages sont en français, les applications parlent français, anglais, arabe.

Quand j'ai cherché une voix de synthèse kabyle naturelle, capable de lire un texte comme le ferait une voisine, je n'ai rien trouvé qui me satisfasse. Alors une idée a germé, un peu folle pour un développeur qui passe ses journées sur une plateforme de formation en comptabilité : et si je la construisais moi-même ?

III. Le trésor de Mozilla

Toute voix artificielle commence par des voix humaines. Ce trésor existait déjà : depuis des années, la fondation Mozilla mène le projet Common Voice. Des volontaires lisent des phrases dans leur langue et offrent ces enregistrements au domaine public. Des milliers de Kabyles, chez eux, sur leur téléphone, avaient déjà prêté leur voix. Sans le savoir, ils avaient préparé le terrain.

Mais une base publique n'est pas un corpus d'entraînement. Il y avait des micros saturés, des cuisines qui résonnent, des phrases chuchotées, des enfants qui crient au loin. Il fallait trier.

IV. Apprendre les lettres à la machine

Pour fabriquer la voix, j'ai choisi Piper, un moteur de synthèse libre et léger. Piper ne connaissait pas le kabyle, mais il savait parler anglais : je suis parti de ce modèle, comme on apprend une deuxième langue en s'appuyant sur la première.

Le kabyle s'écrit avec un alphabet latin enrichi : ɛ, ɣ, ḍ, ṭ, ṣ, ẓ, ḥ, č, ǧ. Pour la machine, ces lettres n'existaient pas. J'ai reconstruit la table des symboles, lettre par lettre.

Puis il y a eu les pièges invisibles : un γ grec tapé à la place de ɣ, un ε pour ɛ, un Σ pour Ɛ, et l'ancienne notation ţ pour le son « ts », que l'écriture moderne note tt. À l'œil, presque rien. Pour la machine, des sons inconnus.

V. L'oreille et le spectrogramme

À ce moment, le projet a changé de nature. Il ne s'agissait plus de programmer : il fallait écouter.

J'ai appris à lire les spectrogrammes, ces images où le son devient paysage. Les inspirations près du micro y dessinaient des bandes sans énergie dans les graves ; la voix, elle, empilait ses harmoniques comme les marches d'un escalier.

Et puis, la surprise : une femme dans une voix étiquetée « homme ». Un seul compte Common Voice, plusieurs personnes derrière le micro. La hauteur de la voix, l'ordre des enregistrements, puis l'empreinte vocale de chaque clip ont permis de démêler l'écheveau : une « voix » cachait en réalité trois personnes.

VI. La nuit du GPU

L'entraînement tourne sur une carte graphique louée à l'heure. Un petit script donne des nouvelles : le tour d'apprentissage en cours, la vitesse, l'heure prévue de fin. Des heures à attendre.

Au centième tour, j'ai généré une phrase pour chaque voix : Azul fell-awen, ansuf yiswen. J'ai appuyé sur lecture.

Ce n'était plus une machine qui épelait. C'était une voix. Le ḥ avait sa chaleur, le ṭṭ de tameṭṭut sa lourdeur, la question montait à la fin comme chez nous. Pendant quelques secondes, j'ai eu l'impression d'entendre des gens de la famille.

VII. Amselya

J'avais d'abord réservé Smelini, construit à partir d'imesli, la voix. Mais le mot ne voulait rien dire en kabyle. Je suis revenu à un mot qui compte dans ma famille : ameslay, la parole. Je l'ai à peine déformé pour en faire un nom à lui seul.

Amselya.

Un nom qui garde la parole en lui, qui se dit facilement en kabyle comme en français, et que la voix de synthèse prononce parfaitement.

VIII. Douze voix, et un piège

En septembre 2026, j'ai repris le travail avec la dernière version de Common Voice : plus de 615 000 enregistrements validés, près de 568 heures de kabyle, plus de 1 300 contributeurs.

J'ai écouté les cinquante plus gros contributeurs et retenu douze voix, six femmes et six hommes. Un tri automatique a ensuite écarté les clips saturés, bruités, contestés par la communauté ou lus trop vite : il en est resté 52 769, soit plus de 51 heures de parole propre, huit fois plus que la version précédente.

L'entraînement a duré une journée, sur une carte graphique louée en Estonie. Au quatre-vingt-dixième tour, les voix étaient devenues claires, sans les petits parasites des versions précédentes. C'est cette version qui parle aujourd'hui sur le site.

Il y a eu un piège, aussi. Pendant une journée entière, mes essais semblaient montrer que la machine ne savait plus dire ḍ, ḥ ou ǧ : ajeǧǧig devenait ajeddig. J'ai soupçonné le corpus, les contributeurs, l'entraînement. Le coupable était mon propre script d'essai, qui effaçait sans rien dire les points sous les lettres avant de les donner à la voix. Sur le site, le défaut n'existait pas. Leçon retenue : on juge une voix dans les conditions réelles, jamais ailleurs.

Les empreintes vocales ont servi une dernière fois : trois des voix d'homme obtenaient une ressemblance de 0,97 à 0,99 sur 1 : presque la même personne. J'en ai gardé une. Il reste huit voix réellement différentes.

Enfin, chaque voix a reçu des variantes (enfant, adolescent, voix âgée, plus grave, plus claire…) et des dizaines d'effets, calculés directement dans le navigateur. Le Studio audio est gratuit : les fichiers ne quittent jamais l'appareil de celui qui les traite.

IX. Et demain

Aujourd'hui, Amselya lit le kabyle à voix haute. Demain, je voudrais qu'il fasse davantage : un dictionnaire où chaque mot se fait entendre, des histoires pour les enfants, des outils simples pour que nos anciens puissent écouter ce qu'on leur écrit.

Ce projet n'appartient pas qu'à moi. Il repose sur des milliers de Kabyles anonymes qui ont prêté leur voix à Common Voice, sans savoir qu'un jour, ces voix raconteraient des contes à des enfants qui ne parlent pas encore la langue de leurs grands-parents.

Peut-être que mes enfants apprendront quelques mots grâce à elles. Peut-être qu'une grand-mère, quelque part, entendra enfin son téléphone lui parler dans sa langue.

C'est pour eux que la porte est aujourd'hui un peu plus ouverte.

Essayer gratuitement