Rencontrez les inventeurs de l’avenir de la vidéo : Robin Hérin

Dans notre série de blogs «  Rencontrez les inventeurs de l’avenir de la vidéo », nous passons en coulisses pour en apprendre davantage sur certains des esprits les plus brillants d’Ateme et sur les projets sur lesquels ils travaillent. Dans cette nouvelle édition, nous vous présentons Robin Herin, Directeur de la standardisation. Il nous a parlé de la traduction Speech‑to‑Text et Speech‑to‑Speech basée sur l’IA.

Quel est votre rôle chez Ateme ?

Je suis Directeur de la standardisation au sein du bureau du CTO.

Sur quoi travaillez-vous actuellement chez Ateme ?

Sur la localisation de contenus à l’aide de technologies de traduction Speech‑to‑Text et Speech‑to‑Speech basées sur l’intelligence artificielle.

Qu’est-ce que la traduction Speech‑to‑Text et Speech‑to‑Speech ?

En substance, ces technologies permettent d’ajouter des langues supplémentaires à un contenu, qu’il soit diffusé en direct ou fourni sous forme de fichier média.

Commençons par le Speech‑to‑Text. Pour ajouter les langues souhaitées, la première étape est la transcription : nous utilisons un modèle d’ASR (Automated Speech Recognition) pour analyser l’audio entrant et produire du texte. Ce texte peut être utilisé immédiatement comme sous-titres de base (sans traduction) ou transmis à un LLM (par exemple Gemini) pour être traduit dans d’autres langues. Le texte traduit est ensuite formaté selon le standard de sous-titrage choisi (DVB Sub ou TTML, par exemple) et réintégré dans le conteneur média d’origine (MPEG‑2 TS sur SRT, etc.).

Dans le cas du Speech‑to‑Speech, nous reproduisons les étapes du Speech‑to‑Text en y ajoutant un composant supplémentaire : le doublage. Celui-ci repose sur un autre LLM capable de transformer du texte en audio, soit à partir d’une voix numérique existante, soit en créant une réplique vocale numérique synthétique correspondant au timbre et aux émotions de l’orateur d’origine (ce que l’on appelle communément le voice cloning). Comme précédemment, l’audio généré est ensuite conditionné dans le format audio choisi (le plus souvent AAC) et réintégré dans le conteneur média d’origine.

À quels défis du secteur cela répond-il ?

Deux aspects principaux : l’accessibilité et la distribution.

La possibilité d’ajouter des langues supplémentaires, par exemple via le sous-titrage, rend les contenus plus accessibles, notamment pour les personnes malentendantes. L’Acte européen sur l’accessibilité a été ratifié l’année dernière en Europe et inclut des réglementations sur ce sujet, afin de garantir que les contenus puissent être appréciés par tous, quelle que soit leur situation.

C’est également une opportunité pour les ayants droit de distribuer des contenus existants dans de nouveaux pays ou régions. Cet enjeu est particulièrement important en matière de préservation culturelle, notamment dans les zones où la langue maternelle n’est pas la langue nationale. Par exemple, l’Espagne utilise l’espagnol, mais aussi le galicien, le basque ou le catalan. En Nouvelle‑Zélande, l’anglais est largement parlé, mais le māori reste très présent.

Qu’avez-vous accompli dans ce domaine chez Ateme ?

Nous avons non seulement développé des fonctionnalités pour les contenus Live et VOD, mais nous avons également collaboré avec plusieurs partenaires et atteint une qualité de production lors d’événements en direct. Plus précisément, notre travail avec Syncwords et l’intégration entre TITAN Live et NEA Live OTT headend, ainsi que leur service Syncwords Live, ont tiré parti de notre implémentation commune de CMAF Ingest.

Qu’est-ce que cela change pour les téléspectateurs ?

Les audiences bénéficient d’une expérience améliorée pour tous, ainsi que d’une expérience plus équitable pour les personnes ayant besoin de fonctionnalités d’accessibilité. Les contenus sont aujourd’hui plus globaux que jamais, et les téléspectateurs peuvent profiter des mêmes programmes dans presque tous les fuseaux horaires et dans un grand nombre de langues.

À lire également



Laisser un commentaire

Votre adresse e-mail ne sera pas publiée. Les champs obligatoires sont indiqués avec *