Votre clip, dans une langue que vous ne parlez pas
Un clip terminé peut être doublé en 19 langues sans rien réenregistrer et sans entamer votre quota mensuel de vidéos. Mais quatre choses différentes se vendent sous le mot « doublage IA », et elles ne sont pas interchangeables. Voici d'abord la comparaison, pour que vous sachiez si c'est bien celle que vous vouliez.
Quatre approches, côte à côte
Chaque ligne est une vraie catégorie de produit avec de vrais compromis. Deux d'entre elles, nous ne les proposons pas, et les raisons vous sont plus utiles que la fonctionnalité ne le serait.
| Approche | Ce que vous obtenez | Le compromis | Katto |
|---|---|---|---|
| Sous-titres traduits | Du texte dans la langue visée | Le spectateur entend toujours une langue qu'il ne parle pas. Suffisant pour un clip qui fonctionne sans le son, faible pour tout ce qui repose sur la diction. | Également disponible |
| Doublage à voix synthétique | Une nouvelle piste parlée dans la langue visée | La voix n'est pas celle de l'intervenant. Elle se lit naturellement, mais un spectateur qui connaît l'original remarquera un inconnu. | Ce que fait Katto |
| Clonage vocal | La voix même de l'intervenant, dans une autre langue | Exige son consentement pour être légitime, et la même capacité produit des imitations convaincantes. Le risque n'est pas technique, il est dans ce qu'un tiers en fera. | Volontairement non proposé |
| Synchronisation labiale | La bouche recalculée pour coller au nouvel audio | De loin la plus lourde, et elle s'effondre dès que le plan n'est pas un portrait de face bien net. Sur des images de podcast clippées, c'est la majorité des cas. | Non proposé |
La difficulté est l'horloge, pas la voix
Appeler une API de synthèse vocale est la moitié facile. La difficulté tient à ce que la traduction change la longueur : la même phrase est couramment un tiers plus longue d'une langue à l'autre, et un doublage qui l'ignore dérive un peu plus à chaque réplique, jusqu'à ce que l'intervenant réponde à une question qu'on ne lui a pas encore posée.
Le rythme d'origine est donc traité comme une donnée et non comme quelque chose à écraser. Chaque réplique est traduite avec sa durée parlée pour contrainte, synthétisée séparément, puis réinsérée dans le créneau dont elle vient, étirée seulement dans des limites qui préservent une voix humaine. Les sous-titres sont générés sur la même horloge, pour que le texte et le nouvel audio ne puissent pas se séparer.
Ce que cela vous coûte
Le doublage n'entame pas votre quota mensuel de vidéos, parce que ce quota compte les vidéos sources que vous transformez en clips, et qu'un doublage est un travail sur un clip déjà produit. Il a son propre plafond : 20 doublages par période glissante de 30 jours, jusqu'à 3 langues par demande, les plus anciens sortant du compte en vieillissant. L'éditeur affiche ce qu'il vous reste avant que vous choisissiez, pas après.
Ce plafond existe parce que la synthèse vocale est la seule étape dont le coût suit l'usage plutôt que la durée de la vidéo. Nous préférons annoncer un chiffre que vendre une promesse illimitée qu'on restreindrait discrètement plus tard.
Celle que nous ne proposerons pas
Le clonage vocal est la fonctionnalité que tout le monde réclame, et c'est la raison d'être de cette page sous cette forme. Reproduire la voix d'une personne à partir d'un clip, c'est exactement la capacité de lui faire dire n'importe quoi, et l'ouvrir largement revient à la confier à des gens dont nous ne pouvons pas vérifier les intentions. Si elle arrive un jour, elle sera conditionnée à la preuve que la voix appartient au demandeur. D'ici là, le doublage utilise une voix synthétique et ne prétend être personne.
Questions
19. Le moteur sous-jacent en parle bien davantage, et le sélecteur s'ouvrira quand la qualité aura été vérifiée langue par langue plutôt que supposée. Annoncer un chiffre non vérifié, c'est transformer une fonctionnalité en file d'attente au support.
Non. Le quota compte les vidéos sources que vous transformez en clips. Le doublage a son propre plafond : 20 doublages par période glissante de 30 jours, jusqu'à 3 langues d'un coup. Les plus anciens sortent du compte en vieillissant.
Parce que la synthèse vocale est la seule étape dont le coût croît avec l'usage plutôt qu'avec la durée de votre vidéo. Un plafond est la version honnête de cette contrainte. L'alternative est une promesse illimitée qui se dégrade en silence.
C'est le vrai problème d'ingénierie, et il ne se résout pas en appelant une API de synthèse vocale. Le rythme d'origine est conservé comme donnée, chaque réplique est traduite pour sa durée parlée et pas seulement pour son sens, synthétisée séparément, puis réinsérée dans son créneau. Les sous-titres sont placés sur la même horloge pour ne pas s'écarter du nouvel audio.
La technologie fonctionne. Le problème est qu'un outil capable de reproduire la voix de n'importe qui à partir d'un clip est aussi un outil pour lui faire dire n'importe quoi, et nous le livrerions à des inconnus. S'il arrive, il arrivera conditionné à une preuve de consentement, pas sous forme d'interrupteur.
Oui. La même opération est disponible via l'API REST et comme outil MCP, donc un agent peut doubler un clip terminé sans navigateur. Elle renvoie une tâche à interroger, pas un appel bloquant.
Touchez un public qui ne parle pas votre langue
Le doublage est une fonctionnalité Creator. Le clip que vous avez déjà fait sert d'entrée : rien à réenregistrer, aucun quota à dépenser.