Synchronisation

Ihr Clip, in einer Sprache, die Sie nicht sprechen

Ein fertiger Clip lässt sich in 19 Sprachen synchronisieren, ohne etwas neu aufzunehmen und ohne Ihr monatliches Videokontingent zu verbrauchen. Unter dem Wort KI-Synchronisation werden allerdings vier verschiedene Dinge verkauft, und sie sind nicht austauschbar. Hier zuerst der Vergleich, damit Sie erkennen, ob es das ist, was Sie wollten.

Vier Ansätze im direkten Vergleich

Jede Zeile ist eine echte Produktkategorie mit echten Abwägungen. Zwei davon bieten wir nicht an, und die Gründe nützen Ihnen mehr als die Funktion es täte.

AnsatzWas Sie bekommenDie AbwägungKatto
Übersetzte UntertitelText in der ZielspracheDie Zuschauer hören weiterhin eine Sprache, die sie nicht verstehen. Für einen Clip, der stumm funktioniert, ausreichend; schwach für alles, was vom Vortrag lebt.Ebenfalls verfügbar
Synchronisation mit synthetischer StimmeEine neue Tonspur in der ZielspracheDie Stimme ist nicht die der sprechenden Person. Sie liest sich natürlich, aber wer das Original kennt, bemerkt eine fremde Stimme.Was Katto tut
StimmklonenDie eigene Stimme der Person, in einer anderen SpracheBraucht ihr Einverständnis, um legitim zu sein, und dieselbe Fähigkeit erzeugt überzeugende Imitationen. Das Risiko ist nicht technisch, es liegt darin, was andere damit tun.Bewusst nicht ausgeliefert
Lippensynchrone SynchronisationDer Mund wird passend zum neuen Ton neu berechnetMit Abstand am aufwendigsten, und sie bricht zusammen, sobald es keine saubere Frontalaufnahme ist. Bei geclipptem Podcast-Material ist das die Mehrheit.Nicht ausgeliefert

Schwierig ist die Uhr, nicht die Stimme

Eine Sprachsynthese-API aufzurufen ist die leichte Hälfte. Die Schwierigkeit liegt darin, dass Übersetzung die Länge verändert: Derselbe Satz ist in einer Sprache regelmäßig ein Drittel länger als in einer anderen, und eine Synchronisation, die das ignoriert, läuft mit jeder Phrase weiter aus dem Takt, bis die sprechende Person eine Frage beantwortet, die noch nicht gestellt wurde.

Der Originaltakt wird deshalb als Daten behandelt und nicht als etwas, das man überschreibt. Jede Phrase wird mit ihrer gesprochenen Dauer als Vorgabe übersetzt, einzeln synthetisiert und wieder in ihren Platz eingepasst, nur so weit gedehnt, dass sie nach einem Menschen klingt. Untertitel entstehen an derselben Uhr, damit Text und neuer Ton sich nicht trennen können.

Was es Sie kostet

Synchronisation rührt Ihr monatliches Videokontingent nicht an, denn dieses zählt Quellvideos, die Sie zu Clips machen, und eine Synchronisation ist Arbeit an einem bereits erstellten Clip. Sie hat ein eigenes Limit: 20 Synchronisationen pro rollenden 30 Tagen, bis zu 3 Sprachen pro Anfrage, wobei die ältesten mit der Zeit aus der Zählung fallen. Der Editor zeigt Ihnen vor der Auswahl, wie viele übrig sind, nicht danach.

Das Limit besteht, weil Sprachsynthese der einzige Schritt ist, dessen Kosten der Nutzung folgen und nicht der Videolänge. Wir nennen lieber eine Zahl, als ein unbegrenztes Versprechen zu verkaufen, das später still gedrosselt wird.

Das eine, das wir nicht ausliefern

Stimmklonen ist die Funktion, nach der alle fragen, und der Grund, warum diese Seite diese Form hat. Die Stimme einer Person aus einem Clip zu reproduzieren ist dieselbe Fähigkeit, ihr Worte in den Mund zu legen, und sie offen auszuliefern heißt, sie Menschen zu geben, deren Absichten wir nicht prüfen können. Falls sie je kommt, kommt sie hinter einem Nachweis, dass die Stimme der anfragenden Person gehört. Bis dahin nutzt die Synchronisation eine synthetische Stimme und gibt vor, niemand zu sein.

Fragen

Wie viele Sprachen?

19. Die zugrunde liegende Engine spricht deutlich mehr, und die Auswahl wird sich öffnen, sobald die Qualität Sprache für Sprache geprüft und nicht angenommen wurde. Eine ungeprüfte Zahl anzukündigen ist der Weg, aus einer Funktion eine Support-Warteschlange zu machen.

Verbraucht Synchronisation mein monatliches Kontingent?

Nein. Das Kontingent zählt Quellvideos, die Sie zu Clips machen. Synchronisation hat ein eigenes Limit: 20 Stück pro rollenden 30 Tagen, bis zu 3 Sprachen auf einmal. Die ältesten fallen mit der Zeit aus der Zählung.

Warum überhaupt ein Limit?

Weil Sprachsynthese der einzige Schritt ist, dessen Kosten mit der Nutzung wachsen und nicht mit der Länge Ihres Videos. Ein Limit ist die ehrliche Fassung dieser Einschränkung. Die Alternative ist ein unbegrenztes Versprechen, das still schlechter wird.

Bleibt die Synchronisation im Takt?

Das ist das eigentliche technische Problem, und es löst sich nicht durch den Aufruf einer Sprachsynthese-API. Der Originaltakt wird als Daten behalten, jede Phrase wird für ihre gesprochene Dauer und nicht nur für den Sinn übersetzt, einzeln synthetisiert und wieder in ihren Platz eingepasst. Untertitel laufen an derselben Uhr, damit sie sich nicht vom neuen Ton entfernen.

Warum kein Stimmklonen?

Die Technik funktioniert. Das Problem ist, dass ein Werkzeug, das die Stimme beliebiger Personen aus einem Clip reproduziert, zugleich ein Werkzeug ist, ihnen Worte in den Mund zu legen, und wir würden es Fremden geben. Falls es kommt, kommt es hinter einem Einverständnisnachweis und nicht als Schalter.

Kann ich über die API oder einen Agenten synchronisieren?

Ja. Derselbe Vorgang steht über die REST-API und als MCP-Werkzeug bereit, ein Agent kann einen fertigen Clip also ohne Browser synchronisieren. Er liefert einen Auftrag zum Abfragen zurück, keinen blockierenden Aufruf.

Erreichen Sie ein Publikum, das Ihre Sprache nicht spricht

Synchronisation ist eine Creator-Funktion. Der bereits erstellte Clip ist die Eingabe: nichts neu aufnehmen, kein Kontingent ausgeben.