← Zurück zum Blog
EngineeringBuild in PublicVideo

Ich habe ein LLM gebeten, falsch geschriebene Namen zu korrigieren. Stattdessen hat es das Produkt umbenannt.

Mein KI-Clipper korrigiert Eigennamen in Transkripten. In einem Video ersetzte er einen unbekannten Modellnamen durch den eines echten Konkurrenten.

28. September 2026

Ich habe ein LLM gebeten, falsch geschriebene Namen zu korrigieren. Stattdessen hat es das Produkt umbenannt.

Erstellt: 28. September 2026 · Aktualisiert: 28. September 2026

Katto ist ein KI-Videoclipper. Du lädst ein langes Video hoch, er schneidet die guten Momente zu vertikalen Shorts und schreibt die Untertitel dazu. Ich baue ihn allein, öffentlich. Hier geht es um ein Feature, das ich auf der Preisseite bewerbe und das ich dabei erwischt habe, wie es klammheimlich das Gegenteil seiner Aufgabe tat.

Das Problem, das ich lösen wollte

Spracherkennung ist sehr gut bei Wörtern und sehr schlecht bei Namen. Whisper hört eine Marke, die es noch nie getroffen hat, und schreibt sie phonetisch. Aus "Trump" wird "trompe". Aus "Suárez" wird "Suares". Aus "ChatGPT" wird "chatgépété". In einem französischen Fußballvideo habe ich einmal achtundneunzig solcher Fälle in einem einzigen Transkript gezählt.

Untertitel mit verstümmelten Namen wirken schludrig, und sie sind der sichtbarste Teil eines Clips. Also habe ich einen Korrekturdurchlauf eingebaut: Nach der Transkription geht der Text an ein kleines Sprachmodell mit einer Anweisung, nämlich Eigennamen zu finden, die phonetisch geschrieben wurden, und die Schreibweise zu korrigieren. Das kostet etwa einen Cent pro Video. Es hat die achtundneunzig Fälle korrigiert.

Was tatsächlich ausgeliefert wurde

Letzte Woche hat ein Nutzer ein französisches Video über große Sprachmodelle geclippt. Der Sprecher bezog sich immer wieder auf ein Modell namens JEV. Whisper hörte das und schrieb "Jev", was nah genug dran ist, dass niemand mit der Wimper gezuckt hätte.

Die Clips kamen mit den Titeln "Warum Jamba überbewertet ist" und "Jamba: Revolution und überbewertet zugleich" heraus. In den Untertiteln stand Jamba. In den Beschreibungen stand Jamba.

Jamba ist ein echtes großes Sprachmodell, gebaut von AI21. Es ist nur schlicht nicht das aus dem Video.

Ich habe nachgesehen, was die Pipeline gespeichert hatte. Im archivierten Transkript stand zweimal "Jev" und null Mal "Jamba". In jeder Stufe danach stand "Jamba" und nie "Jev": in den bewerteten Kandidaten, in den Clip-Metadaten, im Clip-Pool, insgesamt vierundzwanzig Vorkommen. Die Transkription war richtig gewesen. Das, was ich hinzugefügt hatte, um sie zu schützen, hatte sie kaputt gemacht.

Warum das Modell das getan hat

Es hat genau das getan, was ein hilfsbereiter Assistent tut. Im Video geht es um Sprachmodelle. "Jev" ist kein Modell, das es kennt. "Jamba" ist ein Modell, das es kennt, und die beiden liegen nicht weit auseinander, wenn man die Augen zusammenkneift. Im Kontext sieht es wie eine Korrektur aus, das eine durch das andere zu ersetzen, und nicht wie eine Erfindung.

Das ist der Fehlermodus, vor dem einen bei dieser Art Aufgabe niemand warnt. Eine Rechtschreibprüfung, die ein Wort nicht kennt, lässt es in Ruhe. Ein Sprachmodell, das ein Wort nicht kennt, greift zum nächstgelegenen Wort, das es doch kennt, und je mehr Fachwissen es hat, desto selbstbewusster und desto falscher wird dieser Griff. Mein Korrektor war bei seltenen Namen gerade deshalb schlechter, weil er bei häufigen gut war.

Der Teil, der wehtat

Ich hatte daran bereits gedacht. Im Prompt stand, in Großbuchstaben:

Korrigiere NUR Schreibweise und Groß-/Kleinschreibung. Ersetze NIEMALS einen Namen durch einen ANDEREN Namen. Einen plausiblen, aber falschen Namen zu erfinden ist SCHLIMMER, als einen ungewöhnlichen unverändert zu lassen. […] Rate NICHT aus dem Kontext einen bekannteren Namen.

Drei Sätze, eindeutig, genau dafür geschrieben, das zu verhindern, was passiert ist. Das Modell hat sie gelesen und das Produkt trotzdem umbenannt.

Ich glaube nicht, dass der Prompt schlecht formuliert war, und ich glaube inzwischen auch nicht mehr, dass ein besserer geholfen hätte. Ein Modell zu bitten, das nicht zu tun, wozu es neigt, ist eine Bitte, keine Einschränkung. Sie hält meistens, und das ist schlimmer, als wenn sie nie hielte, weil man aufhört nachzusehen.

Was ich stattdessen gemacht habe

Die Regel ist aus dem Prompt in den Code gewandert. Das Modell schlägt weiterhin Korrekturen vor; eine Funktion entscheidet jetzt, ob jede einzelne eine Schreibkorrektur oder eine Umbenennung ist, und verwirft die Umbenennungen stillschweigend.

Der Test ist bewusst grob: Groß-/Kleinschreibung und Akzente aus beiden Strings entfernen, dann messen, wie viel vom Original in der Ersetzung überlebt. Über 0.6 ist es derselbe Name, anders geschrieben. Darunter ist es ein anderer Name.

Jede Korrektur in meinem Testset überlebt. Einige berechtigte Korrekturen werden das nicht: Die fünfte Zeile ist ein echter Fall. Ein französischer Sprecher, der "Nguyen" sagt, wird als "nouillène" gehört, die beiden Strings haben fast nichts gemeinsam, sobald man die Akzente entfernt, und die Absicherung wirft diese Korrektur jetzt weg. Dasselbe wird romanisierten japanischen Namen passieren und Akronymen, die in einer anderen Sprache Buchstabe für Buchstabe ausgesprochen werden.

Das ist die Seite, für die ich mich entschieden habe. Ein seltsamer Name, den man stehen lässt, ist sichtbar, und ein Leser kann sich zusammenreimen, was gemeint war. Ein falscher Name ist nicht sichtbar, und niemand kann das. Ablehnungen werden mit beiden Strings geloggt, denn eine Ablehnung bedeutet, dass das Modell gerade versucht hat, etwas umzubenennen, und das lohnt sich zu sehen.

Die Lehren

Eine Regel, die ein Modell ignorieren kann, ist keine Regel. Wenn eine Einschränkung wichtig ist, gehört sie in Code, der nach dem Modell läuft, und nicht in einen Absatz, den das Modell liest. Prompts drücken Absicht aus. Sie setzen sie nicht durch.

Achte auf die Richtung einer Korrektur, nicht nur darauf, dass es eine gab. Ich hatte Metriken für diesen Durchlauf: wie viele Korrekturen er pro Video vornahm. Achtundneunzig sah nach einer gesunden Zahl aus. Nichts hat gemessen, ob eine Korrektur den Text näher an die Wahrheit brachte oder weiter davon weg, und eine schlechte Korrektur ist von einer guten nicht zu unterscheiden, wenn man nur die Summe zählt.

Eine Pipeline, die den Input speichert und den Output ausliefert, kann dich zweimal anlügen. Im archivierten Transkript stand "Jev", während in jedem ausgelieferten Clip "Jamba" stand. Hätte ich nur das Archiv gelesen, wäre ich zu dem Schluss gekommen, dass die Pipeline in Ordnung ist. Die Prüfung, auf die es ankommt, ist die von dem, was das Haus verlassen hat.

Selbstbewusstsein ist Teil des Fehlers. Ein Korrektor, der einen unbekannten Namen in Ruhe lässt, erzeugt eine sichtbare, harmlose Merkwürdigkeit. Einer, der ihn ersetzt, erzeugt sauberen, flüssigen, falschen Text, den niemand hinterfragt, ich eingeschlossen, bis die Person, die das Video gemacht hat, ihre eigenen Untertitel liest.

Die Absicherung ging noch am selben Tag live. Wenn du ein Video über etwas Obskures clippst und Katto einen ungewöhnlichen Namen genau so stehen lässt, wie es ihn gehört hat, ist das jetzt Absicht.

Ähnliche Artikel

Bereit, deine Videos in virale Clips zu verwandeln?

Katto schneidet, untertitelt und rahmt deine langen Videos automatisch zu Kurzform-Content um.

Katto kostenlos testen →