Chaque clip arrive avec une note, et avec sa raison
Un épisode de quatre-vingt-dix minutes contient peut-être huit moments qui méritent d'être publiés. Les trouver en faisant défiler la timeline, c'est précisément ce qui fait abandonner après le premier clip. Katto note chaque segment candidat de 0 à 100 sur quatre axes, pour que vous ouvriez une sélection classée au lieu d'une timeline.
Quatre axes, une note
Le maximum que chaque axe peut apporter est fixe, et les poids sont imprimés ici parce qu'ils sont tout l'argument. Hook et Flow pèsent soixante points à eux deux : un clip qui démarre mal ou qui part en digression ne se rattrape pas au vocabulaire.
Les trois premières secondes, et rien d'autre. Un mot interrogatif dans l'ouverture, un mot fort, un chiffre ou un pourcentage, et le fait de commencer sur une phrase entière. Un clip qui s'ouvre sur une formule de fin perd l'axe en entier.
La tenue du clip. Densité de parole mesurée par détection d'activité vocale, nombre de coupures de plan à l'intérieur du segment, et régularité de l'énergie sonore plutôt que des à-coups.
Densité de mots porteurs et de chiffres, plus l'autonomie : le segment commence-t-il sur un vrai mot plutôt qu'une conjonction, et se termine-t-il sur une phrase finie. Les passages saturés d'autopromotion sont pénalisés ici.
Le plus petit axe, volontairement. Une question, une statistique, un vocabulaire à forte charge, et des pics d'énergie sonore. Il infléchit le classement, il ne le décide jamais.
Ce qu'une note veut vraiment dire
Une note sur 100 invite à la lire comme un pourcentage, et cette lecture est fausse. La question utile est de savoir où un clip se situe par rapport aux autres. Sur l'ensemble des clips produits par Katto, la médiane tombe à 68. Environ un sur quatre atteint 80, environ un sur dix atteint 85. Un 76 est donc un bon clip qui bat à peu près deux tiers du terrain, et un 60 n'est pas un échec, il est simplement sous la moyenne.
Cela compte surtout quand une vidéo entière note bas. Cela dit en général quelque chose de vrai sur la source, un enregistrement trop calme ou une conversation sans vrai retournement, plutôt qu'une panne de l'outil.
Le même clip obtient toujours la même note
Rien dans le calcul ne demande son avis à un modèle de langage. Les entrées sont le transcript au mot, la carte d'activité vocale, les coupures de plan détectées et la forme d'onde audio, et l'arithmétique posée dessus est fixe. Même la phrase qui explique une note est assemblée à partir des quatre chiffres plutôt qu'écrite pour vous.
Ce choix nous coûte de la finesse. Un modèle saisirait qu'une blague fait mouche là où une liste de mots ne le peut pas. Ce qu'il achète, c'est un système avec lequel on peut discuter : quand un moment que vous vouliez n'est pas retenu, il y a un signal à désigner, et relancer la vidéo ne produit pas discrètement une autre réponse. Les modèles interviennent plus tard, pour écrire les titres et les descriptions des clips déjà sélectionnés.
Ce qui est écarté avant que vous le voyiez
Deux motifs notent bien et performent mal, donc les deux sont traités de front. L'ouverture d'une vidéo longue est énergique et a la forme d'une accroche, et c'est aussi là que vivent les lectures de sponsor et la promotion de chaîne : au-delà de deux minutes, un segment qui commence dans les 45 premières secondes porte une pénalité fixe. Les formules de fin fonctionnent en miroir : un segment dense en « abonnez-vous » perd des points sur Value et sur Trend, et un clip qui s'ouvre dessus perd son Hook entièrement.
Ce que la note ne prétend pas
Ce n'est pas une prédiction de vues, et tout outil qui affirme le contraire vous vend un chiffre qu'il ne peut pas assumer. L'audience dépend de votre public, de votre légende, de l'heure de publication et de ce que la plateforme favorise cette semaine-là, rien de tout cela n'étant visible dans votre fichier source. La note classe les candidats d'une même vidéo les uns par rapport aux autres, pour que vous partiez des trois meilleurs plutôt que des trois premiers. Le choix éditorial, celui du moment qui mérite le fil, reste le vôtre.
Questions
Non. Rien dans le chemin de notation n'appelle de modèle. Les quatre axes sont calculés à partir du transcript, de la carte d'activité vocale, des coupures de plan détectées et de la forme d'onde audio. Un modèle écrit ensuite le titre et la description, sur des clips déjà choisis.
Oui. Même source, mêmes chiffres. C'est tout l'intérêt d'un scorer déterministe : quand un clip attendu n'apparaît pas, la cause est un signal qu'on peut nommer, pas un modèle qui a répondu autrement aujourd'hui.
Le clip médian que nous produisons se situe à 68. Environ un clip sur quatre est à 80 ou au-dessus, un sur dix atteint 85. Un 60 n'est pas un mauvais clip, c'est un clip sous la médiane.
Non, et nous ne le prétendrons pas. Les vues dépendent de votre audience, de votre miniature, de votre heure de publication et de l'humeur de la plateforme ce jour-là. La note classe des candidats au sein d'une même vidéo. C'est un travail de tri, pas une prévision.
Oui. Les thèmes et une consigne personnalisée ajoutent un bonus de mots-clés aux segments correspondants, donc les moments demandés remontent dans le classement. C'est une simple correspondance de texte, sans coût ni latence supplémentaires.
Parce qu'elles notent bien pour la mauvaise raison. Une ouverture à froid est énergique et a la forme d'une accroche, et c'est aussi là que vivent les lectures de sponsor et les promos de chaîne. Au-delà de deux minutes, tout ce qui commence dans les 45 premières secondes porte une pénalité fixe.
Voyez les notes sur votre propre vidéo
Chaque clip affiche son total et ses quatre axes, pour que vous confrontiez le classement à votre propre jugement au lieu de le croire sur parole.