评分

每个片段都带着一个数字,以及它的理由

一期九十分钟的节目里,值得发布的瞬间大概只有八个。靠拖时间轴去找,正是多数人做完第一个片段就放弃的原因。Katto 为每个候选区间按四个维度打 0 到 100 分,于是你打开的是一份排好序的候选清单,而不是一条时间轴。

四个维度,一个数字

每个维度的上限是固定的,把权重写在这里,是因为它本身就是全部论点。Hook 和 Flow 合计六十分:开头不行或者话讲散了的片段,靠用词救不回来。

Hook,0 到 30

只看前三秒。开头是否有疑问词、有冲击力的词、数字或百分比,以及是否从一个完整句子开始。以结尾客套话开场的片段,会整项失分。

Flow,0 到 30

片段是否立得住。用语音活动检测测得的说话密度、区间内落入多少个镜头切换,以及音频能量是保持稳定还是忽高忽低。

Value,0 到 25

实词与数字的密度,加上独立性:是以实词而不是连词开头,是否以完整句子收尾。塞满自我宣传的区间在这里扣分。

Trend,0 到 15

故意设成最小的一项。一个提问、一项数据、情绪强烈的词汇,以及音频能量的峰值。它会让排序倾斜,但从不决定排序。

分数真正的含义

百分制的数字容易被当成百分比来读,这种读法是错的。有用的问题是:这个片段相对其他片段处在什么位置。在 Katto 生成的全部片段中,中位数落在 68。大约每四个有一个达到 80,每十个有一个达到 85。因此 76 是一个不错的片段,胜过大约三分之二的同类;60 不是失败,只是低于中间水平。

这一点在整条视频分数都低时最能说明问题。那通常是在讲关于素材的实话,比如录音太平、对话没有明确转折,而不是工具出了故障。

同一个片段永远得到同一个分数

评分路径上没有任何一处去询问语言模型的意见。输入是逐词转写、语音活动图、检测到的镜头边界和音频波形,在此之上的运算是固定的。就连解释分数的那句话,也是由四个数字拼出来的,而不是为你写的。

这个选择让我们失去一些细腻。模型能察觉一个笑话落地了,词表做不到。它换来的是一个可以与之争论的系统:当你想要的瞬间没被选中时,有一个信号可以指认,而且重跑一遍不会悄悄给出另一个答案。模型在后面才登场,为已经选定的片段撰写标题和描述。

在你看到之前就被压下去的内容

有两种模式分数高而表现差,所以两种都被正面处理。长视频的开头有劲头、带着钩子的形状,同时也是口播广告和频道宣传所在的位置:超过两分钟的视频里,在前 45 秒开始的区间会承担一项固定扣分。结尾客套话则是镜像的:塞满「记得订阅」的区间在 Value 和 Trend 上失分,以此开场的片段则整项丢掉 Hook。

这个分数不声称的事

它不是播放量预测,任何声称如此的工具,卖给你的是一个它撑不住的数字。触达取决于你的受众、你的文案、你何时发布,以及平台那一周偏好什么,而这些都不在你的源文件里。这个分数是在一条视频内部把候选互相排序,让你从最强的三个开始,而不是从最前面的三个开始。哪个瞬间配得上信息流,这个编辑判断仍然是你的。

常见问题

分数是语言模型生成的吗?

不是。评分路径上没有任何一处调用模型。四个维度由转写、语音活动图、检测到的镜头边界和音频波形计算得出。模型在之后才写标题和描述,而且只针对已经选定的片段。

同一条视频每次都得到相同分数吗?

是的。相同素材,相同数字。让评分保持确定性的意义正在于此:当预期的片段没有出现时,原因是一个能说得出名字的信号,而不是今天回答得不一样的模型。

多少算是好分数?

我们产出的片段中位数是 68。大约每四个有一个在 80 或以上,每十个有一个达到 85。60 不是差片段,只是低于中位数的片段。

分数高就意味着有播放量吗?

不是,我们也不会这样讲。播放量取决于你的受众、缩略图、发布时间以及平台那天的偏好。分数是在一条视频内部排序候选。这是分拣工作,不是预测。

我能引导选择结果吗?

可以。主题和自定义提示会给匹配的区间加上关键词加分,于是你要求的瞬间在排序中上移。这是简单的文本匹配,不增加成本,也不增加等待。

为什么片头几乎从不胜出?

因为它们以错误的理由拿到高分。冷开场有劲头、带钩子的形状,而口播广告和频道宣传也在那里。超过两分钟的视频,凡是在前 45 秒开始的都会承担固定扣分。

在你自己的视频上看看分数

每个片段都会显示总分和四个维度,你可以拿它和自己的判断对照,而不是照单全收。