让你的片段说一门你不会的语言
一个做好的片段可以配成 19 种语言,不必重录,也不占用你的月度视频额度。不过「AI 配音」这个说法下卖的是四种不同的东西,彼此并不能互相替代。先看对比,你就能判断这是不是你想要的那一种。
四种方案并排比较
每一行都是真实存在的产品类别,各有真实的代价。其中两种我们不提供,而这些理由对你的价值高于功能本身。
| 方案 | 你得到什么 | 代价 | Katto |
|---|---|---|---|
| 翻译字幕 | 目标语言的文字 | 观众听到的仍是自己不懂的语言。对静音也成立的片段够用,对靠表达撑起来的内容则偏弱。 | 同时提供 |
| 合成语音配音 | 目标语言的一条新语音轨 | 声音不是说话人本人的。听起来自然,但熟悉原版的观众会察觉换了个人。 | Katto 采用的方式 |
| 声音克隆 | 说话人本人的声音,换一门语言 | 要正当使用需本人同意,而同样的能力也能造出足以乱真的冒充。风险不在技术,而在第三方拿它去做什么。 | 刻意不提供 |
| 口型同步配音 | 按新音频重新生成嘴部 | 分量最重,而且只要不是干净的正面镜头就会崩。在剪辑过的播客素材里,这种情况占多数。 | 未提供 |
难的是时钟,不是嗓音
调用语音合成 API 是容易的那一半。难点在于翻译会改变长度:同一句话在不同语言里常常相差三分之一,而忽略这一点的配音会每说一句就多偏一点,最后说话人开始回答一个还没被问到的问题。
因此原始节奏被当作数据,而不是可以覆盖的东西。每一句以说出时的时长作为约束去翻译,单独合成,再放回它原来的位置,拉伸幅度限制在听起来仍像人声的范围内。字幕也按同一个时钟生成,所以文字与新音频不会分家。
它会花你什么
配音不动你的月度视频额度,因为那个额度数的是你拿来做片段的源视频,而配音是对已经做好的片段所做的工作。它有自己的上限:每滚动 30 天 20 次,每次请求最多 3 种语言,最早的会随时间退出计数。剩余次数由编辑器在你选择之前显示,而不是之后。
设上限是因为语音合成是整条流程里唯一成本随使用量而不是随视频时长增长的环节。与其卖一个事后被悄悄收紧的无限承诺,我们宁愿给出一个数字。
我们不会发布的那一个
声音克隆是所有人都在要的功能,也是这一页写成这个样子的原因。从一个片段复刻某人的声音,和让那个人说出他没说过的话,是同一种能力;公开提供它,就是把它交给我们无法核实意图的人。如果有一天它出现,也会以证明这把嗓音属于申请人为前提。在那之前,配音使用合成语音,并且不假装是任何人。
常见问题
19 种。底层引擎能说的远不止这些,但要等到逐语言核过质量之后才会放开选择范围。公布一个没核过的数字,是把一项功能变成客服队列的捷径。
不会。额度数的是你拿来做片段的源视频。配音有自己的上限:每滚动 30 天 20 次,一次最多 3 种语言。最早的会随时间退出计数。
因为语音合成是唯一成本随使用量而不是随视频时长增长的环节。上限是这条约束的诚实版本。另一种做法是一个会悄悄变差的无限承诺。
这才是真正的工程难题,靠调用语音合成 API 解决不了。原始节奏作为数据保留,每一句按说出时的时长而不只是按意思翻译,单独合成后放回原位。字幕跟着同一个时钟,因此不会离开新音频。
技术是可行的。问题在于,一个能从片段复刻任何人声音的工具,同时也是让那个人说出他没说过的话的工具,而我们会把它交给陌生人。如果它出现,会以同意证明为前提,而不是作为一个开关。
可以。同一个操作在 REST API 和 MCP 工具中都提供,因此智能体无需浏览器即可为做好的片段配音。返回的是一个可轮询的任务,而不是阻塞调用。
触达不懂你语言的观众
配音是 Creator 功能。输入就是你已经做好的片段:无需重录,也不消耗额度。