视频加字幕与配音:把拍好的素材做成能发的成片
素材拍好了发不出去,多半卡在两件事:没字幕没人看,不想露声又不会配。这两件事现在都能在半小时内解决。
先定一个前提:字幕不是「把语音转成文字」就完事。真正影响完播率的是断句——一行太长、一屏停留太短,观众直接划走。所以第 1 步和第 2 步是重点,别跳。
操作流程
先把口播稿定下来,别指望字幕
约 10 分钟无稿口播的转写结果里全是「嗯」「那个」「我们再」,清理它的时间远远超过提前写稿。而且稿子定下来,字幕和配音都有了基准。
同类备选:Kimi(月之暗面)光速写作
- 先把要说的话写成 300 字以内的短稿,读一遍计时——超过 90 秒就砍。
- 让 AI 把稿子改成口语版:书面语念出来一定别扭。
- 每句不超过 25 字,长句提前拆开,字幕才不会挤成一坨。
把下面这段文字改成适合口播的口语稿: 要求: 1. 每句话不超过 25 个字,长句拆短 2. 去掉书面语(如「因此」「综上所述」「基于此」),换成日常说法 3. 开头 3 秒必须有一个能留住人的点 4. 总字数控制在 300 字以内 【粘贴文字】
卡住了怎么办稿子改了几版还是不顺口,就别改了:照着原稿念一遍录下来自己听,哪句念着别扭就手动改哪句,改完再念。听感比文字上的「通顺」重要得多。
自动生成字幕,然后逐句校对
约 8 分钟语音转写第一遍的准确率大概 95%,剩下那 5% 集中在人名、专有名词和数字上——恰恰是最不能错的地方。
- 导入视频,用「识别字幕」自动生成,语言和方言选项别选错。
- 从头到尾念着检查一遍,重点盯专有名词、数字、专业术语。
- 检查断句:一行字幕不要超过 16 个字,超了就手动断行。
卡住了怎么办方言或口音太重,识别出来全是乱码:直接用第 1 步的稿子,让工具按「文本朗读/对齐」功能把稿子导成字幕轴,比改识别结果快得多。
挑配音:先决定要不要用你自己的声音
约 10 分钟自己的声音信任度最高;但口音重、气息不稳、不敢开口的人,用 AI 配音反而更稳。这一步只做选择,不做评判。
同类备选:ClipchampAdobe Podcast豆包 – 字节跳动 AI 助手
- 先试自己的原声——哪怕普通话不标准,真实感是 AI 给不了的。
- 确定用 AI:音色优先选「新闻/讲解」类,别选「情感/甜美」类,念说明文很出戏。
- 数字、英文缩写、多音字逐个试听,这三类是 TTS 最容易翻车的地方。
- 语速调慢 10%——后期可以加速,加不了减速。
卡住了怎么办AI 配音念你的专业词总是错,就在稿子里把那个词换成同音写法(比如把 SQL 写成「S-Q-L」),念对了再改回字幕。改稿比换工具有效。
常见坑
- 字幕只转不校,人名和数字错在最显眼的位置,专业度直接掉一档。
- 一屏字幕塞二十多个字,观众来不及读完就划走了,完播率就是这么丢的。
- 选了「甜美/情感」类音色念说明性内容,听起来像广告,可信度反而更低。
- 导出前没有静音看一遍——很多问题只在没声音的时候才暴露。
常见问题
自动加字幕的工具免费吗?
站内收录的剪辑工具基本都有免费额度,通常按导出次数或时长限制。日常发短视频,免费额度一般都够;如果一次要处理长课程视频,再考虑付费。
AI 配音听起来假,怎么改善?
三个调整最有效:一是语速降 10%,二是句与句之间留半秒停顿(AI 默认太密,没有呼吸感),三是在稿子里给数字和英文留出空格。音色本身反而是最后才需要考虑的。
字幕该放哪个位置?
竖屏平台(抖音、快手、视频号、小红书)字幕放中间偏下,别贴到最底部——那里会被评论区、账号信息挡住。横屏(课程、官网、公众号内嵌)放底部常规位置就好。
