使用方式与适用边界
其实这件事早就有现成的答案:字幕已经把话切好了。SRT 字幕文件的结构就是一句话一条,每条自带起止时间码。一场三小时的口播直播,SRT 通常是六百到八百条。视频切片做的事情,就是把这份字幕当成目录:导入视频、导入同名的 SRT,点「加载到表格」,每一条字幕变成左侧表格里的一行,这一行携带起始时间、结束时间、时长、这句话的文案。界面顶部实时显示统计,比如「共 663 条、可用 636 条、已选 33 条、约 77.5 秒」——你选了多少、够不够一条视频的长度,一眼就知道。
找那句「这个面料摸起来很舒服」,不用再听了:在搜索框打「面料」,符合的行立刻筛出来。点一行,中间预览区就播这一句,画面对不对、声音有没有被切掉半个字、字幕和画面是不是同一段,三秒钟校对完。确认要,点一下勾选,它就出现在右侧的成片编排表里。左边负责「选什么」,右边负责「按什么顺序合成」,两张表职责分开,右边可以直接拖行调顺序、删掉某一行、清空重来。这里有个细节值得单说:鼠标拖出来的蓝色高亮,和真正打勾的勾选,是两套独立状态。高亮只是临时圈一片看看,不会进导出;要进导出得点「加入当前高亮」或者逐条勾。刚上手的人容易把这两个混起来,记住这一条能少踩很多坑。
批量的地方全都有批量版本。六百多条一条条看太慢,就先用整理筛选粗筛一遍:设关键词规则把「那么」「就是说」「家人们」这类口头禅所在的片段排除掉;设时长区间,比如只保留 1 秒到 5 秒的,太短的「嗯」「对」和拖沓的长段一次筛干净;间隔极短的相邻两句自动合并成一条,避免切出来的片段听着像被硬掐断;还能按目标时长把相邻片段合并,让每段都够长。粗筛后再逐条确认内容。要全要就点「全选可用」,挑反了就点「反选」。
字幕识别有错字也不用忍。双击文案列左侧就能改这一句;一个品牌名从头到尾都写错,用批量替换一次改完,改之前先用「查询出现数量」看看它出现了多少次心里有底,改坏了点「还原文案」回到原始内容。文案不只是显示用的——导出时可以直接用文案给文件命名,加上前缀序号 001、002,同名自动加后缀防覆盖,太长的自动截断,Windows 和 macOS 上不能用于文件名的特殊符号自动去掉。二十个文件手工重命名也是十几分钟的活,这里是勾几个选项的事。
真正拉开差距的是批量导出任务。软件能把所有片段导出成一份「序号 + 时长 + 文案」的纯文本,比如「1 2.3秒 今天这款衣服真的很适合通勤」,你把这份文本丢给任意一个 AI,让它按不同卖点排出 20 组不同的组合,AI 返回 20 行序号,每行一组。把这些序号导回软件,每一行就是一个独立的导出任务,点「批量导出任务」,20 条成片一次跑完。序号用英文逗号、中文逗号、顿号还是空格分隔都认;写了不存在的序号自动跳过,写了已经被排除的序号自动忽略,重复的组合合并处理——不会因为 AI 多打了一个标点就整个任务中断。同一批素材换个排列方式再出一版,是几分钟的事,不是重做一天。