步骤 01
准备本地模型
进入“字幕提取”后查看“本地识别模型”。首次使用点“下载模型”;下载可取消、继续,已有缓存会自动共用。
步骤 01
进入“字幕提取”后查看“本地识别模型”。首次使用点“下载模型”;下载可取消、继续,已有缓存会自动共用。
步骤 02
拖入文件、文件夹,或点“选择文件 / 选择文件夹”。文件夹可递归扫描;页面会说明不支持类型、重复项、空文件夹和 200 个上限。
步骤 03
语言可选自动检测、中文、英语、日语或韩语;输出可选 SRT、TXT 或两种。SRT 含时间轴,TXT 只保留文字。
步骤 04
在“保存到”选择已有且可写的目录。输出按每个输入素材分别新建文件,不覆盖原素材或已有结果;同名时自动追加编号,如 (2)、(3)。
步骤 05
点“开始提取字幕”,逐项查看等待、识别、完成或失败状态。需要停止时点“取消任务”,已完成结果会保留。
步骤 06
在完成项旁打开 SRT 或 TXT,重点检查同音字、专有名词、断句和字幕时间点,再用于剪辑或发布。
不能。本工具只识别视频或音频中的声音,不做 OCR;没有音轨的素材无法还原画面文字。
视频支持 MP4、MOV、MKV、AVI、WEBM、M4V;音频支持 MP3、WAV、M4A、AAC、FLAC、OGG、OPUS。也可导入文件夹并递归扫描,单次最多加入 200 个符合类型的文件。
语音识别在本机运行,需要约 57 MiB 的模型。下载可取消、继续;已有视频处理或 AI 剪辑缓存时会直接共用。
模型已完整缓存后,本地识别不上传素材。重新下载、更新模型或缓存缺失时仍需要网络。
SRT 包含字幕序号和时间轴,适合导入剪辑软件;TXT 只保存识别文字,适合阅读和整理。
口音、噪声、多人重叠、背景音乐、专有名词和音量过低都会影响结果。请校对文字和时间点,必要时先处理音频。
任务会停止,未完成临时文件会清理;已经成功生成的 SRT 或 TXT 会保留在保存目录。
不会。保存目录已有同名 SRT 或 TXT 时,新结果会自动追加编号,如 (2)、(3)。
macOS 14 或更新版本(Apple 芯片),以及 Windows 10 1903(build 18362)或更新的 64 位系统。
不需要。该工具免费、本地处理,不登录,也不会扣积分。
请记录系统版本、素材类型、操作步骤和完整报错,发邮件至 support@laohuangniu.net;请勿发送账号密码或私密素材。