牛老黄牛AI
功能价格教程博客下载
登录 / 控制台
功能价格教程博客下载
首页/博客/视频硬字幕怎么去掉

视频硬字幕怎么去掉:三种办法和它们的代价

2026-09-07约 11 分钟老黄牛

硬字幕是已经压进画面像素里的字,没有「删除」这个动作。能做的只有三件事:把它裁掉、把它盖住、把它那块画面重新算出来。三条路都走得通,但代价完全不一样——一条毁构图,一条一眼假,一条慢。这篇把三种办法的适用范围、失败情况和具体操作顺序讲清楚。

目录

  1. 先分清软字幕和硬字幕
  2. 办法一:裁掉字幕区域
  3. 办法二:盖色块或高斯模糊
  4. 办法三:AI 逐帧修复
  5. 什么素材修得好,什么修不好
  6. 一套稳的操作顺序:3 秒试片再跑全量
  7. 三种办法怎么选

先分清软字幕和硬字幕

很多人一上来就去找「去字幕软件」,其实第一步是分清手上这条视频的字幕属于哪一种,分错了后面全是白折腾。

软字幕是一条独立的字幕轨,跟画面分开存放(mkv 里最常见,mp4 也能带)。这种字幕在播放器里能直接关掉,用 ffmpeg 一条命令就能剥干净——ffmpeg 是一个免费的命令行视频处理工具,很多剪辑软件底层用的都是它。软字幕根本不需要「修」,把字幕轨去掉重新封装就完事了。

硬字幕是发布的时候就渲染进画面的,字已经变成了画面上的一片像素,跟背景焊死在一起。你从网上下载回来的、录屏录下来的、别人导出的成片,基本都是硬字幕。这种情况下没有任何工具能把字「拿掉」,只能想办法让那块地方看起来不像有过字。

怎么判断?两个办法,半分钟能做完:

  • 用播放器(VLC、PotPlayer 这类都行)打开视频,看菜单里有没有「字幕轨」可以切换或关闭。能关掉的就是软字幕。
  • 随手截一张图,把截图丢进任何看图软件放大。字还留在图上,就是硬的。

提示:从短视频平台下载回来的视频,字幕几乎一定是硬的。平台在转码的时候就把字幕压进了画面,没有单独的字幕轨可关。所以「下载别人的视频改改再发」这条路,第一关就是硬字幕。

办法一:裁掉字幕区域

最直接的思路:字幕在画面下沿,那就把下沿切掉。任何剪辑软件都能做,一分钟的事,画质零损失,也不用等模型算。这是三条路里最被低估的一条。

代价是画幅变了。举个具体的例子:一条 1080×1920 的竖版视频,底部字幕连同安全边距占掉 200 像素,裁完剩 1080×1720。这个比例不是标准竖屏,直接发出去平台要么给你上下补黑边,要么自动裁切。想保持 9:16,就得把画面重新放大回 1080×1920——等于整幅画面放大 11.6%,四周各切掉一圈。

放大之后会连着出三个问题:

  • 人物头顶、下巴被切掉,原来舒服的构图变得局促。人像近景尤其明显。
  • 原本在画面边缘的东西被推出画外,或者被推到更显眼的位置。角标、进度条、水印这些平时不碍事的元素,放大之后就碍事了。
  • 清晰度掉一档。1080p 放大 11.6% 还能看,720p 的素材再裁再放大就开始糊了。

什么时候值得裁:字幕在纯背景的边缘、主体牢牢待在画面中间、这条素材是拿去做混剪的片段而不是要单独发布的成片。混剪片段本来就要重新排版、重新加字,画幅变一点根本无所谓,而且裁剪是零风险的——不会出现任何「修得不像」的问题。

什么时候别裁:字幕压在画面中部或者上方(裁下沿根本够不着);素材本身分辨率就低;或者这是一条要原样发出去的成片,构图不能动。

办法二:盖色块或高斯模糊

第二条路是遮:拉一个矩形,填纯色,或者对那块区域做高斯模糊,直接盖在字幕上。剪辑软件里都有现成的效果,同样是分钟级的活。

问题是那块区域会「死掉」,观众一眼就能看出来。原因有三条,一条比一条明显:

  • 背景在动,遮挡不动。镜头一推、人一走,画面里所有东西都在变,只有那个矩形纹丝不动。人眼对这种不一致特别敏感,比对模糊本身敏感得多。
  • 模糊块有硬边。高斯模糊出来的边缘是一条笔直的分界线,跟镜头景深造成的虚化完全不是一个质感。真实的虚化是渐变的、跟着物体轮廓走的,而模糊块是一个规整的长方形。
  • 字幕是断续的,遮挡是全程的。一句话说完,字幕消失一两秒,那块色块还在。只要有这么一两秒,观众就明白发生了什么。

有一种情况遮挡是真能用的:背景本来就是纯色。PPT 录屏、纯黑底的口播、纯白底的教学演示,字幕区域背后是一片没有任何信息的单色,拿同色矩形盖上去几乎看不出痕迹。除了这类素材,遮挡更适合做自己留着用的工作副本,不适合直接发布。

提示:半透明字幕底条特别坑。很多人以为盖住底条上的字就行,但底条本身是半透明的、边缘有渐变,你盖一个不透明的矩形上去,反而比原来的字还显眼。这种素材要么连底条一起处理,要么干脆裁掉。

办法三:AI 逐帧修复

第三条路是把字幕那块区域当成「画面缺了一块」,让模型根据周围的像素推断这块本来应该长什么样,然后一帧一帧补回去。这类模型叫图像修复模型,老黄牛的去字幕用的是 LaMa,模型跑在你自己的电脑上,视频不上传。

有一句话必须先说清楚:模型是在猜,不是在恢复。被字幕挡住的那块真实画面,在这条视频文件里根本不存在,任何工具都变不出来。模型能做的是让那块地方跟周围看起来连得上、不突兀。所以背景越简单、越有规律,猜得越像;背景越复杂,越容易露馅。这不是哪个软件做得好不好的问题,是这条路本身的边界。

它的代价是慢。逐帧推理,一秒 30 帧的视频就是 30 次运算,一分钟的片子要算一千八百次。Windows 上是 CPU 推理,macOS 14 及以上的 Apple 芯片可以用 CPU 或 MPS。另外还有一次性的准备成本:第一次使用要在软件里主动下载完整运行组件(Python / PyTorch / 模型),Windows 约 457 MiB、macOS 约 305 MiB,下载中途停了还能续传,装完缓存在本地,之后升级软件只要版本匹配就能接着复用。

好处也是实打实的:画幅一点不动,构图完全保留;音频原样保留,能直接封装就用原轨,不能就转成 AAC;而且能整个文件夹批量跑,一次最多 2000 个视频。素材全程不出本机,联网只用于登录和验证授权,手上素材敏感也不用担心。

提示:去字幕的运行环境要求比软件本身高一档——需要 macOS 14 以上的 Apple 芯片,或者 Windows 10 以上 64 位。另外软件里的「检测本机显卡」结果只影响视频编码环节,不代表模型推理能用上显卡,Windows 的运行组件是 CPU 推理。

什么素材修得好,什么修不好

这一节是全篇最有用的部分。同样是 AI 修复,素材不一样,结果能差出十条街。先看修得好的:

  • 纯色或浅纹理背景上的字:天空、墙面、桌面、虚化的室内背景。周围像素高度一致,模型几乎不会出错,修完基本看不出来。
  • 位置固定的底部字幕条:整条视频的字幕都在同一个位置、同样大小,一个框从头管到尾。
  • 字幕四周有干净余量:字的上下左右有一两行的空白,框可以贴着字画,不用往画面主体里侵占。

再看修不好的。这几种情况提前知道,能省掉一整天:

  • 字幕压在人脸、手、招牌文字、格子布这类高信息量区域。模型会在那儿编出一片糊掉的东西,比原来的字幕还刺眼。人脸尤其明显,人眼对脸的异常最敏感,脸上糊一块比留着字幕更劝退。
  • 半透明底条。底条覆盖的范围比文字大得多,框小了会在四周留下一圈明显的边,框大了整条画面下沿都要被重新编造,等于把三分之一的画面交给模型去猜。
  • 动态字幕。位置跟着画面跑的、逐字变色的卡拉 OK 式字幕、带弹跳动画的花字,一个固定框盖不住。要么把框拉得很大(面积超限、误伤画面),要么必然漏字。
  • 带粗描边和投影的字。只框住文字本身,描边和阴影会留在框外,形成一圈黑色的幽灵轮廓。框的时候要把描边和阴影一起包进去,这也是为什么框要比目测的字大一圈。
  • 背景在快速运动。每一帧是独立修复的,相邻两帧修出来的内容不完全一样,连起来播放就会看到那块区域在轻微地闪。固定机位几乎不闪,手持晃动或者快速推拉的镜头闪得明显。

一条经验:拿到一批素材,先挑最难的那一条来试。最难的能过,剩下的都能过;最难的过不了,就早点决定换素材,别把时间耗在一批本来就不适合的片子上。

一套稳的操作顺序:3 秒试片再跑全量

不管用哪个工具,顺序都比参数重要。下面这套是按老黄牛 去字幕的实际流程写的,换别的工具思路也一样。

  1. 先分批不同画幅、不同方向、字幕位置不同的视频,分开成几批处理。同一批里所有视频共用同一组相对位置的框,混在一起框必然错位。目录只扫描当前这一层、按文件名排序,视频藏在子文件夹里的先拿出来。
  2. 取一帧字幕最清楚的画面选入素材后拖预览时间轴,找一帧字幕完整、背景有代表性的画面来框。预览时间只影响你看到的画面,不影响后面处理的起点。
  3. 贴着字幕框,别贪大框要把文字连同描边和阴影一起包住,四周留一点点余量就够。最多 16 个区域,所有区域加起来不能超过画面面积的一半,重叠部分也重复计算。双语字幕上下两行,宁可框两个小框,也别拉一个大框把中间的画面一起吃掉。
  4. 跑 3 秒真实试片这一步是真的在处理,不是预览。它固定从每个视频的 0:00 开始处理最多 3 秒,跑完到任务列表里打开结果。如果这条视频开头三秒里根本没有字幕,试片什么也验证不了。先用视频分割从中间截一段有字幕的短片,拿短片当输入去试。
  5. 放大逐帧看试片把试片拖进播放器,放到 100% 甚至更大,一帧一帧拖过去看框的边缘。重点看三处:边缘有没有硬边、有没有残留的描边轮廓、连续播放时那块区域闪不闪。
  6. 确认后跑全量试片过关再提交完整任务。任务列表能看到每个视频的进度和单独的报错,中途可以停,停掉之前已经完成的文件会保留。

提示:每次提交都会在你选的保存目录下面新建一个 job- 开头带时间戳的子目录,不会覆盖源文件,也不会覆盖上一次的结果。完整文件叫「原文件名_去字幕.mp4」,试片叫「原文件名_试处理.mp4」,重名会自动加数字后缀。

三种办法怎么选

把三条路摊在一起看,选起来就不纠结了。

办法画幅像不像原生速度适合不适合
裁掉字幕区域变小,通常要重新放大完全自然分钟级字幕在边缘、拿去做混剪的素材片要原样发布的成片、低分辨率素材
盖色块或模糊不变一眼看得出分钟级纯色背景的录屏、自己留存的工作副本任何要发布的实拍画面
AI 逐帧修复不变背景简单时看不出,复杂时有痕迹逐帧计算,看时长和框选面积位置固定的字幕、背景干净的成片字幕压人脸、半透明底条、动态花字

选法其实很简单,对着素材问一句就行:

  • 素材是拿去做混剪的片段 → 裁。快,而且反正要重新排版。
  • 素材要原样发布、背景又干净 → 修。多花点时间,换一条构图完整的片子值得。
  • 背景是纯色录屏 → 遮。同色矩形一盖,比什么都省事。
  • 字幕压在人脸上,或者是满屏乱跑的动态花字 → 三条路都不理想,老实换素材,或者重新去找无字幕的源片。这不是工具的问题,是这条素材本身不适合。

费用上,裁和遮通常用剪辑软件自带的功能。AI 修复这条路,老黄牛去字幕的当前套餐见价格页和软件内订单页,本地处理不按处理次数扣积分。6 小时免费试用从服务端第一次成功核验该功能权益后开始计时,够你拿真实素材完整跑一遍再决定。

耗时可以自己估:3 秒试片跑了多久,用视频总秒数除以 3 再乘上去,大致就是全片要花的时间。框选面积越大、分辨率越高,越慢。一批素材开跑之前先这么算一下,心里有数,不至于挂着电脑等一晚上还没跑完。

硬字幕能不能一点痕迹都不留地去掉?

不能保证。被字幕挡住的那块画面在这条视频里本来就不存在,模型是根据周围像素推断出来的。背景是纯色或者浅纹理时基本看不出来,背景复杂或者在快速运动时,可能留下痕迹或者轻微闪烁。判断的办法是先跑 3 秒试片放大逐帧看,别直接跑全量。

去字幕的时候视频会上传到服务器吗?

老黄牛的去字幕在你自己的电脑上跑本地模型处理,视频不上传、不出本机,联网只用于登录和验证授权。首次使用需要联网下载一次运行组件,装好之后素材处理可以离线完成。

视频开头三秒没有字幕,试片看不出效果怎么办?

试片固定从每个视频的 0:00 开始处理最多 3 秒,目前不能自己选区间。办法是先用视频分割从中间截一段带字幕的短片,把这段短片当成新的输入去试,效果确认了再拿原片跑全量。

上下两行的双语字幕怎么框?

框两个独立的区域,一行一个,不要拉一个大框把两行中间的画面一起包进去。最多可以框 16 个区域,所有区域的总面积不能超过画面的一半,重叠的部分会重复计算面积。

处理完音频还在吗?画质会掉吗?

音频保留。输出是 MP4 / H.264,源音频能直接封装就原样保留,不能就转成 AAC,源片没有音频的输出也没有。画面会重新编码所以不是无损,但只有框选的那块区域是模型重画的,其余部分保持原样。另外软字幕轨和原文件的元数据不会保留。

接着看

  • 去字幕:框选区域,在本机逐帧把画面修回来
  • 怎么把视频按镜头自动拆成素材
  • 视频怎么分割:按份数、按时长、按大小三种切法
  • 混剪素材库怎么建才好用

拿自己的素材试 6 小时

去字幕的当前套餐见价格页,本地处理不按处理次数扣积分。先跑一遍 3 秒试片看效果,再决定值不值这个钱。

下载客户端 看去字幕功能页
牛老黄牛AI

内容创作者的批量干活工具。把重复的图文和视频工作,交给电脑。

软件

  • 全部功能
  • 下载客户端
  • 价格与开通

使用帮助

  • 使用教程
  • 常见问题
  • 博客
  • 进入控制台

关于

  • 关于我们
  • 联系我们
  • 隐私政策
  • 服务条款
© 2026 老黄牛AI · laohuangniu.net
浙ICP备16029135号-20