有人说,现在 AI 自动翻译字幕的工具已经很多了,你这个有什么特别的?
确实,市面上针对在线视频翻译的工具不少,我自己也用过很多。但总觉得要么翻译得不够准,要么质量不行,有时候还冒出一堆错误。
再加上我经常在推特和视频号上搬运海外视频,于是干脆自己搭了这套工具——实际上,它能帮我把海外视频搬运到国内平台,嘿嘿。
这套工具我自己用了半年,反复调整了很多次,现在算比较成熟了。我稍微整理了一下,开源出来给大家用。

装好之后,你只需要说一句话:「把这个链接翻译成带中文字幕的视频」,后面的事情它全自动搞定:下载、听写、翻译、润色、压制字幕、生成文稿——一条龙全包了。
听写完全在本地电脑上跑,零 API 费用。翻译用的是你装好的 AI。而且不光是英文,日文、韩文、法文等外语视频,都能转成中文字幕。
本质上就是几个脚本加一个说明文档。它不绑定 Claude Code——OpenClaw、Gemini、Codex 都能用,区别只是每个工具装「技能」的方式不同。
下面我会一步一步教你装好,然后跑通第一个视频。
这东西到底能干什么?
你给它一个视频链接(YouTube、B站、抖音都行)或者一个本地视频文件,它就能一口气完成下面五步:
下载 → 听写 → 翻译 → 润色 → 压制字幕
……最后再输出一份文稿。

具体来说就是:
- 下载视频(或者直接用本地文件)。
- 提取音频,用 Whisper 听写出原始字幕,带精确时间戳。
- 把原文翻译成中文,再润色成符合中文观看习惯的字幕。
- 把字幕压制到视频里,输出带中文字幕的视频。
- 同时生成一份 Markdown 文稿,方便归档或改成文章。
什么语言都行。 英文、日文、韩文、法文、西班牙文——只要 Whisper 能听懂,就能转成中文字幕。它会自动识别源语言并翻译。如果是中文视频,就只做听写和生成文稿,跳过翻译步骤。
字幕有两种。一种是纯中文,画面干净。另一种是中英双语,中文大字、英文小字,适合想练听力的人。
你不需要记任何命令。直接说大白话:「我要双语字幕」「不要水印」「用快速模式」——它全能听懂。
简单说,它把一条原来需要四五款软件、花一两个小时才能跑完的流程,压缩成了一句话。
和现有工具有什么不一样?
市面上的字幕工具很多。我比较在意三点,这套工具就是专门针对这三点做的。
第一:本地、免费、离线。 听写用的 OpenAI 开源的 Whisper 模型。在 Apple Silicon 的 Mac 上,会自动用 GPU 加速。整个听写过程都在你电脑上完成——不上传、不收费。翻译复用的是你已经装好的 AI,不需要另外接翻译 API。
第二:时间戳精确。 很多工具的字幕要么比说话快一拍,要么断句生硬。这套工具的时间戳精确到每个词说出的那一刻,按「句子 + 换气停顿」来切分,字幕切换刚好在说话人把一句话说完的时候。
第三:字幕是给人看的,不是纯机翻。 它会自动纠正听错的人名(Claude 常被听成 Cloud,MCP 听成 NCP),按语义断句,每行不超过十二个汉字,技术术语保留英文。双语模式下中文大字、英文小字,主次分明,而不是两行一样大的字叠在一起。
这些细节是我跑了上百个视频反复修改出来的,都固化到了规则里。
效果什么样
拿 a16z 最近发的一篇采访来试试,受访者是 OpenAI 前 CTO Mira Murati。我让工具给双语字幕。
她原话里有一段比喻:
It's more like a tandem bike where both people are pedaling.
机器翻译可能会给出很生硬的直译。这套工具翻译成:「更像是一辆双人自行车,两个人都在一起踩。」
自然、通顺。专有名词也处理得好,像 "Thinking Machines" 这类公司名保留英文,不硬翻。

你只需要发「链接 + 翻译这个视频」,它会先问你要纯中文还是双语——我通常做中文翻译,所以默认留了这两个选项,不过它其实可以翻译成任何一种语言。

除了字幕视频,还会生成一份文稿,左右对照,上边原文、下边中文。

整段读起来是这样的:
更像是构建一个系统,它不会自顾自地跑在前面、把文明抛在身后,而是像一辆双人自行车,两个人都在一起踩。上坡时也许力气大的人踩得更多,但两个人的手都握在车把上。
最实用的是它不限语言。同一篇采访,可以翻成中文、日文、韩文、阿拉伯文、法文的双语字幕——翻译在上,英文在下,主次分明。甚至从右往左写的阿拉伯文也排得整整齐齐:

十分钟的视频没问题,一个半小时以上的长视频也轻松hold住。
其实是三个技能
你打开仓库目录,会看到三个文件夹,每个管理一块工作。它们可以单独用,也可以串起来:
- xiaohu-video-md:总指挥。负责下载、听写、调翻译、压制字幕、输出文稿。
- xiaohu-subtitle-polish:专门做字幕翻译和润色。负责纠正错词、翻译、断句、对齐时间、双语排版。
- xiaohu-video-download:纯下载工具。下载视频、音频或整个播放列表,也可以给本地视频压制字幕。

翻译视频时,xiaohu-video-md 是编排者,它在翻译环节调用 xiaohu-subtitle-polish。你不需要管这些,知道有这三部分就行。
一步步教你装
这套工具目前对 Mac 优化得最好,Apple Silicon 跑得最顺。装有两种方式:想省事,直接把下面这段话丢给你的 AI;想知道发生了什么或者怕出错,就按手动步骤来。
懒人版:把这段丢给你的 AI
打开你的 AI 编程工具(Claude Code、Codex、OpenClaw),把下面这段话原封不动复制进去。它会自动判断系统、安装依赖、克隆仓库、运行安装脚本,需要你确认的时候会问你:
帮我安装这个视频翻译工具: https://github.com/xiaohuailabs/xiaohu-video-translate 按这个顺序来: 1. 检查我的系统:Mac 还是 Windows;如果是 Mac,判断是不是 Apple Silicon(M 系列)。 2. 安装依赖:yt-dlp、ffmpeg、whisper-cpp(Mac 用 brew install,Windows 用 WSL 或 winget)。 听写引擎:Apple Silicon 装 mlx-whisper,其他装 faster-whisper。 3. git clone 这个仓库,进目录后运行 bash install.sh,把三个技能装到我的技能目录里。 4. 装完后,找到 xiaohu-video-md 这个技能里的 config.json(Claude Code 在 ~/.claude/skills/ 下)。问我成品想存哪里,帮我把 output_dir 改成完整路径。 5. 最后检查一遍所有依赖是否装好了,告诉我能不能开始用。
每步简单说明你在做什么;如果某项依赖装失败,停下来问我,不要继续往下跑。
它本质上帮你完成了下面三步。想自己动手或者排查问题,就看手动版。
第一步:装基础工具
先确保你已经装了 Homebrew。然后执行这条命令安装三个工具:
brew install yt-dlp ffmpeg whisper-cpp
接下来装一个听写引擎。Apple Silicon 的 Mac 用这个,可以开启 GPU 加速(--break-system-packages 这个参数只是绕开新版系统的一个限制,不会损坏你的系统):
pip3 install --break-system-packages mlx-whisper
如果不是 Apple Silicon,用通用版:
pip3 install --break-system-packages faster-whisper

第二步:把技能装到 Claude 里
克隆仓库并运行安装脚本:
git clone https://github.com/xiaohuailabs/xiaohu-video-translate.git cd xiaohu-video-translate bash install.sh
这个脚本会把三个技能复制到 Claude 的技能目录,生成配置文件,检查依赖。如果每一项都显示 [OK],就装好了。如果某几项显示 [Missing],按提示处理就好。(这里路径以 Claude Code 为例,其他工具改一下目录即可。)

第三步:告诉它成品存哪里
打开 ~/.claude/skills/xiaohu-video-md/config.json,把 output_dir 改成你想要的文件夹路径(比如 /Users/你的名字/Documents/视频翻译)。
临时文件放 tmp/,文稿放 data/,成品视频默认放你的下载文件夹。
你不用手动下载听写模型。第一次运行时,
mlx-whisper会自动下载(约 1.5GB),之后会复用。
做完之后重启你的 AI 工具,就可以用了。

Windows 用户看这里
上面讲的是 Mac。Windows 也能跑,但有几个地方不一样:
最省事的办法是装 WSL(Windows Subsystem for Linux)。装好之后,把下面这些装上,脚本就能直接跑:
sudo apt install ffmpeg pip3 install yt-dlp faster-whisper
如果不想用 WSL:
- 听写引擎用 faster-whisper。
- 用 Git Bash 来运行安装脚本,或者手动复制文件夹。
- 改字幕字体。默认是 Mac 的苹方。需要换成 Microsoft YaHei,否则字幕会显示成方框。

怎么用
装好之后,就是一句话的事。你可以这么说:
- 「把这个链接翻译成带中文字幕的视频 + [链接]」
- 「翻译这个视频,我要双语字幕 + [链接]」
- 「把这个视频转成文字 + [链接]」(仅生成 Markdown 文稿)
- 「给这个本地视频加中文字幕 + [路径]」
- 「下载这个视频 + [链接]」
- 「用快速模式听写」
- 「翻译时不要水印」
几个容易踩的坑
YouTube 偶尔下载失败(403 错误)。 YouTube 的风控变严了。脚本会尝试从你的浏览器读取 cookie 重试。如果还不行,就用代理。
字幕显示为方框。 这是字体索引问题。确认你用的字体系统里存在(Mac 上苹方没问题)。
抖音需要一次性登录。 运行 douyin_login.py 脚本扫码即可。这个登录信息只保留在你电脑上。
拿去用吧
仓库地址:
github.com/xiaohuailabs/xiaohu-video-translate
代码是 MIT 协议的。水印、样式、字号随便改。只提醒一句:别把你的配置文件或抖音登录信息传到公开仓库。
这是一套我每天都在用的工具,不是玩具。觉得好用就给个 star。有问题就提 issue。
下回我开源配图技能——用一个人物 IP 形象来给文章配图,就像这篇文章里这样。





