YouMind
تسجيل الدخول

一句话翻译任意视频:开源我使用了半年的视频翻译工具

@xiaohu
الصينية08 يونيو 2026
203K
761
164
71
1.6K

ليرة تركية؛ د

这是一份关于开源视频翻译套件的综合指南,它利用 Whisper 和 AI 技术,通过简单的自然语言指令即可生成高质量、精校的字幕与转录文本。

有人说,现在 AI 自动翻译字幕的工具已经很多了,你这个有什么特别的?

确实,市面上针对在线视频翻译的工具不少,我自己也用过很多。但总觉得要么翻译得不够准,要么质量不行,有时候还冒出一堆错误。

再加上我经常在推特和视频号上搬运海外视频,于是干脆自己搭了这套工具——实际上,它能帮我把海外视频搬运到国内平台,嘿嘿。

这套工具我自己用了半年,反复调整了很多次,现在算比较成熟了。我稍微整理了一下,开源出来给大家用。

小互 - inline image

装好之后,你只需要说一句话:「把这个链接翻译成带中文字幕的视频」,后面的事情它全自动搞定:下载、听写、翻译、润色、压制字幕、生成文稿——一条龙全包了。

听写完全在本地电脑上跑,零 API 费用。翻译用的是你装好的 AI。而且不光是英文,日文、韩文、法文等外语视频,都能转成中文字幕。

本质上就是几个脚本加一个说明文档。它不绑定 Claude Code——OpenClaw、Gemini、Codex 都能用,区别只是每个工具装「技能」的方式不同。

下面我会一步一步教你装好,然后跑通第一个视频。

这东西到底能干什么?

你给它一个视频链接(YouTube、B站、抖音都行)或者一个本地视频文件,它就能一口气完成下面五步:

下载 → 听写 → 翻译 → 润色 → 压制字幕

……最后再输出一份文稿。

小互 - inline image

具体来说就是:

  • 下载视频(或者直接用本地文件)。
  • 提取音频,用 Whisper 听写出原始字幕,带精确时间戳。
  • 把原文翻译成中文,再润色成符合中文观看习惯的字幕。
  • 把字幕压制到视频里,输出带中文字幕的视频。
  • 同时生成一份 Markdown 文稿,方便归档或改成文章。

什么语言都行。 英文、日文、韩文、法文、西班牙文——只要 Whisper 能听懂,就能转成中文字幕。它会自动识别源语言并翻译。如果是中文视频,就只做听写和生成文稿,跳过翻译步骤。

字幕有两种。一种是纯中文,画面干净。另一种是中英双语,中文大字、英文小字,适合想练听力的人。

你不需要记任何命令。直接说大白话:「我要双语字幕」「不要水印」「用快速模式」——它全能听懂。

简单说,它把一条原来需要四五款软件、花一两个小时才能跑完的流程,压缩成了一句话。

和现有工具有什么不一样?

市面上的字幕工具很多。我比较在意三点,这套工具就是专门针对这三点做的。

第一:本地、免费、离线。 听写用的 OpenAI 开源的 Whisper 模型。在 Apple Silicon 的 Mac 上,会自动用 GPU 加速。整个听写过程都在你电脑上完成——不上传、不收费。翻译复用的是你已经装好的 AI,不需要另外接翻译 API。

第二:时间戳精确。 很多工具的字幕要么比说话快一拍,要么断句生硬。这套工具的时间戳精确到每个词说出的那一刻,按「句子 + 换气停顿」来切分,字幕切换刚好在说话人把一句话说完的时候。

第三:字幕是给人看的,不是纯机翻。 它会自动纠正听错的人名(Claude 常被听成 Cloud,MCP 听成 NCP),按语义断句,每行不超过十二个汉字,技术术语保留英文。双语模式下中文大字、英文小字,主次分明,而不是两行一样大的字叠在一起。

这些细节是我跑了上百个视频反复修改出来的,都固化到了规则里。

效果什么样

拿 a16z 最近发的一篇采访来试试,受访者是 OpenAI 前 CTO Mira Murati。我让工具给双语字幕。

她原话里有一段比喻:

It's more like a tandem bike where both people are pedaling.

机器翻译可能会给出很生硬的直译。这套工具翻译成:「更像是一辆双人自行车,两个人都在一起踩。」

自然、通顺。专有名词也处理得好,像 "Thinking Machines" 这类公司名保留英文,不硬翻。

小互 - inline image

你只需要发「链接 + 翻译这个视频」,它会先问你要纯中文还是双语——我通常做中文翻译,所以默认留了这两个选项,不过它其实可以翻译成任何一种语言。

小互 - inline image

除了字幕视频,还会生成一份文稿,左右对照,上边原文、下边中文。

小互 - inline image

整段读起来是这样的:

更像是构建一个系统,它不会自顾自地跑在前面、把文明抛在身后,而是像一辆双人自行车,两个人都在一起踩。上坡时也许力气大的人踩得更多,但两个人的手都握在车把上。

最实用的是它不限语言。同一篇采访,可以翻成中文、日文、韩文、阿拉伯文、法文的双语字幕——翻译在上,英文在下,主次分明。甚至从右往左写的阿拉伯文也排得整整齐齐:

小互 - inline image

十分钟的视频没问题,一个半小时以上的长视频也轻松hold住。

其实是三个技能

你打开仓库目录,会看到三个文件夹,每个管理一块工作。它们可以单独用,也可以串起来:

  • xiaohu-video-md:总指挥。负责下载、听写、调翻译、压制字幕、输出文稿。
  • xiaohu-subtitle-polish:专门做字幕翻译和润色。负责纠正错词、翻译、断句、对齐时间、双语排版。
  • xiaohu-video-download:纯下载工具。下载视频、音频或整个播放列表,也可以给本地视频压制字幕。
小互 - inline image

翻译视频时,xiaohu-video-md 是编排者,它在翻译环节调用 xiaohu-subtitle-polish。你不需要管这些,知道有这三部分就行。

一步步教你装

这套工具目前对 Mac 优化得最好,Apple Silicon 跑得最顺。装有两种方式:想省事,直接把下面这段话丢给你的 AI;想知道发生了什么或者怕出错,就按手动步骤来。

懒人版:把这段丢给你的 AI

打开你的 AI 编程工具(Claude Code、Codex、OpenClaw),把下面这段话原封不动复制进去。它会自动判断系统、安装依赖、克隆仓库、运行安装脚本,需要你确认的时候会问你:

帮我安装这个视频翻译工具: https://github.com/xiaohuailabs/xiaohu-video-translate 按这个顺序来: 1. 检查我的系统:Mac 还是 Windows;如果是 Mac,判断是不是 Apple Silicon(M 系列)。 2. 安装依赖:yt-dlp、ffmpeg、whisper-cpp(Mac 用 brew install,Windows 用 WSL 或 winget)。 听写引擎:Apple Silicon 装 mlx-whisper,其他装 faster-whisper。 3. git clone 这个仓库,进目录后运行 bash install.sh,把三个技能装到我的技能目录里。 4. 装完后,找到 xiaohu-video-md 这个技能里的 config.json(Claude Code 在 ~/.claude/skills/ 下)。问我成品想存哪里,帮我把 output_dir 改成完整路径。 5. 最后检查一遍所有依赖是否装好了,告诉我能不能开始用。

每步简单说明你在做什么;如果某项依赖装失败,停下来问我,不要继续往下跑。

它本质上帮你完成了下面三步。想自己动手或者排查问题,就看手动版。

第一步:装基础工具

先确保你已经装了 Homebrew。然后执行这条命令安装三个工具:

brew install yt-dlp ffmpeg whisper-cpp

接下来装一个听写引擎。Apple Silicon 的 Mac 用这个,可以开启 GPU 加速(--break-system-packages 这个参数只是绕开新版系统的一个限制,不会损坏你的系统):

pip3 install --break-system-packages mlx-whisper

如果不是 Apple Silicon,用通用版:

pip3 install --break-system-packages faster-whisper

小互 - inline image

第二步:把技能装到 Claude 里

克隆仓库并运行安装脚本:

git clone https://github.com/xiaohuailabs/xiaohu-video-translate.git cd xiaohu-video-translate bash install.sh

这个脚本会把三个技能复制到 Claude 的技能目录,生成配置文件,检查依赖。如果每一项都显示 [OK],就装好了。如果某几项显示 [Missing],按提示处理就好。(这里路径以 Claude Code 为例,其他工具改一下目录即可。)

小互 - inline image

第三步:告诉它成品存哪里

打开 ~/.claude/skills/xiaohu-video-md/config.json,把 output_dir 改成你想要的文件夹路径(比如 /Users/你的名字/Documents/视频翻译)。

临时文件放 tmp/,文稿放 data/,成品视频默认放你的下载文件夹。

你不用手动下载听写模型。第一次运行时,mlx-whisper 会自动下载(约 1.5GB),之后会复用。

做完之后重启你的 AI 工具,就可以用了。

小互 - inline image

Windows 用户看这里

上面讲的是 Mac。Windows 也能跑,但有几个地方不一样:

最省事的办法是装 WSL(Windows Subsystem for Linux)。装好之后,把下面这些装上,脚本就能直接跑:

sudo apt install ffmpeg pip3 install yt-dlp faster-whisper

如果不想用 WSL:

  • 听写引擎用 faster-whisper。
  • 用 Git Bash 来运行安装脚本,或者手动复制文件夹。
  • 改字幕字体。默认是 Mac 的苹方。需要换成 Microsoft YaHei,否则字幕会显示成方框。
小互 - inline image

怎么用

装好之后,就是一句话的事。你可以这么说:

  • 「把这个链接翻译成带中文字幕的视频 + [链接]」
  • 「翻译这个视频,我要双语字幕 + [链接]」
  • 「把这个视频转成文字 + [链接]」(仅生成 Markdown 文稿)
  • 「给这个本地视频加中文字幕 + [路径]」
  • 「下载这个视频 + [链接]」
  • 「用快速模式听写」
  • 「翻译时不要水印」

几个容易踩的坑

YouTube 偶尔下载失败(403 错误)。 YouTube 的风控变严了。脚本会尝试从你的浏览器读取 cookie 重试。如果还不行,就用代理。

字幕显示为方框。 这是字体索引问题。确认你用的字体系统里存在(Mac 上苹方没问题)。

抖音需要一次性登录。 运行 douyin_login.py 脚本扫码即可。这个登录信息只保留在你电脑上。

拿去用吧

仓库地址:

github.com/xiaohuailabs/xiaohu-video-translate

代码是 MIT 协议的。水印、样式、字号随便改。只提醒一句:别把你的配置文件或抖音登录信息传到公开仓库。

这是一套我每天都在用的工具,不是玩具。觉得好用就给个 star。有问题就提 issue。

下回我开源配图技能——用一个人物 IP 形象来给文章配图,就像这篇文章里这样。

ريمكس في YouMind

قم بتحويل مقال سريع الانتشار إلى سير عمل كامل المحتوى

قم بتجميع المصدر وفك تشفير النمط وإنشاء الأصول وصياغة القصة وتوزيعها من مساحة عمل واحدة تعمل بالذكاء الاصطناعي.

اكتشف YouMind
للمبدعين

حول Markdown إلى مقالة 𝕏 نظيفة

عندما تنشر كتاباتك الطويلة، فإن الصور والجداول وكتل التعليمات البرمجية تجعل تنسيق 𝕏 مؤلمًا. YouMind يحول مسودة Markdown كاملة إلى مقالة نظيفة وجاهزة للنشر 𝕏.

حاول Markdown إلى 𝕏

المزيد من الأنماط لفك التشفير

المقالات الفيروسية الأخيرة

استكشاف المزيد من المقالات الفيروسية