YouMind
ลงชื่อเข้าใช้

แปลวิดีโอได้ในประโยคเดียว: เปิดซอร์สโค้ดเครื่องมือแปลวิดีโอที่ผมใช้งานมานานกว่า 6 เดือน

@xiaohu
จีน08 มิ.ย. 2569
203K
761
164
71
1.6K

TL;DR

คู่มือฉบับสมบูรณ์สำหรับชุดเครื่องมือแปลวิดีโอแบบโอเพนซอร์สที่ใช้ Whisper และ AI ในการสร้างคำบรรยายและถอดความคุณภาพสูงผ่านคำสั่งภาษาธรรมชาติที่เรียบง่าย

บางคนบอกว่าตอนนี้มีเครื่องมือแปลซับไตเติลอัตโนมัติด้วย AI มากมายแล้ว แล้วเครื่องมือนี้จะแตกต่างตรงไหน?

จริงอยู่ว่ามีเครื่องมือมากมายสำหรับการแปลวิดีโอออนไลน์ และผมเองก็เคยใช้มาหลายตัว แต่ผมรู้สึกว่ามันไม่แม่นยำพอ หรือคุณภาพไม่ดี บางครั้งก็มีข้อผิดพลาดโผล่ขึ้นมาเป็นชุดๆ

นอกจากนี้ ผมแชร์วิดีโอจากต่างประเทศบน Twitter และ WeChat Channels บ่อยๆ เลยตัดสินใจสร้างชุดเครื่องมือนี้ขึ้นมา—จริงๆ แล้วมันช่วยคุณย้ายวิดีโอจากต่างประเทศมาแพลตฟอร์มในประเทศได้ด้วยนะ ฮ่าๆ

ผมใช้ชุดเครื่องมือนี้มาครึ่งปี ปรับหลายครั้ง ตอนนี้มันค่อนข้างสมบูรณ์แล้ว ผมทำความสะอาดแล้วเปิดเป็นโอเพนซอร์สให้ทุกคนใช้

小互 - inline image

เมื่อติดตั้งแล้ว คุณแค่พูดประโยคเดียว: "แปลลิงก์นี้เป็นวิดีโอที่มีซับไตเติลภาษาจีน" แล้วมันก็จัดการทุกอย่างโดยอัตโนมัติ: ดาวน์โหลด, ถอดเสียง, แปล, ปรับปรุง, เผาซับไตเติล, และสร้างบทถอดเสียง—ครบวงจรในที่เดียว

การถอดเสียงทำงานบนเครื่องคุณทั้งหมด ไม่มีค่าใช้จ่าย API การแปลใช้ AI ที่คุณติดตั้งไว้แล้ว และไม่ใช่แค่ภาษาอังกฤษเท่านั้น วิดีโอภาษาญี่ปุ่น เกาหลี ฝรั่งเศส และภาษาต่างประเทศอื่นๆ ก็แปลงเป็นซับไตเติลภาษาจีนได้ทั้งหมด

จริงๆ แล้วมันก็แค่สคริปต์ไม่กี่ตัวรวมกับคู่มือ ไม่ได้จำกัดเฉพาะ Claude Code—OpenClaw, Gemini, และ Codex ก็ใช้ได้ทั้งหมด ข้อแตกต่างคือแต่ละเครื่องมือติดตั้ง "สกิล" ต่างกันเท่านั้น

ด้านล่างนี้คือคำแนะนำทีละขั้นตอนในการติดตั้งและรันวิดีโอแรกของคุณ

เครื่องมือนี้ทำอะไรได้บ้าง?

ให้ลิงก์วิดีโอ (YouTube, Bilibili, Douyin ก็ได้) หรือไฟล์วิดีโอในเครื่อง แล้วมันจะทำห้าขั้นตอนนี้ในครั้งเดียว:

ดาวน์โหลด → ถอดเสียง → แปล → ปรับปรุง → เผาซับไตเติล

...และสุดท้ายก็ส่งออกบทถอดเสียง

小互 - inline image

แจกแจงรายละเอียด:

  • ดาวน์โหลดวิดีโอ (หรือใช้ไฟล์ในเครื่องโดยตรง)
  • แยกเสียงและใช้ Whisper ถอดเสียงเป็นซับไตเติลต้นฉบับพร้อมเวลาที่แม่นยำ
  • แปลข้อความต้นฉบับเป็นภาษาจีนและปรับปรุงเป็นซับไตเติลที่เหมาะกับพฤติกรรมการดูของคนจีน
  • เผาซับไตเติลลงในวิดีโอ ส่งออกเป็นวิดีโอที่มีซับไตเติลภาษาจีน
  • สร้างบทถอดเสียงรูปแบบ Markdown พร้อมกัน เพื่อเก็บถาวรหรือนำไปทำเป็นบทความ

ภาษาไม่ใช่ปัญหา อังกฤษ ญี่ปุ่น เกาหลี ฝรั่งเศส สเปน—ตราบใดที่ Whisper เข้าใจ ก็แปลงเป็นซับไตเติลภาษาจีนได้ โดยระบุภาษาต้นทางอัตโนมัติและทำการแปล สำหรับวิดีโอภาษาจีน จะถอดเสียงและสร้างบทถอดเสียงเท่านั้น ไม่ต้องผ่านขั้นตอนแปล

มีตัวเลือกซับไตเติลสองแบบ แบบหนึ่งคือภาษาจีนล้วนๆ หน้าจอสะอาดตา อีกแบบคือสองภาษา (จีน/อังกฤษ) โดยข้อความจีนตัวใหญ่ ข้อความอังกฤษตัวเล็ก เหมาะสำหรับคนที่อยากฝึกฟัง

คุณไม่ต้องจำคำสั่งใดๆ แค่ใช้ภาษาธรรมดา: "ฉันต้องการซับสองภาษา" "ไม่มีลายน้ำ" "ใช้โหมดเร็ว" — มันเข้าใจทั้งหมด

พูดง่ายๆ ก็คือ มันบีบอัดกระบวนการที่แต่ก่อนต้องใช้ซอฟต์แวร์สี่ห้าตัวและเวลาทำงานหนึ่งถึงสองชั่วโมงให้เหลือแค่ประโยคเดียว

ต่างจากเครื่องมือที่มีอยู่อย่างไร?

มีเครื่องมือซับไตเติลมากมายในตลาด ผมใส่ใจสามเรื่อง และเครื่องมือนี้ถูกสร้างมาเพื่อเรื่องเหล่านี้โดยเฉพาะ

แรก: ในเครื่อง ฟรี และออฟไลน์ การถอดเสียงใช้โมเดล Whisper โอเพนซอร์สของ OpenAI บน Mac Apple Silicon จะใช้ GPU เร่งความเร็วอัตโนมัติ กระบวนการถอดเสียงทั้งหมดเกิดขึ้นบนเครื่องคุณ—ไม่ต้องอัปโหลด ไม่มีค่าธรรมเนียม การแปลใช้ AI ที่คุณมีอยู่แล้ว ไม่ต้องใช้ API แปลแยกต่างหาก

สอง: เวลาที่แม่นยำ เครื่องมือหลายตัวมีซับที่ขึ้นก่อนผู้พูดหรือตัดประโยคไม่เหมาะสม เครื่องมือนี้ได้เวลาที่แม่นยำถึงเมื่อแต่ละคำถูกพูด และตัดตาม "ประโยค + หยุดหายใจ" ดังนั้นซับจะเปลี่ยนเมื่อผู้พูดจบความคิดพอดี

สาม: ซับสำหรับมนุษย์ ไม่ใช่แค่การแปลเครื่องดิบ มันแก้ไขชื่อเฉพาะที่ได้ยินผิดโดยอัตโนมัติ (Claude มักได้ยินเป็น "cloud", MCP เป็น "NCP"), แบ่งประโยคตามความหมาย, เก็บแต่ละบรรทัดไม่เกินสิบสองตัวอักษร, และคงคำศัพท์เทคนิคเป็นภาษาอังกฤษ ในโหมดสองภาษา ภาษาจีนตัวใหญ่ ภาษาอังกฤษตัวเล็ก แยกกันชัดเจน ไม่ใช่แค่สองบรรทัดขนาดเท่ากันซ้อนกัน

นี่คือรายละเอียดที่ผมปรับปรุงจากวิดีโอหลายร้อยเรื่อง ทั้งหมดรวมอยู่ในกฎ

ผลลัพธ์ที่ได้เป็นอย่างไร

ลองทดสอบกับสัมภาษณ์ล่าสุดที่ a16z โพสต์กับ Mira Murati อดีต CTO ของ OpenAI ผมขอให้เครื่องมือทำซับสองภาษา

ในคำพูดเดิมของเธอ มีอุปมาอุปไมย:

It's more like a tandem bike where both people are pedaling.

การแปลด้วยเครื่องอาจให้คำแปลตรงตัวที่ดูแข็งๆ เครื่องมือนี้แปลว่า: "มันเหมือนจักรยานสองคนมากกว่า ที่ทั้งสองคนปั่นพร้อมกัน"

เป็นธรรมชาติและลื่นไหล ชื่อเฉพาะก็จัดการได้ดี ชื่อบริษัทอย่าง "Thinking Machines" คงเป็นภาษาอังกฤษแทนที่จะถูกบังคับให้แปล

小互 - inline image

คุณแค่ส่ง "ลิงก์ + แปลวิดีโอนี้" แล้วมันจะถามก่อนว่าต้องการภาษาจีนล้วนหรือสองภาษา—ผมมักแปลเป็นภาษาจีน เลยตั้งสองตัวเลือกนี้เป็นค่าเริ่มต้น แต่จริงๆ แล้วแปลเป็นภาษาไหนก็ได้

小互 - inline image

นอกจากวิดีโอที่มีซับแล้ว มันยังสร้างบทถอดเสียงที่มีข้อความต้นฉบับและภาษาจีนวางเคียงข้างกัน

小互 - inline image

ย่อหน้าเต็มอ่านได้ดังนี้:

It's more like building a system that doesn't just run off on its own and leave civilization behind, but is more like a tandem bike where both people are pedaling. On the uphill, maybe the stronger person pedals harder, but both people's hands are on the handlebars.

ส่วนที่ใช้งานได้จริงที่สุดคือมันไม่จำกัดภาษา สัมภาษณ์เดียวกันสามารถแปลเป็นซับสองภาษาสำหรับจีน ญี่ปุ่น เกาหลี อาหรับ หรือฝรั่งเศส—โดยมีคำแปลอยู่ด้านบนและภาษาอังกฤษด้านล่าง ลำดับความสำคัญชัดเจน แม้แต่อาหรับที่อ่านจากขวาไปซ้ายก็เรียงอย่างเรียบร้อย:

小互 - inline image

วิดีโอสิบนาทีไม่มีปัญหา และวิดีโอยาวกว่าหนึ่งชั่วโมงครึ่งก็จัดการได้สบาย

จริงๆ แล้วมันคือสามสกิล

เมื่อคุณเปิดที่เก็บ (repository) คุณจะเห็นสามโฟลเดอร์ แต่ละโฟลเดอร์จัดการส่วนหนึ่งของงาน สามารถใช้แยกกันหรือเชื่อมต่อกัน:

  • xiaohu-video-md: ผู้บัญชาการ รับผิดชอบดาวน์โหลด ถอดเสียง เรียกการแปล เผาซับ และส่งออกบทถอดเสียง
  • xiaohu-subtitle-polish: เชี่ยวชาญด้านการแปลและปรับปรุงซับไตเติล จัดการแก้ไขข้อผิดพลาด การแปล การแบ่งประโยค การปรับเวลา และการจัดรูปแบบสองภาษา
  • xiaohu-video-download: เครื่องมือดาวน์โหลดล้วนๆ ดาวน์โหลดวิดีโอ เสียง หรือทั้งเพลย์ลิสต์ และยังสามารถเผาซับลงบนวิดีโอในเครื่องได้
小互 - inline image

เมื่อแปลวิดีโอ xiaohu-video-md เป็นตัวจัดการ และเรียก xiaohu-subtitle-polish สำหรับขั้นตอนการแปล คุณไม่ต้องกังวลเรื่องนี้ แค่รู้ว่ามีสามส่วนนี้อยู่

การติดตั้งทีละขั้นตอน

เครื่องมือนี้ปรับให้เหมาะกับ Mac ในตอนนี้ ทำงานราบรื่นที่สุดบน Apple Silicon มีสองวิธีในการติดตั้ง: ถ้าต้องการง่าย แค่วางข้อความด้านล่างนี้ลงใน AI ของคุณ ถ้าอยากรู้ว่าเกิดอะไรขึ้นหรือกลัวข้อผิดพลาด ให้ทำตามขั้นตอนด้วยตนเอง

รุ่นขี้เกียจ: ส่งให้ AI ของคุณ

เปิดเครื่องมือเขียนโค้ด AI ของคุณ (Claude Code, Codex, OpenClaw) แล้วคัดลอกข้อความต่อไปนี้ทุกประการ มันจะตรวจสอบระบบของคุณ ติดตั้ง dependencies โคลนที่เก็บ และรันสคริปต์ติดตั้ง โดยถามคุณเมื่อจำเป็น:

ช่วยฉันติดตั้งเครื่องมือแปลวิดีโอนี้: https://github.com/xiaohuailabs/xiaohu-video-translate ทำตามลำดับนี้: 1. ตรวจสอบระบบของฉัน: Mac หรือ Windows; ถ้า Mac ให้ตรวจสอบว่าเป็น Apple Silicon (ซีรีส์ M) หรือไม่ 2. ติดตั้ง dependencies: yt-dlp, ffmpeg, whisper-cpp (ใช้ brew install สำหรับ Mac, WSL หรือ winget สำหรับ Windows) เอ็นจิ้นการถอดเสียง: ติดตั้ง mlx-whisper สำหรับ Apple Silicon, faster-whisper สำหรับรุ่นอื่นๆ 3. git clone ที่เก็บนี้ เข้าไปในไดเรกทอรีแล้วรัน bash install.sh เพื่อติดตั้งสามสกิลลงในไดเรกทอรีสกิลของฉัน 4. เมื่อติดตั้งแล้ว ให้ค้นหา config.json ในสกิล xiaohu-video-md (สำหรับ Claude Code อยู่ใน ~/.claude/skills/) ถามฉันว่าต้องการบันทึกผลลัพธ์ไว้ที่ไหน และช่วยฉันเปลี่ยน output_dir เป็นพาธแบบเต็ม 5. สุดท้าย ตรวจสอบว่าติดตั้ง dependencies ทั้งหมดแล้วหรือไม่ และบอกฉันว่าสามารถเริ่มใช้ได้

อธิบายสั้นๆ ว่าคุณทำอะไรในแต่ละขั้นตอน ถ้า dependency ตัวไหนล้มเหลว ให้หยุดและถามฉัน อย่าไปต่อเรื่อยๆ

โดยพื้นฐานแล้ว มันจะรันสามขั้นตอนด้านล่างให้คุณ ถ้าคุณต้องการทำเองหรือแก้ปัญหา ให้ทำตามรุ่นด้วยตนเอง

ขั้นตอนที่ 1: ติดตั้งเครื่องมือพื้นฐาน

ก่อนอื่น ตรวจสอบให้แน่ใจว่าคุณได้ติดตั้ง Homebrew แล้ว จากนั้นรันคำสั่งนี้เพื่อติดตั้งสามเครื่องมือ:

brew install yt-dlp ffmpeg whisper-cpp

จากนั้นติดตั้งเอ็นจิ้นการถอดเสียง สำหรับ Mac Apple Silicon ให้ใช้คำสั่งนี้เพื่อใช้ GPU เร่งความเร็ว (แฟล็ก --break-system-packages แค่หลีกเลี่ยงข้อจำกัดของระบบรุ่นใหม่ ไม่เป็นอันตรายต่อระบบ):

pip3 install --break-system-packages mlx-whisper

ถ้าไม่ใช่ Apple Silicon ให้ใช้รุ่นทั่วไป:

pip3 install --break-system-packages faster-whisper

小互 - inline image

ขั้นตอนที่ 2: ติดตั้งสกิลลงใน Claude

โคลนที่เก็บและรันสคริปต์ติดตั้ง:

git clone https://github.com/xiaohuailabs/xiaohu-video-translate.git cd xiaohu-video-translate bash install.sh

สคริปต์นี้จะคัดลอกสามสกิลไปยังไดเรกทอรีสกิลของ Claude สร้างไฟล์คอนฟิก และตรวจสอบ dependencies ถ้าทุกอย่างขึ้น [OK] ก็พร้อมแล้ว ถ้ามีอะไรขึ้น [Missing] ให้ทำตามคำแนะนำเพื่อแก้ไข (พาธที่นี่ใช้ Claude Code เป็นตัวอย่าง สำหรับเครื่องมืออื่นๆ แค่เปลี่ยนไดเรกทอรี)

小互 - inline image

ขั้นตอนที่ 3: บอกว่าต้องการให้ผลลัพธ์ไปไว้ที่ไหน

เปิด ~/.claude/skills/xiaohu-video-md/config.json และเปลี่ยน output_dir เป็นพาธโฟลเดอร์ที่คุณต้องการ (เช่น /Users/yourname/Documents/VideoTranslation)

ไฟล์ชั่วคราวไปที่ tmp/ บทถอดเสียงไปที่ data/ และวิดีโอที่เสร็จแล้วจะไปที่โฟลเดอร์ Downloads ของคุณโดยค่าเริ่มต้น

คุณไม่ต้องดาวน์โหลดโมเดลการถอดเสียงด้วยตนเอง ครั้งแรกที่รัน mlx-whisper จะดาวน์โหลดให้ (ประมาณ 1.5GB) และนำกลับมาใช้ใหม่หลังจากนั้น

เมื่อเสร็จแล้ว ให้รีสตาร์ทเครื่องมือ AI ของคุณ ก็พร้อมใช้งาน

小互 - inline image

ผู้ใช้ Windows ดูตรงนี้

ข้างต้นสำหรับ Mac Windows ก็รันได้เช่นกัน แต่มีข้อแตกต่างเล็กน้อย:

วิธีที่ง่ายที่สุดคือใช้ WSL (Windows Subsystem for Linux) เมื่อติดตั้งแล้ว ให้ติดตั้งสิ่งเหล่านี้แล้วสคริปต์จะทำงานได้เลย:

sudo apt install ffmpeg pip3 install yt-dlp faster-whisper

ถ้าไม่อยากใช้ WSL:

  • ใช้ faster-whisper เป็นเอ็นจิ้น
  • รันสคริปต์ติดตั้งด้วย Git Bash หรือคัดลอกโฟลเดอร์ด้วยตนเอง
  • เปลี่ยนฟอนต์ซับไตเติล ค่าเริ่มต้นคือ PingFang SC ของ Mac เปลี่ยนเป็น Microsoft YaHei ในคำสั่งเพื่อป้องกันข้อความแสดงเป็นช่องว่าง
小互 - inline image

วิธีใช้งาน

เมื่อติดตั้งแล้ว แค่ประโยคเดียว คุณสามารถพูดเช่น:

  • "แปลลิงก์นี้เป็นวิดีโอที่มีซับไตเติลภาษาจีน + [ลิงก์]"
  • "แปลวิดีโอนี้ ฉันต้องการซับสองภาษา + [ลิงก์]"
  • "เปลี่ยนวิดีโอนี้เป็นข้อความ + [ลิงก์]" (สร้าง Markdown เท่านั้น)
  • "เพิ่มซับไทยให้วิดีโอในเครื่องนี้ + [พาธ]"
  • "ดาวน์โหลดวิดีโอนี้ + [ลิงก์]"
  • "ใช้โหมดเร็วสำหรับการถอดเสียง"
  • "ไม่มีลายน้ำเมื่อแปล"

ข้อควรระวังบางอย่าง

YouTube บางครั้งดาวน์โหลดไม่สำเร็จ (ข้อผิดพลาด 403) การควบคุมความเสี่ยงของ YouTube เข้มงวดขึ้น สคริปต์จะพยายามอ่านคุกกี้จากเบราว์เซอร์ของคุณเพื่อลองอีกครั้ง ถ้ายังล้มเหลว ให้ใช้พร็อกซี

ซับไตเติลแสดงเป็นช่องว่าง นี่เป็นปัญหาการจัดทำดัชนีฟอนต์ ตรวจสอบให้แน่ใจว่าคุณใช้ฟอนต์ที่มีอยู่ในระบบของคุณ (เช่น PingFang SC บน Mac)

Douyin ต้องล็อกอินครั้งเดียว รันสคริปต์ douyin_login.py แล้วสแกน QR โค้ด ข้อมูลล็อกอินนี้จะอยู่เฉพาะในคอมพิวเตอร์ของคุณเท่านั้น

เอาไปใช้ได้เลย

ที่อยู่ที่เก็บ:

github.com/xiaohuailabs/xiaohu-video-translate

โค้ดอยู่ภายใต้ลิขสิทธิ์ MIT เปลี่ยนลายน้ำ รูปแบบ หรือขนาดฟอนต์ได้ตามสบาย แค่เตือน: อย่าอัปโหลดไฟล์คอนฟิกหรือข้อมูลล็อกอิน Douyin ของคุณไปยังที่เก็บสาธารณะ

นี่คือเครื่องมือที่ผมใช้ทุกวัน ไม่ใช่ของเล่น ถ้าคุณเห็นว่ามีประโยชน์ ก็กดดาวให้หน่อย ถ้ามีปัญหา ก็เปิด issue ได้

ครั้งหน้าผมจะเปิดเป็นโอเพนซอร์สสกิลสร้างภาพประกอบบทความ—ใช้รูปภาพตัวละครส่วนตัวเพื่อสร้างภาพประกอบสำหรับบทความ เหมือนกับในโพสต์นี้

สร้างต่อใน YouMind

Turn one viral article into a full content workflow

Collect the source, decode the pattern, create assets, draft the story, and distribute from one AI workspace.

Explore YouMind
สำหรับครีเอเตอร์

เปลี่ยน Markdown ของคุณให้เป็นบทความ 𝕏 ที่สะอาดตา

เวลาคุณเผยแพร่งานเขียนยาวของตัวเอง การจัดรูปแบบรูปภาพ ตาราง และบล็อกโค้ดให้เข้ากับ 𝕏 นั้นน่าปวดหัว YouMind เปลี่ยนร่าง Markdown ทั้งฉบับให้เป็นบทความ 𝕏 ที่สะอาดตาและพร้อมโพสต์ทันที

ลอง Markdown เป็น 𝕏

แพตเทิร์นให้ถอดรหัสเพิ่มเติม

บทความไวรัลล่าสุด

สำรวจบทความไวรัลเพิ่มเติม