บางคนบอกว่าตอนนี้มีเครื่องมือแปลซับไตเติลอัตโนมัติด้วย AI มากมายแล้ว แล้วเครื่องมือนี้จะแตกต่างตรงไหน?
จริงอยู่ว่ามีเครื่องมือมากมายสำหรับการแปลวิดีโอออนไลน์ และผมเองก็เคยใช้มาหลายตัว แต่ผมรู้สึกว่ามันไม่แม่นยำพอ หรือคุณภาพไม่ดี บางครั้งก็มีข้อผิดพลาดโผล่ขึ้นมาเป็นชุดๆ
นอกจากนี้ ผมแชร์วิดีโอจากต่างประเทศบน Twitter และ WeChat Channels บ่อยๆ เลยตัดสินใจสร้างชุดเครื่องมือนี้ขึ้นมา—จริงๆ แล้วมันช่วยคุณย้ายวิดีโอจากต่างประเทศมาแพลตฟอร์มในประเทศได้ด้วยนะ ฮ่าๆ
ผมใช้ชุดเครื่องมือนี้มาครึ่งปี ปรับหลายครั้ง ตอนนี้มันค่อนข้างสมบูรณ์แล้ว ผมทำความสะอาดแล้วเปิดเป็นโอเพนซอร์สให้ทุกคนใช้

เมื่อติดตั้งแล้ว คุณแค่พูดประโยคเดียว: "แปลลิงก์นี้เป็นวิดีโอที่มีซับไตเติลภาษาจีน" แล้วมันก็จัดการทุกอย่างโดยอัตโนมัติ: ดาวน์โหลด, ถอดเสียง, แปล, ปรับปรุง, เผาซับไตเติล, และสร้างบทถอดเสียง—ครบวงจรในที่เดียว
การถอดเสียงทำงานบนเครื่องคุณทั้งหมด ไม่มีค่าใช้จ่าย API การแปลใช้ AI ที่คุณติดตั้งไว้แล้ว และไม่ใช่แค่ภาษาอังกฤษเท่านั้น วิดีโอภาษาญี่ปุ่น เกาหลี ฝรั่งเศส และภาษาต่างประเทศอื่นๆ ก็แปลงเป็นซับไตเติลภาษาจีนได้ทั้งหมด
จริงๆ แล้วมันก็แค่สคริปต์ไม่กี่ตัวรวมกับคู่มือ ไม่ได้จำกัดเฉพาะ Claude Code—OpenClaw, Gemini, และ Codex ก็ใช้ได้ทั้งหมด ข้อแตกต่างคือแต่ละเครื่องมือติดตั้ง "สกิล" ต่างกันเท่านั้น
ด้านล่างนี้คือคำแนะนำทีละขั้นตอนในการติดตั้งและรันวิดีโอแรกของคุณ
เครื่องมือนี้ทำอะไรได้บ้าง?
ให้ลิงก์วิดีโอ (YouTube, Bilibili, Douyin ก็ได้) หรือไฟล์วิดีโอในเครื่อง แล้วมันจะทำห้าขั้นตอนนี้ในครั้งเดียว:
ดาวน์โหลด → ถอดเสียง → แปล → ปรับปรุง → เผาซับไตเติล
...และสุดท้ายก็ส่งออกบทถอดเสียง

แจกแจงรายละเอียด:
- ดาวน์โหลดวิดีโอ (หรือใช้ไฟล์ในเครื่องโดยตรง)
- แยกเสียงและใช้ Whisper ถอดเสียงเป็นซับไตเติลต้นฉบับพร้อมเวลาที่แม่นยำ
- แปลข้อความต้นฉบับเป็นภาษาจีนและปรับปรุงเป็นซับไตเติลที่เหมาะกับพฤติกรรมการดูของคนจีน
- เผาซับไตเติลลงในวิดีโอ ส่งออกเป็นวิดีโอที่มีซับไตเติลภาษาจีน
- สร้างบทถอดเสียงรูปแบบ Markdown พร้อมกัน เพื่อเก็บถาวรหรือนำไปทำเป็นบทความ
ภาษาไม่ใช่ปัญหา อังกฤษ ญี่ปุ่น เกาหลี ฝรั่งเศส สเปน—ตราบใดที่ Whisper เข้าใจ ก็แปลงเป็นซับไตเติลภาษาจีนได้ โดยระบุภาษาต้นทางอัตโนมัติและทำการแปล สำหรับวิดีโอภาษาจีน จะถอดเสียงและสร้างบทถอดเสียงเท่านั้น ไม่ต้องผ่านขั้นตอนแปล
มีตัวเลือกซับไตเติลสองแบบ แบบหนึ่งคือภาษาจีนล้วนๆ หน้าจอสะอาดตา อีกแบบคือสองภาษา (จีน/อังกฤษ) โดยข้อความจีนตัวใหญ่ ข้อความอังกฤษตัวเล็ก เหมาะสำหรับคนที่อยากฝึกฟัง
คุณไม่ต้องจำคำสั่งใดๆ แค่ใช้ภาษาธรรมดา: "ฉันต้องการซับสองภาษา" "ไม่มีลายน้ำ" "ใช้โหมดเร็ว" — มันเข้าใจทั้งหมด
พูดง่ายๆ ก็คือ มันบีบอัดกระบวนการที่แต่ก่อนต้องใช้ซอฟต์แวร์สี่ห้าตัวและเวลาทำงานหนึ่งถึงสองชั่วโมงให้เหลือแค่ประโยคเดียว
ต่างจากเครื่องมือที่มีอยู่อย่างไร?
มีเครื่องมือซับไตเติลมากมายในตลาด ผมใส่ใจสามเรื่อง และเครื่องมือนี้ถูกสร้างมาเพื่อเรื่องเหล่านี้โดยเฉพาะ
แรก: ในเครื่อง ฟรี และออฟไลน์ การถอดเสียงใช้โมเดล Whisper โอเพนซอร์สของ OpenAI บน Mac Apple Silicon จะใช้ GPU เร่งความเร็วอัตโนมัติ กระบวนการถอดเสียงทั้งหมดเกิดขึ้นบนเครื่องคุณ—ไม่ต้องอัปโหลด ไม่มีค่าธรรมเนียม การแปลใช้ AI ที่คุณมีอยู่แล้ว ไม่ต้องใช้ API แปลแยกต่างหาก
สอง: เวลาที่แม่นยำ เครื่องมือหลายตัวมีซับที่ขึ้นก่อนผู้พูดหรือตัดประโยคไม่เหมาะสม เครื่องมือนี้ได้เวลาที่แม่นยำถึงเมื่อแต่ละคำถูกพูด และตัดตาม "ประโยค + หยุดหายใจ" ดังนั้นซับจะเปลี่ยนเมื่อผู้พูดจบความคิดพอดี
สาม: ซับสำหรับมนุษย์ ไม่ใช่แค่การแปลเครื่องดิบ มันแก้ไขชื่อเฉพาะที่ได้ยินผิดโดยอัตโนมัติ (Claude มักได้ยินเป็น "cloud", MCP เป็น "NCP"), แบ่งประโยคตามความหมาย, เก็บแต่ละบรรทัดไม่เกินสิบสองตัวอักษร, และคงคำศัพท์เทคนิคเป็นภาษาอังกฤษ ในโหมดสองภาษา ภาษาจีนตัวใหญ่ ภาษาอังกฤษตัวเล็ก แยกกันชัดเจน ไม่ใช่แค่สองบรรทัดขนาดเท่ากันซ้อนกัน
นี่คือรายละเอียดที่ผมปรับปรุงจากวิดีโอหลายร้อยเรื่อง ทั้งหมดรวมอยู่ในกฎ
ผลลัพธ์ที่ได้เป็นอย่างไร
ลองทดสอบกับสัมภาษณ์ล่าสุดที่ a16z โพสต์กับ Mira Murati อดีต CTO ของ OpenAI ผมขอให้เครื่องมือทำซับสองภาษา
ในคำพูดเดิมของเธอ มีอุปมาอุปไมย:
It's more like a tandem bike where both people are pedaling.
การแปลด้วยเครื่องอาจให้คำแปลตรงตัวที่ดูแข็งๆ เครื่องมือนี้แปลว่า: "มันเหมือนจักรยานสองคนมากกว่า ที่ทั้งสองคนปั่นพร้อมกัน"
เป็นธรรมชาติและลื่นไหล ชื่อเฉพาะก็จัดการได้ดี ชื่อบริษัทอย่าง "Thinking Machines" คงเป็นภาษาอังกฤษแทนที่จะถูกบังคับให้แปล

คุณแค่ส่ง "ลิงก์ + แปลวิดีโอนี้" แล้วมันจะถามก่อนว่าต้องการภาษาจีนล้วนหรือสองภาษา—ผมมักแปลเป็นภาษาจีน เลยตั้งสองตัวเลือกนี้เป็นค่าเริ่มต้น แต่จริงๆ แล้วแปลเป็นภาษาไหนก็ได้

นอกจากวิดีโอที่มีซับแล้ว มันยังสร้างบทถอดเสียงที่มีข้อความต้นฉบับและภาษาจีนวางเคียงข้างกัน

ย่อหน้าเต็มอ่านได้ดังนี้:
It's more like building a system that doesn't just run off on its own and leave civilization behind, but is more like a tandem bike where both people are pedaling. On the uphill, maybe the stronger person pedals harder, but both people's hands are on the handlebars.
ส่วนที่ใช้งานได้จริงที่สุดคือมันไม่จำกัดภาษา สัมภาษณ์เดียวกันสามารถแปลเป็นซับสองภาษาสำหรับจีน ญี่ปุ่น เกาหลี อาหรับ หรือฝรั่งเศส—โดยมีคำแปลอยู่ด้านบนและภาษาอังกฤษด้านล่าง ลำดับความสำคัญชัดเจน แม้แต่อาหรับที่อ่านจากขวาไปซ้ายก็เรียงอย่างเรียบร้อย:

วิดีโอสิบนาทีไม่มีปัญหา และวิดีโอยาวกว่าหนึ่งชั่วโมงครึ่งก็จัดการได้สบาย
จริงๆ แล้วมันคือสามสกิล
เมื่อคุณเปิดที่เก็บ (repository) คุณจะเห็นสามโฟลเดอร์ แต่ละโฟลเดอร์จัดการส่วนหนึ่งของงาน สามารถใช้แยกกันหรือเชื่อมต่อกัน:
- xiaohu-video-md: ผู้บัญชาการ รับผิดชอบดาวน์โหลด ถอดเสียง เรียกการแปล เผาซับ และส่งออกบทถอดเสียง
- xiaohu-subtitle-polish: เชี่ยวชาญด้านการแปลและปรับปรุงซับไตเติล จัดการแก้ไขข้อผิดพลาด การแปล การแบ่งประโยค การปรับเวลา และการจัดรูปแบบสองภาษา
- xiaohu-video-download: เครื่องมือดาวน์โหลดล้วนๆ ดาวน์โหลดวิดีโอ เสียง หรือทั้งเพลย์ลิสต์ และยังสามารถเผาซับลงบนวิดีโอในเครื่องได้

เมื่อแปลวิดีโอ xiaohu-video-md เป็นตัวจัดการ และเรียก xiaohu-subtitle-polish สำหรับขั้นตอนการแปล คุณไม่ต้องกังวลเรื่องนี้ แค่รู้ว่ามีสามส่วนนี้อยู่
การติดตั้งทีละขั้นตอน
เครื่องมือนี้ปรับให้เหมาะกับ Mac ในตอนนี้ ทำงานราบรื่นที่สุดบน Apple Silicon มีสองวิธีในการติดตั้ง: ถ้าต้องการง่าย แค่วางข้อความด้านล่างนี้ลงใน AI ของคุณ ถ้าอยากรู้ว่าเกิดอะไรขึ้นหรือกลัวข้อผิดพลาด ให้ทำตามขั้นตอนด้วยตนเอง
รุ่นขี้เกียจ: ส่งให้ AI ของคุณ
เปิดเครื่องมือเขียนโค้ด AI ของคุณ (Claude Code, Codex, OpenClaw) แล้วคัดลอกข้อความต่อไปนี้ทุกประการ มันจะตรวจสอบระบบของคุณ ติดตั้ง dependencies โคลนที่เก็บ และรันสคริปต์ติดตั้ง โดยถามคุณเมื่อจำเป็น:
ช่วยฉันติดตั้งเครื่องมือแปลวิดีโอนี้: https://github.com/xiaohuailabs/xiaohu-video-translate ทำตามลำดับนี้: 1. ตรวจสอบระบบของฉัน: Mac หรือ Windows; ถ้า Mac ให้ตรวจสอบว่าเป็น Apple Silicon (ซีรีส์ M) หรือไม่ 2. ติดตั้ง dependencies: yt-dlp, ffmpeg, whisper-cpp (ใช้ brew install สำหรับ Mac, WSL หรือ winget สำหรับ Windows) เอ็นจิ้นการถอดเสียง: ติดตั้ง mlx-whisper สำหรับ Apple Silicon, faster-whisper สำหรับรุ่นอื่นๆ 3. git clone ที่เก็บนี้ เข้าไปในไดเรกทอรีแล้วรัน bash install.sh เพื่อติดตั้งสามสกิลลงในไดเรกทอรีสกิลของฉัน 4. เมื่อติดตั้งแล้ว ให้ค้นหา config.json ในสกิล xiaohu-video-md (สำหรับ Claude Code อยู่ใน ~/.claude/skills/) ถามฉันว่าต้องการบันทึกผลลัพธ์ไว้ที่ไหน และช่วยฉันเปลี่ยน output_dir เป็นพาธแบบเต็ม 5. สุดท้าย ตรวจสอบว่าติดตั้ง dependencies ทั้งหมดแล้วหรือไม่ และบอกฉันว่าสามารถเริ่มใช้ได้
อธิบายสั้นๆ ว่าคุณทำอะไรในแต่ละขั้นตอน ถ้า dependency ตัวไหนล้มเหลว ให้หยุดและถามฉัน อย่าไปต่อเรื่อยๆ
โดยพื้นฐานแล้ว มันจะรันสามขั้นตอนด้านล่างให้คุณ ถ้าคุณต้องการทำเองหรือแก้ปัญหา ให้ทำตามรุ่นด้วยตนเอง
ขั้นตอนที่ 1: ติดตั้งเครื่องมือพื้นฐาน
ก่อนอื่น ตรวจสอบให้แน่ใจว่าคุณได้ติดตั้ง Homebrew แล้ว จากนั้นรันคำสั่งนี้เพื่อติดตั้งสามเครื่องมือ:
brew install yt-dlp ffmpeg whisper-cpp
จากนั้นติดตั้งเอ็นจิ้นการถอดเสียง สำหรับ Mac Apple Silicon ให้ใช้คำสั่งนี้เพื่อใช้ GPU เร่งความเร็ว (แฟล็ก --break-system-packages แค่หลีกเลี่ยงข้อจำกัดของระบบรุ่นใหม่ ไม่เป็นอันตรายต่อระบบ):
pip3 install --break-system-packages mlx-whisper
ถ้าไม่ใช่ Apple Silicon ให้ใช้รุ่นทั่วไป:
pip3 install --break-system-packages faster-whisper

ขั้นตอนที่ 2: ติดตั้งสกิลลงใน Claude
โคลนที่เก็บและรันสคริปต์ติดตั้ง:
git clone https://github.com/xiaohuailabs/xiaohu-video-translate.git cd xiaohu-video-translate bash install.sh
สคริปต์นี้จะคัดลอกสามสกิลไปยังไดเรกทอรีสกิลของ Claude สร้างไฟล์คอนฟิก และตรวจสอบ dependencies ถ้าทุกอย่างขึ้น [OK] ก็พร้อมแล้ว ถ้ามีอะไรขึ้น [Missing] ให้ทำตามคำแนะนำเพื่อแก้ไข (พาธที่นี่ใช้ Claude Code เป็นตัวอย่าง สำหรับเครื่องมืออื่นๆ แค่เปลี่ยนไดเรกทอรี)

ขั้นตอนที่ 3: บอกว่าต้องการให้ผลลัพธ์ไปไว้ที่ไหน
เปิด ~/.claude/skills/xiaohu-video-md/config.json และเปลี่ยน output_dir เป็นพาธโฟลเดอร์ที่คุณต้องการ (เช่น /Users/yourname/Documents/VideoTranslation)
ไฟล์ชั่วคราวไปที่ tmp/ บทถอดเสียงไปที่ data/ และวิดีโอที่เสร็จแล้วจะไปที่โฟลเดอร์ Downloads ของคุณโดยค่าเริ่มต้น
คุณไม่ต้องดาวน์โหลดโมเดลการถอดเสียงด้วยตนเอง ครั้งแรกที่รัน
mlx-whisperจะดาวน์โหลดให้ (ประมาณ 1.5GB) และนำกลับมาใช้ใหม่หลังจากนั้น
เมื่อเสร็จแล้ว ให้รีสตาร์ทเครื่องมือ AI ของคุณ ก็พร้อมใช้งาน

ผู้ใช้ Windows ดูตรงนี้
ข้างต้นสำหรับ Mac Windows ก็รันได้เช่นกัน แต่มีข้อแตกต่างเล็กน้อย:
วิธีที่ง่ายที่สุดคือใช้ WSL (Windows Subsystem for Linux) เมื่อติดตั้งแล้ว ให้ติดตั้งสิ่งเหล่านี้แล้วสคริปต์จะทำงานได้เลย:
sudo apt install ffmpeg pip3 install yt-dlp faster-whisper
ถ้าไม่อยากใช้ WSL:
- ใช้ faster-whisper เป็นเอ็นจิ้น
- รันสคริปต์ติดตั้งด้วย Git Bash หรือคัดลอกโฟลเดอร์ด้วยตนเอง
- เปลี่ยนฟอนต์ซับไตเติล ค่าเริ่มต้นคือ PingFang SC ของ Mac เปลี่ยนเป็น Microsoft YaHei ในคำสั่งเพื่อป้องกันข้อความแสดงเป็นช่องว่าง

วิธีใช้งาน
เมื่อติดตั้งแล้ว แค่ประโยคเดียว คุณสามารถพูดเช่น:
- "แปลลิงก์นี้เป็นวิดีโอที่มีซับไตเติลภาษาจีน + [ลิงก์]"
- "แปลวิดีโอนี้ ฉันต้องการซับสองภาษา + [ลิงก์]"
- "เปลี่ยนวิดีโอนี้เป็นข้อความ + [ลิงก์]" (สร้าง Markdown เท่านั้น)
- "เพิ่มซับไทยให้วิดีโอในเครื่องนี้ + [พาธ]"
- "ดาวน์โหลดวิดีโอนี้ + [ลิงก์]"
- "ใช้โหมดเร็วสำหรับการถอดเสียง"
- "ไม่มีลายน้ำเมื่อแปล"
ข้อควรระวังบางอย่าง
YouTube บางครั้งดาวน์โหลดไม่สำเร็จ (ข้อผิดพลาด 403) การควบคุมความเสี่ยงของ YouTube เข้มงวดขึ้น สคริปต์จะพยายามอ่านคุกกี้จากเบราว์เซอร์ของคุณเพื่อลองอีกครั้ง ถ้ายังล้มเหลว ให้ใช้พร็อกซี
ซับไตเติลแสดงเป็นช่องว่าง นี่เป็นปัญหาการจัดทำดัชนีฟอนต์ ตรวจสอบให้แน่ใจว่าคุณใช้ฟอนต์ที่มีอยู่ในระบบของคุณ (เช่น PingFang SC บน Mac)
Douyin ต้องล็อกอินครั้งเดียว รันสคริปต์ douyin_login.py แล้วสแกน QR โค้ด ข้อมูลล็อกอินนี้จะอยู่เฉพาะในคอมพิวเตอร์ของคุณเท่านั้น
เอาไปใช้ได้เลย
ที่อยู่ที่เก็บ:
github.com/xiaohuailabs/xiaohu-video-translate
โค้ดอยู่ภายใต้ลิขสิทธิ์ MIT เปลี่ยนลายน้ำ รูปแบบ หรือขนาดฟอนต์ได้ตามสบาย แค่เตือน: อย่าอัปโหลดไฟล์คอนฟิกหรือข้อมูลล็อกอิน Douyin ของคุณไปยังที่เก็บสาธารณะ
นี่คือเครื่องมือที่ผมใช้ทุกวัน ไม่ใช่ของเล่น ถ้าคุณเห็นว่ามีประโยชน์ ก็กดดาวให้หน่อย ถ้ามีปัญหา ก็เปิด issue ได้
ครั้งหน้าผมจะเปิดเป็นโอเพนซอร์สสกิลสร้างภาพประกอบบทความ—ใช้รูปภาพตัวละครส่วนตัวเพื่อสร้างภาพประกอบสำหรับบทความ เหมือนกับในโพสต์นี้





