ผมใช้เวิร์กโฟลว์ตัดต่อนี้มากว่าสองเดือนแล้ว และปรับปรุงมากว่า 10 เวอร์ชัน ในบทความนี้ ผมจะอธิบายขั้นตอนและรายละเอียดทั้งหมดให้ชัดเจนที่สุดเท่าที่จะทำได้ เพื่อนๆ สามารถอ่านตามตรรกะของบทความ หรือจะส่งบทความนี้ให้ Codex เพื่อให้ AI สร้าง Skill ให้คุณก็ได้ สวัสดีเพื่อนๆ มาแล้วครับกับต้นฉบับ!
สัปดาห์ที่แล้วผมเขียนบทความแนะนำ Codex ไป ขอบคุณมากสำหรับการสนับสนุน มียอดเข้าชมเกินล้านวิว
https://x.com/xilo2991/status/2070051136187621452
ตอนนั้นเพื่อนๆ หลายคนถามว่าผมจะแชร์ระบบตัดต่ออัตโนมัติที่พูดถึงในบทความได้ไหม
ได้เลยครับ วันนี้ผมจะมาคุยกับคุณเกี่ยวกับวิธีการใช้ Codex เพื่อตัดต่ออัตโนมัติ เพิ่มประสิทธิภาพการทำวิดีโอให้สูงสุด
ตรรกะเบื้องหลังของเวิร์กโฟลว์
ไม่ว่าคุณจะทำคอนเทนต์หรืออีคอมเมิร์ซ วิธีที่ง่ายที่สุดในการปั่น traffic ให้เร็วคือ ก็อปปี้ของที่ปัง
เพราะของที่ปังเป็นคอนเทนต์ที่ตลาดรับรองแล้ว ถ้าคุณตามทัน traffic มักจะไม่แย่ (แน่นอน ต้องระวังความแตกต่างระหว่างก็อปปี้กับลอกเลียน)
หัวใจของเวิร์กโฟลว์นี้คือการก็อปปี้ของที่ปัง
สมมติว่าคุณเห็นวิดีโอไวรัลแล้วอยากทำวิดีโอตามจังหวะและโครงสร้างนั้น วิธีเดิมคือต้องเข้า CapCut (Jianying) แล้วจับคู่เฟรมต่อเฟรมกับวิดีโออ้างอิง หาวัสดุ จับเวลา และจัดเรียงซับไตเติ้ล วิดีโอหนึ่งคลิปอาจใช้เวลาสองสามชั่วโมง
แต่ด้วยเวิร์กโฟลว์นี้ คุณแค่ต้องเตรียมวิดีโออ้างอิงและคลังวัสดุของคุณเอง Codex จะจัดการส่วนที่เหลือให้อัตโนมัติ
Codex จะตรวจจับการเปลี่ยนคัททุกครั้งในวิดีโออ้างอิง หาวัสดุที่ตรงกันที่สุดจากคลังของคุณ สร้างเสียงพากย์และซับไตเติ้ลอัตโนมัติ และสุดท้ายให้คุณได้ดราฟต์ CapCut ที่คุณสามารถเปิดและแก้ไขต่อได้
ทั้งกระบวนการอาจใช้เวลาแค่ไม่กี่นาที
ผมใช้เวิร์กโฟลว์นี้เป็นหลักตอนทำวิดีโอสินค้าสำหรับ Douyin
ก่อนมี Codex ผมตัดต่อได้มากสุดแค่วันละ 6 วิดีโอ แต่พอมี Codex ผมแค่ต้องหาวิดีโอไวรัลที่ใช่เป็นตัวอย่าง และเตรียมวัสดุสินค้า ที่เหลือก็เป็นการสร้าง ตรวจสอบ และปรับแต่งอัตโนมัติ
ผมสามารถทำวิดีโอได้วันละ 30 ชิ้นสบายๆ ประสิทธิภาพเพิ่มขึ้นอย่างน้อยห้าเท่า

แต่ต้องบอกให้ชัด: ตำแหน่งของเวิร์กโฟลว์นี้คือการผลิตอัตโนมัติ ไม่ใช่การสร้างผลงานพรีเมียม
มันเหมาะกับวิดีโอแบบ mashup ที่ต้องต่อหลายคลิป เช่น อีคอมเมิร์ซ การตลาด หรือ Vlog แบบ mashup
วิดีโออ้างอิงให้โครงสร้างและจังหวะ คลังวัสดุของคุณให้ภาพ เสียงพากย์และซับไตเติ้ลถูกสร้างอัตโนมัติ และได้วิดีโอสุดท้ายออกมาโดยอัตโนมัติ
ถ้าคุณต้องการสร้างคอนเทนต์ต้นฉบับคุณภาพสูงที่ต้องใช้ภาษา cinematic ที่แม่นยำมาก ทรานซิชันซับซ้อน และการสื่ออารมณ์อย่างละเอียด กระบวนการนี้อาจไม่เหมาะ
เพราะตรรกะการจับคู่อัตโนมัติในปัจจุบันยังไม่สามารถเข้าใจความหมายและควบคุมอารมณ์ได้ละเอียดขนาดนั้น
ผมกำลังศึกษาวิธีปรับกระบวนการนี้ให้เหมาะกับวิดีโอต้นฉบับ และจะมาแชร์กับเพื่อนๆ เมื่อมันเสถียร
การเตรียมพร้อมสำหรับเวิร์กโฟลว์
โอเค กลับมาที่เวิร์กโฟลว์ตัดต่ออัตโนมัติกัน ด้านล่างนี้ ผมจะอธิบายทีละขั้นตอนว่าเราจะสร้างเวิร์กโฟลว์นี้อย่างไร ก่อนเริ่ม คุณต้องเตรียมสองสิ่ง
1. ติดตั้งเครื่องมือที่เกี่ยวข้อง
เวิร์กโฟลว์นี้ใช้ Codex ดังนั้นคุณต้องมี Codex ก่อน ถ้ายังไม่เคยใช้ ลองดูบทความแนะนำของผมจากสัปดาห์ที่แล้ว
โดยเฉพาะ เวิร์กโฟลว์นี้ต้องใช้เครื่องมือหลักเหล่านี้:
- FFmpeg: ใช้สำหรับการทำงานพื้นฐาน เช่น แยกวิดีโอ รวม และแปลงฟอร์แมต นี่คือรากฐาน ต้องติดตั้งให้ได้
- Python Environment: เพราะทั้งกระบวนการเขียนด้วย Python คุณต้องมี Python 3.8 ขึ้นไป
- Voiceover Tools: ถ้าต้องการเสียงพากย์อัตโนมัติ ที่เสถียรที่สุดคือโมเดลเสียง Doubao ของ ByteDance ถ้าต้องการ clone เสียง ใช้ VoxCPM ซึ่งเป็นเครื่องมือโอเพนซอร์สฟรี
- CapCut (Jianying): ดราฟต์ที่สร้างออกมาจะเป็นฟอร์แมตของ CapCut ดังนั้นคุณต้องติดตั้งเวอร์ชันเดสก์ท็อป
ในนี้ FFmpeg และ Python เป็นตัวหลักที่ต้องมี
คุณสามารถคัดลอกข้อความต่อไปนี้ไปให้ Codex เพื่อช่วยตรวจสอบสภาพแวดล้อมและติดตั้งเครื่องมือที่ขาดหาย:
1ช่วยตรวจสอบสภาพแวดล้อมที่จำเป็นสำหรับการตัดต่อวิดีโออัตโนมัติ:231. ตรวจสอบว่าติดตั้ง FFmpeg หรือไม่ ถ้าไม่ได้ติดตั้ง ช่วยติดตั้งให้ด้วย42. ตรวจสอบว่า Python เวอร์ชัน >= 3.8 หรือไม่ ถ้าไม่ ช่วยติดตั้งหรืออัปเกรดให้53. ตรวจสอบว่าติดตั้ง CapCut (Jianying) Professional หรือไม่ ถ้าไม่ บอกลิงก์ดาวน์โหลดให้หน่อย64. ติดตั้ง dependencies ของ Python: opencv-python, numpy, pillow78หลังจากตรวจสอบแล้ว บอกว่าอะไรพร้อมแล้ว และอะไรที่ฉันต้องจัดการเอง
สำหรับเสียงพากย์ ขึ้นอยู่กับความต้องการของคุณ ถ้าคุณทำวิดีโออีคอมเมิร์ซ โมเดลเสียง Doubao เสถียรที่สุด มันใช้เสียง AI เดียวกับ CapCut ราคาถูก การสร้างวิดีโอความยาว 1 นาที ค่าใช้จ่ายประมาณ 0.4-0.8 หยวน
ถ้าคุณอยากใช้เสียงตัวเองหรือ clone เสียงคนอื่น ให้ใช้ VoxCPM หาลิงก์บน GitHub แล้วส่งให้ Codex เพื่อติดตั้ง
2. สร้างโฟลเดอร์
หลังจากติดตั้ง这些东西 แล้ว คุณต้องสร้างโฟลเดอร์โปรเจกต์ ผมมักจะจัดแบบนี้:
1Project Folder/2 assets/ # คลังวัสดุของคุณ3 work/ # พื้นที่ทำงาน สร้างโฟลเดอร์วันที่สำหรับแต่ละการตัดต่อ4 final/ # ผลงานสุดท้าย5 AGENTS.md # ไฟล์คอนฟิกโปรเจกต์
โฟลเดอร์ assets คือคลังของคุณ ใส่วัสดุที่อาจมีประโยชน์ทั้งหมดไว้ที่นี่ อาจเป็น AI สร้างหรือคุณถ่ายเอง แต่ควรเตรียมไว้ล่วงหน้าเป็นทรัพย์สินที่ใช้ซ้ำได้
วัสดุสามารถจัดหมวดหมู่ตามรูปลักษณ์ ฟังก์ชัน หรือฉาก
โฟลเดอร์ work ใช้สำหรับโปรเจกต์ที่กำลังทำอยู่ ทุกครั้งที่ทำวิดีโอใหม่ ให้สร้างโฟลเดอร์วันที่ เช่น 2026-07-05 แล้วใส่วิดีโออ้างอิง ไฟล์กลาง และดราฟต์สุดท้ายไว้
AGENTS.md คือไฟล์คอนฟิกที่มีเป้าหมายโปรเจกต์ สเปกผลลัพธ์ และเกณฑ์การยอมรับ นี่สำคัญมากเพราะ Codex ใช้มันเพื่อเข้าใจความต้องการของคุณ

PS: ไฟล์ AGENTS ของผมเองค่อนข้างยาว เลยวางไว้ท้ายบทความให้ดูเป็นตัวอย่าง
การสร้างเวิร์กโฟลว์การตัดต่อ
1. ถอดโครงสร้างวิดีโออ้างอิง
เป้าหมายหลักคือ แยกวิดีโออ้างอิงออกเป็นช็อตอิสระ และดึงคีย์เฟรมของแต่ละช็อตมาใช้เป็นพื้นฐานในการจับคู่วัสดุ
หาวิดีโอที่คุณอยากใช้เป็นตัวอย่าง ดาวน์โหลด ใส่ในโฟลเดอร์ work และตั้งชื่อให้ชัดเจน
จากนั้นส่งข้อความนี้ไปยัง Codex:
1ฉันต้องการถอดโครงสร้างวิดีโออ้างอิง23ตำแหน่งวิดีโออ้างอิง: @(ใส่ชื่อไฟล์ของคุณ)45ช่วยฉัน:61. ใช้ FFmpeg ระบุจุดเปลี่ยนช็อต (ผ่านการวิเคราะห์ความแตกต่างระหว่างเฟรม)72. ดึงคีย์เฟรมของแต่ละช็อตและบันทึกเป็นภาพ83. แยกแทร็กเสียงออกมาต่างหาก94. สร้างไฟล์ recipe.json ที่บันทึกเวลาเริ่ม เวลาจบ ระยะเวลา และพาธของคีย์เฟรมสำหรับแต่ละช็อต105. ถ้ามีข้อความ ให้สร้างสคริปต์เสียงพากย์ตามเสียง โดยแบ่งตามช็อต1112หลังจากเสร็จ ให้ทำตามข้อกำหนดใน AGENTS.md บันทึกลงในโฟลเดอร์ที่เกี่ยวข้อง และบอกฉันว่าตรวจพบกี่ช็อต
ไฟล์ recipe.json นี้คือหัวใจของทั้งกระบวนการ

หลังถอดโครงสร้าง คุณจะเห็นคลิปวิดีโอเล็กๆ และภาพหน้าจอจำนวนมาก ตรวจสอบว่าการแยกนั้นสมเหตุสมผลหรือไม่ ถ้าไม่ คุณสามารถขอให้ Codex ปรับได้
2. กรองและจับคู่วัสดุ
ขั้นตอนนี้สำคัญที่สุด และแสดงให้เห็นคุณค่าของระบบอัตโนมัติ
วิธีเดิม คุณต้องค้นหาคลังของคุณทีละช็อต แต่ด้วยเวิร์กโฟลว์นี้ คุณแค่บอก Codex ว่าคลังของคุณอยู่ที่ไหน มันก็จะทำการจับคู่ภาพ
พรอมต์สำหรับ Codex:
1ฉันต้องการจับคู่และแทนที่วัสดุจากคลัง23ข้อมูลโปรเจกต์:4- พาธของ recipe.json: (พาธจากขั้นตอนก่อนหน้า)5- พาธคลังวัสดุ: assets/6- พาธเอาต์พุต: work/(พาธของคุณ)78ข้อกำหนดการจับคู่:91. อ่านคีย์เฟรมจาก recipe.json102. วนลูปในคลังและดึงคีย์เฟรมของแต่ละวัสดุ113. แนะนำวัสดุที่ตรงกันที่สุดผ่านสี ความสว่าง และองค์ประกอบ (พร้อมให้คะแนนความเชื่อมั่น)124. ใช้กฎ: หลีกเลี่ยงการใช้วัสดุเดียวกัน 3 ช็อตติดกัน หลีกเลี่ยงองค์ประกอบที่ซ้ำกันชัดเจน135. สร้าง fragment_plan.json และ matches.json146. คัดลอก (ไม่ใช่ย้าย) วัสดุที่เลือกไปยัง material/fragment01/ ฯลฯ1516หลักการ: ถ้าคะแนนความเชื่อมั่นต่ำกว่า 0.6 ให้ทำเครื่องหมายเป็น "missing material"
Codex จะคำนวณความคล้ายคลึงจากฟีเจอร์ที่มองเห็น วัสดุที่ได้คะแนนสูงจะถูกเลือกก่อน

matches.json บันทึกผลลัพธ์สุดท้าย หลักการสำคัญ: ปล่อยให้วัสดุว่างดีกว่าบังคับใช้วัสดุที่ไม่เกี่ยวข้อง
3. สร้างเสียงพากย์
หลังจากจับคู่แล้ว ให้สร้างเสียงพากย์ เนื่องจาก Codex ใช้ OCR/ASR ให้ตรวจสอบสคริปต์ว่ามีข้อผิดพลาดก่อน
พรอมต์:
1ฉันต้องการสร้างเสียงพากย์ สคริปต์อยู่ที่ @(script.txt ของคุณ)23ข้อกำหนด:41. เรียกใช้ Doubao TTS API เพื่อสร้างเสียงอิสระสำหรับแต่ละช็อต52. อ่านระยะเวลาจริงของไฟล์เสียงแต่ละไฟล์63. ถ้าระยะเวลาแตกต่างจากช็อตอ้างอิง ให้บันทึกความแตกต่าง74. รวมเป็น final_voice.mp385. อัปเดต recipe.json ด้วยระยะเวลาจริง
Codex จะปรับจังหวะวิดีโอตามเสียง ถ้าเสียงพากย์ยาว 5 วินาทีสำหรับช็อตอ้างอิงที่ยาว 3 วินาที ช็อตในวิดีโอสุดท้ายจะถูกขยายเป็น 5 วินาที

4. สร้างดราฟต์และโปรเจกต์ CapCut
การสร้างดราฟต์ CapCut ซับซ้อนเพราะฟอร์แมตค่อนข้างเข้มงวดเรื่อง ID และพาธ ผมใส่กฎในพรอมต์เพื่อหลีกเลี่ยงข้อผิดพลาด
พรอมต์:
1ฉันต้องการสร้างวิดีโอสุดท้ายและดราฟต์ CapCut23อินพุต:4- recipe.json, matches.json, พาธวัสดุ, ไฟล์เสียงพากย์, สคริปต์56เอาต์พุต:71. เรนเดอร์วิดีโอตัวอย่าง: work/remix.mp482. ไฟล์ซับไตเติ้ล: work/captions.srt93. ดราฟต์ CapCut: work/jianying_draft/1011ข้อกำหนด:12- จับคู่วัสดุตาม recipe และ matches.json13- ใช้ระยะเวลาเสียงพากย์เป็นหลัก14- ตรวจสอบให้แน่ใจว่า Content ID, Metadata ID และ Root Index ID สอดคล้องกันและไม่ซ้ำ15- ใช้พาธสัมบูรณ์สำหรับวัสดุ

ตรวจสอบว่าดราฟต์เปิดได้ถูกต้อง วัสดุแสดงผล และซับไตเติ้ล/เสียงตรงกัน
คำทิ้งท้าย
ทั้งกระบวนการจากวิดีโออ้างอิงถึงดราฟต์ใช้เวลาประมาณ 20-30 นาที ถ้ามีคลังพร้อม ใช้เวลาแค่ 5 นาทีต่อวิดีโอ
เมื่อเวิร์กโฟลว์ลื่นแล้ว ให้บอก Codex: ช่วยฉันแพ็กเวิร์กโฟลว์นี้เป็น Skill หน่อย ครั้งต่อไปก็แค่เรียกใช้ Skill
หวังว่าสิ่งนี้จะเป็นประโยชน์ ขอให้โชคดี! 🍀
(เทมเพลต AGENTS.md ละไว้ในที่นี้เพื่อความกระชับ แต่มีอยู่ในข้อความต้นฉบับ)





