คู่มือทีละขั้นตอนในการสร้างวิดีโอไวรัล Douyin ใหม่ด้วย Codex + Hypit

204K
468
92
29
937

TL;DR

คู่มือฉบับสมบูรณ์เกี่ยวกับการใช้เอนจินโอเพนซอร์ส Hypit ร่วมกับ Codex เพื่อสร้างวิดีโอขนาดสั้นที่ไวรัลขึ้นใหม่ โดยอธิบายรายละเอียดการตั้งค่าเอเจนต์ AI สำหรับการสร้างทรัพยากร การตัดต่อ และการรวมภาพ

Hypit คืออะไร?

Hypit เป็นโปรเจกต์โอเพนซอร์สที่ช่วยให้ AI Agents สามารถสร้างวิดีโอได้ โดยคุณเพียงส่งวิดีโออ้างอิง ภาพตัวละคร และข้อกำหนดต่างๆ ไปยัง Codex จากนั้น Agent จะใช้ Hypit ในการจัดการกระบวนการสร้างสินทรัพย์ (Asset Generation) การตัดต่อ ซับไตเติล และเอฟเฟกต์ภาพซ้อนภาพ (Picture-in-Picture) ก่อนที่จะส่งออกเป็นไฟล์วิดีโอในที่สุด

นอกจากนี้ ระบบยังเก็บรักษาไฟล์โปรเจกต์ที่สามารถแก้ไขต่อได้ไว้ด้วย หากคุณต้องการเปลี่ยนซับไตเติลหรือปรับตำแหน่งภาพซ้อนภาพในภายหลัง คุณสามารถนำสินทรัพย์ที่สร้างไปแล้วกลับมาใช้และดำเนินการแก้ไขต่อได้ทันที

ที่อยู่แหล่งโค้ดแบบเปิด: hypit-ai/hypit

มาดูผลงานที่เสร็จสมบูรณ์กันก่อน ทางซ้ายคือวิดีโอต้นฉบับจากช่อง "Chao Ge Shuo Che" (พี่เฉาเล่าเรื่องรถ) ส่วนทางขวาคือเวอร์ชันที่ผมทำซ้ำโดยใช้ตัวละครชื่อ "Han Li"

雪踏乌云 - inline image

วิดีโอนี้สร้างขึ้นโดยใช้ API Minimax H3 ของผมเอง หากคุณใช้ API อย่างเป็นทางการหรือ SeedDance ผลลัพธ์ที่ได้จะดียิ่งกว่านี้อีก

ด้านล่างนี้ เราจะเริ่มตั้งแต่ขั้นตอนการติดตั้งไปจนถึงการใช้งานจริงอย่างครบถ้วน การตั้งค่าโมเดลมีสองทางเลือก: ใช้บริการในตัวหากคุณมีเครดิต Hypit หรือเชื่อมต่อ API ของคุณเองหากคุณไม่มี ตัวอย่างนี้จะสาธิตผ่านเส้นทางที่สองคือการเชื่อมต่อกับ API ของตนเอง

  1. ชี้แจงบทบาทหน้าที่: Hypit, Codex และโมเดลสำหรับสร้างเนื้อหา (Generation Models) มีหน้าที่อะไรบ้าง?

เราต้องทำความเข้าใจหน้าที่เฉพาะของแต่ละเครื่องมือในเวิร์กโฟลว์นี้ให้ชัดเจนเพื่อป้องกันความสับสน:

  • บทบาทของ Codex: ในฐานะผู้ช่วยด้านโค้ดและวิศวกรรม Codex ทำหน้าที่วิเคราะห์คำขอของผู้ใช้ที่เป็นภาษาธรรมชาติ ตรวจสอบและกำหนดค่าสภาพแวดล้อมการพัฒนาบนเครื่องของคุณ อ่านและแยกโครงสร้างสตอรี่บอร์ดจากวิดีโออ้างอิง สร้างและแก้ไขไฟล์ต้นฉบับของโปรเจกต์ รวมถึงจัดการการเรียกใช้งานเอนจินพื้นฐานเพื่อให้กระบวนการทำงานอัตโนมัติสำเร็จลุล่วง
  • บทบาทของโมเดลสร้างภาพและวิดีโอ: รับผิดชอบโดยตรงในการสร้างสินทรัพย์ภาพนิ่งและฉากเคลื่อนไหว ในตัวอย่างนี้ โมเดลสร้างภาพจะสร้างเฟรมแรกของชายแต่งกายโบราณในห้องไลฟ์สตรีมสมัยใหม่ ในขณะที่โมเดลสร้างวิดีโอจะขับเคลื่อนเฟรมแรกนั้นให้กลายเป็นภาพโฮสต์กำลังพูด และสร้างช็อตภายนอกเกี่ยวกับสภาพจราจรตามคำสั่ง (Prompt) ที่กำหนด
  • บทบาทของเอนจิน Hypit: ในฐานะศูนย์กลางการประสานงานหลัก Hypit บันทึกความสัมพันธ์ของสินทรัพย์ทั้งหมดที่ถูกสร้างขึ้น กำหนดลำดับช็อตและจังหวะการเปลี่ยนฉาก ควบคุมเวลาและการปรากฏตัวของซับไตเติล จัดการตำแหน่ง ชั้นวาง (Layering) และมาสก์ขอบโค้งของภาพซ้อนภาพ รวมถึงเรียกใช้ตัวเรนเดอร์พื้นฐานเพื่อรวมภาพเป็นวิดีโอสุดท้ายเมื่อสินทรัพย์พร้อมใช้งาน

เพื่อรองรับสถานการณ์ที่แตกต่างกันของผู้เรียนแต่ละคน บทเรียนนี้จึงแยกการกำหนดค่าโมเดลสำหรับการสร้างเนื้อหาออกเป็นสองเส้นทางอิสระ:

  • เส้นทาง A: คุณมีเครดิตเหลืออยู่ในบัญชี Hypit และเรียกใช้โมเดลที่โฮสต์ไว้ภายในระบบโดยตรงผ่านบริการ HypiHub อย่างเป็นทางการ
  • เส้นทาง B: คุณไม่มีเครดิตบนแพลตฟอร์ม Hypit และต้องกำหนดค่าและเชื่อมต่ออินเทอร์เฟซ API ของบุคคลที่สามที่คุณมีอยู่ด้วยตนเอง

คุณจำเป็นต้องเลือกเพียงหนึ่งเส้นทาง (A หรือ B) ที่เหมาะสมกับเงื่อนไขของคุณเพื่อทำการตั้งค่าให้เสร็จสิ้น จากนั้นจึงเข้าสู่ขั้นตอนการผลิตและประสานงานทั่วไปร่วมกัน

  1. การเตรียมความพร้อมและสเปคของสินทรัพย์

ก่อนเริ่มต้น ให้เตรียม Codex วิดีโออ้างอิงที่ชัดเจน และภาพอ้างอิงของตัวละครเป้าหมายที่คุณต้องการนำมาแทนที่

ภาพอ้างอิงของตัวละครควรเป็นภาพถ่ายเดี่ยวที่มีลักษณะใบหน้าเด่นชัด แสงสว่างสม่ำเสมอ และเห็นรายละเอียดเสื้อผ้า/ทรงผมชัดเจน เนื่องจากภาพอ้างอิงไม่มีข้อมูลการเคลื่อนไหว อย่าคาดหวังว่าโมเดลจะเลียนแบบท่าทาง เช่น การยักไหล่ หรือท่าทางมือ ของโฮสต์ต้นฉบับโดยอัตโนมัติจากภาพนิ่งเพียงอย่างเดียว

หากคุณวางแผนจะเผยแพร่ผลลัพธ์ต่อสาธารณะและไม่ต้องการใช้เสียงของโฮสต์ต้นฉบับ ให้บันทึกเสียงบทสนทนาสำรองก่อนเริ่มการผลิตจริง การเปลี่ยนเสียงพากย์จะส่งผลต่อการหยุดเว้นวรรคและความยาวของแต่ละส่วน ซึ่งจำเป็นต้องมีการจัดตำแหน่งการตัดต่อและเวลาซับไตเติลใหม่ทั้งหมด

  1. การติดตั้ง

รันคำสั่งติดตั้ง Skill แบบทั่วโลก (Global Installation) ตามทางการ:

npx skills add hypit-ai/hypit -g

ดูจุดเริ่มต้นการติดตั้งได้ที่ Hypit Repository และอ่านขั้นตอนกระบวนการอย่างละเอียดได้ที่ คู่มือเริ่มต้นอย่างรวดเร็วอย่างเป็นทางการ

เส้นทาง A: มีเครดิต Hypit ใช้บริการในตัว

หากคุณมีเครดิต คุณสามารถให้ Codex ใช้บริการในตัว Hypit ได้โดยตรงโดยไม่ต้องกำหนดค่า API ของคุณเอง

โปรดใช้บริการในตัว Hypit เพื่อช่วยฉันเข้าสู่ระบบ ตรวจสอบโมเดลที่ใช้ได้และจำนวนเครดิตที่เหลือ บอกประมาณการค่าใช้จ่ายก่อน แล้วค่อยเริ่มกระบวนการสร้าง

เส้นทาง B: ไม่มีเครดิต Hypit ใช้ API ของตัวเอง

ครั้งนี้ผมเลือกใช้เส้นทาง API ของตนเอง: ใช้ Google สำหรับสร้างภาพ และ MiniMax H3 Max จาก ZenMux สำหรับสร้างวิดีโอ

ผมให้ Codex กำหนดค่าอินเทอร์เฟซก่อน ยืนยันว่าสามารถเรียกใช้โมเดลได้ แล้วจึงดำเนินการผลิตต่อ

ใช้ Google API สำหรับสร้างภาพและ MiniMax H3 Max จาก ZenMux สำหรับสร้างวิดีโอ ช่วยฉันกำหนดค่าให้เสร็จและตรวจสอบความพร้อมใช้งาน หากต้องทดสอบแบบเสียเงิน กรุณาอธิบายต้นทุนก่อน

雪踏乌云 - inline image

ส่งวิดีโอต้นฉบับและภาพ Han Li ให้ Codex

ต่อมา ผมส่งลิงก์วิดีโอของ "Chao Ge Shuo Che" พร้อมภาพของ Han Li ไปยัง Codex โดยระบุให้ทำซ้ำเฉพาะ 20 วินาทีแรกเท่านั้น

โปรดทำซ้ำ 20 วินาทีแรกของวิดีโอนี้ โดยเปลี่ยนตัวละครเป็นภาพ Han Li ที่ฉันให้ไว้ รักษาสัดส่วนองค์ประกอบ จังหวะการตัดต่อ ซับไตเติล และภาพซ้อนภาพตามต้นฉบับ เก็บเสียงต้นฉบับไว้ ดำเนินการทั้งหมดภายในโปรเจกต์ Hypit เดียวกัน

ต้องระบุขอบเขตการทำซ้ำให้ชัดเจน มิฉะนั้นสำหรับวิดีโอต้นฉบับที่ยาวเกิน 10 นาที Codex อาจวางแผนครอบคลุมทั้งคลิป

雪踏乌云 - inline image

ตรวจสอบเฟรมแรกก่อนสร้างวิดีโอ

ผมให้ Codex แยกช็อตและสร้างเฟรมแรกสี่ภาพ: Han Li ในห้องไลฟ์สตรีม, สภาพจราจรยามพระอาทิตย์ตกดิน, รถ Mercedes สีขาวในอุโมงค์, และสภาพจราจรกลางวัน

ขั้นตอนนี้เน้นตรวจสอบว่าตัวละครดูถูกต้อง เสื้อผ้าเรียบร้อย และฉากไม่บิดเบือน หากเฟรมแรกยังไม่เป็นที่พอใจ ให้แก้ไขก่อนแล้วจึงดำเนินการสร้างวิดีโอแบบไดนามิกต่อ

โปรดแสดงเฟรมแรกของทั้งสี่ฉากก่อน รักษาใบหน้า ผมยาว และชุดคลุมสีน้ำเงินทองของ Han Li ไว้ ช็อตรถยนต์ไม่ควร包含โฮสต์ต้นฉบับ ซับไตเติล หรือภาพซ้อนภาพ; สิ่งเหล่านี้จะถูกเพิ่มโดย Hypit ในภายหลังอย่างเป็นเอกภาพ

[แทรกเฟรมแรกของ Han Li ในห้องไลฟ์สตรีมที่นี่]

ให้ Codex สร้างส่วนย่อย แล้วรวมภาพด้วย Hypit

หลังจากยืนยันเฟรมแรกแล้ว ผมให้ Codex สร้างส่วนโฮสต์สี่ช่วงและส่วนรถยนต์สามช่วง โดยขอให้มีความยาวช่วงละ 5 วินาที จากนั้นใช้ Hypit รวมเป็นวิดีโอสุดท้ายความยาว 20 วินาที

โมเดลทำหน้าที่สร้างภาพ ส่วน Hypit ดูแลเรื่องการตัดต่อ ซับไตเติล และภาพซ้อนภาพ

โปรดสร้างสินทรัพย์แบบไดนามิกตามเฟรมแรกและงบประมาณที่ยืนยันแล้ว จากนั้นรวมเป็นวิดีโอ 20 วินาทีตามจังหวะต้นฉบับ เมื่อปรากฏช็อตรถยนต์ ให้วาง Han Li ในภาพซ้อนภาพตรงกลางด้านล่าง พร้อมเสียงต้นฉบับและซับไตเติล นำสินทรัพย์ที่สร้างไปแล้วกลับมาใช้โดยตรง ไม่ต้องสร้างใหม่

雪踏乌云 - inline image

ครั้งนี้ ตั้งแต่ขั้นตอนวิดีโออ้างอิงจนถึงเวอร์ชัน Han Li ที่เสร็จสมบูรณ์ งานหลักของผมคือการแจ้งข้อกำหนดให้ Codex ทราบ ตรวจทานผลลัพธ์ และบอกมันว่าสิ่งใดที่ต้องปรับปรุง

Hypit ไม่ได้ทิ้งไว้แค่ไฟล์วิดีโอ แต่ทิ้งโปรเจกต์ที่สามารถแก้ไขต่อได้ ครั้งหน้าหากคุณต้องการเปลี่ยนตัวละคร แก้ไขซับไตเติล หรือปรับภาพซ้อนภาพ คุณสามารถดำเนินการต่อจากโปรเจกต์นี้ได้ทันที

แน่นอนว่าการเคลื่อนไหวและการขยับปากในปัจจุบันยังไม่สามารถทำซ้ำได้ 1:1 อย่างสมบูรณ์แบบ การใช้โมเดลที่ดีขึ้นเช่นซีรีส์ Seedance จะช่วยปรับปรุงคุณภาพในส่วนนี้ได้อย่างมาก หากสนใจ ลองหาวิดีโอสั้นๆ ความยาว 10-20 วินาทีมาทดลองก่อน เพื่อดูว่าขั้นตอนใดบ้างที่ระบบจะช่วยประหยัดเวลาให้คุณ

ที่อยู่โปรเจกต์: hypit-ai/hypit หากคุณพบว่ามันมีประโยชน์ โปรดพิจารณาให้ดาวแก่โปรเจกต์นี้

สร้างต่อใน YouMind

Turn one viral article into a full content workflow

Collect the source, decode the pattern, create assets, draft the story, and distribute from one AI workspace.

Explore YouMind
สำหรับครีเอเตอร์

เปลี่ยน Markdown ของคุณให้เป็นบทความ 𝕏 ที่สะอาดตา

เวลาคุณเผยแพร่งานเขียนยาวของตัวเอง การจัดรูปแบบรูปภาพ ตาราง และบล็อกโค้ดให้เข้ากับ 𝕏 นั้นน่าปวดหัว YouMind เปลี่ยนร่าง Markdown ทั้งฉบับให้เป็นบทความ 𝕏 ที่สะอาดตาและพร้อมโพสต์ทันที

ลอง Markdown เป็น 𝕏

แพตเทิร์นให้ถอดรหัสเพิ่มเติม

บทความไวรัลล่าสุด

สำรวจบทความไวรัลเพิ่มเติม