สร้างวิดีโอด้วย H3 — จากบทถึงคลิปจริง ทีละขั้น
คนส่วนใหญ่ที่ลองสร้างวิดีโอด้วย AI ครั้งแรกมักทำแบบเดียวกัน — เปิดเครื่องมือขึ้นมา พิมพ์คำบรรยายฉากลงไป กดสร้าง แล้วรอดูว่าจะได้อะไร
ผลที่ได้มักจะเป็นคลิปสวย ๆ หนึ่งคลิป ที่เอาไปต่อกับคลิปอื่นไม่ได้ เพราะตัวละครหน้าไม่เหมือนกัน แสงคนละอย่าง สไตล์ภาพเพี้ยนไปคนละทาง
การสร้างวิดีโอด้วย H3 ให้ออกมาเป็นเรื่องเป็นราวไม่ได้เริ่มที่การเขียน prompt แต่เริ่มที่การเตรียมของก่อนหน้านั้น บทความนี้จะพาไปทีละขั้นตามลำดับที่ทำงานจริง
ภาพรวม 5 ขั้น
| ขั้น | ทำอะไร | ได้อะไรออกมา |
|---|---|---|
| 1 | ล็อกหน้าตัวละคร | character sheet 6 มุม |
| 2 | วางช็อต | สตอรี่บอร์ด 6 ช็อต |
| 3 | เขียน prompt | prompt H3 ต่อช็อต |
| 4 | เรนเดอร์ | คลิปดิบพร้อมเสียง |
| 5 | ตัดต่อ | คลิปสมบูรณ์ |
สังเกตว่าการเขียน prompt อยู่กลางทาง ไม่ใช่ขั้นแรก เพราะ prompt ที่ดีต้องอ้างอิงของที่มีอยู่แล้ว
ขั้นที่ 1 — ล็อกหน้าตัวละครก่อน
นี่คือขั้นที่คนข้ามบ่อยที่สุด และเป็นสาเหตุอันดับหนึ่งที่คลิปออกมาต่อกันไม่ได้
ปัญหาคือ ถ้าคุณอธิบายตัวละครด้วยข้อความอย่างเดียว — "ผู้หญิงไทยอายุสามสิบ ผมยาวสีดำ ใส่เสื้อเชิ้ตขาว" — โมเดลจะตีความใหม่ทุกครั้งที่เรนเดอร์ ช็อตแรกได้หน้าหนึ่ง ช็อตที่สองได้อีกหน้าหนึ่ง ทั้งที่คำบรรยายเหมือนกันเป๊ะ
วิธีแก้คือทำ character sheet — ภาพอ้างอิงตัวละครที่แสดงหน้าและร่างกายจากหลายมุมในภาพเดียว รูปแบบที่ใช้ได้ดีคือ 6 พาเนล เรียงเป็นกริด 3×2 ซึ่งให้มุมมองครบพอที่โมเดลจะเข้าใจโครงหน้าและสัดส่วน
สิ่งที่ต้องคงที่ทุกพาเนล:
- โครงหน้าและสีผิว
- ทรงผมและสีผม
- เสื้อผ้าและสีเสื้อผ้า
- สัดส่วนร่างกาย
- ของประจำตัว เช่น แว่น สร้อย รอยสัก
พอมี character sheet แล้ว คุณจะเอาไปเสียบเป็นภาพอ้างอิงใน Full-Reference Mode ของ H3 ซึ่งเป็นวิธีบอกโมเดลว่า "คนนี้หน้าแบบนี้ ใช้หน้านี้ทุกช็อต" แทนที่จะหวังว่ามันจะเดาถูก
เคล็ดลับ: ถ้าเรื่องมีตัวละคร 3 คน ให้ทำ character sheet แยกคนละใบ อย่ารวมทุกคนไว้ในใบเดียว เพราะเวลาอ้างถึงในภายหลังจะสับสน
ขั้นที่ 2 — วางช็อตเป็นสตอรี่บอร์ด
พอมีตัวละครแล้ว ขั้นถัดไปคือตัดสินใจว่าคลิปนี้จะเล่าด้วยกี่ช็อต และแต่ละช็อตเห็นอะไร
ทำไมต้องมีสตอรี่บอร์ด? เพราะ H3 สร้างคลิปได้ทีละช็อต การมีภาพรวมก่อนช่วยให้คุณ:
- รู้ว่าต้องเรนเดอร์กี่ครั้ง คำนวณเวลาและค่าใช้จ่ายได้
- เห็นว่าช็อตไหนต่อกับช็อตไหน จะได้คุมทิศทางการมองและตำแหน่งตัวละครให้ต่อเนื่อง
- ใช้ภาพจากสตอรี่บอร์ดเป็นเฟรมแรกของแต่ละช็อตได้เลย
รูปแบบที่ใช้ได้ดีคือ สตอรี่บอร์ดแผ่นเดียว 6 พาเนล มีเลขกำกับชัดเจน โดยแต่ละพาเนลออกแบบเป็น ช็อตแนวตั้ง 9:16 ถ้าทำคอนเทนต์ลง TikTok, Reels หรือ Shorts
สไตล์ภาพของทั้งแผ่นต้องคงที่ ไม่ใช่พาเนลหนึ่งเป็นภาพเหมือนจริง อีกพาเนลเป็นการ์ตูน เพราะภาพพวกนี้จะกลายเป็นจุดตั้งต้นของคลิปจริง
ถ้าอยากเข้าใจหลักการวางช็อตให้ลึกขึ้น ลองอ่าน AI ทำวิดีโอ Storyboard อัตโนมัติ — Workflow Pro
ขั้นที่ 3 — เขียน prompt แยกทีละช็อต
ตอนนี้คุณมีหน้าตัวละครและมีช็อตแล้ว ถึงเวลาแปลงเป็น prompt
H3 ใช้ prompt ที่แบ่งเป็นสามช่อง:
integrated_multimodal_description: ...
overall_soundscape: ...
non_diegetic_music: ...
ช่องแรกคือไทม์ไลน์ของคลิป ช่องที่สองคือเสียงบรรยากาศ ช่องที่สามคือดนตรีประกอบที่มีแต่คนดูได้ยิน
หลักสำคัญที่สุด — เขียนเฉพาะสิ่งที่เห็นหรือได้ยิน
ประโยคที่ใช้ไม่ได้:
- "ฉากนี้เต็มไปด้วยความเศร้า"
- "โมเมนต์ที่ทรงพลัง"
- "ตัวละครรู้สึกสิ้นหวัง"
เขียนเป็นหลักฐานที่จับต้องได้แทน:
- ตาลดต่ำลง มองพื้น
- ไหล่ผ่อนลง ลมหายใจสั่น
- เสียงพูดค่อยลงจนแทบไม่ได้ยิน
- ฝนกระทบกระจกหน้าต่างดังขึ้นเรื่อย ๆ
โมเดลแปลงคำว่า "เศร้า" เป็นภาพไม่ได้ แต่แปลง "ตาลดต่ำลง" ได้ทันที
เรื่องบทพูดภาษาไทย H3 รองรับตรง ๆ โดยครอบข้อความด้วยแท็กที่ระบุภาษา แล้วบรรยายวิธีพูดไว้นอกแท็ก ไม่ใช่ข้างใน เช่นบอกว่าพูดด้วยเสียงต่ำ ควบคุมอารมณ์ สำเนียงเหนือ แล้วค่อยตามด้วยตัวบทพูด
รายละเอียดของแต่ละช่อง คำศัพท์การเคลื่อนกล้อง และวิธีจัดการบทพูดหลายคน อ่านต่อได้ที่ เขียน H3 Prompt ให้ได้คลิปตรงใจ
ขั้นที่ 4 — เรนเดอร์
ขั้นนี้ต้องมีเครื่องที่รัน H3 ได้ ซึ่งหมายถึง GPU ที่มี VRAM 32 GB ขึ้นไป
คนส่วนใหญ่เช่าเป็นรายชั่วโมงแทนการซื้อการ์ด ราคาราว $0.45–$0.95 ต่อชั่วโมงสำหรับ RTX 5090 วิธีเช่าและวิธีคุมค่าใช้จ่ายอ่านได้ที่ เช่าเครื่อง GPU ทำ H3 บน vast.ai
เมื่อเข้า ComfyUI ได้แล้ว ลำดับการทำงานคือ:
- เสียบภาพอ้างอิง — character sheet และภาพเฟรมแรกจากสตอรี่บอร์ด เรียงลำดับให้ตรงกับที่อ้างใน prompt
- วาง prompt ลงในช่องข้อความ
- ตั้งความยาว เป็นวินาที ระบบจะแปลงเป็นเฟรมให้เอง
- กดรัน แล้วรอ
เรื่องความยาวคลิปที่ควรรู้ — อย่ายัดหลายเหตุการณ์ลงในคลิปสั้น ๆ
| ความยาว | ควรมี |
|---|---|
| 5–6 วินาที | 1 ช็อต, 1 การกระทำหลัก, บทพูดไม่เกิน 1 ประโยคสั้น |
| 8–10 วินาที | 1 ช็อตยาว หรือ 2 ช็อตง่าย ๆ, บทพูด 1–2 ประโยค |
| 15–20 วินาที | 2–4 ช็อต, บทสนทนาโต้ตอบสั้น, มีต้น-กลาง-จบชัดเจน |
ถ้าเขียนบทพูดยาวสามประโยคลงในคลิป 6 วินาที โมเดลจะบีบให้พูดเร็วผิดธรรมชาติ หรือตัดกลางคัน
เรื่องความละเอียด วิธีที่เร็วที่สุดคือเรนเดอร์ร่างที่ความละเอียดต่ำก่อน (ราว 0.2 megapixels) แล้วค่อยขยายใน latent ไปที่ 1.0 megapixels แล้วเก็บรายละเอียดอีกไม่กี่ step วิธีนี้ให้คุณภาพเท่าการเรนเดอร์เต็มรอบเดียวแต่ใช้เวลาน้อยกว่ามาก ดูรายละเอียด workflow ได้ที่ ComfyUI H3 — ติดตั้งและใช้ workflow
ขั้นที่ 5 — ตัดต่อรวมเป็นคลิปสมบูรณ์
H3 ให้คลิปพร้อมเสียงมาแล้ว แต่ยังเป็นคลิปแยกช็อต ต้องเอามาต่อกัน
งานที่เหลือในโปรแกรมตัดต่อ:
- เรียงช็อตตามสตอรี่บอร์ด และตัดหัวท้ายที่ไม่ต้องการ
- ปรับระดับเสียง ให้แต่ละช็อตดังเท่ากัน เพราะเสียงที่โมเดลสร้างอาจไม่เท่ากันทุกคลิป
- ใส่ซับไตเติล ถ้าจะลงโซเชียล เพราะคนส่วนใหญ่ดูโดยปิดเสียง
- ใส่ดนตรีคลุมทั้งเรื่อง ถ้าอยากได้โทนเดียวกันตลอด แทนที่จะให้แต่ละช็อตมีดนตรีของตัวเอง
เคล็ดลับเรื่องดนตรี: ถ้าจะใส่ดนตรีคลุมทั้งเรื่องในขั้นตัดต่ออยู่แล้ว ให้ตั้งช่องดนตรีประกอบใน prompt เป็นค่าว่างไปเลย จะได้ไม่มีดนตรีสองชั้นทับกัน
ข้อผิดพลาดที่เจอบ่อย
เขียน prompt ก่อนมีภาพตัวละคร — จบลงที่ตัวละครหน้าเปลี่ยนทุกช็อต ต้องเรนเดอร์ใหม่ทั้งหมด
เสียบภาพอ้างอิงสลับลำดับ — prompt อ้างถึงภาพใบที่สองว่าเป็นตัวละครหญิง แต่เสียบไฟล์ผิดลำดับ โมเดลจะสร้างผิดคนโดยไม่มีอะไรเตือน
ยัดบทพูดยาวในคลิปสั้น — ได้เสียงพูดเร็วผิดธรรมชาติ หรือประโยคขาดกลางคัน
ลืมปิดเครื่องที่เช่า — ค่าใช้จ่ายบานปลายโดยไม่ได้งานเพิ่ม
เรนเดอร์ที่ความละเอียดเต็มตั้งแต่รอบแรก — เสียเวลาเป็นเท่าตัวโดยไม่จำเป็น ทั้งที่การเรนเดอร์ร่างก่อนให้ผลเหมือนกัน
สรุป
การสร้างวิดีโอด้วย H3 ให้ออกมาเป็นเรื่องเป็นราวคือการทำงานเป็นสายพาน ไม่ใช่การกดปุ่มเดียว
ล็อกหน้าตัวละครก่อน ด้วย character sheet แล้ว วางช็อต เป็นสตอรี่บอร์ด จากนั้นค่อย เขียน prompt ที่อ้างอิงของสองอย่างนั้น แล้ว เรนเดอร์ ด้วยวิธีสองรอบเพื่อประหยัดเวลา สุดท้าย ตัดต่อ รวมเป็นคลิปสมบูรณ์
ขั้นที่คนข้ามบ่อยที่สุดคือขั้นแรก และเป็นขั้นที่ทำให้ต้องกลับมาเรนเดอร์ใหม่ทั้งหมด ถ้าจำอะไรจากบทความนี้ได้อย่างเดียว ให้จำว่า อย่าเริ่มที่ prompt
อยากได้เครื่องมือที่ทำสามขั้นแรกให้อัตโนมัติ? AI Unlocked มีคอร์สสร้างละครสั้นด้วย H3 พร้อมสกิลสำหรับสร้าง character sheet, สตอรี่บอร์ด และ prompt ที่ใช้ได้ทันที ดูแพ็กเกจได้ที่ หน้าราคา
เขียนโดย
AI Unlocked Team
บทความอื่นๆ ที่น่าสนใจ
เขียน H3 Prompt ให้ได้คลิปตรงใจ — คู่มือฉบับใช้งานจริง
วิธีเขียน prompt MiniMax H3 ครบทุกช่อง ตั้งแต่ integrated_multimodal_description, soundscape, ดนตรีประกอบ ไปจนถึงคำศัพท์การเคลื่อนกล้อง บทพูดภาษาไทย และการคุมจังหวะให้พอดีความยาวคลิป
เช่าเครื่อง GPU ทำ H3 บน vast.ai — ทีละขั้น ไม่ให้เงินรั่ว
วิธีเช่าเครื่อง GPU รัน MiniMax H3 บน vast.ai ตั้งแต่สมัคร เติมเครดิต เลือกการ์ด ตั้ง disk 100 GB จนถึงเปิด ComfyUI พร้อมวิธีคุมค่าใช้จ่ายไม่ให้เครื่องกินเงินตอนไม่ได้ใช้
ComfyUI H3 — ติดตั้งและใช้ workflow สร้างวิดีโอพร้อมเสียง
คู่มือ ComfyUI H3 ตั้งแต่วางไฟล์โมเดล MiniMax H3 ลงโฟลเดอร์ให้ถูก จนถึงใช้ workflow แบบสองรอบที่เรนเดอร์ร่างก่อนแล้วขยายใน latent พร้อมกับดักที่ทำให้ workflow พัง
