MiniMax H3Prompt EngineeringAI VideoH3 PromptAI Prompt

เขียน H3 Prompt ให้ได้คลิปตรงใจ — คู่มือฉบับใช้งานจริง

วิธีเขียน prompt MiniMax H3 ครบทุกช่อง ตั้งแต่ integrated_multimodal_description, soundscape, ดนตรีประกอบ ไปจนถึงคำศัพท์การเคลื่อนกล้อง บทพูดภาษาไทย และการคุมจังหวะให้พอดีความยาวคลิป

AI Unlocked Team
01/09/2569

เขียน H3 Prompt ให้ได้คลิปตรงใจ — คู่มือฉบับใช้งานจริง

Prompt ของ MiniMax H3 ไม่เหมือน prompt ของโมเดลวิดีโอทั่วไป มันไม่ใช่ก้อนข้อความเดียวที่คุณพิมพ์ยาว ๆ แล้วหวังผล แต่มีโครงสร้างที่กำหนดไว้ชัดเจน และการเขียนผิดช่องทำให้ผลลัพธ์เพี้ยนได้ทันที

ถ้าคุณเคยเขียน prompt ให้ Runway หรือ Kling แล้วเอามาใช้กับ H3 ตรง ๆ คุณจะได้คลิปที่ใช้งานไม่ได้ — ไม่ใช่เพราะโมเดลไม่ดี แต่เพราะยังไม่ได้บอกมันในภาษาที่มันเข้าใจ

บทความนี้อธิบายโครงสร้าง prompt ของ H3 ทีละส่วน พร้อมกฎที่ต้องรู้

โครงสร้างสามช่อง

Prompt ปกติของ H3 ประกอบด้วยสามช่อง เขียนเรียงกันแบบนี้:

integrated_multimodal_description: ...

overall_soundscape: ...

non_diegetic_music: ...

แต่ละช่องมีหน้าที่ต่างกันชัดเจน และการเอาเนื้อหาไปใส่ผิดช่องคือความผิดพลาดที่พบบ่อยที่สุด

ช่องที่ 1 — integrated_multimodal_description

นี่คือไทม์ไลน์หลักของคลิป ทุกอย่างที่เกิดขึ้นตามลำดับเวลาอยู่ในช่องนี้ ประกอบด้วย:

  • สไตล์ภาพ
  • องค์ประกอบและขนาดภาพ
  • หน้าตาและตำแหน่งของตัวละคร
  • สภาพแวดล้อมและแสง
  • การกระทำและปฏิกิริยา
  • การเปลี่ยนแปลงของวัตถุในฉาก
  • การเคลื่อนกล้อง
  • บทพูด
  • เสียงที่เกิดพร้อมภาพในฉาก
  • การตัดข้ามช็อต

ช็อตแรกต้องเริ่มด้วยสไตล์ภาพและองค์ประกอบตั้งต้น เพราะเป็นตัวกำหนดโทนของทั้งคลิป เช่นเริ่มด้วยการบอกว่าเป็นภาพเหมือนจริงแนวภาพยนตร์ ถ่ายเป็นภาพระยะกลางค่อนกว้าง แล้วค่อยบรรยายว่าในเฟรมมีอะไร

ช่องที่ 2 — overall_soundscape

เสียงบรรยากาศรวมของคลิป เขียนเป็นภาษาอังกฤษ 1–4 ประโยคในย่อหน้าเดียว ครอบคลุม:

  • บรรยากาศและสภาพอากาศ
  • เสียงฝีเท้า
  • เสียงผ้าเสียดสี
  • เสียงกระแทก เสียงประตู
  • เสียงหายใจและเสียงมนุษย์ที่ไม่ใช่คำพูด
  • เสียงจากวัตถุ

ห้ามเอาบทพูดหรือเนื้อเพลงมาเขียนซ้ำในช่องนี้ เพราะจะทำให้เสียงซ้อนกัน

ถ้าต้องการความเงียบสนิทจริง ๆ ให้ใส่ค่าว่างไว้ แต่กรณีนี้เกิดขึ้นน้อยมาก คลิปที่ไม่มีเสียงบรรยากาศเลยจะรู้สึกเหมือนภาพนิ่งที่ขยับได้

ช่องที่ 3 — non_diegetic_music

ดนตรีที่ มีแต่คนดูได้ยิน ตัวละครในฉากไม่ได้ยิน

เขียนให้เป็นรูปธรรม บอกเครื่องดนตรี จังหวะ และการพัฒนาของเสียง อย่าเขียนแค่อารมณ์กว้าง ๆ

ตัวอย่างที่ดี: เสียงเปียโนเป็นโน้ตห่าง ๆ จังหวะช้า มีเสียงเครื่องสายต่ำคลอ ค่อย ๆ ดังขึ้นก่อนจะเฟดหายไป

ตัวอย่างที่แย่: ดนตรีที่ให้ความรู้สึกเศร้าและลึกลับ

ถ้าไม่ต้องการดนตรีประกอบ ให้ใส่ค่าว่างไว้ ซึ่งเป็นทางเลือกที่ดีถ้าคุณตั้งใจจะใส่ดนตรีเองในขั้นตัดต่ออยู่แล้ว

เส้นแบ่งที่คนสับสนที่สุด — เสียงในฉาก vs ดนตรีประกอบ

นี่คือจุดที่ผิดกันมากที่สุด

ถ้าเสียงนั้นเกิดขึ้นในฉากและตัวละครได้ยินด้วย — วิทยุที่เปิดอยู่ในร้าน เพลงจากโทรศัพท์ วงดนตรีที่เล่นอยู่ในผับ เสียงทีวี — เสียงพวกนี้เป็น เสียงในฉาก ต้องไปอยู่ในช่องแรก ไม่ใช่ช่องดนตรีประกอบ

ถ้าเสียงนั้นมีแต่คนดูได้ยิน — สกอร์ประกอบที่ลอยมาจากไหนไม่รู้ — นั่นคือช่องที่สาม

เขียนผิดช่องแล้วเป็นยังไง? ถ้าเอาเพลงจากวิทยุไปใส่ในช่องดนตรีประกอบ โมเดลจะไม่รู้ว่าต้องทำให้เสียงนั้นดังตามระยะห่างจากวิทยุ ผลคือเสียงลอยไม่เข้ากับภาพ

กฎเหล็ก — เขียนเฉพาะสิ่งที่เห็นหรือได้ยิน

โมเดลแปลงคำนามธรรมเป็นภาพไม่ได้ ประโยคพวกนี้แทบไม่มีผลอะไรเลย:

  • "ฉากนี้ดูอบอุ่น"
  • "โมเมนต์ที่ทรงพลัง"
  • "ตัวละครรู้สึกสิ้นหวัง"
  • "บรรยากาศตึงเครียด"

แทนที่จะบอกอารมณ์ ให้บอก หลักฐานของอารมณ์นั้น:

อยากได้เขียนแบบนี้แทน
เศร้าตาลดต่ำลง ไหล่ผ่อนลง ลมหายใจสั่น
ตึงเครียดมือกำแน่นจนข้อนิ้วขาว ขากรรไกรเกร็ง
อบอุ่นแสงสีส้มจากโคมไฟส่องด้านข้างใบหน้า มุมปากยกขึ้นเล็กน้อย
ตกใจศีรษะหันกลับอย่างรวดเร็ว ตาเบิกกว้าง

หลักการเดียวกันนี้ใช้ได้กับ prompt วิดีโอทั่วไปด้วย ลองอ่านเพิ่มที่ วิธีเขียน Prompt สร้างวิดีโอ AI ให้ได้ผลลัพธ์ตรงใจ

คำศัพท์การเคลื่อนกล้อง

H3 เข้าใจคำสั่งกล้องเฉพาะชุด ใช้คำนอกชุดนี้แล้วผลจะไม่แน่นอน

ชุดคำที่รองรับ:

กลุ่มคำสั่ง
ซูมและเข้าออกZoom In, Zoom Out, Push In, Pull Out
แพนและเลื่อนข้างPan Left, Pan Right, Truck Left, Truck Right
เงยและก้มTilt Up, Tilt Down, Pedestal Up, Pedestal Down
เคลื่อนตามArc Shot, Tracking Shot, POV
อยู่กับที่และสั่นStatic Shot, Shake Slightly, Shake Strongly
หมุนRoll Clockwise, Roll Counterclockwise

กำหนดขนาดและความเร็วเพิ่มได้ โดยระบุว่าเคลื่อนน้อยหรือมาก และช้าหรือเร็ว ถ้าเป็นความเร็วปกติและการเคลื่อนขนาดกลางก็ไม่ต้องระบุ

เขียนให้เป็นประโยคธรรมชาติ ไม่ใช่รายการคำสั่ง

เขียนแบบนี้ได้ผล — กล้องดันเข้าหาจดหมายในมือเธออย่างช้า ๆ ด้วยระยะที่ไม่มาก

เขียนแบบนี้ไม่ได้ผล — Camera: Push In / Small Amplitude / Slow

สำหรับคลิปสั้น ให้ใช้การเคลื่อนกล้องหลักแค่แบบเดียวต่อช็อต ถ้าใส่ทั้งซูม ทั้งแพน ทั้งเงยในช็อตเดียวที่ยาว 5 วินาที ผลจะออกมามั่ว

บทพูดและการกำกับผู้พูด

ทุกคนที่พูด ร้องเพลง หรือเปล่งเสียงในคลิปต้องมี รหัสผู้พูดประจำตัว เขียนเป็น (S1), (S2), (S3) ตามลำดับ

รหัสต้องคงที่ตลอดทุกช็อต ถ้าช็อตแรกตัวละครหญิงเป็น (S1) ช็อตที่ห้าก็ต้องเป็น (S1) เหมือนเดิม ไม่งั้นเสียงจะเปลี่ยนคน

ตัวละครที่ไม่เคยพูดเลยไม่ต้องมีรหัส

บทพูดภาษาไทย

H3 รองรับภาษาไทยโดยครอบข้อความด้วยแท็กที่ระบุภาษา ตัวอย่างโครงสร้าง:

The frightened middle-aged woman (S1) whispers with a trembling voice, <d>[Thai] อย่าเปิดประตูนะลูก!</d>

กฎสำคัญ — ในแท็กใส่ได้แค่ป้ายภาษากับตัวบทพูดเท่านั้น

ห้ามใส่ในแท็ก:

  • คำสั่งกล้อง
  • ป้ายอารมณ์
  • คำบรรยายการกระทำ

สิ่งเหล่านั้นเขียนไว้นอกแท็ก ก่อนหน้าบทพูด เช่นบอกว่าพูดด้วยเสียงต่ำที่ควบคุมไว้ ด้วยสำเนียงเหนือ แล้วค่อยตามด้วยแท็กบทพูด

อย่าแปลบทพูดเป็นภาษาอื่นเอง ถ้าผู้เขียนบทเขียนไทยมา ก็ใช้ไทยตามนั้น รักษาถ้อยคำเดิมไว้ทั้งหมด

กรณีพิเศษของบทพูด

พูดพร้อมกันหลายคน — รวมรหัสไว้ด้วยกันเป็น (S1,S2) แล้วเขียนบทพูดที่ทั้งคู่พูดพร้อมกัน

เสียงบรรยายนอกจอ — ต้องใช้วลีเฉพาะที่ระบุว่าเป็น voiceover แล้วบอกให้ชัดว่าปากของตัวละครบนจอปิดสนิท ถ้าไม่บอก โมเดลอาจขยับปากตามเสียง ทำให้ดูเหมือนพูดจริง

บทพูดต่อเนื่องข้ามช็อต — เมื่อประโยคเดียวพาดผ่านการตัดภาพ ต้องใส่แท็กเชื่อมและระบุชัดว่าเสียงไม่ขาดตอน

บทพูดที่ถูกตัดจบพร้อมคลิป — มีแท็กเฉพาะสำหรับกรณีที่ประโยคยังไม่จบแต่คลิปหมดเวลา

ข้อความที่ปรากฏบนจอ

ป้าย ชื่อเรื่อง ฉลาก ข้อความบนหน้าจอ ซับไตเติล โปสเตอร์ หรือไฟนีออน — อะไรก็ตามที่เป็นตัวอักษรที่คนดูมองเห็น ให้เขียนไว้ใน เครื่องหมายคำพูดคู่ และคัดลอกข้อความให้ตรงเป๊ะ

ถ้าไม่ครอบด้วยเครื่องหมายคำพูด โมเดลอาจตีความว่าเป็นคำบรรยาย แล้วสร้างตัวอักษรมั่ว ๆ ขึ้นมาแทน

คุมจังหวะให้พอดีความยาว

นี่คือเรื่องที่ทำให้คลิปเสียบ่อยที่สุดรองจากการเขียนอารมณ์แทนภาพ

อย่ายัดหลายเหตุการณ์ลงในเวลาสั้น ๆ

ความยาวควรมี
5–6 วินาที1 ช็อต, 1 การกระทำหลัก, บทพูดไม่เกิน 1 ประโยคสั้น
8–10 วินาที1 ช็อตยาวต่อเนื่อง หรือ 2 ช็อตง่าย ๆ, บทพูด 1–2 ประโยคสั้น
15–20 วินาที2–4 ช็อต, บทสนทนาโต้ตอบสั้น, มีต้น-กลาง-จบชัดเจน

สำหรับคลิปที่มีบทพูดเยอะ ให้จังหวะการพูดมาก่อนลูกเล่นกล้อง ถ้าเวลาไม่พอ ตัดการเคลื่อนกล้องออก อย่าตัดบทพูดให้พูดเร็วผิดธรรมชาติ

โหมดต่าง ๆ ต้องขึ้นบรรทัดแรกให้ถูก

ถ้าคุณใช้ภาพอ้างอิงเป็นเฟรมแรกหรือเฟรมสุดท้าย prompt ต้องมี บรรทัดแรกที่ระบุความสัมพันธ์ระหว่างภาพกับเวลาในคลิป ก่อนจะขึ้นสามช่องหลัก

  • โหมดภาพเป็นเฟรมแรก — ระบุว่าภาพอ้างอิงตรงกับวินาทีที่ 0.00
  • โหมดเฟรมแรกและเฟรมสุดท้าย — ระบุทั้งสองภาพว่าตรงกับวินาทีไหน โดยเวลาของภาพสุดท้ายต้องเขียนทศนิยมสองตำแหน่งให้ตรงกับความยาวจริงของคลิป
  • โหมดเฉพาะเฟรมสุดท้าย — ระบุว่าภาพตรงกับวินาทีสุดท้าย แล้วให้โมเดลเดาสถานะก่อนหน้าเอง

เขียนบรรทัดนี้ผิดหรือลืม โมเดลจะไม่ยึดภาพอ้างอิงเป็นเฟรมตามที่ตั้งใจ กลายเป็นแค่ภาพประกอบแนวคิด

เช็กลิสต์ก่อนกดรัน

ก่อนส่ง prompt เข้าเครื่อง ลองไล่ตามนี้:

  • ช็อตแรกเริ่มด้วยสไตล์ภาพและองค์ประกอบหรือยัง
  • มีคำนามธรรมอย่าง "เศร้า" "ทรงพลัง" หลงเหลืออยู่ไหม
  • เสียงจากวิทยุหรือทีวีอยู่ในช่องแรกใช่ไหม ไม่ใช่ช่องดนตรี
  • บทพูดไม่ได้ถูกเขียนซ้ำในช่องเสียงบรรยากาศ
  • รหัสผู้พูดคงที่ตลอดทุกช็อตหรือเปล่า
  • ข้อความบนจอครอบด้วยเครื่องหมายคำพูดคู่แล้วหรือยัง
  • ปริมาณเหตุการณ์เหมาะกับความยาวคลิปไหม
  • ถ้าใช้ภาพอ้างอิงเป็นเฟรม บรรทัดแรกระบุเวลาถูกต้องหรือเปล่า

สรุป

Prompt ของ H3 มีสามช่อง — ไทม์ไลน์ภาพและเสียงในฉาก, เสียงบรรยากาศรวม, และดนตรีที่มีแต่คนดูได้ยิน การเอาเนื้อหาไปใส่ผิดช่องคือความผิดพลาดที่พบบ่อยที่สุด

กฎที่สำคัญที่สุดคือ เขียนเฉพาะสิ่งที่เห็นหรือได้ยิน โมเดลแปลง "เศร้า" เป็นภาพไม่ได้ แต่แปลง "ตาลดต่ำลง" ได้ทันที

ส่วนบทพูดภาษาไทยใช้ได้ตรง ๆ ขอแค่ครอบด้วยแท็กภาษาให้ถูก และเก็บคำบรรยายวิธีพูดไว้นอกแท็ก

เมื่อเขียน prompt เป็นแล้ว ขั้นถัดไปคือเอาไปรันจริง ซึ่งต้องมีเครื่องที่รองรับ — อ่านต่อได้ที่ เช่าเครื่อง GPU ทำ H3 บน vast.ai และ สร้างวิดีโอด้วย H3 จากบทถึงคลิปจริง


อยากได้ตัวช่วยเขียน prompt ที่รู้กฎพวกนี้อยู่แล้ว? AI Unlocked มีคอร์สสร้างละครสั้นด้วย H3 พร้อมสกิลที่แปลงบทเป็น prompt ตามโครงสร้างข้างบนให้อัตโนมัติ ดูแพ็กเกจได้ที่ หน้าราคา

เขียนโดย

AI Unlocked Team

บทความอื่นๆ ที่น่าสนใจ

📝

สร้างวิดีโอด้วย H3 — จากบทถึงคลิปจริง ทีละขั้น

ขั้นตอนสร้างวิดีโอด้วย MiniMax H3 ครบทั้งสาย ตั้งแต่ล็อกหน้าตัวละครด้วย character sheet วางช็อตด้วยสตอรี่บอร์ด เขียน prompt เรนเดอร์ ไปจนถึงตัดต่อรวมเป็นคลิปสมบูรณ์

31/08/2569
📝

เช่าเครื่อง GPU ทำ H3 บน vast.ai — ทีละขั้น ไม่ให้เงินรั่ว

วิธีเช่าเครื่อง GPU รัน MiniMax H3 บน vast.ai ตั้งแต่สมัคร เติมเครดิต เลือกการ์ด ตั้ง disk 100 GB จนถึงเปิด ComfyUI พร้อมวิธีคุมค่าใช้จ่ายไม่ให้เครื่องกินเงินตอนไม่ได้ใช้

30/08/2569
📝

ComfyUI H3 — ติดตั้งและใช้ workflow สร้างวิดีโอพร้อมเสียง

คู่มือ ComfyUI H3 ตั้งแต่วางไฟล์โมเดล MiniMax H3 ลงโฟลเดอร์ให้ถูก จนถึงใช้ workflow แบบสองรอบที่เรนเดอร์ร่างก่อนแล้วขยายใน latent พร้อมกับดักที่ทำให้ workflow พัง

29/08/2569