KM
บทที่ 4 · IMAGE EDIT & VIDEO

แก้ภาพด้วย
ประโยคเดียว

ยุคของ instruction-based editing

โมเดลรุ่นใหม่อย่าง Qwen-Image-Edit และ Nano Banana ไม่ต้องการ mask ไม่ต้องการ Photoshop — แค่พิมพ์บอกว่าจะแก้อะไร เหมือนสั่งงานรีทัชเชอร์ แต่ผลลัพธ์จะดีหรือเพี้ยน อยู่ที่ประโยคคำสั่งของเราล้วน ๆ

1

กริยาชัด VERB

ขึ้นต้นด้วยคำสั่งว่าจะ "ทำอะไร" — REMOVE, CHANGE, TURN, ...

2

เป้าชัด TARGET

ระบุของในภาพที่จะแก้ให้เจาะจง — PLASTIC BAG ไม่ใช่ "ของในมือ"

3

ขอบเขตชัด SCOPE

บอกด้วยว่าอะไร "ห้ามเปลี่ยน" — keep everything else unchanged

คำกริยา 10 คำ → preserve → transform → รวมภาพ → ต่อยอดสู่วิดีโอ

Edit Verbs · 10 คำจากคลาส

ขึ้นต้นด้วยกริยา — แล้วโมเดลจะรู้ว่าต้องทำอะไร

คลาส SalmonRK สรุปคำกริยาที่ Qwen-Image-Edit เข้าใจดีไว้ 10 คำ — ลองคลิกแต่ละคำ ดูโครงประโยค ตัวอย่างจริง และผล before/after จากในคลาส

จุดเขียว = มีภาพผลจริงจากคลาสให้เลื่อนเทียบ

REMOVEลบออกตัวอย่างจริงจากคลาส

เอาของออกจากภาพแล้วให้โมเดลเติมพื้นหลังแทนที่ให้เนียน — คำสั่งยอดนิยมอันดับหนึ่ง

โครงประโยค

REMOVE [ของที่จะลบ]

ตัวอย่าง

REMOVE PLASTIC BAG

ผลที่ได้: ถุงผลไม้หายไป มือเปิดว่างแบบธรรมชาติ — โมเดลเติมท่ามือใหม่ให้เองโดยไม่แตะส่วนอื่น

ภาพต้นฉบับ — นักศึกษาถือไม้ลูกชิ้นและถุงผลไม้กลางตลาด
ผลลัพธ์ — ถุงผลไม้หายไป มือว่าง
ก่อนหลัง

ลากเส้นแบ่ง ⇄ เทียบต้นฉบับกับผลจาก “REMOVE PLASTIC BAG

💡 สังเกตว่าทุกตัวอย่างใช้ ภาพต้นฉบับเดียวกัน (นักศึกษากลางตลาด ถือไม้ลูกชิ้น + ถุงผลไม้) — เปลี่ยนแค่ประโยคคำสั่ง ผลก็ต่างกันคนละเรื่อง นี่คือพลังของ instruction-based editing

ภาพจากคลาส ComfyUI Fundamental โดย SalmonRK

Preserve · ขอบเขตชัด

บอกด้วยว่าอะไร “ห้ามเปลี่ยน” — สำคัญพอ ๆ กับบอกว่าจะเปลี่ยนอะไร

โมเดลแก้ภาพไม่ได้ตัดแปะ — มัน “วาดภาพใหม่ทั้งใบ” โดยพยายามคงของเดิมไว้ ถ้าเราไม่ขีดเส้นว่าห้ามแตะอะไร ใบหน้า ท่าทาง หรือฉากอาจเพี้ยนไปโดยไม่ได้ตั้งใจ

ทดลอง: เปิด/ปิดประโยค preserve

prompt ที่ส่งให้โมเดล (โจทย์: เปลี่ยนสีผมเป็นแดง)

CHANGE TO RED HAIR COLOR
MAINTAIN THE ORIGINAL CHARACTER'S APPEARANCE, POSE, AND DETAILS, ENSURING ACCURACY AND CLARITY ACROSS ALL PERSPECTIVES.
สีผมเป้าที่จะแก้
ใบหน้าล็อกไว้
ท่าโพสล็อกไว้
ชุดนักศึกษาล็อกไว้
ฉากตลาดล็อกไว้

ผลที่คาด:ผมเปลี่ยนเป็นสีแดงจุดเดียว — ใบหน้า ท่าโพส ชุด และฉากตลาดถูก “ตรึง” ไว้ด้วยประโยค preserve เหมือนในตัวอย่างจริงของคลาส

ประโยค preserve ติดกระเป๋า — เลือกใช้ตามสถานการณ์

MAINTAIN THE ORIGINAL CHARACTER'S APPEARANCE, POSE, AND DETAILS, ENSURING ACCURACY AND CLARITY ACROSS ALL PERSPECTIVES.

ประโยคเต็มจากคลาส — ใช้เมื่อต้องคงตัวละครเดิมทุกมุมมอง

KEEP EVERYTHING ELSE UNCHANGED

แบบสั้น — ต่อท้ายคำสั่งแก้จุดเดียว กันโมเดลมือลั่นแก้ที่อื่น

PRESERVE FACE/CLOTHING FEATURES

เจาะจงหน้า + เสื้อผ้า — สำคัญมากเวลารวมคน/สัตว์จากหลายภาพ

Transform · Trigger Words

เปลี่ยนสไตล์ทั้งภาพ — ปลุก LoRA ด้วยวลีเฉพาะ

LoRA บางตัวถูกเทรนมากับ “วลีกระตุ้น” (trigger word) — ต้องพิมพ์วลีนั้นเป๊ะ ๆ LoRA ถึงจะทำงาน สูตรจากคลาส: trigger word มาก่อน + รายละเอียดฉากตามหลัง

1 · TRIGGER WORD2 · รายละเอียดฉาก (ออกแบบเอง)สลับลำดับ/พิมพ์ trigger เพี้ยน = LoRA อาจไม่ทำงาน

:: trigger word for LoRA model ::

TRANSFORMING THE SUBJECT INTO A REALISTIC 3D PVC FIGURE

รายละเอียดฉากตามหลัง (จาก prompt จริงในคลาส — ย่อ)

THE SUBJECT'S TORSO IS COMPLETED, WHILE THE POSE AND FACIAL FEATURES REMAIN UNCHANGED... BEHIND THE FIGURE, THERE IS A BEAUTIFULLY DESIGNED FIGURE PACKAGING BOX WITH THE "QWEN" ART WORDING AND A RED "SALMONRK" LABEL. BEHIND THE BOX, AN AOC-BRANDED COMPUTER SCREEN DISPLAYS A GRAY 3D MODEL OF THE FIGURE. THE SCENE IS SET IN A FIGURE PRODUCTION STUDIO, WITH A 3D PRINTER AT THE BACK.

ครึ่งหลังของ prompt บรรยายฉากละเอียดยิบ — กล่องแพ็กเกจ ป้ายแดง จอคอมโชว์ 3D model สตูดิโอ — ทุกอย่างโผล่ครบในผลลัพธ์

💡 trigger เรียก LoRA ให้ทำงาน ส่วนรายละเอียดฉากคือ "ของแถม" ที่เราออกแบบเองได้เต็มที่

นักศึกษาหญิงกลายเป็น PVC figure พร้อมกล่อง QWEN และจอ AOC โชว์ 3D model สีเทา
ผลจริง: คน → figure + กล่อง QWEN + จอโชว์ 3D model ครบตามที่บรรยาย
ชายใส่สูทยืนกอดอกกลายเป็น PVC figure ข้างกล่องแพ็กเกจของตัวเอง
สูตรเดิมใช้ซ้ำกับคนอื่นได้ทันที — เปลี่ยนแค่ภาพต้นฉบับ

ภาพจากคลาส ComfyUI Fundamental โดย SalmonRK

Compose · Multi-image Input

รวมสองภาพเป็นหนึ่ง — สูตรจาก Workshop 4

ป้อนภาพ 2 ใบให้โมเดล แล้วสั่งด้วยประโยคเดียวให้ตัวละครจากคนละภาพมาอยู่ฉากเดียวกัน — prompt ของคลาสมี 4 ท่อนที่ขาดท่อนไหนไม่ได้เลย ลองคลิกดูทีละท่อน

prompt จริงจากคลาส — คลิกแต่ละท่อนเพื่อดูหน้าที่

Preserve identity

หัวใจของ workshop นี้ — ถ้าไม่สั่ง โมเดลจะวาดหน้าเด็กใหม่ เปลี่ยนลายเสื้อ หรือเปลี่ยนสีขนหมา

ภาพต้นฉบับ 1 — เด็กชายยืนยิ้มในคอกกั้นเด็กสีขาว ใส่เสื้อลายทาง
ต้นฉบับ 1 · น้องเด็กชาย
ถ่ายในบ้าน คอกกั้นเด็ก
ภาพต้นฉบับ 2 — สุนัขขนน้ำตาลนอนหมอบบนพื้นไม้หน้าระเบียง
ต้นฉบับ 2 · น้องหมา
ถ่ายคนละที่ คนละแสง
ผลลัพธ์ — เด็กชายคนเดิมนั่งยิ้มกอดสุนัขตัวเดิมในคอกกั้นเด็กฉากเดียวกัน
ผลลัพธ์ · ภาพเดียว
หน้า-ลายเสื้อ-สีขน ตรงต้นฉบับทั้งคู่

💡 สังเกตว่าผลลัพธ์ใช้ ฉากจากภาพเด็ก(คอกกั้นเด็ก) — เมื่อสั่ง “SAME BACKGROUND” โมเดลจะเลือกฉากหนึ่งเป็นหลักแล้วพาอีกตัวละครเข้ามา ถ้าอยากกำหนดเองว่าใช้ฉากไหน ให้ระบุไปเลย เช่น “ON THE WOODEN PORCH”

ภาพจากคลาส ComfyUI Fundamental โดย SalmonRK

Video Prompt · Veo / WAN

วิดีโอ = ภาพ + เวลา — ต้องบอกว่า “อะไรเคลื่อน” เสมอ

สูตรภาพนิ่งจากบท 3 ใช้ได้ต่อเลย แต่เพิ่ม 2 ช่องที่ภาพนิ่งไม่มี: การเคลื่อนไหวของตัวแบบ และการเคลื่อนกล้อง — ลืมบอกเมื่อไหร่ จะได้ภาพนิ่งที่กระดิกนิดเดียว

[Subject]

ตัวแบบ

[Action / Motion]

อะไรเคลื่อน

[Camera movement]

กล้องเคลื่อนยังไง

[Scene / Atmosphere]

ฉาก + บรรยากาศ

[+ Audio (Veo)]

เสียงประกอบ

Camera vocabulary — คลังคำสั่งกล้อง (คลิกดูความหมาย)

dolly in–out เลื่อนกล้องเข้าหา-ถอยออกจากตัวแบบ

เหมาะกับ: dolly in = เพิ่มความเข้มข้น / dolly out = เผยบริบทรอบตัว

ตัวอย่าง prompt เต็ม — ระบายสีตามช่องของสูตร

🥤 Product shot

SubjectA glass bottle of iced coffee on a wet slate table

Action / Motioncondensation drips slowly down the bottle, thin mist drifts around the base

Camera movementslow dolly in from the front, shallow depth of field

Scene / Atmospheremoody dark studio, single warm spotlight from the left

+ Audio (Veo)Audio: soft lo-fi beat, gentle liquid sounds

🧥 Portrait cinematic

SubjectA young woman in a yellow raincoat on a Bangkok rooftop at dusk

Action / Motionher coat ripples in the wind as she slowly turns to face the camera

Camera movementslow orbit around the subject

Scene / Atmospherecity lights flickering on below, light rain, cinematic atmosphere

+ Audio (Veo)Audio: distant traffic hum, soft rain

🐕 Lifestyle / action

SubjectA golden retriever running along the shoreline at sunrise

Action / Motionpaws kicking up splashes of water, ears flapping mid-stride

Camera movementlow-angle tracking shot moving alongside the dog

Scene / Atmospheregolden morning light, gentle waves, empty beach

+ Audio (Veo)Audio: waves, seagulls, light playful music

⚠️ จุดพลาดอันดับหนึ่ง: บรรยายฉากสวยหรูแต่ ไม่บอกว่าอะไรเคลื่อน — โมเดลจะได้แค่ ภาพนิ่งที่สั่นไหวเบา ๆ 5 วินาที ให้เช็กทุกครั้งว่า prompt มีทั้ง [Action/Motion] ของตัวแบบ และ [Camera movement] อย่างละช่องเป็นอย่างน้อย

Summary · บทที่ 4

สรุป — แก้ภาพและสั่งวิดีโอด้วยประโยคที่คม

ห้าหลักจากบทนี้ ใช้ได้กับทุกโมเดลแก้ภาพ ไม่ว่าจะ Qwen-Image-Edit, Nano Banana หรือรุ่นที่ยังไม่เกิด

ขึ้นต้นด้วยกริยา

REPLACE · FIX · CHANGE · TURN · RELIGHT · MAKE · RE-RENDER · ADD · CREATE · REMOVE — กริยาชัด เป้าชัด แล้วโมเดลทำงานตรงจุด

บอกสิ่งที่ห้ามเปลี่ยน

ใส่ประโยค preserve ทุกครั้งที่ต้องคงตัวตน — "keep everything else unchanged" คือเพื่อนแท้ของการแก้ภาพ

Trigger word ต้องเป๊ะ

LoRA เปลี่ยนสไตล์ทั้งภาพได้ แต่ต้องเรียกด้วยวลีที่มันถูกเทรนมา — trigger มาก่อน รายละเอียดฉากตามหลัง

รวมภาพ = 4 ท่อน

subject ทั้งคู่ + ความสัมพันธ์/ท่าทาง + background เดียวกัน + preserve — ขาดท่อนไหนภาพเพี้ยนท่อนนั้น

วิดีโอ = ภาพ + เวลา

เพิ่ม [Action/Motion] กับ [Camera movement] เสมอ — ไม่บอกว่าอะไรเคลื่อน จะได้ภาพนิ่งขยับนิดเดียว

บทถัดไป: บทที่ 5 — Prompt งานโค้ด & Agent — จากสั่งแก้ภาพ สู่สั่งให้ AI เขียนโค้ดและทำงานแทนเราทั้งชิ้น ไปบทที่ 5 →