KM
ComfyUI 101 · บทที่ 5 · สาย Graphic

เทคนิคงานกราฟิก — กล่องเครื่องมือ ของทีมภาพ

แก้ภาพ · คุมองค์ประกอบ · ใส่สไตล์ · ขยายความละเอียด · สร้างวิดีโอ — ทุกเทคนิคต่อยอดจากโครง 6-node ในบทที่ 3 (ขอให้แม่นบท 3–4 ก่อน)

5.1

Image-to-Image — สร้างภาพจากภาพต้นแบบ

แทนที่จะเริ่มจากผ้าใบเปล่า เราเริ่มจากภาพจริงแล้วให้ AI วาดทับตาม prompt — workflow เปลี่ยนจากบทที่ 3 แค่จุดเดียว

Load Image 🖼️VAE EncodeKSampler (denoise 0.55)VAE DecodeSave Image

เปลี่ยนจากผ้าใบเปล่า → เริ่มจากภาพจริงที่ถูกบีบเป็น latent — ที่เหลือเหมือนบทที่ 3 ทุกประการ

ภาพต้นแบบผลลัพธ์ตาม denoiseต้นแบบ 45% · ใหม่ 55%
denoise =0.55

กุญแจจากบทที่ 4 กลับมาทำงานจริง: ต่ำ = เหมือนต้นฉบับ · สูง = เปลี่ยนเยอะ — โซนใช้บ่อยของ img2img คือ 0.4–0.7

ใช้ทำ: เปลี่ยนสไตล์ภาพ · ปรับโทน · sketch → ภาพจริง · ภาพถ่าย → การ์ตูน

5.2 · ใช้บ่อยที่สุด

Inpainting — แก้เฉพาะบางส่วนของภาพ

แก้เฉพาะพื้นที่ที่ระบาย mask ไว้ ส่วนที่เหลือคงเดิม — เครื่องมือทำงานจริงที่ทีมกราฟิกใช้บ่อยที่สุด: ลบ/เปลี่ยนวัตถุ เปลี่ยนพื้นหลัง แก้มือเพี้ยน

🖌️ ลากเมาส์ระบาย พื้นที่ที่อยากแก้ — เหมือนใช้ MaskEditor ของจริง

ภาพต้นฉบับสำหรับลอง inpaint
🖌️ ลองระบายตรงท้องฟ้า / แม่น้ำ ดูสิ

ใน ComfyUI จริง: คลิกขวาที่ภาพใน Load Image Open in MaskEditor → ระบายแบบเดียวกันนี้

แล้วต่อผ่าน VAE Encode (for Inpainting) — prompt = สิ่งที่อยากให้ปรากฏในพื้นที่ mask · ส่วนนอก mask คงเดิม 100%

💡 เคล็ดลับความเนียน: ขยายขอบ mask เล็กน้อยด้วย grow_mask_by และใช้ denoise ~0.7–0.9 ในพื้นที่ inpaint — ขั้นกว่า: เสริม ControlNet คุมโครงสร้างเดิม (หัวข้อถัดไป)

5.3

ControlNet — คุมองค์ประกอบ / ท่าทาง / เส้นโครง

บังคับโครงสร้างของภาพด้วยภาพอ้างอิง (ท่าทาง เส้นขอบ ความลึก) ขณะที่ prompt ยังคุมเนื้อหา/สไตล์ — ภาพชุดที่ pose เหมือนกันเป๊ะเกิดจากตัวนี้

คุมอะไร

ท่าทาง / โครงกระดูกคน

Use case

จัดท่านางแบบ, คุม pose ตัวละคร

ภาพ input ของ OpenPose: โครงกระดูก OpenPose

input — โครงกระดูก OpenPose

ผลลัพธ์ของ OpenPose: ตัวละครยืนท่าเดียวกันเป๊ะ

output — ตัวละครยืนท่าเดียวกันเป๊ะ

ภาพจากคลาส SalmonRK

strength =0.80
สมดุล — โครงตามอ้างอิง เนื้อหาตาม prompt

🔗 เส้นทางข้อมูล: ภาพอ้างอิง → Preprocessor (แปลงเป็นโครง) → Apply ControlNet แทรกเข้าไปใน CONDITIONING ก่อนถึง KSampler — และเสียบหลายตัวพร้อมกันได้ (เช่น Pose + Depth) โดยต่อ Apply ControlNet ซ้อนกัน

5.4

LoRA — ฉีดสไตล์ / ตัวละคร / แบรนด์

ไฟล์เสริมเล็ก ๆ ที่เสียบเพิ่มความสามารถให้โมเดลหลัก — สไตล์ประจำองค์กร มาสคอต สินค้าเฉพาะรุ่น · ปี 2026 เทรน LoRA ได้ในตัว ComfyUI แล้ว (Z-Image, Flux, SDXL, Wan)

ภาพจากโมเดลหลักสไตล์เข้ม 80%
Load CheckpointLoad LoRA #1MODEL+CLIP ที่ฉีดสไตล์แล้ว
LoRA #1 strength0.80

ปกติใช้ 0.6–1.0 · ซ้อนหลายตัวได้แต่ระวังตีกัน · LoRA ต้องตรงตระกูลโมเดล (SDXL↔SDXL, Flux↔Flux)

LoRA มี 3 ประเภท

จำอะไร

จำ “ตัวตน” เฉพาะ — หน้าคน มาสคอต ตัวละคร ให้เรียกกลับมาได้ทุกภาพ

ตัวอย่างการใช้

เทรนหน้าพรีเซนเตอร์/มาสคอตแบรนด์ครั้งเดียว → สร้างภาพคนเดิมในฉากไหนก็ได้ หน้าตรงกันทุกภาพ

💼 เทรนเองได้ — ของจริงจากธุรกิจจริง

ใช้ภาพถ่ายจริงไม่กี่สิบรูปเทรน LoRA ของตัวเอง → ได้ “โมเดลที่รู้จักของของเรา” เอาไปสร้างภาพโฆษณา/คอนเทนต์ได้ไม่จำกัด

สินค้า — รถยนต์แบรนด์

Feature
ภาพโฆษณา SUV สีชมพูพร้อมพรีเซนเตอร์ จาก LoRA สินค้าSUV สีขาวริมทะเลพร้อมนางแบบ ฉากใหม่จาก LoRA เดียวกัน

เทรนจากภาพรถจริง → ทำช็อตโฆษณาฉากใหม่ ๆ (พรีเซนเตอร์ ริมทะเล) โดยรถยังถูกต้องทุกเส้นสาย

แฟชั่น — กางเกงลายช้าง

Feature
ภาพต้นแบบ: กางเกงลายช้างของจริงผลลัพธ์: นางแบบใส่กางเกงลายช้างวิ่งออกกำลังในสวน

จากภาพถ่ายสินค้าจริง → นางแบบใส่จริงในไลฟ์สไตล์ช็อต ลายผ้าคงเดิม

ตัวละคร — หน้าคนจริง

Character
ภาพต้นแบบ: ชายชุดสูทดำถ่ายสตูดิโอผลลัพธ์: คนเดิมในลุคโจ๊กเกอร์ ผมเขียว สูทม่วง

เทรนหน้าคนจริงครั้งเดียว → แปลงเป็นคาแรกเตอร์/คอสตูมไหนก็ได้ หน้ายังเป็นคนเดิม

อาหาร — ไก่ย่างแบรนด์

Feature
ภาพต้นแบบ: ไก่ย่างเสียบไม้บนเตาถ่านของจริงผลลัพธ์: ไก่ย่างจานชมพูพร้อมโลโก้ BANGTAN บนเตา

จากภาพหน้าเตาจริง → ภาพโฆษณาจัดจานพร้อมโลโก้แบรนด์บนเตา

ภาพจากคลาส SalmonRK

กฎเหล็ก

MODEL ต่างตระกูล ใช้ร่วมกันไม่ได้

Checkpoint / LoRA / ControlNet / VAE / Embedding เป็น “ชุด” ของตระกูลใครตระกูลมัน — จุดพลาดอันดับ 1 ของมือใหม่คือผสมข้ามตระกูลแล้วได้ ภาพมั่วหรือ error เงียบ ๆ โดยไม่รู้ว่าผิดตรงไหน

① หยิบ LoRA:② แล้วคลิกใส่ checkpoint ฝั่งไหนก็ได้

ตระกูล SD1.5

ControlNet ของ SD1.5VAE ของ SD1.5Embedding ของ SD1.5

ตระกูล SDXL

1.0LCMTurboLightningPony
ControlNet ของ SDXLVAE ของ SDXLEmbedding ของ SDXL

⚠️ กฎนี้ใช้กับ ทุกชิ้นส่วน: ControlNet / VAE / Embedding ก็ต้องตรงตระกูลเช่นกัน · แม้ใน SDXL เองยังแตกสายย่อย (1.0 / LCM / Turbo / Lightning / Pony) — LoRA ที่เทรนกับ Pony อาจเข้ากับ SDXL base ได้ไม่สนิท · ตระกูลใหม่ ๆ (Flux, Qwen, Z-Image) ก็มีชุดของตัวเองแยกอีก — ดูหน้า download ของไฟล์เสมอว่า “for SDXL” หรือ “for SD1.5”

5.5

IPAdapter — ใช้ “ภาพ” เป็น prompt

ส่งภาพอ้างอิงแทนการพิมพ์บรรยาย — ผลลัพธ์ได้สไตล์/องค์ประกอบ/ใบหน้าคล้ายภาพนั้น (image prompt)

🎨

Style transfer

ลุค/โทนคงที่ตาม reference — คุมมู้ดทั้งแคมเปญด้วยภาพเดียว

🧑

FaceID

ถ่ายทอดใบหน้าเฉพาะคน — ใช้ Insightface ที่เราลงไว้แล้วในบทที่ 2

🔄

Multi-angle

สร้างภาพหลายมุมของตัวละคร/สินค้าเดียวกันให้หน้าตาคงเส้นคงวา

5.6

Upscaling — ขยายความละเอียดระดับใช้งานจริง

มี 2 แนวทางหลัก และมักใช้ร่วมกัน — กดสลับดูทั้งสองสาย

Load Upscale Model (4x-UltraSharp / RealESRGAN)Upscale Image (using Model)Save

ขยายด้วยโมเดล AI เฉพาะทาง — คมขึ้นโดยไม่เปลี่ยนเนื้อหา ตรงไปตรงมาและเร็ว

💡 สองแนวทางมักใช้ร่วมกัน · ภาพใหญ่มากใช้ Ultimate SD Upscale (แบ่ง tile) กัน VRAM ระเบิด · use case: เตรียมภาพพิมพ์/โฆษณา, asset ความละเอียดสูง

5.7

เลือกโมเดลให้ถูกงาน (2025–2026)

ComfyUI รองรับโมเดลใหม่ Day-0 — คำถามจริงคือ “งานนี้ควรใช้ตัวไหน”

จุดเด่น

คุณภาพสูง photorealistic ดีมาก เขียนตัวอักษรในภาพได้ดี

เหมาะกับ

งานคุณภาพสูง, ภาพคน/ฉาก

💡 งานที่มีตัวหนังสือไทย/อังกฤษในภาพ (โปสเตอร์ ป้าย) → กลุ่ม Flux/Qwen เก่ง text rendering · เปิด Templates ในแอป (หมวด Image/Video/Audio/3D/LLM) มี workflow สำเร็จให้เริ่มทุกตัว — โปรไฟล์เต็มของแต่ละโมเดลดูได้ที่ Showcase บทที่ 1

Qwen-Image

release 2025-08-04MMDiT foundation model · 20B parameters
  • 🔤วาดตัวหนังสือแม่นมาก — ทั้งอังกฤษและจีน (ป้าย โปสเตอร์ โลโก้)
  • 🧩เทรน LoRA ของตัวเองได้ — สินค้า/ตัวละคร/สไตล์แบรนด์
  • 🎛️มี ecosystem เครื่องมือเสริมครบ เช่น ControlNet
  • 🌐Opensource — โหลดมารันใน ComfyUI ได้เลย
  • 📊 กราฟขวา: จำนวนพารามิเตอร์โต 20 เท่าจากยุค SD1.5 (~0.9B) → Qwen-Image (20B) — โมเดลใหญ่ขึ้น = เข้าใจภาษามนุษย์/ตัวหนังสือดีขึ้น แต่ก็กิน VRAM มากขึ้นตาม
กราฟแท่งเทียบจำนวนพารามิเตอร์: SD1.5, SDXL, SD3, FLUX.1 จนถึง QWEN Image 20,000 ล้าน

พารามิเตอร์ (ล้าน): SD1.5 → SDXL → SD3 → FLUX.1 → QWEN 20B

ภาพ generate ชั้นหนังสือ มีป้าย New Arrivals This Week, Best-Selling Novels Here และโปสเตอร์ Author Meet And Greet ตัวหนังสือคมชัด

ตัวหนังสืออังกฤษบนป้าย/ปกหนังสือ — คมทุกตัวอักษร

ภาพ generate ผู้หญิงใส่เสื้อ QWEN เขียนข้อความภาษาจีนยาวหลายบรรทัดบนกระดานกระจก

ภาษาโลโกกราฟิก (จีน) หลายบรรทัดบนกระดาน — ยังแม่น

ภาพจากคลาส SalmonRK

Qwen-Image-Edit

release 2025-08-19ต่อยอดจาก Qwen-Image 20B — จูนมาเพื่อ “แก้ไขภาพ” โดยเฉพาะ
Novel View Synthesis: ภาพ input ของเด็ก หมา อีกา สิงโต ถูกสั่งหมุนดูด้านซ้าย/ขวา/ด้านหลัง

Novel View Synthesis — ส่งภาพเข้าไปแล้วสั่ง “ขอดูด้านซ้าย / ด้านหลัง” ได้เลย โดยตัวแบบยังเป็นตัวเดิม รักษาความสอดคล้องทางภาพโดยรวม

ภาพจากคลาส SalmonRK

✍️ อยากเขียน prompt แก้ภาพให้เก่ง (REMOVE / REPLACE / CHANGE / TURN …) → ไปต่อที่หมวด Prompt 101 บทที่ 4 — Prompt แก้ภาพ & วิดีโอ

5.8

Video Generation — สร้างวิดีโอ

เทคนิคยอดนิยม Start/End Frame: กำหนดเฟรมเริ่ม+จบ แล้วให้โมเดลสร้างเฟรมระหว่างกลาง — ลองเองได้เลย

เฟรมเริ่ม

Start frame

เฟรมที่ถูกสร้างระหว่างกลางเฟรม 1 / 33 — โมเดลสร้างให้
เฟรมจบ

End frame

เรากำหนดแค่ เฟรมเริ่ม + เฟรมจบ — Wan 2.2 สร้างเฟรมระหว่างกลางให้เป็นแอนิเมชันลื่น ๆ · เหมาะกับ transition, เปลี่ยนฉาก, animate ภาพนิ่ง, กำหนด pose

⚠️ วิดีโอกิน VRAM และเวลามาก — เริ่มจากความละเอียด/ความยาวต่ำก่อน แล้วค่อยขยาย

Wan 2.1 / 2.2

T2V + I2V คุณภาพ/การควบคุมสูง — โมเดลวิดีโอยอดนิยมปี 2026

HunyuanVideo

text-to-video คุณภาพสูง

LTX-2 / 2.3

open สายเร็ว real-time — 2.3 (22B) สร้างเสียงซิงก์ในตัว · ดูวิธีใช้ใน 5.9

5.9

ใช้งาน LTX-2.3 — วิดีโอ + เสียงในตัว

โมเดลวิดีโอ open ของ Lightricks ที่สร้างเสียงซิงก์กับภาพได้ในตัว — วิธีเขียน prompt 3 ส่วน + ลิงก์โหลดโมเดลสำหรับรันเอง

1Core Actions

บรรยายเหตุการณ์และแอ็กชัน “ตามลำดับเวลา” — เกิดอะไรขึ้นก่อน-หลังในคลิป

a chef tosses vegetables in a wok, flames rise, then he plates the dish

2Visual Details

บรรยายรายละเอียดภาพทุกอย่างที่อยากให้ปรากฏ — ฉาก แสง เสื้อผ้า มุมกล้อง

steam fills a neon-lit kitchen, close-up shot, shallow depth of field

3Audio

บรรยายเสียงและบทพูดที่ต้องการ — LTX-2.3 สร้างเสียงซิงก์กับภาพในตัว

sizzling sounds, upbeat jazz, the chef says “dinner is ready!”

เคล็ดลับ: เขียนทั้ง 3 ส่วนรวมเป็น prompt เดียว — แอ็กชันตามเวลา → รายละเอียดภาพ → เสียง/บทพูด ยิ่งบรรยายเป็นลำดับเหตุการณ์ชัด ผลลัพธ์ยิ่งตรง

Model Downloads — สำหรับรันบนเครื่องตัวเอง

วางไฟล์ตามโฟลเดอร์ใน ComfyUI/models/ ให้ตรงตามนี้ — กดชื่อไฟล์เพื่อดาวน์โหลดเลย หรือกด ⧉ เพื่อคัดลอกลิงก์

⚠️ อัปเดต ComfyUI ให้เป็นเวอร์ชันล่าสุดก่อนใช้ (คู่มืออัปเดต) — Desktop/Cloud ตามรอบ stable release โมเดลที่เพิ่งรองรับใน nightly อาจยังใช้ไม่ได้

5.10 · รวมร่าง

เทมเพลตจริง: pipeline งานสินค้า

พลังจริงของ ComfyUI คือรวมหลายเทคนิคใน workflow เดียว — ตัวอย่าง “ปรับภาพสินค้าให้พร้อมใช้” ใช้ของจากทั้งบทนี้

1. Load Image

ภาพสินค้าถ่ายเอง

จาก บท 3

2. Inpaint เปลี่ยนพื้นหลัง

mask รอบสินค้า + ControlNet (Canny) คงรูปทรง

จาก 5.2 + 5.3

3. LoRA สไตล์แบรนด์

โทนภาพประจำองค์กร strength ~0.8

จาก 5.4

4. Upscale 2×

model upscale + KSampler รอบสอง denoise 0.35

จาก 5.6

5. Save Image

พร้อมใช้ — และทำซ้ำกับสินค้า 100 ชิ้นได้

จาก → บท 6

🔁 สร้างครั้งเดียว ทำซ้ำกับสินค้า 100 ชิ้นได้ — ต่อยอดเป็น automation เต็มรูปแบบในบทที่ 6

✅ สรุปบทที่ 5

  • img2img/denoise = สร้างภาพจากภาพ · inpaint = แก้เฉพาะ mask (ใช้บ่อยสุด)
  • ControlNet คุมโครงสร้าง/ท่าทาง · LoRA ฉีดสไตล์/ตัวละคร · IPAdapter ใช้ภาพเป็น prompt
  • • LoRA มี 3 ประเภท (Character / Style / Feature) และเทรนเองจากภาพสินค้า/หน้าคนจริงได้ — แต่ MODEL ต่างตระกูลใช้ร่วมกันไม่ได้ (SD1.5 ↔ SDXL) — จุดพลาดอันดับ 1 ของมือใหม่
  • Upscale 2 แนวทาง (model / latent+KSampler) — ภาพใหญ่ใช้ tile กัน VRAM ระเบิด
  • • โมเดลยุคใหม่: Flux/Qwen เก่ง text · Wan 2.2 วิดีโอ — มี Templates ให้เริ่ม
  • • พลังจริงคือ รวมหลายเทคนิคใน workflow เดียวแล้วทำซ้ำได้
📚 ถัดไป: บทที่ 6 — Automation / API (รัน workflow นี้กับสินค้า 100 ชิ้นอัตโนมัติ) — เลือกได้จาก sidebar ซ้ายมือ