KM

บทที่ 2 · ลงมือใช้จริง

ติดตั้ง → ใช้คำสั่ง → เชื่อมต่อแอป

ทำตามทีละขั้น (มีภาพจริง + วิดีโอ) แล้วรู้จักคำสั่งพื้นฐานกับช่องทางเชื่อมต่อ เพื่อเอา Ollama ไปต่อกับแอปอื่น

01 · ลงมือทำ

ติดตั้งใน 3 ขั้นตอน

ดาวน์โหลดจาก ollama.com/download — ทุกภาพด้านล่างถ่ายจากการติดตั้งจริงบน Windows 11

ติดตั้ง Ollama 3 ขั้นตอน — ติดตั้ง, ดึงโมเดล, รันและแชต
1

ติดตั้ง Ollama

OllamaSetup.exe

ดาวน์โหลดจาก ollama.com/download แล้วติดตั้ง (Win/macOS/Linux)

2

ดึงโมเดล

ollama pull

เลือกโมเดลจาก ollama.com/library มาเก็บไว้ในเครื่อง

3

รันและแชต

ollama run

พิมพ์คุยได้เลย หรือให้แอปอื่นในเครื่องเรียกใช้

🎬 วิดีโอเดินผ่านการติดตั้ง (61 วินาที)

📸 ทุกขั้นตอน (ภาพจริง — คลิกเพื่อขยาย)

💡 ตั้งที่เก็บโมเดลผ่านหน้า Settings ได้เลย — บันทึกในตัวแอป ไม่ต้องตั้งค่าอะไรเพิ่มในระบบ

02 · คำสั่ง

คำสั่งเบื้องต้น

เริ่มเร็วสุดด้วยคำสั่งเดียว — คลิกที่การ์ดเพื่อคัดลอกคำสั่งไปใช้

⭐ โมเดลแนะนำ (เลือกตามการ์ดจอ)

Qwen 3.6 35B A3B

การ์ดจอ 16GB ขึ้นไป
🦙

ตัวท็อป ฉลาดรอบด้าน — งานเขียน/โค้ด/เหตุผล ตอบภาษาไทยดี

ดูรายละเอียดโมเดล ↗

Gemma 4 e2b

การ์ดจอ 8GB ขึ้นไป
🦙

เล็ก เร็ว ประหยัดหน่วยความจำ — เหมาะการ์ดจอเล็ก/โน้ตบุ๊ก

ดูรายละเอียดโมเดล ↗
⬇️ ดาวน์โหลดโปรแกรม Ollama — ollama.com ↗

🛠️ คำสั่งที่ใช้บ่อย

03 · เชื่อมต่อแอป (สำหรับนักพัฒนา)

ช่องทางเชื่อมต่อ (REST API) ที่ localhost:11434

หลังติดตั้ง Ollama จะเปิด 'ช่องทางเชื่อมต่อ' ให้แอปหรือสคริปต์อื่นในเครื่องมาเรียกใช้ได้อัตโนมัติ — เรียกจาก curl, Python หรือเชื่อมแบบเดียวกับ ChatGPT API ก็ได้

bash
curl http://localhost:11434/api/generate -d '{
  "model": "gemma4:e2b",
  "prompt": "อธิบาย Ollama ใน 1 ประโยค",
  "stream": false
}'
ช่องทาง (Endpoint)หน้าที่
POST /api/generateถามครั้งเดียว ได้คำตอบ (ทยอยส่งข้อความ)
POST /api/chatคุยต่อเนื่องหลายรอบ (ส่งประวัติแชตไปด้วย)
POST /api/pullดาวน์โหลดโมเดลจากคลัง
POST /api/embedแปลงข้อความเป็นตัวเลข (ใช้กับการค้นหา)
GET /api/tagsดูรายการโมเดลที่มีในเครื่อง
GET /api/psดูโมเดลที่กำลังเปิดใช้อยู่

04 · ข้อควรรู้

เคล็ดลับ & คำถามที่พบบ่อย

ฮาร์ดแวร์ที่ต้องการ, การบีบขนาดโมเดล, ความยาวบทสนทนา และความปลอดภัยสำหรับมือใหม่

ต้องใช้การ์ดจอแรงแค่ไหน?▾

ขึ้นกับขนาดโมเดล — โมเดลเล็ก (7–8B แบบบีบขนาด) ใช้หน่วยความจำการ์ดจอราว 4–5GB · ขนาดกลาง 32B ~19–20GB · ใหญ่ 70B ~38–40GB · หลักสำคัญคือทั้งโมเดลต้องพอดีกับหน่วยความจำการ์ดจอ ไม่งั้นจะช้ามาก — มือใหม่แนะนำเริ่มที่ 7–8B ก่อน (ตัวเลขเป็นแนวทางประมาณ)

การบีบขนาดโมเดล (Quantization) คืออะไร?▾

คือการย่อโมเดลให้เล็กลงเพื่อประหยัดหน่วยความจำ โดยยอมให้คุณภาพลดลงนิดหน่อย — แบบ Q4 เป็นค่ามาตรฐาน สมดุลระหว่างขนาดกับคุณภาพ (แนะนำมือใหม่) · แบบ Q8 ใหญ่กว่าแต่คุณภาพใกล้ตัวเต็ม ใช้เมื่อการ์ดจอมีที่ว่างพอ

ทำให้ AI จำบทสนทนาได้ยาวขึ้นได้ไหม?▾

ได้ — ปกติ AI จะจำได้ประมาณ 2048 โทเคน (โทเคน ≈ คำ/พยางค์ ราวไม่กี่หน้ากระดาษ) ปรับให้ยาวขึ้นได้ผ่านไฟล์ตั้งค่าโมเดล (Modelfile) หรือค่าระบบ OLLAMA_CONTEXT_LENGTH · ยิ่งจำยาว ยิ่งใช้หน่วยความจำการ์ดจอมากขึ้น

เปิดให้เครื่องอื่นเรียกใช้ปลอดภัยไหม?▾

ปกติ Ollama เปิดใช้เฉพาะในเครื่องนี้เท่านั้น ถ้าอยากให้เครื่องอื่นเรียกใช้ได้ ต้องเปิดเพิ่มเอง (ตั้งค่า OLLAMA_HOST=0.0.0.0) — กรณีนั้นควรตั้งระบบกันภายนอก (firewall) ด้วย เพราะช่องทางนี้ไม่มีระบบล็อกอินในตัว

ลบโมเดลที่ไม่ใช้ยังไง?▾

ใช้ ollama rm <ชื่อโมเดล> — โมเดลกินพื้นที่ดิสก์เยอะ (หลายสิบ GB) ดูรายการด้วย ollama list และดูตัวที่เปิดอยู่ด้วย ollama ps

สรุปบทที่ 2

ติดตั้งเป็น ใช้เป็น ต่อแอปเป็น

  • ✓ติดตั้ง Ollama 3 ขั้น: ติดตั้ง → ดึงโมเดล → รันและแชต
  • ✓คำสั่งที่ใช้บ่อย: run / pull / list / ps / rm
  • ✓มีช่องทางเชื่อมต่อ (REST API) ที่ localhost:11434 ให้แอปอื่นเรียกใช้
  • ✓ปรับแต่งได้ผ่านไฟล์ตั้งค่าโมเดล (Modelfile) — system prompt, ความยาวบทสนทนา

📎 อยากดูภาพรวมเครื่องมือ Local AI ตัวอื่น ๆ → ดูหัวข้อ Local AI 20 แอป · อยากเลือกเครื่อง/การ์ดจอ → หัวข้อ Local AI PC