บทที่ 2 · ลงมือใช้จริง
ติดตั้ง → ใช้คำสั่ง → เชื่อมต่อแอป
ทำตามทีละขั้น (มีภาพจริง + วิดีโอ) แล้วรู้จักคำสั่งพื้นฐานกับช่องทางเชื่อมต่อ เพื่อเอา Ollama ไปต่อกับแอปอื่น
01 · ลงมือทำ
ติดตั้งใน 3 ขั้นตอน
ดาวน์โหลดจาก ollama.com/download — ทุกภาพด้านล่างถ่ายจากการติดตั้งจริงบน Windows 11

🎬 วิดีโอเดินผ่านการติดตั้ง (61 วินาที)
📸 ทุกขั้นตอน (ภาพจริง — คลิกเพื่อขยาย)
💡 ตั้งที่เก็บโมเดลผ่านหน้า Settings ได้เลย — บันทึกในตัวแอป ไม่ต้องตั้งค่าอะไรเพิ่มในระบบ
02 · คำสั่ง
คำสั่งเบื้องต้น
เริ่มเร็วสุดด้วยคำสั่งเดียว — คลิกที่การ์ดเพื่อคัดลอกคำสั่งไปใช้
⭐ โมเดลแนะนำ (เลือกตามการ์ดจอ)
Qwen 3.6 35B A3B
การ์ดจอ 16GB ขึ้นไปตัวท็อป ฉลาดรอบด้าน — งานเขียน/โค้ด/เหตุผล ตอบภาษาไทยดี
ดูรายละเอียดโมเดล ↗Gemma 4 e2b
การ์ดจอ 8GB ขึ้นไปเล็ก เร็ว ประหยัดหน่วยความจำ — เหมาะการ์ดจอเล็ก/โน้ตบุ๊ก
ดูรายละเอียดโมเดล ↗🛠️ คำสั่งที่ใช้บ่อย
03 · เชื่อมต่อแอป (สำหรับนักพัฒนา)
ช่องทางเชื่อมต่อ (REST API) ที่ localhost:11434
หลังติดตั้ง Ollama จะเปิด 'ช่องทางเชื่อมต่อ' ให้แอปหรือสคริปต์อื่นในเครื่องมาเรียกใช้ได้อัตโนมัติ — เรียกจาก curl, Python หรือเชื่อมแบบเดียวกับ ChatGPT API ก็ได้
curl http://localhost:11434/api/generate -d '{
"model": "gemma4:e2b",
"prompt": "อธิบาย Ollama ใน 1 ประโยค",
"stream": false
}'| ช่องทาง (Endpoint) | หน้าที่ |
|---|---|
POST /api/generate | ถามครั้งเดียว ได้คำตอบ (ทยอยส่งข้อความ) |
POST /api/chat | คุยต่อเนื่องหลายรอบ (ส่งประวัติแชตไปด้วย) |
POST /api/pull | ดาวน์โหลดโมเดลจากคลัง |
POST /api/embed | แปลงข้อความเป็นตัวเลข (ใช้กับการค้นหา) |
GET /api/tags | ดูรายการโมเดลที่มีในเครื่อง |
GET /api/ps | ดูโมเดลที่กำลังเปิดใช้อยู่ |
04 · ข้อควรรู้
เคล็ดลับ & คำถามที่พบบ่อย
ฮาร์ดแวร์ที่ต้องการ, การบีบขนาดโมเดล, ความยาวบทสนทนา และความปลอดภัยสำหรับมือใหม่
ต้องใช้การ์ดจอแรงแค่ไหน?▾
ขึ้นกับขนาดโมเดล — โมเดลเล็ก (7–8B แบบบีบขนาด) ใช้หน่วยความจำการ์ดจอราว 4–5GB · ขนาดกลาง 32B ~19–20GB · ใหญ่ 70B ~38–40GB · หลักสำคัญคือทั้งโมเดลต้องพอดีกับหน่วยความจำการ์ดจอ ไม่งั้นจะช้ามาก — มือใหม่แนะนำเริ่มที่ 7–8B ก่อน (ตัวเลขเป็นแนวทางประมาณ)
การบีบขนาดโมเดล (Quantization) คืออะไร?▾
คือการย่อโมเดลให้เล็กลงเพื่อประหยัดหน่วยความจำ โดยยอมให้คุณภาพลดลงนิดหน่อย — แบบ Q4 เป็นค่ามาตรฐาน สมดุลระหว่างขนาดกับคุณภาพ (แนะนำมือใหม่) · แบบ Q8 ใหญ่กว่าแต่คุณภาพใกล้ตัวเต็ม ใช้เมื่อการ์ดจอมีที่ว่างพอ
ทำให้ AI จำบทสนทนาได้ยาวขึ้นได้ไหม?▾
ได้ — ปกติ AI จะจำได้ประมาณ 2048 โทเคน (โทเคน ≈ คำ/พยางค์ ราวไม่กี่หน้ากระดาษ) ปรับให้ยาวขึ้นได้ผ่านไฟล์ตั้งค่าโมเดล (Modelfile) หรือค่าระบบ OLLAMA_CONTEXT_LENGTH · ยิ่งจำยาว ยิ่งใช้หน่วยความจำการ์ดจอมากขึ้น
เปิดให้เครื่องอื่นเรียกใช้ปลอดภัยไหม?▾
ปกติ Ollama เปิดใช้เฉพาะในเครื่องนี้เท่านั้น ถ้าอยากให้เครื่องอื่นเรียกใช้ได้ ต้องเปิดเพิ่มเอง (ตั้งค่า OLLAMA_HOST=0.0.0.0) — กรณีนั้นควรตั้งระบบกันภายนอก (firewall) ด้วย เพราะช่องทางนี้ไม่มีระบบล็อกอินในตัว
ลบโมเดลที่ไม่ใช้ยังไง?▾
ใช้ ollama rm <ชื่อโมเดล> — โมเดลกินพื้นที่ดิสก์เยอะ (หลายสิบ GB) ดูรายการด้วย ollama list และดูตัวที่เปิดอยู่ด้วย ollama ps
ตัวเลขหน่วยความจำการ์ดจอ/การบีบขนาดโมเดล เป็นแนวทางประมาณ (อ้างอิงจากบทความ) — ควรทดสอบกับเครื่องจริง · ข้อมูล ณ ก.ย. 2026 Ollama พัฒนาต่อเนื่อง ตรวจสอบเวอร์ชันล่าสุดเสมอ
สรุปบทที่ 2