เมื่อ AI ไม่จำเป็นต้องอยู่บน Cloud เสมอไป
ทุกวันนี้การใช้งาน Large Language Model หรือ LLM ไม่ได้จำกัดอยู่แค่บริการบน Cloud อย่างเดียวอีกต่อไป
องค์กร โรงเรียน ห้อง Lab หรือแม้แต่ผู้ดูแลระบบสามารถนำ AI Model มารันบน Server ของตัวเอง แล้วเปิดให้เครื่อง Client, Web Application, Python, n8n หรือระบบ Automation เรียกใช้งานผ่าน API ได้
หนึ่งในเครื่องมือที่ทำเรื่องนี้ได้ง่ายมากคือ Ollama
ลองนึกภาพว่าเรามี Server อยู่หนึ่งเครื่อง
┌─────────────────────┐
│ Ollama Server │
│ │
│ LLM Model │
│ GPU / CPU │
│ API :11434 │
└──────────┬──────────┘
│
┌──────────────┼──────────────┐
│ │ │
▼ ▼ ▼
Web Application Python n8n
│
▼
Users
แทนที่ Client ทุกเครื่องจะต้องติดตั้ง AI Model ขนาดหลาย GB เราสามารถรวมทรัพยากร CPU, RAM และ GPU ไว้ที่ Server กลาง แล้วให้ Application เรียกใช้งานผ่าน Network ได้
นี่คือเหตุผลสำคัญที่ SysAdmin ควรเริ่มรู้จัก Ollama
Ollama คืออะไร
Ollama คือ Platform สำหรับดาวน์โหลด จัดการ และรัน Large Language Model บนเครื่องของเราเอง โดยรองรับ macOS, Windows และ Linux
ผู้ใช้งานไม่จำเป็นต้องจัดการรายละเอียดของ Model Runtime ที่ซับซ้อนมากนัก เราสามารถเลือก Model แล้วสั่งรันผ่าน Command Line ได้โดยตรง
ตัวอย่าง
# ดาวน์โหลดและรัน AI Model
snap install ollama
ollama run gemma4
คำสั่ง ollama run จะเรียก Model ที่ระบุขึ้นมาใช้งาน และหาก Model ยังไม่มีอยู่ในเครื่อง Ollama จะจัดการดาวน์โหลด Model ที่จำเป็นให้
นอกจากใช้งานผ่าน Command Line แล้ว จุดสำคัญสำหรับ SysAdmin คือ Ollama มี REST API ในตัว
ค่าเริ่มต้น API จะให้บริการที่
http://localhost:11434/api
ตามเอกสารอย่างเป็นทางการของ Ollama
หมายความว่าเราสามารถเปลี่ยน Linux Server ธรรมดาให้กลายเป็น AI API Server ได้
Ollama ไม่ใช่ AI Model
จุดนี้ผู้เริ่มต้นมักสับสน
Ollama ไม่ใช่ AI Model เหมือน Llama หรือ Gemma แต่เป็นระบบที่ช่วยให้เราจัดการและรัน Model เหล่านั้น
เปรียบเทียบง่าย ๆ
Docker Ollama
│ │
├── Container ├── AI Model
├── Container ├── AI Model
└── Container └── AI Model
ในมุม SysAdmin เราอาจมองว่า Ollama ทำหน้าที่คล้าย Model Runtime + Model Manager + API Server
เราสามารถ Pull Model, Run Model, ดู Model ที่ติดตั้งอยู่ ลบ Model รวมถึงเรียก Model ผ่าน API ได้
Ollama API มี Endpoint สำหรับงานต่าง ๆ เช่น Generate, Chat, Embed, List Models, Show Model, Pull, Push และ Delete Model
นี่จึงทำให้ Ollama เหมาะกับการนำ AI เข้าไปเป็นส่วนหนึ่งของ Infrastructure
ทำไม SysAdmin ควรรู้จัก Ollama
1. สามารถสร้าง Private AI Server ได้
กรณีที่ข้อมูลไม่ควรส่งออกไปยังบริการภายนอก เราสามารถรัน Model ภายใน Infrastructure ของเราเองได้
ตัวอย่างเช่น
User
│
▼
Internal Web
│
▼
Ollama Server
│
▼
Local LLM
แนวทางนี้เหมาะกับระบบภายใน เช่น
-
Knowledge Base ขององค์กร
-
Documentation
-
Internal Chatbot
-
IT Helpdesk
-
วิเคราะห์ Log
-
Search เอกสาร
-
AI Assistant สำหรับเจ้าหน้าที่
-
ระบบ RAG
อย่างไรก็ตามคำว่า Private AI ไม่ได้หมายความว่าระบบจะปลอดภัยโดยอัตโนมัติ SysAdmin ยังต้องควบคุม Network, Authentication, Authorization, Logging และข้อมูลที่ส่งเข้า Model ตามนโยบายขององค์กร
2. มี REST API พร้อมใช้งาน
นี่คือคุณสมบัติที่สำคัญมากสำหรับงาน Infrastructure และ Automation
หลังจาก Ollama ทำงานแล้ว เราสามารถเรียก Model ผ่าน curl ได้ทันที
ตัวอย่าง
# ส่ง Prompt ไปยัง Ollama API
curl http://localhost:11434/api/generate \
-d '{
"model": "gemma4",
"prompt": "Explain Linux load average for a system administrator"
}'
คำสั่งนี้ส่ง HTTP Request ไปยัง Endpoint /api/generate เพื่อให้ Model สร้างคำตอบกลับมา รูปแบบนี้เป็นรูปแบบเดียวกับตัวอย่างในเอกสาร Ollama API
ตรงนี้เองที่ทำให้เราสามารถนำ Ollama ไปเชื่อมกับระบบอื่นได้ง่ายมาก
ตัวอย่างเช่น
Prometheus ──┐
Grafana ─────┤
Linux Logs ──┤
▼
n8n
│
▼
Ollama Server
│
▼
AI Analysis
ลองจินตนาการว่า n8n ดึง Error Log จาก Server แล้วส่งให้ Ollama ช่วยสรุปปัญหา จากนั้นส่งรายงานให้ Administrator
นี่คือการนำ Local AI มาใช้กับงาน SysAdmin จริง
3. เชื่อมต่อกับ Python และ JavaScript ได้
Ollama มี Official Library สำหรับทั้ง Python และ JavaScript
ดังนั้น Developer และ SysAdmin สามารถสร้าง Application ที่ใช้ AI ได้โดยไม่จำเป็นต้องเขียนระบบ Model Runtime ขึ้นมาเองทั้งหมด
สถาปัตยกรรมอาจเป็น
Python Application
│
│ API
▼
Ollama Server
│
▼
Model
จึงเหมาะมากสำหรับการทำ
-
Chatbot
-
AI Agent
-
Log Analyzer
-
Document Assistant
-
RAG
-
Automation
-
Monitoring Assistant
-
DevOps Assistant
4. ใช้ CPU หรือ GPU ได้
LLM สามารถประมวลผลด้วย CPU ได้ แต่หากต้องการประสิทธิภาพสูง GPU จะมีบทบาทสำคัญมาก
Ollama รองรับ GPU หลาย Platform โดยเอกสารปัจจุบันระบุการรองรับ NVIDIA และ AMD รวมถึง Metal บนอุปกรณ์ Apple ส่วน AMD บน Linux ใช้ ROCm v7 สำหรับ GPU ที่รองรับ
ตัวอย่าง Server สำหรับเริ่มต้น Lab อาจเป็น
CPU 8 Cores
RAM 32 GB
GPU NVIDIA 12 GB VRAM
Disk NVMe 500 GB
OS Ubuntu Server 26.04
Ollama 0.32.x
สเปกจริงจะขึ้นอยู่กับขนาด Model, Quantization, Context Length และจำนวนผู้ใช้งานพร้อมกัน
โดยเฉพาะ Context Length ที่สูงขึ้นจะใช้ Memory หรือ VRAM เพิ่มขึ้น ดังนั้นอย่าพิจารณาเฉพาะจำนวน Parameter ของ Model เพียงอย่างเดียว
Ollama ทำงานอย่างไร
มองแบบง่ายที่สุด กระบวนการมีประมาณนี้
1. Install Ollama
│
▼
2. Pull Model
│
▼
3. Load Model
│
▼
4. Send Prompt
│
▼
5. Inference
│
▼
6. Response
เราสามารถตรวจสอบ Model ที่มีอยู่ใน Server ได้ด้วย
# แสดงรายการ Model ที่ติดตั้งใน Ollama
ollama list
ในระดับ API ก็สามารถเรียก
# แสดงรายการ Model ผ่าน REST API
curl http://localhost:11434/api/tags
Endpoint /api/tags ใช้สำหรับแสดง Model และรายละเอียดของ Model ที่มีอยู่ใน Ollama Server
Ollama กับ Cloud AI ต่างกันอย่างไร
แนวคิดของสองระบบต่างกันพอสมควร
| ประเด็น | Ollama Local | Cloud AI |
|---|---|---|
| Model ทำงานที่ | Server ของเรา | Cloud Provider |
| Hardware | เราจัดการ | Provider จัดการ |
| GPU | ต้องมีเองถ้าต้องการ | Provider จัดการ |
| Network | ทำ Offline/Local ได้ในหลายกรณี | โดยทั่วไปต้องใช้ Internet |
| Privacy | ควบคุม Infrastructure เอง | ขึ้นกับบริการและนโยบาย Provider |
| Scaling | ต้องออกแบบเอง | Provider ช่วยจัดการ |
| Maintenance | SysAdmin ดูแล | Provider ดูแลส่วนใหญ่ |
| API | มี | มี |
ดังนั้น Ollama ไม่ได้หมายความว่าจะมาแทน Cloud AI ทุกกรณี
หากต้องการ Model ขนาดใหญ่มาก รองรับผู้ใช้จำนวนมาก หรือไม่ต้องการลงทุน GPU การใช้ Cloud อาจเหมาะกว่า
แต่ถ้าต้องการเรียนรู้ Local LLM, สร้าง Lab, ทำ Edge AI หรือควบคุม Infrastructure เอง Ollama เป็นอีกทางเลือกที่น่าสนใจมาก
Ollama รุ่นปัจจุบันยังรองรับ Cloud Models ด้วย ทำให้สามารถใช้เครื่องมือ Ollama เดิมและเลือกว่าจะใช้ Local Model หรือ Model ที่ประมวลผลบน Ollama Cloud ตาม Workload ได้
เรื่อง Security ที่ SysAdmin ต้องระวัง
หัวข้อนี้สำคัญมาก
ค่าเริ่มต้นของ Ollama API ทำงานที่
127.0.0.1:11434
หรือเข้าผ่าน
http://localhost:11434
การเข้าถึง Ollama API แบบ Local ไม่ต้อง Authentication ตามเอกสารอย่างเป็นทางการ
ดังนั้น
⚠️ อย่าเปิด Port 11434 ออก Internet โดยตรงโดยไม่มีมาตรการป้องกัน
หากต้องการให้ Client ภายใน Network ใช้งาน Central Ollama Server ควรออกแบบประมาณนี้
Internet
│
Firewall
│
▼
Reverse Proxy
HTTPS / Authentication
│
▼
Ollama Server
:11434
หรือถ้าใช้เฉพาะภายในองค์กร
LAN / VLAN
│
Firewall ACL
│
▼
Ollama Server
SysAdmin ควรพิจารณาอย่างน้อย
-
Firewall
-
VLAN
-
Reverse Proxy
-
HTTPS
-
Authentication
-
Rate Limiting
-
Access Log
-
Monitoring
-
Resource Limit
-
Backup Configuration
-
Model Storage
-
Patch Management
โดยเฉพาะ Server ที่มี GPU ราคาแพง หากปล่อย API โดยไม่มีการควบคุม ผู้ใช้สามารถส่ง Request จำนวนมากจน CPU, RAM หรือ VRAM เต็มได้
Ollama มีระบบ Queue สำหรับ Request และสามารถกำหนดจำนวน Request ที่รอประมวลผลด้วย OLLAMA_MAX_QUEUE ได้ นอกจากนี้ยังรองรับ Concurrent Requests ตาม Memory และ VRAM ที่มีอยู่
Ollama เหมาะกับงานอะไรของ SysAdmin
ตัวอย่างที่ผมมองว่าน่าสนใจสำหรับห้อง Lab และองค์กรมีหลายแบบ
AI สำหรับวิเคราะห์ Log
Nginx Log
│
▼
Python / n8n
│
▼
Ollama
│
▼
สรุป Error และแนวทางแก้ไข
Internal IT Assistant
IT Documentation
│
▼
Vector Database
│
▼
RAG
│
▼
Ollama Server
│
▼
IT Helpdesk Chatbot
AI สำหรับ Automation
Monitoring Alert
│
▼
n8n
│
▼
Ollama
│
▼
วิเคราะห์เหตุการณ์
│
▼
LINE / Email / Dashboard
หรือสร้าง AI Assistant ให้ช่วยอธิบายคำสั่ง Linux, วิเคราะห์ Configuration, สรุป Incident Report และช่วยค้นหา Documentation ภายในองค์กร
Ollama ไม่ได้ทำให้ทุกอย่างง่ายโดยอัตโนมัติ
การติดตั้ง Ollama อาจง่าย แต่การทำ AI Infrastructure ที่ใช้งานจริง ยังมีเรื่องที่ SysAdmin ต้องเรียนรู้อีกหลายอย่าง
เช่น
Model Selection
│
Quantization
│
RAM / VRAM
│
Context Length
│
Concurrency
│
API Security
│
Monitoring
│
Scaling
Model ขนาดใหญ่ไม่ได้หมายความว่าจะเหมาะกับทุกงานเสมอไป
ในหลายกรณี Model ขนาดเล็กแต่ตอบเร็ว ใช้ VRAM น้อย และรองรับผู้ใช้พร้อมกันได้มากกว่า อาจเป็นทางเลือกที่ดีกว่าสำหรับ Production
นี่เป็นจุดที่บทบาทของ SysAdmin เริ่มมีความสำคัญ
เพราะ AI Server ไม่ได้มีแค่เรื่อง Model แต่ยังเกี่ยวกับ
Linux + Network + Security + Storage + GPU + API + Monitoring + Automation
ซึ่งทั้งหมดเป็นพื้นที่ที่ SysAdmin คุ้นเคยอยู่แล้ว
แนะนำ Screenshot สำหรับบทความ
เพื่อให้บทความเข้าใจง่ายขึ้น สามารถเพิ่ม Screenshot ตามจุดต่อไปนี้
-
หน้าเว็บไซต์หรือหน้า Model Library ของ Ollama
-
Terminal แสดงคำสั่ง
ollama --version -
Terminal แสดง
ollama list -
การรัน Model ด้วย
ollama run -
ผลลัพธ์จาก
curl http://localhost:11434/api/tags -
Diagram สถาปัตยกรรม Central Ollama Server
-
ภาพ GPU Server พร้อมผลจาก
nvidia-smi
สรุป
Ollama เป็นเครื่องมือที่ช่วยลดความซับซ้อนในการนำ Large Language Model มารันบนเครื่องหรือ Server ของเราเอง พร้อม Command Line และ REST API ที่สามารถนำไปเชื่อมกับ Application, Python, JavaScript และระบบ Automation ได้
สำหรับ SysAdmin สิ่งที่น่าสนใจไม่ใช่เพียงการสั่ง AI ให้ตอบคำถาม แต่คือการนำ Ollama มาสร้าง AI Infrastructure
จาก Server เพียงเครื่องเดียว เราสามารถพัฒนาต่อไปเป็น
Private AI Server
│
├── Internal Chatbot
├── RAG Server
├── AI Automation
├── Log Analysis
├── DevOps Assistant
└── AI API
และเมื่อเริ่มมีผู้ใช้จริง งานด้าน Network Security, GPU Resource Management, Monitoring, API Security และ Scaling ก็จะกลายเป็นหน้าที่ของ SysAdmin โดยตรง
ดังนั้นในยุคที่ AI กำลังกลายเป็นส่วนหนึ่งของ Infrastructure การรู้จัก Ollama จึงเป็นจุดเริ่มต้นที่ดีสำหรับ SysAdmin ที่ต้องการก้าวจากการเป็นเพียง ผู้ใช้ AI ไปสู่การเป็น ผู้ดูแล AI Infrastructure
—
Write by Dr.Arnut Ruttanatirakul
(c) SysAdmin Knowledge
https://www.sysadmin.in.th
August 12, 2026