Ollama คืออะไร ทำไม SysAdmin ควรรู้จัก

เมื่อ AI ไม่จำเป็นต้องอยู่บน Cloud เสมอไป

ทุกวันนี้การใช้งาน Large Language Model หรือ LLM ไม่ได้จำกัดอยู่แค่บริการบน Cloud อย่างเดียวอีกต่อไป

องค์กร โรงเรียน ห้อง Lab หรือแม้แต่ผู้ดูแลระบบสามารถนำ AI Model มารันบน Server ของตัวเอง แล้วเปิดให้เครื่อง Client, Web Application, Python, n8n หรือระบบ Automation เรียกใช้งานผ่าน API ได้

หนึ่งในเครื่องมือที่ทำเรื่องนี้ได้ง่ายมากคือ Ollama

ลองนึกภาพว่าเรามี Server อยู่หนึ่งเครื่อง

                 ┌─────────────────────┐
                 │    Ollama Server    │
                 │                     │
                 │  LLM Model          │
                 │  GPU / CPU          │
                 │  API :11434         │
                 └──────────┬──────────┘
                            │
             ┌──────────────┼──────────────┐
             │              │              │
             ▼              ▼              ▼
        Web Application   Python          n8n
             │
             ▼
          Users

แทนที่ Client ทุกเครื่องจะต้องติดตั้ง AI Model ขนาดหลาย GB เราสามารถรวมทรัพยากร CPU, RAM และ GPU ไว้ที่ Server กลาง แล้วให้ Application เรียกใช้งานผ่าน Network ได้

นี่คือเหตุผลสำคัญที่ SysAdmin ควรเริ่มรู้จัก Ollama


Ollama คืออะไร

Ollama คือ Platform สำหรับดาวน์โหลด จัดการ และรัน Large Language Model บนเครื่องของเราเอง โดยรองรับ macOS, Windows และ Linux

ผู้ใช้งานไม่จำเป็นต้องจัดการรายละเอียดของ Model Runtime ที่ซับซ้อนมากนัก เราสามารถเลือก Model แล้วสั่งรันผ่าน Command Line ได้โดยตรง

ตัวอย่าง

# ดาวน์โหลดและรัน AI Model
snap install ollama
ollama run gemma4

คำสั่ง ollama run จะเรียก Model ที่ระบุขึ้นมาใช้งาน และหาก Model ยังไม่มีอยู่ในเครื่อง Ollama จะจัดการดาวน์โหลด Model ที่จำเป็นให้

นอกจากใช้งานผ่าน Command Line แล้ว จุดสำคัญสำหรับ SysAdmin คือ Ollama มี REST API ในตัว

ค่าเริ่มต้น API จะให้บริการที่

http://localhost:11434/api

ตามเอกสารอย่างเป็นทางการของ Ollama

หมายความว่าเราสามารถเปลี่ยน Linux Server ธรรมดาให้กลายเป็น AI API Server ได้


Ollama ไม่ใช่ AI Model

จุดนี้ผู้เริ่มต้นมักสับสน

Ollama ไม่ใช่ AI Model เหมือน Llama หรือ Gemma แต่เป็นระบบที่ช่วยให้เราจัดการและรัน Model เหล่านั้น

เปรียบเทียบง่าย ๆ

Docker                  Ollama
   │                       │
   ├── Container           ├── AI Model
   ├── Container           ├── AI Model
   └── Container           └── AI Model

ในมุม SysAdmin เราอาจมองว่า Ollama ทำหน้าที่คล้าย Model Runtime + Model Manager + API Server

เราสามารถ Pull Model, Run Model, ดู Model ที่ติดตั้งอยู่ ลบ Model รวมถึงเรียก Model ผ่าน API ได้

Ollama API มี Endpoint สำหรับงานต่าง ๆ เช่น Generate, Chat, Embed, List Models, Show Model, Pull, Push และ Delete Model

นี่จึงทำให้ Ollama เหมาะกับการนำ AI เข้าไปเป็นส่วนหนึ่งของ Infrastructure


ทำไม SysAdmin ควรรู้จัก Ollama

1. สามารถสร้าง Private AI Server ได้

กรณีที่ข้อมูลไม่ควรส่งออกไปยังบริการภายนอก เราสามารถรัน Model ภายใน Infrastructure ของเราเองได้

ตัวอย่างเช่น

User
  │
  ▼
Internal Web
  │
  ▼
Ollama Server
  │
  ▼
Local LLM

แนวทางนี้เหมาะกับระบบภายใน เช่น

  • Knowledge Base ขององค์กร

  • Documentation

  • Internal Chatbot

  • IT Helpdesk

  • วิเคราะห์ Log

  • Search เอกสาร

  • AI Assistant สำหรับเจ้าหน้าที่

  • ระบบ RAG

อย่างไรก็ตามคำว่า Private AI ไม่ได้หมายความว่าระบบจะปลอดภัยโดยอัตโนมัติ SysAdmin ยังต้องควบคุม Network, Authentication, Authorization, Logging และข้อมูลที่ส่งเข้า Model ตามนโยบายขององค์กร


2. มี REST API พร้อมใช้งาน

นี่คือคุณสมบัติที่สำคัญมากสำหรับงาน Infrastructure และ Automation

หลังจาก Ollama ทำงานแล้ว เราสามารถเรียก Model ผ่าน curl ได้ทันที

ตัวอย่าง

# ส่ง Prompt ไปยัง Ollama API
curl http://localhost:11434/api/generate \
  -d '{
    "model": "gemma4",
    "prompt": "Explain Linux load average for a system administrator"
  }'

คำสั่งนี้ส่ง HTTP Request ไปยัง Endpoint /api/generate เพื่อให้ Model สร้างคำตอบกลับมา รูปแบบนี้เป็นรูปแบบเดียวกับตัวอย่างในเอกสาร Ollama API

ตรงนี้เองที่ทำให้เราสามารถนำ Ollama ไปเชื่อมกับระบบอื่นได้ง่ายมาก

ตัวอย่างเช่น

Prometheus ──┐
Grafana ─────┤
Linux Logs ──┤
             ▼
            n8n
             │
             ▼
        Ollama Server
             │
             ▼
        AI Analysis

ลองจินตนาการว่า n8n ดึง Error Log จาก Server แล้วส่งให้ Ollama ช่วยสรุปปัญหา จากนั้นส่งรายงานให้ Administrator

นี่คือการนำ Local AI มาใช้กับงาน SysAdmin จริง


3. เชื่อมต่อกับ Python และ JavaScript ได้

Ollama มี Official Library สำหรับทั้ง Python และ JavaScript

ดังนั้น Developer และ SysAdmin สามารถสร้าง Application ที่ใช้ AI ได้โดยไม่จำเป็นต้องเขียนระบบ Model Runtime ขึ้นมาเองทั้งหมด

สถาปัตยกรรมอาจเป็น

Python Application
        │
        │ API
        ▼
   Ollama Server
        │
        ▼
      Model

จึงเหมาะมากสำหรับการทำ

  • Chatbot

  • AI Agent

  • Log Analyzer

  • Document Assistant

  • RAG

  • Automation

  • Monitoring Assistant

  • DevOps Assistant


4. ใช้ CPU หรือ GPU ได้

LLM สามารถประมวลผลด้วย CPU ได้ แต่หากต้องการประสิทธิภาพสูง GPU จะมีบทบาทสำคัญมาก

Ollama รองรับ GPU หลาย Platform โดยเอกสารปัจจุบันระบุการรองรับ NVIDIA และ AMD รวมถึง Metal บนอุปกรณ์ Apple ส่วน AMD บน Linux ใช้ ROCm v7 สำหรับ GPU ที่รองรับ

ตัวอย่าง Server สำหรับเริ่มต้น Lab อาจเป็น

CPU     8 Cores
RAM     32 GB
GPU     NVIDIA 12 GB VRAM
Disk    NVMe 500 GB
OS      Ubuntu Server 26.04
Ollama  0.32.x

สเปกจริงจะขึ้นอยู่กับขนาด Model, Quantization, Context Length และจำนวนผู้ใช้งานพร้อมกัน

โดยเฉพาะ Context Length ที่สูงขึ้นจะใช้ Memory หรือ VRAM เพิ่มขึ้น ดังนั้นอย่าพิจารณาเฉพาะจำนวน Parameter ของ Model เพียงอย่างเดียว


Ollama ทำงานอย่างไร

มองแบบง่ายที่สุด กระบวนการมีประมาณนี้

1. Install Ollama
       │
       ▼
2. Pull Model
       │
       ▼
3. Load Model
       │
       ▼
4. Send Prompt
       │
       ▼
5. Inference
       │
       ▼
6. Response

เราสามารถตรวจสอบ Model ที่มีอยู่ใน Server ได้ด้วย

# แสดงรายการ Model ที่ติดตั้งใน Ollama
ollama list

ในระดับ API ก็สามารถเรียก

# แสดงรายการ Model ผ่าน REST API
curl http://localhost:11434/api/tags

Endpoint /api/tags ใช้สำหรับแสดง Model และรายละเอียดของ Model ที่มีอยู่ใน Ollama Server


Ollama กับ Cloud AI ต่างกันอย่างไร

แนวคิดของสองระบบต่างกันพอสมควร

ประเด็น Ollama Local Cloud AI
Model ทำงานที่ Server ของเรา Cloud Provider
Hardware เราจัดการ Provider จัดการ
GPU ต้องมีเองถ้าต้องการ Provider จัดการ
Network ทำ Offline/Local ได้ในหลายกรณี โดยทั่วไปต้องใช้ Internet
Privacy ควบคุม Infrastructure เอง ขึ้นกับบริการและนโยบาย Provider
Scaling ต้องออกแบบเอง Provider ช่วยจัดการ
Maintenance SysAdmin ดูแล Provider ดูแลส่วนใหญ่
API มี มี

ดังนั้น Ollama ไม่ได้หมายความว่าจะมาแทน Cloud AI ทุกกรณี

หากต้องการ Model ขนาดใหญ่มาก รองรับผู้ใช้จำนวนมาก หรือไม่ต้องการลงทุน GPU การใช้ Cloud อาจเหมาะกว่า

แต่ถ้าต้องการเรียนรู้ Local LLM, สร้าง Lab, ทำ Edge AI หรือควบคุม Infrastructure เอง Ollama เป็นอีกทางเลือกที่น่าสนใจมาก

Ollama รุ่นปัจจุบันยังรองรับ Cloud Models ด้วย ทำให้สามารถใช้เครื่องมือ Ollama เดิมและเลือกว่าจะใช้ Local Model หรือ Model ที่ประมวลผลบน Ollama Cloud ตาม Workload ได้


เรื่อง Security ที่ SysAdmin ต้องระวัง

หัวข้อนี้สำคัญมาก

ค่าเริ่มต้นของ Ollama API ทำงานที่

127.0.0.1:11434

หรือเข้าผ่าน

http://localhost:11434

การเข้าถึง Ollama API แบบ Local ไม่ต้อง Authentication ตามเอกสารอย่างเป็นทางการ

ดังนั้น

⚠️ อย่าเปิด Port 11434 ออก Internet โดยตรงโดยไม่มีมาตรการป้องกัน

หากต้องการให้ Client ภายใน Network ใช้งาน Central Ollama Server ควรออกแบบประมาณนี้

                  Internet
                      │
                   Firewall
                      │
                      ▼
               Reverse Proxy
           HTTPS / Authentication
                      │
                      ▼
               Ollama Server
                 :11434

หรือถ้าใช้เฉพาะภายในองค์กร

LAN / VLAN
    │
Firewall ACL
    │
    ▼
Ollama Server

SysAdmin ควรพิจารณาอย่างน้อย

  • Firewall

  • VLAN

  • Reverse Proxy

  • HTTPS

  • Authentication

  • Rate Limiting

  • Access Log

  • Monitoring

  • Resource Limit

  • Backup Configuration

  • Model Storage

  • Patch Management

โดยเฉพาะ Server ที่มี GPU ราคาแพง หากปล่อย API โดยไม่มีการควบคุม ผู้ใช้สามารถส่ง Request จำนวนมากจน CPU, RAM หรือ VRAM เต็มได้

Ollama มีระบบ Queue สำหรับ Request และสามารถกำหนดจำนวน Request ที่รอประมวลผลด้วย OLLAMA_MAX_QUEUE ได้ นอกจากนี้ยังรองรับ Concurrent Requests ตาม Memory และ VRAM ที่มีอยู่


Ollama เหมาะกับงานอะไรของ SysAdmin

ตัวอย่างที่ผมมองว่าน่าสนใจสำหรับห้อง Lab และองค์กรมีหลายแบบ

AI สำหรับวิเคราะห์ Log

Nginx Log
   │
   ▼
Python / n8n
   │
   ▼
Ollama
   │
   ▼
สรุป Error และแนวทางแก้ไข

Internal IT Assistant

IT Documentation
      │
      ▼
 Vector Database
      │
      ▼
     RAG
      │
      ▼
 Ollama Server
      │
      ▼
 IT Helpdesk Chatbot

AI สำหรับ Automation

Monitoring Alert
       │
       ▼
      n8n
       │
       ▼
     Ollama
       │
       ▼
วิเคราะห์เหตุการณ์
       │
       ▼
LINE / Email / Dashboard

หรือสร้าง AI Assistant ให้ช่วยอธิบายคำสั่ง Linux, วิเคราะห์ Configuration, สรุป Incident Report และช่วยค้นหา Documentation ภายในองค์กร


Ollama ไม่ได้ทำให้ทุกอย่างง่ายโดยอัตโนมัติ

การติดตั้ง Ollama อาจง่าย แต่การทำ AI Infrastructure ที่ใช้งานจริง ยังมีเรื่องที่ SysAdmin ต้องเรียนรู้อีกหลายอย่าง

เช่น

Model Selection
      │
Quantization
      │
RAM / VRAM
      │
Context Length
      │
Concurrency
      │
API Security
      │
Monitoring
      │
Scaling

Model ขนาดใหญ่ไม่ได้หมายความว่าจะเหมาะกับทุกงานเสมอไป

ในหลายกรณี Model ขนาดเล็กแต่ตอบเร็ว ใช้ VRAM น้อย และรองรับผู้ใช้พร้อมกันได้มากกว่า อาจเป็นทางเลือกที่ดีกว่าสำหรับ Production

นี่เป็นจุดที่บทบาทของ SysAdmin เริ่มมีความสำคัญ

เพราะ AI Server ไม่ได้มีแค่เรื่อง Model แต่ยังเกี่ยวกับ

Linux + Network + Security + Storage + GPU + API + Monitoring + Automation

ซึ่งทั้งหมดเป็นพื้นที่ที่ SysAdmin คุ้นเคยอยู่แล้ว


แนะนำ Screenshot สำหรับบทความ

เพื่อให้บทความเข้าใจง่ายขึ้น สามารถเพิ่ม Screenshot ตามจุดต่อไปนี้

  1. หน้าเว็บไซต์หรือหน้า Model Library ของ Ollama

  2. Terminal แสดงคำสั่ง ollama --version

  3. Terminal แสดง ollama list

  4. การรัน Model ด้วย ollama run

  5. ผลลัพธ์จาก curl http://localhost:11434/api/tags

  6. Diagram สถาปัตยกรรม Central Ollama Server

  7. ภาพ GPU Server พร้อมผลจาก nvidia-smi


สรุป

Ollama เป็นเครื่องมือที่ช่วยลดความซับซ้อนในการนำ Large Language Model มารันบนเครื่องหรือ Server ของเราเอง พร้อม Command Line และ REST API ที่สามารถนำไปเชื่อมกับ Application, Python, JavaScript และระบบ Automation ได้

สำหรับ SysAdmin สิ่งที่น่าสนใจไม่ใช่เพียงการสั่ง AI ให้ตอบคำถาม แต่คือการนำ Ollama มาสร้าง AI Infrastructure

จาก Server เพียงเครื่องเดียว เราสามารถพัฒนาต่อไปเป็น

Private AI Server
        │
        ├── Internal Chatbot
        ├── RAG Server
        ├── AI Automation
        ├── Log Analysis
        ├── DevOps Assistant
        └── AI API

และเมื่อเริ่มมีผู้ใช้จริง งานด้าน Network Security, GPU Resource Management, Monitoring, API Security และ Scaling ก็จะกลายเป็นหน้าที่ของ SysAdmin โดยตรง

ดังนั้นในยุคที่ AI กำลังกลายเป็นส่วนหนึ่งของ Infrastructure การรู้จัก Ollama จึงเป็นจุดเริ่มต้นที่ดีสำหรับ SysAdmin ที่ต้องการก้าวจากการเป็นเพียง ผู้ใช้ AI ไปสู่การเป็น ผู้ดูแล AI Infrastructure

 



Write by Dr.Arnut Ruttanatirakul
(c) SysAdmin Knowledge
https://www.sysadmin.in.th
August  12, 2026