Bỏ qua

Module III - Production LLMOps

Tổng quan

Module III chuyển từ "hệ thống chạy được trên máy mình" sang "hệ thống chạy được trong production, có người khác vận hành": prompt được version hoá, chất lượng được đo tự động, chi phí được kiểm soát, deploy được tự động hoá, và sự cố được phát hiện trước khi người dùng báo.

Module dùng GitHub Actions làm nền tảng CI/CD và Google Cloud (Compute Engine + Secret Manager) làm môi trường deploy xuyên suốt.


Lộ trình học

graph LR
    A[LLMOps &<br/>Prompt Mgmt] --> B[Eval Pipelines]
    B --> C[Cost Opt &<br/>Caching]
    C --> D[Containerisation<br/>& Serving]
    D --> E[Cloud Deploy]
    E --> F[CI/CD]
    B --> F
    F --> G[Observability<br/>& Guardrails]
    G --> H[Capstone Project]

Danh sách bài học

# Bài Chủ đề chính
1 LLMOps Overview & Prompt Management LLMOps vs MLOps, prompt versioning, prompt registry, A/B testing
2 LLM Evaluation Pipelines Golden datasets, eval methods, regression testing, eval gate trong CI
3 Cost Optimization & Caching Token economics, 2-stage cache, model cascading, batch API, cost governance
4 Containerisation & LLM Serving Docker cho LLM, vLLM/TGI, PagedAttention, FastAPI streaming
5 Cloud Deployment (Compute Engine + Secret Manager) Cloud landscape, systemd/nginx/HTTPS, GCP Secret Manager
6 CI/CD for LLM Apps GitHub Actions, prompt linting, eval gate, smoke test, rollback
7 LLM Observability & Guardrails at Scale Tracing production, cost dashboard, guardrails ở scale, incident response
8 Capstone: Production LLM System Pipeline hoàn chỉnh version → evaluate → register → deploy → monitor

Framework tư duy: Thứ gì đáng chặn deploy?

graph TD
    Q{Thay đổi gì?} --> A[Sửa code / dependency]
    Q --> B[Sửa prompt]
    Q --> C[Đổi model / provider]
    A --> UNIT[→ Unit test + smoke test]
    B --> EVAL[→ Eval gate: điểm không được giảm quá threshold]
    C --> EVAL
    EVAL --> COST{Cost / latency<br/>tăng bất thường?}
    COST -->|Có| BLOCK[→ Chặn, review lại]
    COST -->|Không| DEPLOY[→ Deploy + theo dõi dashboard]

Phụ thuộc từ Module I & II

Module III không dạy lại nền tảng - nó pipeline hoá những gì hai module trước đã xây:

  • Prompt patterns (M1, Bài 1) → được version hoá và đưa vào registry (Bài 1).
  • LLM Evaluation & RAGAS (M1, Bài 7) và Agent / Trajectory Evaluation (M2, Bài 5) → trở thành eval pipeline chạy tự động trên PR (Bài 2).
  • Production Optimization - Caching & Routing (M1, Bài 8) → mở rộng sang cost governance, cascading, batch API (Bài 3).
  • Serving Local LLMs - Ollama & Quantization (M1, Bài 2) → mở rộng sang vLLM/TGI cho high-throughput (Bài 4).
  • Guardrails (M1, Bài 7) và Tracing / OpenTelemetry (M2, Bài 5) → mở rộng sang dashboard production và incident response (Bài 7).
  • Capstone Module I (Vietnamese Legal Assistant) và Capstone Module II (Multi-Agent Research Assistant) → được đưa lên pipeline production hoàn chỉnh trong Capstone Module III.