Mở đầu: "Train xong rồi" — và rồi sao nữa?

Rất nhiều bài viết về AI kết thúc ở đúng khoảnh khắc loss cong giảm về gần 0 và model "hoạt động". Nhưng nếu bạn từng tự hỏi vì sao một phòng lab AI lớn có hàng nghìn nhân sự mà phần lớn trong số đó không hề viết code huấn luyện model, câu trả lời nằm ở phần bị bỏ qua này: huấn luyện chỉ là một mắt xích nhỏ trong một chuỗi quy trình dài hơn nhiều — từ dữ liệu thô đến một sản phẩm hàng triệu người dùng tin tưởng mỗi ngày.

Bài học này vẽ ra toàn cảnh 6 giai đoạn tạo nên một AI product thật, chỉ rõ ai chịu trách nhiệm ở từng giai đoạn, và — quan trọng nhất — chi phí thật sự nằm ở đâu chứ không chỉ nằm ở "tiền mua GPU train model". Đây là bối cảnh nền cho toàn bộ Track A của series; các bài sau (2–6) sẽ đào sâu từng giai đoạn một.


📚 Điều kiện tiên quyết
Bài này không yêu cầu kiến thức toán/ML trước đó — chỉ cần đọc hiểu JavaScript ES6+ cơ bản để theo dõi các đoạn code minh hoạ. Nếu bạn muốn hiểu sâu hơn về bên trong bước huấn luyện (gradient descent, kiến trúc transformer), có thể tham khảo thêm Series 12: AI — Từ Neuron Đến LLM — series đó và series này bổ trợ nhau nhưng độc lập, không bắt buộc phải học trước.

1. Vì sao "train xong" chỉ là khoảng 20% công việc

Hãy hình dung một trục thời gian đơn giản của một AI product từ ý tưởng đến khi người dùng thật sự gõ câu hỏi vào nó: thu thập dữ liệu → huấn luyện (pretraining) → RLHF/alignment → đánh giá & red-team → triển khai → giám sát. Bước "huấn luyện" — thứ chiếm gần như toàn bộ nội dung các khoá học ML phổ thông — thực ra chỉ là giai đoạn thứ 2 trên 6 giai đoạn, và về mặt thời gian lịch làm việc, nó thường không phải giai đoạn dài nhất.

Điều này giải thích vì sao một tổ chức AI nghiêm túc cần nhiều vai trò hoàn toàn không "làm ML" theo nghĩa viết code huấn luyện: người rà soát dữ liệu, người viết prompt tấn công thử hệ thống, kỹ sư vận hành hạ tầng inference, và đội ngũ hỗ trợ khách hàng đọc log lỗi mỗi ngày. Dưới đây là cấu trúc dữ liệu mô tả 6 giai đoạn mà bộ demo tương tác của bài này sử dụng:

aisys-product-lifecycle.js (trích)
export const LIFECYCLE_STAGES = [
  { id: "collect",  label: "1. Thu thập & Làm sạch",           costPct: 15  },
  { id: "pretrain", label: "2. Huấn luyện phân tán",           costPct: 100 }, // đắt nhất
  { id: "rlhf",     label: "3. RLHF / Alignment",              costPct: 40  },
  { id: "eval",     label: "4. Đánh giá & Red-team",           costPct: 20  },
  { id: "deploy",   label: "5. Triển khai (Canary → Full)",    costPct: 25  },
  { id: "monitor",  label: "6. Giám sát & Lặp lại",             costPct: 30  }, // liên tục
];

Lưu ý cột costPct chỉ là chi phí tương đối để minh hoạ tương quan giữa các giai đoạn (chuẩn hoá theo giai đoạn đắt nhất = 100), không phải số liệu tài chính thật của bất kỳ công ty cụ thể nào — chi tiết ở mục 3.

🕳️ Cạm bẫy: Tưởng rằng "AI Engineer" = người viết code training
Sai lầm phổ biến nhất khi mới vào ngành là nghĩ công việc AI xoay quanh việc viết vòng lặp huấn luyện. Thực tế, phần lớn thời gian của một tổ chức AI trưởng thành nằm ở giai đoạn 1 (làm sạch dữ liệu — cực kỳ tốn nhân lực), giai đoạn 4 (đánh giá/red-team — cần chuyên gia bảo mật, không phải ML), và giai đoạn 6 (giám sát — vận hành liên tục, không có điểm kết thúc). Nếu bạn chỉ học "cách train model" mà bỏ qua 5 giai đoạn còn lại, bạn sẽ không hiểu được vì sao dự án AI thực tế luôn "chậm hơn dự kiến".

2. Ai làm gì ở mỗi giai đoạn — và bàn giao ra sao

Mỗi giai đoạn có một (hoặc vài) vai trò chủ chốt, và điểm mấu chốt để một pipeline AI không "vỡ trận" là bàn giao (handoff) giữa các vai trò phải có định dạng rõ ràng — không phải một tin nhắn Slack "xong rồi đó". Ví dụ, khi đội Data Engineer bàn giao một tập dữ liệu đã làm sạch cho đội Research Scientist, họ không chỉ gửi file — họ gửi kèm một "manifest" mô tả nguồn gốc, kích thước, và các bước lọc đã áp dụng:

dataset-manifest.json
{
  "datasetId": "web-corpus-v7",
  "handoffFrom": "Data Engineering",
  "handoffTo": "Research Scientist (Pretraining)",
  "rowCount": 842000000,
  "filtersApplied": ["dedup-minhash", "pii-scrub", "toxicity-classifier@0.7"],
  "excludedPct": 34.2,
  "license": "reviewed-by-legal",
  "readyForTraining": true
}

Bảng dưới đây tóm tắt vai trò chủ chốt và sản phẩm bàn giao (artifact) của từng giai đoạn:

Giai đoạn Vai trò chủ chốt Bàn giao cho giai đoạn sau
1. Thu thập & Làm sạch Data Engineer, Data Labeler, Legal Dataset manifest đã lọc + đã duyệt license
2. Huấn luyện phân tán Research Scientist, Infra Engineer Checkpoint model đã pretrain (SFT-ready)
3. RLHF / Alignment Alignment Researcher, Human Rater Model đã căn chỉnh (candidate release)
4. Đánh giá & Red-team Trust & Safety, Security Researcher Báo cáo pass/fail benchmark + danh sách lỗ hổng đã vá
5. Triển khai MLOps, SRE, Product Manager Model version đang phục vụ traffic thật
6. Giám sát & Lặp lại MLOps, Support, Product/Research Dữ liệu phản hồi thật → quay lại giai đoạn 1
💡 Mẹo: Vòng đời là một VÒNG LẶP, không phải đường thẳng
Nhìn bảng trên, cột cuối của giai đoạn 6 quay ngược lại giai đoạn 1 — dữ liệu người dùng thật (câu hỏi khó, phản hồi tiêu cực, log lỗi) trở thành nguyên liệu cho vòng huấn luyện phiên bản kế tiếp. Một AI product trưởng thành không bao giờ "hoàn thành" — nó liên tục lặp qua cả 6 giai đoạn theo chu kỳ release (có thể vài tuần đến vài tháng một vòng).

3. Chi phí thật nằm ở đâu

Khi nhắc đến "chi phí AI", phần lớn người ngoài ngành chỉ nghĩ đến hoá đơn thuê cụm GPU để huấn luyện. Con số đó có thật và rất lớn — nhưng nó chỉ là một loại chi phí trong ít nhất ba loại chi phí hoàn toàn khác bản chất:

  • Chi phí compute một lần (CapEx-như): huấn luyện pretraining — tốn nhất tính theo GPU-giờ, nhưng chỉ trả một lần cho mỗi phiên bản model.
  • Chi phí nhân lực trải dài: gán nhãn dữ liệu, gán nhãn preference cho RLHF, red-team thủ công — đây là chi phí con người, không co giãn theo GPU giá rẻ hơn.
  • Chi phí vận hành liên tục (OpEx): phục vụ inference cho hàng triệu request mỗi ngày, giám sát, hỗ trợ — chi phí này KHÔNG dừng lại sau khi "deploy xong", và về dài hạn có thể vượt tổng chi phí huấn luyện ban đầu.

Một hàm ước lượng rất đơn giản (giản lược, không tính đến chiết khấu quy mô) minh hoạ sự khác biệt:

estimate-cost.js
function estimateTrainingCost(gpuHours, costPerGpuHour) {
  // Chi phí MỘT LẦN — trả xong là xong cho phiên bản model này.
  return gpuHours * costPerGpuHour;
}

function estimateServingCostPerMonth(requestsPerDay, costPerThousandRequests) {
  // Chi phí LIÊN TỤC — nhân theo số ngày, KHÔNG có điểm dừng tự nhiên.
  const daysPerMonth = 30;
  return (requestsPerDay / 1000) * costPerThousandRequests * daysPerMonth;
}

// Ví dụ: training tốn 2 triệu USD một lần, nhưng serving 5 triệu request/ngày
// với giá 0.002 USD/1000 request đã là 300 USD/ngày = 9,000 USD/tháng — và
// con số này CHẠY MÃI, không giảm khi model "đã huấn luyện xong".

So sánh trực quan hai bản chất chi phí này:

Tiêu chí Chi phí Training (một lần) Chi phí Serving/Giám sát (liên tục)
Tần suất phát sinh Một lần cho mỗi phiên bản model Mỗi ngày, suốt vòng đời sản phẩm
Đơn vị đo GPU-giờ (thường tính bằng cụm nghìn GPU) Request/giây, chi phí/1000 request
Có thể "trả 1 lần rồi quên"? Có — sau khi có checkpoint, không tốn thêm Không — dừng trả tiền là dừng phục vụ người dùng
Ai chịu trách nhiệm tối ưu Research/Infra Engineer MLOps/SRE
🔬 Đào sâu: Vì sao chi phí gán nhãn con người hay bị đánh giá thấp
Chi phí GPU dễ ước lượng vì có bảng giá rõ ràng theo giờ. Chi phí gán nhãn con người (cho RLHF, cho red-team, cho lọc dữ liệu độc hại) khó ước lượng hơn nhiều vì phụ thuộc vào chất lượng và tính lặp lại của công việc — một chuyên gia y tế chấm điểm câu trả lời y khoa đắt hơn rất nhiều một người gán nhãn dữ liệu ảnh phổ thông. Nhiều đội mới thường lập ngân sách chỉ dựa trên chi phí compute và bị vượt ngân sách nặng ở khoản nhân lực — đây là lý do Bài 4 (RLHF) và Bài 5 (Red-team) của series này dành hẳn một mục riêng cho chi phí gán nhãn.

4. Thực hành tương tác: Timeline vòng đời AI product

Bấm vào từng giai đoạn dưới đây để xem thời gian, chi phí tương đối và vai trò chủ chốt tương ứng. Thanh chi phí đã được chuẩn hoá theo giai đoạn đắt nhất (huấn luyện phân tán = 100%) để bạn dễ so sánh tương quan giữa các giai đoạn:

🗺️ Timeline Vòng Đời AI Product
aisys-product-lifecycle.js (trích)
// Xem toàn bộ tại aisys-product-lifecycle.js — dữ liệu 6 giai đoạn
// (thời gian, chi phí tương đối, vai trò) + hàm render tương tác.
export function renderLifecycleDemo(root) {
  const stageBtns = root.querySelectorAll(".lifecycle-stage");
  const detailPanel = root.querySelector(".lifecycle-detail");
  // ... click 1 nút -> tìm stage tương ứng trong LIFECYCLE_STAGES -> render chi tiết
}

Nếu bạn muốn hiểu sâu hơn cơ chế đứng sau bước 2 (huấn luyện) ở mức toán học, series Series 12: AI — Từ Neuron Đến LLM dạy chính xác gradient descent và kiến trúc transformer đứng sau bước này. Nếu bạn tò mò phần cứng thật sự chạy bước huấn luyện đó, xem thêm Bài 10 Series 15: Tăng Tốc Phần Cứng GPU/NPU/AMX.

5. Case study rút gọn: một vòng đời phát hành

Để cụ thể hoá, hãy hình dung một "release note" nội bộ rút gọn — dạng tài liệu thật mà một đội AI có thể viết ra sau khi hoàn thành một vòng đời đầy đủ cho phiên bản model mới:

release-timeline-v3.json
{
  "modelVersion": "assistant-v3",
  "timeline": [
    { "stage": "collect",  "durationWeeks": 10, "note": "Thêm 40% dữ liệu domain y tế, lọc bỏ 34% do trùng lặp" },
    { "stage": "pretrain", "durationWeeks": 6,  "note": "Chạy trên cụm GPU, checkpoint mỗi 6 giờ để phòng sự cố" },
    { "stage": "rlhf",     "durationWeeks": 3,  "note": "12,000 cặp so sánh preference từ chuyên gia domain" },
    { "stage": "eval",     "durationWeeks": 2,  "note": "Phát hiện 3 lớp jailbreak mới, đã vá trước release" },
    { "stage": "deploy",   "durationWeeks": 1,  "note": "Canary 2% traffic trong 3 ngày trước khi rollout 100%" },
    { "stage": "monitor",  "durationWeeks": "liên tục", "note": "Phát hiện drift ở tháng thứ 2 -> khởi động vòng v4" }
  ]
}

Cộng dồn các con số ở trên: ~22 tuần (hơn 5 tháng) từ lúc bắt đầu thu thập dữ liệu tới lúc rollout đầy đủ — trong đó bước "huấn luyện" mà nhiều người tưởng là toàn bộ công việc chỉ chiếm 6/22 tuần, tức khoảng 27% thời gian lịch làm việc (không tính giai đoạn giám sát liên tục sau đó). Đây chính là con số cụ thể hoá cho tiêu đề mục 1 của bài này.

Bài tiếp theo (Bài 2) sẽ đi sâu vào giai đoạn tốn nhân lực nhất — thu thập và làm sạch dữ liệu — trước khi Bài 3 quay lại giải phẫu kỹ thuật của bước huấn luyện phân tán. Nếu bạn muốn xem cách một agent tận dụng dữ liệu đã qua các giai đoạn này để trả lời câu hỏi thật (RAG), tham khảo thêm Series 16: Kỹ Sư AI Thực Chiến.

Tải file code thực hành minh họa bài học

File JavaScript aisys-product-lifecycle.js — dữ liệu đầy đủ 6 giai đoạn (thời gian, chi phí tương đối, vai trò, mô tả) cùng hàm render demo tương tác dùng trong bài:

Tải về aisys-product-lifecycle.js

📖 Tài liệu tham khảo

Bài viết liên quan trong series

Bài 2: Thu Thập & Làm Sạch Dữ Liệu Quay lại Lộ trình Kỹ Thuật Hệ Thống AI

Bình luận