Mở đầu: "Train xong rồi" — và rồi sao nữa?
Rất nhiều bài viết về AI kết thúc ở đúng khoảnh khắc loss cong giảm về gần 0 và model "hoạt động". Nhưng nếu bạn từng tự hỏi vì sao một phòng lab AI lớn có hàng nghìn nhân sự mà phần lớn trong số đó không hề viết code huấn luyện model, câu trả lời nằm ở phần bị bỏ qua này: huấn luyện chỉ là một mắt xích nhỏ trong một chuỗi quy trình dài hơn nhiều — từ dữ liệu thô đến một sản phẩm hàng triệu người dùng tin tưởng mỗi ngày.
Bài học này vẽ ra toàn cảnh 6 giai đoạn tạo nên một AI product thật, chỉ rõ ai chịu trách nhiệm ở từng giai đoạn, và — quan trọng nhất — chi phí thật sự nằm ở đâu chứ không chỉ nằm ở "tiền mua GPU train model". Đây là bối cảnh nền cho toàn bộ Track A của series; các bài sau (2–6) sẽ đào sâu từng giai đoạn một.
1. Vì sao "train xong" chỉ là khoảng 20% công việc
Hãy hình dung một trục thời gian đơn giản của một AI product từ ý tưởng đến khi người dùng thật sự gõ câu hỏi vào nó: thu thập dữ liệu → huấn luyện (pretraining) → RLHF/alignment → đánh giá & red-team → triển khai → giám sát. Bước "huấn luyện" — thứ chiếm gần như toàn bộ nội dung các khoá học ML phổ thông — thực ra chỉ là giai đoạn thứ 2 trên 6 giai đoạn, và về mặt thời gian lịch làm việc, nó thường không phải giai đoạn dài nhất.
Điều này giải thích vì sao một tổ chức AI nghiêm túc cần nhiều vai trò hoàn toàn không "làm ML" theo nghĩa viết code huấn luyện: người rà soát dữ liệu, người viết prompt tấn công thử hệ thống, kỹ sư vận hành hạ tầng inference, và đội ngũ hỗ trợ khách hàng đọc log lỗi mỗi ngày. Dưới đây là cấu trúc dữ liệu mô tả 6 giai đoạn mà bộ demo tương tác của bài này sử dụng:
export const LIFECYCLE_STAGES = [
{ id: "collect", label: "1. Thu thập & Làm sạch", costPct: 15 },
{ id: "pretrain", label: "2. Huấn luyện phân tán", costPct: 100 }, // đắt nhất
{ id: "rlhf", label: "3. RLHF / Alignment", costPct: 40 },
{ id: "eval", label: "4. Đánh giá & Red-team", costPct: 20 },
{ id: "deploy", label: "5. Triển khai (Canary → Full)", costPct: 25 },
{ id: "monitor", label: "6. Giám sát & Lặp lại", costPct: 30 }, // liên tục
];
Lưu ý cột costPct chỉ là chi phí tương đối để minh hoạ tương quan giữa các
giai đoạn (chuẩn hoá theo giai đoạn đắt nhất = 100), không phải số liệu tài chính thật của bất kỳ công ty
cụ thể nào — chi tiết ở mục 3.
2. Ai làm gì ở mỗi giai đoạn — và bàn giao ra sao
Mỗi giai đoạn có một (hoặc vài) vai trò chủ chốt, và điểm mấu chốt để một pipeline AI không "vỡ trận" là bàn giao (handoff) giữa các vai trò phải có định dạng rõ ràng — không phải một tin nhắn Slack "xong rồi đó". Ví dụ, khi đội Data Engineer bàn giao một tập dữ liệu đã làm sạch cho đội Research Scientist, họ không chỉ gửi file — họ gửi kèm một "manifest" mô tả nguồn gốc, kích thước, và các bước lọc đã áp dụng:
{
"datasetId": "web-corpus-v7",
"handoffFrom": "Data Engineering",
"handoffTo": "Research Scientist (Pretraining)",
"rowCount": 842000000,
"filtersApplied": ["dedup-minhash", "pii-scrub", "toxicity-classifier@0.7"],
"excludedPct": 34.2,
"license": "reviewed-by-legal",
"readyForTraining": true
}
Bảng dưới đây tóm tắt vai trò chủ chốt và sản phẩm bàn giao (artifact) của từng giai đoạn:
| Giai đoạn | Vai trò chủ chốt | Bàn giao cho giai đoạn sau |
|---|---|---|
| 1. Thu thập & Làm sạch | Data Engineer, Data Labeler, Legal | Dataset manifest đã lọc + đã duyệt license |
| 2. Huấn luyện phân tán | Research Scientist, Infra Engineer | Checkpoint model đã pretrain (SFT-ready) |
| 3. RLHF / Alignment | Alignment Researcher, Human Rater | Model đã căn chỉnh (candidate release) |
| 4. Đánh giá & Red-team | Trust & Safety, Security Researcher | Báo cáo pass/fail benchmark + danh sách lỗ hổng đã vá |
| 5. Triển khai | MLOps, SRE, Product Manager | Model version đang phục vụ traffic thật |
| 6. Giám sát & Lặp lại | MLOps, Support, Product/Research | Dữ liệu phản hồi thật → quay lại giai đoạn 1 |
3. Chi phí thật nằm ở đâu
Khi nhắc đến "chi phí AI", phần lớn người ngoài ngành chỉ nghĩ đến hoá đơn thuê cụm GPU để huấn luyện. Con số đó có thật và rất lớn — nhưng nó chỉ là một loại chi phí trong ít nhất ba loại chi phí hoàn toàn khác bản chất:
- Chi phí compute một lần (CapEx-như): huấn luyện pretraining — tốn nhất tính theo GPU-giờ, nhưng chỉ trả một lần cho mỗi phiên bản model.
- Chi phí nhân lực trải dài: gán nhãn dữ liệu, gán nhãn preference cho RLHF, red-team thủ công — đây là chi phí con người, không co giãn theo GPU giá rẻ hơn.
- Chi phí vận hành liên tục (OpEx): phục vụ inference cho hàng triệu request mỗi ngày, giám sát, hỗ trợ — chi phí này KHÔNG dừng lại sau khi "deploy xong", và về dài hạn có thể vượt tổng chi phí huấn luyện ban đầu.
Một hàm ước lượng rất đơn giản (giản lược, không tính đến chiết khấu quy mô) minh hoạ sự khác biệt:
function estimateTrainingCost(gpuHours, costPerGpuHour) {
// Chi phí MỘT LẦN — trả xong là xong cho phiên bản model này.
return gpuHours * costPerGpuHour;
}
function estimateServingCostPerMonth(requestsPerDay, costPerThousandRequests) {
// Chi phí LIÊN TỤC — nhân theo số ngày, KHÔNG có điểm dừng tự nhiên.
const daysPerMonth = 30;
return (requestsPerDay / 1000) * costPerThousandRequests * daysPerMonth;
}
// Ví dụ: training tốn 2 triệu USD một lần, nhưng serving 5 triệu request/ngày
// với giá 0.002 USD/1000 request đã là 300 USD/ngày = 9,000 USD/tháng — và
// con số này CHẠY MÃI, không giảm khi model "đã huấn luyện xong".
So sánh trực quan hai bản chất chi phí này:
| Tiêu chí | Chi phí Training (một lần) | Chi phí Serving/Giám sát (liên tục) |
|---|---|---|
| Tần suất phát sinh | Một lần cho mỗi phiên bản model | Mỗi ngày, suốt vòng đời sản phẩm |
| Đơn vị đo | GPU-giờ (thường tính bằng cụm nghìn GPU) | Request/giây, chi phí/1000 request |
| Có thể "trả 1 lần rồi quên"? | Có — sau khi có checkpoint, không tốn thêm | Không — dừng trả tiền là dừng phục vụ người dùng |
| Ai chịu trách nhiệm tối ưu | Research/Infra Engineer | MLOps/SRE |
4. Thực hành tương tác: Timeline vòng đời AI product
Bấm vào từng giai đoạn dưới đây để xem thời gian, chi phí tương đối và vai trò chủ chốt tương ứng. Thanh chi phí đã được chuẩn hoá theo giai đoạn đắt nhất (huấn luyện phân tán = 100%) để bạn dễ so sánh tương quan giữa các giai đoạn:
// Xem toàn bộ tại aisys-product-lifecycle.js — dữ liệu 6 giai đoạn
// (thời gian, chi phí tương đối, vai trò) + hàm render tương tác.
export function renderLifecycleDemo(root) {
const stageBtns = root.querySelectorAll(".lifecycle-stage");
const detailPanel = root.querySelector(".lifecycle-detail");
// ... click 1 nút -> tìm stage tương ứng trong LIFECYCLE_STAGES -> render chi tiết
}
Nếu bạn muốn hiểu sâu hơn cơ chế đứng sau bước 2 (huấn luyện) ở mức toán học, series Series 12: AI — Từ Neuron Đến LLM dạy chính xác gradient descent và kiến trúc transformer đứng sau bước này. Nếu bạn tò mò phần cứng thật sự chạy bước huấn luyện đó, xem thêm Bài 10 Series 15: Tăng Tốc Phần Cứng GPU/NPU/AMX.
5. Case study rút gọn: một vòng đời phát hành
Để cụ thể hoá, hãy hình dung một "release note" nội bộ rút gọn — dạng tài liệu thật mà một đội AI có thể viết ra sau khi hoàn thành một vòng đời đầy đủ cho phiên bản model mới:
{
"modelVersion": "assistant-v3",
"timeline": [
{ "stage": "collect", "durationWeeks": 10, "note": "Thêm 40% dữ liệu domain y tế, lọc bỏ 34% do trùng lặp" },
{ "stage": "pretrain", "durationWeeks": 6, "note": "Chạy trên cụm GPU, checkpoint mỗi 6 giờ để phòng sự cố" },
{ "stage": "rlhf", "durationWeeks": 3, "note": "12,000 cặp so sánh preference từ chuyên gia domain" },
{ "stage": "eval", "durationWeeks": 2, "note": "Phát hiện 3 lớp jailbreak mới, đã vá trước release" },
{ "stage": "deploy", "durationWeeks": 1, "note": "Canary 2% traffic trong 3 ngày trước khi rollout 100%" },
{ "stage": "monitor", "durationWeeks": "liên tục", "note": "Phát hiện drift ở tháng thứ 2 -> khởi động vòng v4" }
]
}
Cộng dồn các con số ở trên: ~22 tuần (hơn 5 tháng) từ lúc bắt đầu thu thập dữ liệu tới lúc rollout đầy đủ — trong đó bước "huấn luyện" mà nhiều người tưởng là toàn bộ công việc chỉ chiếm 6/22 tuần, tức khoảng 27% thời gian lịch làm việc (không tính giai đoạn giám sát liên tục sau đó). Đây chính là con số cụ thể hoá cho tiêu đề mục 1 của bài này.
Bài tiếp theo (Bài 2) sẽ đi sâu vào giai đoạn tốn nhân lực nhất — thu thập và làm sạch dữ liệu — trước khi Bài 3 quay lại giải phẫu kỹ thuật của bước huấn luyện phân tán. Nếu bạn muốn xem cách một agent tận dụng dữ liệu đã qua các giai đoạn này để trả lời câu hỏi thật (RAG), tham khảo thêm Series 16: Kỹ Sư AI Thực Chiến.
Tải file code thực hành minh họa bài học
File JavaScript aisys-product-lifecycle.js — dữ liệu đầy đủ 6 giai đoạn (thời gian, chi phí
tương đối, vai trò, mô tả) cùng hàm render demo tương tác dùng trong bài:
📖 Tài liệu tham khảo
- Paper nền tảng RLHF: Training language models to follow instructions with human feedback (InstructGPT, OpenAI 2022) — mô tả chi tiết quy trình RLHF được nhắc tới xuyên suốt bài.
- Kiến trúc MLOps thực chiến: ml-ops.org — MLOps Principles — tổng quan các giai đoạn vòng đời model trong công nghiệp (bao gồm giám sát & lặp lại).
- Red-teaming & đánh giá an toàn: Anthropic — Red Teaming Language Models to Reduce Harms — quy trình red-team hệ thống được tham chiếu ở Bài 5.
Bình luận