Nếu ở Chương 5, chúng ta đã làm quen với bài toán Hồi quy (Regression) để trả lời cho câu hỏi định lượng "Bao nhiêu?" (ví dụ: giá nhà, doanh thu, lợi nhuận là bao nhiêu?), thì bước sang Chương 6, chúng ta sẽ đối mặt với một câu hỏi mang tính phân loại quyết liệt hơn: "Thuộc nhóm nào?" hoặc "Có hay Không?". Đây chính là cốt lõi của Bài toán Phân lớp (Classification) - một nhánh trọng tâm của Học có giám sát (Supervised Learning), nơi đầu ra không phải là một con số liên tục mà là các nhãn (label) hoặc trạng thái rời rạc.
Trong môi trường kinh tế và tài chính hiện đại, kết quả phân lớp không chỉ mang ý nghĩa kỹ thuật thống kê mà còn định đoạt trực tiếp các quyết định quản trị và dòng tiền của doanh nghiệp. Ứng dụng của bài toán phân lớp xuất hiện ở khắp mọi nơi: giúp ngân hàng quyết định phê duyệt hay từ chối một khoản vay dựa trên xác suất vỡ nợ, giúp hệ thống thanh toán tự động chặn đứng các giao dịch thẻ tín dụng gian lận, hay giúp các doanh nghiệp viễn thông, bán lẻ nhận diện sớm những khách hàng có nguy cơ rời bỏ dịch vụ (Customer Churn) để kịp thời tung ra chiến lược giữ chân.
Đặc thù lớn nhất và cũng là thách thức nguy hiểm nhất của dữ liệu phân lớp trong thực tế kinh tế là sự mất cân bằng nghiêm trọng (Class Imbalance). Số lượng giao dịch gian lận hay khách hàng vỡ nợ thường chỉ chiếm một tỷ lệ rất nhỏ (có thể dưới 1%) so với tổng thể. Do đó, chương này sẽ mang đến một sự chuyển dịch lớn trong tư duy đánh giá mô hình: từ bỏ sự phụ thuộc vào Độ chính xác tổng thể (Accuracy) để tập trung phân tích sâu Ma trận nhầm lẫn (Confusion Matrix) cùng bộ chỉ số Precision, Recall, F1-Score và ROC-AUC. Quan trọng hơn, chúng ta sẽ đi sâu vào bài toán đánh đổi giữa các sai lầm dự báo (Lỗi Loại I - Cảnh báo nhầm vs. Lỗi Loại II - Bỏ lọt rủi ro) dựa trên bài toán hàm chi phí kinh tế thực tế của từng doanh nghiệp.
Chương 6 sẽ dẫn dắt bạn khám phá hệ sinh thái các thuật toán phân lớp từ cơ bản đến nâng cao, bao gồm:
Các mô hình truyền thống mang tính khả giải cao như Hồi quy Logistic (Logistic Regression) và K-Láng giềng gần nhất (KNN).
Các thuật toán dựa trên luật lệ trực quan như Cây quyết định (Decision Tree).
Các cỗ máy dự báo mạnh mẽ thuộc nhóm Học kết hợp như Rừng ngẫu nhiên (Random Forest) cùng các thuật toán thiết lập ranh giới phức tạp như SVM và Naive Bayes.
Tất cả lý thuyết và thuật toán sẽ được "thử lửa" trực tiếp thông qua các Case Study thực chiến đắt giá nhất như: Dự báo nguy cơ tiểu đường, Phát hiện gian lận thẻ tín dụng, Đánh giá rủi ro vỡ nợ và Dự báo khách hàng rời bỏ dịch vụ.