Bài 23. Dữ liệu có nhãn, dữ liệu không nhãn và bài toán phân cụm
Không phải lúc nào ta cũng có sẵn đáp án đúng để dạy máy. Bài học này đi vào một trục phân chia quan trọng của học máy: dữ liệu có nhãn hay không nhãn, từ đó phân biệt học có giám sát với học không giám sát, và tìm hiểu bài toán tiêu biểu nhất của nhóm thứ hai - phân cụm (clustering).
Bắt đầu bằng một hình dung
Cuối năm học, thư viện trường nhận về hai thùng sách quyên góp. Cô thủ thư nhờ hai bạn trong đội cộng tác viên giúp một tay, mỗi bạn một thùng.
Bạn thứ nhất nhận thùng có kèm một tờ danh mục ghi rõ từng cuốn: cuốn này xếp vào giá Văn học, cuốn kia vào giá Khoa học, cuốn nọ vào giá Truyện tranh. Vừa xếp, bạn ấy vừa để ý: sách bìa mềm, khổ nhỏ, nhiều tranh vẽ thì thường là truyện tranh; sách dày, bìa cứng, có nhiều bảng biểu thì thường là sách khoa học. Xếp xong thùng đó, cô thủ thư đưa thêm mười cuốn không hề có trong danh mục, vậy mà bạn ấy vẫn đoán được nên đặt mỗi cuốn vào giá nào.
Bạn thứ hai kém may hơn: thùng của bạn ấy chẳng kèm tờ giấy nào cả. Không ai nói cuốn nào thuộc loại gì, thậm chí cũng chẳng ai cho biết trong thùng có mấy loại sách. Bạn ấy đành làm theo cách của mình: lật từng cuốn, thấy cuốn nào giống nhau về độ dày, khổ giấy, cách trình bày thì để chung một chồng. Đến cuối buổi, trên bàn hiện ra bốn chồng sách khá rõ rệt. Lúc đó bạn ấy mới ngồi nhìn lại từng chồng và tự nghĩ ra tên gọi cho chúng.
Hai bạn cùng làm một việc là sắp xếp sách, nhưng xuất phát điểm hoàn toàn khác nhau: một bên có sẵn đáp án để học theo, một bên phải tự mò ra trật tự từ một đống lộn xộn. Máy tính cũng học theo đúng hai kiểu như vậy.
Nội dung bài học
- 1) Dữ liệu có nhãn và dữ liệu không nhãn
- 2) Ba nhóm phương pháp học máy, chia theo dữ liệu đầu vào
- 3) Phân cụm: máy tự gom những đối tượng giống nhau
- 4) Phân cụm và phân loại - đừng nhầm hai bài toán này
Tóm tắt lý thuyết cần nhớ
- Dữ liệu có nhãn là dữ liệu mà mỗi mẫu đã kèm sẵn đáp án đúng do con người gán; dữ liệu không nhãn thì không có đáp án đi kèm. Đây chính là căn cứ để chia học máy thành các nhóm phương pháp khác nhau.
- Học có giám sát học từ dữ liệu đã có nhãn để dự đoán nhãn cho dữ liệu mới; học không giám sát làm việc với dữ liệu không nhãn và tự tìm ra cấu trúc ẩn nằm sẵn trong dữ liệu.
- Phân cụm (
clustering) là bài toán tiêu biểu của học không giám sát: máy dựa trên độ tương tự để gom các đối tượng giống nhau vào cùng một cụm, dù không hề biết trước có bao nhiêu nhóm hay tên gọi của chúng. - Phân loại có sẵn danh sách nhãn do con người định nghĩa trước, còn với phân cụm thì con người phải tự đặt tên và giải thích ý nghĩa cho các cụm máy tách ra; ngoài hai nhóm này còn có học tăng cường - máy học qua thử - sai cùng cơ chế thưởng/phạt.
Thuật ngữ tiếng Anh trong bài
| Tiếng Anh | Đọc là | Nghĩa |
|---|---|---|
| supervised learning | su-pơ-vai-zơ lơ-ninh | học có giám sát Là kiểu dạy máy mà mỗi ví dụ đều dán sẵn đáp án đúng. |
| unsupervised learning | ăn-su-pơ-vai-zơ lơ-ninh | học không giám sát Là kiểu máy tự học mà không ai nói đáp án. |
| label | LÂY-bồ | nhãn (đáp án đúng của một mẫu) Là đáp án đúng do con người gán sẵn cho một mẫu dữ liệu, ví dụ ảnh này là "mèo". |
| clustering | CLÁT-tơ-ring | phân cụm Bài toán tiêu biểu của học không giám sát: máy tự gom các đối tượng giống nhau vào cùng một cụm mà không có nhãn cho trước. |
| reinforcement learning | ri-in-PHO-sờ-mần LƠ-ning | học tăng cường Nhóm phương pháp thứ ba: máy học bằng cách thử hành động rồi nhận thưởng hoặc phạt, dần chọn cách làm cho điểm cao nhất. |
| similarity | si-mi-LA-ri-ti | độ tương tự Thước đo cho biết hai đối tượng giống nhau đến mức nào, tính từ các đặc điểm của chúng. |
Câu hỏi trắc nghiệm có đáp án
Mấy câu mẫu để bạn tự kiểm tra ngay. Trong ứng dụng, bài này có đủ 20 câu, chấm điểm tự động và giải thích từng câu sai.
- Dữ liệu đã được sắp xếp theo thứ tự tăng dần trước khi đưa vào máy
- Dữ liệu chỉ gồm các con số, không chứa chữ hay hình ảnh
- Dữ liệu mà mỗi mẫu đã kèm sẵn đáp án đúng do con người gán từ trước
- Dữ liệu được lưu trong tệp có đặt tên rõ ràng, dễ tìm lại
- Học không giám sát
- Học có giám sát
- Học tăng cường
- Lập trình truyền thống, không thuộc học máy
- Phân loại, vì kết quả cuối cùng là xếp khách vào các nhóm
- Dự đoán số, vì phải tính ra doanh thu của từng khách hàng
- Học tăng cường, vì máy phải thử nhiều cách rồi nhận thưởng hoặc phạt
- Phân cụm, một bài toán thuộc học không giám sát
- a)Học có giám sát cần dữ liệu huấn luyện đã được gắn nhãn sẵn để máy đối chiếu trong quá trình học.Đúng
- b)Trong bài toán phân cụm, con người phải cho máy biết trước tên gọi và ý nghĩa của từng cụm.Sai
- c)Học không giám sát làm việc với dữ liệu không nhãn và tự tìm ra cấu trúc ẩn nằm sẵn trong dữ liệu.Đúng
- d)Học tăng cường là cách máy học bằng việc được cung cấp sẵn nhãn đúng cho từng mẫu dữ liệu.Sai
- (a) Đúng - bản chất của “giám sát” là luôn có đáp án đúng do con người gán sẵn để máy so kết quả dự đoán và tự điều chỉnh.
- (b) Sai - ngược lại mới đúng: máy tự tách các cụm dựa trên độ tương tự mà không biết gì về tên gọi, con người chỉ đặt tên và giải thích ý nghĩa SAU khi máy đã chia xong.
- (c) Đúng - đây chính là định nghĩa của học không giám sát: không có nhãn để đối chiếu nên nhiệm vụ là phát hiện trật tự ẩn trong dữ liệu, mà phân cụm là ví dụ tiêu biểu.
- (d) Sai - học từ nhãn có sẵn là học có giám sát; học tăng cường là học qua thử - sai, hành động tốt được thưởng, hành động dở bị phạt, thường gặp trong trò chơi và điều khiển rô-bốt.
Thử ngay: minh hoạ từng bước
Bấm từng bước để tự xem cơ chế hoạt động, hoặc bấm “Tự chạy” cho nó tiến mỗi giây một lần. Đổi được dữ liệu đầu vào - không cần đăng nhập.
Học trọn bài này trong ứng dụng
Bài giảng đầy đủ, 20 câu luyện tập chấm tự động, thi thử đúng cấu trúc đề tốt nghiệp (24 trắc nghiệm + 4 Đúng/Sai), bài thực hành máy tự chấm và gia sư AI giải thích chỗ sai.
Phần học miễn phí, không cần tạo tài khoản.
Bài liên quan - Trí tuệ nhân tạo & Học máy
Cùng mạch kiến thức với bài này, học nối tiếp cho chắc phần lí thuyết.