Tin Học KHMT
Ôn tập Tin học THPT › Tin học 12 - Khoa học máy tính › Bài 23
Tin học 12 - Khoa học máy tính

Bài 23. Dữ liệu có nhãn, dữ liệu không nhãn và bài toán phân cụm

Không phải lúc nào ta cũng có sẵn đáp án đúng để dạy máy. Bài học này đi vào một trục phân chia quan trọng của học máy: dữ liệu có nhãn hay không nhãn, từ đó phân biệt học có giám sát với học không giám sát, và tìm hiểu bài toán tiêu biểu nhất của nhóm thứ hai - phân cụm (clustering).

Chủ đề G · Trí tuệ nhân tạo & Học máy - đọc khoảng 12 phút · 20 câu luyện tập trong ứng dụng

Bắt đầu bằng một hình dung

Cuối năm học, thư viện trường nhận về hai thùng sách quyên góp. Cô thủ thư nhờ hai bạn trong đội cộng tác viên giúp một tay, mỗi bạn một thùng.

Bạn thứ nhất nhận thùng có kèm một tờ danh mục ghi rõ từng cuốn: cuốn này xếp vào giá Văn học, cuốn kia vào giá Khoa học, cuốn nọ vào giá Truyện tranh. Vừa xếp, bạn ấy vừa để ý: sách bìa mềm, khổ nhỏ, nhiều tranh vẽ thì thường là truyện tranh; sách dày, bìa cứng, có nhiều bảng biểu thì thường là sách khoa học. Xếp xong thùng đó, cô thủ thư đưa thêm mười cuốn không hề có trong danh mục, vậy mà bạn ấy vẫn đoán được nên đặt mỗi cuốn vào giá nào.

Bạn thứ hai kém may hơn: thùng của bạn ấy chẳng kèm tờ giấy nào cả. Không ai nói cuốn nào thuộc loại gì, thậm chí cũng chẳng ai cho biết trong thùng có mấy loại sách. Bạn ấy đành làm theo cách của mình: lật từng cuốn, thấy cuốn nào giống nhau về độ dày, khổ giấy, cách trình bày thì để chung một chồng. Đến cuối buổi, trên bàn hiện ra bốn chồng sách khá rõ rệt. Lúc đó bạn ấy mới ngồi nhìn lại từng chồng và tự nghĩ ra tên gọi cho chúng.

Hai bạn cùng làm một việc là sắp xếp sách, nhưng xuất phát điểm hoàn toàn khác nhau: một bên có sẵn đáp án để học theo, một bên phải tự mò ra trật tự từ một đống lộn xộn. Máy tính cũng học theo đúng hai kiểu như vậy.

Nội dung bài học

  1. 1) Dữ liệu có nhãn và dữ liệu không nhãn
  2. 2) Ba nhóm phương pháp học máy, chia theo dữ liệu đầu vào
  3. 3) Phân cụm: máy tự gom những đối tượng giống nhau
  4. 4) Phân cụm và phân loại - đừng nhầm hai bài toán này

Tóm tắt lý thuyết cần nhớ

  • Dữ liệu có nhãn là dữ liệu mà mỗi mẫu đã kèm sẵn đáp án đúng do con người gán; dữ liệu không nhãn thì không có đáp án đi kèm. Đây chính là căn cứ để chia học máy thành các nhóm phương pháp khác nhau.
  • Học có giám sát học từ dữ liệu đã có nhãn để dự đoán nhãn cho dữ liệu mới; học không giám sát làm việc với dữ liệu không nhãn và tự tìm ra cấu trúc ẩn nằm sẵn trong dữ liệu.
  • Phân cụm (clustering) là bài toán tiêu biểu của học không giám sát: máy dựa trên độ tương tự để gom các đối tượng giống nhau vào cùng một cụm, dù không hề biết trước có bao nhiêu nhóm hay tên gọi của chúng.
  • Phân loại có sẵn danh sách nhãn do con người định nghĩa trước, còn với phân cụm thì con người phải tự đặt tên và giải thích ý nghĩa cho các cụm máy tách ra; ngoài hai nhóm này còn có học tăng cường - máy học qua thử - sai cùng cơ chế thưởng/phạt.

Thuật ngữ tiếng Anh trong bài

Tiếng AnhĐọc làNghĩa
supervised learningsu-pơ-vai-zơ lơ-ninhhọc có giám sát
Là kiểu dạy máy mà mỗi ví dụ đều dán sẵn đáp án đúng.
unsupervised learningăn-su-pơ-vai-zơ lơ-ninhhọc không giám sát
Là kiểu máy tự học mà không ai nói đáp án.
labelLÂY-bồnhãn (đáp án đúng của một mẫu)
Là đáp án đúng do con người gán sẵn cho một mẫu dữ liệu, ví dụ ảnh này là "mèo".
clusteringCLÁT-tơ-ringphân cụm
Bài toán tiêu biểu của học không giám sát: máy tự gom các đối tượng giống nhau vào cùng một cụm mà không có nhãn cho trước.
reinforcement learningri-in-PHO-sờ-mần LƠ-ninghọc tăng cường
Nhóm phương pháp thứ ba: máy học bằng cách thử hành động rồi nhận thưởng hoặc phạt, dần chọn cách làm cho điểm cao nhất.
similaritysi-mi-LA-ri-tiđộ tương tự
Thước đo cho biết hai đối tượng giống nhau đến mức nào, tính từ các đặc điểm của chúng.

Câu hỏi trắc nghiệm có đáp án

Mấy câu mẫu để bạn tự kiểm tra ngay. Trong ứng dụng, bài này có đủ 20 câu, chấm điểm tự động và giải thích từng câu sai.

Câu 1 · Nhận biết
Dữ liệu có nhãn (labeled data) là loại dữ liệu như thế nào?
  1. Dữ liệu đã được sắp xếp theo thứ tự tăng dần trước khi đưa vào máy
  2. Dữ liệu chỉ gồm các con số, không chứa chữ hay hình ảnh
  3. Dữ liệu mà mỗi mẫu đã kèm sẵn đáp án đúng do con người gán từ trước
  4. Dữ liệu được lưu trong tệp có đặt tên rõ ràng, dễ tìm lại
Đáp án: C - Nhãn chính là đáp án đúng đi kèm mỗi mẫu dữ liệu, do con người xác định trước - ví dụ mỗi email kèm sẵn ghi chú “thư rác” hay “không phải thư rác”, nên phương án thứ ba đúng. Phương án đầu nhầm “nhãn” với việc sắp xếp dữ liệu, hai việc hoàn toàn khác nhau: dữ liệu sắp xếp gọn gàng vẫn có thể không có đáp án đi kèm. Phương án thứ hai nhầm sang kiểu dữ liệu (số hay chữ), trong khi ảnh, âm thanh, văn bản đều có thể có nhãn. Phương án cuối nhầm “nhãn của dữ liệu” với “tên tệp” - đặt tên tệp là chuyện lưu trữ, không phải đáp án của từng mẫu.
Câu 2 · Nhận biết
Bài toán phân cụm (clustering) là bài toán tiêu biểu của nhóm phương pháp nào?
  1. Học không giám sát
  2. Học có giám sát
  3. Học tăng cường
  4. Lập trình truyền thống, không thuộc học máy
Đáp án: A - Phân cụm làm việc với dữ liệu KHÔNG có nhãn và tự tìm ra cấu trúc ẩn - đúng bản chất của học không giám sát, nên phương án đầu đúng. Học có giám sát bắt buộc phải có dữ liệu đã gắn nhãn để đối chiếu, điều mà bài toán phân cụm không hề có. Học tăng cường là học qua thử - sai với thưởng và phạt, không phải gom nhóm một tập dữ liệu cho sẵn. Phương án cuối sai vì phân cụm là một bài toán học máy thực thụ: máy tự rút ra cách chia nhóm từ dữ liệu chứ không chạy theo luật do người viết sẵn.
Câu 3 · Thông hiểu
Một hiệu sách trực tuyến có dữ liệu về lượt xem và lượt mua của 50 000 khách hàng, nhưng không có bất kì thông tin nào cho biết mỗi khách thuộc nhóm nào. Hiệu sách muốn máy tự tách khách thành vài nhóm có thói quen giống nhau. Đây là bài toán gì?
  1. Phân loại, vì kết quả cuối cùng là xếp khách vào các nhóm
  2. Dự đoán số, vì phải tính ra doanh thu của từng khách hàng
  3. Học tăng cường, vì máy phải thử nhiều cách rồi nhận thưởng hoặc phạt
  4. Phân cụm, một bài toán thuộc học không giám sát
Đáp án: D - Dữ liệu không có nhãn và số nhóm cũng chưa được định trước, máy phải tự tách nhóm dựa trên độ tương tự - đó chính là phân cụm, thuộc học không giám sát, nên phương án cuối đúng. Phương án đầu là bẫy phổ biến nhất: kết quả tuy cũng là “các nhóm” nhưng phân loại đòi hỏi danh sách nhãn có sẵn do con người định nghĩa cùng dữ liệu huấn luyện đã gắn nhãn, ở đây hoàn toàn không có. Phương án thứ hai sai vì đề không yêu cầu ước lượng một con số nào cả. Phương án thứ ba sai vì không hề có cơ chế hành động - thưởng - phạt, mà chỉ có một bảng dữ liệu tĩnh cho sẵn.
Câu Đúng/Sai (Phần II) · Thông hiểu
Cho biết mỗi phát biểu sau đúng hay sai:
  • a)Học có giám sát cần dữ liệu huấn luyện đã được gắn nhãn sẵn để máy đối chiếu trong quá trình học.Đúng
  • b)Trong bài toán phân cụm, con người phải cho máy biết trước tên gọi và ý nghĩa của từng cụm.Sai
  • c)Học không giám sát làm việc với dữ liệu không nhãn và tự tìm ra cấu trúc ẩn nằm sẵn trong dữ liệu.Đúng
  • d)Học tăng cường là cách máy học bằng việc được cung cấp sẵn nhãn đúng cho từng mẫu dữ liệu.Sai
Vì sao:
  • (a) Đúng - bản chất của “giám sát” là luôn có đáp án đúng do con người gán sẵn để máy so kết quả dự đoán và tự điều chỉnh.
  • (b) Sai - ngược lại mới đúng: máy tự tách các cụm dựa trên độ tương tự mà không biết gì về tên gọi, con người chỉ đặt tên và giải thích ý nghĩa SAU khi máy đã chia xong.
  • (c) Đúng - đây chính là định nghĩa của học không giám sát: không có nhãn để đối chiếu nên nhiệm vụ là phát hiện trật tự ẩn trong dữ liệu, mà phân cụm là ví dụ tiêu biểu.
  • (d) Sai - học từ nhãn có sẵn là học có giám sát; học tăng cường là học qua thử - sai, hành động tốt được thưởng, hành động dở bị phạt, thường gặp trong trò chơi và điều khiển rô-bốt.

Thử ngay: minh hoạ từng bước

Bấm từng bước để tự xem cơ chế hoạt động, hoặc bấm “Tự chạy” cho nó tiến mỗi giây một lần. Đổi được dữ liệu đầu vào - không cần đăng nhập.

Học trọn bài này trong ứng dụng

Bài giảng đầy đủ, 20 câu luyện tập chấm tự động, thi thử đúng cấu trúc đề tốt nghiệp (24 trắc nghiệm + 4 Đúng/Sai), bài thực hành máy tự chấm và gia sư AI giải thích chỗ sai.

Mở bài 23 trong ứng dụng

Phần học miễn phí, không cần tạo tài khoản.