Tin Học KHMT
Ôn tập Tin học THPT › Tin học 12 - Khoa học máy tính › Bài 24
Tin học 12 - Khoa học máy tính

Bài 24. Khoa học dữ liệu là gì?

Mỗi ngày, thế giới tạo ra một lượng dữ liệu khổng lồ - từ hoá đơn bán hàng đến kết quả xét nghiệm y tế. Bài học này giúp bạn hiểu khoa học dữ liệu là gì: quá trình biến những con số rời rạc thành hiểu biết giúp con người ra quyết định tốt hơn.

Chủ đề G · Trí tuệ nhân tạo & Học máy - đọc khoảng 10 phút · 21 câu luyện tập trong ứng dụng

Tương ứng sách giáo khoa
  • Cánh DiềuTin học 12 (Khoa học máy tính) - Chủ đề F(CS) · Bài 2. Giới thiệu về khoa học dữ liệutr. 133
  • Chân trời sáng tạoTin học 12 (Khoa học máy tính) - Bài F15. Khoa học dữ liệutr. 148
  • Kết nối tri thứcTin học 12 (Khoa học máy tính) - Bài 26. Làm quen với Khoa học dữ liệutr. 140–144
Xem bảng đối chiếu cả bộ →

Bắt đầu bằng một hình dung

Hãy tưởng tượng một cửa hàng quần áo nhỏ đã bán hàng được ba năm. Suốt thời gian đó, mỗi lần bán được món gì, người bán chỉ ghi vội vài dòng lên hoá đơn giấy rồi cất đi một chỗ. Ba năm sau, chồng hoá đơn ấy đã cao gần nửa mét, chữ viết tay lộn xộn, có tờ ghi thiếu ngày, có tờ trùng lặp vì đánh số hai lần, có tờ lại ghi nhầm giá.

Nhìn đống giấy đó, chủ cửa hàng không thấy được điều gì cả - chỉ là một mớ hỗn độn khó đọc. Nhưng khi nhờ một người biết cách xử lý dữ liệu giúp sắp xếp lại: gõ toàn bộ vào bảng tính, loại bỏ những tờ trùng, bổ sung ngày tháng còn thiếu, sửa các chỗ ghi nhầm, rồi thử vẽ vài biểu đồ theo từng tháng - bức tranh bỗng hiện ra rõ ràng: áo khoác bán chạy vào tháng 11 và 12, áo thun bán chạy nhất vào tháng 5 và 6, còn quần dài thì bán đều quanh năm.

Cùng một đống dữ liệu, lúc đầu chỉ là ‘rác’ không ai đọc nổi, nhưng sau khi qua một quy trình xử lý, nó trở thành hiểu biết có thể dùng để quyết định: nên nhập thêm áo khoác vào cuối năm, chuẩn bị áo thun từ đầu hè. Biến đống giấy lộn xộn ấy thành hiểu biết hữu ích - đó chính là công việc của khoa học dữ liệu.

Nội dung bài học

  1. Khoa học dữ liệu là gì?
  2. Quy trình năm bước xử lý dữ liệu

Tóm tắt lý thuyết cần nhớ

  • Khoa học dữ liệu là quá trình biến dữ liệu thô thành hiểu biết có ích để ra quyết định.
  • Quy trình gồm năm bước: thu thậplàm sạchphân tíchtrực quan hoárút kết luận.
  • Làm sạch dữ liệu là bước quan trọng bậc nhất - dữ liệu đầu vào lỗi thì kết quả phân tích cũng sai theo nguyên tắc ‘rác vào thì rác ra’.
  • Khoa học dữ liệu có mặt trong kinh doanh, y tế, thể thao, giáo dục... và là nền tảng chuẩn bị dữ liệu để huấn luyện học máy.

Thuật ngữ tiếng Anh trong bài

Tiếng AnhĐọc làNghĩa
data scienceđây-tơ sai-ơnskhoa học dữ liệu
Là môn tìm hiểu thật nhiều số liệu để rút ra điều hay.
big databích đây-tơdữ liệu lớn
Là lượng thông tin khổng lồ, nhiều đến mức đếm bằng tay không xuể.
Volumevô-liumkhối lượng dữ liệu
Nói về việc dữ liệu nhiều hay ít.
Velocityvơ-lô-si-titốc độ dữ liệu
Nói về việc dữ liệu chạy tới nhanh cỡ nào.
Varietyvơ-rai-ơ-tisự đa dạng dữ liệu
Nói về việc dữ liệu có nhiều kiểu khác nhau.
Veracityvơ-ra-si-tiđộ tin cậy dữ liệu
Nói về việc dữ liệu có đúng và đáng tin hay không.
AIây-aitrí tuệ nhân tạo
Máy tính được 'dạy' để học hỏi và tự đưa ra quyết định giống con người, ví dụ nhận diện khuôn mặt, trả lời câu hỏi.

Câu hỏi trắc nghiệm có đáp án

Mấy câu mẫu để bạn tự kiểm tra ngay. Trong ứng dụng, bài này có đủ 21 câu, chấm điểm tự động và giải thích từng câu sai.

Câu 1 · Nhận biết
Khoa học dữ liệu là quá trình biến điều gì thành hiểu biết có ích để ra quyết định?
  1. Dữ liệu thô
  2. Chương trình máy tính
  3. Mạng máy tính
  4. Hệ điều hành
Đáp án: A - Khoa học dữ liệu tập trung thu thập và xử lý dữ liệu thô - những con số, chữ viết chưa qua xử lý - để tìm ra hiểu biết có thể dùng cho việc ra quyết định.
Câu 2 · Nhận biết
Trong quy trình khoa học dữ liệu, bước nào thường diễn ra ngay sau khi thu thập dữ liệu?
  1. Trực quan hoá
  2. Làm sạch dữ liệu
  3. Rút kết luận
  4. Huấn luyện mô hình học máy
Đáp án: B - Sau khi thu thập, dữ liệu thường còn lỗi, thiếu hoặc trùng lặp nên bước tiếp theo là làm sạch, trước khi đem đi phân tích.
Câu 3 · Thông hiểu
Việc loại bỏ các hoá đơn ghi trùng và bổ sung ngày tháng còn thiếu trong dữ liệu bán hàng thuộc bước nào của quy trình khoa học dữ liệu?
  1. Thu thập dữ liệu
  2. Làm sạch dữ liệu
  3. Trực quan hoá
  4. Rút kết luận
Đáp án: B - Loại bỏ bản ghi trùng và bổ sung dữ liệu thiếu chính là công việc của bước làm sạch dữ liệu - chuẩn bị dữ liệu đáng tin cậy trước khi phân tích.
Câu Đúng/Sai (Phần II) · Thông hiểu
Xét các phát biểu về bước trực quan hoá trong quy trình khoa học dữ liệu:
  • a)Trực quan hoá là việc thể hiện dữ liệu dưới dạng biểu đồ, bảng biểu để con người dễ nhận ra quy luật hơn so với đọc hàng nghìn con số rời rạc.Đúng
  • b)Trong năm bước xử lý dữ liệu, trực quan hoá thường được thực hiện sau khi đã phân tích và trước khi rút ra kết luận, khuyến nghị.Đúng
  • c)Bước rút kết luận và khuyến nghị là bước đầu tiên, được làm ngay khi vừa thu thập được dữ liệu thô.Sai
  • d)Khi đã tính ra được các con số thống kê thì bước trực quan hoá là thừa và có thể bỏ qua hoàn toàn mà không ảnh hưởng gì.Sai
Vì sao:
  • (a) Đúng - trực quan hoá biến dữ liệu thành hình ảnh như biểu đồ cột, đường... giúp mắt người nắm bắt quy luật nhanh hơn nhiều so với dò từng dòng số.
  • (b) Đúng - thứ tự quen thuộc là thu thập, làm sạch, phân tích, trực quan hoá rồi mới rút kết luận; trực quan hoá đứng sau phân tích và trước bước kết luận.
  • (c) Sai - rút kết luận và khuyến nghị là bước cuối cùng, dựa trên kết quả đã phân tích, không thể làm ngay khi mới có dữ liệu thô.
  • (d) Sai - dù đã có con số thống kê, trực quan hoá vẫn giúp nhìn ra xu hướng, điểm bất thường dễ dàng hơn, nên là bước có giá trị chứ không thừa.

Học trọn bài này trong ứng dụng

Bài giảng đầy đủ, 21 câu luyện tập chấm tự động, thi thử đúng cấu trúc đề tốt nghiệp (24 trắc nghiệm + 4 Đúng/Sai), bài thực hành máy tự chấm và gia sư AI giải thích chỗ sai.

Mở bài 24 trong ứng dụng

Phần học miễn phí, không cần tạo tài khoản.