Đề thi, bài tập trắc nghiệm online Khai phá dữ liệu – Đề 3

Đề 3 - Bài tập, đề thi trắc nghiệm online Khai phá dữ liệu

1. Ma trận nhầm lẫn (confusion matrix) được sử dụng để đánh giá hiệu suất của mô hình nào?
2. Khi dữ liệu bị 'quá khớp' (overfitting) trong mô hình học máy, điều gì có khả năng xảy ra?
3. Kỹ thuật 'lựa chọn đặc trưng' (feature selection) nhằm mục đích:
4. Khi nào thì nên sử dụng phương pháp phân cụm phân cấp (hierarchical clustering) thay vì k-means?
5. Độ đo 'độ chính xác' (accuracy) trong phân lớp được tính bằng:
6. Khai phá dữ liệu (Data Mining) được định nghĩa chính xác nhất là:
7. Khi dữ liệu có thuộc tính 'mật độ thấp' (sparsity), điều này có nghĩa là:
8. Phương pháp 'cross-validation' (kiểm định chéo) được sử dụng để:
9. Ứng dụng nào sau đây KHÔNG phải là ứng dụng điển hình của khai phá dữ liệu?
10. Phương pháp nào sau đây giúp phát hiện các mặt hàng thường được mua cùng nhau trong siêu thị?
11. Khi đánh giá mô hình phân cụm, độ đo 'silhouette score' cao cho thấy:
12. Mục tiêu chính của việc tiền xử lý dữ liệu trong khai phá dữ liệu là:
13. Trong khai phá dữ liệu chuỗi thời gian (time series data mining), mục tiêu có thể là:
14. Trong khai phá dữ liệu, 'dữ liệu nhiễu' (noisy data) đề cập đến:
15. Mô hình Naive Bayes dựa trên giả định nào?
16. Kỹ thuật nào sau đây thường được sử dụng để dự đoán giá nhà dựa trên các đặc điểm như diện tích, vị trí và số phòng ngủ?
17. Phương pháp nào sau đây có thể giúp xử lý dữ liệu bị thiếu giá trị (missing values)?
18. Trong khai phá dữ liệu không gian (spatial data mining), loại dữ liệu đặc biệt cần xử lý là:
19. Trong thuật toán k-means, 'k' đại diện cho:
20. Phương pháp giảm chiều dữ liệu (dimensionality reduction) KHÔNG bao gồm:
21. Trong ngữ cảnh khai phá dữ liệu lớn (big data), thách thức chính KHÔNG bao gồm:
22. Kỹ thuật 'chuẩn hóa dữ liệu' (data normalization) thường được áp dụng trước khi sử dụng thuật toán nào?
23. Trong khai phá dữ liệu văn bản (text mining), kỹ thuật 'TF-IDF' được sử dụng để:
24. Bước nào sau đây KHÔNG thuộc quy trình Khám phá tri thức từ dữ liệu (KDD)?
25. Kỹ thuật 'bootstrap aggregating' (bagging) trong học máy nhằm mục đích:
26. Trong khai phá dữ liệu, kỹ thuật phân cụm (clustering) được sử dụng để:
27. Thuật toán Apriori được sử dụng chủ yếu trong kỹ thuật khai phá dữ liệu nào?
28. Ưu điểm chính của cây quyết định (decision tree) so với các mô hình phân lớp khác là:
29. Mục đích của việc chia dữ liệu thành tập huấn luyện, tập kiểm tra và tập xác thực (validation set) là gì?
30. Độ đo 'độ thu hồi' (recall) trong phân lớp được định nghĩa là: