Đề thi, bài tập trắc nghiệm online Dữ liệu lớn (BigData) – Đề 4

Đề 4 - Bài tập, đề thi trắc nghiệm online Dữ liệu lớn (BigData)

1. Trong ngữ cảnh Dữ liệu lớn, 'Data Silos' (Ống khói dữ liệu) gây ra vấn đề gì?
2. Công cụ nào sau đây thường được sử dụng để truy vấn và phân tích dữ liệu trong Hadoop Data Lake sử dụng ngôn ngữ SQL-like?
3. Khía cạnh 'Value' (Giá trị) trong '5Vs' của Dữ liệu lớn nhấn mạnh đến điều gì?
4. Trong bối cảnh Dữ liệu lớn, 'Data Lake' (Hồ dữ liệu) khác biệt chính so với 'Data Warehouse' (Kho dữ liệu) là gì?
5. Công cụ nào sau đây thường được sử dụng để thu thập dữ liệu log từ nhiều nguồn khác nhau trong hệ sinh thái Dữ liệu lớn?
6. Loại cơ sở dữ liệu nào thường được sử dụng để xử lý dữ liệu phi cấu trúc và bán cấu trúc trong môi trường Dữ liệu lớn?
7. Trong Dữ liệu lớn, 'Cardinality' (Tính bản số) đề cập đến điều gì?
8. Công nghệ nào sau đây KHÔNG phải là một nền tảng điện toán đám mây phổ biến được sử dụng cho các giải pháp Dữ liệu lớn?
9. Trong ngữ cảnh Dữ liệu lớn, thuật ngữ 'Schema on Read' (Lược đồ khi đọc) đề cập đến điều gì?
10. Loại phân tích dữ liệu nào tập trung vào việc tìm hiểu điều gì đã xảy ra trong quá khứ dựa trên dữ liệu lịch sử?
11. Trong kiến trúc Dữ liệu lớn, tầng nào chịu trách nhiệm lưu trữ và quản lý dữ liệu thô, chưa qua xử lý?
12. Mô hình lập trình 'MapReduce' hoạt động dựa trên nguyên tắc chính nào?
13. Đặc điểm nào sau đây KHÔNG phải là một trong '5Vs' thường được dùng để mô tả Dữ liệu lớn?
14. Quy trình ETL (Extract, Transform, Load) đóng vai trò gì trong Dữ liệu lớn?
15. Thách thức chính nào mà Dữ liệu lớn đặt ra đối với vấn đề bảo mật và quyền riêng tư?
16. Thách thức chính nào liên quan đến 'Variety' (Đa dạng) trong '5Vs' của Dữ liệu lớn?
17. Ứng dụng nào sau đây KHÔNG phải là một ví dụ điển hình của việc sử dụng Dữ liệu lớn?
18. Ưu điểm chính của việc sử dụng 'In-Memory Computing' (Điện toán trong bộ nhớ) trong Dữ liệu lớn là gì?
19. Trong quá trình chuẩn bị dữ liệu cho Dữ liệu lớn, 'Data Wrangling' (Vật lộn với dữ liệu) đề cập đến hoạt động nào?
20. Phương pháp phân tích dữ liệu nào tập trung vào việc khám phá các mẫu ẩn, mối quan hệ và xu hướng trong các tập dữ liệu lớn để đưa ra quyết định hoặc dự đoán?
21. Thuật ngữ 'Data Governance' (Quản trị dữ liệu) trong Dữ liệu lớn liên quan đến điều gì?
22. Thử thách nào sau đây KHÔNG phải là một trong những thách thức phổ biến khi triển khai các dự án Dữ liệu lớn?
23. Trong Dữ liệu lớn, 'Lambda Architecture' (Kiến trúc Lambda) kết hợp hai lớp xử lý dữ liệu nào?
24. Trong mô hình tham chiếu Dữ liệu lớn, tầng 'Processing' (Xử lý) thường bao gồm các hoạt động nào?
25. Loại tấn công bảo mật nào đặc biệt nguy hiểm trong môi trường Dữ liệu lớn do lượng dữ liệu nhạy cảm lớn được lưu trữ?
26. Phương pháp trực quan hóa dữ liệu nào phù hợp nhất để hiển thị sự phân bố của một biến số liên tục duy nhất?
27. Thuật ngữ 'Hadoop' liên quan chặt chẽ nhất đến thành phần nào của hệ sinh thái Dữ liệu lớn?
28. Ưu điểm chính của việc sử dụng xử lý song song và phân tán trong Dữ liệu lớn là gì?
29. Phương pháp nào sau đây thường được sử dụng để giảm chiều dữ liệu (dimensionality reduction) trong Dữ liệu lớn, giúp đơn giản hóa mô hình và giảm nhiễu?
30. Công nghệ nào sau đây thường được sử dụng để xử lý dữ liệu dòng (streaming data) trong thời gian thực trong các ứng dụng Dữ liệu lớn?