Ngân hàng đề — Microsoft Azure Data Fundamentals
Tìm thấy 328 câu.
- A Azure Blob storage stores data in a flat hierarchy of containers and blobs.
- B Azure Blob storage stores data in a hierarchical structure of databases and tables.
- C Azure Blob storage stores data in a key-value store, where each blob is identified by a unique key.
- D Azure Blob storage stores data in a relational database with rows and columns.
Xem giải thích
Đáp án
A — Lưu dữ liệu theo cấu trúc phẳng gồm container và blob
Vì sao đúng
Blob Storage có hai tầng và chỉ hai tầng: tài khoản lưu trữ chứa container, container chứa blob. Không có thư mục lồng nhau thật sự.
Điều này quan trọng vì cái ta hay thấy như thư mục — anh/2024/thang1/hinh.jpg — thực ra chỉ là tên của blob có chứa dấu gạch chéo. Giao diện hiển thị nó thành cây cho dễ nhìn, nhưng bên dưới vẫn là một danh sách phẳng. Hệ quả thực tế: đổi tên hay xoá cả "thư mục" không phải thao tác nguyên tử — hệ thống phải duyệt và xử lý từng blob một.
Muốn có thư mục thật thì phải bật hierarchical namespace (Data Lake Gen2).
Vì sao các phương án khác sai
- B. Cấu trúc phân cấp gồm cơ sở dữ liệu và bảng — mô tả cơ sở dữ liệu, không phải kho đối tượng.
- C. Kho khoá–giá trị — gần đúng về tinh thần nhưng bỏ mất khái niệm container.
- D. Cơ sở dữ liệu quan hệ với hàng và cột — sai hẳn mô hình.
- A Perform advanced statistical analyses and predictive modeling
- B Create interactive data visualizations from various data sources
- C Share dashboards and reports with others in a secured and centralized way
- D Automatically generate insights and recommendations based on machine learning algorithms
Xem giải thích
Đáp án
A — Thực hiện phân tích thống kê nâng cao và mô hình hoá dự báo
Vì sao đúng
Câu này tìm thứ không phải năng lực của Power BI. Power BI là công cụ trực quan hoá và báo cáo: nó rất mạnh ở việc biến dữ liệu thành biểu đồ và bảng điều khiển tương tác, nhưng phần thống kê nâng cao và dự báo là lĩnh vực của các công cụ khác — Azure Machine Learning, R, Python.
Ranh giới không tuyệt đối: Power BI có vài tính năng dự báo cơ bản và nhúng được script R hay Python. Nhưng mô hình hoá dự báo không phải mục đích chính của nó, và đó là điều câu hỏi muốn kiểm tra.
Vì sao các phương án khác sai (chúng là năng lực của Power BI)
- B. Tạo trực quan hoá tương tác từ nhiều nguồn dữ liệu — chức năng cốt lõi.
- C. Chia sẻ bảng điều khiển có kiểm soát — qua workspace và app.
- D. Tự sinh insight và gợi ý — tính năng Quick Insights.
- A Normalization improves query performance by denormalizing data into a single table.
- B Normalization is the process of removing all null values from a database.
- C Normalization helps eliminate redundant data by organizing fields and tables.
- D Normalization is used to ensure referential integrity between tables.
Xem giải thích
Đáp án
C — Chuẩn hoá giúp loại bỏ dữ liệu trùng lặp bằng cách tổ chức lại trường và bảng
Vì sao đúng
Chuẩn hoá là quá trình tách dữ liệu thành nhiều bảng liên kết nhau sao cho mỗi sự thật chỉ được lưu ở một chỗ. Nếu địa chỉ khách hàng nằm trong mọi dòng đơn hàng, thì đổi địa chỉ nghĩa là sửa hàng nghìn dòng — và sót một dòng là dữ liệu mâu thuẫn. Tách khách hàng ra bảng riêng thì chỉ sửa một chỗ.
Vì sao các phương án khác sai
- A. Chuẩn hoá cải thiện hiệu năng bằng cách gộp dữ liệu vào một bảng — mô tả phi chuẩn hoá (denormalization), tức là điều ngược lại. Đây là bẫy chính, và nó phản ánh một đánh đổi thật: chuẩn hoá tốt cho tính nhất quán nhưng đòi nhiều phép nối, nên kho dữ liệu phân tích thường cố ý phi chuẩn hoá.
- B. Loại bỏ mọi giá trị null — không liên quan tới chuẩn hoá.
- D. Đảm bảo toàn vẹn tham chiếu — đó là việc của khoá ngoại; chuẩn hoá tạo ra bối cảnh cần tới khoá ngoại, nhưng bản thân nó không phải cơ chế đó.
- A Implementing and managing data governance policies
- B Maintaining database backups and disaster recovery
- C Monitoring resource utilization and performance
- D Writing complex application code and logic
Xem giải thích
Đáp án
D — Viết mã và logic ứng dụng phức tạp
Vì sao đúng
Câu này tìm thứ không thuộc trách nhiệm của quản trị viên cơ sở dữ liệu. Viết logic ứng dụng là việc của lập trình viên. Quản trị viên cơ sở dữ liệu lo tầng dữ liệu: nó có sẵn sàng không, có nhanh không, có an toàn không, và có khôi phục được không.
Vì sao các phương án khác sai (chúng là trách nhiệm của DBA)
- B. Duy trì sao lưu và khôi phục thảm hoạ — trách nhiệm cốt lõi nhất.
- C. Theo dõi mức dùng tài nguyên và hiệu năng — bao gồm cả việc tối ưu truy vấn và chỉ mục.
- A. Triển khai và quản lý chính sách quản trị dữ liệu — phân loại dữ liệu, phân quyền, tuân thủ.
Ranh giới có chỗ mờ: DBA vẫn viết SQL, thủ tục lưu trữ và script bảo trì. Nhưng đó là mã của tầng dữ liệu, khác với logic nghiệp vụ của ứng dụng.
- A Unstructured data is typically small in size, making it difficult to extract meaningful insights.
- B Unstructured data is always in a structured format, such as CSV or JSON files.
- C Unstructured data is easily searchable using SQL queries, just like structured data.
- D Unstructured data lacks a predefined schema, making it challenging to store and query in traditional databases.
Xem giải thích
Đáp án
D — Dữ liệu phi cấu trúc không có lược đồ định sẵn, nên khó lưu trữ và xử lý hơn
Vì sao đúng
Đây là định nghĩa của dữ liệu phi cấu trúc: không có lược đồ cố định. Bài đăng mạng xã hội, đánh giá của khách, mô tả sản phẩm — mỗi mẩu có độ dài, định dạng và nội dung khác nhau, không xếp gọn vào hàng và cột được.
Hệ quả là phải dùng cách tiếp cận khác: lưu trong kho đối tượng hoặc cơ sở dữ liệu tài liệu thay vì bảng quan hệ, và dùng công cụ xử lý ngôn ngữ tự nhiên hay tìm kiếm toàn văn thay vì SQL.
Vì sao các phương án khác sai
- B. Luôn ở định dạng có cấu trúc như CSV hoặc JSON — tự mâu thuẫn: nếu có cấu trúc thì đâu còn là phi cấu trúc. Riêng JSON thường được xếp vào nhóm bán cấu trúc.
- C. Tìm kiếm dễ bằng SQL như dữ liệu có cấu trúc — sai; đó chính là điều khó nhất.
- A. Thường có kích thước nhỏ — sai ngược: dữ liệu phi cấu trúc (video, ảnh, log) thường chiếm phần lớn khối lượng dữ liệu của một tổ chức.
- A Optimized for machine learning and artificial intelligence workloads
- B Ensures data integrity and consistency through the use of transactions
- C Supports large-scale analytics and data warehousing
- D Designed for high-volume ingestion and streaming of data
Xem giải thích
Đáp án
B — Đảm bảo tính toàn vẹn và nhất quán của dữ liệu thông qua giao dịch
Vì sao đúng
Khối lượng công việc giao dịch (OLTP) có đặc trưng là nhiều thao tác đọc ghi nhỏ, xảy ra liên tục, và điều quan trọng nhất là mỗi thao tác phải đúng tuyệt đối. Giao dịch với các tính chất ACID bảo đảm điều đó: một chuỗi thao tác hoặc thành công trọn vẹn hoặc không có gì xảy ra.
Ví dụ kinh điển là chuyển tiền: trừ tài khoản này và cộng tài khoản kia phải cùng thành công; hệ thống chết giữa chừng thì cả hai phải quay về trạng thái ban đầu.
Vì sao các phương án khác sai
Ba phương án còn lại đều mô tả khối lượng công việc phân tích (OLAP) hoặc chuyên biệt:
- C. Hỗ trợ phân tích quy mô lớn và kho dữ liệu — đây đúng là đặc điểm của OLAP, và là đối cực của OLTP.
- D. Nạp và truyền dữ liệu khối lượng lớn theo luồng — thuộc về hệ thống xử lý luồng.
- A. Tối ưu cho học máy và trí tuệ nhân tạo — lĩnh vực khác hẳn.
- A Defining measures and calculating columns
- B Creating relationships between tables
- C Enabling row-level security based on user roles
- D Enforcing data governance policies across the organization
Xem giải thích
Đáp án
D — Áp đặt chính sách quản trị dữ liệu trên toàn tổ chức
Vì sao đúng
Câu này tìm thứ không phải tính năng của mô hình dữ liệu trong Power BI. Mô hình dữ liệu là thứ nằm bên trong một tập dữ liệu: nó định nghĩa bảng, quan hệ, phép tính. Quản trị dữ liệu ở phạm vi toàn tổ chức — phân loại dữ liệu nhạy cảm, lập bản đồ dòng chảy dữ liệu, áp nhãn bảo vệ — là việc của Microsoft Purview, một sản phẩm khác.
Vì sao các phương án khác sai (chúng là tính năng của mô hình dữ liệu)
- B. Tạo quan hệ giữa các bảng — nền tảng của mô hình.
- A. Định nghĩa measure và cột tính toán — viết bằng DAX ngay trong mô hình.
- C. Bật bảo mật ở mức dòng theo vai người dùng — cấu hình trong mô hình để mỗi người chỉ thấy phần dữ liệu của mình.
- A Text file
- B Spreadsheet
- C Non-relational database
- D Relational database
Xem giải thích
Đáp án
D — Cơ sở dữ liệu quan hệ
Vì sao đúng
Đề hỏi loại dữ liệu có cấu trúc cho phép lưu trữ và truy xuất hiệu quả qua hàng và cột. Cơ sở dữ liệu quan hệ khớp đúng: lược đồ được định nghĩa trước, mỗi bảng có cột với kiểu dữ liệu xác định, và chỉ mục khiến việc truy xuất nhanh ngay cả trên khối dữ liệu lớn.
Vì sao các phương án khác sai
- B. Bảng tính — cũng có hàng và cột, và đây là phương án nhiễu gần nhất. Nhưng nó thiếu những thứ làm nên "lưu trữ và truy xuất hiệu quả": không có chỉ mục thật, không có ràng buộc kiểu dữ liệu bắt buộc, không xử lý được truy cập đồng thời của nhiều người.
- C. Cơ sở dữ liệu phi quan hệ — không dùng mô hình hàng và cột cố định.
- A. Tệp văn bản — không có cấu trúc nào cả.
- A Data is stored in a distributed, partitioned structure
- B Data is stored in tables with rows and columns
- C Data is stored in collections of key-value pairs
- D Data is stored in a hierarchical structure
Xem giải thích
Đáp án
B — Dữ liệu được lưu trong bảng gồm hàng và cột
Vì sao đúng
Đây là định nghĩa cốt lõi của mô hình quan hệ: dữ liệu tổ chức thành bảng (quan hệ), mỗi hàng là một bản ghi, mỗi cột là một thuộc tính có kiểu xác định. Từ nền tảng đó mới có được khoá chính, khoá ngoại, ràng buộc toàn vẹn và phép nối giữa các bảng.
Vì sao các phương án khác sai
Ba phương án còn lại đều mô tả các mô hình phi quan hệ:
- C. Tập hợp cặp khoá–giá trị — mô hình key-value như Azure Table hay Redis.
- D. Cấu trúc phân cấp — mô hình tài liệu hoặc XML.
- A. Cấu trúc phân tán, được phân mảnh — mô tả cách triển khai ở quy mô lớn, không phải mô hình dữ liệu; và cơ sở dữ liệu quan hệ cũng phân tán được.
- A Gauge chart
- B Pie chart
- C Stacked bar chart
- D Scatter plot
Xem giải thích
Đáp án
C — Biểu đồ cột chồng (stacked bar chart)
Vì sao đúng
Đề có hai chiều dữ liệu cần nhìn cùng lúc: nhóm nhân khẩu học và lịch sử mua hàng. Biểu đồ cột chồng làm đúng việc đó — mỗi cột là một nhóm, và các phần trong cột cho thấy thành phần bên trong. Nhờ vậy so sánh được cả tổng giữa các nhóm lẫn tỷ trọng bên trong từng nhóm.
Vì sao các phương án khác sai
- B. Biểu đồ tròn — chỉ biểu diễn thành phần của một tổng duy nhất, nên không so sánh được nhiều nhóm; và mắt người rất kém trong việc so sánh diện tích các lát.
- D. Biểu đồ phân tán — dùng để tìm tương quan giữa hai biến số liên tục, không hợp với dữ liệu phân nhóm.
- A. Biểu đồ đồng hồ — hiển thị một con số so với mục tiêu.