Ngân hàng đề — Microsoft Azure Data Fundamentals
Tìm thấy 328 câu.
- A UPDATE
- B SELECT
- C INSERT
- D CREATE
Xem giải thích
Đáp án
C — INSERT
Vì sao đúng
Bốn lệnh trong danh sách thuộc hai nhóm khác nhau, và biết ranh giới đó giúp trả lời nhanh:
| Nhóm | Lệnh | Tác động lên |
|---|---|---|
| DML — thao tác dữ liệu | INSERT, UPDATE, DELETE, SELECT |
Dữ liệu bên trong bảng |
| DDL — định nghĩa cấu trúc | CREATE, ALTER, DROP |
Cấu trúc của bảng |
Thêm một dòng mới là thao tác trên dữ liệu, nên đó là INSERT.
Vì sao các phương án khác sai
- A.
UPDATE— sửa dòng đã có, không tạo dòng mới. - B.
SELECT— chỉ đọc. - D.
CREATE— tạo bảng hoặc đối tượng khác, không tạo dòng. Đây là chỗ dễ nhầm nhất vì từ "create" nghe như "tạo mới".
- A Azure Cosmos DB
- B Azure SQL Database
- C Azure Blob Storage
- D Azure Data Lake Storage Gen2
Xem giải thích
Đáp án
A — Azure Cosmos DB
Vì sao đúng
Ba yêu cầu trong đề đều là đặc điểm định danh của Cosmos DB: lưu và truy vấn JSON, thông lượng cao với độ trễ thấp, và phân tán toàn cầu. Nó lưu JSON nguyên bản và đánh chỉ mục tự động mọi trường, nên truy vấn sâu vào cấu trúc lồng nhau mà không phải khai chỉ mục trước.
Vì sao các phương án khác sai
- C. Blob Storage — chứa được tệp JSON nhưng không truy vấn được nội dung bên trong; với nó thì JSON chỉ là một khối byte.
- D. Data Lake Gen2 — kho cho phân tích quy mô lớn, độ trễ không hợp đường phục vụ ứng dụng.
- B. Azure SQL Database — quan hệ; lưu được JSON trong cột nhưng đó không phải mô hình dữ liệu tự nhiên của nó, và mở rộng ngang kém hơn.
- A Microsoft Purview
- B Azure Synapse Analytics
- C Azure AI Services
- D Azure Databricks
Xem giải thích
Đáp án
D — Azure Databricks
Vì sao đúng
Từ khoá quyết định trong đề là Apache Spark. Databricks là nền tảng Spark được quản lý, do chính những người tạo ra Spark xây dựng, và bản Azure tích hợp sẵn với Entra ID, mạng ảo và các công cụ tuân thủ của Microsoft — đúng phần "bảo mật và tuân thủ mức doanh nghiệp" mà đề nhắc tới.
Vì sao các phương án khác sai
- B. Azure Synapse Analytics — đây là phương án nhiễu gần nhất vì Synapse cũng có Spark pool. Nhưng Synapse là nền tảng phân tích gộp nhiều thứ (kho dữ liệu SQL, pipeline, Spark), còn câu hỏi mô tả một dịch vụ lấy Spark làm trung tâm — đó là Databricks.
- A. Microsoft Purview — quản trị dữ liệu.
- C. Azure AI Services — mô hình AI dựng sẵn qua API.
- A Azure SQL Database
- B Azure Cosmos DB
- C Azure Synapse Analytics
- D Azure Data Lake Storage Gen2
Xem giải thích
Đáp án
C — Azure Synapse Analytics
Vì sao đúng
Ba yếu tố trong đề — dữ liệu có cấu trúc và bán cấu trúc, khối lượng lớn, khối lượng công việc phân tích — đều chỉ về kho dữ liệu phân tích. Synapse cho cả hai cách truy vấn: SQL pool chuyên dụng cho dữ liệu đã mô hình hoá, và serverless SQL để truy vấn thẳng tệp Parquet hay JSON nằm trong data lake mà không cần nạp trước.
Vì sao các phương án khác sai
- A. Azure SQL Database — cơ sở dữ liệu giao dịch; tối ưu cho nhiều thao tác nhỏ, không cho truy vấn quét khối lượng lớn.
- B. Cosmos DB — cũng là cơ sở dữ liệu giao dịch, đắt cho mục đích phân tích.
- D. Data Lake Gen2 — là nơi lưu trữ; tự nó không truy vấn được, thường đóng vai kho nguồn bên cạnh Synapse.
- A Azure Blob storage is recommended for storing unstructured data, such as files, images, and videos, and can handle data of any size.
- B Azure Blob storage is a cloud-based file sharing service that allows users to securely share and collaborate on files from anywhere.
- C Azure Blob storage provides durable and highly available object storage service designed for storing structured data in tables.
- D Azure Blob storage is a fully-managed, serverless compute service that automatically scales CPUs and memory based on usage.
Xem giải thích
Đáp án
A — Blob Storage được khuyến nghị cho dữ liệu phi cấu trúc như tệp, ảnh, video, và xử lý được dữ liệu ở mọi kích cỡ
Vì sao đúng
Đây là mô tả chính xác nhất: Blob Storage là kho đối tượng dựng cho dữ liệu phi cấu trúc, không có trần dung lượng thực tế, và có nhiều tầng truy cập để tối ưu chi phí theo tần suất đọc.
Vì sao các phương án khác sai
- **C. Kho đối tượng bền và sẵn sàng cao dùng để lưu dữ liệu có cấu trúc trong bảng — nửa đầu đúng nhưng nửa sau sai: lưu dữ liệu dạng bảng là việc của Azure Table Storage. Đây là phương án nhiễu gần nhất vì phần mô tả đầu nghe rất chuẩn.
- B. Dịch vụ chia sẻ tệp để cộng tác — mô tả Azure Files hoặc OneDrive.
- D. Dịch vụ tính toán không máy chủ tự co giãn CPU và bộ nhớ — mô tả Azure Functions; Blob Storage không tính toán gì cả.
- A Designing and implementing data models and data flows
- B Analyzing and interpreting complex data sets to identify patterns and trends
- C Maintaining databases and ensuring data integrity
- D Writing code to build and deploy machine learning models
Xem giải thích
Đáp án
B — Phân tích và diễn giải tập dữ liệu phức tạp để tìm ra mẫu và xu hướng
Vì sao đúng
Ba vai trò trong lĩnh vực dữ liệu có ranh giới khá rõ, và câu này kiểm tra đúng ranh giới đó:
| Vai trò | Việc chính |
|---|---|
| Kỹ sư dữ liệu | Dựng đường ống, mô hình dữ liệu, dòng chảy dữ liệu |
| Nhà phân tích dữ liệu | Phân tích, diễn giải, trực quan hoá để hỗ trợ ra quyết định |
| Quản trị viên cơ sở dữ liệu | Duy trì cơ sở dữ liệu, bảo đảm toàn vẹn, sao lưu |
| Nhà khoa học dữ liệu | Xây và triển khai mô hình học máy |
Vì sao các phương án khác sai
- A. Thiết kế mô hình và dòng chảy dữ liệu — việc của kỹ sư dữ liệu.
- C. Duy trì cơ sở dữ liệu và bảo đảm toàn vẹn — việc của quản trị viên cơ sở dữ liệu.
- D. Viết mã xây và triển khai mô hình học máy — việc của nhà khoa học dữ liệu.
- A It requires that there are no transitive dependencies between non-key attributes.
- B It requires that all attributes are fully dependent on the primary key.
- C It requires that all attributes depend on the primary key and that all non-key attributes are mutually independent.
- D It requires that each record be unique and there are no repeating groups of data.
Xem giải thích
Đáp án
D — Mỗi bản ghi phải duy nhất và không có nhóm giá trị lặp lại
Vì sao đúng
Dạng chuẩn 1 (1NF) là bước đầu tiên và đặt ra yêu cầu cơ bản nhất: mỗi ô chỉ chứa một giá trị nguyên tử, và không có cột lặp kiểu DienThoai1, DienThoai2, DienThoai3. Mỗi bản ghi phải phân biệt được với bản ghi khác.
Ví dụ vi phạm 1NF quen thuộc: một cột SoDienThoai chứa chuỗi "0901234567, 0987654321". Muốn đạt 1NF thì phải tách số điện thoại ra bảng riêng.
Vì sao các phương án khác sai
Hai phương án còn lại mô tả các dạng chuẩn cao hơn, và đó là bẫy chính:
- B. Mọi thuộc tính phụ thuộc hoàn toàn vào khoá chính — đây là 2NF.
- A và C. Không có phụ thuộc bắc cầu giữa các thuộc tính không khoá — đây là 3NF.
Thứ tự cần nhớ: 1NF loại giá trị lặp → 2NF loại phụ thuộc một phần → 3NF loại phụ thuộc bắc cầu.
- A Azure SQL Database
- B Azure Blob Storage
- C Azure Data Lake Storage
- D Azure Cosmos DB
Xem giải thích
Đáp án
A — Azure SQL Database
Vì sao đúng
Azure SQL Database là dịch vụ cơ sở dữ liệu quan hệ được quản lý, dựa trên chính công nghệ SQL Server: dữ liệu trong bảng có lược đồ cố định, có khoá chính và khoá ngoại, hỗ trợ giao dịch ACID và truy vấn bằng T-SQL.
Vì sao các phương án khác sai
- D. Cosmos DB — cơ sở dữ liệu phi quan hệ (NoSQL); nó có "SQL API" nhưng đó chỉ là cú pháp truy vấn giống SQL, còn mô hình dữ liệu bên dưới là tài liệu chứ không phải quan hệ. Đây là bẫy chính.
- B. Blob Storage — kho đối tượng.
- C. Data Lake Storage — kho cho phân tích quy mô lớn.
- A MySQL API
-
B
PostgreSQL API
- C MongoDB API
- D SQL API
Xem giải thích
Đáp án
A — MySQL API
Vì sao đúng
Câu này tìm API không tồn tại trong Cosmos DB. Cosmos DB hỗ trợ nhiều API để tương thích với các cơ sở dữ liệu phổ biến, nhờ đó ứng dụng đang chạy chuyển sang mà gần như không phải sửa mã: NoSQL (Core), MongoDB, Cassandra, Gremlin, Table và PostgreSQL.
MySQL không nằm trong đó. Azure có dịch vụ riêng cho nó — Azure Database for MySQL — vì MySQL là cơ sở dữ liệu quan hệ, không khớp với mô hình phân tán của Cosmos DB.
Vì sao các phương án khác sai (chúng đều được hỗ trợ)
- B. PostgreSQL API — có, dựa trên Citus để phân tán theo chiều ngang.
- C. MongoDB API và D. SQL API — hai API phổ biến nhất.
- A Azure Stream Analytics
- B Azure Data Factory
- C Azure Event Hubs
- D Azure Synapse Analytics
Xem giải thích
Đáp án
B — Azure Data Factory
Vì sao đúng
Đề mô tả một đường ống nạp dữ liệu: xử lý và biến đổi dữ liệu trước khi đưa vào data lake. Data Factory là dịch vụ điều phối dữ liệu dựng cho đúng việc đó — kết nối tới hơn chín mươi loại nguồn, khai luồng biến đổi bằng giao diện kéo thả hoặc gọi sang Databricks cho phần nặng, chạy theo lịch hoặc theo sự kiện, và tự thử lại khi lỗi.
Vì sao các phương án khác sai
- C. Event Hubs — nhận dữ liệu theo luồng, nhưng không biến đổi gì.
- A. Stream Analytics — xử lý luồng thời gian thực; hợp khi dữ liệu tới liên tục, không phải cho đường ống nạp theo lô như đề mô tả.
- D. Synapse Analytics — nền tảng phân tích; nó chứa pipeline dựa trên Data Factory, nhưng câu hỏi hỏi về công cụ cho khâu nạp cụ thể.