Ngân hàng đề — Microsoft Azure Data Fundamentals

Tìm thấy 328 câu.

Câu 171 Relational concepts
Which SQL statement is used to add a new row to a table?
  1. A UPDATE
  2. B SELECT
  3. C INSERT
  4. D CREATE
Xem giải thích

Đáp án

C — INSERT

Vì sao đúng

Bốn lệnh trong danh sách thuộc hai nhóm khác nhau, và biết ranh giới đó giúp trả lời nhanh:

Nhóm Lệnh Tác động lên
DML — thao tác dữ liệu INSERT, UPDATE, DELETE, SELECT Dữ liệu bên trong bảng
DDL — định nghĩa cấu trúc CREATE, ALTER, DROP Cấu trúc của bảng

Thêm một dòng mới là thao tác trên dữ liệu, nên đó là INSERT.

Vì sao các phương án khác sai

  • A. UPDATE — sửa dòng đã có, không tạo dòng mới.
  • B. SELECT — chỉ đọc.
  • D. CREATE — tạo bảng hoặc đối tượng khác, không tạo dòng. Đây là chỗ dễ nhầm nhất vì từ "create" nghe như "tạo mới".
Câu 172 Azure Cosmos DB
You are building an application that needs to store and query large amounts of unstructured JSON data. The application needs to handle high throughput with low latency and have global distribution capabilities. Which Azure service would be the best choice for this scenario?
  1. A Azure Cosmos DB
  2. B Azure SQL Database
  3. C Azure Blob Storage
  4. D Azure Data Lake Storage Gen2
Xem giải thích

Đáp án

A — Azure Cosmos DB

Vì sao đúng

Ba yêu cầu trong đề đều là đặc điểm định danh của Cosmos DB: lưu và truy vấn JSON, thông lượng cao với độ trễ thấp, và phân tán toàn cầu. Nó lưu JSON nguyên bản và đánh chỉ mục tự động mọi trường, nên truy vấn sâu vào cấu trúc lồng nhau mà không phải khai chỉ mục trước.

Vì sao các phương án khác sai

  • C. Blob Storage — chứa được tệp JSON nhưng không truy vấn được nội dung bên trong; với nó thì JSON chỉ là một khối byte.
  • D. Data Lake Gen2 — kho cho phân tích quy mô lớn, độ trễ không hợp đường phục vụ ứng dụng.
  • B. Azure SQL Database — quan hệ; lưu được JSON trong cột nhưng đó không phải mô hình dữ liệu tự nhiên của nó, và mở rộng ngang kém hơn.
Câu 173 Large-scale analytics
Which service enables you to create and manage a cloud-native, fully-managed big data analytics service that integrates Apache Spark with Microsoft's enterprise security and compliance capabilities?
  1. A Microsoft Purview
  2. B Azure Synapse Analytics
  3. C Azure AI Services
  4. D Azure Databricks
Xem giải thích

Đáp án

D — Azure Databricks

Vì sao đúng

Từ khoá quyết định trong đề là Apache Spark. Databricks là nền tảng Spark được quản lý, do chính những người tạo ra Spark xây dựng, và bản Azure tích hợp sẵn với Entra ID, mạng ảo và các công cụ tuân thủ của Microsoft — đúng phần "bảo mật và tuân thủ mức doanh nghiệp" mà đề nhắc tới.

Vì sao các phương án khác sai

  • B. Azure Synapse Analytics — đây là phương án nhiễu gần nhất vì Synapse cũng có Spark pool. Nhưng Synapse là nền tảng phân tích gộp nhiều thứ (kho dữ liệu SQL, pipeline, Spark), còn câu hỏi mô tả một dịch vụ lấy Spark làm trung tâm — đó là Databricks.
  • A. Microsoft Purview — quản trị dữ liệu.
  • C. Azure AI Services — mô hình AI dựng sẵn qua API.
Câu 174 Large-scale analytics
Which Azure service is recommended for storing and querying large volumes of structured and semi-structured data for analytics workloads?
  1. A Azure SQL Database
  2. B Azure Cosmos DB
  3. C Azure Synapse Analytics
  4. D Azure Data Lake Storage Gen2
Xem giải thích

Đáp án

C — Azure Synapse Analytics

Vì sao đúng

Ba yếu tố trong đề — dữ liệu có cấu trúc và bán cấu trúc, khối lượng lớn, khối lượng công việc phân tích — đều chỉ về kho dữ liệu phân tích. Synapse cho cả hai cách truy vấn: SQL pool chuyên dụng cho dữ liệu đã mô hình hoá, và serverless SQL để truy vấn thẳng tệp Parquet hay JSON nằm trong data lake mà không cần nạp trước.

Vì sao các phương án khác sai

  • A. Azure SQL Database — cơ sở dữ liệu giao dịch; tối ưu cho nhiều thao tác nhỏ, không cho truy vấn quét khối lượng lớn.
  • B. Cosmos DB — cũng là cơ sở dữ liệu giao dịch, đắt cho mục đích phân tích.
  • D. Data Lake Gen2 — là nơi lưu trữ; tự nó không truy vấn được, thường đóng vai kho nguồn bên cạnh Synapse.
Câu 175 Capabilities of Azure storage
Which of the following is an accurate description of Azure Blob storage?
  1. A Azure Blob storage is recommended for storing unstructured data, such as files, images, and videos, and can handle data of any size.
  2. B Azure Blob storage is a cloud-based file sharing service that allows users to securely share and collaborate on files from anywhere.
  3. C Azure Blob storage provides durable and highly available object storage service designed for storing structured data in tables.
  4. D Azure Blob storage is a fully-managed, serverless compute service that automatically scales CPUs and memory based on usage.
Xem giải thích

Đáp án

A — Blob Storage được khuyến nghị cho dữ liệu phi cấu trúc như tệp, ảnh, video, và xử lý được dữ liệu ở mọi kích cỡ

Vì sao đúng

Đây là mô tả chính xác nhất: Blob Storage là kho đối tượng dựng cho dữ liệu phi cấu trúc, không có trần dung lượng thực tế, và có nhiều tầng truy cập để tối ưu chi phí theo tần suất đọc.

Vì sao các phương án khác sai

  • **C. Kho đối tượng bền và sẵn sàng cao dùng để lưu dữ liệu có cấu trúc trong bảng — nửa đầu đúng nhưng nửa sau sai: lưu dữ liệu dạng bảng là việc của Azure Table Storage. Đây là phương án nhiễu gần nhất vì phần mô tả đầu nghe rất chuẩn.
  • B. Dịch vụ chia sẻ tệp để cộng tác — mô tả Azure Files hoặc OneDrive.
  • D. Dịch vụ tính toán không máy chủ tự co giãn CPU và bộ nhớ — mô tả Azure Functions; Blob Storage không tính toán gì cả.
Câu 176 Roles and responsibilities
Which of the following responsibilities are typically associated with a data analyst role?
  1. A Designing and implementing data models and data flows
  2. B Analyzing and interpreting complex data sets to identify patterns and trends
  3. C Maintaining databases and ensuring data integrity
  4. D Writing code to build and deploy machine learning models
Xem giải thích

Đáp án

B — Phân tích và diễn giải tập dữ liệu phức tạp để tìm ra mẫu và xu hướng

Vì sao đúng

Ba vai trò trong lĩnh vực dữ liệu có ranh giới khá rõ, và câu này kiểm tra đúng ranh giới đó:

Vai trò Việc chính
Kỹ sư dữ liệu Dựng đường ống, mô hình dữ liệu, dòng chảy dữ liệu
Nhà phân tích dữ liệu Phân tích, diễn giải, trực quan hoá để hỗ trợ ra quyết định
Quản trị viên cơ sở dữ liệu Duy trì cơ sở dữ liệu, bảo đảm toàn vẹn, sao lưu
Nhà khoa học dữ liệu Xây và triển khai mô hình học máy

Vì sao các phương án khác sai

  • A. Thiết kế mô hình và dòng chảy dữ liệu — việc của kỹ sư dữ liệu.
  • C. Duy trì cơ sở dữ liệu và bảo đảm toàn vẹn — việc của quản trị viên cơ sở dữ liệu.
  • D. Viết mã xây và triển khai mô hình học máy — việc của nhà khoa học dữ liệu.
Câu 177 Relational concepts
When normalizing data in a relational database, which of the following statements about the first normal form (1NF) is correct?
  1. A It requires that there are no transitive dependencies between non-key attributes.
  2. B It requires that all attributes are fully dependent on the primary key.
  3. C It requires that all attributes depend on the primary key and that all non-key attributes are mutually independent.
  4. D It requires that each record be unique and there are no repeating groups of data.
Xem giải thích

Đáp án

D — Mỗi bản ghi phải duy nhất và không có nhóm giá trị lặp lại

Vì sao đúng

Dạng chuẩn 1 (1NF) là bước đầu tiên và đặt ra yêu cầu cơ bản nhất: mỗi ô chỉ chứa một giá trị nguyên tử, và không có cột lặp kiểu DienThoai1, DienThoai2, DienThoai3. Mỗi bản ghi phải phân biệt được với bản ghi khác.

Ví dụ vi phạm 1NF quen thuộc: một cột SoDienThoai chứa chuỗi "0901234567, 0987654321". Muốn đạt 1NF thì phải tách số điện thoại ra bảng riêng.

Vì sao các phương án khác sai

Hai phương án còn lại mô tả các dạng chuẩn cao hơn, và đó là bẫy chính:

  • B. Mọi thuộc tính phụ thuộc hoàn toàn vào khoá chính — đây là 2NF.
  • A và C. Không có phụ thuộc bắc cầu giữa các thuộc tính không khoá — đây là 3NF.

Thứ tự cần nhớ: 1NF loại giá trị lặp → 2NF loại phụ thuộc một phần → 3NF loại phụ thuộc bắc cầu.

Câu 178 Options for data storage
Which of the following is a type of relational database offered by Microsoft Azure?
  1. A Azure SQL Database
  2. B Azure Blob Storage
  3. C Azure Data Lake Storage
  4. D Azure Cosmos DB
Xem giải thích

Đáp án

A — Azure SQL Database

Vì sao đúng

Azure SQL Database là dịch vụ cơ sở dữ liệu quan hệ được quản lý, dựa trên chính công nghệ SQL Server: dữ liệu trong bảng có lược đồ cố định, có khoá chính và khoá ngoại, hỗ trợ giao dịch ACID và truy vấn bằng T-SQL.

Vì sao các phương án khác sai

  • D. Cosmos DB — cơ sở dữ liệu phi quan hệ (NoSQL); nó có "SQL API" nhưng đó chỉ là cú pháp truy vấn giống SQL, còn mô hình dữ liệu bên dưới là tài liệu chứ không phải quan hệ. Đây là bẫy chính.
  • B. Blob Storage — kho đối tượng.
  • C. Data Lake Storage — kho cho phân tích quy mô lớn.
Câu 179 Azure Cosmos DB
Which of the following is NOT one of the Azure Cosmos DB APIs?
  1. A MySQL API
  2. B

    PostgreSQL API

  3. C MongoDB API
  4. D SQL API
Xem giải thích

Đáp án

A — MySQL API

Vì sao đúng

Câu này tìm API không tồn tại trong Cosmos DB. Cosmos DB hỗ trợ nhiều API để tương thích với các cơ sở dữ liệu phổ biến, nhờ đó ứng dụng đang chạy chuyển sang mà gần như không phải sửa mã: NoSQL (Core), MongoDB, Cassandra, Gremlin, Table và PostgreSQL.

MySQL không nằm trong đó. Azure có dịch vụ riêng cho nó — Azure Database for MySQL — vì MySQL là cơ sở dữ liệu quan hệ, không khớp với mô hình phân tán của Cosmos DB.

Vì sao các phương án khác sai (chúng đều được hỗ trợ)

  • B. PostgreSQL API — có, dựa trên Citus để phân tán theo chiều ngang.
  • C. MongoDB API và D. SQL API — hai API phổ biến nhất.
Câu 180 Large-scale analytics
You are designing a data ingestion pipeline for a large-scale analytics solution. Which service would you use to process and transform data before storing it in a data lake?
  1. A Azure Stream Analytics
  2. B Azure Data Factory
  3. C Azure Event Hubs
  4. D Azure Synapse Analytics
Xem giải thích

Đáp án

B — Azure Data Factory

Vì sao đúng

Đề mô tả một đường ống nạp dữ liệu: xử lý và biến đổi dữ liệu trước khi đưa vào data lake. Data Factory là dịch vụ điều phối dữ liệu dựng cho đúng việc đó — kết nối tới hơn chín mươi loại nguồn, khai luồng biến đổi bằng giao diện kéo thả hoặc gọi sang Databricks cho phần nặng, chạy theo lịch hoặc theo sự kiện, và tự thử lại khi lỗi.

Vì sao các phương án khác sai

  • C. Event Hubs — nhận dữ liệu theo luồng, nhưng không biến đổi gì.
  • A. Stream Analytics — xử lý luồng thời gian thực; hợp khi dữ liệu tới liên tục, không phải cho đường ống nạp theo lô như đề mô tả.
  • D. Synapse Analytics — nền tảng phân tích; nó chứa pipeline dựa trên Data Factory, nhưng câu hỏi hỏi về công cụ cho khâu nạp cụ thể.