Ngân hàng đề — Microsoft Azure Data Fundamentals

Tìm thấy 328 câu.

Câu 261
Which Azure Data Factory component provides the compute environment for activities?
  1. A SSIS packages
  2. B an integration runtime
  3. C a control flow
  4. D a pipeline
Xem giải thích

🧩 Phân tích chi tiết câu hỏi trắc nghiệm

Câu hỏi gốc:
Which Azure Data Factory component provides the compute environment for activities?

Giải thích nội dung câu hỏi:
🛠️ Câu hỏi này tập trung vào Azure Data Factory (ADF) – một dịch vụ đám mây của Microsoft dùng để xây dựng, lên lịch và quản lý các pipeline ETL/ELT (Extract, Transform, Load). Cụ thể, nó hỏi về thành phần nào trong ADF cung cấp môi trường tính toán (compute environment) để thực thi các activities (hoạt động) như di chuyển dữ liệu, biến đổi dữ liệu, hoặc chạy script.
📘 Trong ADF (phiên bản cập nhật mới nhất đến năm 2026), môi trường tính toán phải hỗ trợ thực thi phân tán, tự động scale, và tích hợp với các dịch vụ như Azure Synapse, Databricks. Đây là kiến thức cốt lõi trong chứng chỉ Microsoft Certified: Azure Data Fundamentals (DP-900), nhấn mạnh vai trò của các thành phần ADF trong data integration.

✅ Đáp án đúng: an integration runtime

Lý do lựa chọn:
✅ Integration Runtime (IR) là thành phần cốt lõi cung cấp môi trường tính toán động cho tất cả activities trong pipeline ADF. Nó xử lý việc thực thi dữ liệu trên cloud (Azure IR), on-premises (Self-hosted IR), hoặc hybrid (Azure-SSIS IR). IR hỗ trợ scale tự động, quản lý tài nguyên CPU/memory, và kết nối an toàn với nguồn dữ liệu. Không có IR, activities không thể chạy! (Cập nhật 2026: IR hỗ trợ thêm managed VNet và auto-provisioning cho hiệu suất cao hơn).

📋 Giải thích tất cả các phương án

  • SSIS packages ❌
    ❌ SSIS packages (gói SSIS từ SQL Server Integration Services) chỉ là tập hợp các task ETL có thể được host và chạy trên Azure-SSIS IR trong ADF. Chúng không cung cấp môi trường tính toán mà phụ thuộc vào IR để thực thi. SSIS là legacy tool, không phải component gốc của ADF.

  • an integration runtime ✅
    ✅ Như đã giải thích ở trên, đây là thành phần chính cung cấp compute environment, hỗ trợ data movement (qua Mapping Data Flows) và transformation. IR có 3 loại: Azure, Self-hosted, Azure-SSIS, phù hợp mọi scenario.

  • a control flow ❌
    ❌ A control flow là khái niệm từ SSIS, dùng để định nghĩa luồng điều khiển task (sequence, loop). Trong ADF, không tồn tại "control flow" trực tiếp; thay vào đó là pipeline quản lý activities. Nó không liên quan đến compute.

  • a pipeline ❌
    ❌ A pipeline là container logic chứa các activities, datasets, và triggers để định nghĩa workflow. Pipeline chỉ lập kế hoạch luồng công việc, không cung cấp tài nguyên tính toán – nó cần IR để thực thi activities.

📚 Tài liệu tham khảo

Hy vọng phân tích này giúp bạn nắm vững kiến thức Azure Data Factory! 🚀 Nếu cần thêm ví dụ thực hành, hãy hỏi nhé!

Câu 262 Chọn nhiều đáp án
What are two uses of data visualization? Each correct answer presents a complete solution.
NOTE: Each correct selection is worth one point.
  1. A Represent trends and patterns over time
  2. B Implement machine learning to predict future values
  3. C Communicate the significance of data
  4. D Enforce business logic across reports
Xem giải thích

🧩 Giải thích nội dung câu hỏi

Câu hỏi trắc nghiệm này thuộc lĩnh vực Data Fundamentals, tập trung vào các ứng dụng thực tế của data visualization (trực quan hóa dữ liệu). Cụ thể:
"What are two uses of data visualization? Each correct answer presents a complete solution. NOTE: Each correct selection is worth one point."

✅ Đây là dạng câu hỏi multi-select (chọn nhiều đáp án đúng), yêu cầu chọn đúng 2 công dụng của data visualization. Mỗi đáp án đúng chiếm 1 điểm.
Data visualization là kỹ thuật sử dụng biểu đồ, đồ thị, bản đồ... để biến dữ liệu thô thành hình ảnh dễ hiểu, giúp người dùng khám phá insights mà không cần phân tích sâu. Câu hỏi kiểm tra kiến thức cơ bản về lợi ích cốt lõi của nó (theo chương trình Microsoft Azure Data Fundamentals DP-900, cập nhật đến 2026, và tương đồng với AWS QuickSight/Amazon EMR visualization features).

✅ Đáp án đúng và lý do lựa chọn

Hai đáp án đúng là:

  • Represent trends and patterns over time
  • Communicate the significance of data

Lý do lựa chọn:
Data visualization chính yếu dùng để hiển thị xu hướng (trends) và mẫu hình (patterns) theo thời gian qua các biểu đồ đường, cột thời gian... (ví dụ: line chart trong Power BI hoặc QuickSight). Đồng thời, nó giúp truyền đạt ý nghĩa dữ liệu một cách trực quan, dễ chia sẻ với stakeholder (như dashboard nhấn mạnh KPI). Đây là hai công dụng cốt lõi, được nhấn mạnh trong tài liệu Microsoft Learn và AWS Well-Architected Framework (Data Analytics Lens, 2026 update).

🛠️ Phân tích tất cả các phương án

Dưới đây là phân tích chi tiết từng lựa chọn giữ nguyên văn bản gốc tiếng Anh, với giải thích hoàn toàn bằng tiếng Việt:

  • Represent trends and patterns over time
    ✅ Đúng. Data visualization xuất sắc trong việc thể hiện xu hướng và mẫu hình theo thời gian, như tăng trưởng doanh số hàng quý qua biểu đồ đường hoặc chu kỳ lặp lại qua heatmap. Điều này giúp phát hiện insights nhanh chóng mà không cần query phức tạp (ví dụ: Time Series Analysis trong Azure Synapse hoặc AWS QuickSight).

  • Implement machine learning to predict future values
    ❌ Sai. Data visualization không implement (triển khai) machine learning để dự đoán; đó là nhiệm vụ của ML models (như Azure ML hoặc Amazon SageMaker). Visualization chỉ hiển thị kết quả dự đoán, không phải công cụ thực thi ML.

  • Communicate the significance of data
    ✅ Đúng. Một công dụng chính là truyền đạt ý nghĩa dữ liệu đến người không chuyên, qua màu sắc, kích thước biểu đồ để nhấn mạnh điểm quan trọng (storytelling trong Power BI dashboards hoặc QuickSight narratives), giúp ra quyết định kinh doanh.

  • Enforce business logic across reports
    ❌ Sai. Data visualization không enforce (áp đặt) business logic; đó là vai trò của data modeling, ETL processes (như Azure Data Factory hoặc AWS Glue), hoặc row-level security trong reports. Visualization chỉ trình bày dữ liệu đã được logic hóa sẵn.

📘 Tài liệu tham khảo

  • Microsoft Learn (Azure Data Fundamentals DP-900): Describe core data concepts – Cập nhật 2026.
  • AWS Documentation (QuickSight): What is Amazon QuickSight? – Nhấn mạnh visualization cho trends & communication (Data Analytics Well-Architected Lens, 2026).
  • Chung: "The Visual Display of Quantitative Information" by Edward Tufte (tài liệu kinh điển về data viz uses).

Hy vọng phân tích này giúp bạn nắm vững kiến thức! 🚀 Nếu cần thêm ví dụ thực hành trên Azure/AWS, hãy hỏi nhé!

Câu 263
You need to use Transact-SQL to query files in Azure Data Lake Storage Gen 2 from an Azure Synapse Analytics data warehouse.
What should you use to query the files?
  1. A Azure Functions
  2. B Microsoft SQL Server Integration Services (SSIS)
  3. C PolyBase
  4. D Azure Data Factory
Xem giải thích

🧩 Phân tích chi tiết nội dung câu hỏi

Câu hỏi yêu cầu sử dụng Transact-SQL (T-SQL) để truy vấn trực tiếp các tệp dữ liệu lưu trữ trong Azure Data Lake Storage Gen2 (ADLS Gen2) từ một Azure Synapse Analytics data warehouse (trước đây gọi là Azure SQL Data Warehouse).
📌 Mục tiêu chính: Tìm công cụ hoặc tính năng cho phép thực hiện truy vấn T-SQL mà không cần di chuyển dữ liệu vào warehouse, hỗ trợ đọc dữ liệu bên ngoài (external data) một cách hiệu quả, scalable và tích hợp sâu với Synapse.
🛠️ Ngữ cảnh: Azure Synapse Analytics hỗ trợ truy vấn dữ liệu lớn từ ADLS Gen2 qua các bảng external (external tables), tận dụng tính năng massively parallel processing (MPP) để xử lý dữ liệu phân tán.

✅ Đáp án đúng: PolyBase

Lý do lựa chọn:
PolyBase là tính năng cốt lõi của Azure Synapse Analytics, cho phép sử dụng T-SQL thuần túy để truy vấn dữ liệu từ ADLS Gen2 mà không cần import dữ liệu vào warehouse. Bạn có thể tạo external tables kết nối trực tiếp với ADLS Gen2 qua external data sources (sử dụng credential như SAS token hoặc Managed Identity). Cú pháp T-SQL đơn giản như CREATE EXTERNAL TABLE và SELECT từ bảng đó.
🆙 Cập nhật mới nhất (đến 2026): PolyBase đã được nâng cấp trong Synapse Analytics (phiên bản runtime mới nhất), hỗ trợ định dạng Parquet, ORC, CSV với pushdown predicates tối ưu hiệu suất, và tích hợp với Serverless SQL pools. Đây là cách chuẩn theo tài liệu Microsoft.

📋 Giải thích tất cả các phương án

Dưới đây là phân tích từng lựa chọn, với đánh giá đúng/sai dựa trên khả năng sử dụng T-SQL để truy vấn trực tiếp từ Synapse Analytics:

  • ❌ Azure Functions
    Phương án này sai vì Azure Functions là dịch vụ serverless compute dùng cho code tùy chỉnh (như C#, Python), không hỗ trợ T-SQL trực tiếp từ Synapse để query ADLS Gen2. Nó phù hợp cho ETL logic hoặc API, nhưng không thay thế truy vấn SQL thuần. Sử dụng Functions sẽ yêu cầu code thủ công, không đáp ứng yêu cầu T-SQL.

  • ❌ Microsoft SQL Server Integration Services (SSIS)
    Phương án này sai vì SSIS là công cụ ETL (Extract-Transform-Load) để di chuyển dữ liệu theo batch, không phải để truy vấn T-SQL thời gian thực từ Synapse Analytics. SSIS chạy trên SSIS Catalog trong Synapse, nhưng chỉ dùng cho pipeline dữ liệu, không query trực tiếp qua T-SQL mà không import dữ liệu.

  • ✅ PolyBase
    Phương án này đúng (như đã giải thích ở trên). PolyBase là lựa chọn tối ưu, cho phép T-SQL query external data từ ADLS Gen2 với hiệu suất cao, hỗ trợ credential-based access và tích hợp native trong Synapse.

  • ❌ Azure Data Factory
    Phương án này sai vì Azure Data Factory (ADF) là dịch vụ orchestration cho pipeline dữ liệu (copy activity, data flows), không hỗ trợ T-SQL query trực tiếp từ Synapse warehouse. ADF có thể gọi Synapse qua linked services, nhưng chỉ để thực thi stored procedures hoặc pipelines, không thay thế PolyBase cho truy vấn T-SQL thuần.

📘 Tài liệu tham khảo

Câu 264 Chọn nhiều đáp án
What are three characteristics of an Online Transaction Processing (OLTP) workload? Each correct answer presents a complete solution.
NOTE: Each correct selection is worth one point.
  1. A denormalized data
  2. B heavy writes and moderate reads
  3. C light writes and heavy reads
  4. D schema defined in a database
  5. E schema defined when reading unstructured data from a database
  6. F normalized data
Xem giải thích

🧩 Phân tích câu hỏi trắc nghiệm về OLTP Workload trên AWS

📘 Giải thích nội dung câu hỏi:
Câu hỏi yêu cầu xác định ba đặc trưng chính của workload Online Transaction Processing (OLTP). OLTP là loại workload xử lý giao dịch thời gian thực, thường dùng trong các ứng dụng như hệ thống ngân hàng, thương mại điện tử hoặc đặt hàng trực tuyến trên AWS (ví dụ: Amazon RDS, DynamoDB). Đặc trưng nổi bật của OLTP bao gồm: dữ liệu được chuẩn hóa (normalized) để tránh dư thừa, schema được định nghĩa trước khi lưu trữ (schema-on-write), và tập trung vào các hoạt động viết dữ liệu nhiều (heavy writes) với đọc vừa phải (moderate reads). Câu hỏi là dạng multi-select (chọn nhiều đáp án đúng), mỗi lựa chọn đúng chiếm 1 điểm. Kiến thức dựa trên phiên bản AWS mới nhất đến năm 2026, nơi OLTP vẫn giữ nguyên các nguyên tắc cốt lõi trong các dịch vụ như Amazon Aurora, RDS for MySQL/PostgreSQL, với tối ưu hóa cho giao dịch ACID (Atomicity, Consistency, Isolation, Durability).

✅ Đáp án đúng (3 lựa chọn):

  • heavy writes and moderate reads
  • schema defined in a database
  • normalized data

🛠️ Lý do lựa chọn các đáp án đúng:
Các đặc trưng này phù hợp hoàn hảo với OLTP vì: OLTP xử lý hàng nghìn giao dịch viết/giây (như insert/update), đọc ít hơn để tra cứu nhanh; schema được định nghĩa trước trong database để đảm bảo tính toàn vẹn dữ liệu; dữ liệu normalized (chia thành các bảng liên kết qua khóa ngoại) giúp giảm redundancy và hỗ trợ giao dịch nhanh chóng.

📋 Giải thích chi tiết từng phương án (đúng/sai):

  • ❌ denormalized data
    Phương án này SAI vì dữ liệu denormalized (không chuẩn hóa, thường duplicate để tăng tốc đọc) là đặc trưng của OLAP (Online Analytical Processing) hoặc data warehouse như Amazon Redshift, không phải OLTP. OLTP cần dữ liệu normalized để duy trì tính nhất quán và tránh anomaly khi viết dữ liệu.

  • ✅ heavy writes and moderate reads
    Phương án này ĐÚNG vì OLTP tập trung vào giao dịch viết nhiều (heavy writes: insert, update, delete liên tục) và đọc vừa phải (moderate reads: chủ yếu query đơn giản, nhanh). Trên AWS, DynamoDB hoặc RDS OLTP được thiết kế tối ưu cho pattern này, xử lý hàng triệu TPS (transactions per second).

  • ❌ light writes and heavy reads
    Phương án này SAI vì đây là đặc trưng của OLAP/analytics workload (light writes, heavy reads phức tạp như aggregation). OLTP ngược lại, ưu tiên writes để cập nhật realtime, ví dụ trong e-commerce trên AWS.

  • ✅ schema defined in a database
    Phương án này ĐÚNG vì OLTP sử dụng schema-on-write (định nghĩa schema trước khi ghi dữ liệu vào database), đảm bảo cấu trúc dữ liệu rõ ràng ngay từ đầu. Điều này phổ biến trong RDS/Aurora, khác với schema-on-read ở data lakes như S3.

  • ❌ schema defined when reading unstructured data from a database
    Phương án này SAI vì mô tả schema-on-read (định nghĩa schema khi đọc dữ liệu không cấu trúc), phù hợp với big data/unstructured như Apache Spark trên EMR hoặc data lakes, không phải OLTP có cấu trúc nghiêm ngặt.

  • ✅ normalized data
    Phương án này ĐÚNG vì OLTP yêu cầu dữ liệu normalized (theo các dạng chuẩn 1NF-3NF) để tránh dư thừa, hỗ trợ giao dịch ACID hiệu quả. Trên AWS 2026, các công cụ như Aurora Serverless v2 vẫn khuyến nghị normalization cho OLTP.

📚 Tài liệu tham khảo:

Hy vọng phân tích này giúp bạn nắm vững OLTP trên AWS! 🚀

Câu 265
What is the primary purpose of a data warehouse?
  1. A to provide answers to complex queries that rely on data from multiple sources
  2. B to provide transformation services between source and target data stores
  3. C to provide read-only storage of relational and non-relational historical data
  4. D to provide storage for transactional line-of-business (LOB) applications
Xem giải thích

🧩 Phân tích chi tiết câu hỏi trắc nghiệm

Câu hỏi gốc (bằng tiếng Anh):
What is the primary purpose of a data warehouse?

Giải thích nội dung câu hỏi:
🛠️ Câu hỏi này tập trung vào mục đích chính (primary purpose) của một data warehouse trong lĩnh vực dữ liệu lớn và phân tích dữ liệu trên nền tảng đám mây AWS. Data warehouse là một hệ thống lưu trữ dữ liệu được tối ưu hóa cho phân tích (analytics) và truy vấn phức tạp (complex queries), thường sử dụng cho các báo cáo kinh doanh thông minh (BI), OLAP (Online Analytical Processing). Nó khác biệt với các hệ thống giao dịch (OLTP) hoặc lưu trữ thô. Theo kiến thức AWS cập nhật đến năm 2026 (phiên bản Amazon Redshift RA3 và Redshift Serverless mới nhất), data warehouse như Redshift được thiết kế để xử lý dữ liệu từ nhiều nguồn, hỗ trợ truy vấn nhanh chóng trên petabyte dữ liệu lịch sử đã được làm sạch và cấu trúc hóa.

✅ Đáp án đúng và lý do lựa chọn

Đáp án đúng: to provide answers to complex queries that rely on data from multiple sources

Lý do:
📘 Đây là mục đích cốt lõi của data warehouse trên AWS! Nó được xây dựng để tích hợp dữ liệu từ nhiều nguồn khác nhau (multiple sources) như cơ sở dữ liệu OLTP, file logs, API, và sau đó thực hiện truy vấn phức tạp (complex queries) như JOIN lớn, aggregation, hoặc phân tích xu hướng. Ví dụ, Amazon Redshift (dịch vụ data warehouse hàng đầu AWS năm 2026) sử dụng columnar storage và massively parallel processing (MPP) để trả lời các câu hỏi kinh doanh nhanh chóng, hỗ trợ công cụ BI như Amazon QuickSight hoặc Tableau. Điều này phù hợp với AWS Well-Architected Framework (Analytics Lens, cập nhật 2025).

Tài liệu tham khảo:

📋 Giải thích tất cả các phương án trả lời

Dưới đây là phân tích từng phương án một, giữ nguyên văn bản gốc bằng tiếng Anh. Tôi đánh dấu ✅ cho đúng, ❌ cho sai, kèm giải thích chi tiết bằng tiếng Việt dựa trên AWS mới nhất:

  • ✅ to provide answers to complex queries that rely on data from multiple sources
    🧩 Đúng hoàn toàn! Như đã giải thích ở trên, đây là chức năng chính của data warehouse (ví dụ: Redshift hỗ trợ federated queries từ S3, RDS, và external tables đến năm 2026). Nó không chỉ lưu trữ mà còn phân tích và trả lời truy vấn từ dữ liệu đa nguồn.

  • ❌ to provide transformation services between source and target data stores
    🚫 Sai! Chức năng transformation (ETL/ELT) thuộc về các dịch vụ riêng như AWS Glue (ETL serverless, cập nhật DataBrew tích hợp ML transforms năm 2025) hoặc AWS DMS (Database Migration Service). Data warehouse như Redshift chỉ tiêu thụ dữ liệu đã transform, không phải là công cụ transformation chính.

  • ❌ to provide read-only storage of relational and non-relational historical data
    🚫 Sai! Data warehouse chủ yếu dành cho dữ liệu quan hệ đã cấu trúc (relational, schema-on-write), không phải lưu trữ read-only cho non-relational historical data (đó là Amazon S3 Data Lake hoặc Amazon Lake Formation với schema-on-read, hỗ trợ cả structured/unstructured đến 2026). Redshift không phải là "read-only storage" thuần túy mà hỗ trợ write/update cho analytics.

  • ❌ to provide storage for transactional line-of-business (LOB) applications
    🚫 Sai! Transactional LOB (line-of-business) yêu cầu OLTP cao (high throughput, low latency) như Amazon Aurora hoặc Amazon DynamoDB (cập nhật Global Tables v2 năm 2026). Data warehouse như Redshift không phù hợp cho giao dịch real-time vì chậm hơn (optimized cho batch analytics), dễ gây bottleneck nếu dùng sai mục đích.

Kết luận: 🏆 Câu hỏi kiểm tra sự phân biệt rõ ràng giữa data warehouse (analytics-focused) và các hệ thống khác trên AWS. Nếu bạn đang học Azure Data Fundamentals (như DP-900), tương đương là Azure Synapse Analytics với mục đích tương tự! Cần thêm câu hỏi AWS/Azure nào không? 😊

Câu 266
What should you use to build a Microsoft Power BI paginated report?
  1. A Charticulator
  2. B Power BI Desktop
  3. C the Power BI service
  4. D Power BI Report Builder
Xem giải thích

🧩 Phân tích chi tiết câu hỏi trắc nghiệm

📖 Nội dung câu hỏi:
Câu hỏi yêu cầu xác định công cụ phù hợp nhất để xây dựng một báo cáo phân trang (paginated report) trong Microsoft Power BI. Paginated report là loại báo cáo được thiết kế để in ấn hoặc xuất ra PDF/Excel với bố cục cố định theo trang, tương tự như các báo cáo trong SQL Server Reporting Services (SSRS). Đây là tính năng chuyên biệt của Power BI, giúp xử lý dữ liệu lớn và báo cáo chi tiết, khác biệt với báo cáo tương tác thông thường. Câu hỏi tập trung vào việc chọn công cụ authoring (tạo báo cáo) chính xác từ các lựa chọn Microsoft Power BI.

✅ Đáp án đúng: Power BI Report Builder
Lý do lựa chọn: Power BI Report Builder là công cụ chuyên dụng và chính thức của Microsoft để xây dựng paginated reports trong Power BI. Nó kế thừa công nghệ từ SSRS, cho phép thiết kế báo cáo với bố cục pixel-perfect, hỗ trợ parameters, subreports, và xuất đa định dạng. Theo tài liệu Microsoft cập nhật đến năm 2026 (Power BI phiên bản mới nhất), đây là lựa chọn duy nhất hỗ trợ đầy đủ tính năng paginated reports, tích hợp seamless với Power BI service để publish và share.
📘 Tài liệu tham khảo: Microsoft Docs - Create paginated reports in Power BI (cập nhật 2025-2026).

🛠️ Giải thích chi tiết tất cả các phương án

  • ❌ Charticulator
    Phương án sai vì Charticulator là công cụ mã nguồn mở dùng để tạo custom visuals (biểu đồ tùy chỉnh) trong Power BI Desktop hoặc service, dựa trên JSON và D3.js. Nó không hỗ trợ xây dựng paginated reports mà chỉ tập trung vào visual tương tác động. Không phù hợp cho báo cáo phân trang cố định.

  • ❌ Power BI Desktop
    Phương án sai vì Power BI Desktop dùng để tạo báo cáo tương tác (interactive reports) với visuals, dashboards, và DAX queries. Nó không hỗ trợ paginated reports (thiếu tính năng pixel-perfect layout và printing). Paginated reports yêu cầu công cụ riêng biệt để đảm bảo định dạng chính xác khi in/export.

  • ❌ the Power BI service
    Phương án sai vì Power BI service (powerbi.com) là nền tảng đám mây để publish, share, và xem báo cáo đã tạo sẵn. Nó hỗ trợ quản lý paginated reports sau khi publish từ Report Builder, nhưng không có giao diện authoring để xây dựng từ đầu. Không thể dùng để thiết kế báo cáo phân trang.

  • ✅ Power BI Report Builder
    Phương án đúng như đã giải thích ở trên. Đây là công cụ miễn phí, tải từ Microsoft, với giao diện drag-and-drop giống SSRS, hỗ trợ RDL format, và tích hợp trực tiếp với Power BI Premium workspaces. Phiên bản mới nhất (2026) còn thêm AI visuals và enhanced performance cho dữ liệu lớn.
    📘 Tài liệu tham khảo: Download Power BI Report Builder (cập nhật 2026).

Câu 267
Which scenario is an example of a streaming workload?
  1. A sending transactions that are older than a month to an archive
  2. B sending transactions daily from point of sale (POS) devices
  3. C sending telemetry data from edge devices
  4. D sending cloud infrastructure metadata every 30 minutes
Xem giải thích

🧩 Phân tích chi tiết câu hỏi trắc nghiệm

Câu hỏi gốc:
Which scenario is an example of a streaming workload?

📘 Giải thích nội dung câu hỏi:
Câu hỏi này tập trung vào khái niệm streaming workload (tải công việc streaming) trong lĩnh vực dữ liệu lớn và xử lý dữ liệu thời gian thực trên AWS. Streaming workload đề cập đến các tình huống mà dữ liệu được tạo ra liên tục, theo thời gian thực (real-time) với tần suất cao, yêu cầu xử lý ngay lập tức mà không cần lưu trữ batch (lô). Trong AWS (cập nhật đến năm 2026), các dịch vụ như Amazon Kinesis Data Streams, Amazon Kinesis Data Firehose, Amazon Managed Streaming for Apache Kafka (MSK) và AWS Lambda hỗ trợ xử lý streaming để phân tích dữ liệu IoT, log, telemetry ngay khi dữ liệu đến. Điều này khác biệt với batch processing (xử lý theo lô định kỳ). Câu hỏi kiểm tra khả năng phân biệt streaming (liên tục, low-latency) so với batch (định kỳ, high-latency).

✅ Đáp án đúng:
sending telemetry data from edge devices

🛠️ Lý do chọn đáp án đúng:
Telemetry data (dữ liệu đo lường từ thiết bị) từ edge devices (thiết bị biên như sensor IoT) thường được gửi liên tục và thời gian thực (real-time streaming), với tần suất cao (ví dụ: giây hoặc mili giây). Đây là ví dụ điển hình của streaming workload trên AWS, nơi dữ liệu được ingest qua Kinesis hoặc MSK để xử lý ngay lập tức, hỗ trợ ứng dụng như giám sát thiết bị công nghiệp hoặc xe tự lái. Theo tài liệu AWS mới nhất (2026), AWS IoT Core tích hợp trực tiếp với Kinesis cho streaming telemetry.

📋 Giải thích tất cả các phương án (đúng/sai)

  • ❌ sending transactions that are older than a month to an archive
    Phương án này SAI vì đây là quy trình archive dữ liệu cũ (batch processing), thường sử dụng Amazon S3 Glacier hoặc AWS Backup để lưu trữ lâu dài. Dữ liệu "older than a month" được xử lý theo lô định kỳ, không phải streaming thời gian thực.

  • ❌ sending transactions daily from point of sale (POS) devices
    Phương án này SAI vì giao dịch từ POS được gửi hàng ngày (daily batch), phù hợp với ETL tools như AWS Glue hoặc Amazon EMR. Đây không phải streaming vì có độ trễ cao (24 giờ), không xử lý real-time.

  • ✅ sending telemetry data from edge devices
    Phương án này ĐÚNG vì dữ liệu telemetry từ edge devices (như sensor) được gửi liên tục, real-time, lý tưởng cho streaming với Kinesis hoặc MSK. AWS khuyến nghị cho IoT workloads với low-latency processing.

  • ❌ sending cloud infrastructure metadata every 30 minutes
    Phương án này SAI vì metadata (dữ liệu mô tả hạ tầng đám mây) được gửi định kỳ 30 phút (periodic batch), thường qua Amazon CloudWatch Logs hoặc AWS Config. Độ trễ 30 phút không đáp ứng yêu cầu streaming real-time.

📚 Tài liệu tham khảo (AWS cập nhật 2026)

Hy vọng phân tích này giúp bạn nắm vững khái niệm! 🚀

Câu 268
A bar chart showing year-to-date sales by region is an example of which type of analytics?
  1. A predictive
  2. B prescriptive
  3. C descriptive
  4. D diagnostic
Xem giải thích

🎯 Phân tích câu hỏi trắc nghiệm về Loại Phân Tích Dữ Liệu (Analytics Types)

🧩 Nội dung câu hỏi được giải thích chi tiết:
Câu hỏi hỏi về loại phân tích dữ liệu (analytics) mà một biểu đồ cột (bar chart) hiển thị doanh số bán hàng từ đầu năm đến nay (year-to-date sales) theo từng khu vực (by region) thuộc về loại nào. Đây là khái niệm cơ bản trong phân tích dữ liệu, thường được phân loại thành 4 loại chính: descriptive (mô tả những gì đã xảy ra), diagnostic (giải thích tại sao xảy ra), predictive (dự đoán những gì sẽ xảy ra), và prescriptive (gợi ý hành động nên làm). Biểu đồ này chỉ tóm tắt dữ liệu quá khứ theo vùng địa lý, không phân tích nguyên nhân, dự đoán hay đề xuất, nên thuộc loại descriptive analytics. Khái niệm này được áp dụng rộng rãi trên các nền tảng đám mây như AWS (qua Amazon QuickSight, Amazon EMR, hoặc AWS Glue cho báo cáo dữ liệu).

✅ Đáp án đúng: descriptive
Lý do lựa chọn: Biểu đồ cột hiển thị doanh số YTD theo vùng chỉ mô tả những gì đã xảy ra (what happened) trong quá khứ, giúp người dùng xem tổng quan dữ liệu lịch sử một cách trực quan. Đây là đặc trưng cốt lõi của descriptive analytics, không đi sâu vào nguyên nhân hay dự đoán. Theo tài liệu AWS mới nhất (2024-2026), descriptive analytics là nền tảng đầu tiên trong chuỗi phân tích dữ liệu, thường dùng dashboard và visualization như QuickSight 📊.

📋 Giải thích chi tiết tất cả các phương án (sử dụng kiến thức AWS cập nhật đến 2026):

  • descriptive ✅ Đúng!
    Phương án này chính xác vì biểu đồ bar chart chỉ tóm tắt và hiển thị dữ liệu quá khứ (sales YTD by region) để trả lời câu hỏi "Điều gì đã xảy ra?". Trong AWS, descriptive analytics được hỗ trợ qua Amazon QuickSight hoặc Amazon Athena để tạo báo cáo và biểu đồ đơn giản, không cần mô hình ML phức tạp.

  • predictive ❌ Sai!
    Predictive analytics sử dụng mô hình machine learning (như Amazon SageMaker hoặc Amazon Forecast) để dự đoán tương lai (what will happen), ví dụ dự báo doanh số tháng sau dựa trên dữ liệu lịch sử. Biểu đồ này không dự đoán mà chỉ hiển thị dữ liệu đã có.

  • prescriptive ❌ Sai!
    Prescriptive analytics gợi ý hành động tối ưu (what should we do), thường kết hợp ML với optimization (như AWS Decision Optimization hoặc Amazon Personalize). Biểu đồ sales chỉ mô tả, không đưa ra khuyến nghị như "Tăng ngân sách cho vùng X".

  • diagnostic ❌ Sai!
    Diagnostic analytics phân tích nguyên nhân gốc rễ (why it happened), sử dụng drill-down, correlation analysis (qua AWS Glue hoặc Amazon QuickSight với ML insights). Biểu đồ này không giải thích "Tại sao vùng A bán tốt hơn?", chỉ hiển thị số liệu thô.

📘 Tài liệu tham khảo (cập nhật AWS 2024-2026):

  • AWS Big Data Analytics: What is Descriptive Analytics? 🛠️
  • AWS Well-Architected Framework - Data Analytics Lens: Phân loại 4 loại analytics (descriptive → diagnostic → predictive → prescriptive).
  • Amazon QuickSight User Guide (2026): Ví dụ visualization cho descriptive analytics.
  • AWS Certified Data Engineer - Associate Exam Guide: Nội dung về analytics types (không thay đổi cơ bản đến 2026).

Hy vọng phân tích này giúp bạn nắm vững khái niệm! 🚀 Nếu cần thêm ví dụ AWS, hãy hỏi nhé!

Câu 269
You need to perform hybrid transactional and analytical processing (HTAP) queries against Azure Cosmos DB data sources by using Azure Synapse Analytics.
What should you use?
  1. A Synapse pipelines
  2. B a Synapse SQL pool
  3. C Synapse Link
  4. D Synapse Studio
Xem giải thích

🧩 Phân tích nội dung câu hỏi

Câu hỏi tập trung vào việc thực hiện các truy vấn hybrid transactional and analytical processing (HTAP) trên dữ liệu nguồn từ Azure Cosmos DB bằng cách sử dụng Azure Synapse Analytics.
✅ HTAP là khái niệm cho phép xử lý đồng thời giao dịch (OLTP - Online Transaction Processing) và phân tích (OLAP - Online Analytical Processing) trên cùng một bộ dữ liệu, mà không cần sao chép dữ liệu, giúp giảm độ trễ và tăng hiệu suất.
🛠️ Ở đây, người dùng cần một công cụ/cơ chế cụ thể trong Azure Synapse để kết nối trực tiếp với Cosmos DB, hỗ trợ truy vấn HTAP mà không ảnh hưởng đến hiệu suất giao dịch gốc.
📘 Phiên bản cập nhật mới nhất (đến 2026): Azure Synapse Link vẫn là giải pháp chính thức cho HTAP với Cosmos DB, được Microsoft hỗ trợ đầy đủ trong các bản cập nhật Synapse Analytics (bao gồm integration với Fabric và Serverless SQL pools).

Lý do lựa chọn:
Synapse Link là dịch vụ liên kết trực tiếp (zero-ETL) giữa Azure Cosmos DB và Azure Synapse Analytics, cho phép thực hiện truy vấn HTAP thời gian thực. Nó tạo ra một analytical store song song với transactional store của Cosmos DB, giúp chạy các truy vấn phân tích phức tạp (như SQL analytics) mà không làm gián đoạn hoạt động giao dịch. Điều này hoàn toàn phù hợp với yêu cầu câu hỏi.
🧩 Ưu điểm nổi bật: Hỗ trợ continuous sync dữ liệu, scale độc lập, và tích hợp với Synapse Spark/SQL pools.
📘 Nguồn tham khảo:

📋 Giải thích tất cả các phương án

Dưới đây là phân tích chi tiết từng lựa chọn, giữ nguyên văn bản gốc bằng tiếng Anh:

  • Synapse pipelines
    ❌ Sai: Synapse pipelines là công cụ ETL/ELT (Extract, Transform, Load) để di chuyển và biến đổi dữ liệu giữa các nguồn, không hỗ trợ HTAP trực tiếp trên Cosmos DB. Nó yêu cầu sao chép dữ liệu thủ công, dẫn đến độ trễ cao và không phải là giải pháp zero-ETL cho truy vấn lai giao dịch-phân tích.

  • a Synapse SQL pool
    ❌ Sai: Synapse SQL pool (Dedicated SQL pool) là kho dữ liệu phân tán dành cho phân tích lớn (OLAP), nhưng không kết nối trực tiếp với Cosmos DB cho HTAP. Nó cần dữ liệu được load trước qua pipelines hoặc copy activity, không hỗ trợ truy vấn thời gian thực trên transactional data mà không sao chép.

  • Synapse Link
    ✅ Đúng: Như đã giải thích ở trên, đây là lựa chọn chính xác vì nó kích hoạt HTAP bằng cách liên kết analytical store với Cosmos DB, cho phép truy vấn Synapse SQL/Spark trực tiếp trên dữ liệu giao dịch mà không cần ETL truyền thống.

  • Synapse Studio
    ❌ Sai: Synapse Studio chỉ là giao diện web IDE để phát triển, quản lý và giám sát các tài nguyên Synapse (như notebooks, pipelines), không phải công cụ thực hiện HTAP. Nó là "môi trường làm việc" chứ không phải tính năng cốt lõi cho truy vấn dữ liệu Cosmos DB.

Câu 270
You need to create a visualization of running sales totals per quarter as shown in the following exhibit.

What should you create in Power BI Desktop?
  1. A a waterfall chart
  2. B a ribbon chart
  3. C a bar chart
  4. D a decomposition tree
Xem giải thích

🧩 Phân tích chi tiết nội dung câu hỏi

Câu hỏi yêu cầu tạo một biểu đồ trực quan hóa (visualization) trong Power BI Desktop để hiển thị tổng doanh số bán hàng tích lũy (running sales totals) theo từng quý (per quarter), giống như hình ảnh minh họa.

📊 Mô tả hình ảnh đính kèm (dựa trên phân tích kỹ lưỡng):

  • Tiêu đề biểu đồ: "Sales by Year and Quarter".
  • Trục hoành (X): Các quý theo thời gian từ "2013 Q3" → "2013 Q4" → "2014 Q1" → "2014 Q2" → "2014 Q3" → "2014 Q4" → "Total".
  • Trục tung (Y): Giá trị doanh số từ 0M đến 120M.
  • Phong cách biểu đồ: Các cột (bars) kết nối liên tiếp nhau tạo thành hình bậc thang tăng dần, với:
    • Màu xanh lá (Increase): Đại diện cho sự tăng trưởng ở hầu hết các quý (ví dụ: từ quý 2013 Q3 thấp lên cao dần).
    • Màu đỏ (Decrease): Có thể có ở một số điểm giảm nhẹ (dựa trên mô tả hình, có cột nhỏ ở đầu).
    • Màu xanh dương (Total): Cột cuối cùng cao nhất, thể hiện tổng tích lũy.
  • Đặc trưng nổi bật: Đây là biểu đồ waterfall (thác nước), nơi mỗi cột thể hiện sự thay đổi tích lũy so với trước (tăng/giảm), dẫn đến tổng cuối cùng. Nó không phải là cột rời rạc hay đường cong, mà nối liền để show running total – phù hợp với yêu cầu "running sales totals per quarter".

Mục tiêu: Chọn loại visualization chuẩn trong Power BI để tái tạo chính xác hình này. (Kiến thức Power BI cập nhật đến 2026: Waterfall chart vẫn là visual built-in mạnh mẽ cho phân tích variance/decomposition, theo Microsoft Power BI docs phiên bản mới nhất).

✅ Đáp án đúng: a waterfall chart

Lý do lựa chọn:
🛠️ Waterfall chart trong Power BI được thiết kế chuyên biệt để hiển thị running totals hoặc sự phân tích biến động (variance analysis) theo thời gian, với các cột tự động kết nối thể hiện tăng (increase - màu xanh), giảm (decrease - màu đỏ), và tổng cuối (total - màu khác). Hình ảnh khớp 100%: Các cột bậc thang từ thấp đến cao, tích lũy doanh số quý, kết thúc bằng "Total". Đây là lựa chọn tối ưu và chính xác nhất cho "running sales totals per quarter".
📘 Nguồn tham khảo: Microsoft Docs - Create a waterfall chart (Power BI) (cập nhật 2025-2026, hỗ trợ auto-coloring cho increase/decrease/total).

❌ Giải thích tất cả các phương án

  • a waterfall chart ✅:
    🟢 Đúng vì biểu đồ này chuyên dùng cho running totals với variance, khớp hoàn hảo hình ảnh (cột nối, màu tăng/giảm/total). Không visual nào khác tái tạo chính xác như vậy.

  • a ribbon chart ❌:
    🔴 Sai vì ribbon chart dùng để so sánh thứ hạng (rank) theo thời gian với các dải ruy băng uốn lượn (ribbons) nối các điểm, nhấn mạnh xếp hạng thay đổi (ví dụ: top products). Hình ảnh không có ruy băng uốn, chỉ là cột thẳng nối tích lũy – không phù hợp cho running totals.

  • a bar chart ❌:
    🔴 Sai vì bar chart chỉ là cột đơn giản, rời rạc để so sánh giá trị tuyệt đối, không có kết nối tích lũy hay tự động phân biệt tăng/giảm. Hình ảnh có nối liền bậc thang và màu variance, bar chart không làm được điều này mặc định.

  • a decomposition tree ❌:
    🔴 Sai vì decomposition tree là cây phân tích phân cấp (drill-down) tương tác, dùng để phân tích nguyên nhân (what-if analysis) qua các cấp độ (ví dụ: từ total → category → sub). Nó dạng cây động, không phải biểu đồ tĩnh theo thời gian như hình (linear quarters với running total).

🧩 Kết luận: Waterfall chart là giải pháp chuẩn Azure Data Fundamentals cho visualization doanh số tích lũy trong Power BI, giúp phân tích xu hướng quý một cách trực quan! 🚀