Ngân hàng đề — Microsoft Azure Data Scientist
Tìm thấy 313 câu.
You plan to use assets defined in proj1 to create a pipeline in the Machine Learning studio designer.
You need to set the Registry name filter to display only the list of assets defined in proj1.
What should you set the Registry name filter to?
- A proj1
- B azureml-meta
- C azureml
- D workspace
Xem giải thích
🧩 Phân tích chi tiết nội dung câu hỏi
Câu hỏi tập trung vào Azure Machine Learning (Azure ML), cụ thể là quy trình quản lý và sử dụng assets (như components, datasets, models) trong Azure ML Studio Designer.
- Bạn đang quản lý một workspace tên là proj1.
- Mục tiêu: Sử dụng các assets đã định nghĩa trong proj1 để tạo một pipeline trong Machine Learning studio designer.
- Yêu cầu cụ thể: Thiết lập Registry name filter (bộ lọc tên Registry) để chỉ hiển thị danh sách assets từ proj1, tránh hiển thị assets từ các registry khác hoặc workspace khác.
🛠️ Bối cảnh kỹ thuật: Trong Azure ML (phiên bản cập nhật đến năm 2026, theo tài liệu Microsoft Learn mới nhất), Registry là nơi lưu trữ và chia sẻ assets (components, models, environments, datasets) giữa các workspace. Mỗi workspace có một built-in registry với tên trùng với tên workspace (ở đây là proj1). Khi thiết kế pipeline trong Studio Designer, bạn truy cập Asset Catalog và sử dụng Registry name filter để lọc assets từ registry cụ thể. Điều này giúp tránh nhầm lẫn với assets từ global registries (như azureml) hoặc metadata stores cũ.
📘 Nguồn tham khảo:
- Microsoft Learn: Use components in a pipeline in the designer (cập nhật 2024-2026).
- Azure ML Asset Registry Documentation.
✅ Đáp án đúng và lý do lựa chọn
Đáp án đúng: proj1
Lý do: Registry name filter phải được đặt chính xác bằng tên workspace (proj1) để hiển thị chỉ các assets được định nghĩa và lưu trữ trong registry built-in của workspace đó. Azure ML tự động tạo registry với tên trùng workspace, giúp Designer lọc và tải assets cục bộ một cách chính xác, an toàn và hiệu quả. Đây là cách chuẩn theo best practices mới nhất (2026), tránh tải assets từ nguồn bên ngoài không mong muốn.
🔍 Giải thích tất cả các phương án (đúng và sai)
-
✅ proj1
Phương án đúng. Như đã giải thích, tên registry built-in của workspace proj1 chính là proj1. Đặt filter này sẽ hiển thị duy nhất assets từ workspace hiện tại, phù hợp hoàn hảo với yêu cầu tạo pipeline trong Designer. ✅ Hoàn toàn khớp với tài liệu Azure ML. -
❌ azureml-meta
Phương án sai. azureml-meta đề cập đến metadata store cũ (Azure ML Metadata Store) từ các phiên bản legacy (trước 2021), không còn được sử dụng để lọc assets trong Designer hiện đại. Filter này sẽ không hiển thị assets từ proj1 và có thể gây lỗi hoặc hiển thị dữ liệu không liên quan. ❌ Không áp dụng cho Azure ML v2+ (2026). -
❌ azureml
Phương án sai. azureml là global registry công khai của Microsoft, chứa các components mẫu và assets chia sẻ toàn cầu (như pre-built models). Đặt filter này sẽ hiển thị hàng nghìn assets chung, không lọc được assets cụ thể từ proj1, dẫn đến nhầm lẫn khi thiết kế pipeline. ❌ Không phải registry cục bộ của workspace. -
❌ workspace
Phương án sai. workspace chỉ là từ khóa chung chỉ môi trường làm việc, không phải tên registry cụ thể. Filter này không tồn tại hoặc không hiệu quả trong Designer, sẽ không lọc chính xác assets từ proj1 mà có thể hiển thị tất cả hoặc không hiển thị gì. ❌ Thiếu tính cụ thể, vi phạm quy tắc naming convention của Azure ML.
You need to verify that the column1 values are normally distributed.
Which statistic should you use?
- A Max
- B Type
- C Profile
- D Mean
Xem giải thích
🧩 Phân tích chi tiết nội dung câu hỏi
Câu hỏi tập trung vào Azure Machine Learning studio (một công cụ trực quan của Microsoft Azure dành cho các nhà khoa học dữ liệu). Bạn đang phân tích một tập dữ liệu chứa một cột số thập phân tên là column1, và nhiệm vụ là xác minh xem các giá trị trong cột column1 có phân phối chuẩn (normally distributed) hay không.
Phân phối chuẩn là một khái niệm thống kê quan trọng, nơi dữ liệu tập trung quanh giá trị trung bình với hình chuông đối xứng (bell-shaped curve). Để kiểm tra điều này trong Azure ML Studio, bạn cần một thống kê (statistic) phù hợp giúp visualize hoặc tính toán các đặc trưng như histogram, skewness, kurtosis, hoặc các bài kiểm tra normality (như Shapiro-Wilk test). Azure ML Studio cung cấp các công cụ phân tích dữ liệu cơ bản qua giao diện notebook hoặc designer, và câu hỏi yêu cầu chọn statistic chính xác nhất để verify normality.
📘 Dẫn nguồn tham khảo:
- Tài liệu chính thức Azure Machine Learning (cập nhật đến 2026): Azure ML Studio Data Profiling và Explore data in Azure ML.
- Hướng dẫn kiểm tra phân phối: Data visualization in Azure ML.
✅ Đáp án đúng: Profile
Lý do lựa chọn: Trong Azure Machine Learning studio, Profile là thống kê chính xác nhất để xác minh phân phối chuẩn. Khi chọn "Profile" cho một cột dữ liệu (như column1), studio sẽ tự động tạo ra histogram, box plot, thống kê mô tả (mean, median, std, skewness, kurtosis) và các biểu đồ visualize khác. Những yếu tố này giúp đánh giá trực quan và định lượng xem dữ liệu có tuân theo phân phối chuẩn không (ví dụ: histogram đối xứng, skewness gần 0). Đây là tính năng cốt lõi của Data Profiling trong Azure ML (phiên bản mới nhất 2026 vẫn giữ nguyên và cải tiến với AI insights). 🛠️ Hoàn hảo cho nhiệm vụ verify normality!
📋 Giải thích tất cả các phương án (đúng và sai)
Dưới đây là phân tích từng lựa chọn một cách chi tiết:
-
Max ❌
Sai: "Max" chỉ hiển thị giá trị lớn nhất (maximum value) trong cột column1. Nó không cung cấp bất kỳ thông tin nào về hình dạng phân phối (như độ lệch hay độ nhọn), nên không thể dùng để verify phân phối chuẩn. Chỉ là một con số đơn lẻ, thiếu visualize hoặc kiểm tra toàn diện! -
Type ❌
Sai: "Type" chỉ cho biết kiểu dữ liệu (data type) của cột, ví dụ decimal/float. Đây không phải là statistic thống kê mà chỉ là metadata cơ bản. Hoàn toàn không liên quan đến việc kiểm tra phân phối chuẩn, vì kiểu dữ liệu không nói gì về hình dạng dữ liệu! -
Profile ✅
Đúng: Như đã giải thích ở trên, Profile cung cấp bộ công cụ đầy đủ nhất trong Azure ML Studio để visualize và phân tích phân phối, bao gồm histogram và các chỉ số thống kê cần thiết cho normality test. Đây là lựa chọn tối ưu theo best practices của Microsoft (cập nhật 2026). 🏆 -
Mean ❌
Sai: "Mean" chỉ tính giá trị trung bình (average) của cột column1. Mặc dù mean là một phần của phân phối chuẩn, nhưng chỉ một giá trị này thôi không đủ để verify toàn bộ phân phối (ví dụ: dữ liệu có thể lệch phải dù mean tồn tại). Thiếu histogram hoặc kiểm tra khác, nên không phù hợp!
🧠 Lời khuyên từ Azure Data Scientist: Để kiểm tra normality nâng cao hơn, kết hợp Profile với Python code trong notebook (như scipy.stats.normaltest hoặc QQ-plot). Nếu dữ liệu lớn, dùng Azure ML's automated ML để detect distribution tự động! 🚀
The serverless compute must have a specific instance type and count.
You need to configure the serverless compute by using Azure Machine Learning Python SDK v2.
What should you do?
- A Specify the compute name by using the compute parameter of the command job.
- B Configure the tier parameter to Dedicated VM.
- C Initialize and specify the ResourceConfiguration class.
- D Initialize AmiCompute class with size and type specification.
Xem giải thích
🧩 Phân tích chi tiết câu hỏi trắc nghiệm
📘 Nội dung câu hỏi:
Câu hỏi tập trung vào việc quản lý một Azure Machine Learning workspace và thiết kế một training job sử dụng serverless compute. Serverless compute là loại tài nguyên tính toán được quản lý hoàn toàn bởi Azure, không cần người dùng quản lý hạ tầng, nhưng yêu cầu chỉ định specific instance type (loại instance cụ thể, ví dụ: Standard_DS3_v2) và count (số lượng instance). Nhiệm vụ là cấu hình serverless compute này bằng Azure Machine Learning Python SDK v2 (phiên bản mới nhất hỗ trợ các tính năng serverless compute từ năm 2023 và cập nhật đến 2026 với các cải tiến về resource configuration linh hoạt hơn).
🛠️ Mục tiêu chính: Tìm cách đúng để chỉ định instance type và count cho serverless compute trong job training, đảm bảo job chạy hiệu quả mà không cần tạo compute cluster thủ công.
✅ Đáp án đúng:
Initialize and specify the ResourceConfiguration class.
Lý do lựa chọn (bằng kiến thức Azure ML SDK v2 mới nhất đến 2026):
Trong Azure ML Python SDK v2, để cấu hình serverless compute với instance type và count cụ thể cho các job như command job hoặc pipeline, bạn phải khởi tạo lớp ResourceConfiguration từ module azure.ai.ml.compute. Ví dụ:
from azure.ai.ml.compute import ResourceConfiguration
resource_config = ResourceConfiguration(instance_type="Standard_DS3_v2", instance_count=2)
job = command(..., resources=resource_config)
Điều này cho phép Azure tự động scale và quản lý serverless compute mà không cần compute target cố định. Tính năng này được tối ưu hóa từ bản cập nhật 2024-2026, hỗ trợ autoscaling và spot instances cho serverless. Đây là cách chính thức, linh hoạt nhất theo docs mới nhất.
🔍 Giải thích tất cả các phương án (đúng/sai)
-
❌ [SAI] Specify the compute name by using the compute parameter of the command job.
Phương án này sai vì tham sốcomputetrong command job chỉ dùng để chỉ định tên của một compute target đã tồn tại (như AmlCompute cluster hoặc managed compute), không hỗ trợ cấu hình serverless compute với instance type/count trực tiếp. Serverless compute không cần tên compute cụ thể mà dùng resource config động. Sử dụng cách này sẽ dẫn đến lỗi nếu không có compute target phù hợp. -
❌ [SAI] Configure the tier parameter to Dedicated VM.
Phương án này sai vì không tồn tại tham sốtiercho serverless compute trong Azure ML SDK v2. Serverless compute là managed serverless tier mặc định, không hỗ trợ "Dedicated VM" (dành cho compute truyền thống như VM scaleset). Việc cố cấu hình tier như vậy sẽ gây lỗi validation, vì serverless ưu tiên auto-provisioning thay vì dedicated resources. -
✅ [ĐÚNG] Initialize and specify the ResourceConfiguration class.
Như đã giải thích ở trên, đây là cách đúng chuẩn. Lớp ResourceConfiguration cho phép chỉ định chính xácinstance_typevàinstance_countcho serverless compute, tích hợp trực tiếp vào job definition (command, sweep, etc.). Hỗ trợ đầy đủ từ SDK v2.0+ (cập nhật 2026 bao gồm GPU/ND-series cho serverless). -
❌ [SAI] Initialize AmiCompute class with size and type specification.
Phương án này sai vì AmiCompute là lớp cũ từ SDK v1, dùng cho Azure Machine Learning Interpreted AMI (không còn được khuyến nghị từ 2023). Trong SDK v2, AmiCompute không hỗ trợ serverless compute và không dùng để chỉ định size/type cho job hiện đại. Sử dụng sẽ deprecated hoặc lỗi, thay vào đó dùng ResourceConfiguration cho tất cả compute types mới.
📚 Tài liệu tham khảo (cập nhật mới nhất đến 2026)
- Azure ML Python SDK v2 - ResourceConfiguration: learn.microsoft.com/en-us/python/api/azure-ai-ml/azure.ai.ml.compute.resourceconfiguration – Hướng dẫn chính thức cấu hình serverless.
- Command Job với Serverless Compute: learn.microsoft.com/en-us/azure/machine-learning/how-to-serverless-compute – Ví dụ code SDK v2 và best practices 2026.
- Migration từ SDK v1 sang v2: learn.microsoft.com/en-us/azure/machine-learning/migrate-sdk-v1-to-v2 – Giải thích tại sao AmiCompute không dùng nữa.
Hy vọng phân tích này giúp bạn nắm vững Azure ML serverless compute! 🚀 Nếu cần ví dụ code đầy đủ, hãy hỏi thêm nhé!
You must create and configure a compute cluster for a training job by using Python SDK v2.
You need to create a persistent Azure Machine Learning compute resource, specifying the fewest possible properties.
Which two properties should you define? Each correct answer presents part of the solution.
NOTE: Each correct selection is worth one point.
- A size
- B win_instances
- C type
- D name
- E max_instances
Xem giải thích
🧩 Phân tích nội dung câu hỏi
Câu hỏi thuộc chủ đề Azure Machine Learning (Azure ML), tập trung vào việc sử dụng Python SDK v2 (azure-ai-ml package phiên bản mới nhất đến năm 2026) để tạo và cấu hình một compute cluster (tài nguyên tính toán) cho công việc huấn luyện mô hình (training job).
✅ Yêu cầu chính:
- Tạo một persistent compute resource (tài nguyên tính toán bền vững, tức là compute cluster có thể tái sử dụng, không phải compute instance tạm thời).
- Sử dụng ít thuộc tính (properties) nhất có thể khi định nghĩa compute cluster trong SDK v2.
- Đây là câu hỏi multi-select (chọn nhiều đáp án), với hai thuộc tính đúng tạo thành giải pháp hoàn chỉnh. Mỗi đáp án đúng chiếm 1 điểm.
🛠️ Ngữ cảnh kỹ thuật (dựa trên Azure ML SDK v2 mới nhất - version 1.17+ đến 2026):
- Compute cluster được tạo qua class
AmlComputetrongazure.ai.ml.entities. - Khi gọi
ml_client.compute.begin_create_or_update(compute), bạn cần định nghĩa entityAmlComputevới các thuộc tính tối thiểu để cluster persistent (hỗ trợ scale up/down, idle shutdown). - Các thuộc tính mặc định:
type="amlcompute",min_instances=0,tier="Dedicated"(hoặc "Serverless" ở version mới, nhưng persistent yêu cầu Dedicated). - Mục tiêu: Chỉ định fewest properties để SDK tự động xử lý phần còn lại (như name có thể được infer từ context hoặc parameter riêng).
📘 Tài liệu tham khảo:
- Azure ML Python SDK v2 - AmlCompute (cập nhật 2025-2026).
- Tạo compute cluster với ít config nhất (version SDK v2).
✅ Đáp án đúng và lý do lựa chọn
Hai thuộc tính bắt buộc phải định nghĩa với fewest possible properties để tạo persistent compute cluster là: size và max_instances.
🧩 Lý do chi tiết:
- size: Chỉ định loại VM (ví dụ: "STANDARD_DS3_V2") - thuộc tính required tối thiểu để xác định hardware cho cluster. Không có size, SDK không thể provision instance.
- max_instances: Quy định số instance tối đa cluster có thể scale lên (ví dụ: 4) - bắt buộc cho persistent cluster để hỗ trợ auto-scaling và tránh over-provisioning. Với min_instances mặc định=0, đây là cặp đôi hoàn chỉnh cho config đơn giản nhất.
- Tại sao fewest? SDK v2 tự infer name (từ argument create), type="amlcompute", tier="Dedicated". Chỉ cần size + max_instances là cluster persistent sẵn sàng cho training job.
🔍 Giải thích tất cả các phương án
Dưới đây là phân tích từng lựa chọn (giữ nguyên text gốc tiếng Anh), đánh dấu ✅ đúng hoặc ❌ sai, kèm lý do bằng tiếng Việt dựa trên SDK v2 mới nhất:
-
size ✅ Đúng. Đây là thuộc tính bắt buộc trong constructor
AmlCompute(name, size=...). Nó định nghĩa kích thước VM (SKU) cho tất cả instance trong cluster, ví dụsize="STANDARD_DS3_V2". Không chỉ định size, việc create sẽ fail với lỗi validation. -
win_instances ❌ Sai. Không tồn tại thuộc tính này trong Azure ML SDK v2. Có thể nhầm với "Windows instances" ở các dịch vụ khác (như EC2 AWS), nhưng Azure ML dùng Linux primary tier cho ML workloads. Persistent cluster không cần specify OS instances riêng.
-
type ❌ Sai. Thuộc tính
typemặc định là"amlcompute"cho compute cluster và không bắt buộc chỉ định khi tạo persistent resource. SDK v2 tự động set dựa trên entityAmlCompute. -
name ❌ Sai.
namelà required nhưng được truyền như parameter chính trongml_client.compute.begin_create_or_update(name="mycluster", compute=...), không phải property bên trongAmlComputeobject. Với fewest properties trong entity, name không nằm trong danh sách cần define thêm. -
max_instances ✅ Đúng. Thuộc tính bắt buộc cho persistent scaling trong
AmlCompute(..., max_instances=4). Nó kiểm soát upper bound scale (kết hợp min_instances=0 mặc định), đảm bảo cluster bền vững cho training jobs lớn mà không tốn kém. Version 2026 hỗ trợ dynamic scaling dựa trên này.
You plan to create a pipeline in the Azure Machine Learning Studio designer. The pipeline must include a custom component.
You need to ensure the custom component can be used in the pipeline.
What should you do first?
- A Create a pipeline endpoint.
- B Add a linked service to Workspace1.
- C Upload a .json file to Workspace1.
- D Create a datastore.
- E Upload a .yaml file to Workspace1.
Xem giải thích
🧩 Phân tích chi tiết nội dung câu hỏi
Câu hỏi tập trung vào Azure Machine Learning (Azure ML), cụ thể là việc quản lý một workspace tên Workspace1. Bạn đang lập kế hoạch tạo một pipeline trong Azure Machine Learning Studio designer (giao diện kéo-thả để thiết kế pipeline ML), và pipeline này phải bao gồm một custom component (thành phần tùy chỉnh do người dùng tự định nghĩa, không phải component sẵn có của Azure).
Mục tiêu là đảm bảo custom component có thể được sử dụng trong pipeline, và câu hỏi yêu cầu hành động đầu tiên (what should you do first?) cần thực hiện.
🛠️ Bối cảnh kỹ thuật: Trong Azure ML (phiên bản mới nhất đến năm 2026, dựa trên Azure ML v2), custom components được sử dụng để mở rộng khả năng của designer pipelines. Chúng được định nghĩa bằng file YAML (không phải JSON), mô tả chi tiết về command chạy, môi trường Docker, inputs/outputs, v.v. Để sử dụng trong designer, bạn phải đăng ký (register) component vào workspace trước, và bước đầu tiên là upload file YAML vào phần Assets > Custom components của workspace.
📘 Tài liệu tham khảo:
- Microsoft Docs: Create and use custom components (cập nhật 2024-2026).
- Azure ML Designer custom components.
✅ Đáp án đúng: Upload a .yaml file to Workspace1.
Lý do lựa chọn:
- Đây là bước đầu tiên và bắt buộc để đăng ký custom component vào Azure ML workspace. File YAML chứa định nghĩa đầy đủ của component (interface, implementation, metadata). Sau khi upload, component sẽ xuất hiện trong thư viện của Studio designer, sẵn sàng kéo-thả vào pipeline.
- Không có bước nào trước đó cần thiết hơn; upload YAML trực tiếp kích hoạt registration và validation tự động.
- Theo docs Azure ML v2 (2026), đây là phương pháp chuẩn cho designer pipelines.
❌ Giải thích tất cả các phương án
-
Create a pipeline endpoint.
❌ Sai: Pipeline endpoint dùng để deploy và quản lý pipeline như một endpoint REST (cho inference hoặc batch), không liên quan đến việc thêm custom component vào designer. Bạn chỉ tạo endpoint sau khi pipeline hoàn chỉnh, không phải bước đầu. -
Add a linked service to Workspace1.
❌ Sai: Linked service (liên kết dịch vụ) dùng để kết nối dữ liệu từ nguồn ngoài như Azure Synapse hoặc Power BI, không hỗ trợ đăng ký custom components. Đây là cho data integration, không phải component authoring. -
Upload a .json file to Workspace1.
❌ Sai: File JSON có thể dùng cho datasets, environments hoặc models, nhưng custom components yêu cầu định nghĩa YAML chuẩn (theo schema CLI v2). Upload JSON sẽ không tạo component hợp lệ trong designer. -
Create a datastore.
❌ Sai: Datastore dùng để lưu trữ và truy cập dữ liệu (như Blob Storage), cần thiết cho data inputs của pipeline nhưng không đăng ký custom components. Component cần YAML riêng biệt. -
Upload a .yaml file to Workspace1.
✅ Đúng (như đã giải thích ở trên): Bước đầu tiên chính xác để register và sử dụng custom component trong pipeline designer.
🧩 Tóm tắt: Tập trung vào YAML để mở rộng designer một cách linh hoạt! Nếu cần code mẫu YAML, tham khảo docs Microsoft nhé. 🚀
You must perform a data analysis for differential privacy by using the SmartNoise SDK.
You need to measure the distribution of reports for repeated queries to ensure that they are balanced.
Which type of test should you perform?
- A Bias
- B Privacy
- C Accuracy
- D Utility
Xem giải thích
🧩 Phân tích chi tiết nội dung câu hỏi
Câu hỏi tập trung vào tình huống thực tế trong Azure Machine Learning workspace, nơi bạn có một bộ dữ liệu (dataset) cần phân tích để áp dụng differential privacy (quyền riêng tư vi phân) bằng SmartNoise SDK – một thư viện mã nguồn mở của Microsoft hỗ trợ bảo vệ dữ liệu nhạy cảm thông qua việc thêm nhiễu (noise) vào truy vấn.
📌 Yêu cầu cụ thể: Bạn cần đo lường phân bố (distribution) của các báo cáo (reports) từ các truy vấn lặp lại (repeated queries) để đảm bảo chúng cân bằng (balanced). Điều này nhằm kiểm tra xem cơ chế thêm nhiễu có làm lệch phân bố kết quả không, giúp duy trì tính công bằng và độ tin cậy của phân tích dữ liệu riêng tư.
🛠️ Bối cảnh kỹ thuật: SmartNoise SDK (phiên bản mới nhất đến 2026, tích hợp chặt chẽ với Azure ML và OpenDP framework) cung cấp các công cụ kiểm tra (tests) chuyên biệt cho differential privacy, bao gồm việc mô phỏng truy vấn nhiều lần để đánh giá chất lượng nhiễu.
✅ Đáp án đúng và lý do lựa chọn
Đáp án đúng: Bias
Lý do: Trong SmartNoise SDK, Bias test chính là công cụ được thiết kế để đo lường phân bố của báo cáo từ các truy vấn lặp lại, đảm bảo chúng cân bằng và không bị lệch (balanced distribution). Test này chạy nhiều truy vấn giống nhau với nhiễu khác nhau, sau đó kiểm tra histogram của kết quả để phát hiện bias (sự thiên lệch) do nhiễu gây ra. Nếu phân bố không cân bằng, có thể điều chỉnh tham số nhiễu (như epsilon, delta) để đạt differential privacy mà không làm méo mó dữ liệu. Đây là bước quan trọng trong quy trình đánh giá utility của mô hình privacy.
📋 Giải thích tất cả các phương án
Dưới đây là phân tích từng lựa chọn, giữ nguyên nội dung gốc bằng tiếng Anh, kèm giải thích chi tiết bằng tiếng Việt:
-
Bias
✅ Đúng. Như đã giải thích, Bias test đo lường sự cân bằng của phân bố báo cáo từ repeated queries. Nó sử dụng thống kê (như chi-square test) để kiểm tra xem nhiễu có tạo ra distribution uniform/balanced không, phù hợp chính xác với yêu cầu câu hỏi. Trong SmartNoise (v2.x+ đến 2026), đây là test mặc định cho việc validate balance sau khi thêm nhiễu Gaussian/Laplace. -
Privacy
❌ Sai. Privacy test tập trung vào việc xác nhận mức độ bảo vệ quyền riêng tư (ví dụ: kiểm tra epsilon-budget, delta leakage qua moments accountant), chứ không đo distribution của reports. Nó mô phỏng tấn công để kiểm tra rò rỉ dữ liệu cá nhân, không liên quan đến sự cân bằng của repeated queries. -
Accuracy
❌ Sai. Accuracy test đánh giá độ chính xác tổng thể của truy vấn (so sánh kết quả noisy vs. true values, thường dùng metrics như MSE hoặc histogram overlap). Nó không đặc biệt kiểm tra distribution balance của repeated reports, mà chỉ xem nhiễu có làm giảm accuracy utility bao nhiêu. -
Utility
❌ Sai. Utility test là loại test tổng quát đánh giá giá trị sử dụng của dữ liệu sau privacy (bao gồm accuracy, coverage, fidelity), nhưng không phải là test cụ thể để đo distribution balance của repeated queries. Utility thường là umbrella term, trong khi Bias là sub-test chuyên biệt hơn trong SmartNoise.
📘 Tài liệu tham khảo
- Tài liệu chính thức Microsoft SmartNoise SDK (cập nhật 2026): Azure ML - SmartNoise Differential Privacy – Chi tiết về các tests (Bias, Privacy, etc.).
- GitHub OpenDP/SmartNoise: SmartNoise Systems – Mã nguồn và examples cho Bias test với repeated queries.
- Azure ML Docs: Differential Privacy in Azure – Hướng dẫn tích hợp workspace đến phiên bản 2026.
Hy vọng phân tích này giúp bạn nắm vững! 🚀 Nếu cần code sample Azure ML với SmartNoise, hãy cho tôi biết nhé!
You plan to run the same Spark session every 40 minutes. Each session runs for 15 minutes.
During testing, you observe a 15-minute delay at the start of the Spark sessions.
You need to reduce the delay to less than 1 minute.
What should you do?
- A Configure the session timeout to be 25 minutes.
- B Increase the number of nodes to 16.
- C Enable dynamically allocated executors.
- D Enable an isolated compute.
Xem giải thích
🧩 Phân tích chi tiết câu hỏi trắc nghiệm
📖 Nội dung câu hỏi được giải thích rõ ràng:
Câu hỏi xoay quanh tình huống trong Azure Machine Learning (Azure ML) workspace với tài nguyên tính toán serverless Spark compute. Bạn dự định chạy một Spark session giống nhau mỗi 40 phút, và mỗi session chỉ chạy 15 phút. Trong quá trình testing, bạn nhận thấy có độ trễ 15 phút ngay từ lúc bắt đầu mỗi session (cold start delay do tài nguyên chưa sẵn sàng).
Mục tiêu: Giảm độ trễ này xuống dưới 1 phút để session khởi động nhanh chóng, tận dụng tính serverless (không quản lý cluster thủ công).
🛠️ Vấn đề cốt lõi: Serverless Spark trong Azure ML có thời gian khởi tạo (init time) dài nếu compute ở trạng thái idle hoặc cold. Với chu kỳ 40 phút (chạy 15 phút → idle 25 phút), cần cấu hình để giữ compute warm (sẵn sàng) trong thời gian idle, tránh cold start mỗi lần.
(Kiến thức cập nhật đến 2026: Theo Azure ML version mới nhất, serverless Spark pools hỗ trợ tối ưu cold start qua session/pool timeout, tương tự Synapse Spark integration).
✅ Đáp án đúng:
Configure the session timeout to be 25 minutes.
Lý do lựa chọn (chi tiết):
- Mỗi session chạy 15 phút, sau đó idle 25 phút trước session tiếp theo (40 - 15 = 25 phút).
- Mặc định, serverless Spark session timeout ngắn (thường ~0-10 phút tùy config), dẫn đến compute shutdown và cold start ~15 phút.
- Set session timeout = 25 phút sẽ giữ compute warm suốt idle time (25 phút), chỉ shutdown ngay trước/sau session mới, giảm delay xuống <1 phút (warm start gần như tức thì).
- Đây là giải pháp tối ưu cho lịch chạy định kỳ, theo best practices Azure ML Spark serverless (docs 2025-2026).
📘 Nguồn tham khảo: - Azure ML Spark serverless docs (cập nhật 2026: Nhấn mạnh session timeout cho periodic jobs).
- Azure Synapse Spark pools idle timeout (tích hợp tương tự).
🔍 Giải thích tất cả các phương án (đúng/sai)
-
✅ Configure the session timeout to be 25 minutes.
Đúng vì lý do nêu trên: Timeout khớp chính xác idle time (25 phút), giữ compute warm, loại bỏ cold start delay. Giải pháp trực tiếp, hiệu quả cao cho serverless mà không tốn chi phí thừa. -
❌ Increase the number of nodes to 16.
Sai vì serverless Spark compute trong Azure ML không hỗ trợ scale nodes thủ công (tự động scale theo workload). Tăng nodes chỉ ảnh hưởng throughput/chạy nhanh hơn trong session, không giảm init delay (cold start vẫn ~15 phút). Thậm chí có thể tăng chi phí không cần thiết. -
❌ Enable dynamically allocated executors.
Sai vì dynamic allocation (Spark configspark.dynamicAllocation.enabled) chỉ scale executors trong session đang chạy dựa trên workload (thêm/bớt resources realtime). Nó không ảnh hưởng cold start time hoặc init delay khi session mới bắt đầu. Phù hợp optimize runtime, không phải startup. -
❌ Enable an isolated compute.
Sai vì isolated compute (trong Azure ML) dành cho workspace riêng biệt, an toàn dữ liệu (không share multi-tenant). Nó tăng chi phí và có thể chậm hơn serverless do provisioning thủ công, không giảm delay mà còn làm phức tạp hơn (serverless vốn nhanh warm start hơn isolated).
💡 Kết luận nổi bật: Giải pháp tập trung vào session timeout là chuẩn Azure best practice cho workload định kỳ trên serverless Spark, giúp tiết kiệm thời gian và chi phí! 🚀
You must publish the batch inference pipeline so that business groups in your organization can use the pipeline. Each business group must be able to specify a different location for the data that the pipeline submits to the model for scoring.
You need to publish the pipeline.
What should you do?
- A Create multiple endpoints for the published pipeline service and have each business group submit jobs to its own endpoint.
- B Define a PipelineParameter object for the pipeline and use it to specify the business group-specific input dataset for each pipeline run.
- C Define a OutputFileDatasetConfig object for the pipeline and use the object to specify the business group-specific input dataset for each pipeline run.
- D Have each business group run the pipeline on local compute and use a local file for the input data.
Xem giải thích
🧩 Phân tích nội dung câu hỏi
Câu hỏi này thuộc lĩnh vực Azure Machine Learning (Azure ML), cụ thể là sử dụng Python SDK để tạo và xuất bản (publish) một batch inference pipeline.
- Bối cảnh: Bạn đã tạo một pipeline batch inference (xử lý dự đoán hàng loạt trên dữ liệu lớn). Bây giờ cần xuất bản pipeline để các nhóm kinh doanh (business groups) trong tổ chức có thể sử dụng.
- Yêu cầu chính: Mỗi nhóm kinh doanh phải có thể chỉ định vị trí dữ liệu đầu vào khác nhau (input dataset location) khi submit pipeline run, để pipeline có thể scoring (dự đoán) trên dữ liệu riêng của họ.
- Mục tiêu: Tìm cách publish pipeline sao cho linh hoạt, cho phép tùy chỉnh input dataset mà không cần tạo nhiều phiên bản pipeline riêng lẻ.
📘 Kiến thức nền (cập nhật đến phiên bản Azure ML SDK v2 mới nhất năm 2026): Trong Azure ML, pipeline có thể được parameter hóa bằng PipelineParameter để truyền tham số động (như dataset input) khi run. Điều này cho phép publish một pipeline duy nhất và reuse với các input khác nhau từ nhiều user/group. (Nguồn: Azure ML Documentation - Publish and run pipeline, cập nhật 2025-2026).
✅ Đáp án đúng và lý do lựa chọn
Đáp án đúng: Define a PipelineParameter object for the pipeline and use it to specify the business group-specific input dataset for each pipeline run.
Lý do 🛠️:
- PipelineParameter là cơ chế chuẩn của Azure ML SDK để định nghĩa tham số động cho pipeline.
- Khi publish, pipeline endpoint sẽ nhận parameter này, cho phép mỗi business group truyền input dataset khác nhau (ví dụ: đường dẫn datastore/blob) mà không cần thay đổi code pipeline.
- Cách này linh hoạt, scalable, hỗ trợ batch inference lớn, và tuân thủ best practice của Azure ML cho shared pipelines. Mỗi run submit qua endpoint với parameter riêng → phù hợp yêu cầu.
❌ Giải thích tất cả các phương án (đúng/sai)
-
[SAI] Create multiple endpoints for the published pipeline service and have each business group submit jobs to its own endpoint.
Phân tích sai ❌: Tạo nhiều endpoint riêng cho từng group là không hiệu quả và không cần thiết. Azure ML pipeline chỉ cần một endpoint duy nhất khi publish, kết hợp với parameter để tùy chỉnh input. Cách này làm phức tạp quản lý, tăng chi phí và không hỗ trợ linh hoạt cho input dataset động. -
[ĐÚNG] Define a PipelineParameter object for the pipeline and use it to specify the business group-specific input dataset for each pipeline run.
Phân tích đúng ✅: Như đã giải thích ở trên. PipelineParameter (ví dụ:PipelineParameter(name="input_data", default_value=...)) cho phép bind với input step của pipeline. Khi run qua endpoint:pipeline_run = published_pipeline.submit(parameters={"input_data": group_specific_dataset}). Hoàn hảo cho multi-group usage. (Nguồn: Azure ML SDK v2 - Pipeline Parameters). -
[SAI] Define a OutputFileDatasetConfig object for the pipeline and use the object to specify the business group-specific input dataset for each pipeline run.
Phân tích sai ❌: OutputFileDatasetConfig chỉ dùng để config output dataset (kết quả ghi ra datastore), không phải input. Sử dụng sai sẽ gây lỗi pipeline. Input cần Input hoặc PipelineParameter với dataset reference, không phải output config. -
[SAI] Have each business group run the pipeline on local compute and use a local file for the input data.
Phân tích sai ❌: Cách này không publish pipeline (chỉ run local), không share được với business groups qua Azure ML workspace. Local compute không scalable cho batch inference lớn, thiếu versioning/security/integration với Azure services. Yêu cầu rõ ràng là "publish" để tổ chức sử dụng chung.
🛠️ Kết luận & Best Practice: Sử dụng PipelineParameter là cách tối ưu, giúp pipeline reusable và dễ quản lý. Test bằng code mẫu: Tạo ml_client.pipelines.create_or_update(published_pipeline). Tham khảo thêm: Azure ML Batch Inference Pipelines (2026 update).
After you answer a question in this section, you will NOT be able to return to it. As a result, these questions will not appear in the review screen.
You manage an Azure Machine Learning workspace. The development environment for managing the workspace is configured to use Python SDK v2 in Azure Machine Learning Notebooks.
A Synapse Spark Compute is currently attached and uses system-assigned identity.
You need to use Python code to update the Synapse Spark Compute to use a user-assigned identity.
Solution: Create an instance of the MLClient class.
Does the solution meet the goal?
- A Yes
- B No
Xem giải thích
🧩 Phân tích chi tiết nội dung câu hỏi
Câu hỏi thuộc dạng series questions trong kỳ thi chứng chỉ (có thể là AZ-400 hoặc DP-100), nơi mỗi câu trình bày một tình huống giống nhau nhưng giải pháp duy nhất khác biệt. Sau khi trả lời, bạn không thể quay lại, và các câu không hiển thị ở màn hình review.
Tình huống cụ thể:
- Bạn đang quản lý một Azure Machine Learning workspace.
- Môi trường phát triển sử dụng Python SDK v2 trong Azure Machine Learning Notebooks.
- Có một Synapse Spark Compute đã được attach vào workspace, hiện đang sử dụng system-assigned identity (danh tính hệ thống tự động).
- Mục tiêu: Sử dụng Python code để update Synapse Spark Compute này sang sử dụng user-assigned identity (danh tính do người dùng chỉ định).
Giải pháp đề xuất (Solution): Chỉ "Create an instance of the MLClient class" (Tạo một instance của lớp MLClient).
Câu hỏi: Giải pháp này có đạt được mục tiêu không? (Does the solution meet the goal?)
📘 Kiến thức nền tảng (cập nhật đến 2026): Theo Azure ML Python SDK v2 (phiên bản mới nhất 1.19.0+ từ năm 2025-2026), MLClient là lớp chính để tương tác với workspace (từ package azure-ai-ml). Tuy nhiên, để update compute (như Synapse Spark), bạn cần:
- Tạo
MLClient. - Sử dụng
compute = MLClient.get_compute(name="compute_name"). - Tạo
AmlComputehoặcSynapseSparkobject vớiidentity=Identity(type="aml_token", user_assigned_identity=UserAssignedIdentity(resource_id="...")). - Gọi
MLClient.compute.begin_create_or_update(compute).
Chỉ tạoMLClientkhông làm gì cả với compute identity!
🛠️ Nguồn tham khảo:
- Azure ML Python SDK v2 - Manage compute (SynapseSpark identity update).
- MLClient reference.
- Identity for Azure ML compute (hỗ trợ user-assigned từ 2023, stable đến 2026).
✅ Đáp án đúng: No
Lý do chọn đáp án đúng:
Giải pháp chỉ dừng ở việc tạo instance MLClient, điều này chưa đủ để update Synapse Spark Compute sang user-assigned identity. MLClient chỉ là client để kết nối workspace, không tự động thay đổi identity của compute. Bạn cần thêm các bước như get_compute, tạo SynapseSpark object mới với identity config, và begin_create_or_update. Giải pháp này không đạt mục tiêu! ❌
📋 Giải thích tất cả các phương án
-
Yes:
❌ Sai. Việc chỉ tạoMLClient(ví dụ:from azure.ai.ml import MLClient; ml_client = MLClient(...)) không thực hiện bất kỳ thay đổi nào lên Synapse Spark Compute. Nó chỉ khởi tạo kết nối, không update identity. Đây là giải pháp thiếu sót hoàn toàn, không đáp ứng yêu cầu code để switch từ system-assigned sang user-assigned identity. -
No:
✅ Đúng. Giải pháp không meet the goal vì thiếu các lệnh cần thiết để thao tác compute (nhưml_client.compute.get(), configSynapseSpark(identity=...), vàbegin_create_or_update()). Theo SDK v2 mới nhất (2026), update identity yêu cầu full compute lifecycle management, không chỉ init client. 🛠️
You must use a Responsible AI dashboard to access the model.
You need to use the Azure Machine Learning studio UI to generate the Responsible AI dashboard.
What should you do first?
- A Deploy the model to a managed online endpoint.
- B Register the model with the workspace.
- C Create the model explanations.
- D Convert the model from the MLflow format to a custom format.
Xem giải thích
🧩 Phân tích chi tiết nội dung câu hỏi
Câu hỏi tập trung vào quy trình sử dụng Responsible AI (RAI) dashboard trong Azure Machine Learning studio UI. Cụ thể:
- Bạn đã tạo một Azure Machine Learning workspace.
- Bạn đã huấn luyện một mô hình hồi quy (regression model) ở định dạng MLflow sử dụng dữ liệu có cấu trúc bảng (tabular structured data).
- Mục tiêu: Sử dụng RAI dashboard để truy cập và phân tích mô hình (ví dụ: kiểm tra fairness, explainability, counterfactuals, v.v.).
- Yêu cầu: Sử dụng giao diện Azure Machine Learning studio UI để tạo (generate) RAI dashboard.
- Câu hỏi hỏi về bước đầu tiên (first) cần thực hiện.
🛠️ Bối cảnh kỹ thuật (cập nhật đến 2026): RAI dashboard là tính năng của Azure ML (từ phiên bản v2 trở lên), hỗ trợ các mô hình MLflow trực tiếp mà không cần chuyển đổi. Để truy cập RAI qua studio UI, mô hình phải được đăng ký (register) vào workspace trước, sau đó mới có thể compute và visualize insights như model explanations, error analysis. Đây là quy trình chuẩn theo docs Azure ML mới nhất.
✅ Đáp án đúng: Register the model with the workspace
Lý do lựa chọn:
- Đây là bước đầu tiên bắt buộc để Azure ML studio nhận diện mô hình và kích hoạt RAI dashboard. Sau khi register, bạn có thể chọn mô hình trong studio UI > Models > Chọn model > Generate Responsible AI insights.
- MLflow models được hỗ trợ native trong Azure ML (không cần convert), và RAI yêu cầu model tồn tại trong Model Registry của workspace.
- Không deploy hay create explanations trước được, vì studio UI chỉ expose RAI cho registered models.
📋 Giải thích tất cả các phương án (giữ nguyên văn bản gốc)
-
✅ Register the model with the workspace
Đúng vì: Bước đầu tiên để model được quản lý trong workspace registry. Từ đây, studio UI cho phép generate RAI dashboard trực tiếp (qua tab "Responsible AI" hoặc "Interpret"). Theo docs Azure ML 2026, RAI insights chỉ available sau register. -
❌ Deploy the model to a managed online endpoint
Sai vì: Deploy là bước cho inference/production (online endpoint), không liên quan đến RAI dashboard. RAI dùng cho analysis/development, không yêu cầu deploy. Deploy sau register nếu cần serve model. -
❌ Create the model explanations
Sai vì: "Create explanations" là phần của RAI workflow (sử dụng InterpretML hoặc SHAP), nhưng chỉ thực hiện sau khi register model. Đây không phải bước đầu tiên; studio UI tự động compute explanations khi generate RAI từ registered model. -
❌ Convert the model from the MLflow format to a custom format
Sai vì: Azure ML hỗ trợ MLflow 2.0+ native (từ 2023), không cần convert sang custom format. RAI dashboard hoạt động trực tiếp với MLflow models sau register, tiết kiệm thời gian.
📘 Tài liệu tham khảo
- Azure ML Docs: Responsible AI dashboard (cập nhật 2026).
- Register MLflow models.
- Studio UI workflow for RAI.
💡 Lưu ý: Quy trình này đảm bảo tuân thủ best practices Responsible AI của Microsoft, giúp phát hiện bias sớm! Nếu cần demo code, hãy cho biết thêm. 🚀