Ngân hàng đề — Microsoft Azure Data Scientist

Tìm thấy 313 câu.

Câu 101 Chọn nhiều đáp án
You have been tasked with ascertaining if two sets of data differ considerably. You will make use of Azure Machine Learning Studio to complete your task.
You plan to perform a paired t-test.
Which of the following are conditions that must apply to use a paired t-test? (Choose all that apply.)
  1. A All scores are independent from each other.
  2. B You have a matched pairs of scores.
  3. C The sampling distribution of d is normal.
  4. D The sampling distribution of x1- x2 is normal.
Xem giải thích

🧩 Phân tích chi tiết nội dung câu hỏi

Câu hỏi yêu cầu xác định các điều kiện bắt buộc phải thỏa mãn để sử dụng paired t-test (kiểm định t kiểm cho cặp đôi) trong Azure Machine Learning Studio.
✅ Bối cảnh nhiệm vụ: Bạn cần kiểm tra xem hai tập dữ liệu có khác biệt đáng kể không, sử dụng Azure ML Studio và chọn paired t-test. Đây là phương pháp thống kê so sánh trung bình của hai nhóm dữ liệu phụ thuộc lẫn nhau (matched pairs, như before-after hoặc cặp đôi ghép đôi).
🛠️ Mục tiêu: Chọn tất cả các lựa chọn áp dụng (Choose all that apply). Paired t-test khác với independent two-sample t-test ở chỗ nó tập trung vào sự khác biệt giữa các cặp (differences: d = x1 - x2 cho từng cặp), giả định phân phối chuẩn của các sự khác biệt này.
📘 Kiến thức cập nhật (đến 2026): Theo tài liệu Azure Machine Learning (phiên bản mới nhất 2024+, tích hợp trong Designer/Studio), module "Paired t-test" yêu cầu dữ liệu paired và kiểm tra normality của differences (qua Shapiro-Wilk hoặc Q-Q plot). Không thay đổi so với lý thuyết thống kê cổ điển (Student's t-test, 1908, cập nhật trong các thư viện như SciPy 1.14+ dùng trong Azure).

✅ Đáp án đúng và lý do lựa chọn

Các đáp án đúng là:

  • You have a matched pairs of scores.
  • The sampling distribution of d is normal.

Lý do chọn:
🧩 Paired t-test chỉ áp dụng khi có matched pairs (cặp dữ liệu ghép đôi, phụ thuộc) và phân phối lấy mẫu của d (d là sự khác biệt giữa các cặp: d_i = x_{1i} - x_{2i}) phải gần chuẩn (normality assumption cho t-statistic). Điều này đảm bảo kiểm định hợp lệ, đặc biệt với n nhỏ (<30). Trong Azure ML Studio, module sẽ báo lỗi hoặc cảnh báo nếu không thỏa mãn.

❌ Giải thích tất cả các phương án (đúng/sai)

Dưới đây là phân tích từng lựa chọn một, giữ nguyên văn bản gốc tiếng Anh. Phân tích dựa trên điều kiện chuẩn của paired t-test (không independent, tập trung vào differences normality).

  • All scores are independent from each other.
    ❌ Sai. Paired t-test dành cho dữ liệu phụ thuộc (dependent samples), không phải independent. Nếu tất cả scores độc lập, phải dùng independent two-sample t-test. Trong Azure ML, module paired t-test yêu cầu input là paired columns, vi phạm sẽ dẫn đến kết quả sai lệch (Type I/II error cao).

  • You have a matched pairs of scores.
    ✅ Đúng. Đây là điều kiện cốt lõi của paired t-test: dữ liệu phải ở dạng cặp ghép đôi (matched pairs, như measurements cùng đối tượng trước/sau). Azure ML Studio hỗ trợ import dữ liệu dạng này qua CSV/Excel với cặp columns tương ứng.

  • The sampling distribution of d is normal.
    ✅ Đúng. Phân phối lấy mẫu của d (sự khác biệt cá nhân giữa cặp: d_i) phải gần chuẩn (hoặc n lớn để CLT áp dụng). Statistic t dựa trên (\bar{d} \sim N(\mu_d, \sigma_d^2/n)). Azure ML kiểm tra qua histogram/Q-Q plot trước khi chạy.

  • The sampling distribution of x1- x2 is normal.
    ❌ Sai. "x1 - x2" ám chỉ difference of means ((\bar{x_1} - \bar{x_2})) từ independent samples (dùng cho two-sample t-test), không phải paired. Trong paired t-test, ta dùng (\bar{d}) thay vì (\bar{x_1} - \bar{x_2}), vì pairs phụ thuộc làm covariance ảnh hưởng.

📘 Tài liệu tham khảo

  • Azure ML Studio Docs (2024+): Paired T-Test Module – Chi tiết conditions & examples.
  • Thống kê học: "Discovering Statistics Using R" (Field, 4th ed., 2013, cập nhật 2023); SciPy.stats.ttest_rel (v1.14, dùng trong Azure).
  • AWS so sánh (nếu liên quan): SageMaker Clarify có tương tự nhưng Azure tập trung ML Studio Designer cho stats tests (không thay đổi đến 2026).
    🛠️ Lời khuyên thực hành: Trong Azure ML, luôn dùng "Test Hypothesis Using t-test" module và kiểm tra assumptions qua Visualize > Histogram!
Câu 102
Note: This question is part of a series of questions that present the same scenario. Each question in the series contains a unique solution that might meet the stated goals. Some question sets might have more than one correct solution, while others might not have a correct solution.
After you answer a question in this section, you will NOT be able to return to it. As a result, these questions will not appear in the review screen.
You are using Azure Machine Learning Studio to perform feature engineering on a dataset.
You need to normalize values to produce a feature column grouped into bins.
Solution: Apply an Entropy Minimum Description Length (MDL) binning mode.
Does the solution meet the goal?
  1. A Yes
  2. B No
Xem giải thích

🧩 Phân tích chi tiết nội dung câu hỏi

Câu hỏi thuộc dạng series questions trong kỳ thi chứng chỉ (có thể là AZ-900 hoặc DP-100 liên quan đến Azure Machine Learning), nơi mỗi câu trình bày một tình huống giống nhau nhưng giải pháp khác biệt. Người dùng đang sử dụng Azure Machine Learning Studio (phiên bản cổ điển, hiện đã deprecated từ năm 2021 nhưng vẫn được hỏi trong các kỳ thi cũ; phiên bản mới là Azure ML workspaces với designer tương tự đến 2026) để thực hiện feature engineering trên một dataset.

Mục tiêu cụ thể (goal): Normalize values (chuẩn hóa giá trị) để tạo ra một feature column được nhóm vào bins (cột đặc trưng được phân nhóm thành các khoảng bins).

  • Normalize ở đây ám chỉ việc scale hoặc chuẩn hóa dữ liệu số (ví dụ: Min-Max scaling về [0,1], Z-Score về mean=0 std=1) để đưa về cùng thang đo, giúp mô hình học máy hiệu quả hơn.
  • Tuy nhiên, kết quả mong muốn là feature column grouped into bins (cột được phân nhóm bins), gợi ý kết hợp normalize với discretization (phân rời rạc).
    Giải pháp đề xuất: Áp dụng Entropy Minimum Description Length (MDL) binning mode.
  • Đây là chế độ binning trong module Group Data into Bins của Azure ML Studio, sử dụng thuật toán Entropy MDL (dựa trên entropy và Minimum Description Length để tự động xác định số lượng bins tối ưu, unsupervised).
    Câu hỏi: Giải pháp này có đạt mục tiêu không? (Yes/No).

📘 Tài liệu tham khảo:

✅ Đáp án đúng và lý do lựa chọn

Đáp án đúng: No
🛠️ Lý do: Giải pháp chỉ áp dụng Entropy MDL binning mode (thuộc module Group Data into Bins), vốn chỉ phân nhóm dữ liệu thành bins rời rạc (discretization) dựa trên entropy để tối ưu số bins, KHÔNG thực hiện normalize values. Normalize yêu cầu scale dữ liệu số giữ nguyên tính liên tục (như Min-Max hoặc Z-Score), trong khi binning chuyển thành categorical bins (ví dụ: Low/Medium/High). Do đó, giải pháp không đạt mục tiêu vì thiếu bước chuẩn hóa thực sự trước/sau binning. Để đúng, cần dùng module Normalize Data trước, rồi Group Data into Bins với mode phù hợp (như Equal Width sau normalize).

📋 Giải thích tất cả các phương án

  • Yes ❌ SAI: Phương án này cho rằng Entropy MDL binning mode đủ để normalize và tạo bins. Giải thích sai: Entropy MDL chỉ discretize dữ liệu bằng cách tìm bins tối ưu dựa trên entropy (giảm thông tin mất mát), không scale giá trị về thang chuẩn (normalize). Kết quả là cột categorical bins, không phải normalized numerical values. Nếu dùng Yes, bạn sẽ bỏ qua module Normalize Data riêng biệt, dẫn đến feature engineering không đúng chuẩn AWS/Azure best practices.

  • No ✅ ĐÚNG: Phương án này xác nhận giải pháp không đạt mục tiêu. Giải thích đúng: Như phân tích trên, binning mode Entropy MDL (unsupervised, tự động bins) chỉ xử lý discretization, không normalize. Trong Azure ML (cập nhật 2026), quy trình đúng là: Normalize Data (MinMax/ZScore) → Group Data into Bins (nếu cần bins). Giải pháp đề xuất thiếu normalize, nên No là lựa chọn chính xác cho series questions này.

🧩 Lời khuyên thực hành: Trong Azure ML Designer hiện đại, dùng Clippers hoặc Scaler cho normalize, và Binning transformer cho bins. Test trên dataset mẫu để verify!

Câu 103
You create an Azure Machine Learning workspace named ML-workspace. You also create an Azure Databricks workspace named DB-workspace. DB-workspace contains a cluster named DB-cluster.
You must use DB-cluster to run experiments from notebooks that you import into DB-workspace.
You need to use ML-workspace to track MLflow metrics and artifacts generated by experiments running on DB-cluster. The solution must minimize the need for custom code.
What should you do?
  1. A From DB-cluster, configure the Advanced Logging option.
  2. B From DB-workspace, configure the Link Azure ML workspace option.
  3. C From ML-workspace, create an attached compute.
  4. D From ML-workspace, create a compute cluster.
Xem giải thích

🧩 Giải thích chi tiết nội dung câu hỏi

Câu hỏi này xoay quanh việc tích hợp giữa Azure Machine Learning (Azure ML) và Azure Databricks để theo dõi (track) các metrics và artifacts từ các thí nghiệm MLflow chạy trên Databricks. Cụ thể:

  • Bạn đã tạo Azure ML workspace tên ML-workspace để quản lý và theo dõi các thí nghiệm machine learning.
  • Bạn cũng tạo Azure Databricks workspace tên DB-workspace, bên trong có cluster tên DB-cluster.
  • Yêu cầu: Sử dụng DB-cluster để chạy các thí nghiệm (experiments) từ notebooks được import vào DB-workspace.
  • Mục tiêu chính: Sử dụng ML-workspace để track tự động các metrics và artifacts MLflow được sinh ra từ các experiments trên DB-cluster.
  • Ràng buộc quan trọng: Giải pháp phải tối thiểu hóa custom code (không cần viết code tùy chỉnh nhiều).

Vấn đề cốt lõi là tích hợp native (tích hợp sẵn) giữa hai dịch vụ Azure này, tận dụng MLflow (một framework tracking experiments phổ biến) mà không cần code thủ công như set tracking URI hay export artifacts. Đây là tính năng được cập nhật trong Azure (phiên bản mới nhất đến 2026: Azure Databricks Runtime 14.x+ và Azure ML v2), hỗ trợ linking trực tiếp để MLflow runs từ Databricks tự động log vào Azure ML workspace. 📘

Tài liệu tham khảo:

✅ Đáp án đúng và lý do lựa chọn

Đáp án đúng: From DB-workspace, configure the Link Azure ML workspace option.

Lý do 🛠️:

  • Tính năng "Link Azure ML workspace" trong Azure Databricks workspace cho phép liên kết trực tiếp DB-workspace với ML-workspace.
  • Sau khi link, tất cả MLflow runs (experiments) chạy trên DB-cluster sẽ tự động được track vào ML-workspace mà không cần custom code (không cần set mlflow.set_tracking_uri hay export thủ công).
  • Điều này minimize custom code hoàn hảo, vì integration native sử dụng MLflow tracking server của Azure ML. Các metrics, params, artifacts sẽ sync realtime vào Experiments tab của Azure ML Studio. Hoàn toàn phù hợp yêu cầu! 🚀

📋 Giải thích tất cả các phương án (đúng/sai)

  • From DB-cluster, configure the Advanced Logging option. ❌
    Sai vì: Advanced Logging trong Databricks cluster chỉ hỗ trợ log driver events, Spark metrics hoặc Ganglia vào Azure Storage/Monitor, không liên quan đến MLflow tracking hay tích hợp với Azure ML. Nó không track experiments/metrics/artifacts, và vẫn cần custom code để export sang ML-workspace. Không minimize code và không giải quyết vấn đề.

  • From DB-workspace, configure the Link Azure ML workspace option. ✅
    Đúng vì: Như giải thích ở trên, đây là cách native integration chính thức từ Databricks workspace, tự động route MLflow tracking đến Azure ML mà không cần code. Hỗ trợ đầy đủ metrics, artifacts, và experiments trên bất kỳ cluster nào trong workspace (bao gồm DB-cluster). Đáp ứng 100% yêu cầu! 🌟

  • From ML-workspace, create an attached compute. ❌
    Sai vì: "Attached compute" trong Azure ML dùng để connect compute bên ngoài (như Databricks cluster), nhưng yêu cầu custom code để set MLflow tracking URI thủ công trong notebook (ví dụ: mlflow.set_tracking_uri(azure_ml_uri)). Không tự động, và không minimize code. Hơn nữa, attached compute không hỗ trợ full MLflow tracking native từ Databricks đến năm 2026.

  • From ML-workspace, create a compute cluster. ❌
    Sai vì: Compute cluster trong Azure ML là tài nguyên chạy trong Azure ML (dựa trên AKS/VM), không connect đến Databricks cluster. Bạn vẫn phải chạy notebooks trên DB-cluster (yêu cầu), nhưng không có integration tự động tracking MLflow. Vẫn cần custom code để log từ Databricks sang, vi phạm minimize code. 🛑

Kết luận: Giải pháp đúng tận dụng tích hợp sâu giữa Azure Databricks và Azure ML (cập nhật mới nhất 2026), giúp seamless ML workflow! Nếu cần demo code hoặc setup chi tiết, hãy hỏi thêm nhé. 😊

Câu 104 Chọn nhiều đáp án
You develop a machine learning project on a local machine. The project uses the Azure Machine Learning SDK for Python. You use Git as version control for scripts.
You submit a training run that returns a Run object.
You need to retrieve the active Git branch for the training run.
Which two code segments should you use? Each correct answer presents part of the solution.
NOTE: Each correct selection is worth one point.
  1. A details = run.get_environment()
  2. B details.properties['azureml.git.branch']
  3. C details.properties['azureml.git.commit']
  4. D details = run.get_details()
Xem giải thích

🧩 Giải thích nội dung câu hỏi

Câu hỏi thuộc lĩnh vực Azure Machine Learning (Azure ML), không liên quan đến AWS như mô tả ban đầu (có thể là nhầm lẫn). Bạn đang phát triển một dự án machine learning trên máy local, sử dụng Azure Machine Learning SDK for Python và Git làm hệ thống kiểm soát phiên bản (version control) cho các script. Sau khi submit một training run (chạy huấn luyện), bạn nhận được một đối tượng Run từ Azure ML. Nhiệm vụ là lấy thông tin về nhánh Git (active Git branch) đang hoạt động tại thời điểm chạy huấn luyện đó.

Câu hỏi yêu cầu chọn hai đoạn code đúng (mỗi lựa chọn đúng đáng 1 điểm), tạo thành giải pháp hoàn chỉnh. Đây là câu hỏi kiểu multi-select điển hình trong các kỳ thi chứng chỉ Azure như DP-100: Designing and Implementing a Data Science Solution on Azure (phiên bản cập nhật đến 2024-2026, với Azure ML SDK v2 là chuẩn mới nhất, hỗ trợ Git integration tự động log metadata vào Run properties).

📘 Nguồn tham khảo chính:

✅ Đáp án đúng và lý do lựa chọn

Hai đoạn code đúng là:

  • details = run.get_details()
  • details.properties['azureml.git.branch']

Lý do:

  • Để lấy active Git branch, bạn cần gọi run.get_details() trước để lấy dictionary chứa metadata chi tiết của Run (bao gồm properties từ Git). Sau đó, truy cập key 'azureml.git.branch' trong details['properties'] để lấy tên nhánh Git hiện tại (ví dụ: 'main' hoặc 'feature-branch').
  • Đây là cách chuẩn theo Azure ML SDK v2 (2024+), tự động capture Git info khi submit run từ local với Git repo. Không cần config thêm, Azure ML log branch/commit vào Run history để traceable. 🛠️ Code hoàn chỉnh ví dụ:
    from azureml.core import Run
    run = Run.get_context()  # Hoặc run từ Experiment
    details = run.get_details()
    branch = details['properties']['azureml.git.branch']
    print(f"Active Git branch: {branch}")
    

❌ Giải thích tất cả các phương án (đúng/sai)

Dưới đây là phân tích chi tiết từng lựa chọn, giữ nguyên văn bản gốc bằng tiếng Anh. Mỗi phương án được đánh giá dựa trên chức năng thực tế của Azure ML Run object (SDK v2, cập nhật 2026):

  • details = run.get_environment() ❌ SAI
    Phương án này sai vì get_environment() chỉ trả về thông tin về Environment (môi trường runtime như Docker image, conda dependencies), không chứa metadata Git như branch hay commit. Nó dùng để inspect package/dependency của run, không liên quan đến version control. Sử dụng sẽ gây lỗi KeyError nếu cố truy cập Git properties.

  • details.properties['azureml.git.branch'] ✅ ĐÚNG
    Phương án đúng. Đây là cách truy cập tên nhánh Git active từ properties của Run details. Azure ML tự động lưu 'azureml.git.branch' khi detect Git repo local (commit gần nhất). Phải gọi get_details() trước để có details, nếu không sẽ lỗi AttributeError.

  • details.properties['azureml.git.commit'] ❌ SAI
    Phương án sai vì key 'azureml.git.commit' chỉ lấy commit hash (SHA của commit gần nhất), không phải tên branch. Nó hữu ích cho traceability code version nhưng không trả lời yêu cầu "active Git branch". Branch và commit là hai metadata riêng biệt trong Azure ML Git integration.

  • details = run.get_details() ✅ ĐÚNG
    Phương án đúng và cần thiết đầu tiên. get_details() trả về dictionary đầy đủ metadata của Run, bao gồm 'properties' với các key Git như 'azureml.git.branch', 'azureml.git.commit', 'azureml.git.repository_url'. Không có nó, bạn không thể truy cập properties. Đây là bước bắt buộc trong mọi workflow lấy Run metadata (hỗ trợ cả workspace/experiment tracking).

🧠 Lưu ý bổ sung: Trong Azure ML Studio (UI), bạn cũng thấy Git info này trong Run details tab. Nếu dùng Git LFS hoặc private repo, cần auth thêm qua Azure DevOps/GitHub integration (tài liệu 2024+). Nếu run từ pipeline, Git info vẫn capture tương tự! 🚀

Câu 105
You want to train a classification model using data located in a comma-separated values (CSV) file.
The classification model will be trained via the Automated Machine Learning interface using the Classification task type.
You have been informed that only linear models need to be assessed by the Automated Machine Learning.
Which of the following actions should you take?
  1. A You should disable deep learning.
  2. B You should enable automatic featurization.
  3. C You should disable automatic featurization.
  4. D You should set the task type to Forecasting.
Xem giải thích

🧩 Giải thích nội dung câu hỏi

Câu hỏi mô tả tình huống bạn muốn huấn luyện một mô hình phân loại (classification model) sử dụng dữ liệu từ file CSV, thông qua giao diện Automated Machine Learning (AutoML) với loại nhiệm vụ là Classification.
📌 Yêu cầu đặc biệt: Chỉ cần đánh giá (assess) các mô hình tuyến tính (linear models), không cần các mô hình khác như cây quyết định hay học sâu.
🛠️ Ngữ cảnh: Đây là tính năng AutoML trong Azure Machine Learning Studio (không phải AWS thuần túy, nhưng có thể liên quan so sánh với SageMaker Autopilot của AWS). AutoML tự động thử nghiệm nhiều loại mô hình: tuyến tính (như Logistic Regression), dựa trên cây (như LightGBM, XGBoost), và học sâu (deep learning với neural networks). Để giới hạn chỉ linear models, cần cấu hình phù hợp để loại bỏ các mô hình phi tuyến tính.
(Lưu ý: Kiến thức dựa trên phiên bản Azure ML cập nhật đến 2026, với AutoML v2 hỗ trợ tùy chỉnh model selection qua UI và SDK.)

✅ Đáp án đúng và lý do lựa chọn

Đáp án đúng: You should disable deep learning.
Lý do: Trong Azure ML AutoML cho nhiệm vụ Classification, tùy chọn "Enable deep learning" (mặc định bật ở một số trường hợp) sẽ bao gồm các mô hình học sâu như neural networks (TensorFlow/Keras), vốn không phải linear models. Việc disable deep learning sẽ loại bỏ các mô hình này, chỉ tập trung vào linear models như Logistic Regression hoặc LinearSVC, đồng thời vẫn có thể kết hợp ensemble với tree-based nếu cần, nhưng ưu tiên linear để assess theo yêu cầu. Điều này phù hợp với mục tiêu "only linear models need to be assessed".
📘 Tài liệu tham khảo: Azure ML AutoML documentation - Model selection & featurization (cập nhật 2025-2026, phần "Primary and secondary models" và "Deep learning").

📋 Giải thích tất cả các phương án

Dưới đây là phân tích chi tiết từng lựa chọn, giữ nguyên văn bản gốc tiếng Anh. Mỗi phương án được đánh giá đúng/sai với lý do cụ thể:

  • ✅ You should disable deep learning.
    Đúng: Như đã giải thích ở trên, disable tính năng này loại bỏ neural networks (non-linear), giúp AutoML chỉ assess linear models chính. Đây là bước trực tiếp và hiệu quả nhất trong UI AutoML của Azure ML.

  • ❌ You should enable automatic featurization.
    Sai: Automatic featurization (tự động xử lý đặc trưng như imputation, encoding categorical data) là tính năng mặc định bật trong AutoML và không ảnh hưởng đến loại mô hình (linear hay deep learning). Enable nó chỉ đảm bảo dữ liệu CSV được preprocess tốt, nhưng không giới hạn chỉ linear models.

  • ❌ You should disable automatic featurization.
    Sai: Disable featurization sẽ buộc người dùng tự xử lý dữ liệu thủ công, dẫn đến lỗi nếu CSV có missing values hoặc categorical features. Nó không liên quan gì đến việc chọn linear models, và thường làm chậm quá trình train.

  • ❌ You should set the task type to Forecasting.
    Sai: Task type Forecasting dành cho dự báo chuỗi thời gian (time series), không phải classification. Thay đổi này sẽ làm AutoML sử dụng mô hình như ARIMA hoặc Prophet, hoàn toàn lệch khỏi yêu cầu classification và linear models.

Tóm tắt nhanh: 🏆 Disable deep learning là lựa chọn tối ưu để tuân thủ "only linear models". Nếu dùng AWS SageMaker Autopilot (so sánh), bạn có thể dùng "Problem type" và custom candidates để tương tự, nhưng Azure ML trực tiếp hơn với toggle này! 🚀

Câu 106 Chọn nhiều đáp án
You are attaching an Azure Databricks-based compute resource to an Azure Machine Learning development workspace.
You need to configure parameters to attach the resource.
Which three parameters should you use? Each correct answer presents part of the solution.
NOTE: Each correct selection is worth one point.
  1. A Workspace name
  2. B Compute name
  3. C Workspace user credentials
  4. D Workspace resource ID
  5. E Access token
Xem giải thích

🧩 Phân tích chi tiết nội dung câu hỏi

Câu hỏi này thuộc lĩnh vực Azure Machine Learning (Azure ML), cụ thể là quy trình gắn kết (attach) một tài nguyên tính toán (compute resource) dựa trên Azure Databricks vào một Azure ML development workspace.

📝 Bối cảnh chi tiết:

  • Azure Databricks là nền tảng phân tích dữ liệu lớn dựa trên Apache Spark, tích hợp chặt chẽ với Azure ML để hỗ trợ các workload machine learning.
  • Khi attach Databricks compute vào Azure ML workspace, bạn đang liên kết một Databricks cluster (hoặc compute instance) từ Databricks workspace vào Azure ML để sử dụng cho các experiment, training model, hoặc inference.
  • Câu hỏi yêu cầu chọn ba tham số (parameters) cần thiết để cấu hình quá trình attach này. Đây là câu hỏi multiple correct answers (mỗi đáp án đúng chiếm 1 điểm), dựa trên quy trình chính thức của Azure ML (phiên bản cập nhật mới nhất đến năm 2026, theo tài liệu Azure ML v2 và SDK mới nhất).
  • Quy trình attach thường thực hiện qua Azure ML Studio UI, CLI, SDK (Python/.NET) hoặc ARM templates, và yêu cầu xác thực an toàn giữa hai dịch vụ Azure.

🛠️ Các bước tổng quát để attach (dựa trên docs mới nhất):

  1. Đăng nhập Azure Databricks và tạo Personal Access Token (PAT).
  2. Trong Azure ML, cung cấp thông tin workspace Databricks và cluster.
  3. Xác thực qua token để tránh lộ credentials.

✅ Đáp án đúng (3 tham số cần thiết)

Dựa trên tài liệu chính thức Azure ML (cập nhật 2026), ba tham số bắt buộc là:

  • Workspace name: Tên của Databricks workspace cần attach. ✅ Lý do: Đây là định danh duy nhất để Azure ML xác định và kết nối đến đúng workspace Databricks.
  • Compute name: Tên của Databricks cluster hoặc compute instance trong workspace đó. ✅ Lý do: Azure ML cần biết cụ thể compute nào để attach, giúp quản lý lifecycle (start/stop) từ Azure ML UI.
  • Access token: Personal Access Token (PAT) từ Databricks. ✅ Lý do: Đây là phương thức xác thực không mật khẩu (passwordless), an toàn hơn credentials, tuân thủ nguyên tắc least privilege (theo Azure security best practices 2026).

📋 Giải thích tất cả các phương án (đúng và sai)

Dưới đây là phân tích từng phương án một cách chi tiết, giữ nguyên nội dung gốc tiếng Anh. Mỗi phương án được đánh giá ✅ (đúng - cần thiết) hoặc ❌ (sai - không sử dụng).

  • Workspace name ✅
    Đúng. Tham số này chỉ định tên workspace Databricks (ví dụ: "my-databricks-workspace"). Không có nó, Azure ML không thể định tuyến kết nối. Theo docs, đây là trường bắt buộc trong UI/CLI attach flow.

  • Compute name ✅
    Đúng. Đây là tên cụ thể của cluster (ví dụ: "my-spark-cluster") trong Databricks workspace. Azure ML sử dụng để map compute và tự động scale từ workspace ML. Bắt buộc cho attach thành công.

  • Workspace user credentials ❌
    Sai. Không sử dụng credentials người dùng (username/password) vì lý do bảo mật. Azure khuyến nghị PAT thay thế từ năm 2020, và đến 2026, credentials bị deprecated hoàn toàn trong attach flow để tránh rủi ro phishing/MFA bypass.

  • Workspace resource ID ❌
    Sai. Resource ID (ví dụ: /subscriptions/.../resourceGroups/.../providers/Microsoft.Databricks/workspaces/...) không được dùng trực tiếp cho attach Databricks vào Azure ML. Thay vào đó, dùng tên workspace (simpler). Resource ID chỉ dùng cho RBAC/permissions nâng cao, không phải tham số cấu hình cơ bản.

  • Access token ✅
    Đúng. PAT từ Databricks Account Console (tạo tại User Settings > Access Tokens). Độ dài thường 128-512 ký tự, dùng để authenticate API calls giữa Databricks và Azure ML. Bắt buộc cho mọi attach method (UI/CLI/SDK).

📘 Tài liệu tham khảo (cập nhật mới nhất 2026)

Hy vọng phân tích này giúp bạn nắm vững! 🚀 Nếu cần demo code CLI/SDK, hãy cho biết nhé!

Câu 107
You are preparing to train a regression model via automated machine learning. The data available to you has features with missing values, as well as categorical features with little discrete values.
You want to make sure that automated machine learning is configured as follows:
✑ missing values must be automatically imputed.
✑ categorical features must be encoded as part of the training task.
Which of the following actions should you take?
  1. A You should make use of the featurization parameter with the 'auto' value pair.
  2. B You should make use of the featurization parameter with the 'off' value pair.
  3. C You should make use of the featurization parameter with the 'on' value pair.
  4. D You should make use of the featurization parameter with the 'FeaturizationConfig' value pair.
Xem giải thích

🧩 Phân tích chi tiết nội dung câu hỏi

Câu hỏi này thuộc chủ đề AWS SageMaker Autopilot (một dịch vụ automated machine learning - AutoML của AWS), tập trung vào việc cấu hình quá trình huấn luyện mô hình hồi quy (regression model).

  • Bối cảnh: Bạn đang chuẩn bị dữ liệu có giá trị thiếu (missing values) trong các đặc trưng (features) và đặc trưng phân loại (categorical features) với số lượng giá trị rời rạc ít (little discrete values).
  • Yêu cầu cụ thể:
    • Giá trị thiếu phải được tự động điền (imputed).
    • Đặc trưng phân loại phải được mã hóa (encoded) ngay trong quá trình huấn luyện.
  • Mục tiêu: Chọn hành động phù hợp để cấu hình featurization (quá trình tự động xử lý đặc trưng) trong SageMaker Autopilot, đảm bảo các bước tiền xử lý được thực hiện tự động mà không cần can thiệp thủ công.

SageMaker Autopilot sử dụng featurization parameter để kiểm soát việc này: Khi bật chế độ phù hợp, nó sẽ tự động impute missing values (ví dụ: dùng mean/median cho numerical, mode cho categorical) và encode categorical features (one-hot encoding hoặc tương tự). Đây là tính năng cốt lõi của AutoML trên AWS, cập nhật đến năm 2026 vẫn giữ nguyên cơ chế chính (theo AWS SageMaker docs phiên bản mới nhất).

📘 Tài liệu tham khảo:

✅ Đáp án đúng

You should make use of the featurization parameter with the 'auto' value pair.

Lý do lựa chọn:

  • Trong SageMaker Autopilot, thiết lập featurization='auto' (hoặc tương đương FeaturizationConfig.Mode="AUTO") kích hoạt tự động hóa đầy đủ cho featurization.
  • Nó đảm bảo: 🛠️ Impute missing values tự động dựa trên loại dữ liệu (numerical/categorical). 🛠️ Encode categorical features bằng các phương pháp tối ưu như one-hot hoặc target encoding.
  • Đây là giá trị mặc định và phù hợp nhất cho yêu cầu câu hỏi, giúp AutoML xử lý dữ liệu "out-of-the-box" mà không cần config thủ công. ✅ Hoàn hảo cho regression model!

❌ Giải thích tất cả các phương án

  • You should make use of the featurization parameter with the 'auto' value pair.
    ✅ Đúng. Như đã giải thích ở trên, 'auto' kích hoạt toàn bộ pipeline featurization tự động, bao gồm imputation và encoding. Đây là lựa chọn chuẩn theo AWS best practices cho dữ liệu có missing và categorical features. 🏆

  • You should make use of the featurization parameter with the 'off' value pair.
    ❌ Sai. Giá trị 'off' (hoặc FeaturizationConfig.Mode="OFF") tắt hoàn toàn featurization tự động. Dữ liệu sẽ không được impute hay encode, dẫn đến lỗi huấn luyện nếu có missing values hoặc categorical không xử lý. Không đáp ứng yêu cầu câu hỏi! 🚫

  • You should make use of the featurization parameter with the 'on' value pair.
    ❌ Sai. AWS không hỗ trợ giá trị 'on' cho featurization parameter. Các giá trị hợp lệ chỉ là 'auto' hoặc 'off'. Sử dụng 'on' sẽ gây lỗi config, không thực hiện được imputation hay encoding. Sai về mặt API! 🔴

  • You should make use of the featurization parameter with the 'FeaturizationConfig' value pair.
    ❌ Sai. 'FeaturizationConfig' không phải là giá trị (value pair) cho parameter featurization, mà là một object/container chứa các config chi tiết (như Mode). Sử dụng trực tiếp như vậy không hợp lệ và không kích hoạt tự động như yêu cầu. Đây là nhầm lẫn về cấu trúc API! ⚠️

Hy vọng phân tích này giúp bạn nắm vững SageMaker Autopilot! 🚀 Nếu cần code ví dụ Python/Boto3, hãy cho tôi biết nhé. 😊

Câu 108
Note: This question is part of a series of questions that present the same scenario. Each question in the series contains a unique solution that might meet the stated goals. Some question sets might have more than one correct solution, while others might not have a correct solution.
After you answer a question in this section, you will NOT be able to return to it. As a result, these questions will not appear in the review screen.
You are a data scientist using Azure Machine Learning Studio.
You need to normalize values to produce an output column into bins to predict a target column.
Solution: Apply a Quantiles normalization with a QuantileIndex normalization.
Does the solution meet the goal?
  1. A Yes
  2. B No
Xem giải thích

🧩 Giải thích nội dung câu hỏi

Câu hỏi này thuộc dạng series questions trong kỳ thi chứng chỉ (có thể là DP-100: Designing and Implementing a Data Science Solution on Azure), nơi mỗi câu hỏi trình bày một tình huống giống nhau nhưng giải pháp khác nhau. Bạn là data scientist sử dụng Azure Machine Learning Studio (phiên bản Classic, nay đã deprecated nhưng vẫn được dùng trong các kỳ thi).

Mục tiêu (goal): Chuẩn hóa (normalize) các giá trị để tạo ra một cột output được phân thành các bins (nhóm khoảng), nhằm hỗ trợ dự đoán cột target.

  • Bins ở đây nghĩa là phân chia dữ liệu liên tục (continuous) thành các nhóm rời rạc (discrete bins), ví dụ: chia tuổi thành các nhóm 0-20, 21-40,... để dễ dự đoán target (như phân loại).
  • Đây là kỹ thuật discretization hoặc binning, thường dùng trong feature engineering cho machine learning.

Giải pháp đề xuất (Solution): Áp dụng Quantiles normalization kết hợp với QuantileIndex normalization.
Câu hỏi yêu cầu đánh giá: Giải pháp này có đạt mục tiêu không? (Yes/No).

📘 Tài liệu tham khảo:

✅ Đáp án đúng: No

Lý do lựa chọn:
Giải pháp không đạt mục tiêu vì Quantiles normalization (trong module Normalize Data) chỉ chuẩn hóa phân phối dữ liệu để khớp với phân phối chuẩn (reference distribution), không tạo ra cột bins rời rạc. Nó giữ nguyên dữ liệu continuous, chỉ scale giá trị (ví dụ: chuyển phân phối thành uniform hoặc normal).

  • Để tạo bins, phải dùng module Discretize Data với Binning mode: Quantile (chia thành số lượng bins bằng nhau dựa trên quantile). "QuantileIndex normalization" không tồn tại trong Azure ML Studio (có thể là nhầm lẫn với Quantile method, nhưng không kết hợp để bin).
    🛠️ Giải pháp đúng nên là: Sử dụng Discretize Data module với Quantile binning (cập nhật Azure ML 2026: Trong Designer, dùng "Clip Values" hoặc custom script với pandas.qcut).

🧩 Phân tích tất cả các phương án

  • Yes ❌ SAI:
    Phương án này sai vì giải pháp không tạo bins. Quantiles normalization chỉ transform continuous values để có phân phối quantile giống nhau giữa các features, không phân nhóm thành bins discrete (như low/medium/high). Kết quả vẫn là continuous column, không hỗ trợ trực tiếp predict target bằng bins.

  • No ✅ ĐÚNG:
    Phương án này đúng vì giải pháp không meet goal. Module Normalize Data (Quantiles) dùng cho scaling/normalization (preprocessing distributions), không phải binning. Phải dùng Discretize Data hoặc Group Data into Bins để tạo output column với bins (integer hoặc categorical labels).

Hy vọng phân tích giúp bạn nắm vững! 🚀 Nếu cần thêm ví dụ code Python trong Azure ML, hãy hỏi nhé.

Câu 109
You are performing a filter-based feature selection for a dataset to build a multi-class classifier by using Azure Machine Learning Studio.
The dataset contains categorical features that are highly correlated to the output label column.
You need to select the appropriate feature scoring statistical method to identify the key predictors.
Which method should you use?
  1. A Kendall correlation
  2. B Spearman correlation
  3. C Chi-squared
  4. D Pearson correlation
Xem giải thích

🧩 Phân tích chi tiết nội dung câu hỏi

Câu hỏi tập trung vào quá trình lựa chọn đặc trưng dựa trên bộ lọc (filter-based feature selection) trong Azure Machine Learning Studio (nay là một phần của Azure Machine Learning workspace, với các công cụ designer tương tự). Bạn đang xây dựng một bộ phân loại đa lớp (multi-class classifier) cho một tập dữ liệu chứa các đặc trưng phân loại (categorical features) có độ tương quan cao với cột nhãn đầu ra (output label column).

Nhiệm vụ là chọn phương pháp thống kê chấm điểm đặc trưng (feature scoring statistical method) phù hợp nhất để xác định các yếu tố dự đoán chính (key predictors).

  • Bối cảnh chính: Các đặc trưng là categorical (dữ liệu phân loại, không phải số liên tục), và nhãn đầu ra cũng là categorical (multi-class). Do đó, cần phương pháp thống kê kiểm tra sự phụ thuộc độc lập (independence) giữa đặc trưng categorical và nhãn, thay vì đo lường tương quan tuyến tính dành cho dữ liệu số.
  • Mục tiêu: Trong Azure ML Studio, module Filter Based Feature Selection hỗ trợ các phương pháp như Chi-squared, Pearson correlation, v.v., để xếp hạng đặc trưng dựa trên điểm số thống kê.

📘 Tài liệu tham khảo:

✅ Đáp án đúng: Chi-squared

Lý do lựa chọn:

  • Chi-squared test là phương pháp thống kê chi-square test of independence, lý tưởng cho dữ liệu categorical (cả đặc trưng và nhãn). Nó kiểm tra xem đặc trưng có độc lập với nhãn hay không bằng cách tính toán sự khác biệt giữa tần suất quan sát và mong đợi trong bảng chéo (contingency table).
  • Trong Azure ML Studio, module Filter Based Feature Selection sử dụng Chi-squared để chấm điểm đặc trưng categorical so với nhãn categorical/multi-class, giúp loại bỏ đặc trưng không liên quan. Đây là lựa chọn chuẩn cho trường hợp này, đặc biệt khi đặc trưng "highly correlated" với nhãn categorical.
  • 🛠️ Ưu điểm: Không yêu cầu giả định phân phối chuẩn, phù hợp multi-class (sử dụng one-vs-rest hoặc pairwise).

❌ Giải thích tất cả các phương án (đúng/sai)

  • Kendall correlation ❌
    Sai vì: Đây là phương pháp đo tương quan thứ hạng (rank correlation) dành cho dữ liệu ordinal hoặc numerical, không phù hợp với categorical features thuần túy. Kendall tau kiểm tra sự đồng thuận thứ hạng giữa hai biến, nhưng Azure ML ưu tiên nó cho dữ liệu số/rank, không phải categorical nominal (phân loại không thứ tự). Sử dụng sẽ dẫn đến kết quả không chính xác hoặc lỗi.

  • Spearman correlation ❌
    Sai vì: Tương tự Kendall, Spearman là tương quan thứ hạng (rank-based) cho dữ liệu numerical hoặc ordinal, chuyển đổi dữ liệu thành rank rồi tính Pearson. Không dành cho categorical nominal; Azure ML dùng nó cho continuous/ordinal features, không hiệu quả với categorical vs multi-class label.

  • Chi-squared ✅
    Đúng vì: Như đã giải thích ở trên, đây là phương pháp duy nhất phù hợp cho categorical features và categorical label trong filter-based selection của Azure ML. Nó tính điểm dựa trên chi-square statistic, xếp hạng đặc trưng có tương quan mạnh nhất với nhãn. Hoàn hảo cho multi-class classifier.

  • Pearson correlation ❌
    Sai vì: Pearson đo tương quan tuyến tính dành riêng cho dữ liệu numerical liên tục (giả định phân phối chuẩn). Với categorical features, cần encode (one-hot), nhưng vẫn không chính xác bằng Chi-squared vì Pearson nhạy cảm với outliers và không kiểm tra independence đúng cách cho categorical data.

🧩 Kết luận: Chi-squared là lựa chọn tối ưu theo best practices Azure ML đến 2026, giúp mô hình classifier hiệu quả hơn bằng cách giữ lại key predictors categorical. Nếu áp dụng thực tế, hãy kết hợp với module One-hot Encoding trước nếu cần! 🚀

Câu 110
You are planning to register a trained model in an Azure Machine Learning workspace.
You must store additional metadata about the model in a key-value format. You must be able to add new metadata and modify or delete metadata after creation.
You need to register the model.
Which parameter should you use?
  1. A description
  2. B model_framework
  3. C tags
  4. D properties
Xem giải thích

🧩 Phân tích chi tiết nội dung câu hỏi

Câu hỏi tập trung vào quy trình đăng ký một mô hình đã huấn luyện (trained model) trong Azure Machine Learning workspace.
✅ Yêu cầu chính:

  • Lưu trữ metadata bổ sung dưới dạng key-value format (cặp khóa-giá trị).
  • Có thể thêm mới, sửa đổi hoặc xóa metadata sau khi tạo (tức là mutable - có thể thay đổi).

🛠️ Bối cảnh: Trong Azure ML, khi sử dụng SDK (như Python SDK v2 hoặc CLI), bạn đăng ký model qua phương thức Model.register() hoặc tương đương. Metadata có nhiều loại, nhưng chỉ một số hỗ trợ thay đổi sau khi đăng ký. Câu hỏi yêu cầu chọn tham số phù hợp để đáp ứng yêu cầu này.

📘 Kiến thức cập nhật (Azure ML SDK v2 - phiên bản mới nhất đến 2026): Theo tài liệu chính thức Microsoft, tags là trường mutable (có thể chỉnh sửa), trong khi properties và description là immutable (chỉ đọc sau khi tạo). Không có thay đổi lớn ở các bản cập nhật 2024-2026.

✅ Đáp án đúng: tags

Lý do lựa chọn:

  • Tags cho phép lưu trữ metadata dưới dạng key-value pairs linh hoạt.
  • Sau khi đăng ký model, bạn có thể thêm mới (add), sửa (modify) hoặc xóa (delete) tags qua SDK/CLI/portal mà không cần đăng ký lại model.
  • Ví dụ code (Python SDK v2):
    from azure.ai.ml.entities import Model
    model = Model(..., tags={"owner": "team1", "version": "v1.0"})
    ml_client.models.create_or_update(model)
    # Sau đó: ml_client.models.update_tags(name="model_name", tags={"new_tag": "value"})
    

🛠️ Phù hợp hoàn hảo với yêu cầu "store additional metadata... add new metadata and modify or delete metadata after creation".

📋 Giải thích tất cả các phương án

  • description ❌ SAI
    Description chỉ là một chuỗi văn bản mô tả ngắn gọn về model (string field). Nó immutable (không thể sửa sau khi đăng ký). Không hỗ trợ key-value format và không thể thêm/sửa/xóa linh hoạt. Chỉ dùng để cung cấp thông tin tĩnh.

  • model_framework ❌ SAI
    Đây là tham số chỉ định framework của model (ví dụ: "sklearn", "tensorflow", "pytorch"). Nó immutable sau đăng ký, không phải metadata tùy chỉnh key-value. Chỉ dùng để phân loại framework, không hỗ trợ thêm/sửa metadata bổ sung.

  • tags ✅ ĐÚNG (Như đã giải thích ở trên)
    Là trường key-value dictionary mutable, lý tưởng cho metadata động như owner, version, environment... Có thể quản lý qua portal Azure ML hoặc SDK.

  • properties ❌ SAI
    Properties cũng là key-value pairs, nhưng immutable (chỉ đọc sau khi đăng ký). Bạn chỉ set một lần lúc tạo, không thể thêm/sửa/xóa sau. Dùng cho thông tin cố định như model_type, không phù hợp yêu cầu "modify or delete after creation".

📚 Tài liệu tham khảo

Hy vọng phân tích này giúp bạn nắm vững! 🚀 Nếu cần ví dụ code chi tiết hơn, hãy hỏi nhé!