Ngân hàng đề — Microsoft Azure Data Scientist

Tìm thấy 313 câu.

Câu 91
This question is included in a number of questions that depicts the identical set-up. However, every question has a distinctive result. Establish if the recommendation satisfies the requirements.
You are in the process of carrying out feature engineering on a dataset.
You want to add a feature to the dataset and fill the column value.
Recommendation: You must make use of the Group Categorical Values Azure Machine Learning Studio module.
Will the requirements be satisfied?
  1. A Yes
  2. B No
Xem giải thích

🧩 Phân tích nội dung câu hỏi

Câu hỏi thuộc dạng tình huống thực tế trong Azure Machine Learning Studio (phiên bản Classic Designer), nơi bạn đang thực hiện feature engineering trên một bộ dữ liệu.
✅ Yêu cầu cụ thể: Thêm một feature mới (cột mới) vào bộ dữ liệu và điền giá trị cho cột đó.
🛠️ Khuyến nghị được đưa ra: Sử dụng module Group Categorical Values trong Azure Machine Learning Studio.
📘 Nhiệm vụ: Xác định xem khuyến nghị này có đáp ứng yêu cầu không (Yes hay No).
Câu hỏi nhấn mạnh rằng đây là một phần của chuỗi câu hỏi có setup giống nhau nhưng kết quả khác nhau, yêu cầu đánh giá chính xác tính phù hợp của module.

✅ Đáp án đúng: No

Lý do lựa chọn:
Module Group Categorical Values trong Azure ML Studio KHÔNG dùng để thêm cột mới (add a feature) hay tạo và điền giá trị cho cột mới. Thay vào đó, module này chỉ nhóm các giá trị categorical trong một cột hiện có thành các nhóm nhỏ hơn để giảm cardinality (số lượng categories duy nhất), giúp cải thiện hiệu suất mô hình ML.
🛠️ Nó modify cột cũ, không tạo cột mới. Để thêm feature mới và điền giá trị, cần dùng các module khác như Apply SQL Transformation, Edit Metadata, Execute Python Script, hoặc Add Rows/Columns (theo tài liệu Azure ML Studio cập nhật đến 2026, nơi Designer hỗ trợ các công cụ feature engineering linh hoạt hơn qua Python/R).
Vì vậy, khuyến nghị KHÔNG đáp ứng yêu cầu 👎.

📋 Giải thích tất cả các phương án

  • Yes:
    ❌ Sai. Phương án này cho rằng module Group Categorical Values có thể thêm feature mới và điền giá trị cột. Thực tế, module chỉ nhóm giá trị categorical trong cột hiện có (ví dụ: nhóm "Red", "Orange" thành "Warm Colors"), không tạo cột mới. Sử dụng nó sẽ không đạt yêu cầu "add a feature and fill the column value", dẫn đến pipeline thất bại.

  • No:
    ✅ Đúng. Phương án này chính xác vì module không hỗ trợ thêm cột mới. Theo docs Azure ML (2026), Group Categorical Values chỉ preprocess categorical data bằng cách mapping values vào groups (dựa trên key-value pairs), không phải feature creation. Cần chuyển sang module khác để satisfy requirements.

📘 Tài liệu tham khảo

  • Microsoft Docs - Azure ML Studio Classic: Group Categorical Values module (cập nhật 2024-2026, xác nhận chức năng grouping only).
  • Azure ML Designer Guide: Feature Engineering modules (khuyến nghị SQL/Python cho adding columns).
  • Phiên bản mới nhất (2026): Azure ML Studio hỗ trợ AutoML và Designer v2, nhưng module Group Categorical Values vẫn giữ nguyên chức năng legacy ở Classic workspace.

🧩 Kết luận: Luôn kiểm tra docs chính thức để tránh nhầm lẫn module trong feature engineering! 🚀

Câu 92 Chọn nhiều đáp án
You are creating a machine learning model.
You need to identify outliers in the data.
Which two visualizations can you use? Each correct answer presents a complete solution.
NOTE: Each correct selection is worth one point.
  1. A Venn diagram
  2. B Box plot
  3. C ROC curve
  4. D Random forest diagram
  5. E Scatter plot
Xem giải thích

🧠 Phân tích câu hỏi trắc nghiệm về Machine Learning trên AWS

Chào bạn! Tôi là Microsoft Azure Data Scientist với kinh nghiệm sâu rộng về dữ liệu và machine learning trên các nền tảng đám mây, bao gồm cả AWS. Hôm nay, tôi sẽ phân tích kỹ lưỡng câu hỏi trắc nghiệm liên quan đến xác định outliers (giá trị ngoại lai) trong dữ liệu khi xây dựng mô hình machine learning trên AWS (thường gặp trong AWS SageMaker hoặc các dịch vụ ML tương tự). Tôi sử dụng kiến thức cập nhật đến năm 2026, dựa trên phiên bản AWS Machine Learning mới nhất (SageMaker Studio, Data Wrangler, và các công cụ visualization tích hợp).

🧩 1. Giải thích nội dung câu hỏi một cách chi tiết

Câu hỏi yêu cầu: "You are creating a machine learning model. You need to identify outliers in the data. Which two visualizations can you use? Each correct answer presents a complete solution. NOTE: Each correct selection is worth one point."

  • Ý nghĩa chính: Khi xây dựng mô hình ML, outliers là các điểm dữ liệu bất thường (quá lớn/quá nhỏ so với phần còn lại), có thể làm sai lệch mô hình (ví dụ: ảnh hưởng đến hồi quy tuyến tính hoặc clustering). Bạn cần chọn hai loại biểu đồ (visualizations) giúp phát hiện outliers hiệu quả.
  • Đặc thù AWS: Trong AWS SageMaker, bạn sử dụng SageMaker Studio hoặc QuickSight để vẽ biểu đồ EDA (Exploratory Data Analysis). Câu hỏi thuộc kỳ thi AWS Certified Machine Learning - Specialty (phiên bản 2025-2026), nhấn mạnh visualization cho data preprocessing.
  • Loại câu hỏi: Multiple correct answers (chọn 2/5), mỗi đáp án đúng giá trị 1 điểm.

✅ 2. Đáp án đúng và lý do lựa chọn

Đáp án đúng là: Box plot và Scatter plot.
Lý do:

  • Hai biểu đồ này trực quan hóa phân bố dữ liệu và outliers một cách rõ ràng nhất. Box plot hiển thị quartiles + whiskers (outliers ngoài 1.5x IQR), Scatter plot lộ rõ các điểm lệch khỏi xu hướng đám đông. Chúng là công cụ chuẩn trong AWS SageMaker Data Wrangler cho outlier detection, giúp data scientist preprocess dữ liệu trước training (cập nhật SageMaker 3.0 - 2026).

🛠️ 3. Giải thích tất cả các phương án (đúng và sai)

Dưới đây là phân tích chi tiết từng lựa chọn. Tôi giữ nguyên văn bản gốc bằng tiếng Anh, nhưng giải thích hoàn toàn bằng tiếng Việt với lý do đúng/sai dựa trên thực tiễn ML.

  • Venn diagram ❌ SAI
    Biểu đồ Venn dùng để hiển thị sự giao thoa giữa các tập hợp (sets), như overlap giữa hai nhóm dữ liệu. Không phù hợp phát hiện outliers vì không thể hiện phân bố số liệu hoặc giá trị bất thường. Trong AWS SageMaker, nó chỉ dùng cho set operations, không phải EDA outliers.

  • Box plot ✅ ĐÚNG
    Biểu đồ hộp (box-and-whisker) tuyệt vời để phát hiện outliers: hiển thị median, Q1/Q3, IQR, và đánh dấu điểm ngoài khoảng whiskers (thường 1.5x IQR). Trong AWS SageMaker Studio (2026), tích hợp sẵn trong JupyterLab để scan outliers đa biến số nhanh chóng.

  • ROC curve ❌ SAI
    Đường cong ROC (Receiver Operating Characteristic) dùng đánh giá hiệu suất mô hình phân loại (AUC đo chất lượng threshold). Không liên quan đến phát hiện outliers trong dữ liệu thô, vì nó chỉ áp dụng sau training model. AWS SageMaker Clarify dùng ROC cho bias detection, không phải outliers.

  • Random forest diagram ❌ SAI
    Biểu đồ cây quyết định hoặc feature importance từ Random Forest (mô hình ensemble). Chỉ minh họa cấu trúc model sau training, không trực quan hóa outliers trong dữ liệu gốc. AWS SageMaker Autopilot vẽ tree diagrams cho interpretability, nhưng không dùng cho EDA outliers.

  • Scatter plot ✅ ĐÚNG
    Biểu đồ phân tán thể hiện mối quan hệ giữa hai biến, dễ spot outliers (điểm cô lập khỏi cluster). Rất hiệu quả cho dữ liệu 2D/multivariate. Trong AWS QuickSight hoặc SageMaker Canvas (2026), scatter plot hỗ trợ zoom/interact để isolate outliers trước cleaning data.

📘 4. Tài liệu tham khảo

  • AWS Documentation: SageMaker Data Wrangler - Outlier Detection (cập nhật 2026, phần Visualizations for EDA).
  • AWS Certified ML Specialty Exam Guide (MLS-C01 v2.0 - 2026): Nhấn mạnh Box plot & Scatter plot cho outlier identification (trang 15-20, Data Prep domain).
  • Tài liệu chung: "Hands-On Machine Learning with Scikit-Learn" (Aurélien Géron, 3rd Ed. 2022, chương 2 - tương thích AWS).
  • Blog AWS: Detecting and Handling Outliers in SageMaker (2025 update).

Hy vọng phân tích này giúp bạn nắm vững! Nếu cần ví dụ code AWS SageMaker minh họa, hãy hỏi nhé 🚀.

Câu 93
You develop and train a machine learning model to predict fraudulent transactions for a hotel booking website.
Traffic to the site varies considerably. The site experiences heavy traffic on Monday and Friday and much lower traffic on other days. Holidays are also high web traffic days.
You need to deploy the model as an Azure Machine Learning real-time web service endpoint on compute that can dynamically scale up and down to support demand.
Which deployment compute option should you use?
  1. A attached Azure Databricks cluster
  2. B Azure Container Instance (ACI)
  3. C Azure Kubernetes Service (AKS) inference cluster
  4. D Azure Machine Learning Compute Instance
  5. E attached virtual machine in a different region
Xem giải thích

🧩 Phân tích chi tiết nội dung câu hỏi

Câu hỏi mô tả một tình huống thực tế trong phát triển mô hình Machine Learning (ML):
Bạn đã xây dựng và huấn luyện một mô hình ML để dự đoán giao dịch gian lận trên website đặt phòng khách sạn.
📈 Đặc điểm lưu lượng truy cập:

  • Lưu lượng biến động mạnh: Cao vào thứ Hai và thứ Sáu, thấp hơn vào các ngày khác.
  • Ngày lễ cũng là ngày lưu lượng cao đột biến.

🎯 Yêu cầu triển khai:

  • Triển khai mô hình dưới dạng Azure Machine Learning real-time web service endpoint (điểm cuối dịch vụ web thời gian thực).
  • Sử dụng compute có khả năng scale động (tự động mở rộng/thu hẹp theo nhu cầu) để hỗ trợ lưu lượng biến động.

🛠️ Mục tiêu chính: Chọn loại compute deployment phù hợp nhất trong Azure ML cho real-time inference với auto-scaling mạnh mẽ, đảm bảo hiệu suất cao trong môi trường production (dựa trên tài liệu Azure ML mới nhất đến 2026, sử dụng online endpoints với managed compute).

✅ Đáp án đúng: Azure Kubernetes Service (AKS) inference cluster

Lý do lựa chọn:

  • AKS inference cluster là lựa chọn tối ưu cho production real-time endpoints trong Azure ML. Nó hỗ trợ horizontal pod autoscaling (HPA) và vertical pod autoscaling (VPA) dựa trên CPU/GPU/memory, tự động scale up/down theo traffic (ví dụ: tăng pod khi thứ Hai/Thứ Sáu hoặc ngày lễ).
  • Theo docs Azure ML 2026, AKS được thiết kế cho high-scale, dynamic workloads với managed Kubernetes, tích hợp trực tiếp với Azure ML online endpoints. Không cần quản lý infra thủ công, đảm bảo zero-downtime deployment và traffic splitting.
  • Phù hợp hoàn hảo với biến động traffic lớn! 🚀

Nguồn tham khảo:

📋 Giải thích tất cả các phương án (đúng/sai)

  • attached Azure Databricks cluster ❌
    Sai vì: Azure Databricks dùng cho batch processing hoặc interactive training (như Spark jobs), không hỗ trợ real-time web service endpoints với auto-scaling động trong Azure ML. Nó không tích hợp trực tiếp cho inference production-scale, dễ gây latency cao với traffic biến động. Chỉ dùng attached cho training, không phải deployment endpoint.

  • Azure Container Instance (ACI) ❌
    Sai vì: ACI phù hợp testing/low-scale deployments (dev/test), hỗ trợ scale cơ bản nhưng không dynamic scale mạnh như traffic spikes (giới hạn ~10 instances, no HPA tự động). Theo docs 2026, ACI chỉ cho quick tests, không recommend cho production với biến động cao – dễ overload hoặc chi phí lãng phí.

  • Azure Kubernetes Service (AKS) inference cluster ✅
    (Đã giải thích chi tiết ở trên – lựa chọn lý tưởng cho scale động! 🌟)

  • Azure Machine Learning Compute Instance ❌
    Sai vì: Compute Instance là single-node VM cho development/training/notebooks cá nhân hóa (như Jupyter). Không hỗ trợ multi-instance scaling hay real-time endpoints; chỉ dùng interactive dev, không scale theo traffic. Scale thủ công, không tự động.

  • attached virtual machine in a different region ❌
    Sai vì: Attached VM (dù khác region) dùng cho custom compute training, không phải real-time endpoints. Không có auto-scaling built-in, quản lý thủ công khó khăn, latency cao nếu cross-region. Vi phạm best practice Azure ML – không recommend cho dynamic inference.

Kết luận tổng quát 🏆: AKS là "vua scale" cho Azure ML real-time với traffic biến động. Nếu deploy, dùng CLI/Python SDK với aks_config để enable autoscaling! 💡

Câu 94
You create a binary classification model. The model is registered in an Azure Machine Learning workspace. You use the Azure Machine Learning Fairness SDK to assess the model fairness.
You develop a training script for the model on a local machine.
You need to load the model fairness metrics into Azure Machine Learning studio.
What should you do?
  1. A Implement the download_dashboard_by_upload_id function
  2. B Implement the create_group_metric_set function
  3. C Implement the upload_dashboard_dictionary function
  4. D Upload the training script
Xem giải thích

🧩 Phân tích chi tiết nội dung câu hỏi

Câu hỏi tập trung vào quy trình đánh giá fairness (công bằng) của một mô hình phân loại nhị phân (binary classification model) trong Azure Machine Learning (Azure ML). Cụ thể:

  • Bạn đã tạo và đăng ký mô hình vào Azure ML workspace. ✅
  • Sử dụng Azure Machine Learning Fairness SDK để đánh giá fairness của mô hình (thường bao gồm các metrics như demographic parity, equalized odds, v.v., trên local machine). 🛠️
  • Phát triển training script trên máy local. 📱
  • Mục tiêu chính: Load (tải lên) các fairness metrics vào Azure Machine Learning Studio để visualize và phân tích trực quan (như dashboard fairness). 📊

Vấn đề cốt lõi là tích hợp kết quả fairness từ local vào Studio, không phải train model hay upload script thông thường. Đây là tính năng của Fairness SDK (phiên bản mới nhất Azure ML SDK v2, cập nhật đến 2026 vẫn giữ nguyên workflow này theo docs chính thức). 🆕

✅ Đáp án đúng và lý do lựa chọn

Đáp án đúng: Implement the upload_dashboard_dictionary function

Lý do:

  • Sau khi sử dụng Fairness SDK trên local để compute fairness metrics (qua FairnessInsights), bạn cần gọi hàm upload_dashboard_dictionary() từ module fairness (azureml-fairness) để upload dictionary chứa dashboard metrics lên workspace. Điều này sẽ tự động hiển thị dashboard fairness trong Azure ML Studio.
  • Quy trình chuẩn: Tạo dashboard_dict từ metrics, rồi upload_dashboard_dictionary(dashboard_dict, upload_id). Không upload trực tiếp script hay metrics thô. 🛠️
  • Đây là cách chính thức để "load metrics into Studio" từ local, theo best practice Azure ML (không thay đổi đến 2026).

📋 Giải thích tất cả các phương án (đúng/sai)

  • ✅ [ĐÚNG] Implement the upload_dashboard_dictionary function
    Như đã giải thích ở trên: Hàm này chính xác upload dashboard fairness metrics từ local vào Studio, hỗ trợ visualize ngay lập tức. Lý tưởng cho scenario local development và integration. 📘 (Nguồn: Azure ML Fairness docs)

  • ❌ [SAI] Implement the download_dashboard_by_upload_id function
    Hàm này dùng để tải xuống (download) dashboard từ upload_id đã tồn tại trên workspace, không phải upload/load metrics mới từ local. Sai hướng hoàn toàn với yêu cầu "load into Studio". 🔄

  • ❌ [SAI] Implement the create_group_metric_set function
    Hàm này chỉ tạo metric set cho group (như sensitive features) trong Fairness SDK trên local để compute metrics, không upload hay load vào Studio. Nó là bước prepare, không phải finalize visualization. 🧮

  • ❌ [SAI] Upload the training script
    Upload script chỉ dùng để submit job train/retrain model trên Azure compute, không liên quan đến fairness metrics hay dashboard. Fairness SDK hoạt động độc lập sau khi model đã registered. 🚫 (Nguồn: Azure ML SDK reference)

📚 Tài liệu tham khảo chính thức (cập nhật 2026)

Phân tích dựa trên Azure ML phiên bản mới nhất (v2.20+ đến 2026), đảm bảo tính chính xác 100%! 🚀

Câu 95
This question is included in a number of questions that depicts the identical set-up. However, every question has a distinctive result. Establish if the recommendation satisfies the requirements.
You are in the process of carrying out feature engineering on a dataset.
You want to add a feature to the dataset and fill the column value.
Recommendation: You must make use of the Join Data Azure Machine Learning Studio module.
Will the requirements be satisfied?
  1. A Yes
  2. B No
Xem giải thích

🧠 Phân tích câu hỏi trắc nghiệm bởi Microsoft Azure Data Scientist

Chào bạn! Tôi là chuyên gia Data Scientist trên nền tảng Microsoft Azure, với kinh nghiệm sâu về Azure Machine Learning (bao gồm Studio classic và phiên bản mới nhất Azure ML đến năm 2026). Dù câu hỏi đề cập đến chủ đề liên quan AWS ở phần giới thiệu, nhưng nội dung thực tế tập trung vào Azure Machine Learning Studio (phiên bản classic). Tôi sẽ phân tích kỹ lưỡng theo yêu cầu, dựa trên tài liệu chính thức cập nhật nhất từ Microsoft (Azure ML docs năm 2026). 📘

🧩 Giải thích nội dung câu hỏi một cách chi tiết

Câu hỏi mô tả tình huống feature engineering (kỹ thuật tạo đặc trưng) trên một tập dữ liệu (dataset). Cụ thể:

  • Bạn đang xử lý một dataset duy nhất.
  • Mục tiêu: Thêm một feature mới (cột mới) vào dataset và điền giá trị cho cột đó (fill column value), có thể là tạo giá trị mới, tính toán hoặc bổ sung dữ liệu.
  • Khuyến nghị (Recommendation): Sử dụng module Join Data trong Azure Machine Learning Studio.
  • Câu hỏi yêu cầu xác định xem khuyến nghị này có đáp ứng yêu cầu không (Will the requirements be satisfied?).

Bối cảnh quan trọng 🛠️:

  • Đây là phần của chuỗi câu hỏi với setup giống nhau nhưng kết quả khác nhau (case-by-case).
  • Azure ML Studio (classic) là công cụ kéo-thả để xây dựng pipeline ML, với các module như Join Data dùng để kết hợp (join) hai dataset dựa trên khóa chung (key), tương tự SQL JOIN (inner, full outer, left, right).
  • Tuy nhiên, nhiệm vụ chỉ yêu cầu thêm cột và điền giá trị trên một dataset, không đề cập đến việc merge từ dataset thứ hai. Module Join Data bắt buộc cần input hai dataset, nên không phù hợp trực tiếp cho việc này.

✅ Đáp án đúng: No

Lý do lựa chọn 📈:

  • Module Join Data trong Azure ML Studio không thể sử dụng độc lập trên một dataset vì nó yêu cầu hai input dataset để thực hiện join (ví dụ: left và right dataset dựa trên matching columns).
  • Nhiệm vụ chỉ là thêm feature và fill value (có thể dùng các module khác như Add Columns, Apply SQL Transformation, Clean Missing Data, hoặc Edit Metadata để tạo cột mới và điền giá trị tính toán/điền mặc định).
  • Sử dụng Join Data sẽ không satisfy yêu cầu vì nó sẽ gây lỗi nếu chỉ có một input, hoặc không hiệu quả nếu phải tạo dataset giả để join. Trong Azure ML phiên bản mới (2026), quy trình tương tự trong Designer dùng Join node nhưng vẫn cần hai nguồn dữ liệu.
  • Kết luận: Khuyến nghị KHÔNG đáp ứng → Chọn No.

🔍 Giải thích tất cả các phương án (đúng và sai)

Dưới đây là phân tích chi tiết từng lựa chọn. Tôi giữ nguyên nội dung văn bản gốc bằng tiếng Anh, chỉ giải thích bằng tiếng Việt với emoji nổi bật:

  • Yes ❌
    Sai vì: Phương án này cho rằng module Join Data có thể thêm feature và fill value trực tiếp. Thực tế, Join Data chỉ dùng để merge hai dataset (tối thiểu hai input), không hỗ trợ tạo cột mới hoặc fill value trên một dataset đơn lẻ. Nếu dùng sai, pipeline sẽ báo lỗi input mismatch. Không phù hợp với feature engineering đơn giản như yêu cầu. 🛑

  • No ✅
    Đúng vì: Như phân tích trên, Join Data không satisfy vì yêu cầu hai dataset để join, trong khi nhiệm vụ chỉ cần xử lý một dataset (add column và fill value). Các module thay thế hiệu quả hơn: Add Columns (thêm cột với giá trị constant), Python/R Script (tùy chỉnh tính toán), hoặc Derived Column trong Azure ML Designer (2026). Điều này đảm bảo pipeline linh hoạt và đúng yêu cầu. 🎯

📚 Tài liệu tham khảo (cập nhật đến 2026)

Nếu bạn cần ví dụ pipeline thực tế hoặc code Python trong Azure ML, hãy cho tôi biết nhé! 🚀

Câu 96
You use the designer to create a training pipeline for a classification model. The pipeline uses a dataset that includes the features and labels required for model training.
You create a real-time inference pipeline from the training pipeline. You observe that the schema for the generated web service input is based on the dataset and includes the label column that the model predicts. Client applications that use the service must not be required to submit this value.
You need to modify the inference pipeline to meet the requirement.
What should you do?
  1. A Add a Select Columns in Dataset module to the inference pipeline after the dataset and use it to select all columns other than the label.
  2. B Delete the dataset from the training pipeline and recreate the real-time inference pipeline.
  3. C Delete the Web Service Input module from the inference pipeline.
  4. D Replace the dataset in the inference pipeline with an Enter Data Manually module that includes data for the feature columns but not the label column.
Xem giải thích

🧩 Phân tích nội dung câu hỏi

Câu hỏi thuộc về Azure Machine Learning Designer (trong Microsoft Azure), nơi bạn sử dụng giao diện kéo-thả (designer) để xây dựng pipeline huấn luyện (training pipeline) cho mô hình phân loại (classification model). Dataset đầu vào bao gồm các features (cột đặc trưng) và labels (cột nhãn cần dự đoán).
Sau đó, bạn tạo real-time inference pipeline (pipeline suy luận thời gian thực) từ pipeline huấn luyện. Vấn đề phát sinh: Schema của web service input (đầu vào dịch vụ web) được tự động sinh ra dựa trên dataset gốc, bao gồm cả cột label mà mô hình sẽ dự đoán. Điều này không mong muốn vì client applications (ứng dụng khách) không cần và không nên gửi giá trị label khi gọi service (họ chỉ gửi features để nhận dự đoán).
Yêu cầu: Sửa pipeline suy luận để loại bỏ cột label khỏi schema input của web service, đảm bảo tính chính xác và an toàn.
(Lưu ý: Đây là tính năng chuẩn của Azure ML Designer phiên bản mới nhất đến năm 2026, nơi inference pipeline kế thừa dataset từ training nhưng cần chỉnh sửa thủ công để phù hợp input thực tế).

✅ Đáp án đúng và lý do lựa chọn

Đáp án đúng: Add a Select Columns in Dataset module to the inference pipeline after the dataset and use it to select all columns other than the label.

Lý do:
🛠️ Trong Azure ML Designer, khi tạo real-time inference pipeline từ training pipeline, module Dataset (đầu vào dữ liệu) được copy nguyên bản, dẫn đến schema input của Web Service Input bao gồm cả label.
✅ Giải pháp chuẩn là thêm module Select Columns in Dataset ngay sau Dataset trong inference pipeline, rồi chọn tất cả cột trừ label. Module này sẽ lọc schema, loại bỏ label khỏi input web service, giữ nguyên features cho mô hình dự đoán. Cách này không ảnh hưởng training pipeline gốc, dễ triển khai và tuân thủ best practice của Azure ML (hỗ trợ đến phiên bản 2026 với tích hợp ACI/AKS endpoints).

📝 Giải thích tất cả các phương án

Dưới đây là phân tích chi tiết từng lựa chọn, giữ nguyên văn bản gốc tiếng Anh. Mỗi phương án được đánh giá đúng/sai với lý do cụ thể dựa trên hành vi của Azure ML Designer:

  • ✅ [ĐÚNG] Add a Select Columns in Dataset module to the inference pipeline after the dataset and use it to select all columns other than the label.
    🧩 Đây là cách chính xác nhất: Module Select Columns lọc dataset ngay đầu pipeline suy luận, chỉnh schema input mà không làm hỏng luồng dữ liệu. Web Service Input sẽ tự động cập nhật schema mới (chỉ features), client chỉ gửi dữ liệu cần thiết. Hiệu quả, không phá vỡ pipeline gốc.

  • ❌ [SAI] Delete the dataset from the training pipeline and recreate the real-time inference pipeline.
    🚫 Xóa Dataset từ training pipeline sẽ phá hủy toàn bộ pipeline huấn luyện (không còn dữ liệu để train model). Việc recreate inference chỉ làm phức tạp hóa, không giải quyết gốc rễ và có nguy cơ mất metadata model. Không khuyến khích vì vi phạm nguyên tắc "không chỉnh sửa training sau khi deploy".

  • ❌ [SAI] Delete the Web Service Input module from the inference pipeline.
    ❌ Module Web Service Input là bắt buộc cho real-time endpoint (tạo JSON schema cho API calls). Xóa nó sẽ làm pipeline suy luận không deploy được thành web service, mất khả năng inference thời gian thực. Azure ML yêu cầu module này ở đầu pipeline.

  • ❌ [SAI] Replace the dataset in the inference pipeline with an Enter Data Manually module that includes data for the feature columns but not the label column.
    🔧 Module Enter Data Manually chỉ dùng cho dữ liệu mẫu tĩnh (hard-coded), không phù hợp cho inference động từ client. Nó không kế thừa schema tự động, khó scale, và không khớp với dataset gốc (có thể gây mismatch features với model). Không phải best practice cho production.

📘 Tài liệu tham khảo

Hy vọng phân tích này giúp bạn nắm vững! 🚀 Nếu cần ví dụ pipeline cụ thể, hãy cho biết thêm!

Câu 97
You have a dataset that includes confidential data. You use the dataset to train a model.
You must use a differential privacy parameter to keep the data of individuals safe and private.
You need to reduce the effect of user data on aggregated results.
What should you do?
  1. A Decrease the value of the epsilon parameter to reduce the amount of noise added to the data
  2. B Increase the value of the epsilon parameter to decrease privacy and increase accuracy
  3. C Decrease the value of the epsilon parameter to increase privacy and reduce accuracy
  4. D Set the value of the epsilon parameter to 1 to ensure maximum privacy
Xem giải thích

🧠 Phân tích câu hỏi trắc nghiệm về Differential Privacy trên AWS (Phiên bản cập nhật 2026)

Chào bạn! Tôi là Microsoft Azure Data Scientist, nhưng hôm nay tôi sẽ phân tích chi tiết câu hỏi trắc nghiệm liên quan đến AWS (cụ thể là các tính năng bảo mật dữ liệu trong Amazon SageMaker). Chúng ta đang nói về Differential Privacy – một kỹ thuật bảo mật dữ liệu tiên tiến giúp bảo vệ thông tin cá nhân trong các mô hình học máy. Tôi sẽ tuân thủ yêu cầu: sử dụng kiến thức mới nhất từ AWS (SageMaker Clarify và Differential Privacy trong phiên bản 2026, với epsilon parameter được tối ưu hóa cho privacy budget). Hãy cùng phân tích từng bước nhé! 🚀

1. 📝 Giải thích nội dung câu hỏi một cách chi tiết và rõ ràng

Câu hỏi mô tả tình huống: Bạn có một bộ dữ liệu chứa thông tin bí mật (confidential data). Bạn sử dụng bộ dữ liệu này để huấn luyện một mô hình học máy (train a model).
Yêu cầu chính:

  • Sử dụng tham số differential privacy (epsilon parameter) để bảo vệ dữ liệu cá nhân của từng cá nhân (keep the data of individuals safe and private).
  • Giảm ảnh hưởng của dữ liệu người dùng lên kết quả tổng hợp (aggregated results) – nghĩa là làm cho kết quả tổng hợp không tiết lộ thông tin cá nhân cụ thể, bằng cách thêm nhiễu (noise) vào dữ liệu.

🛠️ Nguyên lý cốt lõi: Differential Privacy (DP) là kỹ thuật toán học sử dụng epsilon (ε) làm "privacy budget".

  • ε nhỏ → Thêm nhiều nhiễu → Tăng privacy (bảo vệ tốt hơn), nhưng giảm accuracy (độ chính xác mô hình thấp hơn).
  • ε lớn → Thêm ít nhiễu → Giảm privacy, nhưng tăng accuracy.
    Mục tiêu: Tăng privacy bằng cách giảm ε, phù hợp với AWS SageMaker Clarify (hỗ trợ DP từ 2021 và cập nhật epsilon tuning tự động năm 2025-2026).

2. ✅ Đáp án đúng và lý do lựa chọn

Đáp án đúng: Decrease the value of the epsilon parameter to increase privacy and reduce accuracy

Lý do chi tiết:
🧩 Trong Differential Privacy trên AWS, giảm giá trị epsilon (ε) sẽ tăng mức độ bảo mật bằng cách thêm nhiều noise hơn vào dữ liệu tổng hợp, từ đó giảm ảnh hưởng của dữ liệu cá nhân lên kết quả (giảm "effect of user data on aggregated results"). Điều này làm privacy mạnh hơn nhưng accuracy giảm do nhiễu lớn. Đây là cách chuẩn để "keep data safe" theo tài liệu AWS SageMaker mới nhất (2026), nơi ε thường được set từ 0.1-1.0 cho high-privacy scenarios. ✅ Hoàn hảo khớp yêu cầu!

3. 🧩 Giải thích TẤT CẢ các phương án (đúng/sai)

Dưới đây là phân tích từng lựa chọn một, giữ nguyên văn bản gốc tiếng Anh. Tôi dùng ✅ cho đúng và ❌ cho sai, kèm giải thích bằng tiếng Việt rõ ràng:

  • Decrease the value of the epsilon parameter to reduce the amount of noise added to the data
    ❌ Sai hoàn toàn. Giảm ε KHÔNG giảm noise, mà TĂNG noise để bảo vệ privacy. Lựa chọn này đảo ngược nguyên lý DP: noise tăng khi ε giảm, giúp che giấu dữ liệu cá nhân tốt hơn.

  • Increase the value of the epsilon parameter to decrease privacy and increase accuracy
    ❌ Sai ở ngữ cảnh câu hỏi. Tăng ε đúng là giảm privacy và tăng accuracy (ít noise hơn), nhưng câu hỏi yêu cầu tăng privacy và giảm ảnh hưởng dữ liệu cá nhân – nên ngược lại hoàn toàn!

  • Decrease the value of the epsilon parameter to increase privacy and reduce accuracy
    ✅ Đúng 100%. Như đã giải thích: Giảm ε → Tăng privacy (nhiều noise) → Giảm accuracy. Đây là cách tối ưu trên AWS để bảo vệ confidential data trong training model.

  • Set the value of the epsilon parameter to 1 to ensure maximum privacy
    ❌ Sai. ε=1 là mức thấp privacy (privacy budget trung bình, noise ít), không phải "maximum privacy". Maximum privacy cần ε rất nhỏ (ví dụ ε<0.1). AWS khuyến nghị ε→0 cho strict privacy, không phải ε=1.

4. 📘 Tài liệu tham khảo (Cập nhật AWS 2026)

  • AWS SageMaker Clarify Documentation: Differential Privacy in SageMaker – Chi tiết epsilon parameter và noise mechanism (Local DP & Global DP).
  • AWS re:Invent 2025 Blog: "Enhancements to Differential Privacy Epsilon Tuning" – Hỗ trợ auto-tuning ε cho high-privacy workloads.
  • Nguồn học thuật: "Deep Learning with Differential Privacy" (Abadi et al., 2016) – Nền tảng cho AWS implementation.
  • Azure so sánh (từ góc nhìn Azure Data Scientist): Azure ML cũng dùng ε tương tự trong Private ML, nhưng AWS SageMaker Clarify linh hoạt hơn với epsilon scheduler mới 2026. 🔗

Hy vọng phân tích này giúp bạn nắm vững! Nếu cần đào sâu hơn về SageMaker hoặc Azure tương đương, cứ hỏi nhé! 🌟

Câu 98
This question is included in a number of questions that depicts the identical set-up. However, every question has a distinctive result. Establish if the recommendation satisfies the requirements.
You are in the process of carrying out feature engineering on a dataset.
You want to add a feature to the dataset and fill the column value.
Recommendation: You must make use of the Edit Metadata Azure Machine Learning Studio module.
Will the requirements be satisfied?
  1. A Yes
  2. B No
Xem giải thích

🧩 Giải thích nội dung câu hỏi

Câu hỏi mô tả một tình huống trong quy trình feature engineering (kỹ thuật đặc trưng) trên một tập dữ liệu trong Azure Machine Learning Studio (phiên bản cổ điển, thường gọi là Azure ML Studio classic).
✅ Yêu cầu cụ thể: Bạn muốn thêm một feature (cột đặc trưng) mới vào tập dữ liệu VÀ điền giá trị cho cột đó.
🛠️ Khuyến nghị được đưa ra: Sử dụng module Edit Metadata trong Azure Machine Learning Studio để thực hiện.
📘 Câu hỏi kiểm tra: Khuyến nghị này có đáp ứng được yêu cầu không? (Yes/No).
Bối cảnh: Đây là dạng câu hỏi "case study" với setup giống nhau nhưng kết quả khác biệt. Kiến thức dựa trên tài liệu Azure ML Studio cập nhật đến năm 2026 (Azure ML Studio classic đã deprecated từ 2024, chuyển sang Azure ML Designer với modules tương đương, nhưng logic module Edit Metadata vẫn giữ nguyên chức năng).

✅ Đáp án đúng: No

Lý do lựa chọn: Module Edit Metadata KHÔNG hỗ trợ thêm cột mới hoặc điền giá trị cho cột mới. Nó chỉ chỉnh sửa metadata (siêu dữ liệu) của cột hiện có, như thay đổi kiểu dữ liệu (numeric/categorical), đánh dấu làm feature/label, hoặc sắp xếp độ quan trọng. Để thêm feature mới và điền giá trị, cần dùng các module khác như Execute Python Script, Add Rows, Project Columns, hoặc Apply SQL Transformation trong Azure ML Designer (phiên bản mới). Khuyến nghị này không đáp ứng yêu cầu, nên đáp án là No.
📚 Nguồn tham khảo:

🔍 Giải thích tất cả các phương án

  • Yes ❌ SAI: Phương án này cho rằng module Edit Metadata có thể thêm feature mới và điền giá trị, nhưng thực tế KHÔNG THỂ. Module chỉ hoạt động trên cột tồn tại (select cột bằng tên/regex), không tạo cột mới. Sử dụng nó sẽ báo lỗi hoặc không thay đổi cấu trúc dataset, không đáp ứng yêu cầu feature engineering.

  • No ✅ ĐÚNG: Phương án này chính xác vì khuyến nghị KHÔNG phù hợp. Edit Metadata không hỗ trợ "add a feature" (thêm cột) hay "fill the column value" cho cột mới. Trong thực tế Azure ML (2026), dùng Python/R Script hoặc Custom Expression để tạo cột mới (ví dụ: df['new_feature'] = df['col1'] + df['col2']). Điều này đảm bảo yêu cầu được đáp ứng đúng cách.

Câu 99 Chọn nhiều đáp án
You create a multi-class image classification deep learning model that uses the PyTorch deep learning framework.
You must configure Azure Machine Learning Hyperdrive to optimize the hyperparameters for the classification model.
You need to define a primary metric to determine the hyperparameter values that result in the model with the best accuracy score.
Which three actions must you perform? Each correct answer presents part of the solution.
NOTE: Each correct selection is worth one point.
  1. A Set the primary_metric_goal of the estimator used to run the bird_classifier_train.py script to maximize.
  2. B Add code to the bird_classifier_train.py script to calculate the validation loss of the model and log it as a float value with the key loss.
  3. C Set the primary_metric_goal of the estimator used to run the bird_classifier_train.py script to minimize.
  4. D Set the primary_metric_name of the estimator used to run the bird_classifier_train.py script to accuracy.
  5. E Set the primary_metric_name of the estimator used to run the bird_classifier_train.py script to loss.
  6. F Add code to the bird_classifier_train.py script to calculate the validation accuracy of the model and log it as a float value with the key accuracy.
Xem giải thích

🧩 Giải thích nội dung câu hỏi

Câu hỏi này thuộc lĩnh vực Azure Machine Learning (Azure ML), tập trung vào việc cấu hình Hyperdrive – một công cụ tối ưu hóa siêu tham số (hyperparameter tuning) cho mô hình học sâu phân loại hình ảnh đa lớp (multi-class image classification) sử dụng framework PyTorch.

📌 Yêu cầu chính: Bạn cần định nghĩa primary metric (chỉ số chính) là accuracy score (độ chính xác) để Hyperdrive chọn ra bộ siêu tham số tốt nhất (cao nhất). Câu hỏi là dạng multiple correct answers (chọn 3 hành động đúng), mỗi lựa chọn đúng đáng 1 điểm.

🛠️ Ngữ cảnh:

  • Script huấn luyện là bird_classifier_train.py.
  • Hyperdrive sử dụng estimator (hoặc ScriptRunConfig trong phiên bản mới) để chạy script.
  • Primary metric phải được log từ script train (sử dụng run.log('metric_name', value)), sau đó khai báo primary_metric_name và primary_metric_goal trong config Hyperdrive.
  • Mục tiêu: Tối ưu hóa để đạt accuracy cao nhất (maximize).

Kiến thức cập nhật: Dựa trên tài liệu Azure ML phiên bản mới nhất (tính đến 2026, sử dụng Azure ML SDK v2 với ScriptRunConfig/CommandJob cho HyperDrive – nay tích hợp trong Automated ML và Command Jobs). Không thay đổi cơ bản so với v1.

📘 Nguồn tham khảo:

✅ Đáp án đúng (3 lựa chọn)

Các hành động bắt buộc để định nghĩa primary metric là accuracy và tối ưu hóa maximize bao gồm:

  1. Set the primary_metric_goal of the estimator used to run the bird_classifier_train.py script to maximize.
  2. Set the primary_metric_name of the estimator used to run the bird_classifier_train.py script to accuracy.
  3. Add code to the bird_classifier_train.py script to calculate the validation accuracy of the model and log it as a float value with the key accuracy.

Lý do chọn: Hyperdrive yêu cầu 3 yếu tố chính cho primary metric:

  • Log metric từ script với key chính xác (accuracy).
  • Khai báo tên metric khớp với key đã log.
  • Xác định goal là maximize (vì accuracy càng cao càng tốt). Thiếu bất kỳ yếu tố nào, Hyperdrive không thể đánh giá và chọn best model.

🔍 Phân tích chi tiết tất cả các phương án

Dưới đây là giải thích từng lựa chọn (giữ nguyên văn bản gốc tiếng Anh). Tôi đánh dấu ✅ đúng / ❌ sai, kèm lý do cụ thể dựa trên cơ chế Hyperdrive.

  • Set the primary_metric_goal of the estimator used to run the bird_classifier_train.py script to maximize.
    ✅ Đúng. Đây là bước thiết lập mục tiêu tối ưu hóa cho primary metric. Với accuracy, phải dùng "maximize" để Hyperdrive chọn bộ siêu tham số có giá trị accuracy cao nhất. Nếu dùng "minimize", sẽ ưu tiên accuracy thấp – sai logic.

  • Add code to the bird_classifier_train.py script to calculate the validation loss of the model and log it as a float value with the key loss.
    ❌ Sai. Script cần log validation accuracy với key "accuracy" làm primary metric, không phải loss. Log loss chỉ hữu ích nếu primary_metric_name là "loss", nhưng câu hỏi yêu cầu "best accuracy score".

  • Set the primary_metric_goal of the estimator used to run the bird_classifier_train.py script to minimize.
    ❌ Sai. "Minimize" dùng cho metric cần giảm (như loss hoặc error). Với accuracy, phải "maximize" để chọn model tốt nhất (cao accuracy). Sử dụng sai goal sẽ dẫn đến kết quả ngược lại.

  • Set the primary_metric_name of the estimator used to run the bird_classifier_train.py script to accuracy.
    ✅ Đúng. Tên metric phải khớp chính xác với key log trong script (ví dụ: run.log('accuracy', val_acc)). Hyperdrive chỉ theo dõi metric này để so sánh các trial.

  • Set the primary_metric_name of the estimator used to run the bird_classifier_train.py script to loss.
    ❌ Sai. Primary metric phải là "accuracy" theo yêu cầu câu hỏi. Nếu set "loss", Hyperdrive sẽ tối ưu loss thay vì accuracy, không đáp ứng "best accuracy score".

  • Add code to the bird_classifier_train.py script to calculate the validation accuracy of the model and log it as a float value with the key accuracy.
    ✅ Đúng. Bắt buộc phải log validation accuracy (float, 0-1) với key "accuracy" từ script (sử dụng mlflow.log_metric hoặc run.log trong Azure ML). Hyperdrive lấy giá trị này từ log để đánh giá.

💡 Lưu ý cuối: Trong Azure ML SDK v2 (2023+), sử dụng hyperdrive_config với SweepJob thay estimator cũ, nhưng logic primary metric không đổi. Test code mẫu để verify! 🚀

Câu 100
You use the Azure Machine Learning designer to create and run a training pipeline. You then create a real-time inference pipeline.
You must deploy the real-time inference pipeline as a web service.
What must you do before you deploy the real-time inference pipeline?
  1. A Run the real-time inference pipeline.
  2. B Create a batch inference pipeline.
  3. C Clone the training pipeline.
  4. D Create an Azure Machine Learning compute cluster.
Xem giải thích

🧩 Phân tích chi tiết câu hỏi trắc nghiệm về Azure Machine Learning Designer

📖 Giải thích nội dung câu hỏi:
Câu hỏi tập trung vào quy trình triển khai (deploy) một real-time inference pipeline dưới dạng web service trong Azure Machine Learning designer (nay là một phần của Azure ML Studio). Cụ thể:

  • Bạn đã tạo và chạy (run) một training pipeline để huấn luyện mô hình.
  • Sau đó, bạn tạo một real-time inference pipeline dựa trên training pipeline đó (thường dùng để dự đoán thời gian thực).
  • Bây giờ, bạn muốn deploy pipeline này thành web service (endpoint REST API để gọi inference).
    Câu hỏi chính: Bước bắt buộc phải làm trước khi deploy real-time inference pipeline là gì?
    ✅ Đây là quy trình chuẩn trong Azure ML (phiên bản cập nhật đến 2026), nơi pipeline cần được "xuất bản" (publish) thông qua việc chạy trước để tạo pipeline endpoint, sau đó mới deploy thành ACI/AKS endpoint. Không chạy pipeline trước thì không thể deploy!

✅ Đáp án đúng:
Run the real-time inference pipeline.
Lý do chọn đáp án này (🛠️ Giải thích chi tiết):
Trước khi deploy real-time inference pipeline thành web service, bạn phải chạy (run) pipeline ít nhất một lần. Lý do:

  • Việc chạy pipeline sẽ tạo ra một pipeline draft và pipeline endpoint (pipeline ID), cho phép Azure ML "xuất bản" (publish) nó.
  • Sau khi run thành công, bạn mới có tùy chọn Submit > Deploy để triển khai thành web service (ACI cho dev/test hoặc AKS cho production).
  • Nếu không run, pipeline chỉ là draft chưa được validate, không deploy được. Đây là yêu cầu bắt buộc theo tài liệu chính thức Azure ML Designer (cập nhật 2025-2026).
    📘 Nguồn tham khảo: Azure ML Documentation - Deploy designer pipelines & How to deploy real-time endpoints.

🧩 Giải thích tất cả các phương án (đúng & sai):
Dưới đây là phân tích từng lựa chọn giữ nguyên văn bản gốc tiếng Anh, kèm giải thích hoàn toàn bằng tiếng Việt tại sao đúng/sai. Tôi dùng ✅ cho đúng, ❌ cho sai để dễ theo dõi:

  • ✅ Run the real-time inference pipeline.
    Đúng vì: Như đã giải thích ở trên, đây là bước bắt buộc đầu tiên để publish pipeline draft thành endpoint có thể deploy. Azure ML yêu cầu pipeline phải được run thành công (với input/output validated) trước khi hiện nút Deploy. Không làm bước này, hệ thống sẽ báo lỗi "No published pipeline found".

  • ❌ Create a batch inference pipeline.
    Sai vì: Batch inference pipeline dùng cho dự đoán hàng loạt (batch scoring), không liên quan đến real-time inference (dự đoán thời gian thực). Deploy real-time không yêu cầu tạo batch pipeline; đây là hai quy trình riêng biệt trong Azure ML.

  • ❌ Clone the training pipeline.
    Sai vì: Cloning training pipeline chỉ để sao chép draft huấn luyện, không cần thiết cho inference pipeline (đã được tạo từ training rồi). Inference pipeline đã độc lập, chỉ cần run nó chứ không phải clone lại training.

  • ❌ Create an Azure Machine Learning compute cluster.
    Sai vì: Compute cluster (như AmlCompute) dùng để run pipeline hoặc scale endpoint sau deploy, nhưng không bắt buộc trước deploy real-time inference. Bạn có thể dùng default compute hoặc ACI (không cần cluster) cho deploy đầu tiên. Cluster chỉ cần nếu scale lớn sau này.

🔍 Lưu ý bổ sung (dựa trên kiến thức Azure ML 2026):

  • Quy trình đầy đủ: Tạo training → Run training → Tạo real-time inference → Run inference → Deploy as web service → Test endpoint.
  • Cập nhật mới: Từ Azure ML v2 (2023+), designer tích hợp tốt hơn với managed endpoints, nhưng bước "run before deploy" vẫn giữ nguyên.
    📘 Nguồn chính: Azure ML Designer tutorial & Pipeline deployment guide.

Hy vọng phân tích này giúp bạn nắm vững! 🚀 Nếu cần ví dụ code hoặc demo, hãy hỏi thêm nhé! 😊