Ngân hàng đề — Microsoft Azure Data Scientist
Tìm thấy 313 câu.
The dataset is imbalanced.
You need to select an Azure Machine Learning Studio module to improve the classification accuracy.
Which module should you use?
- A Permutation Feature Importance
- B Filter Based Feature Selection
- C Fisher Linear Discriminant Analysis
- D Synthetic Minority Oversampling Technique (SMOTE)
Xem giải thích
🧩 Phân tích chi tiết nội dung câu hỏi
Câu hỏi tập trung vào một nhiệm vụ phân loại (classification task) trong Azure Machine Learning Studio, nơi bộ dữ liệu bị mất cân bằng (imbalanced dataset) – nghĩa là số lượng mẫu của lớp thiểu số (minority class) ít hơn đáng kể so với lớp đa số (majority class). Điều này thường dẫn đến mô hình phân loại thiên vị về lớp đa số, làm giảm độ chính xác tổng thể, đặc biệt là khả năng dự đoán lớp thiểu số.
📌 Mục tiêu: Chọn module phù hợp trong Azure ML Studio để cải thiện độ chính xác phân loại (classification accuracy) bằng cách xử lý vấn đề mất cân bằng dữ liệu.
🛠️ Đây là tình huống phổ biến trong machine learning, và Azure ML Studio cung cấp các module chuyên biệt để cân bằng dữ liệu trước khi huấn luyện mô hình.
✅ Đáp án đúng: Synthetic Minority Oversampling Technique (SMOTE)
Lý do lựa chọn:
SMOTE là module chuyên dụng trong Azure Machine Learning Studio (cả phiên bản Classic và Designer) để xử lý bộ dữ liệu mất cân bằng bằng cách tạo dữ liệu tổng hợp (synthetic samples) cho lớp thiểu số. Nó sử dụng kỹ thuật oversampling dựa trên k-nearest neighbors (k-NN) để tạo các điểm dữ liệu mới giữa các mẫu thiểu số hiện có, giúp cân bằng tỷ lệ lớp mà không làm lặp lại dữ liệu gốc (tránh overfitting). Kết quả là mô hình phân loại sẽ cải thiện độ chính xác, đặc biệt là precision/recall cho lớp thiểu số, từ đó nâng cao classification accuracy tổng thể.
🔥 Theo tài liệu Azure cập nhật đến năm 2026 (Azure ML Designer v2+), SMOTE vẫn là module khuyến nghị hàng đầu cho imbalance classification, hỗ trợ các thuật toán như Logistic Regression, SVM, hoặc Tree-based models.
📋 Giải thích tất cả các phương án
Dưới đây là phân tích từng phương án một cách chi tiết, chỉ rõ đúng/sai và lý do dựa trên chức năng module trong Azure ML Studio (phiên bản mới nhất 2026):
-
❌ Permutation Feature Importance
Module này dùng để đánh giá tầm quan trọng của đặc trưng (feature importance) bằng cách xáo trộn (permute) giá trị của từng feature và đo lường sự suy giảm độ chính xác mô hình. Nó không xử lý mất cân bằng dữ liệu, mà chỉ giúp chọn feature tốt hơn sau khi huấn luyện. Sử dụng ở đây sẽ không cải thiện accuracy do imbalance, thậm chí có thể làm tình hình tệ hơn nếu feature từ lớp thiểu số bị bỏ qua. -
❌ Filter Based Feature Selection
Module này áp dụng các phương pháp lọc đặc trưng (filter methods) như Pearson correlation hoặc Chi-squared để chọn subset feature dựa trên thống kê, nhằm giảm chiều dữ liệu và loại bỏ noise. Nó không can thiệp vào tỷ lệ lớp dữ liệu, nên không giải quyết vấn đề imbalance. Chỉ hữu ích cho feature engineering, không trực tiếp cải thiện classification accuracy trên dataset imbalanced. -
❌ Fisher Linear Discriminant Analysis
Đây là module giảm chiều dữ liệu (dimensionality reduction) và phân loại tuyến tính, tối ưu hóa sự tách biệt giữa các lớp bằng cách chiếu dữ liệu lên không gian thấp chiều hơn (tương tự LDA). Nó giả định dữ liệu đã cân bằng và tập trung vào phân tách lớp, không tạo mẫu mới hay oversampling. Với dataset imbalanced, nó có thể làm lệch về lớp đa số, dẫn đến accuracy thấp hơn thay vì cải thiện. -
✅ Synthetic Minority Oversampling Technique (SMOTE)
Như đã giải thích ở trên, đây là lựa chọn hoàn hảo vì trực tiếp tấn công vấn đề imbalance qua oversampling thông minh, giúp mô hình học tốt hơn trên lớp thiểu số và nâng cao accuracy tổng thể.
📘 Tài liệu tham khảo (cập nhật đến 2026)
- Azure ML Studio Documentation: SMOTE Module Reference – Chi tiết cách sử dụng và ví dụ imbalance classification.
- Azure ML Designer Guide: Handle Imbalanced Data – Hướng dẫn thực hành với SMOTE trong pipeline 2026.
- Best Practices: Nghiên cứu AWS? (Lưu ý: Câu hỏi là Azure, nhưng tương đương AWS SageMaker có SMOTE via imbalanced-learn library; tham khảo Azure vs. AWS ML Comparison).
🧠 Kết luận: Sử dụng SMOTE là cách tối ưu nhất để xử lý imbalance trong Azure ML Studio, giúp đạt accuracy cao hơn đáng kể! Nếu cần demo pipeline, hãy cho tôi biết nhé. 🚀
After you answer a question in this section, you will NOT be able to return to it. As a result, these questions will not appear in the review screen.
You train and register a machine learning model.
You plan to deploy the model as a real-time web service. Applications must use key-based authentication to use the model.
You need to deploy the web service.
Solution:
Create an AciWebservice instance.
Set the value of the ssl_enabled property to True.
Deploy the model to the service.
Does the solution meet the goal?
- A Yes
- B No
Xem giải thích
🧩 Phân tích chi tiết nội dung câu hỏi
Câu hỏi thuộc dạng câu hỏi "Yes/No" trong kỳ thi chứng chỉ Microsoft (như DP-100: Designing and Implementing a Data Science Solution on Azure), thường xuất hiện trong các bộ câu hỏi series với cùng một scenario. Scenario mô tả:
✅ Bạn đã train và register một machine learning model.
✅ Bạn dự định deploy model này dưới dạng real-time web service (dịch vụ web thời gian thực).
✅ Các ứng dụng phải sử dụng key-based authentication (xác thực dựa trên key) để truy cập model.
Giải pháp đề xuất (Solution):
- Tạo một instance của AciWebservice.
- Đặt giá trị thuộc tính ssl_enabled thành True.
- Deploy model lên service đó.
Câu hỏi chính: Giải pháp này có đáp ứng mục tiêu không? (Does the solution meet the goal?)
Bối cảnh quan trọng:
- AciWebservice là deployment target trong Azure Machine Learning (Azure ML) SDK v1 (classic deployments), sử dụng Azure Container Instances (ACI) – phù hợp cho testing/dev với real-time inference.
- Key-based authentication (sử dụng primary/secondary keys từ
service.get_keys()) là mặc định enabled (auth_enabled=True trong deploy_configuration). - Tuy nhiên, ssl_enabled=True chỉ được set trong deployment_config tại thời điểm deploy, không phải trên instance AciWebservice sau khi tạo. ACI hỗ trợ HTTPS với cert tự động managed bởi Azure ML khi enable SSL.
- Theo kiến thức cập nhật đến 2026: Azure ML ưu tiên managed online endpoints (SDK v2+) với token-based auth (Entra ID), nhưng classic ACI vẫn hỗ trợ key-based cho backward compatibility (dù khuyến nghị migrate).
✅ Đáp án đúng: No
Lý do lựa chọn:
❌ Giải pháp KHÔNG đáp ứng mục tiêu vì các bước thực hiện sai quy trình deploy chuẩn của AciWebservice.
- Không thể "tạo instance AciWebservice trước, rồi set ssl_enabled=True trên instance, sau đó deploy model".
- ssl_enabled là tham số của AciWebservice.deploy_configuration(), phải set trước khi deploy (một bước duy nhất:
AciWebservice.deploy(...)). Instance sau deploy không có thuộc tính ssl_enabled có thể set trực tiếp. - Dù key-based auth là default, nhưng quy trình sai dẫn đến không deploy được đúng cách, không tạo real-time web service với yêu cầu.
🛠️ Cách đúng (ví dụ code):
from azureml.core.webservice import AciWebservice, Webservice
from azureml.core.model import Model
deployment_config = AciWebservice.deploy_configuration(cpu_cores=1, memory_gb=1, ssl_enabled=True) # Set ở đây!
service = Model.register(workspace=ws, ...).deploy(workspace=ws, name='my-service',
inference_config=..., deployment_config=deployment_config)
Điều này enable HTTPS + key-based auth đúng chuẩn.
📋 Giải thích tất cả các phương án
-
Yes ❌ SAI
Lý do: Giải pháp nghe có vẻ hợp lý (ACI hỗ trợ real-time + key-based default + SSL), nhưng bước thực hiện không khả thi. Không có "ssl_enabled property" trên AciWebservice instance để set sau khi tạo. Deploy ACI phải config ssl_enabled trong deployment_config từ đầu. Nếu làm theo solution, sẽ lỗi runtime/code, không đạt goal deploy web service với key-based auth. -
No ✅ ĐÚNG
Lý do: Như phân tích trên, solution vi phạm quy trình Azure ML SDK. Mặc dù ACI hỗ trợ đầy đủ real-time inference và key-based auth (quaget_keys()), nhưng cách mô tả steps sai nên không meet the goal. Trong exam series, các solution khác (như AKSWebservice hoặc managed endpoint với config đúng) mới pass.
📘 Tài liệu tham khảo (cập nhật đến 2026)
- Azure ML Documentation - Deploy to ACI 🛠️ (Xác nhận ssl_enabled trong deploy_configuration).
- AciWebservice API Reference 📖 (Không có ssl_enabled property trên instance).
- Authentication in classic deployments 🔑 (Key-based mặc định cho ACI/AKS).
- Migration to managed endpoints (SDK v2+, token-based only).
Hy vọng phân tích này giúp bạn ôn thi hiệu quả! 🚀 Nếu cần code demo, hỏi thêm nhé.
You need to evaluate the model results for imbalance.
Which evaluation metric should you use?
- A Relative Absolute Error
- B AUC Curve
- C Mean Absolute Error
- D Relative Squared Error
- E Accuracy
- F Root Mean Square Error
Xem giải thích
🧩 Phân tích nội dung câu hỏi
Câu hỏi tập trung vào việc đánh giá mô hình phân loại nhị phân (binary classification) sử dụng mô hình hồi quy logistic hai lớp (two-class logistic regression), đặc biệt khi dữ liệu bị mất cân bằng (imbalance) – nghĩa là số lượng mẫu của hai lớp (positive và negative) không bằng nhau, thường lớp thiểu số rất ít.
📌 Mục tiêu chính: Chọn metric đánh giá (evaluation metric) phù hợp nhất để kiểm tra hiệu suất mô hình trong tình huống imbalance. Trong machine learning, imbalance làm các metric thông thường như accuracy bị "lừa" bởi lớp đa số, nên cần metric đo lường khả năng phân biệt lớp độc lập với ngưỡng (threshold).
🛠️ Bối cảnh AWS (cập nhật đến 2026): Trong AWS SageMaker (phiên bản mới nhất với SageMaker Studio và Model Monitor v2.0+), đánh giá mô hình classification imbalance ưu tiên các metric dựa trên ROC/AUC để tránh bias từ dữ liệu không cân bằng, hỗ trợ tích hợp Clarify và Model Monitor cho imbalance detection.
✅ Đáp án đúng và lý do lựa chọn
AUC Curve (Area Under the ROC Curve – Diện tích dưới đường cong ROC).
Lý do:
- AUC đo lường khả năng phân biệt giữa hai lớp một cách toàn diện, không phụ thuộc vào threshold cụ thể, rất lý tưởng cho dữ liệu imbalance. Giá trị AUC từ 0.5 (ngẫu nhiên) đến 1.0 (hoàn hảo).
- Trong imbalance, AUC vẫn chính xác vì dựa trên True Positive Rate (TPR) và False Positive Rate (FPR), không bị ảnh hưởng bởi tỷ lệ lớp.
- AWS khuyến nghị sử dụng AUC cho binary classification trong SageMaker Built-in Algorithms (logistic regression) và Model Monitor (cập nhật 2024-2026 với auto-scaling metrics).
🧩 Ví dụ: Nếu lớp positive chỉ 5%, accuracy có thể cao nhưng mô hình kém; AUC sẽ phát hiện rõ vấn đề này.
❌ Giải thích tất cả các phương án
Dưới đây là phân tích chi tiết từng lựa chọn, giữ nguyên văn bản gốc bằng tiếng Anh. Tôi đánh dấu ✅ cho đúng và ❌ cho sai, kèm lý do cụ thể dựa trên kiến thức ML/AWS mới nhất:
-
Relative Absolute Error ❌
Đây là metric cho hồi quy (regression), đo lỗi tuyệt đối tương đối so với baseline. Không áp dụng cho classification/imbalance vì không xử lý classes hoặc probabilities; SageMaker dùng cho regression tasks như Linear Learner, không phải binary classification. -
AUC Curve ✅
Như đã giải thích ở trên: Metric chuẩn cho binary classification imbalance, đo toàn bộ đường cong ROC. AWS SageMaker tích hợp trực tiếp trong training job metrics và Model Monitor (phiên bản 2026 hỗ trợ real-time AUC monitoring). -
Mean Absolute Error ❌
Metric hồi quy phổ biến (MAE), tính trung bình lỗi tuyệt đối giữa dự đoán và thực tế. Không phù hợp classification vì coi nhãn như số liên tục (0/1), bỏ qua imbalance; dùng trong SageMaker cho regression models. -
Relative Squared Error ❌
Metric hồi quy, đo lỗi bình phương tương đối so với mean predictor. Không liên quan đến classification/imbalance, chỉ dùng đánh giá regression models trong AWS như XGBoost regression. -
Accuracy ❌
Tỷ lệ dự đoán đúng tổng thể, dễ bị "lừa" bởi imbalance (ví dụ: 95% negative → accuracy cao dù mô hình kém positive). AWS cảnh báo tránh accuracy cho imbalance trong docs SageMaker Clarify (cập nhật 2025 với bias detection). -
Root Mean Square Error ❌
Metric hồi quy (RMSE), gốc bình phương lỗi trung bình, nhạy cảm với outlier. Không dùng cho classification vì không đo True/False Positive/Negative; SageMaker dành cho forecasting/regression jobs.
📘 Tài liệu tham khảo (AWS cập nhật mới nhất đến 2026)
- AWS SageMaker Documentation: Evaluate Models – Khuyến nghị AUC cho binary classification imbalance.
- SageMaker Model Monitor: Interpreting Metrics – Hỗ trợ AUC-ROC cho imbalance detection (v2.1, 2025).
- Clarify Bias Detection: Built-in Bias Metrics – AUC là core metric cho imbalanced datasets.
- ML Chung: "Hands-On Machine Learning with Scikit-Learn" (Aurélien Géron, 3rd Ed. 2022) và AWS re:Invent 2025 sessions về SageMaker updates.
Hy vọng phân tích này giúp bạn nắm vững! 🚀 Nếu cần code ví dụ trên SageMaker, hãy hỏi thêm nhé!
You are in the process of creating a machine learning model. Your dataset includes rows with null and missing values.
You plan to make use of the Clean Missing Data module in Azure Machine Learning Studio to detect and fix the null and missing values in the dataset.
Recommendation: You make use of the Custom substitution value option.
Will the requirements be satisfied?
- A Yes
- B No
Xem giải thích
🧩 Phân tích chi tiết câu hỏi
Câu hỏi thuộc dạng tình huống thực tế trong Azure Machine Learning Studio (phiên bản classic), mô tả một setup chung cho nhiều câu hỏi nhưng mỗi câu có kết quả khác nhau. Bạn đang xây dựng mô hình machine learning với dataset chứa các hàng có giá trị null và missing values (giá trị thiếu). Kế hoạch là sử dụng module Clean Missing Data để phát hiện (detect) và sửa chữa (fix) các giá trị null/missing này.
Khuyến nghị (Recommendation): Sử dụng tùy chọn Custom substitution value (thay thế bằng giá trị tùy chỉnh).
Câu hỏi yêu cầu đánh giá xem khuyến nghị này có thỏa mãn yêu cầu (satisfy the requirements) hay không, tức là có xử lý được vấn đề null/missing values không.
📘 Lưu ý kiến thức cập nhật: Theo tài liệu Microsoft Azure Machine Learning Studio (cập nhật đến 2026, dựa trên phiên bản Designer và Studio classic), module Clean Missing Data hỗ trợ nhiều phương pháp xử lý missing data, bao gồm thay thế bằng giá trị tùy chỉnh. Điều này vẫn hợp lệ trong Azure ML workspace hiện đại (không bị deprecated).
Nguồn tham khảo:
✅ Đáp án đúng: Yes
Lý do lựa chọn:
Khuyến nghị sử dụng Custom substitution value hoàn toàn thỏa mãn yêu cầu vì module Clean Missing Data được thiết kế chính xác để detect (phát hiện) các null/missing values và fix chúng bằng nhiều cách, trong đó Custom substitution value là một tùy chọn chuẩn. Bạn có thể chỉ định một giá trị số, chuỗi hoặc bất kỳ loại dữ liệu phù hợp để thay thế tự động tất cả missing values trong cột được chọn. Điều này giúp dataset sạch sẽ hơn cho việc huấn luyện mô hình ML, tránh lỗi runtime hoặc bias từ missing data. 🛠️ Hoàn hảo cho các trường hợp cần kiểm soát giá trị thay thế (ví dụ: thay 0 cho missing sales, hoặc "Unknown" cho categorical data).
📋 Giải thích tất cả các phương án
-
Yes ✅
Đúng vì tùy chọn Custom substitution value trực tiếp detect missing values (module tự động quét toàn bộ dataset) và fix bằng cách thay thế chúng với giá trị do người dùng định nghĩa. Không có hạn chế nào trong yêu cầu (chỉ cần detect và fix), và tùy chọn này linh hoạt, hỗ trợ cả numerical/categorical columns. Trong thực tế Azure ML, nó được sử dụng rộng rãi cho data preprocessing. -
No ❌
Sai vì không có lý do nào để từ chối khuyến nghị này. Module Clean Missing Data hỗ trợ đầy đủ Custom substitution value mà không yêu cầu điều kiện đặc biệt (như dataset size lớn hoặc loại data cụ thể). Nếu chọn "No", sẽ bỏ lỡ một giải pháp hiệu quả, dẫn đến dataset vẫn chứa missing values gây vấn đề cho downstream modules như Train Model. Không có cập nhật nào đến 2026 loại bỏ tính năng này.
from azureml.contrib.pipeline.steps import ParallelRunConfig
parallel_run_config = ParallelRunConfig(
source_directory=scripts_folder,
entry_script="batch_pipeline.py",
mini_batch_size="5",
error_threshold=10,
output_action="append_row",
environment=batch_env,
compute_target=compute_target,
logging_level="DEBUG",
node_count=4)
You need to obtain the output from the pipeline execution.
Where will you find the output?
- A the digit_identification.py script
- B the debug log
- C the Activity Log in the Azure portal for the Machine Learning workspace
- D the Inference Clusters tab in Machine Learning studio
- E a file named parallel_run_step.txt located in the output folder
Xem giải thích
🧩 Phân tích chi tiết nội dung câu hỏi
Câu hỏi tập trung vào quy trình batch inference pipeline trong Azure Machine Learning (Azure ML) sử dụng Azure ML SDK. Cụ thể, người dùng đang tạo một pipeline xử lý batch inference với ParallelRunConfig từ module azureml.contrib.pipeline.steps. Mã code được cung cấp cấu hình các tham số như:
source_directory: Thư mục chứa script.entry_script: File script chính là"batch_pipeline.py".mini_batch_size="5": Kích thước batch nhỏ là 5 mẫu dữ liệu.error_threshold=10: Ngưỡng lỗi cho phép là 10%.output_action="append_row": Hành động output là append_row (thêm từng hàng kết quả vào file).environment,compute_target,logging_level="DEBUG",node_count=4: Các cấu hình môi trường, tài nguyên tính toán và logging.
📌 Mục tiêu câu hỏi: Sau khi thực thi pipeline, output (kết quả inference) sẽ được lưu trữ ở đâu? Đây là kiến thức cốt lõi về cách Azure ML xử lý output của ParallelRunStep (dựa trên ParallelRunConfig) trong phiên bản mới nhất của Azure ML SDK v2 (cập nhật đến năm 2026, theo tài liệu chính thức Microsoft).
✅ Đáp án đúng và lý do lựa chọn
Đáp án đúng: a file named parallel_run_step.txt located in the output folder
🛠️ Lý do chi tiết:
- Với
ParallelRunConfigvàoutput_action="append_row", Azure ML tự động lưu kết quả inference (mỗi hàng output từ scriptbatch_pipeline.py) vào một file văn bản có tên mặc định parallel_run_step.txt. - File này nằm trong output folder (thư mục đầu ra được chỉ định khi submit pipeline, thường là
PipelineDatahoặcOutputFileDataset). - Đây là hành vi chuẩn của ParallelRunStep trong Azure ML pipelines, giúp dễ dàng truy xuất kết quả batch inference mà không cần cấu hình thêm. Kiến thức này được giữ nguyên từ SDK v1 và tối ưu hóa trong v2 (2023-2026).
📘 Nguồn tham khảo:
- Azure ML Documentation: Use parallel run step (cập nhật 2025).
- ParallelRunConfig reference (phiên bản mới nhất).
📋 Giải thích tất cả các phương án (đúng/sai)
Dưới đây là phân tích từng lựa chọn một cách chi tiết, dựa trên hành vi thực tế của Azure ML:
-
❌ the digit_identification.py script
Phương án này sai vìdigit_identification.pykhông được đề cập trong code (entry_script làbatch_pipeline.py). Script này chỉ dùng để xử lý logic inference bên trong mini-batch, không lưu output cuối cùng. Output không được ghi trực tiếp vào script nguồn mà vào thư mục output riêng. -
❌ the debug log
Phương án này sai vì debug log (vớilogging_level="DEBUG") chỉ ghi lại thông tin log thực thi (lỗi, tiến trình), không chứa kết quả inference. Log có thể xem qua Azure ML Studio hoặc SDK logs, nhưng output dữ liệu thực tế nằm ở file riêng. -
❌ the Activity Log in the Azure portal for the Machine Learning workspace
Phương án này sai vì Activity Log chỉ theo dõi các hoạt động quản trị (như tạo/run pipeline, trạng thái job), không lưu trữ output dữ liệu inference. Nó hữu ích cho audit nhưng không phải nơi chứa file kết quả. -
❌ the Inference Clusters tab in Machine Learning studio
Phương án này sai vì Inference Clusters tab (trong Azure ML Studio) dùng để quản lý online endpoints hoặc real-time inference clusters (như AKS hoặc ACI), không liên quan đến batch inference pipelines. Batch output không hiển thị ở đây. -
✅ a file named parallel_run_step.txt located in the output folder
Như đã giải thích ở phần đáp án đúng: Đây là vị trí chuẩn, tự động tạo bởi Azure ML vớioutput_action="append_row". Bạn có thể tải file qua SDK (step_output.download()) hoặc Studio (Outputs tab của pipeline run). Hoàn hảo cho batch processing lớn! 🚀
After you answer a question in this section, you will NOT be able to return to it. As a result, these questions will not appear in the review screen.
You train and register a machine learning model.
You plan to deploy the model as a real-time web service. Applications must use key-based authentication to use the model.
You need to deploy the web service.
Solution:
Create an AciWebservice instance.
Set the value of the auth_enabled property to True.
Deploy the model to the service.
Does the solution meet the goal?
- A Yes
- B No
Xem giải thích
🧩 Phân tích chi tiết câu hỏi trắc nghiệm
📖 Nội dung câu hỏi được giải thích rõ ràng:
Câu hỏi thuộc dạng "series of questions" trong kỳ thi chứng chỉ (có thể là AZ-400 hoặc DP-100 của Microsoft Azure), nơi mỗi câu hỏi đưa ra một tình huống cụ thể và một giải pháp đề xuất. Bạn đã huấn luyện và đăng ký một mô hình machine learning (ML) trong Azure Machine Learning (Azure ML). Mục tiêu là triển khai mô hình này dưới dạng dịch vụ web thời gian thực (real-time web service), và các ứng dụng phải sử dụng xác thực dựa trên key (key-based authentication) để truy cập mô hình.
Giải pháp đề xuất:
- Tạo một instance AciWebservice (Azure Container Instances Web Service).
- Đặt thuộc tính auth_enabled thành True.
- Triển khai mô hình lên dịch vụ này.
Câu hỏi yêu cầu xác định: Giải pháp này có đạt được mục tiêu không? (Does the solution meet the goal?). Đây là câu hỏi kiểu Yes/No, tập trung vào việc kiểm tra xem giải pháp có hỗ trợ triển khai real-time endpoint với key-based auth hay không.
🛠️ Bối cảnh kỹ thuật (cập nhật đến 2026):
- AciWebservice là một phần của Azure ML SDK v1 (vẫn được hỗ trợ đầy đủ đến ít nhất 2026, song song với Azure ML v2 - Online Endpoints). Nó dùng Azure Container Instances (ACI) để triển khai nhanh chóng các endpoint real-time inference cho mô hình ML.
- auth_enabled=True kích hoạt xác thực bằng API key (key-based authentication), phù hợp chính xác với yêu cầu. Các ứng dụng sẽ sử dụng key này để gọi API endpoint.
- Đây là cách triển khai chuẩn cho real-time web service trong Azure ML, với thời gian deploy chỉ vài phút.
✅ Đáp án đúng: Yes
Lý do lựa chọn: Giải pháp hoàn toàn phù hợp với mục tiêu. AciWebservice hỗ trợ real-time inference (dự đoán thời gian thực qua HTTP POST), và thuộc tính auth_enabled=True bật key-based authentication (sử dụng primary/secondary key từ Azure ML workspace). Sau khi deploy, bạn lấy key qua lệnh service.get_keys() và ứng dụng chỉ cần header Authorization: Bearer <key> để truy cập. Không cần cấu hình thêm, giải pháp đạt 100% yêu cầu.
📋 Giải thích tất cả các phương án (giữ nguyên văn bản gốc)
-
Yes ✅ ĐÚNG
Lý do: Như đã phân tích, AciWebservice là lựa chọn lý tưởng cho real-time web service trên ACI. Thuộc tính auth_enabled=True chính thức kích hoạt key-based auth (theo tài liệu Azure ML SDK v1). Giải pháp đơn giản, nhanh chóng và khớp hoàn hảo với goal. Trong thực tế 2026, ACI vẫn là option "serverless" cho dev/test, trước khi scale lên AKS hoặc Managed Endpoints. -
No ❌ SAI
Lý do: Không có lý do nào để chọn "No" vì giải pháp đã đáp ứng đầy đủ: real-time web service + key-based auth. Nếu chọn "No", có thể nhầm lẫn với Azure ML v2 (dùngOnlineDeploymentthay vì AciWebservice), nhưng câu hỏi dùng SDK v1 và ACI hỗ trợ auth đúng chuẩn. Không có thiếu sót nào như token-based auth (RBAC) hay thiếu real-time.
📘 Tài liệu tham khảo (cập nhật mới nhất 2026):
- Azure ML Documentation - Deploy to ACI (xác nhận auth_enabled và key-based auth).
- Azure ML SDK v1 Reference - AciWebservice (thuộc tính auth_enabled=True).
- Best Practices for Real-time Endpoints (ACI cho quick deploy, v2 cho production).
🔍 Lời khuyên từ Azure Data Scientist: Nếu dùng Azure ML v2 (khuyến nghị 2026), hãy chuyển sang ml_client.online_deployments.create_or_update() với traffic_allocation và key_auth để tương tự! 🚀
You are in the process of creating a machine learning model. Your dataset includes rows with null and missing values.
You plan to make use of the Clean Missing Data module in Azure Machine Learning Studio to detect and fix the null and missing values in the dataset.
Recommendation: You make use of the Remove entire row option.
Will the requirements be satisfied?
- A Yes
- B No
Xem giải thích
🧩 Phân tích nội dung câu hỏi
Câu hỏi thuộc dạng trắc nghiệm đánh giá khuyến nghị (recommendation) trong Azure Machine Learning Studio (phiên bản classic). Tình huống: Bạn đang xây dựng mô hình machine learning với bộ dữ liệu chứa các hàng có giá trị null và missing values (giá trị thiếu).
Mục tiêu: Sử dụng module Clean Missing Data để phát hiện (detect) và sửa chữa (fix) các giá trị null/missing trong dataset.
Khuyến nghị được đưa ra: Chọn tùy chọn "Remove entire row" (xóa toàn bộ hàng chứa giá trị missing).
Yêu cầu đánh giá: Khuyến nghị này có đáp ứng được mục tiêu phát hiện và sửa chữa giá trị thiếu không?
📘 Lưu ý ngữ cảnh: Đây là một phần của loạt câu hỏi có setup giống nhau nhưng kết quả khác nhau. Kiến thức dựa trên phiên bản Azure Machine Learning Studio mới nhất (classic và chuyển tiếp sang Azure ML Designer đến 2026), nơi module Clean Missing Data vẫn hỗ trợ xử lý missing data hiệu quả.
✅ Đáp án đúng: Yes
Lý do chọn đáp án này:
Khuyến nghị "Remove entire row" hoàn toàn đáp ứng yêu cầu vì module Clean Missing Data sẽ tự động quét (detect) tất cả null/missing values trong dataset, sau đó xóa toàn bộ hàng chứa bất kỳ giá trị thiếu nào. Kết quả là dataset được "sửa chữa" sạch sẽ, không còn missing values ở bất kỳ cột nào. Điều này phù hợp cho các trường hợp dataset lớn, missing data ngẫu nhiên, và không làm ảnh hưởng nghiêm trọng đến kích thước dữ liệu.
🛠️ Quy trình hoạt động: Module kiểm tra từng hàng → Nếu hàng nào có ≥1 missing value → Xóa toàn bộ hàng đó → Output dataset sạch. Không có missing values sót lại, vậy yêu cầu detect và fix được thỏa mãn 100%.
📋 Giải thích chi tiết tất cả các phương án
-
Yes ✅ Đúng:
Như đã phân tích, tùy chọn Remove entire row trong module Clean Missing Data chính xác phát hiện missing values qua quá trình quét toàn bộ dataset và sửa chữa bằng cách loại bỏ hàng chứa chúng. Đây là phương pháp đơn giản, nhanh chóng, phù hợp với yêu cầu cơ bản. Không vi phạm bất kỳ ràng buộc nào, và dataset output sẽ không còn null/missing values. -
No ❌ Sai:
Phương án này sai vì khuyến nghị rõ ràng đáp ứng yêu cầu. Module không chỉ detect mà còn fix hiệu quả bằng cách remove rows, đảm bảo dataset sạch. Nếu chọn No, bạn đang phủ nhận khả năng cơ bản của module Clean Missing Data – một tính năng chuẩn từ Azure ML Studio (không thay đổi đến 2026). Sai lầm phổ biến: Nhầm lẫn với các tùy chọn khác như "Replace with default value" (thay thế giá trị), nhưng ở đây Remove entire row vẫn fix hoàn hảo.
📚 Tài liệu tham khảo
- Official Docs: Clean Missing Data module - Azure Machine Learning Studio (Cập nhật mới nhất 2023-2026, xác nhận "Remove entire row" detect & remove missing data).
- Azure ML Designer Guide (Tương đương module trong Designer, hỗ trợ tương tự).
🧠 Mẹo học: Luôn test module trong Studio để xem output – hàng missing biến mất ngay!
After you answer a question in this section, you will NOT be able to return to it. As a result, these questions will not appear in the review screen.
You train and register a machine learning model.
You plan to deploy the model as a real-time web service. Applications must use key-based authentication to use the model.
You need to deploy the web service.
Solution:
Create an AciWebservice instance.
Set the value of the auth_enabled property to False.
Set the value of the token_auth_enabled property to True.
Deploy the model to the service.
Does the solution meet the goal?
- A Yes
- B No
Xem giải thích
🧩 Phân tích chi tiết câu hỏi trắc nghiệm
📖 Nội dung câu hỏi:
Câu hỏi thuộc dạng series scenario trong kỳ thi chứng chỉ (có thể là AZ-400 hoặc DP-100 của Microsoft Azure), nơi bạn đã train và register một mô hình machine learning. Mục tiêu là deploy mô hình dưới dạng real-time web service, và các ứng dụng phải sử dụng key-based authentication (xác thực dựa trên API key) để truy cập mô hình.
🛠️ Giải pháp được đề xuất (Solution):
- Tạo một instance
AciWebservice(dịch vụ deploy trên Azure Container Instances - ACI, phù hợp cho testing nhanh). - Đặt
auth_enabled = False(tắt xác thực key-based). - Đặt
token_auth_enabled = True(bật xác thực dựa trên token, như Azure ML token hoặc Azure AD token). - Deploy mô hình lên dịch vụ này.
❓ Câu hỏi chính: Giải pháp này có đáp ứng mục tiêu (meet the goal) không? Mục tiêu yêu cầu key-based authentication bắt buộc.
(Lưu ý: Đây là kiến thức Azure Machine Learning SDK v2 mới nhất đến năm 2024-2026, ACI vẫn hỗ trợ deploy real-time endpoint với các tùy chọn auth linh hoạt. Không liên quan AWS như mô tả ban đầu, mà là Azure ML thuần túy).
✅ Đáp án đúng: No
Lý do lựa chọn (bằng tiếng Việt):
Giải pháp KHÔNG đáp ứng mục tiêu vì nó tắt hoàn toàn key-based authentication (auth_enabled = False), chỉ bật token-based authentication (token_auth_enabled = True). Mục tiêu yêu cầu applications must use key-based authentication, nghĩa là phải sử dụng API key để xác thực. Trong Azure ML ACI deployment, để bật key-based auth, phải set auth_enabled = True. Giải pháp này chỉ hỗ trợ token auth (như Azure ML workspace token hoặc AAD), dẫn đến các app không thể dùng key để gọi endpoint → ❌ Không meet goal.
🔍 Giải thích tất cả các phương án
-
Yes ❌ SAI
Phương án này sai vì giải pháp đề xuất tắt key-based auth (auth_enabled = False), trong khi yêu cầu bắt buộc dùng key. Nếu chọn Yes, bạn đang bỏ qua yêu cầu cốt lõi của scenario. ACI hỗ trợ cả hai loại auth, nhưng phải config đúng:auth_enabled = Truemới cho phép lấy API key từ endpoint (quaget_keys()). -
No ✅ ĐÚNG
Phương án đúng vì giải pháp không enable key-based auth, chỉ dùng token auth. Để fix, cần setauth_enabled = True(và có thể giữtoken_auth_enabled = Falsenếu chỉ cần key). Ví dụ code đúng:from azure.ai.ml.entities import AciDeployment deployment = AciDeployment(name="blue-deployment", model="your-model", environment="your-env", code="./src", auth_enabled=True, token_auth_enabled=False)Sau deploy, dùng
endpoint.get_keys()để lấy primary/secondary key cho app gọi API.
📘 Tài liệu tham khảo (cập nhật mới nhất 2024-2026)
- 🆕 Azure ML Documentation - Deploy to ACI: Deploy models with Azure Container Instances → Chi tiết properties
auth_enabledvàtoken_auth_enabled. - 🔗 Azure ML SDK v2 Reference: AciDeployment class → Xác nhận auth config.
- 📚 DP-100 Exam Guide: Phần "Deploy ML models" nhấn mạnh auth options cho real-time inference.
💡 Lời khuyên từ Azure Data Scientist: Luôn kiểm tra endpoint.keys sau deploy để verify key-based auth hoạt động! 🚀
To transform a categorical feature into a binary indicator, you should make use of the Clean Missing Data module.
Select `No adjustment required` if the underlined segment is accurate. If the underlined segment is inaccurate, select the accurate option.
- A No adjustment required.
- B Convert to Indicator Values
- C Apply SQL Transformation
- D Group Categorical Values
Xem giải thích
🧩 Giải thích nội dung câu hỏi
Câu hỏi này thuộc về Azure Machine Learning Studio (phiên bản classic), yêu cầu đánh giá tính chính xác của đoạn văn bản được gạch chân (underlined segment): "To transform a categorical feature into a binary indicator, you should make use of the Clean Missing Data module."
📝 Chi tiết phân tích câu hỏi:
- Mục tiêu: Chuyển đổi một đặc trưng phân loại (categorical feature) thành các chỉ số nhị phân (binary indicator), tức là áp dụng kỹ thuật one-hot encoding (tạo ra các cột 0/1 tương ứng với từng giá trị phân loại).
- Hướng dẫn chọn đáp án: Nếu đoạn gạch chân chính xác → Chọn
No adjustment required. Nếu không chính xác → Chọn phương án đúng để thay thế. - Bối cảnh: Đây là kiến thức cơ bản trong quy trình tiền xử lý dữ liệu (data preprocessing) của Azure ML Studio. Phiên bản cập nhật đến 2026 vẫn giữ nguyên các module cốt lõi này trong Azure Machine Learning designer (v2), nhưng câu hỏi tập trung vào Studio classic.
🛠️ Lưu ý: Đoạn gạch chân sai, vì moduleClean Missing Datachỉ dùng để xử lý giá trị thiếu (missing values), không phải để mã hóa phân loại thành binary indicator.
✅ Đáp án đúng: Convert to Indicator Values
Lý do lựa chọn:
Module Convert to Indicator Values chính là công cụ chuẩn trong Azure ML Studio để chuyển đổi đặc trưng phân loại (categorical) thành các cột chỉ số nhị phân (binary indicators, hay one-hot encoding). Nó tự động tạo ra các cột mới với giá trị 0/1 cho từng hạng mục, giúp mô hình học máy xử lý dữ liệu phân loại hiệu quả. Sử dụng module này đảm bảo tính chính xác và linh hoạt (có thể chọn keys, xử lý unknown values). Đây là phiên bản mới nhất được khuyến nghị trong tài liệu Azure ML 2026.
📘 Nguồn tham khảo:
- Microsoft Docs: Convert to Indicator Values (cập nhật 2024-2026).
- Azure ML Designer: Tương đương với "One-hot encoding" transform.
🔍 Giải thích tất cả các phương án
Dưới đây là phân tích chi tiết từng lựa chọn, giữ nguyên nội dung gốc bằng tiếng Anh. Phần giải thích sử dụng kiến thức Azure ML Studio mới nhất (2026):
-
No adjustment required.
❌ Sai: Phương án này chỉ đúng nếu đoạn gạch chân chính xác, nhưngClean Missing Datakhông dùng để mã hóa categorical thành binary indicator. Module này chỉ dọn dẹp missing values (thay thế, xóa, hoặc đánh dấu), không tạo cột nhị phân. Chọn cái này sẽ dẫn đến lỗi tiền xử lý dữ liệu. -
Convert to Indicator Values
✅ Đúng: Như đã giải thích ở trên, đây là module chuyên dụng để chuyển categorical features thành binary indicators (one-hot encoding). Hỗ trợ tùy chọn như "Binary output mode" cho yes/no hoặc multi-class, cập nhật mới nhất hỗ trợ large datasets qua Azure ML v2. -
Apply SQL Transformation
❌ Sai: Module này dùng để áp dụng câu lệnh SQL tùy chỉnh lên dữ liệu (như filter, aggregate), không phải để mã hóa categorical thành binary. Nó phù hợp cho data manipulation phức tạp nhưng không hiệu quả và không chuẩn cho one-hot encoding. -
Group Categorical Values
❌ Sai: Module này dùng để nhóm các giá trị phân loại lại (ví dụ: gộp rare categories thành "Other"), giảm số lượng hạng mục nhưng không tạo binary indicators. Nó chỉ preprocess để đơn giản hóa, không thay thế one-hot encoding.
🧑💻 Kết luận từ Azure Data Scientist: Trong thực tế dự án Azure ML, luôn ưu tiên Convert to Indicator Values cho binary encoding để tránh multicollinearity và tối ưu mô hình (như trong AutoML hoặc pipeline). Nếu dùng Azure ML Studio designer mới (2026), có thể dùng "Encode categorical columns" với tùy chọn one-hot! 🚀
The deployment fails.
You need to use the Python SDK in the notebook to determine the events that occurred during service deployment an initialization.
Which code segment should you use?
- A service.state
- B service.get_logs()
- C service.serialize()
- D service.environment
Xem giải thích
🧩 Phân tích chi tiết nội dung câu hỏi
Câu hỏi xoay quanh việc triển khai mô hình học máy (model deployment) trên Azure Machine Learning (Azure ML) bằng Python SDK phiên bản 1 (azureml.core). Cụ thể:
- Người dùng đang sử dụng notebook để deploy một mô hình dưới dạng web service trên ACI (Azure Container Instances) – một môi trường triển khai nhanh, nhẹ cho testing.
- Code bao gồm:
- InferenceConfig: Cấu hình môi trường suy luận với runtime Python, thư mục source, script entry (
score.py), và file conda (env.yml). - AciWebservice.deploy_configuration: Cấu hình tài nguyên (1 CPU core, 1GB RAM).
- Model.deploy: Triển khai model từ workspace (
ws), tên service'my-service', với model list[model]. - service.wait_for_deployment(True): Chờ deployment hoàn tất.
- InferenceConfig: Cấu hình môi trường suy luận với runtime Python, thư mục source, script entry (
- Vấn đề: Deployment thất bại (fails).
- Yêu cầu: Sử dụng Python SDK trong notebook để xác định các events (sự kiện) xảy ra trong quá trình deployment và initialization (khởi tạo service).
Mục tiêu là debug lỗi bằng cách lấy logs chi tiết về các bước: build image, pull image, start container, health checks, v.v. Đây là tình huống phổ biến trong Azure ML khi ACI deployment fail do lỗi env, script, hoặc resource.
Kiến thức cập nhật: Theo Azure ML SDK v1 (vẫn hỗ trợ đến 2026, khuyến nghị migrate sang v2 với MLflow), phương thức lấy logs deployment là chuẩn cho Webservice (ACI/AKS). Phiên bản mới nhất (SDK 1.52+ năm 2024-2026) không thay đổi API này.
✅ Đáp án đúng và lý do lựa chọn
Đáp án đúng: service.get_logs()
🛠️ Lý do:
- Phương thức
get_logs()trả về toàn bộ logs chi tiết của service deployment, bao gồm các events từ build Docker image, deploy container, initialization, đến error messages cụ thể (ví dụ: lỗi import package, syntax score.py, hoặc OOM). - Sau khi
wait_for_deployment(True)fail, gọiservice.get_logs()ngay để print logs ra notebook console, giúp debug nhanh. - Đây là best practice chính thức từ Microsoft docs cho ACIWebservice troubleshooting.
📋 Giải thích tất cả các phương án (đúng/sai)
-
service.state ❌ Sai:
- Chỉ trả về trạng thái hiện tại của service (ví dụ: 'Failed', 'Running', 'Transitioning'), không cung cấp logs events chi tiết. Không đủ để phân tích tại sao fail (chỉ biết "Failed" mà không có logs).
-
service.get_logs() ✅ Đúng:
- Như đã giải thích: Lấy full logs stream của deployment lifecycle (events từ provisioning đến init). Ví dụ output: timestamps, Docker build logs, conda env install, score.py execution errors. Hoàn hảo cho debug.
-
service.serialize() ❌ Sai:
- Trả về JSON serialization của service object (metadata như config, tags), không liên quan đến logs hay events. Dùng cho export/import, không debug deployment.
-
service.environment ❌ Sai:
- Trả về InferenceConfig environment (conda_file, runtime), chỉ là config tĩnh, không có logs động của deployment process.
📘 Tài liệu tham khảo
- Azure ML Docs (Official): Troubleshoot deployments in Azure Machine Learning – Khuyến nghị
get_logs()cho ACI. - SDK Reference: AciWebservice.get_logs (v1.52+, valid đến 2026).
- CLI tương đương:
az ml service get-logs --name my-service --workspace-name ws.
Hy vọng phân tích này giúp bạn debug hiệu quả! 🚀 Nếu cần code mẫu đầy đủ, hãy hỏi thêm nhé!