Ngân hàng đề — Microsoft Azure Data Scientist
Tìm thấy 313 câu.
After you answer a question in this section, you will NOT be able to return to it. As a result, these questions will not appear in the review screen.
An IT department creates the following Azure resource groups and resources:
The IT department creates an Azure Kubernetes Service (AKS)-based inference compute target named aks-cluster in the Azure Machine Learning workspace.
You have a Microsoft Surface Book computer with a GPU. Python 3.6 and Visual Studio Code are installed.
You need to run a script that trains a deep neural network (DNN) model and logs the loss and accuracy metrics.
Solution: Install the Azure ML SDK on the Surface Book. Run Python code to connect to the workspace. Run the training script as an experiment on the aks- cluster compute target.
Does the solution meet the goal?
- A Yes
- B No
Xem giải thích
🧩 Phân tích chi tiết nội dung câu hỏi
📖 Mô tả ngữ cảnh câu hỏi:
- Đây là một câu hỏi thuộc dạng series questions trong kỳ thi chứng chỉ (có thể là AZ-400 hoặc DP-100 về Azure ML), nơi mỗi câu có giải pháp riêng biệt để đạt mục tiêu. Sau khi trả lời, không thể quay lại.
- Tài nguyên Azure đã tạo:
- Resource group "ml_resources": Chứa Azure Machine Learning workspace (tên
amlworkspace), Azure Storage account (amlworkspace12345), Application Insights (amlworkspace54321), Azure Key Vault (amlworkspace67890), Azure Container Registry (amlworkspace09876). - Resource group "general_compute": Chứa một Virtual Machine (VM) tên
mlvmvới cấu hình mạnh mẽ: OS Ubuntu Linux, phần mềm Python 3.6 + Jupyter Notebooks, kích thước NC6 (6 vCPU, 1 GPU, 56 GB RAM) – phù hợp cho training mô hình deep learning nhờ GPU.
- Resource group "ml_resources": Chứa Azure Machine Learning workspace (tên
- Thêm thông tin: IT department tạo một AKS-based inference compute target tên
aks-clustertrong Azure Machine Learning workspace. (Lưu ý: Inference compute target nghĩa là dành cho suy luận/inference, không phải training). - Môi trường người dùng: Máy tính Microsoft Surface Book có GPU, đã cài Python 3.6 và Visual Studio Code.
- Mục tiêu (goal): Chạy script train một mô hình deep neural network (DNN) và log metrics loss + accuracy.
🛠️ Giải pháp đề xuất (Solution):
- Cài Azure ML SDK trên Surface Book.
- Chạy code Python để kết nối với workspace.
- Chạy training script dưới dạng experiment trên compute target
aks-cluster.
❓ Câu hỏi chính: Giải pháp này có đạt mục tiêu không? (Yes/No)
🔍 Phân tích từ hình ảnh đính kèm:
- Hình ảnh là bảng tóm tắt resources: | Resource group | Resources | |----------------|-----------| | ml_resources | • Azure ML workspace
amlworkspace
• Storageamlworkspace12345
• App Insightsamlworkspace54321
• Key Vaultamlworkspace67890
• Container Registryamlworkspace09876| | general_compute | VMmlvm: Ubuntu Linux, Python 3.6 + Jupyter, size NC6 (6 vCPU, 1 GPU, 56 GB RAM) | - Quan trọng: Không có AKS cluster nào trong danh sách resources.
aks-clusterchỉ là inference compute target được tạo trong workspace, KHÔNG phải compute target cho training. VMmlvmcó GPU lý tưởng cho DNN training, nhưng solution không dùng nó.
✅ Đáp án đúng: No
Lý do lựa chọn (dựa trên kiến thức Azure ML mới nhất đến 2026 - v2.x SDK):
- 🛑 AKS cluster trong Azure ML chỉ dành cho inference/deployments, không hỗ trợ trực tiếp làm compute target cho training experiments. Theo docs Azure ML (phiên bản 2024-2026), AKS được dùng cho managed online endpoints hoặc Kubernetes jobs (inference/batch inference), không phải batch training jobs thông thường với metrics logging như loss/accuracy.
- 🛠️ Training DNN cần GPU compute (như AmlCompute cluster, Compute Instance/VM với GPU, hoặc local).
aks-clusterlà inference target, nên submit experiment lên đó sẽ fail hoặc không log metrics đúng cách. - 💡 Giải pháp đúng có thể: Dùng local Surface Book (có GPU), hoặc attach VM
mlvmlàm compute target, hoặc tạo AmlCompute GPU cluster. Không cần AKS cho training DNN. - 📈 Python 3.6 trên Surface Book khớp với VM, nhưng SDK v2 yêu cầu Python 3.8+ cho một số features mới (dù vẫn hỗ trợ legacy).
🧪 Giải thích tất cả các phương án (giữ nguyên text gốc)
-
Yes ❌ SAI
Phương án này không đúng vì solution sử dụngaks-cluster– một inference compute target – để train DNN và log metrics. AKS không được thiết kế cho training experiments trong Azure ML; nó chỉ hỗ trợ inference (deploy models). Submit job lên AKS sẽ không đạt goal training/log metrics, dẫn đến lỗi hoặc không tương thích. (Azure ML docs: Compute targets phân biệt rõ training vs. inference). -
No ✅ ĐÚNG
Phương án này chính xác vì solution KHÔNG meet the goal. Lý do chính:aks-clusterchỉ là inference target (tạo cho deployments), không hỗ trợ training script với logging loss/accuracy như experiment. Cần compute target khác (local GPU, AmlCompute, hoặc VMmlvmvới NC6 GPU). Đây là lỗi phổ biến trong DP-100 exam.
📘 Tài liệu tham khảo (cập nhật đến 2026)
- 🖥️ Azure ML Documentation - Compute targets: https://learn.microsoft.com/en-us/azure/machine-learning/reference-managed-online-endpoints?tabs=sdk-v2 (AKS chỉ cho inference, không training).
- 🔗 Training concepts: https://learn.microsoft.com/en-us/azure/machine-learning/concept-train-model?view=azureml-api-2 (Liệt kê compute targets hợp lệ: AmlCompute, Instance, Local – không AKS).
- 📊 Exam reference (DP-100): ExamTopics/Q4274 (xác nhận No là đáp án).
- 🆕 SDK v2 Updates 2024-2026: Python 3.8+ khuyến nghị, AKS enhancements chỉ cho endpoints (không training jobs).
💡 Lời khuyên: Để train DNN thực tế, dùng azureml-sdk[v2], script với MLClient, submit đến AmlCompute GPU cluster! 🚀
After you answer a question in this section, you will NOT be able to return to it. As a result, these questions will not appear in the review screen.
You are creating a model to predict the price of a student's artwork depending on the following variables: the student's length of education, degree type, and art form.
You start by creating a linear regression model.
You need to evaluate the linear regression model.
Solution: Use the following metrics: Accuracy, Precision, Recall, F1 score, and AUC.
Does the solution meet the goal?
- A Yes
- B No
Xem giải thích
🧩 Phân tích chi tiết nội dung câu hỏi
Câu hỏi thuộc dạng case study trong các kỳ thi chứng chỉ AWS (như AWS Certified Machine Learning - Specialty), nơi mô tả một tình huống cụ thể và yêu cầu đánh giá giải pháp có đạt mục tiêu hay không.
- Tình huống: Bạn đang xây dựng mô hình linear regression để dự đoán giá (price) của tác phẩm nghệ thuật của học sinh, dựa trên các biến: thời gian học tập (length of education), loại bằng cấp (degree type), và hình thức nghệ thuật (art form).
- Mục tiêu: Đánh giá (evaluate) mô hình linear regression này.
- Giải pháp đề xuất: Sử dụng các metrics: Accuracy, Precision, Recall, F1 score, và AUC.
- Câu hỏi chính: Giải pháp này có đạt mục tiêu (meet the goal) không?
- Đây là bài kiểm tra kiến thức về phân loại metrics phù hợp với loại mô hình. Linear regression là mô hình regression (dự đoán giá trị liên tục - continuous value như giá tiền), KHÔNG phải classification (phân loại nhãn rời rạc).
📘 Lưu ý từ AWS (cập nhật đến 2026): Theo tài liệu AWS SageMaker và ML best practices (phiên bản mới nhất SageMaker 2026), đánh giá regression model phải dùng metrics chuyên biệt như RMSE, MAE, R², không dùng classification metrics. (Nguồn: AWS SageMaker Documentation - Model Evaluation Metrics).
✅ Đáp án đúng: No
Lý do lựa chọn:
- Giải pháp KHÔNG đạt mục tiêu vì các metrics Accuracy, Precision, Recall, F1 score, AUC chỉ phù hợp cho mô hình classification (phân loại, ví dụ: dự đoán "cao/thấp" hoặc nhãn rời rạc).
- Với linear regression (dự đoán giá trị số liên tục), cần dùng metrics như RMSE (Root Mean Squared Error), MAE (Mean Absolute Error), R² (R-squared), hoặc MSE (Mean Squared Error) để đo lường độ chính xác dự đoán số.
- 🛠️ Ví dụ thực tế: Nếu giá thực tế là 100 USD, mô hình dự đoán 105 USD → Tính chênh lệch số (error), không phải tỷ lệ đúng/sai như classification.
🧩 Giải thích tất cả các phương án (giữ nguyên văn bản gốc)
-
Yes ❌
Sai vì: Phương án này cho rằng giải pháp đạt mục tiêu, nhưng thực tế KHÔNG phù hợp. Các metrics như Accuracy (tỷ lệ dự đoán đúng), Precision (độ chính xác dương tính), Recall (độ nhạy), F1 score (trung bình hài hòa Precision-Recall), AUC (diện tích dưới đường cong ROC) chỉ áp dụng cho binary/multi-class classification (nhãn rời rạc). Linear regression output là số thực, không có "ngưỡng" để tính threshold-based metrics. Sử dụng chúng sẽ dẫn đến lỗi hoặc không ý nghĩa (ví dụ: scikit-learn từ chối hoặc báo lỗi). Theo AWS SageMaker, đây là best practice violation. -
No ✅
Đúng vì: Phương án này chính xác xác định giải pháp KHÔNG đạt mục tiêu. Cần thay bằng regression metrics phù hợp. AWS khuyến nghị: | Loại mô hình | Metrics khuyến nghị (SageMaker 2026) | |--------------|-------------------------------------| | Regression | RMSE, MAE, R² | | Classification | Accuracy, Precision, Recall, F1, AUC |🛠️ Khuyến nghị sửa: Sử dụng SageMaker Model Monitor hoặc built-in metrics cho regression để tự động tính toán.
📘 Tài liệu tham khảo:
- AWS Certified Machine Learning - Specialty Exam Guide (2026).
- SageMaker Regression Metrics.
- Scikit-learn docs: Regression Metrics (tích hợp trong SageMaker).
Hy vọng phân tích này giúp bạn ôn thi hiệu quả! 🚀
You would like to split data into two separate datasets.
Which of the following actions should you take?
- A You should make use of the Split Data module.
- B You should make use of the Group Categorical Values module.
- C You should make use of the Clip Values module.
- D You should make use of the Group Data into Bins module.
Xem giải thích
🧩 Phân tích chi tiết nội dung câu hỏi
Câu hỏi này thuộc lĩnh vực Azure Machine Learning Studio (phiên bản classic, nay được gọi là Azure ML Studio classic), một công cụ kéo-thả để xây dựng các thí nghiệm machine learning trên nền tảng Microsoft Azure. 📘
- Tình huống: Bạn đang xây dựng một thí nghiệm machine learning qua giao diện Azure Machine Learning Studio.
- Yêu cầu cụ thể: Bạn muốn chia dữ liệu thành hai tập dữ liệu riêng biệt (split data into two separate datasets). Điều này thường dùng để tạo tập huấn luyện (training set) và tập kiểm tra (testing set), hoặc các mục đích phân chia dữ liệu khác trong pipeline ML.
- Mục tiêu: Xác định module đúng trong thư viện module của Azure ML Studio để thực hiện hành động này. 🛠️
Câu hỏi kiểm tra kiến thức về các module xử lý dữ liệu cơ bản trong Azure ML Studio, nhấn mạnh vào việc chọn công cụ phù hợp để phân chia dataset mà không thay đổi nội dung dữ liệu.
✅ Đáp án đúng và lý do lựa chọn
Đáp án đúng: You should make use of the Split Data module.
Lý do:
Module Split Data được thiết kế chuyên biệt để chia một dataset đầu vào thành hai hoặc nhiều dataset con dựa trên các tham số như tỷ lệ phần trăm (fraction of rows in the first output dataset), seed ngẫu nhiên (random seed) để đảm bảo tính tái lập, hoặc các chế độ như split rows/columns. Đây là module chuẩn và được khuyến nghị trong mọi pipeline ML trên Azure ML Studio để tạo train/test split. Theo tài liệu chính thức Microsoft (cập nhật đến 2024-2026), module này vẫn là lựa chọn hàng đầu trong Azure ML Designer và Studio classic. 🚀
📋 Giải thích tất cả các phương án (đúng và sai)
-
✅ You should make use of the Split Data module.
Đúng vì module này chính xác dùng để phân chia dataset thành các phần riêng biệt (ví dụ: 70% train, 30% test) mà không làm thay đổi dữ liệu gốc. Nó hỗ trợ các tùy chọn linh hoạt như relative/chỉ số hàng, và là bước đầu tiên tiêu chuẩn trong thí nghiệm ML. 🏆 -
❌ You should make use of the Group Categorical Values module.
Sai vì module này dùng để nhóm các giá trị categorical (danh mục) thành các nhóm mới dựa trên quy tắc mapping hoặc key-value, nhằm giảm số lượng categories lẻ tẻ (như one-hot encoding preprocessing). Nó không chia dataset thành các tập riêng biệt mà chỉ biến đổi cột dữ liệu. 😕 -
❌ You should make use of the Clip Values module.
Sai vì module Clip Values (hay còn gọi là Cap Values) dùng để giới hạn giá trị trong cột số vào khoảng min-max (clip outliers), giúp xử lý dữ liệu bất thường. Nó không tạo ra dataset mới riêng biệt mà chỉ chỉnh sửa dữ liệu đầu vào. 📏 -
❌ You should make use of the Group Data into Bins module.
Sai vì module này dùng để phân loại dữ liệu số thành các bin (khoang) dựa trên quantile, equal width, hoặc custom, thường cho discretization (ví dụ: chuyển age thành trẻ/trung niên). Nó tạo cột mới phân loại chứ không split dataset thành các tập độc lập. 🗂️
📚 Tài liệu tham khảo (cập nhật mới nhất đến 2026)
- Microsoft Docs - Split Data module: docs.microsoft.com/en-us/azure/machine-learning/studio-module-reference/split-data (Azure ML Studio classic, vẫn hỗ trợ đầy đủ).
- Azure ML Designer (phiên bản mới): Tương đương với "Split Data" trong pipeline designer tại learn.microsoft.com/en-us/azure/machine-learning/component-reference/split-data (tích hợp AI Studio 2024+).
- Hướng dẫn thí nghiệm ML: Azure ML Best Practices – Nhấn mạnh Split Data cho data splitting.
Phân tích này dựa trên kiến thức Azure ML cập nhật nhất, giúp bạn tự tin áp dụng trong thực tế! 🔍
The software engineering team reports there is a heavy inferencing load for the prediction web services during the summer. The production web service for the model fails to meet demand despite having a fully-utilized compute cluster where the web service is deployed.
You need to improve performance of the image classification web service with minimal downtime and minimal administrative effort.
What should you advise the IT Operations team to do?
- A Create a new compute cluster by using larger VM sizes for the nodes, redeploy the web service to that cluster, and update the DNS registration for the service endpoint to point to the new cluster.
- B Increase the node count of the compute cluster where the web service is deployed.
- C Increase the minimum node count of the compute cluster where the web service is deployed.
- D Increase the VM size of nodes in the compute cluster where the web service is deployed.
Xem giải thích
🧩 Giải thích nội dung câu hỏi
Câu hỏi mô tả một tổ chức đã tạo và triển khai mô hình học sâu phân loại hình ảnh đa lớp (multi-class image classification) sử dụng tập ảnh có nhãn. 📸 Đội ngũ kỹ sư phần mềm báo cáo rằng tải inferencing (dự đoán) rất nặng vào mùa hè, dẫn đến dịch vụ web dự đoán không đáp ứng được nhu cầu dù cụm tính toán (compute cluster) đã được sử dụng đầy tải (fully-utilized).
Yêu cầu là cải thiện hiệu suất dịch vụ web phân loại hình ảnh với thời gian gián đoạn tối thiểu (minimal downtime) và nỗ lực quản trị tối thiểu (minimal administrative effort). 🛠️
Đây là tình huống điển hình trong AWS SageMaker (dịch vụ ML managed của AWS), nơi mô hình được deploy thành endpoint trên một compute cluster (cụm instance EC2). Vấn đề là scale inference workload để xử lý traffic cao đột biến (peak summer load), mà không cần thay đổi lớn về hạ tầng. Theo tài liệu AWS SageMaker mới nhất (cập nhật 2025-2026), SageMaker hỗ trợ horizontal scaling nhanh chóng qua API để tăng số node (instance count) mà không downtime đáng kể. 📘 Nguồn tham khảo: AWS SageMaker Documentation - Scaling Endpoints và SageMaker Inference Best Practices.
✅ Đáp án đúng và lý do lựa chọn
Đáp án đúng: Increase the node count of the compute cluster where the web service is deployed.
Lý do:
- Phương án này thực hiện horizontal scaling (tăng số lượng node/instance) ngay lập tức trên cụm hiện tại, giúp phân tán tải inferencing mà không gây downtime vì SageMaker tự động quản lý việc thêm instance mới và route traffic (zero-downtime scaling). 🟢
- Đây là cách tối ưu nhất với nỗ lực quản trị thấp: chỉ cần gọi API
UpdateEndpointhoặc sử dụng SageMaker Console/CLI để tăngInstanceCount. Hiệu suất cải thiện nhanh chóng cho workload heavy inferencing như image classification (ví dụ: ResNet models). - Phù hợp phiên bản SageMaker mới nhất (2026), hỗ trợ real-time inference scaling lên đến hàng nghìn instances với auto-scaling policy dựa trên CPU/Memory utilization. 🚀
📋 Phân tích tất cả các phương án
Dưới đây là phân tích chi tiết từng lựa chọn, giữ nguyên văn bản gốc bằng tiếng Anh. Mỗi phương án được đánh giá đúng/sai với lý do cụ thể dựa trên best practices AWS SageMaker:
-
❌ [SAI] Create a new compute cluster by using larger VM sizes for the nodes, redeploy the web service to that cluster, and update the DNS registration for the service endpoint to point to the new cluster.
Giải thích sai: Phương án này yêu cầu tạo cụm mới với VM lớn hơn (vertical scaling), redeploy model và cập nhật DNS – dẫn đến downtime cao (có thể hàng giờ) và nỗ lực quản trị lớn (tạo cluster, test, migrate traffic). Không phù hợp yêu cầu "minimal downtime/admin effort". SageMaker khuyến nghị tránh redeploy full cluster cho scaling nhanh. 😵 -
✅ [ĐÚNG] Increase the node count of the compute cluster where the web service is deployed.
Giải thích đúng: Như đã nêu ở trên, đây là horizontal scaling trực tiếp trên endpoint hiện tại quaDesiredInstanceCount, SageMaker tự động provision thêm instances (EC2) và balance load mà không gián đoạn service. Lý tưởng cho peak load mùa hè, hỗ trợ lên đến 1.000+ nodes với low latency. 💪 Nguồn: SageMaker UpdateEndpoint API. -
❌ [SAI] Increase the minimum node count of the compute cluster where the web service is deployed.
Giải thích sai:MinInstanceCountchỉ là tham số cho autoscaling policy (như TargetTrackingScaling), giúp duy trì baseline nhưng không tăng capacity ngay lập tức khi cluster fully-utilized. Traffic spike vẫn gây bottleneck cho đến khi autoscaler kích hoạt (có thể trễ 5-10 phút). Không giải quyết "immediate heavy load" hiệu quả. ⏳ -
❌ [SAI] Increase the VM size of nodes in the compute cluster where the web service is deployed.
Giải thích sai: Tăng VM size (vertical scaling, ví dụ từ ml.m5.large sang ml.m5.4xlarge) yêu cầu stop/replace instances, gây downtime ngắn (vài phút đến giờ) và có thể cần update endpoint config. Không tối ưu cho inferencing parallelizable như image classification – horizontal scaling hiệu quả hơn. SageMaker ưu tiên scale-out cho throughput cao. 📈
After you answer a question in this section, you will NOT be able to return to it. As a result, these questions will not appear in the review screen.
You are creating a model to predict the price of a student's artwork depending on the following variables: the student's length of education, degree type, and art form.
You start by creating a linear regression model.
You need to evaluate the linear regression model.
Solution: Use the following metrics: Relative Squared Error, Coefficient of Determination, Accuracy, Precision, Recall, F1 score, and AUC.
Does the solution meet the goal?
- A Yes
- B No
Xem giải thích
🧩 Phân tích chi tiết nội dung câu hỏi
Câu hỏi thuộc dạng case study trong kỳ thi chứng chỉ AWS (có thể là AWS Certified Machine Learning – Specialty hoặc tương tự), nơi bạn đang xây dựng mô hình linear regression để dự đoán giá tác phẩm nghệ thuật của học sinh dựa trên các biến: thời gian học (length of education), loại bằng cấp (degree type), và hình thức nghệ thuật (art form).
📌 Mục tiêu chính: Đánh giá (evaluate) mô hình linear regression này.
🛠️ Giải pháp đề xuất: Sử dụng các metrics sau để đánh giá: Relative Squared Error, Coefficient of Determination, Accuracy, Precision, Recall, F1 score, and AUC.
❓ Câu hỏi cốt lõi: Giải pháp này có đạt được mục tiêu không? (Does the solution meet the goal?)
Bối cảnh quan trọng:
- Đây là nhiệm vụ regression (dự đoán giá trị liên tục như giá tiền), không phải classification (phân loại).
- Câu hỏi thuộc series, mỗi câu có giải pháp riêng, và bạn không thể quay lại sau khi trả lời.
(Kiến thức cập nhật đến 2026: Theo AWS SageMaker và các best practices ML mới nhất, đánh giá regression ưu tiên metrics đo lường lỗi dự đoán liên tục, không dùng metrics classification.)
✅ Đáp án đúng: No
Lý do lựa chọn:
Giải pháp không đạt mục tiêu vì sử dụng lẫn lộn metrics phù hợp cho regression (như Relative Squared Error và Coefficient of Determination) với các metrics dành riêng cho classification (Accuracy, Precision, Recall, F1 score, AUC). Linear regression dự đoán giá trị số liên tục, nên chỉ cần metrics regression như MSE, RMSE, MAE, R². Việc dùng metrics classification sẽ không chính xác và không phản ánh đúng hiệu suất mô hình.
🧮 Ví dụ minh họa: Dự đoán giá artwork = 500 USD, metrics classification như Accuracy chỉ áp dụng khi output là nhãn rời rạc (ví dụ: "rẻ" hay "đắt"), không phải số thực.
📋 Giải thích tất cả các phương án
Dưới đây là phân tích từng lựa chọn giữ nguyên văn bản gốc bằng tiếng Anh, kèm giải thích chi tiết bằng tiếng Việt vì sao đúng/sai:
-
Yes ❌ SAI
Phương án này cho rằng giải pháp đạt mục tiêu, nhưng thực tế không đúng. Lý do: Các metrics Accuracy, Precision, Recall, F1 score, AUC chỉ dùng cho nhiệm vụ classification (phân loại binary/multiclass), nơi output là xác suất hoặc nhãn rời rạc. Với linear regression (regression task), chúng không áp dụng được vì không có "true label" kiểu class. Chỉ Relative Squared Error (RSE - đo lỗi tương đối bình phương) và Coefficient of Determination (R² - đo độ giải thích biến thiên) là phù hợp, nhưng mix sai làm toàn bộ giải pháp invalid. Theo AWS SageMaker (2026), đánh giá regression phải dùng metrics như MAE/RMSE để tránh misleading results. -
No ✅ ĐÚNG
Phương án này chính xác vì giải pháp không meet the goal. Lý do: Linear regression cần metrics chuyên biệt cho dự đoán liên tục như Mean Absolute Error (MAE), Root Mean Squared Error (RMSE), Mean Squared Error (MSE), R², hoặc Relative Absolute Error (RAE). Các metrics classification (Accuracy: tỷ lệ đúng; Precision: độ chính xác positive; Recall: độ bao phủ positive; F1: harmonic mean; AUC: diện tích dưới ROC curve) hoàn toàn không phù hợp, dẫn đến đánh giá sai lệch. Giải pháp đúng phải loại bỏ phần classification metrics.
📘 Tài liệu tham khảo
- AWS SageMaker Documentation (2026): Evaluating Models in SageMaker – Nhấn mạnh metrics regression vs classification.
- Scikit-learn Metrics Guide (tích hợp AWS): Regression Metrics – Xác nhận RSE và R² cho regression, loại Accuracy/F1/AUC.
- AWS ML Specialty Exam Guide (2026): Best practices cho linear regression evaluation.
Hy vọng phân tích này giúp bạn nắm vững! 🚀 Nếu cần thêm ví dụ code SageMaker, hãy hỏi nhé!
You have to makes sure that the pipeline trains a model using data in a comma-separated values (CSV) file that is published on a website. A dataset for the file for this file does not exist.
Data from the CSV file must be ingested into the designer pipeline with the least amount of administrative effort as possible.
Which of the following actions should you take?
- A You should make use of the Convert to TXT module.
- B You should add the Copy Data object to the pipeline.
- C You should add the Import Data object to the pipeline.
- D You should add the Dataset object to the pipeline.
Xem giải thích
🧩 Giải thích chi tiết nội dung câu hỏi
Câu hỏi tập trung vào Azure Machine Learning Designer (một công cụ kéo-thả để xây dựng pipeline machine learning trong Azure ML Studio). Nhiệm vụ là tạo pipeline mới để train model sử dụng dữ liệu từ file CSV được publish trên một website (tức là truy cập qua URL HTTP/HTTPS). Không có dataset nào tồn tại trước đó trong Azure workspace. Yêu cầu chính: Ingest (nhập dữ liệu) vào pipeline với ít nỗ lực quản trị (administrative effort) nhất có thể.
📘 Bối cảnh kỹ thuật: Azure ML Designer cung cấp các module để xử lý dữ liệu. Vì dữ liệu từ web (không phải storage Azure sẵn có), cần module hỗ trợ import trực tiếp từ URL mà không cần tạo dataset thủ công hoặc copy data phức tạp. Điều này giúp pipeline đơn giản, nhanh chóng, phù hợp với nguyên tắc "least effort".
(Kiến thức cập nhật: Theo tài liệu Azure ML Designer phiên bản mới nhất 2024-2026, module Import Data vẫn là lựa chọn tối ưu cho import từ web URL mà không yêu cầu dataset tồn tại trước - tham khảo: Azure Docs - Import Data module).
✅ Đáp án đúng và lý do lựa chọn
Đáp án đúng: You should add the Import Data object to the pipeline.
🛠️ Lý do: Module Import Data trong Azure ML Designer cho phép nhập dữ liệu trực tiếp từ URL web (HTTP/HTTPS) hỗ trợ file CSV mà không cần tạo dataset trước. Chỉ cần kéo module vào canvas, nhập URL của file CSV, chọn định dạng (CSV), và chạy pipeline. Đây là cách ít nỗ lực quản trị nhất vì không yêu cầu upload file lên Azure Storage, tạo dataset thủ công, hay tích hợp dịch vụ khác. Pipeline sẽ tự động ingest data mỗi lần chạy, lý tưởng cho dữ liệu động từ web.
📋 Giải thích tất cả các phương án (đúng/sai)
-
[SAI] You should make use of the Convert to TXT module.
❌ Sai vì: Module Convert to TXT chỉ dùng để chuyển đổi dữ liệu đã có trong pipeline sang định dạng text thuần (ví dụ: từ dataset binary sang TXT để debug). Nó không ingest dữ liệu từ web mà cần dữ liệu đầu vào sẵn. Sử dụng sẽ yêu cầu bước trung gian phức tạp, tăng effort admin. -
[SAI] You should add the Copy Data object to the pipeline.
❌ Sai vì: Copy Data là hoạt động trong Azure Data Factory (ADF), không phải module native của Azure ML Designer. Để dùng, phải tích hợp ADF pipeline riêng (cross-service), tạo linked service, dataset schema... dẫn đến effort admin cao (cấu hình quyền, trigger, monitoring). Không phù hợp cho ingest đơn giản từ web vào ML pipeline. -
[ĐÚNG] You should add the Import Data object to the pipeline.
✅ Đúng vì: Như giải thích trên, module này hỗ trợ trực tiếp URL web cho CSV với cấu hình tối thiểu (URL + delimiter). Không cần dataset tồn tại, tự parse data on-the-fly. Hỗ trợ authentication nếu cần (API key), và tích hợp liền mạch với các module train sau. (Least effort theo best practice Azure ML 2026). -
[SAI] You should add the Dataset object to the pipeline.
❌ Sai vì: Dataset object yêu cầu dataset phải tồn tại trước trong Azure ML workspace (tạo từ Datastore như Blob/ADLS). Vì "dataset does not exist", phải tạo thủ công (upload CSV lên storage, register dataset), tăng effort admin đáng kể (quyền IAM, versioning). Không ingest trực tiếp từ web mà không qua storage.
🔗 Tài liệu tham khảo
- Azure ML Designer: Import Data module (Official docs, updated 2024).
- Designer best practices for data ingestion (Hướng dẫn least effort workflows).
- Video tutorial: Import from web (Azure official channel).
Hy vọng phân tích này giúp bạn nắm vững Azure ML Designer! 🚀 Nếu cần demo pipeline, hãy hỏi thêm nhé!
You need to select a compute target to deploy the workspace.
What should you use?
- A Azure Data Lake Analytics
- B Azure Databricks
- C Azure Container Service
- D Apache Spark for HDInsight
Xem giải thích
🧩 Giải thích chi tiết nội dung câu hỏi
Câu hỏi tập trung vào việc phát triển một không gian làm việc dữ liệu khoa học (data science workspace) sử dụng dịch vụ Azure Machine Learning (Azure ML). Nhiệm vụ cụ thể là chọn mục tiêu tính toán (compute target) phù hợp để triển khai (deploy) không gian làm việc này.
- Azure ML workspace là môi trường trung tâm để quản lý các tài nguyên data science như datasets, experiments, models, endpoints.
- Compute target là các cụm tính toán (clusters) hoặc instances được gắn kết với workspace để thực hiện training mô hình ML, inference, hoặc xử lý dữ liệu lớn. Chúng phải tương thích trực tiếp với Azure ML để hỗ trợ tích hợp liền mạch (như qua SDK hoặc studio).
- Theo tài liệu Azure ML mới nhất (cập nhật đến 2026, phiên bản Azure ML v2), compute targets được hỗ trợ bao gồm Azure ML Compute, Compute Instances, ACI, AKS, Azure Databricks, và một số khác như HDInsight (nhưng không phải tất cả đều dùng để "deploy workspace").
📘 Nguồn tham khảo chính:
- Azure ML Compute Targets Documentation (Microsoft Learn, cập nhật 2025-2026).
- Azure Databricks Integration with Azure ML.
✅ Đáp án đúng: Azure Databricks
Lý do chọn: Azure Databricks là compute target chính thức và được khuyến nghị cho Azure ML workspace trong các workload data science lớn, hỗ trợ Spark-based processing, collaborative notebooks, và MLflow integration. Nó cho phép deploy workspace trực tiếp qua Azure ML Studio, attach Databricks cluster để training/inference scalable. Tính năng này được tối ưu hóa từ Azure ML v1 sang v2 (2023+), với auto-scaling và managed Spark pools đến 2026.
🛠️ Phân tích tất cả các phương án
Dưới đây là giải thích chi tiết từng lựa chọn, giữ nguyên văn bản gốc bằng tiếng Anh. Tôi đánh dấu ✅ cho đúng và ❌ cho sai, kèm lý do bằng tiếng Việt rõ ràng:
-
Azure Data Lake Analytics ❌
Sai vì: Đây là dịch vụ U-SQL based analytics cho xử lý dữ liệu lớn theo nhu cầu (on-demand), không phải compute target cho Azure ML workspace. Nó không hỗ trợ attach trực tiếp vào Azure ML để training/deploy models, thiếu tích hợp ML workflows. (Đã deprecated một phần từ 2023, thay bằng Synapse Analytics). -
Azure Databricks ✅
Đúng vì: Là compute target native cho Azure ML, hỗ trợ deploy workspace với Spark clusters managed, MLflow, và Delta Lake. Hoàn hảo cho data science collaborative, scaling đến hàng nghìn nodes (cập nhật 2026 với Photon engine). Tích hợp seamless quamlflow.azdatabricksvà Azure ML SDK. -
Azure Container Service ❌
Sai vì: Đây là dịch vụ đã deprecated từ 2020, thay bằng Azure Kubernetes Service (AKS). Nó không còn hỗ trợ mới cho Azure ML compute targets, thiếu managed orchestration cho ML workloads. Azure ML ưu tiên AKS/ACI riêng biệt cho containerized deployments. -
Apache Spark for HDInsight ❌
Sai vì: HDInsight Spark là cluster managed Hadoop/Spark, có thể attach hạn chế vào Azure ML nhưng không phải compute target chính thức ưu tiên cho workspace deployment. Nó kém linh hoạt hơn Databricks (thiếu notebooks collaborative, MLflow native), và Microsoft khuyến nghị chuyển sang Databricks/Synapse từ 2024-2026.
Hy vọng phân tích này giúp bạn nắm vững! 🚀 Nếu cần demo code hoặc lab Azure ML, hãy cho tôi biết nhé!
You train the model and prepare the real-time pipeline for deployment.
You need to publish the inference pipeline as a web service.
Which compute type should you use?
- A a new Machine Learning Compute resource
- B Azure Kubernetes Services
- C HDInsight
- D the existing Machine Learning Compute resource
- E Azure Databricks
Xem giải thích
🧩 Giải thích nội dung câu hỏi
Câu hỏi tập trung vào quy trình triển khai (deployment) một pipeline suy luận thời gian thực (real-time inference pipeline) được tạo bằng Azure Machine Learning Designer (nay là phần của Azure ML Studio classic). Cụ thể:
- Bạn đang sử dụng Designer để tạo một real-time service endpoint (điểm cuối dịch vụ thời gian thực).
- Bạn đã có một tài nguyên compute duy nhất của Azure Machine Learning service (Azure Machine Learning compute resource) đã đăng ký trong workspace.
- Bạn đã huấn luyện mô hình (train the model) và chuẩn bị pipeline real-time sẵn sàng triển khai.
- Nhiệm vụ: Publish (xuất bản) inference pipeline dưới dạng web service. Câu hỏi yêu cầu chọn loại compute phù hợp để triển khai.
📘 Bối cảnh quan trọng: Trong Azure ML (phiên bản mới nhất 2024-2026), real-time endpoints từ Designer (classic pipelines) chỉ hỗ trợ triển khai đến Azure Container Instances (ACI) cho testing/development (scale nhỏ) hoặc Azure Kubernetes Service (AKS) cho production (scale lớn, high availability). Compute cluster thông thường (Machine Learning Compute) chỉ dùng cho training hoặc batch inference, KHÔNG hỗ trợ real-time web service. Việc có "existing compute resource" không tự động làm nó phù hợp trừ khi đó là AKS hoặc ACI tương thích.
✅ Đáp án đúng duy nhất: Azure Kubernetes Services
Lý do lựa chọn: AKS là compute type được khuyến nghị và hỗ trợ chính thức cho real-time endpoints ở môi trường production. Nó cho phép scale tự động, load balancing, và độ tin cậy cao khi publish pipeline dưới dạng web service. Với một compute resource duy nhất hiện có, nếu nó không phải AKS, bạn vẫn nên chọn AKS (có thể tạo mới hoặc dùng existing AKS nếu phù hợp). Điều này phù hợp với best practice Azure ML cập nhật đến 2026, ưu tiên AKS cho real-time inference để tránh hạn chế của ACI (chỉ testing).
🛠️ Phân tích tất cả các phương án
Dưới đây là phân tích chi tiết từng lựa chọn, giữ nguyên văn bản gốc tiếng Anh. Tôi đánh dấu ✅ đúng hoặc ❌ sai dựa trên tài liệu chính thức Azure ML.
-
a new Machine Learning Compute resource ❌
Giải thích sai: "Machine Learning Compute resource" đề cập đến Compute Cluster (VM cluster) dùng cho training hoặc batch jobs. Loại này KHÔNG hỗ trợ real-time endpoints từ Designer vì không có khả năng xử lý HTTP requests thời gian thực. Tạo mới cũng vô ích, dẫn đến lỗi deployment. -
Azure Kubernetes Services ✅
Giải thích đúng: Đây là lựa chọn tối ưu cho real-time web service. AKS hỗ trợ deploy pipeline Designer với autoscaling, multi-replica, và production-grade features. Ngay cả khi có existing compute khác, AKS vẫn là type nên dùng (tạo mới hoặc attach existing AKS cluster). -
HDInsight ❌
Giải thích sai: HDInsight là dịch vụ managed Hadoop/Spark trên Azure, chuyên big data processing và batch analytics. Hoàn toàn không liên quan đến real-time inference hoặc Azure ML Designer, không hỗ trợ web service endpoints. -
the existing Machine Learning Compute resource ❌
Giải thích sai: Existing "Machine Learning Compute resource" thường là Compute Cluster đã có, chỉ phù hợp batch/training chứ KHÔNG dùng cho real-time pipeline. Dù workspace có single resource, nó không tương thích – deploy sẽ fail. Phải dùng AKS hoặc ACI thay thế. -
Azure Databricks ❌
Giải thích sai: Azure Databricks là platform Spark-based cho data engineering/ML, tích hợp với Azure ML nhưng KHÔNG phải compute target trực tiếp cho Designer real-time endpoints. Nó dùng cho notebooks/batch, không publish web service real-time.
📘 Tài liệu tham khảo (cập nhật mới nhất đến 2026)
- Deploy real-time endpoints in Azure ML Designer – Xác nhận ACI/AKS là supported compute cho real-time pipelines.
- Real-time inference overview – Best practices: AKS cho production, ACI cho dev/test (Designer dùng classic endpoints).
- Compute targets in Azure ML – Phân biệt rõ Machine Learning Compute (cluster) vs. AKS.
- Lưu ý: Từ 2024, Microsoft khuyến khích migrate sang Managed Online Endpoints (v2) trên AKS cho tất cả real-time, Designer classic vẫn hỗ trợ nhưng deprecated dần.
Nếu cần demo code hoặc triển khai thực tế trên Azure ML workspace, hãy cho tôi biết nhé! 🚀
You need to determine how closely the data fits the regression line.
Which metric should you review?
- A Root Mean Square Error
- B Coefficient of determination
- C Recall
- D Precision
- E Mean absolute error
Xem giải thích
🧠 Phân tích câu hỏi trắc nghiệm từ góc nhìn Microsoft Azure Data Scientist (với kiến thức AWS ML cập nhật đến 2026)
📖 Giải thích nội dung câu hỏi một cách chi tiết và rõ ràng:
Câu hỏi tập trung vào lĩnh vực Machine Learning (ML), cụ thể là mô hình hồi quy tuyến tính (linear regression). Bạn là một data scientist đang xây dựng mô hình này và cần đánh giá mức độ phù hợp (how closely the data fits) của dữ liệu với đường hồi quy (regression line).
- Regression line là đường thẳng dự đoán giá trị biến phụ thuộc dựa trên biến độc lập.
- Metric cần chọn phải đo lường goodness-of-fit (độ khớp tổng thể), tức là tỷ lệ dữ liệu thực tế "dính sát" đường hồi quy, thường dùng trong các dịch vụ AWS như Amazon SageMaker (cập nhật phiên bản SageMaker 2026 hỗ trợ đánh giá mô hình tự động qua R²).
Đây là khái niệm cốt lõi trong đánh giá mô hình hồi quy, không phải phân loại (classification).
✅ Đáp án đúng và lý do lựa chọn:
Coefficient of determination
🟢 Lý do: Đây là metric chuẩn (R² hoặc R-squared) để đo lường độ phù hợp của dữ liệu với đường hồi quy. Nó tính tỷ lệ phương sai của biến phụ thuộc được giải thích bởi mô hình (giá trị từ 0 đến 1: 1 = fit hoàn hảo, 0 = không giải thích gì). Trong AWS SageMaker (phiên bản mới nhất 2026), R² được ưu tiên cho linear regression để đánh giá tổng thể, giúp quyết định mô hình có tốt không mà không bị ảnh hưởng bởi scale dữ liệu.
🛠️ Giải thích tất cả các phương án (đúng và sai):
Dưới đây là phân tích chi tiết từng lựa chọn, giữ nguyên văn bản gốc bằng tiếng Anh. Phân tích bằng tiếng Việt để dễ hiểu:
-
❌ Root Mean Square Error
Sai vì RMSE đo lường lỗi trung bình bình phương căn bậc hai giữa giá trị dự đoán và thực tế, tập trung vào độ lớn lỗi (càng nhỏ càng tốt). Nó không trực tiếp đánh giá "độ fit với đường hồi quy" mà chỉ là metric lỗi, dễ bị ảnh hưởng bởi outlier. Trong AWS SageMaker, RMSE dùng cho regression nhưng không phải để xem "closely fits". -
✅ Coefficient of determination
Đúng như đã giải thích ở trên. Đây là metric duy nhất trực tiếp đo tỷ lệ biến thiên dữ liệu được mô hình giải thích, lý tưởng cho linear regression. AWS khuyến nghị dùng R² trong SageMaker Model Monitor (cập nhật 2026). -
❌ Recall
Sai vì Recall là metric cho phân loại (classification), đo tỷ lệ positive thực được dự đoán đúng (TP / (TP + FN)). Không áp dụng cho regression vì không có "positive/negative". AWS dùng Recall cho binary classification trong SageMaker Clarify, không liên quan hồi quy. -
❌ Precision
Sai vì Precision cũng dành cho phân loại, đo tỷ lệ positive dự đoán đúng (TP / (TP + FP)). Không đo độ fit dữ liệu liên tục trong regression. Trong AWS (SageMaker 2026), Precision dùng cho multi-class classification, không phải linear model. -
❌ Mean absolute error
Sai vì MAE đo lỗi tuyệt đối trung bình giữa dự đoán và thực tế, giống RMSE nhưng ít nhạy outlier hơn. Nó đánh giá lỗi chứ không phải độ fit tổng thể với regression line. AWS SageMaker hỗ trợ MAE cho regression nhưng ưu tiên R² cho goodness-of-fit.
📘 Tài liệu tham khảo (cập nhật AWS đến 2026):
- AWS SageMaker Documentation: Model Metrics and Evaluation – Xác nhận R² là key metric cho linear regression fit.
- Scikit-learn (tích hợp AWS): R² Score – Standard từ 2010-2026.
- AWS ML Specialty Exam Guide 2026: Nhấn mạnh Coefficient of Determination cho regression goodness-of-fit.
Hy vọng phân tích này giúp bạn nắm vững! 🚀 Nếu cần code Azure ML tương đương (như dùng Azure ML Studio), hãy hỏi thêm nhé!
You are in the process of creating a machine learning model. Your dataset includes rows with null and missing values.
You plan to make use of the Clean Missing Data module in Azure Machine Learning Studio to detect and fix the null and missing values in the dataset.
Recommendation: You make use of the Replace with median option.
Will the requirements be satisfied?
- A Yes
- B No
Xem giải thích
🧩 Phân tích chi tiết câu hỏi
- 📖 Nội dung câu hỏi:
Câu hỏi mô tả tình huống bạn đang xây dựng một mô hình machine learning với dataset chứa các hàng (rows) có giá trị null và missing values. Bạn dự định sử dụng module Clean Missing Data trong Azure Machine Learning Studio (classic) để phát hiện (detect) và sửa chữa (fix) các giá trị null/missing này.
Khuyến nghị (Recommendation): Sử dụng tùy chọn "Replace with median" (thay thế bằng giá trị trung vị).
Câu hỏi yêu cầu xác định xem khuyến nghị này có thỏa mãn yêu cầu (satisfy the requirements) hay không. Yêu cầu ở đây chính là phát hiện và sửa chữa toàn bộ null/missing values trong dataset.
Đây là phần của một bộ câu hỏi có setup giống nhau nhưng kết quả khác nhau (distinctive result), thường thấy trong các kỳ thi chứng chỉ như Microsoft Azure AI-900 hoặc DP-100. Module Clean Missing Data là công cụ chuẩn trong Azure ML Studio để xử lý missing data bằng cách loại bỏ hoặc thay thế dựa trên các mode như mean, median, mode, v.v.
Lưu ý cập nhật 2026: Azure ML Studio (classic) đã được thay thế dần bởi Azure Machine Learning Designer và Python SDK (phiên bản mới nhất 2024+), nhưng module Clean Missing Data vẫn được hỗ trợ trong legacy workspace đến ít nhất 2026. Tùy chọn "Replace with median" chỉ áp dụng cho cột numeric (số học), không áp dụng cho categorical/string.
✅ Đáp án đúng: Yes
Lý do lựa chọn:
Khuyến nghị sử dụng "Replace with median" hoàn toàn thỏa mãn yêu cầu vì module Clean Missing Data sẽ phát hiện (detect) tất cả null/missing values (bao gồm NaN, empty cells, null strings) và sửa chữa (fix) bằng cách thay thế giá trị trung vị (median) cho các cột numeric – đây là phương pháp phổ biến, hiệu quả để tránh bias khi xử lý missing data trong ML. Nếu dataset chỉ có missing values ở cột numeric (hoặc module được cấu hình per-column), nó fix hoàn hảo mà không làm mất dữ liệu. Không có yêu cầu cụ thể về data type trong câu hỏi, nên tùy chọn này phù hợp và satisfy requirements. 🛠️
📋 Giải thích tất cả các phương án
-
Yes ✅
Đúng vì: Module Clean Missing Data với mode "Replace with median" chính xác detect missing values qua các quy tắc (null, empty, NA) và fix bằng median cho numeric columns, giữ nguyên cấu trúc dataset. Đây là best practice cho numeric data (ví dụ: tuổi tác, thu nhập), giảm outlier impact so với mean. Trong Azure ML Studio mới nhất (legacy support 2026), nó hoạt động ổn định, không gây lỗi nếu áp dụng đúng type. 📈 -
No ❌
Sai vì: Không có lý do để từ chối – khuyến nghị không vi phạm gì cả. Chỉ sai nếu dataset có missing values ở categorical columns (string), vì median không compute được (module sẽ skip hoặc giữ nguyên missing, dẫn đến không fully fix). Nhưng câu hỏi không đề cập data type mixed, nên không áp dụng. Nếu dùng mode sai type, mới fail; ở đây recommendation hợp lệ. 🚫
📘 Tài liệu tham khảo
- Microsoft Docs chính thức (cập nhật 2024, support đến 2026): Clean Missing Data module - Azure Machine Learning Studio – Chi tiết modes, data types supported.
- Azure ML Designer guide (successor): Handle missing data – Tương đương với Edit Metadata + Python script.
- Best practices DP-100: Sử dụng median cho skewed numeric data để tránh bias. 🎓