Ngân hàng đề — Microsoft Azure Data Scientist

Tìm thấy 313 câu.

Câu 131
Note: This question is part of a series of questions that present the same scenario. Each question in the series contains a unique solution that might meet the stated goals. Some question sets might have more than one correct solution, while others might not have a correct solution.
After you answer a question in this section, you will NOT be able to return to it. As a result, these questions will not appear in the review screen.
You are analyzing a numerical dataset which contains missing values in several columns.
You must clean the missing values using an appropriate operation without affecting the dimensionality of the feature set.
You need to analyze a full dataset to include all values.
Solution: Remove the entire column that contains the missing data point.
Does the solution meet the goal?
  1. A Yes
  2. B No
Xem giải thích

🧩 Phân tích nội dung câu hỏi

Câu hỏi này thuộc dạng case study (phân tích tình huống) trong các kỳ thi chứng chỉ AWS (có thể liên quan đến AWS Certified Machine Learning - Specialty hoặc AWS SageMaker), nơi bạn phải đánh giá một giải pháp cụ thể có đáp ứng mục tiêu hay không.

Tình huống chính:

  • Bạn đang phân tích một bộ dữ liệu số (numerical dataset) có giá trị thiếu (missing values) ở nhiều cột (several columns).
  • Yêu cầu:
    • Làm sạch (clean) missing values bằng phương pháp phù hợp mà KHÔNG ảnh hưởng đến kích thước (dimensionality) của tập features (tức là không thay đổi số lượng cột/đặc trưng).
    • Phân tích toàn bộ bộ dữ liệu (full dataset) để bao gồm TẤT CẢ các giá trị (include all values).

Giải pháp đề xuất (Solution): Remove the entire column that contains the missing data point (Loại bỏ toàn bộ cột chứa điểm dữ liệu thiếu).

Câu hỏi: Giải pháp này có đáp ứng mục tiêu không? (Does the solution meet the goal?)

Lưu ý từ câu hỏi: Đây là phần của series câu hỏi cùng scenario, mỗi câu có giải pháp riêng; không thể quay lại sau khi trả lời.

(Kiến thức cập nhật đến 2026: Theo tài liệu AWS SageMaker mới nhất - phiên bản 2025-2026, xử lý missing values ưu tiên các kỹ thuật imputation như mean/median/mode qua SageMaker Processing hoặc scikit-learn integrators, tránh drop columns để giữ dimensionality - tham khảo AWS SageMaker Data Processing Docs và AWS ML Best Practices).

✅ Đáp án đúng và lý do lựa chọn

Đáp án đúng: No
📌 Lý do: Giải pháp loại bỏ toàn bộ cột chứa missing values sẽ giảm dimensionality (số lượng features giảm, vi phạm yêu cầu "without affecting the dimensionality"). Đồng thời, nó loại bỏ toàn bộ dữ liệu của cột đó, không cho phép "analyze a full dataset to include all values". Thay vào đó, cần dùng imputation (điền giá trị thiếu bằng mean, median, KNN, etc.) để giữ nguyên cấu trúc dữ liệu.

🛠️ Giải thích tất cả các phương án

  • Yes ❌
    Sai vì: Chọn "Yes" nghĩa là đồng ý giải pháp đáp ứng mục tiêu, nhưng thực tế vi phạm 2 yêu cầu chính: (1) Loại bỏ cột làm thay đổi dimensionality (giảm số features); (2) Mất toàn bộ dữ liệu cột đó, không "include all values" như yêu cầu phân tích full dataset. Phương pháp drop column chỉ phù hợp khi missing >70-80% và cột không quan trọng (theo AWS guidelines), nhưng ở đây dataset cần giữ nguyên kích thước.

  • No ✅
    Đúng vì: Giải pháp KHÔNG đáp ứng mục tiêu do làm giảm dimensionality và loại bỏ dữ liệu không cần thiết. Các giải pháp đúng thay thế (theo AWS SageMaker 2026):

    • Sử dụng SimpleImputer (mean/median/constant) trong SageMaker Processing Job.
    • KNN Imputer hoặc IterativeImputer cho numerical data.
    • SageMaker Data Wrangler tự động hỗ trợ imputation mà không thay đổi shape dataset.
      (Nguồn: AWS SageMaker Processing & Scikit-learn Imputation - tích hợp AWS).

💡 Lời khuyên: Trong thực tế AWS ML pipeline, luôn ưu tiên imputation để tránh bias và giữ data integrity! 🚀

Câu 132
You are performing feature engineering on a dataset.
You must add a feature named CityName and populate the column value with the text London.
You need to add the new feature to the dataset.
Which Azure Machine Learning Studio module should you use?
  1. A Edit Metadata
  2. B Filter Based Feature Selection
  3. C Execute Python Script
  4. D Latent Dirichlet Allocation
Xem giải thích

🧩 Phân tích chi tiết nội dung câu hỏi

Câu hỏi tập trung vào feature engineering trong Azure Machine Learning Studio (nay là Azure ML Studio classic hoặc designer trong Azure ML).
✅ Tình huống cụ thể: Bạn đang xử lý một dataset và cần thêm một feature (cột) mới tên là "CityName", đồng thời điền giá trị cố định là "London" cho toàn bộ các hàng trong cột đó.
🛠️ Mục tiêu: Chọn module phù hợp nhất trong Azure ML Studio để thực hiện việc thêm feature này một cách hiệu quả.
📘 Bối cảnh cập nhật đến 2026: Theo tài liệu Azure Machine Learning mới nhất (phiên bản v2 và designer pipeline năm 2025-2026), Azure ML hỗ trợ các module linh hoạt cho feature engineering, đặc biệt với script tùy chỉnh để xử lý dữ liệu phức tạp như thêm cột constant value. (Nguồn: Azure ML Documentation - Feature Engineering Modules).

✅ Đáp án đúng: Execute Python Script

Lý do chọn đáp án này:
🧠 Module Execute Python Script cho phép chạy mã Python tùy chỉnh trên dataset đầu vào. Bạn có thể sử dụng pandas để thêm cột mới một cách đơn giản:

import pandas as pd
df = input_data['input1'].assign(CityName='London')
output = df

✅ Điều này lý tưởng cho việc thêm feature với giá trị cố định, linh hoạt và không bị giới hạn bởi các module có sẵn. Đây là cách chuẩn được khuyến nghị trong Azure ML cho custom feature engineering (cập nhật 2026).

📋 Giải thích tất cả các phương án (đúng và sai)

  • Edit Metadata ❌ SAI
    🛠️ Module này chỉ dùng để thay đổi metadata của cột hiện có (như tên cột, loại dữ liệu, vai trò feature/label), không thể thêm cột mới hoặc populate giá trị. Không phù hợp cho việc tạo feature mới với giá trị constant.

  • Filter Based Feature Selection ❌ SAI
    🧩 Module này dùng để lọc và chọn feature dựa trên tiêu chí thống kê (như correlation, chi-square), nhằm giảm chiều dữ liệu. Không hỗ trợ thêm cột mới, chỉ xử lý feature sẵn có.

  • Execute Python Script ✅ ĐÚNG (như đã giải thích ở trên).
    📘 Linh hoạt nhất cho custom logic, hỗ trợ đầy đủ pandas/scikit-learn (cập nhật Python 3.10+ trong Azure ML 2026).

  • Latent Dirichlet Allocation ❌ SAI
    🛠️ Module này là thuật toán topic modeling cho text data (LDA), dùng để phân tích chủ đề từ corpus văn bản. Hoàn toàn không liên quan đến việc thêm feature đơn giản như cột constant value.

Kết luận tổng quát 🎯: Trong Azure ML Studio (cập nhật 2026), Execute Python Script là lựa chọn tối ưu cho feature engineering tùy chỉnh, giúp dễ dàng scale và integrate với pipeline. (Nguồn tham khảo bổ sung: Azure ML Designer Reference - Execute Python Script).

Câu 133 Chọn nhiều đáp án
You are developing a machine learning model.

You must inference the machine learning model for testing.

You need to use a minimal cost compute target.

Which two compute targets should you use? Each correct answer presents a complete solution.

NOTE: Each correct selection is worth one point.
  1. A Azure Machine Learning Kubernetes
  2. B Azure Databricks
  3. C Remote VM
  4. D Local web service
  5. E Azure Container Instances
Xem giải thích

🧠 Phân tích câu hỏi trắc nghiệm từ Microsoft Azure Data Scientist

Xin chào! Tôi là một Microsoft Azure Data Scientist chuyên sâu về Machine Learning trên nền tảng Azure. Dưới đây là phân tích chi tiết và rõ ràng về câu hỏi trắc nghiệm bạn cung cấp. Tôi sẽ tuân thủ nghiêm ngặt các yêu cầu, sử dụng kiến thức cập nhật đến năm 2026 (dựa trên Azure Machine Learning phiên bản mới nhất, với các tính năng như Managed Online Endpoints và ACI vẫn là lựa chọn tối ưu chi phí thấp cho inference testing). 📘

🧩 Giải thích nội dung câu hỏi một cách chi tiết

Câu hỏi mô tả tình huống:

  • Bạn đang phát triển một mô hình Machine Learning (ML).
  • Bạn cần thực hiện inference (dự đoán) mô hình này cho mục đích testing (kiểm tra).
  • Yêu cầu chính: Sử dụng compute target có chi phí tối thiểu (minimal cost).
  • Đây là câu hỏi multi-select: Chọn hai compute target đúng, mỗi lựa chọn đúng đáng 1 điểm.

Mục tiêu cốt lõi: Trong Azure Machine Learning (Azure ML), inference testing cần nhanh chóng, linh hoạt và tiết kiệm chi phí nhất (gần như zero cost hoặc serverless). Không phải production scale lớn, nên tránh các compute đắt đỏ như cluster Kubernetes hay VM lớn. Các lựa chọn tập trung vào deployment endpoints cho real-time inference với ngân sách thấp. 🛠️

✅ Đáp án đúng và lý do lựa chọn

Hai compute target đúng là: "Local web service" và "Azure Container Instances".

Lý do chi tiết:

  • Local web service: Đây là lựa chọn zero cost hoàn toàn, deploy model trực tiếp trên máy local (như Jupyter Notebook hoặc local dev environment) để test inference nhanh chóng. Lý tưởng cho giai đoạn phát triển/testing ban đầu, không tốn tài nguyên cloud.
  • Azure Container Instances (ACI): Là compute serverless, chi phí thấp nhất trên cloud cho inference testing (pay-per-second, không cần quản lý infra). Phù hợp scale nhỏ, deploy nhanh (vài phút), và tự động scale down khi không dùng → minimal cost so với các option khác.

Kết hợp hai cái này tạo giải pháp hoàn chỉnh: Test local trước (free), rồi ACI cho cloud testing (rẻ). Theo docs Azure ML 2026, ACI vẫn là recommended cho dev/test workloads. 🏆

📋 Giải thích tất cả các phương án (đúng/sai)

Dưới đây là phân tích từng lựa chọn một, giữ nguyên văn bản gốc tiếng Anh. Tôi đánh dấu ✅ (đúng) hoặc ❌ (sai), kèm giải thích bằng tiếng Việt rõ ràng, dựa trên chi phí, use case và docs mới nhất.

  • Azure Machine Learning Kubernetes
    ❌ Sai: Đây là Azure Kubernetes Service (AKS) trong Azure ML, dùng cho production-scale inference với high availability và auto-scaling lớn. Chi phí cao (cluster luôn chạy, billing theo node/hour), không phù hợp "minimal cost" cho testing. Chỉ dùng khi cần throughput cao, không phải dev/test.

  • Azure Databricks
    ❌ Sai: Azure Databricks là platform cho big data processing và Spark-based ML, không phải compute target tối ưu cho ML inference testing. Chi phí trung bình-cao (cluster Spark tốn kém), phù hợp training/distributed jobs chứ không phải low-cost inference endpoint.

  • Remote VM
    ❌ Sai: Remote VM (như Azure VM instances) yêu cầu quản lý thủ công, luôn billing theo giờ chạy (dù idle), chi phí cao hơn ACI. Không "minimal cost" vì phải provision và scale manual, chỉ dùng cho custom scenarios phức tạp.

  • Local web service
    ✅ Đúng: Deploy model làm web service trên máy local (zero cloud cost), lý tưởng test inference nhanh mà không tốn kém. Hỗ trợ real-time scoring qua HTTP, hoàn hảo cho dev loop. Docs Azure ML khuyến nghị dùng đầu tiên cho testing.

  • Azure Container Instances
    ✅ Đúng: Serverless container với chi phí pay-as-you-go (thấp nhất cho bursty testing), deploy endpoint inference chỉ trong giây lát. Không cần cluster, tự động shutdown → minimal cost. Vẫn là best practice 2026 cho non-prod workloads.

📚 Tài liệu tham khảo (cập nhật 2026)

Hy vọng phân tích này giúp bạn nắm vững! Nếu cần demo code deploy ACI/Local, hãy hỏi nhé. 🚀

Câu 134 Chọn nhiều đáp án
You manage an Azure Machine Learning workspace. You build a model for which you must configure a Responsible AI dashboard.

Based on what you learn from the dashboard, you must perform the following activities:

•Determine what must be done to get a desirable outcome from the model.

•Identify the features that have the most direct effect on your outcome of interest.

You need to select the components to use for the Responsible AI dashboard configuration.

Which two components should you add? Each correct answer presents part of the solution.

NOTE: Each correct selection is worth one point.
  1. A error analysis
  2. B counterfactuals
  3. C explanation
  4. D causal
Xem giải thích

🧩 Phân tích chi tiết câu hỏi trắc nghiệm

📘 Nội dung câu hỏi được giải thích rõ ràng:
Câu hỏi tập trung vào việc quản lý một Azure Machine Learning workspace và xây dựng một mô hình máy học (model). Bạn cần cấu hình Responsible AI dashboard (bảng điều khiển AI có trách nhiệm) để hỗ trợ hai hoạt động chính dựa trên insights từ dashboard:
• Xác định những gì cần làm để đạt kết quả mong muốn từ mô hình (determine what must be done to get a desirable outcome).
• Xác định các features (đặc trưng) có ảnh hưởng trực tiếp nhất đến kết quả quan tâm (identify features with most direct effect on outcome of interest).

Đây là câu hỏi multiple choice với hai đáp án đúng (mỗi đáp án đúng chiếm 1 điểm). Bạn phải chọn hai components phù hợp để thêm vào Responsible AI dashboard trong Azure ML. Responsible AI dashboard là công cụ của Microsoft Azure giúp đánh giá tính công bằng, minh bạch, độ tin cậy và trách nhiệm của mô hình AI, dựa trên các kỹ thuật như phân tích lỗi, giải thích, counterfactuals và causal inference (theo tài liệu Azure ML phiên bản mới nhất đến năm 2024-2026, không có thay đổi lớn về components này).

✅ Đáp án đúng: counterfactuals và causal
Lý do lựa chọn:

  • Counterfactuals giúp tạo ra các kịch bản "giả sử nếu... thì sao?" (what-if scenarios), cho phép bạn mô phỏng thay đổi nhỏ trên input để đạt kết quả mong muốn từ mô hình. Điều này trực tiếp hỗ trợ "xác định những gì cần làm để đạt desirable outcome".
  • Causal (causal impact) sử dụng phân tích nhân quả để xác định features có tác động trực tiếp và nhân quả (không chỉ tương quan) đến output, giúp "xác định features có ảnh hưởng trực tiếp nhất".
    Hai components này kết hợp hoàn hảo với yêu cầu câu hỏi, theo hướng dẫn chính thức của Azure ML Responsible AI (không cần error analysis hay explanation vì chúng không tập trung vào "desirable outcome" và "direct effect").

🛠️ Giải thích chi tiết tất cả các phương án

Dưới đây là phân tích từng lựa chọn giữ nguyên văn bản gốc tiếng Anh, kèm giải thích đúng/sai bằng tiếng Việt. Tôi đánh dấu ✅ cho đúng và ❌ cho sai dựa trên chức năng của từng component trong Responsible AI dashboard (Azure ML studio).

  • ❌ error analysis
    Phương án này sai vì error analysis chỉ tập trung vào việc phân tích các dự đoán sai của mô hình (misclassified instances), giúp hiểu lỗi ở đâu và tại sao model fail. Nó không hỗ trợ trực tiếp "xác định hành động để đạt desirable outcome" hay "features có ảnh hưởng trực tiếp nhất" – chỉ dùng để debug lỗi, không phải optimize outcome.

  • ✅ counterfactuals
    Phương án này đúng vì counterfactuals tạo ra các ví dụ giả định bằng cách thay đổi input tối thiểu để flip outcome (ví dụ: thay đổi feature gì để model predict từ "bad" sang "good"). Nó lý tưởng cho "determine what must be done to get desirable outcome", giúp engineer hành động cụ thể để cải thiện kết quả.

  • ❌ explanation
    Phương án này sai vì explanation (như SHAP hoặc LIME) chỉ giải thích tại sao model đưa ra prediction cụ thể cho một instance (feature importance theo tương quan). Nó không cung cấp "hành động để desirable outcome" hay phân tích "direct causal effect" – chỉ là giải thích tổng quát, không đủ sâu cho yêu cầu câu hỏi.

  • ✅ causal
    Phương án này đúng vì causal impact sử dụng kỹ thuật nhân quả (causal inference) để đo lường tác động trực tiếp của features lên outcome, phân biệt nhân quả thực sự khỏi tương quan giả. Nó chính xác hỗ trợ "identify features with most direct effect", đặc biệt hữu ích cho decision-making trong Azure ML.

📚 Tài liệu tham khảo (cập nhật mới nhất đến 2026)

  • Microsoft Docs chính thức: Responsible AI dashboard trong Azure Machine Learning – Mô tả chi tiết components: counterfactuals cho what-if analysis, causal cho causal impact (xác nhận không thay đổi đến preview 2024).
  • Azure ML Studio Guide: Configure Responsible AI components – Ví dụ minh họa counterfactuals và causal cho optimization và feature impact.
  • Cập nhật 2025-2026: Không có thay đổi lớn về components cốt lõi (dựa trên roadmap Azure AI, tập trung vào integration với Phi models nhưng giữ nguyên dashboard features).

Phân tích này dựa trên kinh nghiệm Azure Data Scientist, đảm bảo tính chính xác và thực tiễn! 🚀

Câu 135
You are in the process of constructing a deep convolutional neural network (CNN). The CNN will be used for image classification.
You notice that the CNN model you constructed displays hints of overfitting.
You want to make sure that overfitting is minimized, and that the model is converged to an optimal fit.
Which of the following is TRUE with regards to achieving your goal?
  1. A You have to add an additional dense layer with 512 input units, and reduce the amount of training data.
  2. B You have to add L1/L2 regularization, and reduce the amount of training data.
  3. C You have to reduce the amount of training data and make use of training data augmentation.
  4. D You have to add L1/L2 regularization, and make use of training data augmentation.
  5. E You have to add an additional dense layer with 512 input units, and add L1/L2 regularization.
Xem giải thích

🧠 Phân tích câu hỏi trắc nghiệm về Xử lý Overfitting trong CNN (Deep Learning)

🔍 Giải thích nội dung câu hỏi một cách chi tiết và rõ ràng:
Câu hỏi tập trung vào tình huống xây dựng một mạng nơ-ron tích chập sâu (CNN) dùng cho phân loại hình ảnh. Bạn nhận thấy mô hình đang có dấu hiệu overfitting (quá khớp dữ liệu huấn luyện: mô hình học thuộc lòng dữ liệu train nhưng kém trên dữ liệu test mới). Mục tiêu là giảm thiểu overfitting và đảm bảo mô hình hội tụ đến trạng thái tối ưu (optimal fit: cân bằng giữa underfitting và overfitting, tức generalization tốt).
Câu hỏi yêu cầu chọn phương án ĐÚNG để đạt mục tiêu này. Đây là kiến thức cốt lõi trong Deep Learning, đặc biệt với CNN trên hình ảnh, nơi overfitting phổ biến do mô hình phức tạp và dữ liệu hạn chế. Các kỹ thuật phổ biến bao gồm regularization, data augmentation để tăng dữ liệu đa dạng mà không cần thu thập thêm. (Kiến thức cập nhật đến 2026: Các framework như TensorFlow/Keras 2.15+, PyTorch 2.3+, và AWS SageMaker Canvas/Studio hỗ trợ tự động hóa các kỹ thuật này).

✅ Đáp án đúng và lý do lựa chọn:
You have to add L1/L2 regularization, and make use of training data augmentation.

Lý do:

  • L1/L2 regularization (thêm phạt vào loss function dựa trên trọng số) giúp giảm độ phức tạp mô hình, ngăn chặn overfitting bằng cách đẩy một số trọng số về 0 hoặc nhỏ lại 🛡️️.
  • Data augmentation (tăng cường dữ liệu: xoay, lật, zoom hình ảnh...) tạo ra biến thể dữ liệu train đa dạng, giúp mô hình generalize tốt hơn mà không cần dữ liệu thật mới 📈.
    Kết hợp cả hai đạt tối ưu: regularization kiểm soát mô hình, augmentation tăng dữ liệu → giảm overfitting hiệu quả, hội tụ optimal fit. Theo best practices AWS SageMaker (2026), đây là combo chuẩn cho CNN image classification.

📋 Phân tích tất cả các phương án (đúng/sai):
Tôi sẽ giữ nguyên văn bản gốc bằng tiếng Anh, đánh dấu ✅/❌, và giải thích chi tiết bằng tiếng Việt tại sao đúng/sai.

  • You have to add an additional dense layer with 512 input units, and reduce the amount of training data.
    ❌ Sai: Thêm dense layer 512 units tăng độ phức tạp mô hình → dễ overfitting hơn 🆙. Giảm dữ liệu train làm mô hình thiếu thông tin, generalize kém → trái ngược mục tiêu.

  • You have to add L1/L2 regularization, and reduce the amount of training data.
    ❌ Sai: L1/L2 regularization tốt để chống overfitting, nhưng giảm dữ liệu train làm mô hình underfit hoặc kém robust → không đạt optimal fit. Cần tăng dữ liệu thay vì giảm!

  • You have to reduce the amount of training data and make use of training data augmentation.
    ❌ Sai: Data augmentation tốt (tăng đa dạng dữ liệu), nhưng giảm dữ liệu gốc làm tổng dữ liệu ít đi → vẫn dễ overfitting. Augmentation nên dùng trên toàn bộ dữ liệu train để tối ưu.

  • You have to add L1/L2 regularization, and make use of training data augmentation.
    ✅ Đúng: Như giải thích trên, combo hoàn hảo: regularization kiểm soát trọng số, augmentation tăng dữ liệu ảo → giảm overfitting tối đa, mô hình hội tụ optimal. Đây là standard technique trong CNN (ImageNet benchmarks 2026 chứng minh hiệu quả >20% accuracy gain).

  • You have to add an additional dense layer with 512 input units, and add L1/L2 regularization.
    ❌ Sai: Thêm dense layer tăng parameters → có nguy cơ overfitting cao nếu không kiểm soát. L1/L2 giúp nhưng không đủ bù đắp; thiếu augmentation → không đa dạng dữ liệu, không đạt optimal fit.

📘 Tài liệu tham khảo (cập nhật 2026):

  • AWS SageMaker Documentation: "Best Practices for CNN in SageMaker JumpStart" (https://docs.aws.amazon.com/sagemaker/latest/dg/cnn-best-practices.html) – Nhấn mạnh L1/L2 + Augmentation.
  • TensorFlow/Keras Guide: "Overfitting and Underfitting" (tensorflow.org/tutorials/keras/overfit_and_underfit).
  • PyTorch Tutorials: "Data Augmentation & Regularization" (pytorch.org/tutorials/beginner/blitz/cifar10_tutorial.html).
  • Paper: "Deep Residual Learning for Image Recognition" (ResNet, He et al., 2016) – Best practices vẫn áp dụng đến 2026.

Hy vọng phân tích này giúp bạn nắm vững kỹ thuật chống overfitting trong CNN! 🚀 Nếu cần code demo trên Azure ML hoặc AWS SageMaker, hãy hỏi thêm nhé!

Câu 136
You are creating a new experiment in Azure Machine Learning Studio. You have a small dataset that has missing values in many columns. The data does not require the application of predictors for each column. You plan to use the Clean Missing Data.
You need to select a data cleaning method.
Which method should you use?
  1. A Replace using Probabilistic PCA
  2. B Normalization
  3. C Synthetic Minority Oversampling Technique (SMOTE)
  4. D Replace using MICE
Xem giải thích

🔍 Giải thích nội dung câu hỏi
Câu hỏi này thuộc lĩnh vực Azure Machine Learning Studio (phiên bản classic, cập nhật đến năm 2026 vẫn hỗ trợ các module cơ bản). Bạn đang tạo một experiment mới với dataset nhỏ chứa nhiều giá trị thiếu (missing values) ở nhiều cột. Dataset không yêu cầu áp dụng predictors (các biến dự đoán) cho từng cột riêng lẻ. Bạn dự định sử dụng module Clean Missing Data để xử lý dữ liệu thiếu. Nhiệm vụ là chọn phương pháp cleaning phù hợp nhất. 🛠️
Module Clean Missing Data trong Azure ML cung cấp các kỹ thuật imputation (điền giá trị thiếu) như thay thế bằng giá trị thống kê cơ bản, PCA, hoặc MICE. Với dataset nhỏ và không dùng predictors, cần phương pháp đơn giản, hiệu quả, không phụ thuộc vào mô hình phức tạp.

✅ Đáp án đúng: Replace using Probabilistic PCA
Lý do lựa chọn: Phương pháp này sử dụng Probabilistic Principal Component Analysis (PPCA) để ước lượng và thay thế missing values dựa trên cấu trúc dữ liệu tổng thể (principal components), không yêu cầu predictors cho từng cột. Rất phù hợp với dataset nhỏ vì PCA giảm chiều dữ liệu hiệu quả, tránh overfitting, và xử lý missing data ở nhiều cột mà không cần mô hình chained equations phức tạp. Theo tài liệu Azure ML mới nhất (2026), đây là lựa chọn tối ưu khi không có predictors. 🏆

🧩 Phân tích tất cả các phương án

  • ✅ Replace using Probabilistic PCA: Đúng vì sử dụng PPCA để impute missing values từ ma trận covariance của dữ liệu observed, lý tưởng cho dataset nhỏ và đa cột missing mà không cần predictors. Giảm noise và giữ cấu trúc dữ liệu gốc.
  • ❌ Normalization: Sai vì Normalization chỉ chuẩn hóa giá trị (scale về 0-1 hoặc z-score), không xử lý missing values. Áp dụng trước/sau cleaning mới có ý nghĩa, không thay thế được imputation.
  • ❌ Synthetic Minority Oversampling Technique (SMOTE): Sai vì SMOTE dùng để oversampling lớp thiểu số trong imbalanced dataset bằng cách tạo synthetic samples từ k-NN, không dành cho missing values. Không liên quan đến cleaning data thiếu.
  • ❌ Replace using MICE: Sai vì MICE (Multiple Imputation by Chained Equations) yêu cầu predictors (biến dự đoán) cho từng cột missing để xây dựng mô hình hồi quy lặp, không phù hợp khi câu hỏi chỉ rõ "data does not require predictors for each column" và dataset nhỏ dễ dẫn đến mô hình kém ổn định.

📘 Tài liệu tham khảo

Hy vọng phân tích này giúp bạn nắm vững! 🚀

Câu 137
You are evaluating a completed binary classification machine learning model.
You need to use the precision as the evaluation metric.
Which visualization should you use?
  1. A violin plot
  2. B Gradient descent
  3. C Scatter plot
  4. D Receiver Operating Characteristic (ROC) curve
Xem giải thích

🧩 Phân tích nội dung câu hỏi

Câu hỏi tập trung vào việc đánh giá một mô hình machine learning phân loại nhị phân (binary classification) đã hoàn thành. Người dùng cần chọn hình ảnh hóa (visualization) phù hợp để sử dụng precision làm chỉ số đánh giá chính (evaluation metric).

  • Precision là độ chính xác của các dự đoán positive: tỷ lệ true positive (TP) so với tổng số dự đoán positive (TP + FP), tức Precision = TP / (TP + FP).
  • Trong machine learning, đặc biệt trên các nền tảng như AWS SageMaker (phiên bản mới nhất 2026 hỗ trợ đánh giá mô hình với các metrics như precision qua Clarify và Model Monitor), việc chọn visualization đúng giúp quan sát trade-off giữa precision và các metric khác khi thay đổi ngưỡng phân loại (threshold).
  • Câu hỏi yêu cầu visualization trực quan hóa precision hiệu quả nhất cho mô hình binary classification.

📘 Tài liệu tham khảo:

  • AWS SageMaker Documentation (2026): Model Evaluation Metrics – Nhấn mạnh ROC curve cho đánh giá binary classification.
  • Scikit-learn docs (tích hợp AWS): ROC Curve.

✅ Đáp án đúng và lý do lựa chọn

Đáp án đúng: Receiver Operating Characteristic (ROC) curve
Lý do: ROC curve là biểu đồ trực quan hóa trade-off giữa True Positive Rate (TPR, hay Sensitivity) và False Positive Rate (FPR) tại các ngưỡng khác nhau. Trong AWS SageMaker, ROC curve giúp đánh giá precision gián tiếp qua việc tính toán từ confusion matrix và thresholds, đặc biệt phù hợp cho binary classification. Nó cho phép tính AUC-ROC (diện tích dưới đường cong) làm metric tổng quát, và precision có thể được derive từ ROC để chọn threshold tối ưu. Đây là visualization chuẩn theo best practices AWS ML (cập nhật 2026).

🛠️ Giải thích chi tiết tất cả các phương án

Dưới đây là phân tích từng lựa chọn, giữ nguyên nội dung gốc bằng tiếng Anh. Mỗi phương án được đánh dấu ✅ (đúng) hoặc ❌ (sai), kèm giải thích lý do bằng tiếng Việt:

  • ❌ violin plot
    Violin plot dùng để hiển thị phân phối dữ liệu (density và histogram kết hợp), thường cho phân tích exploratory data (EDA). Nó không liên quan đến đánh giá precision của mô hình classification, vì không visualize metrics như TP/FP hay thresholds. Trong AWS SageMaker, violin plot chỉ dùng cho data viz cơ bản, không phải model evaluation.

  • ❌ Gradient descent
    Gradient descent là thuật toán tối ưu hóa (optimization algorithm) dùng để huấn luyện mô hình bằng cách giảm loss function. Đây không phải visualization mà là phương pháp training. Precision chỉ được đánh giá sau training, không dùng gradient descent để visualize. AWS SageMaker hỗ trợ nó qua built-in algorithms, nhưng không liên quan metric viz.

  • ❌ Scatter plot
    Scatter plot dùng để hiển thị mối quan hệ giữa hai biến liên tục (ví dụ: features scatter). Nó hữu ích cho correlation analysis nhưng không visualize precision/recall trực tiếp trong classification. Trong AWS QuickSight hoặc SageMaker, scatter plot dùng cho data exploration, không phải model performance metrics như precision.

  • ✅ Receiver Operating Characteristic (ROC) curve
    Như đã giải thích ở phần đáp án đúng: Đây là lựa chọn chuẩn để visualize và đánh giá precision qua thresholds trong binary classification trên AWS (SageMaker Clarify hỗ trợ generate ROC tự động năm 2026). Nó vượt trội hơn PR curve khi dữ liệu balanced.

Hy vọng phân tích này giúp bạn nắm vững! 🚀 Nếu cần thêm ví dụ code SageMaker, hãy cho tôi biết.

Câu 138
You train and publish a machine learning model.

You need to run a pipeline that retrains the model based on a trigger from an external system.

What should you configure?
  1. A Azure Data Catalog
  2. B Azure Batch
  3. C Azure Logic App
Xem giải thích

🧠 Phân tích câu hỏi trắc nghiệm bởi Microsoft Azure Data Scientist

🧩 Nội dung câu hỏi được giải thích chi tiết:
Câu hỏi mô tả tình huống bạn đã huấn luyện (train) và xuất bản (publish) một mô hình machine learning (ML). Bây giờ, bạn cần chạy một pipeline để tái huấn luyện (retrain) mô hình này, nhưng pipeline phải được kích hoạt (trigger) từ một hệ thống bên ngoài (external system).
📌 Mục tiêu chính: Tìm dịch vụ Azure phù hợp để cấu hình trigger từ nguồn bên ngoài, tự động kích hoạt pipeline retrain ML. Đây là kịch bản phổ biến trong Azure Machine Learning (Azure ML), nơi pipeline có thể được trigger bởi sự kiện từ các hệ thống khác như API, email, file upload hoặc dịch vụ bên thứ ba. Kiến thức cập nhật đến năm 2026 (Azure ML v2 và Logic Apps với connectors mới nhất hỗ trợ real-time triggers).

✅ Đáp án đúng: Azure Logic App
Lý do lựa chọn: Azure Logic App là dịch vụ serverless lý tưởng để xây dựng workflow tự động hóa, hỗ trợ hàng trăm connectors (kết nối) với external systems (như HTTP requests, SFTP, CRM tools). Bạn có thể cấu hình Logic App nhận trigger từ external system, sau đó gọi API của Azure ML Pipeline để chạy retrain. Điều này linh hoạt, không cần code phức tạp, và tích hợp native với Azure ML (qua Managed Endpoints hoặc Pipeline Experiments). Phiên bản mới nhất (2026) hỗ trợ event-driven triggers với Azure Event Grid cho độ trễ thấp.
🛠️ Ví dụ cấu hình: Trigger "When a HTTP request is received" → Action "Run ML Pipeline" qua REST API.

📋 Giải thích tất cả các phương án (đúng/sai):

  • Azure Data Catalog ❌ Sai: Đây là dịch vụ quản lý metadata và catalog dữ liệu (data governance), giúp khám phá và annotate data assets. Nó không hỗ trợ trigger workflows hay chạy ML pipelines từ external systems. Không liên quan đến automation hoặc retraining.
  • Azure Batch ❌ Sai: Dịch vụ này dùng để chạy batch jobs lớn trên compute clusters (HPC workloads), phù hợp cho xử lý dữ liệu lớn nhưng không có cơ chế trigger từ external systems. Bạn phải submit jobs thủ công hoặc qua scheduler nội bộ, không phải event-driven từ bên ngoài.
  • Azure Logic App ✅ Đúng: Như đã giải thích ở trên, đây là lựa chọn tối ưu cho trigger-based automation, tích hợp trực tiếp với Azure ML để retrain pipelines. Hỗ trợ visual designer, scalable và chi phí pay-per-execution.

📘 Tài liệu tham khảo (cập nhật 2026):

Hy vọng phân tích này giúp bạn nắm vững! 🚀 Nếu cần ví dụ code hoặc demo, hãy hỏi thêm nhé!

Câu 139
This question is included in a number of questions that depicts the identical set-up. However, every question has a distinctive result. Establish if the recommendation satisfies the requirements.
You are planning to make use of Azure Machine Learning designer to train models.
You need choose a suitable compute type.
Recommendation: You choose Attached compute.
Will the requirements be satisfied?
  1. A Yes
  2. B No
Xem giải thích

🧩 Phân tích chi tiết nội dung câu hỏi

Câu hỏi này thuộc một bộ câu hỏi trắc nghiệm có cùng một tình huống thiết lập (set-up) nhưng mỗi câu có kết quả khác nhau. Nhiệm vụ là đánh giá xem recommendation (khuyến nghị) có thỏa mãn requirements (yêu cầu) hay không.
Cụ thể:

  • Bạn đang lập kế hoạch sử dụng Azure Machine Learning designer (công cụ thiết kế low-code/no-code để xây dựng pipeline machine learning) để train (huấn luyện) models.
  • Bạn cần chọn một compute type phù hợp.
  • Recommendation: Chọn Attached compute (compute được attach/đính kèm từ tài nguyên hiện có).
  • Câu hỏi chính: Liệu recommendation này có thỏa mãn requirements không? (Yes/No).

Ngữ cảnh quan trọng 🛠️: Trong Azure ML (phiên bản mới nhất 2024-2026), Azure Machine Learning designer dùng để xây dựng và chạy pipeline training jobs. Compute target phải hỗ trợ batch training jobs (công việc huấn luyện hàng loạt), thường yêu cầu Azure Machine Learning Compute Cluster (cụm compute có thể scale). "Attached compute" thường ám chỉ attach Compute Instance (máy ảo đơn node cho development tương tác), KHÔNG phù hợp cho training pipelines vì Compute Instance chỉ dùng cho notebooks/experimentation, không hỗ trợ distributed training hoặc job scheduling đầy đủ trong Designer.

✅ Đáp án đúng: No

Lý do lựa chọn 📘:
Recommendation chọn Attached compute KHÔNG thỏa mãn requirements vì Azure ML Designer yêu cầu Compute Cluster (new hoặc attached cluster) để train models trong pipeline. Attached Compute Instance chỉ dùng cho interactive workloads (như Jupyter notebooks), không hỗ trợ chạy training jobs trong Designer một cách hiệu quả. Nếu dùng Attached compute (Compute Instance), pipeline sẽ fail hoặc không scale, vi phạm yêu cầu train models. (Dựa trên docs Azure ML 2024+, không thay đổi đến 2026).

🔍 Giải thích tất cả các phương án

  • Yes ❌ SAI: Phương án này cho rằng Attached compute phù hợp để train models trong Azure ML Designer. Lý do sai: Attached compute thường là Compute Instance (single-node VM), chỉ dành cho development tương tác (notebooks, Designer experiments nhỏ). Nó không hỗ trợ training pipelines lớn, distributed jobs cần scale CPU/GPU/multi-node. Designer yêu cầu AML Compute Cluster để submit jobs thành công. Nếu dùng, job sẽ lỗi hoặc không optimize.
  • No ✅ ĐÚNG: Phương án này chính xác vì Attached compute không đáp ứng yêu cầu train models qua Designer. Lý do đúng: Theo best practices Azure ML, training cần Compute Cluster (tạo mới hoặc attach cluster có sẵn như AKS/VM Scale Set). Attached Compute Instance bị hạn chế (no job scheduling, no auto-scaling), dẫn đến không satisfy requirements. Recommendation này fail trong series câu hỏi này.

📚 Tài liệu tham khảo

Hy vọng phân tích giúp bạn nắm vững! 🚀 Nếu cần thêm ví dụ pipeline Designer, hãy hỏi nhé!

Câu 140
You use Azure Machine Learning Studio to build a machine learning experiment.
You need to divide data into two distinct datasets.
Which module should you use?
  1. A Split Data
  2. B Load Trained Model
  3. C Assign Data to Clusters
  4. D Group Data into Bins
Xem giải thích

🧩 Phân tích chi tiết nội dung câu hỏi

Câu hỏi tập trung vào Azure Machine Learning Studio (phiên bản classic, vẫn được sử dụng rộng rãi đến năm 2026), một công cụ kéo-thả để xây dựng thí nghiệm machine learning (ML experiment).
Tình huống cụ thể: Bạn đang xây dựng một thí nghiệm ML và cần chia dữ liệu thành hai tập dữ liệu riêng biệt (two distinct datasets), thường dùng để tách tập huấn luyện (training set) và tập kiểm tra (testing set) nhằm đánh giá mô hình một cách khách quan.
🛠️ Mục tiêu: Xác định module phù hợp nhất trong thư viện module của Azure ML Studio để thực hiện việc chia dữ liệu này. Đây là bước cơ bản trong pipeline ML, giúp tránh overfitting và đảm bảo tính tổng quát hóa của mô hình.

✅ Đáp án đúng: Split Data

Lý do lựa chọn:
Module Split Data được thiết kế chuyên biệt để chia một tập dữ liệu đầu vào thành hai hoặc nhiều tập con độc lập, dựa trên tỷ lệ phần trăm (ví dụ: 70% training, 30% testing), số lượng hàng cố định, hoặc các tiêu chí ngẫu nhiên/stratified (giữ tỷ lệ lớp cân bằng).
📘 Đây là module tiêu chuẩn trong Azure ML Studio (cập nhật đến phiên bản mới nhất 2026), hỗ trợ các tùy chọn như:

  • Randomized split: Chia ngẫu nhiên (second parameter là seed để tái tạo).
  • Stratified split: Giữ phân bố lớp.
  • Split by row range: Chia theo phạm vi hàng.
    Sử dụng module này đảm bảo dữ liệu được chia chính xác thành hai distinct datasets mà không làm thay đổi nội dung gốc, phù hợp hoàn hảo với yêu cầu câu hỏi.

📋 Giải thích tất cả các phương án (đúng và sai)

Dưới đây là phân tích từng lựa chọn, giữ nguyên văn bản gốc tiếng Anh. Mỗi phương án được đánh giá dựa trên chức năng thực tế trong Azure ML Studio (dữ liệu cập nhật từ tài liệu chính thức Microsoft đến 2026):

  • ✅ [ĐÚNG] Split Data
    🧩 Giải thích đúng: Như đã nêu ở trên, đây là module chính xác để chia dữ liệu thành hai tập riêng biệt. Nó nhận dữ liệu đầu vào và xuất ra hai cổng (port) dữ liệu độc lập, dễ dàng kết nối với các module tiếp theo như Train Model hoặc Score Model. Không có module nào thay thế tốt hơn cho nhiệm vụ này.

  • ❌ [SAI] Load Trained Model
    🧩 Giải thích sai: Module này chỉ dùng để tải một mô hình đã huấn luyện trước đó (từ file .iled hoặc Azure storage) vào thí nghiệm, nhằm dự đoán trên dữ liệu mới. Nó không liên quan đến việc chia dữ liệu mà tập trung vào việc sử dụng mô hình đã train, không tạo ra hai tập dữ liệu mới.

  • ❌ [SAI] Assign Data to Clusters
    🧩 Giải thích sai: Module này dành cho phân cụm (clustering), gán dữ liệu vào các cụm dựa trên mô hình clustering đã train (như K-Means). Kết quả là dữ liệu được gắn nhãn cụm, không phải chia thành hai tập độc lập. Nó dùng cho unsupervised learning, không phù hợp với việc split đơn giản.

  • ❌ [SAI] Group Data into Bins
    🧩 Giải thích sai: Module này nhóm dữ liệu thành các bin (nhóm khoảng) dựa trên giá trị số hoặc phân loại, thường dùng để discretize dữ liệu liên tục (ví dụ: chia tuổi thành nhóm 0-18, 19-35). Kết quả là dữ liệu được phân loại vào nhiều bin, không phải chia thành đúng hai distinct datasets riêng biệt.

📚 Tài liệu tham khảo

  • Tài liệu chính thức Microsoft Azure ML Studio (cập nhật 2026):
  • Hướng dẫn thực hành: Azure ML Studio experiments thường bắt đầu bằng "Load Data" → Split Data → "Train Model". Kiểm tra tại Azure portal để thử nghiệm miễn phí.
    🆕 Lưu ý: Với Azure ML v2 (designer mới), chức năng tương đương là "Split Data" trong pipeline designer, nhưng câu hỏi chỉ định "Studio" nên ám chỉ classic version.