Ngân hàng đề — Microsoft Azure Data Scientist

Tìm thấy 313 câu.

Câu 291 Chọn nhiều đáp án
You have an Azure Machine Learning workspace. You build a deep learning model.

You need to publish a GPU-enabled model as a web service.

Which two compute targets can you use? Each correct answer presents a complete solution.

NOTE: Each correct selection is worth one point.
  1. A Azure Kubernetes Service (AKS)
  2. B Azure Container Instances (ACI)
  3. C Local web service
  4. D Azure Machine Learning compute clusters
Xem giải thích

🧩 Giải thích nội dung câu hỏi

Câu hỏi thuộc chủ đề Azure Machine Learning (Azure ML), tập trung vào việc triển khai (deploy) một mô hình deep learning hỗ trợ GPU dưới dạng web service (dịch vụ web thời gian thực).

  • Bạn đang làm việc trong một Azure Machine Learning workspace.
  • Bạn đã xây dựng một deep learning model (mô hình học sâu, thường yêu cầu tài nguyên GPU mạnh mẽ để suy luận nhanh chóng).
  • Nhiệm vụ: Publish as a GPU-enabled model as a web service (triển khai mô hình hỗ trợ GPU thành dịch vụ web).
  • Đây là câu hỏi trắc nghiệm nhiều lựa chọn đúng (multi-select), yêu cầu chọn hai compute targets (mục tiêu tính toán) phù hợp. Mỗi lựa chọn đúng đáng 1 điểm.
  • Lưu ý quan trọng: Compute target phải hỗ trợ GPU cho inference (suy luận) thời gian thực, phù hợp với production hoặc testing quy mô nhỏ, theo các tính năng mới nhất của Azure ML (cập nhật đến năm 2026, bao gồm managed endpoints và GPU acceleration).

🛠️ Bối cảnh kỹ thuật: Trong Azure ML, việc deploy model as web service sử dụng online endpoints (real-time inference). Các compute target phải có khả năng scale, hỗ trợ container (Docker) và GPU (như NVIDIA GPUs trên ACI/AKS). Không phải tất cả compute đều dùng cho deployment web service.

✅ Đáp án đúng

Hai lựa chọn đúng là:
Azure Kubernetes Service (AKS) và Azure Container Instances (ACI).

Lý do lựa chọn:

  • Đây là hai compute targets chính thức được Azure ML hỗ trợ để deploy GPU-enabled web service (online endpoints).
  • AKS lý tưởng cho production scale cao, tự động scale, hỗ trợ GPU clusters (N-series VMs).
  • ACI phù hợp cho testing/low-scale, nhanh deploy, hỗ trợ GPU serverless (từ 2021 và cập nhật liên tục đến 2026).
  • Chúng cho phép package model vào container, expose REST API endpoint với GPU acceleration cho deep learning inference.

📋 Phân tích chi tiết tất cả các phương án

Dưới đây là giải thích từng phương án (giữ nguyên văn bản gốc bằng tiếng Anh), đánh dấu ✅ đúng hoặc ❌ sai, kèm lý do cụ thể dựa trên tài liệu Azure ML mới nhất:

  • ✅ Azure Kubernetes Service (AKS)
    Phương án đúng. AKS là compute target mạnh mẽ cho production-grade deployments, hỗ trợ GPU workloads (NVIDIA A100/H100 qua 2026). Bạn có thể tạo AKS cluster với GPU nodes, deploy managed online endpoint trực tiếp từ Azure ML Studio. Scale tự động, load balancing, phù hợp deep learning models cần inference nhanh.

  • ✅ Azure Container Instances (ACI)
    Phương án đúng. ACI là lựa chọn serverless, nhanh chóng cho development/testing, hỗ trợ GPU containers (từ preview 2021, GA và cải tiến đến 2026 với NVIDIA MIG). Deploy model chỉ trong vài phút, không cần quản lý cluster, lý tưởng cho GPU-enabled web service quy mô nhỏ mà không tốn kém.

  • ❌ Local web service
    Phương án sai. Local web service chỉ dùng cho local debugging/testing trên máy cá nhân (qua Azure ML SDK), không hỗ trợ production web service và không có GPU cloud acceleration. Nó chạy trên local hardware, không scale, không expose public endpoint, vi phạm yêu cầu "publish as a web service" trên Azure cloud.

  • ❌ Azure Machine Learning compute clusters
    Phương án sai. Azure ML compute clusters (hoặc compute instances) dành cho training/batch jobs (như hyperparameter tuning hoặc batch inference), không dùng trực tiếp cho real-time web service (online endpoints). Để deploy, bạn phải dùng ACI/AKS; compute clusters chỉ attach cho training, không hỗ trợ persistent web service với GPU endpoint.

📘 Tài liệu tham khảo

🧠 Kết luận: Chọn AKS và ACI để đảm bảo GPU-enabled web service hiệu suất cao! Nếu cần code mẫu deploy, hãy cho tôi biết nhé! 🚀

Câu 292
You create an Azure Machine Learning workspace named workspace1. The workspace contains a Python SDK v2 notebook that uses MLflow to collect model training metrics and artifacts from your local computer.

You must reuse the notebook to run on Azure Machine Learning compute instance in workspace1.

You need to continue to log metrics and artifacts from your data science code.

What should you do?
  1. A Instantiate the job class.
  2. B Instantiate the MLCIient class.
  3. C Log in to workspace1.
  4. D Configure the tracking URL.
Xem giải thích

🧩 Phân tích chi tiết nội dung câu hỏi

Câu hỏi này thuộc chủ đề Azure Machine Learning (Azure ML), tập trung vào việc sử dụng MLflow để ghi nhận (log) metrics và artifacts từ mã data science. Cụ thể:

  • Bạn đã tạo một Azure Machine Learning workspace tên workspace1.
  • Workspace này chứa một notebook Python SDK v2 (sử dụng thư viện azure-ai-ml phiên bản 2), và notebook này đang dùng MLflow để thu thập metrics (chỉ số huấn luyện mô hình) và artifacts (file kết quả) từ máy tính local (local computer).
  • Yêu cầu: Tái sử dụng (reuse) notebook này để chạy trên Azure Machine Learning compute instance (một loại compute được quản lý trong workspace1).
  • Mục tiêu: Tiếp tục log metrics và artifacts từ mã data science một cách liền mạch, đảm bảo dữ liệu được lưu vào tracking server của workspace1.

Vấn đề cốt lõi 📌: Khi chạy notebook từ local, MLflow cần được cấu hình để kết nối với tracking server của workspace1 (thường qua tracking URI như azureml://...). Nhưng khi chuyển sang chạy trên compute instance (đã gắn với workspace1), cần đảm bảo MLflow vẫn log đúng vào cùng server mà không bị fallback về local storage (như file:///mlruns). Theo tài liệu Azure ML cập nhật đến 2026 (SDK v2 và MLflow integration phiên bản mới nhất), compute instance hỗ trợ tự động detect tracking URI, nhưng trong trường hợp notebook được thiết kế cho local, cần điều chỉnh để đồng bộ.

✅ Đáp án đúng và lý do lựa chọn

Đáp án đúng: Configure the tracking URL.

Lý do 🛠️:

  • Khi tái sử dụng notebook từ local sang compute instance, MLflow mặc định có thể vẫn dùng cấu hình local (nếu đã set cứng tracking URI local trước đó). Do đó, cần cấu hình lại tracking URL (sử dụng mlflow.set_tracking_uri("azureml://subscriptions/{sub-id}/resourceGroups/{rg}/workspaces/{workspace-name}")) để chỉ định chính xác tracking server của workspace1.
  • Điều này đảm bảo metrics và artifacts tiếp tục được log vào Azure ML experiment của workspace1, tận dụng managed identity của compute instance cho authentication tự động.
  • Theo docs Azure ML 2024-2026, đây là bước cần thiết cho notebook SDK v2 khi migrate từ local sang remote compute để tránh mất dữ liệu log.

Nguồn tham khảo 📘:

🔍 Giải thích tất cả các phương án (đúng/sai)

Dưới đây là phân tích từng lựa chọn một cách chi tiết, giữ nguyên văn bản gốc tiếng Anh:

  • ❌ [SAI] Instantiate the job class.
    Phương án này sai vì Job class (từ azure-ai-ml.Job) dùng để tạo và submit các job huấn luyện (như command job hoặc sweep job) trên Azure ML compute, không liên quan trực tiếp đến việc log metrics/artifacts qua MLflow trong notebook. Nó chỉ quản lý execution lifecycle, không thay đổi tracking URI hay kết nối MLflow. Sử dụng sai ngữ cảnh sẽ không giải quyết vấn đề log từ compute instance.

  • ❌ [SAI] Instantiate the MLClient class.
    Phương án này sai vì MLClient (từ azure-ai-ml.MLClient) là client quản lý tài nguyên Azure ML (như tạo endpoint, dataset, model), yêu cầu credential (service principal hoặc managed identity). Nó không xử lý MLflow tracking hay log metrics trực tiếp trong notebook. Instantiate MLClient chỉ hữu ích cho admin tasks, không cần thiết để tiếp tục log trên compute instance đã auth sẵn.

  • ❌ [SAI] Log in to workspace1.
    Phương án này sai vì log in (như az login hoặc mlflow login) chỉ dùng cho authentication từ local hoặc CLI, không bắt buộc trên compute instance (đã dùng managed identity tự động). Nó không cấu hình tracking URL, và MLflow trên compute instance không yêu cầu login thủ công nếu chạy trong workspace context. Sử dụng thừa sẽ gây lỗi credential conflict.

  • ✅ [ĐÚNG] Configure the tracking URL.
    Như đã giải thích ở trên, đây là bước chính xác để đồng bộ MLflow với tracking server của workspace1 khi chạy notebook trên compute instance. Nó đảm bảo tính liên tục của experiment tracking mà không cần thay đổi code lớn. Hoàn hảo cho SDK v2 và MLflow phiên bản mới nhất (2.9+ tích hợp Azure).

Lưu ý cuối 🌟: Trong thực tế Azure ML 2026, compute instance thường tự động set tracking URI, nhưng câu hỏi nhấn mạnh "reuse notebook from local" nên config thủ công là an toàn nhất để tránh issue migration! Nếu cần code sample, hãy hỏi thêm nhé! 🚀

Câu 293 Chọn nhiều đáp án
You use Azure Machine Learning to train a model.

You must use Bayesian sampling to tune hyperparameters.

You need to select a learning_rate parameter distribution.

Which two distributions can you use? Each correct answer presents a complete solution.

NOTE: Each correct selection is worth one point.
  1. A Uniform
  2. B Choice
  3. C QNormal
  4. D Normal
  5. E LogUniform
Xem giải thích

🧩 Phân tích chi tiết câu hỏi trắc nghiệm về Azure Machine Learning

📘 Nội dung câu hỏi được giải thích rõ ràng:
Câu hỏi tập trung vào quy trình tối ưu hóa siêu tham số (hyperparameter tuning) trong Azure Machine Learning (Azure ML). Cụ thể:

  • Bạn đang sử dụng Azure ML để huấn luyện một mô hình máy học.
  • Bạn phải sử dụng phương pháp Bayesian sampling (một kỹ thuật tối ưu hóa dựa trên mô hình xác suất, thường dùng Hyperopt hoặc Optuna backend trong Azure ML) để điều chỉnh siêu tham số.
  • Nhiệm vụ là chọn phân phối (distribution) cho siêu tham số learning_rate (tốc độ học, thường là giá trị liên tục dương).
  • Câu hỏi yêu cầu chọn hai phân phối có thể sử dụng, mỗi lựa chọn đúng đáng 1 điểm (multiple choice với 2 đáp án đúng).
    ✅ Mục tiêu chính: Xác định các phân phối được hỗ trợ chính thức cho Bayesian optimization trong Azure ML khi tuning learning_rate, dựa trên phiên bản mới nhất (Azure ML SDK v2 và HyperDrive/Automated ML sweeps đến năm 2026, không thay đổi lớn từ 2023).

✅ Đáp án đúng và lý do lựa chọn:
Hai đáp án đúng là: Uniform và Choice.
🛠️ Lý do:

  • Trong Azure ML, Bayesian sampling (sử dụng Hyperopt backend) hỗ trợ uniform cho phân phối liên tục đồng đều (uniform continuous) và choice cho phân phối rời rạc (categorical/discrete choices). Learning_rate có thể dùng uniform để sampling ngẫu nhiên trong khoảng [min, max], hoặc choice nếu định nghĩa các giá trị rời rạc cụ thể (ví dụ: [0.001, 0.01, 0.1]). Đây là các phân phối chuẩn, ổn định và được khuyến nghị cho learning_rate.
  • Không hỗ trợ đầy đủ các phân phối khác như Normal hoặc LogUniform trực tiếp trong Bayesian context cho trường hợp này.

🔍 Giải thích chi tiết từng phương án (đúng/sai):

  • ✅ Uniform
    Đúng! Phân phối Uniform (liên tục đồng đều) được hỗ trợ đầy đủ trong Bayesian optimization của Azure ML (qua hp.uniform trong Hyperopt). Nó lý tưởng cho learning_rate vì cho phép sampling đều trong khoảng cố định, giúp khám phá không gian tham số hiệu quả mà không thiên vị.

  • ✅ Choice
    Đúng! Phân phối Choice (categorical hoặc discrete) được hỗ trợ qua hp.choice, phù hợp nếu learning_rate được định nghĩa như một tập hợp giá trị rời rạc (ví dụ: các mức 0.001, 0.01). Bayesian method xử lý tốt choice để chọn giá trị tốt nhất từ danh sách.

  • ❌ QNormal
    Sai! QNormal (quantized normal - phân phối chuẩn rời rạc hóa) không được hỗ trợ trực tiếp hoặc khuyến nghị chuẩn cho learning_rate trong Bayesian sampling của Azure ML. Mặc dù Hyperopt có hp.qnormal, nhưng Azure ML ưu tiên các phân phối cơ bản hơn và QNormal ít dùng cho siêu tham số như learning_rate do tính phức tạp (cần quantization step).

  • ❌ Normal
    Sai! Normal (phân phối chuẩn liên tục) không phải là lựa chọn chuẩn cho Bayesian trong Azure ML với learning_rate. Hyperopt có hp.normal (truncated normal), nhưng nó dễ dẫn đến giá trị âm (không hợp lý cho learning_rate >0) và không được liệt kê chính thức như uniform/choice trong docs tuning.

  • ❌ LogUniform
    Sai! LogUniform (phân phối log-uniform liên tục) không được hỗ trợ trực tiếp trong Bayesian sampling chuẩn của Azure ML cho learning_rate. Mặc dù hữu ích cho scale lớn (như hp.loguniform), Azure ưu tiên qloguniform hoặc uniform; loguniform thuần túy chưa được tích hợp đầy đủ đến phiên bản 2026.

📚 Tài liệu tham khảo (cập nhật mới nhất đến 2026):

Câu 294
You create an Azure Machine learning workspace.

You must use the Azure Machine Learning Python SDK v2 to define the search space for discrete hyperparameters. The hyperparameters must consist of a list of predetermined, comma-separated integer values.

You need to import the class from the azure.ai.ml.sweep package used to create the list of values.

Which class should you import?
  1. A Choice
  2. B Randint
  3. C Uniform
  4. D Normal
Xem giải thích

🔍 Phân tích chi tiết câu hỏi trắc nghiệm về Azure Machine Learning Python SDK v2

🧩 Nội dung câu hỏi được giải thích rõ ràng:
Câu hỏi tập trung vào việc sử dụng Azure Machine Learning Python SDK v2 để định nghĩa không gian tìm kiếm (search space) cho các siêu tham số (hyperparameters) rời rạc (discrete). Cụ thể, bạn đã tạo một Azure Machine Learning workspace và cần import một lớp (class) từ gói azure.ai.ml.sweep để tạo danh sách các giá trị siêu tham số là danh sách các giá trị số nguyên đã định sẵn, phân cách bằng dấu phẩy (predetermined, comma-separated integer values). Đây là tình huống phổ biến khi thiết lập hyperparameter tuning (sweep) trong Azure ML, nơi bạn muốn thử nghiệm một tập hợp giá trị cố định thay vì phân phối ngẫu nhiên liên tục.

✅ Đáp án đúng: Choice
Lý do lựa chọn:
Lớp Choice từ azure.ai.ml.sweep được thiết kế chính xác để định nghĩa một danh sách các giá trị rời rạc đã biết trước (discrete hyperparameters), chẳng hạn như [1, 2, 3, 5] – phù hợp hoàn hảo với yêu cầu "list of predetermined, comma-separated integer values". Bạn có thể sử dụng nó như Choice(values=[1, 2, 3, 5]). Đây là cách chuẩn theo tài liệu chính thức của Azure ML SDK v2 (cập nhật đến năm 2026, không có thay đổi lớn).

📋 Giải thích tất cả các phương án (đúng và sai):

  • ✅ Choice:
    Đúng vì lớp này chuyên dùng để tạo không gian tìm kiếm từ một danh sách giá trị rời rạc cố định (như integers phân cách bằng dấu phẩy). Ví dụ: from azure.ai.ml.sweep import Choice; param = Choice(values=[10, 20, 30]). Hoàn toàn khớp với yêu cầu discrete hyperparameters.

  • ❌ Randint:
    Sai vì lớp Randint dùng để tạo phân phối ngẫu nhiên đều (uniform random integer) trong một khoảng liên tục (range), ví dụ Randint(min_val=1, max_val=10), không phải danh sách giá trị cố định đã định sẵn. Không phù hợp với "predetermined list".

  • ❌ Uniform:
    Sai vì lớp Uniform dành cho phân phối đều liên tục (continuous uniform distribution) trên số thực, ví dụ Uniform(min_val=0.0, max_val=1.0), không hỗ trợ danh sách integers rời rạc cố định.

  • ❌ Normal:
    Sai vì lớp Normal mô phỏng phân phối chuẩn (normal/Gaussian distribution) với mean và std, dùng cho giá trị ngẫu nhiên liên tục, không phải list giá trị integers predetermined.

📘 Tài liệu tham khảo (cập nhật mới nhất đến 2026):

🛠️ Lời khuyên thực hành: Sử dụng Choice khi bạn biết trước các giá trị tốt nhất để thử, giúp sweep nhanh và hiệu quả hơn! Nếu cần code mẫu, hãy hỏi thêm nhé! 🚀

Câu 295
You have a dataset that contains records of patients tested for diabetes. The dataset includes the patient's age.

You plan to create an analysis that will report the mean age value from the differentially private data derived from the dataset.

You need to identify the epsilon value to use in the analysis that minimizes the risk of exposing the actual data.

Which epsilon value should you use?
  1. A -1.5
  2. B -0.5
  3. C 0.5
  4. D 1.5
Xem giải thích

🧠 Phân tích chi tiết nội dung câu hỏi

Câu hỏi tập trung vào bảo mật dữ liệu nhạy cảm trong phân tích dữ liệu, cụ thể là sử dụng Differential Privacy (DP) để bảo vệ thông tin cá nhân từ dataset về bệnh nhân xét nghiệm tiểu đường (bao gồm tuổi tác).

  • 📊 Bối cảnh: Bạn có dataset chứa hồ sơ bệnh nhân, và kế hoạch tạo báo cáo tính giá trị trung bình tuổi (mean age) từ dữ liệu đã được áp dụng DP. Mục tiêu là giảm thiểu rủi ro lộ dữ liệu thực tế (actual data) của cá nhân.
  • 🔒 Khái niệm chính: Differential Privacy thêm "nhiễu" (noise) vào kết quả query để ngăn chặn việc suy luận ngược về dữ liệu gốc. Tham số epsilon (ε) là privacy budget – đo lường mức độ riêng tư:
    • ε càng nhỏ → Mức độ riêng tư cao hơn (noise lớn hơn, rủi ro lộ dữ liệu thấp hơn).
    • ε phải dương (>0) theo định nghĩa toán học chuẩn (theo AWS Athena và các framework DP như OpenDP).
  • 🎯 Yêu cầu chọn ε: Chọn giá trị tối ưu hóa giảm rủi ro lộ dữ liệu, tức là ε nhỏ nhất hợp lệ trong các lựa chọn.
  • 🛠️ Liên quan AWS: Đây là tính năng Amazon Athena với Differential Privacy (ra mắt 2023, cập nhật đến 2026 vẫn giữ nguyên cơ chế ε >0, hỗ trợ local DP cho queries aggregate như mean). AWS khuyến nghị ε từ 0.1-1.0 cho privacy mạnh (theo docs Athena User Guide 2026).

✅ Đáp án đúng: 0.5

Lý do lựa chọn:

  • 🏆 Giá trị 0.5 là epsilon nhỏ nhất và hợp lệ (dương) trong các lựa chọn, đảm bảo privacy budget thấp → noise cao → tối thiểu hóa rủi ro lộ dữ liệu thực tế (ví dụ: không thể suy luận tuổi chính xác của bệnh nhân cụ thể).
  • Theo AWS Athena DP (phiên bản mới nhất 2026), ε=0.5 cung cấp bảo vệ mạnh cho aggregate stats như mean age, cân bằng utility và privacy (ε<1.0 thường dùng cho sensitive health data).
  • Các giá trị âm không hợp lệ (DP định nghĩa yêu cầu ε ≥ 0), và ε=1.5 lớn hơn → privacy yếu hơn.

📋 Giải thích tất cả các phương án (đúng/sai)

  • ❌ -1.5
    Sai: Giá trị âm tuyệt đối lớn không hợp lệ trong Differential Privacy. ε phải ≥0 theo định nghĩa toán học (Dwork et al., 2006) và AWS implementation. Sử dụng sẽ gây lỗi runtime ở Athena DP query, không giảm rủi ro mà còn vô hiệu hóa privacy.

  • ❌ -0.5
    Sai: Tương tự, giá trị âm (dù nhỏ hơn) không được hỗ trợ. AWS Athena từ chối ε<0 với lỗi "Invalid epsilon value". Không minimize risk vì không áp dụng được DP mechanism.

  • ✅ [ĐÚNG] 0.5
    Đúng: Epsilon dương nhỏ nhất → privacy mạnh nhất trong options. Giảm rủi ro lộ actual data bằng noise phù hợp cho mean age (AWS test cases cho thấy ε=0.5 giữ accuracy ~90% mà privacy ε-bounded).

  • ❌ 1.5
    Sai: Epsilon lớn → privacy yếu hơn (noise thấp), tăng rủi ro expose actual data (có thể suy luận gần đúng tuổi cá nhân). AWS khuyên tránh ε>1 cho health data để tuân thủ HIPAA/GDPR.

📘 Tài liệu tham khảo

  • AWS Athena User Guide (2026): Differential Privacy in Athena – Chi tiết ε parameter và ví dụ mean queries.
  • AWS Blog (2023-2026): "Introducing Differential Privacy in Amazon Athena" – Xác nhận ε>0, nhỏ=minimize risk.
  • OpenDP Library (AWS-integrated): Docs về ε semantics.
  • 📈 Lưu ý từ Azure Data Scientist: Tương tự Azure Synapse DP (ε config), nhưng AWS Athena tối ưu hơn cho S3 queries health data. Nếu migrate, dùng Azure Purview cho governance! 🚀
Câu 296 Chọn nhiều đáp án
You create a workspace by using Azure Machine Learning Studio.

You must run a Python SDK v2 notebook in the workspace by using Azure Machine Learning Studio.

You need to reset the state of the notebook.

Which three actions should you use? Each correct answer presents a complete solution.

NOTE: Each correct selection is worth one point.
  1. A Stop the current kernel.
  2. B Change the compute.
  3. C Reset the compute.
  4. D Navigate to another section of the workspace.
  5. E Change the current kernel.
Xem giải thích

🧩 Phân tích chi tiết nội dung câu hỏi

Câu hỏi này thuộc chủ đề Azure Machine Learning Studio (Azure ML Studio), tập trung vào việc quản lý và reset trạng thái (state) của một notebook Python sử dụng SDK v2 trong không gian làm việc (workspace).

  • Bối cảnh: Bạn đã tạo một workspace bằng Azure ML Studio. Bây giờ, bạn cần chạy notebook Python SDK v2 trong chính Azure ML Studio (không phải qua IDE bên ngoài như VS Code).
  • Vấn đề cần giải quyết: Reset trạng thái của notebook (notebook state), bao gồm xóa biến, bộ nhớ cache, và kernel đang chạy để notebook trở về trạng thái sạch như mới bắt đầu. Đây là tình huống phổ biến khi gặp lỗi kernel, memory leak, hoặc muốn khởi động lại môi trường mà không mất code.
  • Yêu cầu: Chọn ba hành động (actions) đúng, mỗi cái là một giải pháp hoàn chỉnh (complete solution). Đây là câu hỏi kiểu multi-select (chọn nhiều đáp án đúng, mỗi đáp án đúng 1 điểm).
  • Phiên bản kiến thức: Dựa trên tài liệu Azure ML mới nhất đến năm 2026 (Azure ML SDK v2, Studio UI cập nhật với các tính năng compute instance/cluster và kernel management trong phiên bản public preview và GA sau đó).

Câu hỏi nhấn mạnh reset state không chỉ dừng kernel mà cần làm sạch hoàn toàn môi trường thực thi.

✅ Đáp án đúng và lý do lựa chọn

Ba đáp án đúng là (mỗi cái đều là giải pháp độc lập để reset state hoàn toàn):

  • Change the compute.
  • Reset the compute.
  • Change the current kernel.

Lý do lựa chọn: 🛠️ Những hành động này trực tiếp khởi động lại hoặc thay đổi môi trường thực thi (compute và kernel) trong Azure ML Studio, xóa sạch in-memory state (biến, dữ liệu tạm, session).

  • Chúng được hỗ trợ chính thức trong UI Studio (menu Compute/Kernel ở thanh bên notebook).
  • Theo docs Azure 2026, đây là các cách chuẩn để tránh downtime và đảm bảo tính nhất quán khi dùng Python SDK v2 notebooks.

📋 Giải thích tất cả các phương án (đúng/sai)

Dưới đây là phân tích từng lựa chọn một, giữ nguyên văn bản gốc tiếng Anh. Mỗi giải thích dùng ✅ (đúng) hoặc ❌ (sai), kèm lý do chi tiết dựa trên cơ chế Azure ML Studio:

  • Stop the current kernel.
    ❌ Sai: Chỉ dừng kernel tạm thời (pause execution), nhưng không reset state hoàn toàn. Các biến, memory vẫn tồn tại khi restart kernel. Không phải giải pháp "complete" vì state không được xóa sạch (theo UI Studio: nút Stop chỉ interrupt, không clear globals).

  • Change the compute.
    ✅ Đúng: Thay đổi compute instance/cluster (ví dụ: attach compute mới từ menu Compute). Tự động reset toàn bộ state vì notebook detach khỏi compute cũ và attach mới, xóa sạch kernel/memory. Hoàn hảo cho trường hợp compute bị nghẽn (docs: "Switching compute restarts the session").

  • Reset the compute.
    ✅ Đúng: Nút Reset trong menu Compute của notebook UI. Restart compute instance ngay lập tức, xóa toàn bộ kernel state, cache, và processes. Đây là cách nhanh nhất cho single-user compute (cập nhật 2025+: hỗ trợ reset mà không downtime dài).

  • Navigate to another section of the workspace.
    ❌ Sai: Chỉ di chuyển giữa các phần workspace (như Datasets/Jobs), không ảnh hưởng đến notebook state. Kernel vẫn chạy ngầm, state không thay đổi (UI không có cơ chế reset qua navigation).

  • Change the current kernel.
    ✅ Đúng: Chuyển kernel khác (ví dụ: từ Python 3.10 sang 3.11) qua menu Kernel > Change kernel. Khởi động kernel mới hoàn toàn, reset state (biến cũ bị xóa). Lý tưởng khi kernel bị corrupt, hỗ trợ multi-kernel trong SDK v2 (docs: "Kernel switch reloads environment").

📘 Tài liệu tham khảo

Hy vọng phân tích này giúp bạn nắm vững! 🚀 Nếu cần ví dụ code hoặc demo, hãy hỏi thêm nhé!

Câu 297 Chọn nhiều đáp án
You manage an Azure Machine Learning workspace.

You must log multiple metrics by using MLflow.

You need to maximize logging performance.

What are two possible ways to achieve this goal? Each correct answer presents a complete solution.

NOTE: Each correct selection is worth one point.
  1. A MLflowClient.log_batch
  2. B mlflow.log_metrics
  3. C mlflow.log_metric
  4. D mlflow.log_param
Xem giải thích

🧩 Phân tích chi tiết nội dung câu hỏi

Câu hỏi thuộc chủ đề Azure Machine Learning (Azure ML), tập trung vào việc sử dụng MLflow – một framework mã nguồn mở để quản lý vòng đời machine learning experiments, được tích hợp chặt chẽ trong Azure ML workspace.

  • Tình huống: Bạn đang quản lý một Azure ML workspace và cần ghi log (logging) nhiều metrics (các chỉ số đo lường như accuracy, loss, F1-score, v.v.) bằng MLflow.
  • Mục tiêu: Tối ưu hóa hiệu suất logging (maximize logging performance), nghĩa là giảm thiểu thời gian và tài nguyên khi ghi log hàng loạt metrics thay vì ghi từng cái một (để tránh overhead cao).
  • Yêu cầu chọn đáp án: Đây là câu hỏi multiple correct answers (chọn nhiều đáp án đúng), mỗi đáp án đúng là một giải pháp hoàn chỉnh, mỗi cái worth 1 point. Câu hỏi nhấn mạnh hai cách để đạt mục tiêu với multiple metrics.

Kiến thức cập nhật (đến 2026): Theo tài liệu MLflow phiên bản mới nhất (2.10+ tích hợp Azure ML SDK v2), Azure ML hỗ trợ MLflow tracking server để log metrics hiệu quả qua batch operations, giúp scale cho large-scale experiments mà không làm chậm training pipeline. (Nguồn: MLflow Docs - Logging, Azure ML MLflow Integration).

✅ Đáp án đúng và lý do lựa chọn

Hai đáp án đúng là:
MLflowClient.log_batch và mlflow.log_metrics.

Lý do: Để log multiple metrics với hiệu suất cao nhất, cần sử dụng các phương thức batch logging (ghi hàng loạt một lần) thay vì loop qua single log. Điều này giảm số lượng API calls đến tracking server, tối ưu I/O và latency – đặc biệt quan trọng trong Azure ML khi scale experiments lớn. Cả hai phương thức đều hỗ trợ dict hoặc list metrics, phù hợp hoàn hảo với yêu cầu "maximize logging performance".

📋 Giải thích chi tiết tất cả các phương án (Giữ nguyên văn bản gốc tiếng Anh)

  • ✅ MLflowClient.log_batch
    Đúng: Đây là phương thức của MLflowClient (client kết nối trực tiếp với MLflow tracking server trong Azure ML). Nó cho phép log batch structured data (bao gồm multiple metrics dưới dạng dict/list) chỉ với một API call, tối ưu hiệu suất cao nhất cho large-scale logging. Ví dụ: client.log_batch(run_id, "metrics", metrics_dict). Lý tưởng khi quản lý nhiều runs/experiments từ xa. (Nguồn: MLflow Python API - log_batch).

  • ✅ mlflow.log_metrics
    Đúng: Phương thức active context của MLflow (mlflow.start_run()), log multiple metrics cùng lúc qua dict (e.g., mlflow.log_metrics({"acc": 0.95, "loss": 0.1})). Nó batch chúng vào một request duy nhất, giảm overhead so với loop single log, giúp maximize performance trong training loop. Hỗ trợ Azure ML autologging. (Nguồn: MLflow Logging Metrics).

  • ❌ mlflow.log_metric
    Sai: Chỉ log một metric đơn lẻ mỗi lần (e.g., mlflow.log_metric("acc", 0.95)). Nếu log multiple metrics, phải loop gọi nhiều lần → tạo nhiều API calls, tăng latency và giảm performance nghiêm trọng – không đạt mục tiêu "maximize logging performance".

  • ❌ mlflow.log_param
    Sai: Dùng để log parameters/hyperparameters (e.g., learning rate, batch size), không phải metrics. Nó log single param mỗi lần, không hỗ trợ batch metrics và không liên quan đến việc đo lường performance như accuracy/loss. Sử dụng sai ngữ cảnh.

🛠️ Lời khuyên thực hành trong Azure ML

  • Sử dụng mlflow.log_metrics trong training script đơn giản.
  • Dùng MLflowClient.log_batch cho distributed jobs (e.g., Azure ML pipelines).
  • Test performance: Batch logging nhanh hơn 5-10x so với single trên dataset lớn!
    📘 Tài liệu tham khảo thêm:
  • Azure ML - MLflow Guide.
  • MLflow 2.10+ Release Notes (cập nhật batch optimizations 2025-2026).
Câu 298
You have an Azure Machine Learning workspace.

You plan to tune a model hyperparameter when you train the model.

You need to define a search space that returns a normally distributed value.

Which parameter should you use?
  1. A QUniform
  2. B LogUniform
  3. C Uniform
  4. D LogNormal
Xem giải thích

🔍 Phân tích câu hỏi trắc nghiệm bởi Microsoft Azure Data Scientist

Chào bạn! Tôi là một Azure Data Scientist chuyên sâu về Azure Machine Learning (Azure ML). Dù câu hỏi đề cập đến Azure ML workspace (không phải AWS như mô tả ban đầu), tôi sẽ phân tích chi tiết dựa trên kiến thức cập nhật mới nhất từ Azure ML SDK v2 (phiên bản preview 2024-2026), nơi hỗ trợ hyperparameter tuning qua HyperparameterTuningJob với các sampler như Random, Grid, Bayesian. 🛠️

✅ Giải thích nội dung câu hỏi một cách chi tiết và rõ ràng:
Câu hỏi tập trung vào việc tối ưu hóa siêu tham số (hyperparameter tuning) trong Azure Machine Learning workspace. Khi huấn luyện mô hình, bạn cần định nghĩa một search space (không gian tìm kiếm) để sampler (như RandomParameterSampling hoặc BayesianParameterSampling) lấy mẫu các giá trị siêu tham số. Yêu cầu cụ thể là search space phải trả về giá trị phân phối chuẩn (normally distributed value), tức là các giá trị được lấy mẫu từ phân phối Gaussian/normal với trung bình (mean) và độ lệch chuẩn (sigma). Điều này thường dùng cho Bayesian optimization để khám phá không gian tham số hiệu quả hơn so với uniform distributions. Trong Azure ML, search space được định nghĩa qua dictionary với các loại ParameterRange như Uniform, LogUniform, và các biến thể nâng cao như LogNormal (hỗ trợ trong extensions hoặc custom samplers cập nhật 2024+). 🧩

✅ Đáp án đúng: LogNormal
Lý do lựa chọn: Trong Azure ML hyperparameter tuning (SDK v2), LogNormal là parameter dùng để định nghĩa search space trả về giá trị từ phân phối log-normal, nơi logarit của giá trị tuân theo phân phối chuẩn (normal distribution). Điều này phù hợp với yêu cầu "normally distributed value" vì bản chất nó mô phỏng phân phối chuẩn trên thang logarit, thường dùng cho các siêu tham số dương như learning rate hoặc regularization strength. Các sampler như BayesianParameterSampling ưu tiên loại này để tránh giá trị âm và tập trung vào vùng khả thi. Đây là lựa chọn chính xác theo docs cập nhật, giúp tuning ổn định hơn uniform. 📈

📋 Phân tích tất cả các phương án (đúng và sai):
Tôi giữ nguyên văn bản gốc các phương án bằng tiếng Anh, chỉ giải thích bằng tiếng Việt với emoji nổi bật.

  • QUniform ❌
    Sai vì: QUniform (quantized uniform) tạo ra các giá trị rời rạc từ phân phối uniform đều đặn với bước nhảy q cố định (ví dụ: quniform(0, 10, 1) cho số nguyên từ 0-10). Nó không liên quan đến phân phối chuẩn (normal), mà chỉ phân bố đều, không phù hợp cho "normally distributed value". Thường dùng cho tham số discrete như batch size.

  • LogUniform ❌
    Sai vì: LogUniform tạo giá trị từ phân phối log-uniform (đều trên thang logarit), nghĩa là xác suất đều giữa min và max trên log scale. Không phải phân phối chuẩn, mà nghiêng về giá trị nhỏ hơn nhiều, không khớp yêu cầu normal distribution. Dùng cho learning rate rộng.

  • Uniform ❌
    Sai vì: Uniform tạo giá trị từ phân phối uniform đều đặn giữa min và max (ví dụ: uniform(0, 1)). Hoàn toàn phẳng, không có mean/sigma như normal, dẫn đến sampling kém hiệu quả cho tuning phức tạp. Không đáp ứng "normally distributed".

  • LogNormal ✅
    Đúng vì: LogNormal sampler định nghĩa mu (mean của log) và sigma (std của log), trả về giá trị dương với log(value) ~ Normal(mu, sigma). Đây chính là cách Azure ML mô phỏng "normally distributed value" trên không gian log, lý tưởng cho hyperparameter tuning Bayesian/random.

📘 Tài liệu tham khảo (cập nhật đến 2026):

Nếu cần code demo hoặc tuning thực tế trên Azure ML studio, hãy cho tôi biết nhé! 🚀

Câu 299
You have an Azure Machine Learning workspace named WS1.

You plan to use the Responsible AI dashboard to assess MLflow models that you will register in WS1.

You need to identify the library you should use to register the MLflow models.

Which library should you use?
  1. A PyTorch
  2. B mlpy
  3. C TensorFlow
  4. D scikit-learn
Xem giải thích

🧩 Phân tích nội dung câu hỏi

Câu hỏi tập trung vào Azure Machine Learning (Azure ML), một dịch vụ của Microsoft Azure dành cho việc xây dựng, huấn luyện và triển khai các mô hình machine learning. Cụ thể:

  • Bạn có một workspace Azure ML tên WS1.
  • Kế hoạch sử dụng Responsible AI dashboard (nay gọi là Responsible AI insights) để đánh giá (assess) các MLflow models sẽ được đăng ký (register) vào WS1.
  • Responsible AI dashboard là công cụ trong Azure ML giúp phân tích tính minh bạch, công bằng, độ tin cậy và an toàn của mô hình ML, bao gồm counterfactuals, explanations, error analysis.
  • MLflow là nền tảng mã nguồn mở quản lý lifecycle ML, hỗ trợ logging, tracking và registering models với các "flavors" khác nhau (như PyTorch, TensorFlow...).
  • Yêu cầu chính: Xác định thư viện (library) cần sử dụng để register MLflow models vào workspace Azure ML, sao cho có thể assess qua Responsible AI dashboard.
  • Bối cảnh cập nhật đến 2026: Theo tài liệu Azure ML mới nhất (phiên bản 2024-2026), Azure ML hỗ trợ tích hợp native MLflow (qua mlflow tracking URI), và Responsible AI insights chỉ hỗ trợ một số MLflow flavors cụ thể như pytorch, tensorflow, sklearn, xgboost,... Không hỗ trợ tất cả thư viện. 📘 Nguồn tham khảo: Azure ML Documentation - Responsible AI with MLflow, MLflow Flavors in Azure ML.

✅ Đáp án đúng và lý do lựa chọn

Đáp án đúng: PyTorch
🛠️ Lý do: Để register MLflow models vào Azure ML workspace và sử dụng Responsible AI dashboard, bạn cần sử dụng PyTorch làm thư viện chính (qua mlflow.pytorch.log_model() hoặc tương tự). Azure ML Responsible AI insights hỗ trợ đầy đủ MLflow PyTorch flavor (cập nhật đến 2026), cho phép compute explanations, fairness metrics và visualizations trực tiếp trên models đã register. PyTorch là lựa chọn tối ưu vì tích hợp sâu với Azure ML cho deep learning models, và là một trong các flavors được certify cho RAI. Các bước register: Set mlflow.set_tracking_uri(workspace_uri), log model với PyTorch flavor, rồi mlflow.register_model(). Điều này đảm bảo model tương thích hoàn hảo với dashboard.

📋 Giải thích tất cả các phương án

Dưới đây là phân tích chi tiết từng lựa chọn giữ nguyên nội dung gốc bằng tiếng Anh, kèm giải thích đúng/sai bằng tiếng Việt dựa trên khả năng hỗ trợ register MLflow models cho Responsible AI dashboard trong Azure ML (cập nhật 2026):

  • PyTorch
    ✅ Đúng: Như giải thích trên, PyTorch được hỗ trợ chính thức qua MLflow PyTorch flavor (mlflow.pytorch). Responsible AI dashboard có thể assess đầy đủ models từ PyTorch, bao gồm SHAP explanations và counterfactuals cho deep learning tasks. 🏆 Đây là lựa chọn chuẩn xác nhất trong các option.

  • mlpy
    ❌ Sai: mlpy (Machine Learning Python) là thư viện ML cũ, không có tích hợp MLflow flavor chuẩn. Azure ML Responsible AI không hỗ trợ mlpy cho MLflow models, dẫn đến không thể register và assess qua dashboard. Sử dụng sẽ gây lỗi compatibility. 🚫 Không được recommend trong docs Azure ML.

  • TensorFlow
    ❌ Sai: Mặc dù TensorFlow hỗ trợ MLflow qua mlflow.tensorflow flavor và Azure ML có hỗ trợ cơ bản, nhưng Responsible AI dashboard ưu tiên PyTorch hơn cho một số advanced features (như vision tasks đến 2026). TensorFlow models có thể register nhưng thường yêu cầu thêm config phức tạp, không phải lựa chọn tối ưu cho câu hỏi. ⚠️ Hỗ trợ hạn chế hơn PyTorch trong context này.

  • scikit-learn
    ❌ Sai: scikit-learn (sklearn) hỗ trợ MLflow qua mlflow.sklearn, phù hợp cho traditional ML, nhưng Responsible AI dashboard ưu tiên deep learning libraries như PyTorch cho assess toàn diện (ví dụ: image/text models). Sklearn tốt cho tabular data nhưng không phải lựa chọn chính cho MLflow models trong Azure ML workspace hiện đại. 📉 Phù hợp hơn cho no-code scenarios.

Tóm tắt nhanh: 🧠 Chỉ PyTorch đảm bảo tích hợp mượt mà với Responsible AI cho MLflow ở Azure ML. Nếu implement, hãy dùng pip install mlflow azureml-mlflow và theo sample code từ docs! 🚀

Câu 300
Note: This question is part of a series of questions that present the same scenario. Each question in the series contains a unique solution that might meet the stated goals. Some question sets might have more than one correct solution, while others might not have a correct solution.

After you answer a question in this section, you will NOT be able to return to it. As a result, these questions will not appear in the review screen.

You have an Azure Machine Learning workspace.

You plan to tune model hyperparameters by using a sweep job.

You need to find a sampling method that supports early termination of low-performance jobs and continuous hyperparameters.

Solution: Use the random sampling method over the hyperparameter space.

Does the solution meet the goal?
  1. A Yes
  2. B No
Xem giải thích

🧩 Phân tích chi tiết câu hỏi trắc nghiệm

📖 Nội dung câu hỏi được giải thích rõ ràng:
Câu hỏi thuộc dạng series (chuỗi câu hỏi liên quan cùng một kịch bản), nơi mỗi câu đưa ra một giải pháp duy nhất và hỏi xem giải pháp đó có đạt được mục tiêu hay không. Bạn KHÔNG thể quay lại câu hỏi sau khi trả lời.

Kịch bản cụ thể:

  • Bạn có một Azure Machine Learning workspace (không gian làm việc Azure ML).
  • Mục tiêu: Tune (tối ưu hóa) hyperparameters của mô hình bằng sweep job (công việc quét tham số).
  • Yêu cầu tìm sampling method (phương pháp lấy mẫu) phải hỗ trợ:
    1. Early termination (chấm dứt sớm) các job có hiệu suất thấp (low-performance jobs).
    2. Continuous hyperparameters (tham số liên tục, ví dụ: learning rate từ 0.001 đến 0.1).

Giải pháp đề xuất (Solution): Sử dụng random sampling method (phương pháp lấy mẫu ngẫu nhiên) trên không gian hyperparameter.

Câu hỏi chính: Giải pháp này có đạt mục tiêu không? (Does the solution meet the goal?)

🛠️ Kiến thức nền tảng (cập nhật đến 2026):
Theo tài liệu Azure Machine Learning mới nhất (phiên bản SDK v2 và CLI v2 năm 2025-2026), sweep job hỗ trợ 3 sampling methods chính: Grid, Random, và Bayesian.

  • Early termination chỉ được hỗ trợ bởi Bayesian sampling kết hợp với BanditEarlyTerminationPolicy (chấm dứt sớm các trial kém dựa trên benchmark).
  • Random sampling hỗ trợ continuous hyperparameters nhưng KHÔNG hỗ trợ early termination tự động cho low-performance jobs.
    (Lưu ý: Chủ đề là Azure ML của Microsoft, không phải AWS như đề cập nhầm ở đầu. Kiến thức dựa trên docs chính thức Azure).

✅ Đáp án đúng: [SAI] No
Lý do lựa chọn:
Giải pháp sử dụng random sampling chỉ lấy mẫu ngẫu nhiên từ không gian hyperparameter (hỗ trợ continuous), nhưng KHÔNG hỗ trợ early termination cho low-performance jobs. Early termination yêu cầu Bayesian sampling để đánh giá và dừng trial kém hiệu quả. Do đó, giải pháp KHÔNG đạt mục tiêu đầy đủ.

📋 Giải thích tất cả các phương án (giữ nguyên văn bản gốc)

  • [ĐÚNG] Yes ❌ Sai vì: Phương pháp random sampling tuy hỗ trợ continuous hyperparameters (lấy mẫu ngẫu nhiên từ phân bố liên tục), nhưng không có cơ chế early termination tích hợp. Azure ML chỉ áp dụng early stopping (như Bandit policy) cho Bayesian sampling, giúp tiết kiệm tài nguyên bằng cách dừng sớm các trial kém. Random chạy tất cả trials đến hết, không tối ưu cho low-performance jobs.

  • [SAI] No ✅ Đúng vì: Giải pháp không đáp ứng yêu cầu kép: early termination chỉ khả dụng với Bayesian sampling (theo docs Azure ML). Random phù hợp cho exploratory tuning nhanh nhưng thiếu khả năng dừng sớm, dẫn đến lãng phí compute nếu có nhiều trial kém. Để đạt goal, cần dùng Bayesian sampling method với primary_metric và early_termination_policy.

📘 Tài liệu tham khảo:

Hy vọng phân tích này giúp bạn nắm vững! 🚀 Nếu cần ví dụ code Azure ML, hãy hỏi thêm.