Ngân hàng đề — Microsoft Azure Data Scientist

Tìm thấy 313 câu.

Câu 301
Note: This question is part of a series of questions that present the same scenario. Each question in the series contains a unique solution that might meet the stated goals. Some question sets might have more than one correct solution, while others might not have a correct solution.

After you answer a question in this section, you will NOT be able to return to it. As a result, these questions will not appear in the review screen.

You have an Azure Machine Learning workspace.

You plan to tune model hyperparameters by using a sweep job.

You need to find a sampling method that supports early termination of low-performance jobs and continuous hyperparameters.

Solution: Use the Bayesian sampling method over the hyperparameter space.

Does the solution meet the goal?
  1. A Yes
  2. B No
Xem giải thích

🧩 Phân tích chi tiết nội dung câu hỏi

Câu hỏi thuộc dạng case study trong kỳ thi chứng chỉ (có thể là Azure AI-102 hoặc DP-100), nơi bạn có một Azure Machine Learning workspace và cần tune hyperparameters bằng sweep job (công việc quét tham số siêu).
Mục tiêu cụ thể:

  • Tìm sampling method (phương pháp lấy mẫu) hỗ trợ early termination (chấm dứt sớm) cho các job hiệu suất thấp.
  • Đồng thời hỗ trợ continuous hyperparameters (tham số siêu liên tục, ví dụ: learning rate = 0.01).

Solution đề xuất: Sử dụng Bayesian sampling method trên không gian hyperparameter.
Câu hỏi: Solution này có đạt mục tiêu không? (Yes/No).

📘 Lưu ý từ ngữ cảnh: Đây là phần câu hỏi không thể quay lại sau khi trả lời, và có thể có nhiều giải pháp đúng/sai trong series.

✅ Đáp án đúng và lý do lựa chọn

Đáp án đúng: No
🛠️ Lý do:
Bayesian sampling hỗ trợ continuous hyperparameters (nó dùng mô hình Gaussian Process để tối ưu hóa trên không gian liên tục). Tuy nhiên, KHÔNG hỗ trợ early termination cho low-performance jobs. Theo tài liệu Azure ML mới nhất (phiên bản 2024-2026), Bayesian optimization được thiết kế thông minh để tự động ưu tiên các trial tốt, nên không cần và không tương thích với early stopping policies (như Bandit hoặc Median stopping). Sử dụng Bayesian sẽ vi phạm yêu cầu early termination, do đó solution không meet the goal.

📋 Giải thích tất cả các phương án (giữ nguyên nội dung gốc bằng tiếng Anh)

  • Yes ❌ SAI: Phương án này sai vì Bayesian sampling không hỗ trợ early termination. Nó chỉ phù hợp cho việc tối ưu hóa thông minh trên continuous space, nhưng bỏ qua yêu cầu chấm dứt sớm job kém, dẫn đến lãng phí tài nguyên nếu có trial kém kéo dài.
  • No ✅ ĐÚNG: Phương án này đúng vì solution đề xuất không đáp ứng đầy đủ goal. Bayesian chỉ hỗ trợ một phần (continuous hyperparameters), nhưng thiếu early termination – tính năng chỉ có ở Random/Grid sampling kết hợp Bandit policy. Giải pháp thay thế lý tưởng: Random sampling với Bandit early termination policy (hỗ trợ cả discrete/continuous và dừng sớm dựa trên percentile hiệu suất).

🔗 Tài liệu tham khảo (cập nhật mới nhất đến 2026)

🧠 Mẹo thi cử: Trong Azure ML sweep, chọn Random + Bandit cho early stopping + continuous params để đạt goal tương tự!

Câu 302
Note: This question is part of a series of questions that present the same scenario. Each question in the series contains a unique solution that might meet the stated goals. Some question sets might have more than one correct solution, while others might not have a correct solution.

After you answer a question in this section, you will NOT be able to return to it. As a result, these questions will not appear in the review screen.

You have an Azure Machine Learning workspace.

You plan to tune model hyperparameters by using a sweep job.

You need to find a sampling method that supports early termination of low-performance jobs and continuous hyperparameters.

Solution: Use the grid sampling method over the hyperparameter space.

Does the solution meet the goal?
  1. A Yes
  2. B No
Xem giải thích

🧠 Phân tích câu hỏi trắc nghiệm về Azure Machine Learning

🧩 Nội dung câu hỏi được giải thích chi tiết:
Câu hỏi này thuộc dạng "case study" (một loạt câu hỏi cùng scenario), nơi bạn KHÔNG thể quay lại sau khi trả lời. Scenario: Bạn có một Azure Machine Learning workspace và đang lên kế hoạch tune hyperparameters (tối ưu hóa siêu tham số) bằng cách sử dụng sweep job (công việc quét hyperparameter).
Yêu cầu cụ thể: Tìm một sampling method (phương pháp lấy mẫu) hỗ trợ hai tính năng chính:

  • Early termination (chấm dứt sớm) các job có hiệu suất thấp (low-performance jobs) – thường qua Bandit early termination policy.
  • Continuous hyperparameters (siêu tham số liên tục, như learning rate float).
    Giải pháp đề xuất (Solution): Sử dụng grid sampling method (phương pháp lấy mẫu lưới) trên không gian hyperparameter.
    Câu hỏi: Giải pháp này có đạt được mục tiêu không? (Does the solution meet the goal?)
    Đây là kiến thức cốt lõi trong Azure ML HyperDrive (nay tích hợp vào sweep jobs), với các sampling method bao gồm Grid, Random, Bayesian. Phiên bản cập nhật mới nhất (tính đến 2026): Azure ML v2 hỗ trợ sweep jobs linh hoạt hơn, nhưng grid sampling vẫn không hỗ trợ early termination.

✅ Đáp án đúng: No
Lý do lựa chọn: Grid sampling là phương pháp exhaustive (thử tất cả tổ hợp theo lưới cố định), KHÔNG hỗ trợ early termination (như Bandit policy) và kém hiệu quả với continuous hyperparameters (vì nó dành cho discrete/categorical params, không adaptive). Các phương pháp phù hợp là Bayesian hoặc Random sampling (hỗ trợ early stopping và continuous space). Giải pháp này KHÔNG đạt mục tiêu.
(Dựa trên tài liệu chính thức Azure ML: Tune hyperparameters - Azure Machine Learning 📘

🛠️ Giải thích tất cả các phương án (Yes/No):

  • Yes ❌ SAI – Phương án này sai vì grid sampling không hỗ trợ early termination (Bandit policy chỉ áp dụng cho Random/Bayesian). Nó thử toàn bộ lưới, lãng phí tài nguyên với low-performance jobs và không tối ưu cho continuous hyperparameters (dễ dẫn đến explosion of combinations).
  • No ✅ ĐÚNG – Phương án này đúng vì grid sampling vi phạm cả hai yêu cầu: Không có cơ chế dừng sớm (early termination chỉ cho adaptive samplers như Bayesian), và kém phù hợp với continuous space (nên dùng Bayesian cho exploration tốt hơn). Thay thế: Sử dụng Bayesian sampling với Bandit early termination.
    (Tham khảo thêm: Sampling methods in Azure ML sweep jobs và Early stopping policies – cập nhật 2024-2026) 📘
Câu 303
You have an Azure Machine Learning workspace.

You plan to use the workspace to set up automated machine learning training for an image classification model.

You need to choose the primary metric to optimize the model training.

Which primary metric should you choose?
  1. A r2_score
  2. B mean_absolute_error
  3. C iou
  4. D median_absolute_error
Xem giải thích

🧩 Phân tích câu hỏi trắc nghiệm về Azure Machine Learning

📘 Giới thiệu vai trò và nội dung câu hỏi:
Xin chào! Tôi là một Microsoft Azure Data Scientist chuyên sâu về Azure Machine Learning (Azure ML). Câu hỏi này tập trung vào việc thiết lập Automated Machine Learning (AutoML) trong Azure ML workspace để huấn luyện mô hình image classification (phân loại hình ảnh).

Cụ thể:

  • Bạn có một Azure ML workspace.
  • Kế hoạch sử dụng AutoML để tự động hóa việc huấn luyện mô hình phân loại hình ảnh.
  • Nhiệm vụ: Chọn primary metric (chỉ số chính) để tối ưu hóa quá trình huấn luyện mô hình.
    Primary metric là chỉ số mà AutoML sử dụng để đánh giá và chọn mô hình tốt nhất (hyperparameter tuning và model selection dựa trên metric này). Với task image classification (multi-class hoặc multi-label), Azure ML hỗ trợ các metric chuyên biệt cho vision tasks, theo tài liệu cập nhật mới nhất (phiên bản Azure ML 2024-2026, hỗ trợ AutoML Vision v2+).

✅ Đáp án đúng: iou
Lý do lựa chọn:
🛠️ Trong Azure ML AutoML cho image classification, iou (Intersection over Union - độ chồng lấp giữa vùng dự đoán và vùng thực tế) là một primary metric hợp lệ và được khuyến nghị cho các task vision liên quan đến phân loại hình ảnh, đặc biệt khi đánh giá độ chính xác không gian (spatial accuracy). Nó giúp tối ưu mô hình bằng cách đo lường tỷ lệ giao/nhập giữa bounding box hoặc mask dự đoán so với ground truth. Các metric khác trong lựa chọn đều là cho regression tasks, không phù hợp với classification. Theo schema AutoML images (cập nhật 2026), iou nằm trong danh sách supported primary metrics: accuracy, precision_score, recall_score, iou, mean_average_precision.

📚 Tài liệu tham khảo:

🔍 Giải thích chi tiết tất cả các phương án:

  • ❌ r2_score: Đây là metric cho regression tasks (đo độ phù hợp của mô hình hồi quy với dữ liệu, R-squared). Không áp dụng cho image classification vì task này là phân loại (categorical output), không phải dự đoán số liên tục. Sử dụng sẽ gây lỗi trong AutoML config.
  • ❌ mean_absolute_error: Metric regression đo lỗi tuyệt đối trung bình (MAE) giữa giá trị dự đoán và thực tế. Hoàn toàn không phù hợp với image classification, vốn cần metric như accuracy hoặc iou để đánh giá nhãn lớp. AutoML sẽ reject nếu chọn cho vision task.
  • ✅ iou: Đúng như đã giải thích ở trên. Là metric chuẩn cho vision tasks trong Azure ML AutoML, tối ưu hóa mô hình bằng cách ưu tiên độ chính xác vùng giao thoa, đặc biệt hữu ích cho classification với yếu tố spatial (hình ảnh).
  • ❌ median_absolute_error: Metric regression đo lỗi tuyệt đối trung vị (MedAE), robust hơn MAE với outliers. Không liên quan đến image classification, chỉ dùng cho numerical prediction, không hỗ trợ trong AutoML vision.

💡 Lời khuyên thực hành:
Khi config AutoML qua Studio hoặc SDK (azureml-sdk v2+), hãy chỉ định primary_metric='iou' trong AutoMLImageConfig cho task="image-classification". Test trên dataset nhỏ để verify! Nếu cần code sample, hãy hỏi thêm nhé! 🚀

Câu 304
You have an Azure Machine Learning workspace named WS1.

You plan to use Azure Machine Learning SDK v2 to register a model as an asset in WS1 from an artifact generated by an MLflow run. The artifact resides in a named output of a job used for the model training.

You need to identify the syntax of the path to reference the model when you register it.

Which syntax should you use?
  1. A t//model/
  2. B azureml://registries
  3. C mlflow-model/
  4. D azureml://jobs/
Xem giải thích

🧩 Phân tích chi tiết câu hỏi trắc nghiệm

📘 Nội dung câu hỏi:
Câu hỏi tập trung vào việc sử dụng Azure Machine Learning SDK v2 để đăng ký (register) một mô hình (model) như một asset trong không gian làm việc Azure ML có tên WS1. Mô hình này được tạo ra từ một artifact của một MLflow run, và artifact này nằm trong named output của một job dùng để huấn luyện mô hình. Nhiệm vụ là xác định cú pháp đường dẫn (path syntax) chính xác để tham chiếu (reference) mô hình khi đăng ký nó.

Đây là tình huống thực tế trong quy trình MLOps trên Azure ML (phiên bản mới nhất đến năm 2026, hỗ trợ tích hợp sâu với MLflow 2.x và job-based workflows). Khi huấn luyện mô hình bằng MLflow trong một job Azure ML, artifact (như thư mục model) được lưu tự động vào named outputs của job (ví dụ: model_output). Để đăng ký model từ đó, bạn cần sử dụng URI scheme azureml:// để trỏ trực tiếp vào vị trí lưu trữ trong Azure ML workspace, tránh tải về local và đảm bảo tính nhất quán dữ liệu.

🛠️ Quy trình liên quan:

  • Job Azure ML chạy MLflow tracking → Artifact lưu vào outputs/<named-output>/path/to/model.
  • SDK v2 dùng mlflow.register_model() hoặc Model.register() với path URI đặc biệt.
  • Cú pháp đúng phải bắt đầu bằng azureml://jobs/... để truy cập job artifacts mà không cần download.

✅ Đáp án đúng: azureml://jobs/<job-id>
Lý do chọn đáp án này (bằng kiến thức Azure ML SDK v2 mới nhất 2026):
Đây là cú pháp chuẩn để tham chiếu artifact từ named output của job trong Azure ML. Đường dẫn đầy đủ thường là azureml://jobs/<job-id>/outputs/<output-name>/model/ (với <job-id> là ID của job huấn luyện, <output-name> là tên output như model_folder). Scheme azureml:// cho phép SDK v2 tự động resolve URI nội bộ workspace, hỗ trợ versioning và reproducibility. Không dùng local path hay MLflow tracking URI vì artifact nằm trên cloud job storage. Điều này được cập nhật trong Azure ML v2.14+ (2025-2026), tích hợp chặt chẽ MLflow 2.10+ cho enterprise-scale.

📚 Tài liệu tham khảo:

🔍 Giải thích tất cả các phương án (đúng/sai)

  • ❌ Phương án SAI: t/<run-id>/model/
    Cú pháp này không hợp lệ trong Azure ML SDK v2. Nó giống như một phần lỗi của local MLflow tracking URI (thường là runs:/<run-id>/model/ hoặc ./runs/<run-id>/), dùng để truy cập artifact trên MLflow server local. Trong Azure ML job, artifact không dùng scheme t:// hay runs:/, mà phải qua azureml://jobs/... để tránh dependency trên MLflow tracking server riêng lẻ. Sử dụng sẽ gây lỗi "Invalid URI" vì không resolve được job storage.

  • ❌ Phương án SAI: azureml://registries
    Scheme azureml://registries/... dùng để tham chiếu model đã đăng ký sẵn trong model registry của Azure ML (ví dụ: azureml://registries/<registry>/models/<model-name>/versions/<version>). Nó không áp dụng cho artifact thô từ job output chưa đăng ký. Dùng ở đây sẽ fail vì không trỏ đến job-specific storage, dẫn đến lỗi "Asset not found".

  • ❌ Phương án SAI: mlflow-model/
    Đây là prefix nội bộ của MLflow khi lưu model (như mlflow-model:/<run-id>), dùng trong MLflow native environment để flavor-specific serialization. Trong Azure ML SDK v2, prefix này chỉ hỗ trợ local hoặc MLflow tracking URI, không dùng trực tiếp cho job artifacts trên cloud. Nó thiếu scheme azureml://, nên SDK không thể resolve đến workspace storage, gây lỗi path resolution.

  • ✅ Phương án ĐÚNG: azureml://jobs/<job-id>
    Như đã giải thích ở trên, đây là cú pháp cốt lõi và chính xác nhất cho trường hợp artifact từ named output của job. SDK v2 sẽ tự động mở rộng để truy cập outputs/... bên trong, đảm bảo zero-copy registration và hỗ trợ A/B testing models. Hoàn hảo cho production workflows với MLflow integration (xác nhận trong Azure ML 2026 updates).

💡 Lưu ý cuối: Nếu triển khai thực tế, thay <job-id> bằng ID thực từ job.name hoặc job.id (lấy từ ml_client.jobs.get()). Test trên Azure ML Studio để verify! 🚀

Câu 305
Note: This question is part of a series of questions that present the same scenario. Each question in the series contains a unique solution that might meet the stated goals. Some question sets might have more than one correct solution, while others might not have a correct solution.

After you answer a question in this section, you will NOT be able to return to it. As a result, these questions will not appear in the review screen.

You manage an Azure Machine Learning workspace. The Python script named script.py reads an argument named training_data. The training_data argument specifies the path to the training data in a file named dataset1.csv.

You plan to run the script.py Python script as a command job that trains a machine learning model.

You need to provide the command to pass the path for the dataset as a parameter value when you submit the script as a training job.

Solution: python train.py --training_data training_data

Does the solution meet the goal?
  1. A Yes
  2. B No
Xem giải thích

🧩 Phân tích chi tiết câu hỏi trắc nghiệm

📖 Nội dung câu hỏi được giải thích rõ ràng:
Câu hỏi thuộc dạng series questions trong kỳ thi chứng chỉ (như AZ-400 hoặc DP-100 của Microsoft Azure), nơi mỗi câu đưa ra một giải pháp cụ thể và hỏi liệu giải pháp đó có đạt được mục tiêu hay không. Bạn đang quản lý một Azure Machine Learning workspace và có script Python tên script.py, script này đọc một argument tên training_data (chỉ đường dẫn đến file dữ liệu huấn luyện dataset1.csv).
Mục tiêu: Chạy script.py dưới dạng command job để huấn luyện mô hình ML, và cần cung cấp command đúng để truyền đường dẫn dataset làm giá trị tham số khi submit job.
Giải pháp đề xuất: python train.py --training_data training_data.
Câu hỏi: Does the solution meet the goal? (Giải pháp này có đạt mục tiêu không?).
✅ Lưu ý quan trọng: Đây là Azure ML (không phải AWS), sử dụng phiên bản mới nhất Azure ML SDK v2 và CLI v2 (cập nhật đến 2026, hỗ trợ managed endpoints, command jobs với YAML hoặc Python SDK).

✅ Đáp án đúng: No
Lý do lựa chọn (bằng tiếng Việt):
Giải pháp KHÔNG đạt mục tiêu vì:

  • Tên script sai: Script gốc là script.py, nhưng command dùng train.py 🛠️.
  • Không truyền đường dẫn thực tế đến dataset1.csv mà chỉ dùng "training_data" làm giá trị (có thể là placeholder, không hợp lệ cho job).
  • Đây chỉ là lệnh chạy local Python, không phải command submit command job đúng chuẩn Azure ML (phải dùng az ml job create, Python SDK ml_client.jobs.create_or_update(), hoặc YAML với command: python script.py --training_data ${{inputs.training_data}}).
    Kết quả: Job sẽ fail hoặc không chạy đúng trong workspace.

🛠️ Giải thích tất cả các phương án trả lời

  • Yes ❌ [SAI]
    Phương án này sai vì giả định giải pháp đúng, nhưng như phân tích trên, command không khớp tên script, không truyền path thực, và không phải cách submit job Azure ML chuẩn. Nếu chọn Yes, bạn sẽ nhầm lẫn về quy trình command job (theo docs Azure ML, phải dùng SDK/CLI để mount data URI như azureml://datastores/.../dataset1.csv).

  • No ✅ [ĐÚNG]
    Phương án này đúng vì giải pháp đề xuất không đáp ứng mục tiêu. Azure ML yêu cầu command job phải: (1) Chỉ đúng tên script, (2) Truyền data input qua inputs trong YAML/SDK (ví dụ: --training_data ${{inputs.training_data}} với type: uri_file), (3) Sử dụng az ml job create --file job.yml. Giải pháp chỉ là lệnh local, không tích hợp workspace/storage.

📘 Tài liệu tham khảo (cập nhật mới nhất 2026)

  • Azure ML Command Jobs docs: Create and run a command job (CLI v2, hỗ trợ inputs/outputs với data URI).
  • Pass parameters to jobs: How to pass data to training scripts (sử dụng $(inputs.training_data) hoặc environment variables).
  • Sample YAML cho command job đúng:
    $schema: https://azuremlschemas.azureedge.net/latest/commandJob.schema.json
    command: python script.py --training_data ${{inputs.training_data}}
    inputs:
      training_data:
        type: uri_file
        path: azureml://datastores/workspaceblobstore/paths/dataset1.csv
    

🔗 Kiểm tra tại Azure ML Studio > Jobs để verify!

Câu 306
Note: This question is part of a series of questions that present the same scenario. Each question in the series contains a unique solution that might meet the stated goals. Some question sets might have more than one correct solution, while others might not have a correct solution.

After you answer a question in this section, you will NOT be able to return to it. As a result, these questions will not appear in the review screen.

You manage an Azure Machine Learning workspace. The Python script named script.py reads an argument named training_data. The training_data argument specifies the path to the training data in a file named dataset1.csv.

You plan to run the script.py Python script as a command job that trains a machine learning model.

You need to provide the command to pass the path for the dataset as a parameter value when you submit the script as a training job.

Solution: python script.py dataset1.csv

Does the solution meet the goal?
  1. A Yes
  2. B No
Xem giải thích

🧩 Phân tích chi tiết nội dung câu hỏi

Câu hỏi thuộc dạng series questions trong kỳ thi chứng chỉ (có thể là Azure Data Scientist Associate - DP-100), nơi mỗi câu đưa ra một scenario cố định và một solution cụ thể, sau đó hỏi "Does the solution meet the goal?" (Giải pháp này có đạt được mục tiêu không?).

  • Scenario chính: Bạn quản lý một Azure Machine Learning workspace. Có script Python tên script.py đọc một argument tên training_data (đường dẫn đến file dữ liệu huấn luyện dataset1.csv). Bạn muốn chạy script này dưới dạng command job để huấn luyện mô hình ML.
  • Mục tiêu (goal): Cung cấp command đúng để truyền đường dẫn dataset làm parameter value khi submit script như một training job trong Azure ML.
  • Solution đề xuất: python script.py dataset1.csv
  • Lưu ý từ câu hỏi: Sau khi trả lời, không thể quay lại; đây là câu hỏi kiểu "unique solution" có thể đúng/sai hoặc nhiều đúng.

Mục tiêu nhấn mạnh việc submit job qua Azure ML (không phải chạy local), sử dụng cơ chế command job trong Azure ML v2 (phiên bản mới nhất đến 2026, theo Azure ML Python SDK v2 hoặc CLI v2). Command job yêu cầu định nghĩa job với command, inputs, code, và submit qua ml_client.jobs.create_or_update() hoặc az ml job create.

📘 Tài liệu tham khảo:

✅ Đáp án đúng: No

Lý do lựa chọn:
Giải pháp python script.py dataset1.csv KHÔNG đạt mục tiêu vì đây chỉ là lệnh chạy local trên máy cá nhân (không submit job vào Azure ML workspace). Trong Azure ML, để chạy command job làm training job, phải sử dụng Azure ML SDK/CLI để định nghĩa job với command="python script.py --training_data ${{inputs.training_data}}" và truyền inputs={"training_data": Input(type="uri_file", path="azureml://datastores/.../dataset1.csv")}. Solution này bỏ qua toàn bộ quy trình submit job, không tích hợp với workspace, compute target, logging, hay tracking experiments.
🛠️ Command đúng ví dụ (SDK v2):

from azure.ai.ml import command, Input, dsl
job = command(
    code="./src",
    command="python script.py --training_data ${{inputs.training_data}}",
    inputs={"training_data": Input(type="uri_file", path="azureml://datastores/workspaceblobstore/paths/dataset1.csv")}
)
ml_client.jobs.create_or_update(job)

Hoặc CLI: az ml job create --file job.yml với YAML định nghĩa tương tự.

📋 Giải thích tất cả các phương án

  • Yes ❌
    Sai vì: Phương án này cho rằng solution python script.py dataset1.csv là command hợp lệ để submit training job. Thực tế, lệnh này chỉ chạy script local, không tương tác với Azure ML workspace, không hỗ trợ parameter qua inputs, không chạy trên compute cluster (như AML Compute), và không ghi log metrics/models vào Experiments/Registry. Azure ML yêu cầu job definition đầy đủ (code, command, environment, inputs) qua SDK/CLI/Studio – không phải lệnh Python thuần. Điều này vi phạm best practices của command job từ Azure ML v2 (2022+).

  • No ✅
    Đúng vì: Solution không cung cấp command đúng để submit job vào workspace. Nó thiếu: (1) Định nghĩa inputs cho training_data (dùng Input(path=...) hoặc dataset URI); (2) Cú pháp ${{inputs.training_data}} trong command string; (3) Submit qua ml_client.create_or_update() hoặc CLI. Kết quả: Script có thể chạy local nhưng không phải "training job" trong Azure ML, không đạt goal "pass the path as a parameter value when submitting the script as a training job". Đây là lỗi phổ biến trong DP-100, nhấn mạnh sự khác biệt local vs. cloud job.

Câu 307
Note: This question is part of a series of questions that present the same scenario. Each question in the series contains a unique solution that might meet the stated goals. Some question sets might have more than one correct solution, while others might not have a correct solution.

After you answer a question in this section, you will NOT be able to return to it. As a result, these questions will not appear in the review screen.

You manage an Azure Machine Learning workspace. The Python script named script.py reads an argument named training_data. The training_data argument specifies the path to the training data in a file named dataset1.csv.

You plan to run the script.py Python script as a command job that trains a machine learning model.

You need to provide the command to pass the path for the dataset as a parameter value when you submit the script as a training job.

Solution: python script.py --training_data ${{inputs.training_data}}

Does the solution meet the goal?
  1. A Yes
  2. B No
Xem giải thích

🧩 Phân tích chi tiết câu hỏi trắc nghiệm

📘 Nội dung câu hỏi được giải thích rõ ràng:
Câu hỏi thuộc dạng "Does the solution meet the goal?" (Giải pháp có đạt được mục tiêu không?) trong chuỗi câu hỏi về Azure Machine Learning (Azure ML). Tình huống: Bạn đang quản lý một Azure Machine Learning workspace. Có một script Python tên script.py nhận tham số training_data (đường dẫn đến file dữ liệu huấn luyện dataset1.csv). Mục tiêu là chạy script này dưới dạng command job để huấn luyện mô hình ML, và cần cung cấp lệnh command để truyền đường dẫn dataset làm giá trị tham số khi submit job.

Giải pháp đề xuất:
python script.py --training_data ${{inputs.training_data}}

🛠️ Mục tiêu chính: Kiểm tra xem lệnh này có đúng cú pháp để inject (chèn) đường dẫn dataset từ input của command job trong Azure ML hay không. Đây là tính năng chuẩn của Azure ML SDK v2 (phiên bản mới nhất đến 2026), nơi ${{inputs.<tên_input>}} là template expression để tham chiếu động đến inputs được định nghĩa trong job.

✅ Đáp án đúng: Yes

Lý do lựa chọn:
Giải pháp này hoàn toàn đúng và đạt mục tiêu! Trong Azure ML command job (v2 SDK), khi submit job với inputs (ví dụ: một input dataset), bạn sử dụng cú pháp ${{inputs.training_data}} trong phần command để tự động thay thế bằng đường dẫn thực tế của input đó. Script sẽ nhận đúng argument --training_data với giá trị path đến dataset1.csv. Điều này được hỗ trợ đầy đủ trong phiên bản Azure ML mới nhất (2024-2026), giúp job chạy linh hoạt trong pipelines hoặc standalone jobs.
Ví dụ code submit job tương ứng:

from azure.ai.ml import command, Input

job = command(
    code="./src",
    command="python script.py --training_data ${{inputs.training_data}}",
    inputs={
        "training_data": Input(type="uri_file", path="azureml://datastores/.../dataset1.csv")
    }
)

🔍 Giải thích tất cả các phương án (giữ nguyên văn bản gốc bằng tiếng Anh):

  • Yes ✅
    Đúng vì cú pháp ${{inputs.training_data}} là template expression chuẩn của Azure ML v2 để reference inputs trong command line của command job. Nó đảm bảo đường dẫn dataset được inject động, script nhận đúng argument --training_data, và job huấn luyện thành công. Không có lỗi cú pháp hay thiếu sót nào.

  • No ❌
    Sai vì giải pháp không có vấn đề gì. Nếu chọn "No", bạn đang bỏ qua cú pháp chính thức của Azure ML (không phải AWS hay các nền tảng khác). Lệnh này sẽ fail chỉ nếu inputs không được định nghĩa đúng ở phần submit job, nhưng đề bài giả định context hợp lệ.

📚 Tài liệu tham khảo (cập nhật mới nhất đến 2026):

Câu 308
You are implementing hyperparameter tuning by using Bayesian sampling for an Azure ML Python SDK v2-based model training from a notebook. The notebook is in an Azure Machine Learning workspace. The notebook uses a training script that runs on a compute cluster with 20 nodes.

The code implements Bandit termination policy with slack_factor set to 0.2 and a sweep job with max_concurrent_trials set to 10.

You must increase effectiveness of the tuning process by improving sampling convergence.

You need to select which sampling convergence to use.

What should you select?
  1. A Set the value of max_concurrent_trials to 20.
  2. B Set the value of slack_factor of early_termination policy to 0.1.
  3. C Set the value of slack_factor of early_termination policy to 0.9.
  4. D Set the value of max_concurrent_trials to 4.
Xem giải thích

🧩 Phân tích chi tiết nội dung câu hỏi

Câu hỏi tập trung vào việc tối ưu hóa quy trình hyperparameter tuning trong Azure Machine Learning (Azure ML) Python SDK v2. Cụ thể:

  • Bạn đang triển khai Bayesian sampling (một phương pháp lấy mẫu nâng cao dựa trên mô hình thay thế như Gaussian Process hoặc Tree-structured Parzen Estimator - TPE) để tuning hyperparameters cho một mô hình huấn luyện từ notebook trong Azure ML workspace.
  • Script huấn luyện chạy trên compute cluster với 20 nodes (tức là có khả năng xử lý song song cao).
  • Đã áp dụng Bandit termination policy (chính sách chấm dứt sớm dựa trên Bandit algorithm) với slack_factor = 0.2 (giá trị này kiểm soát độ "lỏng lẻo" khi so sánh trial hiện tại với trial tốt nhất; slack_factor thấp hơn nghĩa là nghiêm ngặt hơn, dễ chấm dứt sớm hơn).
  • Sweep job có max_concurrent_trials = 10 (số lượng trial chạy đồng thời tối đa là 10).
  • Mục tiêu: Tăng hiệu quả tuning bằng cách cải thiện sampling convergence (làm cho quá trình hội tụ của Bayesian sampling nhanh và chính xác hơn).

Vấn đề cốt lõi 📈: Bayesian sampling hoạt động tốt nhất khi các trial được đánh giá tuần tự (sequential) hoặc ít song song, vì nó cần sử dụng kết quả của các trial trước để cập nhật mô hình thay thế (surrogate model), từ đó dự đoán hyperparameters tốt hơn cho trial tiếp theo. Nếu chạy quá nhiều trial đồng thời (concurrent cao), mô hình thay thế không cập nhật kịp thời, dẫn đến convergence kém. Với 20 nodes và concurrent=10, cần điều chỉnh để ưu tiên sequential hơn.

(Kiến thức dựa trên Azure ML SDK v2 mới nhất đến 2026: HyperDrive/sweep jobs hỗ trợ BayesianSampling qua BayesianSampling class, với khuyến nghị giảm max_concurrent_trials cho convergence tốt - tham khảo Azure ML docs: Hyperparameter tuning và Sweep configurations).

✅ Đáp án đúng và lý do lựa chọn

Đáp án đúng: Set the value of max_concurrent_trials to 4.

Lý do 🛠️:

  • Giảm max_concurrent_trials từ 10 xuống 4 làm cho quá trình tuning ít song song hơn, tăng tính tuần tự, giúp Bayesian sampling cập nhật surrogate model thường xuyên hơn sau mỗi trial hoàn thành. Điều này cải thiện convergence đáng kể vì mô hình có thể học từ kết quả trước đó nhanh chóng, tránh tình trạng "noise" từ nhiều trial kém chất lượng chạy cùng lúc.
  • Với 20 nodes, concurrent=4 vẫn tận dụng tài nguyên tốt nhưng ưu tiên chất lượng sampling (theo best practices Azure ML: concurrent nên <10% tổng trials hoặc thấp cho Bayesian).
  • Không ảnh hưởng đến Bandit policy, tập trung trực tiếp vào sampling convergence.

❌ Giải thích tất cả các phương án (đúng/sai)

  • Set the value of max_concurrent_trials to 20.
    ❌ Sai: Tăng concurrent lên 20 (tận dụng hết 20 nodes) làm tăng song song quá mức, khiến Bayesian sampling không cập nhật surrogate model kịp thời (chạy parallel nhiều → ít sequential → convergence kém hơn). Điều này làm giảm hiệu quả tuning, trái ngược mục tiêu.

  • Set the value of slack_factor of early_termination policy to 0.1.
    ❌ Sai: Giảm slack_factor xuống 0.1 (nghiêm ngặt hơn) chỉ tăng tốc chấm dứt sớm cho Bandit policy, giúp loại bỏ trial kém nhanh hơn nhưng không cải thiện sampling convergence. Bayesian vẫn cần sequential evaluation; thay đổi này có thể làm mất dữ liệu học cho surrogate model nếu chấm dứt quá sớm. Hơn nữa, code dùng "Bandit termination policy", không phải generic "early_termination".

  • Set the value of slack_factor of early_termination policy to 0.9.
    ❌ Sai: Tăng slack_factor lên 0.9 (lỏng lẻo hơn) làm Bandit ít chấm dứt sớm, kéo dài trial kém → tốn tài nguyên và thời gian, nhưng không tác động đến convergence của Bayesian sampling. Vẫn giữ vấn đề concurrent cao (10 trials), surrogate model không cập nhật tốt.

  • Set the value of max_concurrent_trials to 4.
    ✅ Đúng: Như giải thích ở trên, giảm concurrent trực tiếp cải thiện convergence bằng cách tăng sequential processing, phù hợp best practices cho Bayesian trong Azure ML v2 (2026 updates nhấn mạnh điều này cho large-scale sweeps).

Tài liệu tham khảo chính 📘:

Hy vọng phân tích này giúp bạn nắm vững! 🚀 Nếu cần code ví dụ, hãy hỏi thêm nhé!

Câu 309
You manage an Azure Machine Learning workspace.

You choose the uri_folder data type as an output of a pipeline component.

You need to define the data access mode that is supported by your configuration.

Which mode should you define?
  1. A eval_upload
  2. B rw_mount
  3. C download
  4. D ro_mount
Xem giải thích

🧩 Phân tích chi tiết nội dung câu hỏi

Câu hỏi tập trung vào Azure Machine Learning (Azure ML) workspace, cụ thể là việc quản lý pipeline components (các thành phần trong pipeline). Bạn đã chọn kiểu dữ liệu uri_folder làm output (đầu ra) của một pipeline component. Nhiệm vụ là xác định data access mode (chế độ truy cập dữ liệu) được hỗ trợ bởi cấu hình này.

📘 uri_folder là kiểu dữ liệu dùng để đại diện cho một thư mục dữ liệu (data folder) trong Azure ML datastore, thường lưu trữ dưới dạng URI (như Azure Blob Storage). Khi dùng làm output, component cần ghi dữ liệu (write) vào thư mục đó, nên chế độ truy cập phải hỗ trợ read-write để pipeline có thể tạo và cập nhật file/folder. Theo tài liệu Azure ML mới nhất (phiên bản SDK v2, cập nhật đến 2024-2026 qua Azure ML docs), outputs của uri_folder chỉ hỗ trợ chế độ rw_mount làm mặc định và duy nhất.

Nguồn tham khảo chính:

✅ Đáp án đúng: rw_mount

Lý do lựa chọn:

  • rw_mount (read-write mount) là chế độ duy nhất được hỗ trợ cho uri_folder output trong Azure ML pipelines. Nó cho phép component mount thư mục như một volume read-write, nghĩa là có thể đọc, ghi, tạo mới file/folder trực tiếp trong quá trình chạy pipeline. Điều này phù hợp hoàn hảo vì output cần ghi dữ liệu từ component ra datastore.
  • Không dùng chế độ khác vì Azure ML giới hạn outputs của uri_folder chỉ rw_mount để đảm bảo tính nhất quán và hiệu suất (tránh xung đột ghi đồng thời).
  • 🛠️ Ví dụ code minh họa (Azure ML SDK v2):
    output = Output(type="uri_folder", mode="rw_mount")
    

📋 Giải thích tất cả các phương án

Dưới đây là phân tích từng lựa chọn một cách chi tiết, với lý do đúng/sai dựa trên quy tắc Azure ML (không hỗ trợ lẫn lộn input/output modes cho uri_folder output):

  • eval_upload ❌ SAI: Chế độ này không tồn tại hoặc không hỗ trợ cho uri_folder output trong pipeline components. Nó có thể liên quan đến model evaluation uploads (như trong AutoML hoặc custom eval), nhưng không áp dụng cho data outputs thông thường. Sử dụng sẽ gây lỗi validation khi submit pipeline.

  • rw_mount ✅ ĐÚNG: Như đã giải thích ở trên, đây là chế độ chuẩn và duy nhất cho uri_folder output, hỗ trợ read-write mount để ghi dữ liệu hiệu quả từ component ra datastore. Đáp ứng yêu cầu "supported by your configuration".

  • download ❌ SAI: Chế độ download chỉ dùng cho inputs (đầu vào), tải dữ liệu về local compute trước khi xử lý. Không hỗ trợ cho outputs vì output cần ghi ra datastore, không phải tải về. Dùng cho output sẽ báo lỗi "mode not supported".

  • ro_mount ❌ SAI: ro_mount (read-only mount) dành cho inputs để mount thư mục chỉ đọc, tránh thay đổi dữ liệu gốc. Không hỗ trợ cho outputs vì output yêu cầu quyền ghi (write), ro_mount sẽ không cho phép tạo/sửa file → gây failure khi chạy pipeline.

🧩 Kết luận: Câu hỏi kiểm tra kiến thức sâu về data modes trong Azure ML pipelines. Luôn kiểm tra docs chính thức để tránh nhầm lẫn input/output! Nếu cần code sample đầy đủ, hãy hỏi thêm nhé 🚀.

Câu 310
Note: This question is part of a series of questions that present the same scenario. Each question in the series contains a unique solution that might meet the stated goals. Some question sets might have more than one correct solution, while others might not have a correct solution.

After you answer a question in this section, you will NOT be able to return to it. As a result, these questions will not appear in the review screen.

You manage an Azure Machine Learning workspace. The Python script named script.py reads an argument named training_data. The training_data argument specifies the path to the training data in a file named dataset1.csv.

You plan to run the script.py Python script as a command job that trains a machine learning model.

You need to provide the command to pass the path for the dataset as a parameter value when you submit the script as a training job.

Solution: python script.py --training_data dataset1.csv

Does the solution meet the goal?
  1. A Yes
  2. B No
Xem giải thích

🧩 Phân tích chi tiết nội dung câu hỏi

Câu hỏi thuộc dạng series questions trong kỳ thi chứng chỉ Azure (thường là AZ-400 hoặc DP-100), nơi mỗi câu trình bày một tình huống quản lý Azure Machine Learning workspace. Tình huống cụ thể:

  • Bạn có một script Python tên script.py, đọc tham số training_data (đường dẫn đến file dataset1.csv).
  • Mục tiêu: Chạy script này dưới dạng command job để huấn luyện mô hình ML, và cần cung cấp command để truyền đường dẫn dataset làm tham số khi submit job.

Giải pháp đề xuất (Solution): python script.py --training_data dataset1.csv
Câu hỏi: Giải pháp này có đạt mục tiêu không? (Yes/No)

📌 Lưu ý quan trọng: Trong Azure Machine Learning (phiên bản mới nhất v2, cập nhật đến 2026), command job KHÔNG được submit bằng cách chạy trực tiếp lệnh python trên local/terminal. Thay vào đó, phải sử dụng Azure ML SDK v2 (azure.ai.ml), CLI v2 (az ml job create), hoặc Azure ML Studio UI để định nghĩa job với inputs, command, environment, và compute. Lệnh đề xuất chỉ là chạy local script, không tích hợp với workspace Azure ML, nên KHÔNG truyền dữ liệu đúng cách (dataset phải là Input URI từ datastore/asset).

✅ Đáp án đúng: No

Lý do lựa chọn:
Giải pháp python script.py --training_data dataset1.csv KHÔNG đạt mục tiêu vì:

  • Đây chỉ là lệnh chạy local Python script, không submit job lên Azure ML workspace.
  • Trong Azure ML command job, command phải dùng placeholder như ${{inputs.training_data}} để bind với Input (uri_file/path từ Azure datastore). Ví dụ đúng:
    command="python script.py --training_data ${{inputs.training_data}}"
    inputs={"training_data": Input(path="azureml://datastores/.../dataset1.csv")}
    
  • Chạy local không tận dụng managed compute, scaling, tracking (MLflow), versioning dữ liệu. Phiên bản Azure ML v2 (2023-2026) yêu cầu SDK/CLI để đảm bảo reproducibility và integration.
    🛠️ Cách đúng: Sử dụng code SDK v2 hoặc az ml job create --file job.yml.

📋 Giải thích tất cả các phương án

✅ No (Đúng - Phương án đạt yêu cầu):
Giải pháp KHÔNG đáp ứng mục tiêu vì lệnh đề xuất chỉ chạy script cục bộ, không submit command job lên Azure ML workspace. Azure ML yêu cầu định nghĩa job đầy đủ với inputs, command template sử dụng placeholder (${{inputs.training_data}}), environment, và compute target. Nếu dùng local path trực tiếp, job sẽ fail khi scale lên cloud (không access được file). Điều này phù hợp với best practices Azure ML v2 để quản lý dữ liệu như MLflow Input hoặc Data Asset.

❌ Yes (Sai - Phương án không đạt yêu cầu):
Chọn "Yes" là sai vì bỏ qua cơ chế submit job của Azure ML. Lệnh python script.py --training_data dataset1.csv chỉ hoạt động local, không tích hợp workspace features như data versioning, auto-scaling compute, hoặc MLflow tracking. Trong context thi chứng chỉ, đây là "trap answer" giả định chạy local là đủ, nhưng goal rõ ràng là training job trên Azure ML.

📘 Tài liệu tham khảo