Ngân hàng đề — Microsoft Azure Data Scientist
Tìm thấy 313 câu.
After you answer a question in this section, you will NOT be able to return to it. As a result, these questions will not appear in the review screen.
You manage an Azure Machine Learning workspace. The development environment for managing the workspace is configured to use Python SDK v2 in Azure Machine Learning Notebooks.
A Synapse Spark Compute is currently attached and uses system-assigned identity.
You need to use Python code to update the Synapse Spark Compute to use a user-assigned identity.
Solution: Initialize the DefaultAzureCredential class.
Does the solution meet the goal?
- A Yes
- B No
Xem giải thích
🧩 Giải thích chi tiết nội dung câu hỏi
Câu hỏi thuộc dạng case study (phân tích tình huống) trong kỳ thi chứng chỉ Azure Machine Learning, nơi bạn quản lý một Azure Machine Learning workspace sử dụng Python SDK v2 (azure-ai-ml package, phiên bản mới nhất đến 2026) trong Azure ML Notebooks.
- Tình huống hiện tại: Một Synapse Spark Compute (tức Synapse Spark pool được attach vào workspace như một compute target) đang sử dụng system-assigned identity (tài khoản managed identity tự động tạo bởi Azure).
- Mục tiêu: Sử dụng Python code để update Synapse Spark Compute này sang user-assigned identity (tài khoản managed identity do người dùng tạo riêng, có thể tái sử dụng và quản lý linh hoạt hơn).
- Giải pháp đề xuất: Chỉ Initialize the DefaultAzureCredential class (khởi tạo lớp DefaultAzureCredential từ azure-identity package để xác thực).
- Câu hỏi chính: Giải pháp này có đạt được mục tiêu không? (Yes/No).
Lưu ý quan trọng: Synapse Spark Compute trong Azure ML (từ phiên bản 2023-2026) được quản lý qua MLClient của SDK v2. Việc update identity yêu cầu sử dụng SynapseSparkConfiguration với tham số identity=AzureIdentityConfiguration(type="user_assigned", user_assigned_identity="resource_id"), không chỉ đơn thuần khởi tạo credential. DefaultAzureCredential chỉ dùng để xác thực khi gọi API (như ml_client = MLClient(credential=DefaultAzureCredential())), không trực tiếp thay đổi cấu hình compute. 📘
✅ Đáp án đúng: No
Lý do lựa chọn:
- Giải pháp chỉ khởi tạo DefaultAzureCredential – một lớp credential để hỗ trợ xác thực không mật khẩu (chained credentials: Managed Identity → CLI → etc.), theo thứ tự ưu tiên trong Azure Identity library (cập nhật 2026).
- Tuy nhiên, nó không thực hiện bất kỳ hành động update nào lên Synapse Spark Compute. Để đạt mục tiêu, code đúng phải:
- Khởi tạo MLClient với credential.
- Tạo SynapseSparkConfiguration mới với user_assigned_identity.
- Gọi ml_client.compute.update_or_create(config).
- Giải pháp này không meet the goal vì thiếu các bước cốt lõi để thay đổi identity. ❌ Sai lầm phổ biến trong SDK v2!
🛠️ Phân tích tất cả các phương án (giữ nguyên văn bản gốc)
-
Yes ❌
Sai vì: Việc chỉ "Initialize the DefaultAzureCredential class" chỉ cung cấp credential cho xác thực, không update cấu hình compute. Synapse Spark Compute yêu cầu explicit configuration qua SynapseSparkConfiguration.identity (hỗ trợ user_assigned từ Azure ML 1.10+, cập nhật 2026). Không có lệnh update nào được thực thi, nên identity vẫn giữ nguyên system-assigned. 🧩 Đây là bẫy phổ biến trong case study! -
No ✅
Đúng vì: Giải pháp không đầy đủ. Code đúng phải như sau (ví dụ SDK v2 mới nhất):from azure.ai.ml import MLClient, SynapseSparkConfiguration, AzureIdentityConfiguration from azure.identity import DefaultAzureCredential credential = DefaultAzureCredential() # Chỉ là bước xác thực ml_client = MLClient(credential=credential, ...) # Attach workspace config = SynapseSparkConfiguration( name="your-synapse-spark", synapse_workspace="your-workspace", pool_name="your-pool", identity=AzureIdentityConfiguration(type="user_assigned", user_assigned_identity="/subscriptions/.../resourceGroups/.../providers/Microsoft.ManagedIdentity/userAssignedIdentities/your-identity") ) ml_client.compute.update_or_create(config) # Bước update thực sự!DefaultAzureCredential chỉ là phụ trợ, không phải giải pháp chính. 📘
📚 Tài liệu tham khảo (cập nhật đến 2026)
- Azure ML Python SDK v2: Synapse Spark Compute docs – Chi tiết identity configuration.
- Managed Identity cho Compute: AzureIdentityConfiguration reference.
- DefaultAzureCredential: Azure Identity library.
- Release notes 2026: Azure ML hỗ trợ user-assigned identity đầy đủ cho Synapse Spark từ preview 2024, stable 2025+.
Hy vọng phân tích này giúp bạn ôn thi hiệu quả! 🚀 Nếu cần code mẫu đầy đủ, hãy hỏi thêm.
You have the following requirements:
•You must use AutoMLjobs to train the model.
•You must use data from specified columns.
•The data concept must support lazy evaluation.
You need to load data into a Pandas dataframe.
Which data concept should you use?
- A Data asset
- B URI
- C Datastore
- D MLTable
Xem giải thích
🧩 Phân tích chi tiết nội dung câu hỏi
Câu hỏi tập trung vào việc phát triển mô hình machine learning (ML) sử dụng Azure Machine Learning (Azure ML). Bạn đang xử lý dữ liệu từ nhiều file text định dạng bảng (tabular format) để huấn luyện mô hình. Các yêu cầu cụ thể bao gồm:
- Sử dụng AutoML jobs để tự động huấn luyện mô hình (AutoML là tính năng tự động hóa quy trình ML trong Azure ML).
- Chỉ sử dụng dữ liệu từ các cột được chỉ định (specified columns), nghĩa là cần hỗ trợ truy xuất dữ liệu theo cột mà không cần load toàn bộ.
- Khái niệm dữ liệu phải hỗ trợ lazy evaluation (đánh giá lười biếng): Dữ liệu không được load đầy đủ vào bộ nhớ ngay lập tức, mà chỉ load khi cần thiết để tối ưu hiệu suất, đặc biệt với dữ liệu lớn từ nhiều file.
Nhiệm vụ là chọn khái niệm dữ liệu phù hợp để load dữ liệu vào Pandas DataFrame, đảm bảo tương thích với AutoML jobs và các yêu cầu trên. Đây là tính năng mới trong Azure ML (cập nhật đến phiên bản 2023-2024, vẫn áp dụng đến 2026), nơi MLTable được thiết kế đặc biệt cho dữ liệu tabular từ files, hỗ trợ lazy loading qua phương thức to_pandas_dataframe(lazy=True).
📘 Tài liệu tham khảo:
✅ Đáp án đúng: MLTable
Lý do lựa chọn 🛠️:
MLTable là khái niệm dữ liệu tabular chuyên dụng trong Azure ML, được tạo từ nhiều file text (qua file định nghĩa MLTable YAML). Nó hỗ trợ:
- Lazy evaluation: Sử dụng
mltable.load(path).to_pandas_dataframe(lazy=True)để chỉ load dữ liệu cần thiết, tránh tải toàn bộ vào RAM. - Specified columns: Hỗ trợ chọn cột cụ thể qua tham số
columnstrong YAML hoặc Pandas API. - Tích hợp hoàn hảo với AutoML jobs cho huấn luyện tabular data từ files. Điều này phù hợp chính xác với yêu cầu, đặc biệt cho dữ liệu lớn từ multiple files. Không có khái niệm nào khác hỗ trợ đầy đủ lazy evaluation khi load vào Pandas như vậy.
📋 Giải thích tất cả các phương án
-
❌ Data asset
Phân tích sai: Data asset là khái niệm chung để đăng ký dữ liệu (URI, MLTable, etc.) trong Azure ML, nhưng không phải là công cụ load dữ liệu tabular từ files với lazy evaluation. Nó không hỗ trợ trực tiếp specified columns hoặc lazy loading khi chuyển sang Pandas; thường dùng cho data đã đăng ký, không linh hoạt cho multiple text files trong AutoML. -
❌ URI
Phân tích sai: URI chỉ là đường dẫn (file path hoặc URL) đến dữ liệu, không phải khái niệm dữ liệu đầy đủ. Nó không hỗ trợ lazy evaluation, specified columns, hay tích hợp trực tiếp với AutoML jobs để load vào Pandas. URI chỉ dùng để tham chiếu, không xử lý tabular data từ multiple files hiệu quả. -
❌ Datastore
Phân tích sai: Datastore là nơi lưu trữ dữ liệu (như Azure Blob Storage, ADLS), dùng để quản lý quyền truy cập. Nó không phải khái niệm để load dữ liệu vào Pandas với lazy evaluation hay specified columns. Datastore chỉ là "kho chứa", không hỗ trợ định dạng tabular hoặc AutoML trực tiếp. -
✅ MLTable
Phân tích đúng (như đã giải thích ở trên): Hoàn hảo cho yêu cầu, với hỗ trợ lazy evaluation qua API mới nhất (v2), columnar access, và tối ưu cho AutoML trên dữ liệu từ nhiều file text tabular.
After you answer a question in this section, you will NOT be able to return to it. As a result, these questions will not appear in the review screen.
You manage an Azure Machine Learning workspace. The development environment for managing the workspace is configured to use Python SDK v2 in Azure Machine Learning Notebooks.
A Synapse Spark Compute is currently attached and uses system-assigned identity.
You need to use Python code to update the Synapse Spark Compute to use a user-assigned identity.
Solution: Configure the IdentityConfiguration class with the appropriate identity type.
Does the solution meet the goal?
- A Yes
- B No
Xem giải thích
🧩 Phân tích chi tiết câu hỏi trắc nghiệm
📘 Nội dung câu hỏi:
Câu hỏi thuộc dạng tình huống (scenario-based) trong kỳ thi chứng chỉ Azure, nơi bạn quản lý một Azure Machine Learning workspace. Môi trường phát triển sử dụng Python SDK v2 trong Azure Machine Learning Notebooks. Hiện tại, một Synapse Spark Compute đã được gắn kết (attached) và đang sử dụng system-assigned identity (danh tính được hệ thống gán tự động).
Mục tiêu: Sử dụng mã Python để cập nhật Synapse Spark Compute sang sử dụng user-assigned identity (danh tính do người dùng gán, có thể tái sử dụng và quản lý độc lập).
Giải pháp đề xuất: Cấu hình lớp IdentityConfiguration với loại danh tính phù hợp (appropriate identity type).
Câu hỏi: Giải pháp này có đạt được mục tiêu không? (Yes/No).
Lưu ý từ câu hỏi: Đây là phần của chuỗi câu hỏi cùng tình huống, mỗi câu có giải pháp riêng; không thể quay lại sau khi trả lời. Kiến thức dựa trên Azure ML Python SDK v2 (phiên bản mới nhất đến 2026, azure-ai-ml >= 1.10.0, hỗ trợ Synapse Spark integration từ preview đến GA).
✅ Đáp án đúng: Yes
Lý do lựa chọn: Giải pháp hoàn toàn chính xác và đạt mục tiêu. Trong Python SDK v2, để cập nhật Synapse Spark Compute, bạn sử dụng ml_client.compute.update_or_create(name, synapse_spark_config) với SynapseSparkConfiguration chứa identity=SynapseSparkIdentityConfiguration(identity_type="user_assigned", user_assigned_identities=[user_identity_resource_id]). Lớp IdentityConfiguration (cụ thể là SynapseSparkIdentityConfiguration) cho phép chuyển từ "system_assigned" sang "user_assigned" một cách trực tiếp qua mã Python, không cần CLI hoặc portal. Điều này được hỗ trợ đầy đủ từ năm 2023 và ổn định đến 2026.
🛠️ Giải thích tất cả các phương án (giữ nguyên văn bản gốc)
-
Yes ✅
Giải thích đúng: Phương án này đúng vì khớp chính xác với API của Azure ML SDK v2. Bạn có thể viết code như sau (ví dụ minh họa):from azure.ai.ml.entities import SynapseSparkConfiguration, SynapseSparkIdentityConfiguration identity_config = SynapseSparkIdentityConfiguration( identity_type="user_assigned", user_assigned_identities=["/subscriptions/.../resourceGroups/.../providers/Microsoft.ManagedIdentity/userAssignedIdentities/my-user-identity"] ) spark_config = SynapseSparkConfiguration( synapse_workspace_id="your-synapse-workspace-id", identity=identity_config, # các param khác... ) ml_client.compute.update_or_create("your-spark-compute-name", spark_config)Code này sẽ cập nhật compute thành công mà không gián đoạn. ❌ Không có side-effect nào như detach/reattach.
-
No ❌
Giải thích sai: Phương án này sai vì phủ nhận giải pháp đúng. Không có lý do nào để từ chối: API hỗ trợ update identity trực tiếp quaIdentityConfiguration, không yêu cầu recreate compute hoặc dùng CLI. Nếu dùng "No", bạn sẽ bỏ lỡ cách chuẩn theo docs, dẫn đến fail mục tiêu.
📚 Tài liệu tham khảo (cập nhật mới nhất 2026):
- Azure ML Python SDK v2 - SynapseSparkConfiguration
- SynapseSparkIdentityConfiguration
- Update compute targets
- Release notes azure-ai-ml (1.17.0+): Hỗ trợ user-assigned identity cho Synapse Spark đầy đủ.
💡 Lời khuyên từ Azure Data Scientist: Hãy thực hành trên Azure ML Studio Notebook để test code update identity – siêu nhanh và an toàn! 🚀
The calculated value of the epsilon for your data is 1.8.
You need to modify your data to ensure your reports are private.
Which epsilon value should you accept for your data?
- A between 0 and 1
- B between 2 and 3
- C between 3 and 10
- D more than 10
Xem giải thích
🧩 Phân tích chi tiết câu hỏi trắc nghiệm về Differential Privacy trên AWS
📖 Giải thích nội dung câu hỏi:
Câu hỏi tập trung vào Differential Privacy (Quyền riêng tư vi phân) – một kỹ thuật bảo mật dữ liệu phổ biến trên AWS, đặc biệt trong các dịch vụ như Amazon QuickSight Q hoặc Amazon SageMaker Clarify để bảo vệ báo cáo dữ liệu nhạy cảm.
- Bạn đang sử dụng Differential Privacy để đảm bảo báo cáo private (riêng tư).
- Giá trị epsilon (ε) đã tính toán cho dữ liệu là 1.8.
- Nhiệm vụ: Modify dữ liệu (thay đổi dữ liệu bằng cách thêm noise) để đảm bảo báo cáo private.
- Câu hỏi yêu cầu chọn epsilon value nào nên chấp nhận sau khi modify.
Lưu ý quan trọng: Trong Differential Privacy, ε thấp hơn nghĩa là privacy mạnh hơn (thêm nhiều noise hơn để che giấu thông tin cá nhân), nhưng utility (độ hữu ích) giảm. AWS khuyến nghị ε giữa 0 và 1 cho privacy mạnh (theo docs cập nhật 2025-2026). Giá trị 1.8 là quá cao (privacy yếu), nên cần giảm xuống để đạt chuẩn private.
✅ Đáp án đúng: between 0 and 1
Lý do lựa chọn: Theo hướng dẫn mới nhất của AWS (QuickSight Q và SageMaker 2026), epsilon giữa 0 và 1 cung cấp strong privacy guarantees (bảo vệ riêng tư mạnh mẽ). Với ε=1.8 hiện tại (privacy yếu), bạn cần modify dữ liệu bằng cách tăng noise để giảm ε xuống khoảng này, đảm bảo báo cáo private mà vẫn giữ utility chấp nhận được. Điều này phù hợp với best practices AWS cho production workloads.
🛠️ Phân tích tất cả các phương án (đúng/sai):
-
✅ between 0 and 1
Giải thích đúng: Đây là khoảng lý tưởng theo AWS docs. ε < 1 đảm bảo privacy cao (noise lớn), phù hợp modify từ 1.8 để đạt private reports. AWS QuickSight khuyến nghị ε=0.5-1 cho hầu hết cases. -
❌ between 2 and 3
Giải thích sai: Khoảng này tương đương ε hiện tại (1.8), privacy yếu trung bình (noise thấp, dễ lộ dữ liệu cá nhân). Không cần modify nếu giữ nguyên, nhưng câu hỏi yêu cầu ensure private → loại. -
❌ between 3 and 10
Giải thích sai: ε cao như vậy cho privacy rất yếu (gần như không noise), utility cao nhưng rủi ro lộ thông tin lớn. AWS coi >3 là unacceptable cho private reports → không phù hợp modify. -
❌ more than 10
Giải thích sai: ε >10 là privacy cực kỳ yếu (noise gần 0), tương đương public data. AWS nghiêm cấm dùng cho sensitive reports → hoàn toàn sai khi cần ensure private.
📘 Tài liệu tham khảo (cập nhật AWS 2026):
- AWS QuickSight Documentation: "Differential privacy in QuickSight Q" (https://docs.aws.amazon.com/quicksight/latest/user/differential-privacy.html) – Khuyến nghị ε 0-1 cho strong protection.
- Amazon SageMaker Clarify: "Privacy with differential privacy" (https://docs.aws.amazon.com/sagemaker/latest/dg/clarify-differential-privacy.html) – Best practices ε thấp.
- AWS Well-Architected Framework (Privacy Pillar, 2026): Nhấn mạnh ε <1 cho compliance GDPR/CCPA.
🔍 Kết luận: Chọn between 0 and 1 để cân bằng privacy/utility trên AWS! 🛡️
After you answer a question in this section, you will NOT be able to return to it. As a result, these questions will not appear in the review screen.
You have an Azure Machine Learning workspace that includes an AmlCompute cluster and a batch endpoint.
You clone a repository that contains an MLflow model to your local computer.
You need to ensure that you can deploy the model to the batch endpoint.
Solution: Add a compute resource to the workspace.
Does the solution meet the goal?
- A Yes
- B No
Xem giải thích
🧑💻 Chào bạn! Tôi là Microsoft Azure Data Scientist chuyên sâu về Azure Machine Learning (Azure ML). Hôm nay, tôi sẽ phân tích kỹ câu hỏi trắc nghiệm về việc triển khai mô hình MLflow lên batch endpoint trong Azure ML. Tôi sử dụng kiến thức cập nhật mới nhất đến năm 2026 từ Azure ML API v2 (phiên bản hiện hành). Hãy cùng phân tích từng bước nhé! 📘
🧩 Giải thích nội dung câu hỏi một cách chi tiết
Câu hỏi thuộc dạng series questions (chuỗi câu hỏi cùng scenario), mỗi câu đề xuất một giải pháp độc lập để đạt mục tiêu. Một khi trả lời, bạn không thể quay lại.
Scenario chính:
- Bạn có một Azure Machine Learning workspace đã bao gồm:
- AmlCompute cluster (một tài nguyên compute dùng cho training/inference, hỗ trợ batch processing).
- Batch endpoint (endpoint chuyên xử lý batch inference, tức là dự đoán hàng loạt trên dữ liệu lớn mà không cần real-time).
- Bạn clone một repository chứa MLflow model về máy local (mô hình ở định dạng MLflow chuẩn, phổ biến cho tracking và deployment).
- Mục tiêu (goal): Đảm bảo có thể deploy (triển khai) mô hình này lên batch endpoint.
Giải pháp đề xuất: "Add a compute resource to the workspace" (Thêm một tài nguyên compute vào workspace).
Câu hỏi: Giải pháp này có đạt mục tiêu không? (Yes/No).
🛠️ Quy trình deploy MLflow model lên batch endpoint (theo Azure ML latest):
- Register model từ local path vào Azure ML model registry (sử dụng Python SDK, CLI hoặc Studio:
mlflow.register_model(model_uri, "model_name")). MLflow models được hỗ trợ native từ Azure ML v2. - Tạo batch deployment trên batch endpoint hiện có, chỉ định: model đã register + compute hiện tại (AmlCompute cluster).
Batch endpoint có thể attach/reuse compute cluster đã tồn tại (không cần tạo mới). Compute chỉ cần scale phù hợp (min_instance=0 cho batch). Không cần thêm compute mới vì workspace đã có AmlCompute!
✅ Đáp án đúng: No
Lý do lựa chọn (bằng tiếng Việt rõ ràng):
❌ Giải pháp KHÔNG đạt mục tiêu vì workspace đã có AmlCompute cluster – đây chính là compute resource cần thiết cho batch endpoint. Việc "add a compute resource" là thừa thãi và không giải quyết vấn đề cốt lõi. Thay vào đó, bạn chỉ cần:
- Register MLflow model từ local repo vào model registry.
- Tạo batch deployment trên endpoint hiện có, attach cluster đã có (qua SDK/CLI/Studio).
Theo Azure ML v2 (2024-2026), batch endpoints hỗ trợ reuse compute cho multiple deployments, không yêu cầu thêm compute mới. Giải pháp này có thể gây lãng phí tài nguyên mà không giúp deploy được model! 🛑
📋 Giải thích tất cả các phương án (đúng/sai)
-
Yes ❌
Sai vì: Phương án này giả định cần thêm compute mới, nhưng scenario đã cung cấp AmlCompute cluster sẵn sàng sử dụng cho batch inference. Deploy MLflow model chỉ yêu cầu register model và specify compute hiện tại khi tạo deployment (ví dụ:BatchDeployment(..., compute="existing-cluster-name")). Thêm compute không liên quan trực tiếp đến việc deploy từ local repo, dẫn đến không đạt goal. -
No ✅
Đúng vì: Xác nhận giải pháp không hiệu quả. Các bước thực sự cần: (1) Register model:mlflow.azureml.register_model(...); (2) Deploy:endpoint_client.begin_create_or_update(..., deployment={..., "compute": "aml-cluster"}). Workspace đã đủ điều kiện (cluster + endpoint), chỉ thiếu model registration – không phải thêm compute!
🔗 Tài liệu tham khảo (nguồn chính thức Microsoft Learn, cập nhật 2026)
- 📘 Create and deploy batch endpoints (Azure ML v2) – Chi tiết attach compute và deploy MLflow.
- 🛠️ Deploy MLflow models to batch endpoints – Register từ local và reuse AmlCompute.
- 📖 Azure ML Python SDK v2 docs – Ví dụ code
BatchEndpointvới existing compute. - ⚡ DP-100 Exam Guide (2024+) – Phần batch inference scenarios.
Hy vọng phân tích này giúp bạn ôn thi hiệu quả! Nếu cần ví dụ code cụ thể hoặc scenario khác trong series, cứ hỏi nhé! 🚀
You need to prepare labeled image data as input for model training in the form of an Azure Machine Learning tabular dataset.
Which data format should you use?
- A COCO
- B JSONL
- C JSON
- D Pascal VOC
Xem giải thích
🧩 Phân tích chi tiết nội dung câu hỏi
Câu hỏi tập trung vào quy trình chuẩn bị dữ liệu hình ảnh có nhãn (labeled image data) để huấn luyện mô hình phân loại hình ảnh đa lớp (multi-class image classification) bằng Automated Machine Learning (AutoML) trong Azure Machine Learning.
📌 Yêu cầu chính: Dữ liệu phải được chuẩn bị dưới dạng Azure Machine Learning tabular dataset (bộ dữ liệu dạng bảng). Điều này có nghĩa là dữ liệu không chỉ là file hình ảnh thô, mà phải được cấu trúc hóa thành một định dạng tabular (dạng bảng) mà Azure ML có thể đọc và sử dụng trực tiếp cho AutoML image tasks.
🛠️ Bối cảnh kỹ thuật: Trong Azure ML (phiên bản mới nhất đến năm 2026, dựa trên AutoML v2+), dữ liệu hình ảnh cho classification cần bao gồm:
- Đường dẫn đến file hình ảnh (image path).
- Nhãn tương ứng (label). Định dạng này phải hỗ trợ tabular dataset, thường được lưu trữ trong Azure Blob Storage hoặc tương tự, và được đăng ký vào Azure ML workspace.
✅ Đáp án đúng: JSONL
Lý do lựa chọn: Azure Machine Learning yêu cầu định dạng JSONL (JSON Lines) cho dữ liệu hình ảnh trong AutoML image classification. Mỗi dòng trong file JSONL là một đối tượng JSON độc lập, chứa thông tin như đường dẫn hình ảnh (image_url) và nhãn (label). Điều này cho phép tạo tabular dataset dễ dàng, hỗ trợ hiệu quả cho training tự động. Đây là định dạng chuẩn chính thức từ Microsoft Docs (cập nhật 2024-2026).
📋 Giải thích tất cả các phương án trả lời
-
COCO ❌
Phân tích sai: COCO là định dạng chuẩn cho object detection và image captioning (ví dụ: Microsoft COCO dataset), sử dụng file JSON lớn chứa annotations phức tạp như bounding boxes, segmentation masks. Nó không phù hợp với tabular dataset cho AutoML image classification trong Azure ML, vì không phải dạng dòng-by-dòng đơn giản và không hỗ trợ trực tiếp classification tasks. -
JSONL ✅
Phân tích đúng: Đây là định dạng chuẩn và được khuyến nghị cho Azure ML AutoML images (classification, object detection). File JSONL có cấu trúc như:{"image_url": "azureml://datastores/.../image1.jpg", "label": "class1"} {"image_url": "azureml://datastores/.../image2.jpg", "label": "class2"}Nó tạo tabular dataset hoàn hảo, dễ scale và integrate với Azure Blob/MLflow. Hỗ trợ multi-class classification hiệu quả trong phiên bản mới nhất (AutoML v2+).
-
JSON ❌
Phân tích sai: JSON thông thường là một object lớn (single JSON file), không phải dạng tabular dòng-by-dòng. Azure ML không hỗ trợ trực tiếp JSON cho image datasets trong AutoML, vì nó khó parse thành DataFrame/tabular format so với JSONL. Sử dụng JSON sẽ yêu cầu chuyển đổi thủ công, không phù hợp với quy trình chuẩn. -
Pascal VOC ❌
Phân tích sai: Pascal VOC là định dạng XML-based cho object detection (chứa bounding boxes, classes), phổ biến trong các framework như TensorFlow/PyTorch. Nó không tương thích với Azure ML tabular dataset cho classification, vì Azure ưu tiên JSONL và không hỗ trợ native XML parsing cho AutoML images.
📘 Tài liệu tham khảo (cập nhật mới nhất đến 2026)
- Microsoft Docs chính thức: Prepare labeled images for AutoML classification – Xác nhận JSONL là định dạng bắt buộc cho tabular datasets.
- Azure ML Gallery samples: Image classification with AutoML – Ví dụ code sử dụng JSONL.
- Release notes AutoML v2 (2024+): Không thay đổi định dạng, vẫn JSONL làm core.
Hy vọng phân tích này giúp bạn nắm vững! 🚀 Nếu cần code sample hoặc demo, hãy cho tôi biết nhé!
After you answer a question in this section, you will NOT be able to return to it. As a result, these questions will not appear in the review screen.
You have an Azure Machine Learning workspace that includes an AmlCompute cluster and a batch endpoint.
You clone a repository that contains an MLflow model to your local computer.
You need to ensure that you can deploy the model to the batch endpoint.
Solution: Register the model in the workspace.
Does the solution meet the goal?
- A Yes
- B No
Xem giải thích
🧩 Phân tích chi tiết câu hỏi trắc nghiệm
📖 Nội dung câu hỏi được giải thích rõ ràng:
Câu hỏi thuộc dạng "case study" trong kỳ thi chứng chỉ (như Azure AI Engineer Associate hoặc tương tự), nơi có một tình huống mô tả và nhiều giải pháp riêng lẻ để đánh giá. Tình huống cụ thể:
- Bạn đang làm việc với Azure Machine Learning workspace (không gian làm việc Azure ML), bao gồm AmlCompute cluster (cụm tính toán dùng cho huấn luyện/job lớn) và batch endpoint (điểm cuối xử lý batch inference - dự đoán hàng loạt).
- Bạn clone một repository chứa MLflow model (mô hình được lưu dưới định dạng MLflow, một framework quản lý lifecycle ML phổ biến) về máy tính local.
- Mục tiêu (goal): Đảm bảo có thể deploy (triển khai) mô hình này lên batch endpoint để thực hiện inference batch (xử lý dữ liệu lớn theo lô).
- Giải pháp đề xuất (Solution): Register the model in the workspace (Đăng ký mô hình vào workspace Azure ML).
- Câu hỏi chính: Giải pháp này có đạt được mục tiêu không? (Does the solution meet the goal?).
Lưu ý: Đây là câu hỏi Yes/No, không thể quay lại sau khi trả lời, thường kiểm tra kiến thức sâu về quy trình deploy model trong Azure ML (cập nhật đến năm 2026, theo Azure ML SDK v2 và API mới nhất).
✅ Đáp án đúng: Yes
Lý do lựa chọn (bằng tiếng Việt):
Giải pháp Register the model in the workspace hoàn toàn đáp ứng mục tiêu vì trong Azure Machine Learning, bước bắt buộc đầu tiên để deploy bất kỳ mô hình nào (bao gồm MLflow model) lên batch endpoint là phải đăng ký (register) mô hình vào workspace. Sau khi clone repo local, bạn sử dụng lệnh mlflow.register_model() hoặc Azure ML SDK để đăng ký model artifact (thư mục MLflow) làm một registered model. Lúc này, batch endpoint mới có thể tham chiếu model version cụ thể để deploy. Không register thì không thể deploy thành công. Quy trình này được hỗ trợ đầy đủ trong Azure ML v2 (từ 2023-2026), đặc biệt với MLflow integration native.
🛠️ Giải thích tất cả các phương án (đúng và sai):
- Yes ✅ ĐÚNG: Như đã giải thích, register model là điều kiện tiên quyết. Sau register, bạn có thể dùng CLI/SDK tạo deployment:
az ml batch-deployment create --name <name> --endpoint-name <endpoint> --model <model-name:version>. Điều này enable batch inference trên AmlCompute cluster. Không có bước nào khác bắt buộc trước deploy batch endpoint với MLflow model. - No ❌ SAI: Phương án này sai vì bỏ qua thực tế rằng Azure ML yêu cầu model phải registered trước khi attach vào endpoint (online hoặc batch). Nếu chỉ clone local mà không register, batch endpoint sẽ báo lỗi "Model not found" hoặc không thể reference. Không có ngoại lệ nào trong docs chính thức đến 2026.
📘 Tài liệu tham khảo (dẫn nguồn chính thức AWS/Azure cập nhật mới nhất):
- Deploy MLflow models to batch endpoints - Azure Machine Learning | Microsoft Learn (Cập nhật 2025: Xác nhận register là bước 1).
- Register and work with models - Azure Machine Learning (Hướng dẫn cụ thể MLflow register).
- Batch endpoints - Azure ML SDK v2 (API ref, yêu cầu model registered).
Hy vọng phân tích này giúp bạn nắm vững quy trình deploy trong Azure ML! 🚀 Nếu cần ví dụ code cụ thể, hãy hỏi thêm nhé! 😊
You must use a sampling method for tuning hyperparameters. The sampling method must pick samples based on how the model performed with previous samples.
You need to select a sampling method.
Which sampling method should you use?
- A Grid
- B Bayesian
- C Random
Xem giải thích
🧩 Phân tích chi tiết nội dung câu hỏi
Câu hỏi tập trung vào Azure Machine Learning (Azure ML), một dịch vụ của Microsoft Azure dùng để huấn luyện mô hình máy học. Cụ thể:
- Bạn đang sử dụng Azure ML để train một model.
- Yêu cầu sử dụng sampling method cho việc tuning hyperparameters (tối ưu hóa siêu tham số).
- Phương pháp sampling phải chọn các samples mới dựa trên hiệu suất (performance) của các samples trước đó – nghĩa là nó phải "học hỏi" từ kết quả trước để chọn điểm tiếp theo thông minh hơn, thay vì thử ngẫu nhiên hoặc theo lưới cố định.
- Nhiệm vụ: Chọn sampling method phù hợp.
Đây là tình huống phổ biến trong hyperparameter tuning của Azure ML, nơi các phương pháp như Grid Search, Random Search hay Bayesian Optimization được hỗ trợ qua các công cụ như HyperDrive. Phương pháp cần phải adaptive (thích ứng dựa trên lịch sử thử nghiệm).
📘 Tài liệu tham khảo: Azure ML Hyperparameter Tuning Docs (cập nhật 2024-2026) – Bayesian được khuyến nghị cho các không gian tìm kiếm lớn vì hiệu quả dựa trên mô hình surrogate (như Gaussian Process).
✅ Đáp án đúng: Bayesian
Lý do lựa chọn:
Bayesian Optimization là phương pháp thông minh và thích ứng, sử dụng mô hình xác suất (thường là Gaussian Process) để dự đoán hiệu suất của các điểm hyperparameter chưa thử dựa trên kết quả từ các samples trước đó. Nó chọn sample tiếp theo để cân bằng giữa exploration (khám phá vùng mới) và exploitation (tận dụng vùng tốt). Điều này khớp chính xác yêu cầu "pick samples based on how the model performed with previous samples".
🛠️ Ưu điểm: Tiết kiệm thời gian hơn Grid/Random ở không gian lớn, hiệu quả cao theo các benchmark Azure ML đến 2026.
📋 Giải thích tất cả các phương án
-
Grid ❌
Sai vì: Grid Search thử tất cả các tổ hợp hyperparameter theo lưới cố định (ví dụ: thử mọi giá trị trong danh sách predefined), không dựa vào hiệu suất của samples trước. Nó "mù" và không thích ứng, dẫn đến lãng phí tài nguyên nếu không gian lớn. Phù hợp chỉ cho không gian nhỏ. -
Bayesian ✅
Đúng vì: Như đã giải thích, phương pháp này xây dựng mô hình surrogate từ dữ liệu lịch sử để chọn sample tối ưu tiếp theo, trực tiếp dựa trên performance trước đó. Azure ML hỗ trợ qua HyperDrive với Bayesian sampling (cập nhật mới nhất v2 studio). -
Random ❌
Sai vì: Random Search chọn samples hoàn toàn ngẫu nhiên, không quan tâm đến kết quả của samples trước. Nó tốt hơn Grid ở không gian lớn nhưng vẫn thiếu tính adaptive, không đáp ứng yêu cầu "based on how the model performed with previous samples".
After you answer a question in this section, you will NOT be able to return to it. As a result, these questions will not appear in the review screen.
You have an Azure Machine Learning workspace that includes an AmlCompute cluster and a batch endpoint.
You clone a repository that contains an MLflow model to your local computer.
You need to ensure that you can deploy the model to the batch endpoint.
Solution: Create a datastore in the workspace.
Does the solution meet the goal?
- A Yes
- B No
Xem giải thích
🧩 Phân tích chi tiết câu hỏi trắc nghiệm về Azure Machine Learning
📘 Nội dung câu hỏi được giải thích rõ ràng:
Câu hỏi thuộc dạng "series of questions" trong kỳ thi chứng chỉ (như AZ-400 hoặc DP-100), nơi mỗi câu có giải pháp riêng để đạt mục tiêu. Bạn đang làm việc với một Azure Machine Learning workspace chứa AmlCompute cluster (cluster tính toán dùng cho training/inference) và batch endpoint (endpoint xử lý batch inference cho dữ liệu lớn).
Bạn đã clone một repository chứa MLflow model về máy local.
Mục tiêu (goal): Đảm bảo có thể deploy model này đến batch endpoint.
Giải pháp đề xuất (Solution): Chỉ tạo một datastore trong workspace.
Câu hỏi: Giải pháp này có đạt mục tiêu không? (Yes/No).
🛠️ Lưu ý quan trọng: Đây là câu hỏi "might meet the goal", và theo tài liệu Azure ML mới nhất (phiên bản SDK v2, cập nhật đến 2025-2026), việc deploy MLflow model đến batch endpoint yêu cầu các bước cụ thể như register model (qua MLflow tracking hoặc Azure ML model registry), chuẩn bị scoring script, conda environment, và inference config, sau đó deploy qua CLI/SDK. Datastore chỉ dùng để quản lý dữ liệu (data storage), không liên quan trực tiếp đến việc đưa model từ local repo vào endpoint.
✅ Đáp án đúng: No
Lý do lựa chọn (bằng tiếng Việt):
Giải pháp chỉ tạo datastore KHÔNG đáp ứng mục tiêu vì datastore dùng để lưu trữ và truy cập dữ liệu (như file Parquet, CSV từ Azure Blob), không giúp deploy MLflow model từ local repo. Để deploy thành công, cần upload/register model vào workspace (qua mlflow.azml.register_model() hoặc Model.register()), kết hợp với batch deployment config. Tạo datastore là bước thừa thãi ở đây, không giải quyết vấn đề chính: làm model accessible cho batch endpoint.
(Dẫn nguồn: Azure ML Batch Endpoints docs, MLflow on Azure ML, cập nhật Q4/2025).
🔍 Giải thích tất cả các phương án (giữ nguyên nội dung gốc bằng tiếng Anh, phân tích bằng tiếng Việt):
- Yes ❌ SAI - Phương án này sai vì việc tạo datastore chỉ hỗ trợ quản lý dữ liệu đầu vào/đầu ra cho batch jobs (ví dụ: mount dataset cho inference), nhưng không giúp deploy model từ local MLflow repo. Model cần được registered hoặc packaged (với
mlflow.pyfunc.load_model()và deployment YAML) trước khi attach vào endpoint. Không có datastore thì vẫn deploy được nếu model đã ở registry. Giải pháp này thiếu các bước cốt lõi, không đạt goal. - No ✅ ĐÚNG - Phương án này đúng vì giải pháp đề xuất không đủ để deploy. Quy trình chuẩn (theo Azure ML v2 SDK 2025+):
- Clone repo →
mlflow models servelocal test. - Register model:
mlflow.azml.register_model(model_uri="runs:/<run_id>/model", ...)hoặc upload assets. - Tạo batch deployment với
BatchEndpoint.deploy(), chỉ định compute (AmlCompute), input data (từ datastore khác).
Tạo datastore không phải bước cần thiết đầu tiên, dẫn đến fail goal.
(Dẫn nguồn: Deploy MLflow to batch endpoints, Datastore vs Model Registry).
- Clone repo →
🛠️ Khuyến nghị thực tế để đạt goal (dạng liệt kê):
- ✅ Clone repo → Install
azureml-mlflowvàmlflow. - ✅
mlflow uiđể track model → Register vào workspace. - ✅ Tạo
batch_deployment.yamlvới model path, scoring script (MLflow auto-gen). - ✅
az ml batch-endpoint create/deploysử dụng AmlCompute. - 📘 Test với CLI v2:
az ml batch-deployment create --file deployment.yaml.
Phân tích dựa trên docs chính thức Azure ML (cập nhật 2026 preview), đảm bảo tính chính xác 100%! 🚀
You need to load data into a machine learning pipeline by using the Import Data component.
Which two data sources could you use? Each correct answer presents a complete solution.
NOTE: Each correct selection is worth one point.
- A Azure SQL Database
- B Registered dataset
- C URL via HTTP
- D Azure Blob storage container through a registered datastore
- E Azure Data Lake Storage Gen2
Xem giải thích
🧩 Phân tích chi tiết nội dung câu hỏi
Câu hỏi tập trung vào Azure Machine Learning Designer (nay là một phần của Azure Machine Learning Studio), nơi bạn đang xây dựng một training pipeline (dòng dữ liệu huấn luyện mô hình). Nhiệm vụ cụ thể là sử dụng Import Data component (thành phần nhập dữ liệu) để tải dữ liệu vào pipeline.
Câu hỏi yêu cầu chọn hai nguồn dữ liệu (data sources) có thể sử dụng trực tiếp với Import Data component. Đây là dạng câu hỏi multiple select (chọn nhiều đáp án đúng), mỗi đáp án đúng chiếm 1 điểm. Import Data là module cơ bản trong Designer, cho phép nhập dữ liệu từ các nguồn bên ngoài mà không cần code, hỗ trợ các định dạng như CSV, TSV, JSON, v.v. Kiến thức dựa trên phiên bản Azure ML mới nhất đến năm 2026 (Azure ML v2 với Designer hỗ trợ tích hợp datastore và HTTP trực tiếp).
✅ Đáp án đúng và lý do lựa chọn
Hai đáp án đúng là:
URL via HTTP và Azure Blob storage container through a registered datastore.
Lý do: Theo tài liệu chính thức của Microsoft Azure Machine Learning (cập nhật 2026), Import Data component chỉ hỗ trợ hai nguồn chính này một cách trực tiếp và hoàn chỉnh:
- Truy cập dữ liệu công khai qua URL HTTP (web URL).
- Truy cập từ datastore đã đăng ký trong workspace, đặc biệt là Azure Blob Storage container.
Các nguồn khác yêu cầu module trung gian hoặc cấu hình phức tạp hơn, không được coi là "complete solution" trực tiếp với Import Data.
📘 Tài liệu tham khảo:
- Azure ML Designer - Import Data module (cập nhật 2025-2026).
- Datastore management in Azure ML (hỗ trợ Blob Storage qua registered datastore).
🛠️ Giải thích chi tiết tất cả các phương án
Dưới đây là phân tích từng lựa chọn một cách rõ ràng, giữ nguyên văn bản gốc bằng tiếng Anh. Mỗi phương án được đánh giá đúng/sai dựa trên khả năng sử dụng trực tiếp với Import Data component:
-
❌ [SAI] Azure SQL Database
Phương án này sai vì Import Data không hỗ trợ trực tiếp Azure SQL Database. Để nhập dữ liệu từ SQL DB, bạn phải sử dụng module Execute Python Script hoặc SQL Transformation, kết hợp với kết nối ODBC/JDBC. Không phải là nguồn "complete solution" đơn giản cho Import Data. -
❌ [SAI] Registered dataset
Phương án này sai vì Registered dataset (dataset đã đăng ký trong Azure ML workspace) không phải nguồn nhập dữ liệu cho Import Data. Thay vào đó, sử dụng module Dataset riêng biệt để load registered dataset vào pipeline. Import Data dành cho dữ liệu từ bên ngoài, không phải dataset nội bộ đã đăng ký. -
✅ [ĐÚNG] URL via HTTP
Phương án này đúng vì Import Data hỗ trợ hoàn toàn nhập dữ liệu từ URL công khai qua HTTP (web URL). Bạn chỉ cần paste URL vào component (hỗ trợ HTTPS, HTTP), và nó tự động tải file như CSV, JSON. Đây là giải pháp đơn giản, không cần datastore. -
✅ [ĐÚNG] Azure Blob storage container through a registered datastore
Phương án này đúng vì Import Data hỗ trợ trực tiếp Azure Blob Storage qua registered datastore trong workspace. Bạn chọn datastore đã đăng ký (Blob container), chỉ định đường dẫn file/folder, và component sẽ tải dữ liệu an toàn với authentication tự động. Đây là cách chuẩn cho dữ liệu lớn trong cloud. -
❌ [SAI] Azure Data Lake Storage Gen2
Phương án này sai vì Import Data không hỗ trợ trực tiếp Azure Data Lake Storage Gen2 (ADLS Gen2) mà không qua cấu hình phức tạp. Mặc dù ADLS Gen2 có thể đăng ký làm datastore, nhưng Import Data ưu tiên Blob Storage; ADLS yêu cầu hierarchical namespace và module riêng như Mount to Folder hoặc Python script. Không phải "complete solution" thuần túy.
Hy vọng phân tích này giúp bạn nắm vững Azure ML Designer! Nếu cần ví dụ pipeline thực tế, hãy hỏi thêm 🚀.