Ngân hàng đề — Microsoft Azure Data Scientist

Tìm thấy 313 câu.

Câu 71
You need to consider the underlined segment to establish whether it is accurate.
To improve the amount of low incidence cases in a dataset, you should make use of the SMOTE module.
Select `No adjustment required` if the underlined segment is accurate. If the underlined segment is inaccurate, select the accurate option.
  1. A No adjustment required.
  2. B Remove Duplicate Rows
  3. C Join Data
  4. D Edit Metadata
Xem giải thích

🧩 Phân tích nội dung câu hỏi

Câu hỏi yêu cầu đánh giá tính chính xác của đoạn văn bản được gạch chân (underlined segment):
"To improve the amount of low incidence cases in a dataset, you should make use of the SMOTE module."

  • Low incidence cases đề cập đến các trường hợp lớp thiểu số (minority class) trong tập dữ liệu mất cân bằng (imbalanced dataset), nơi một lớp có số lượng mẫu rất ít so với lớp khác.
  • SMOTE module là module Synthetic Minority Over-sampling Technique trong Azure Machine Learning Designer (Azure ML Studio), dùng để tạo ra các mẫu tổng hợp (synthetic samples) cho lớp thiểu số nhằm tăng số lượng mẫu của chúng, giúp cải thiện hiệu suất mô hình học máy.
  • Nhiệm vụ: Nếu đoạn gạch chân chính xác, chọn No adjustment required. Nếu không chính xác, chọn lựa chọn thay thế phù hợp.
  • Bối cảnh: Đây là câu hỏi kiểm tra kiến thức về xử lý dữ liệu mất cân bằng trong Azure ML (không phải AWS thuần túy, nhưng liên quan đến các công cụ ML tương tự). Kiến thức cập nhật đến năm 2026 vẫn giữ nguyên chức năng SMOTE trong Azure ML Designer phiên bản mới nhất (v5+), hỗ trợ oversampling cho binary/multiclass classification.

✅ Đáp án đúng: No adjustment required

Lý do lựa chọn:
Đoạn gạch chân hoàn toàn chính xác! 🛠️ SMOTE module chính là công cụ chuẩn trong Azure ML để tăng số lượng low incidence cases bằng cách tạo mẫu giả lập từ các mẫu thiểu số hiện có (kết hợp interpolation giữa các điểm dữ liệu gần nhau). Điều này giúp cân bằng dataset mà không làm mất thông tin gốc, cải thiện độ chính xác mô hình (như F1-score cho lớp thiểu số). Không cần chỉnh sửa gì cả!

📋 Giải thích tất cả các phương án

  • ✅ No adjustment required
    Đúng vì SMOTE chính xác là giải pháp để tăng low incidence cases. Module này được thiết kế dành riêng cho việc oversampling lớp thiểu số, hỗ trợ percentage từ 100-1000% (cập nhật Azure ML 2026).

  • ❌ Remove Duplicate Rows
    Sai vì module này chỉ xóa các hàng trùng lặp trong dataset, giúp làm sạch dữ liệu nhưng không tăng số lượng low incidence cases (thậm chí có thể làm giảm nếu có trùng lặp ở lớp thiểu số). Không liên quan đến oversampling!

  • ❌ Join Data
    Sai vì module này dùng để kết hợp (join) hai dataset dựa trên cột khóa chung (inner/left/right join), nhằm mở rộng dữ liệu nhưng không tự động tạo mẫu mới cho lớp thiểu số. Nó chỉ merge dữ liệu có sẵn, không giải quyết imbalance trực tiếp.

  • ❌ Edit Metadata
    Sai vì module này chỉ chỉnh sửa metadata (nhãn cột, loại dữ liệu, vai trò label/feature), giúp chuẩn hóa schema dataset nhưng hoàn toàn không ảnh hưởng đến số lượng mẫu low incidence cases. Không tạo dữ liệu mới!

📘 Tài liệu tham khảo

  • Azure ML Documentation (Microsoft, cập nhật 2026): SMOTE Module – Chi tiết cách SMOTE oversample minority class.
  • Azure ML Designer Reference (2026): Tune Model Hyperparameters with SMOTE – Ví dụ xử lý imbalanced data.
  • Nguồn bổ sung: AWS SageMaker tương tự có SMOTE qua scikit-learn, nhưng câu hỏi tập trung Azure ML (SMOTE module native).

Hy vọng phân tích này giúp bạn nắm vững! 🚀 Nếu cần demo code Azure ML, hãy hỏi thêm nhé!

Câu 72 Chọn nhiều đáp án
You use the Azure Machine Learning Python SDK to define a pipeline that consists of multiple steps.
When you run the pipeline, you observe that some steps do not run. The cached output from a previous run is used instead.
You need to ensure that every step in the pipeline is run, even if the parameters and contents of the source directory have not changed since the previous run.
What are two possible ways to achieve this goal? Each correct answer presents a complete solution.
NOTE: Each correct selection is worth one point.
  1. A Use a PipelineData object that references a datastore other than the default datastore.
  2. B Set the regenerate_outputs property of the pipeline to True.
  3. C Set the allow_reuse property of each step in the pipeline to False.
  4. D Restart the compute cluster where the pipeline experiment is configured to run.
  5. E Set the outputs property of each step in the pipeline to True.
Xem giải thích

🧩 Giải thích nội dung câu hỏi

Câu hỏi này thuộc về Azure Machine Learning (Azure ML) Python SDK, tập trung vào việc quản lý pipeline (dòng xử lý) với nhiều bước (steps). Khi chạy pipeline, một số bước không thực thi mà sử dụng cached output (kết quả lưu cache từ lần chạy trước) nếu inputs, parameters và source code không thay đổi. Mục tiêu là buộc mọi bước phải chạy lại hoàn toàn, ngay cả khi không có thay đổi. Câu hỏi yêu cầu hai cách khả thi (mỗi cách đúng được 1 điểm), dựa trên tính năng caching của Azure ML pipelines (cập nhật đến phiên bản mới nhất năm 2026, nơi caching vẫn dựa trên hash của inputs/parameters/source để tối ưu hiệu suất).

✅ Đáp án đúng và lý do lựa chọn

Hai đáp án đúng là:

  • Set the regenerate_outputs property of the pipeline to True.
  • Set the allow_reuse property of each step in the pipeline to False.

Lý do:
🛠️ Azure ML sử dụng cơ chế caching/reuse để tránh chạy lại các bước không thay đổi, giúp tiết kiệm thời gian và tài nguyên. Để buộc chạy lại:

  • regenerate_outputs=True trên pipeline sẽ force regenerate tất cả outputs, bỏ qua cache toàn bộ pipeline.
  • allow_reuse=False trên từng step sẽ tắt reuse/cache cho step đó, đảm bảo step luôn chạy mới.
    Cả hai cách đều là giải pháp hoàn chỉnh, độc lập theo tài liệu chính thức Azure ML (v2 SDK).

📋 Giải thích chi tiết tất cả các phương án

Dưới đây là phân tích từng lựa chọn, giữ nguyên văn bản gốc bằng tiếng Anh:

  • ❌ Use a PipelineData object that references a datastore other than the default datastore.
    Sai vì: Thay đổi datastore chỉ ảnh hưởng đến vị trí lưu trữ dữ liệu, không liên quan đến cơ chế caching/reuse. Cache vẫn dựa trên hash của inputs/parameters/source, không bị ảnh hưởng bởi datastore khác. Không giải quyết vấn đề buộc chạy lại steps.

  • ✅ Set the regenerate_outputs property of the pipeline to True.
    Đúng vì: Thuộc tính này trên Pipeline object buộc regenerate tất cả outputs, bỏ qua cache từ lần chạy trước. Hoàn hảo cho trường hợp cần chạy toàn bộ pipeline mới, ngay cả khi không thay đổi gì (xem docs Azure ML v2).

  • ✅ Set the allow_reuse property of each step in the pipeline to False.
    Đúng vì: Thuộc tính allow_reuse=False trên từng PipelineStep tắt cơ chế reuse/cache cho step cụ thể. Mọi step sẽ luôn chạy lại, độc lập với pipeline level. Đây là cách granular (chi tiết) nhất để kiểm soát.

  • ❌ Restart the compute cluster where the pipeline experiment is configured to run.
    Sai vì: Restart cluster chỉ reset tài nguyên compute (như AmlCompute), nhưng cache metadata vẫn tồn tại trong Azure ML workspace. Pipeline sẽ vẫn dùng cache cũ từ lịch sử run trước, không buộc chạy lại steps.

  • ❌ Set the outputs property of each step in the pipeline to True.
    Sai vì: outputs là dictionary định nghĩa output ports (như PipelineData), không phải boolean property. Không có thuộc tính outputs=True để kiểm soát cache; việc set này không ảnh hưởng đến reuse mechanism.

📘 Tài liệu tham khảo

Hy vọng phân tích này giúp bạn hiểu rõ! 🚀 Nếu cần code ví dụ, hãy hỏi thêm nhé!

Câu 73
You are creating a machine learning model. You have a dataset that contains null rows.
You need to use the Clean Missing Data module in Azure Machine Learning Studio to identify and resolve the null and missing data in the dataset.
Which parameter should you use?
  1. A Replace with mean
  2. B Remove entire column
  3. C Remove entire row
  4. D Hot Deck
  5. E Custom substitution value
  6. F Replace with mode
Xem giải thích

🧩 Giải thích nội dung câu hỏi

Câu hỏi tập trung vào việc xử lý dữ liệu thiếu (null và missing data) trong Azure Machine Learning Studio (phiên bản classic). Bạn đang xây dựng một mô hình machine learning với dataset chứa null rows (các hàng có giá trị null). Nhiệm vụ là sử dụng module Clean Missing Data để identify (xác định) và resolve (giải quyết) các giá trị null/missing này. Câu hỏi yêu cầu chọn parameter phù hợp nhất trong module này.

Module Clean Missing Data cho phép các chiến lược xử lý missing values như thay thế, xóa hàng/cột, hoặc imputation nâng cao. Vì vấn đề cụ thể là null rows (hàng bị null), cần một phương pháp trực tiếp loại bỏ hoặc xử lý toàn bộ hàng để giữ dataset sạch mà không làm méo dữ liệu. Đây là kỹ thuật phổ biến trong data preprocessing cho ML, giúp tránh bias từ imputation không phù hợp. (Kiến thức dựa trên Azure ML Studio classic, cập nhật đến 2026 vẫn giữ nguyên chức năng cốt lõi).

📘 Tài liệu tham khảo:

✅ Đáp án đúng: Remove entire row

  • Lý do lựa chọn: Parameter này xóa toàn bộ hàng chứa bất kỳ giá trị null/missing nào, trực tiếp giải quyết vấn đề null rows mà câu hỏi đề cập. Nó identify missing data bằng cách quét toàn bộ dataset và resolve bằng cách loại bỏ hàng, đảm bảo dataset sạch sẽ cho training ML model. Phương pháp này đơn giản, nhanh chóng, phù hợp khi số lượng null rows không quá lớn (tránh mất dữ liệu quan trọng). Trong thực tế Azure ML, đây là lựa chọn chuẩn cho trường hợp missing values rải rác ở hàng, giúp model tránh lỗi NaN runtime. ✅

🛠️ Giải thích tất cả các phương án

Dưới đây là phân tích chi tiết từng lựa chọn, đánh dấu đúng hoặc sai dựa trên ngữ cảnh null rows và chức năng module Clean Missing Data:

  • ❌ [SAI] Replace with mean
    Phương án này thay thế missing values bằng giá trị trung bình (mean) của cột. Nó phù hợp cho dữ liệu số liên tục nhưng không giải quyết null rows toàn diện, vì chỉ thay thế từng cell riêng lẻ. Nếu cả hàng null, mean có thể tạo bias (kéo lệch phân phối dữ liệu), không phải lựa chọn tối ưu cho identify/resolve rows.

  • ❌ [SAI] Remove entire column
    Parameter xóa toàn bộ cột chứa missing values. Điều này sai vì tập trung vào cột, không xử lý null rows (hàng). Nếu null chỉ ở vài hàng, việc xóa cột sẽ mất toàn bộ thông tin cột, gây mất mát dữ liệu lớn và làm dataset kém chất lượng cho ML.

  • ✅ [ĐÚNG] Remove entire row
    (Như đã giải thích ở trên: Xóa toàn bộ hàng null, trực tiếp resolve vấn đề, an toàn và hiệu quả). 🏆

  • ❌ [SAI] Hot Deck
    Đây là phương pháp imputation Hot Deck (thay thế missing bằng giá trị từ hàng tương tự trong dataset). Nó phức tạp, dùng cho dữ liệu categorical/survey, nhưng không dành cho null rows đơn giản. Trong Azure ML, nó có thể chậm và không identify rõ rows như xóa trực tiếp, dễ gây overfitting nếu dataset nhỏ.

  • ❌ [SAI] Custom substitution value
    Thay thế missing bằng giá trị tùy chỉnh (do user chỉ định, như 0 hoặc "Unknown"). Phương án này thiếu linh hoạt cho null rows, vì phải set value thủ công cho từng loại dữ liệu, dễ introduce bias (ví dụ: thay null bằng 0 làm lệch mean). Không phải cách identify/resolve tự động tốt nhất.

  • ❌ [SAI] Replace with mode
    Thay thế bằng giá trị mode (phổ biến nhất) của cột, phù hợp categorical data. Nhưng sai cho null rows vì chỉ xử lý từng cell, có thể làm mất tính đa dạng dữ liệu (over-represent mode), không giải quyết triệt để hàng null như xóa row.

Kết luận: Chọn Remove entire row để preprocessing nhanh, sạch sẽ trước khi train model! Nếu dataset lớn, kết hợp với Pandas trong Azure ML Designer (phiên bản mới 2026) để kiểm tra tỷ lệ missing trước khi xóa. 🚀

Câu 74
You train a model and register it in your Azure Machine Learning workspace. You are ready to deploy the model as a real-time web service.
You deploy the model to an Azure Kubernetes Service (AKS) inference cluster, but the deployment fails because an error occurs when the service runs the entry script that is associated with the model deployment.
You need to debug the error by iteratively modifying the code and reloading the service, without requiring a re-deployment of the service for each code update.
What should you do?
  1. A Modify the AKS service deployment configuration to enable application insights and re-deploy to AKS.
  2. B Create an Azure Container Instances (ACI) web service deployment configuration and deploy the model on ACI.
  3. C Add a breakpoint to the first line of the entry script and redeploy the service to AKS.
  4. D Create a local web service deployment configuration and deploy the model to a local Docker container.
  5. E Register a new version of the model and update the entry script to load the new version of the model from its registered path.
Xem giải thích

🧩 Giải thích nội dung câu hỏi

Câu hỏi xoay quanh tình huống debug lỗi trong entry script khi triển khai mô hình Machine Learning từ Azure Machine Learning workspace lên Azure Kubernetes Service (AKS) inference cluster.

  • Bạn đã huấn luyện và đăng ký mô hình thành công trong workspace.
  • Triển khai dưới dạng real-time web service (dịch vụ web thời gian thực) lên AKS thất bại do lỗi trong entry script (script đầu vào xử lý request khi dịch vụ chạy).
  • Yêu cầu chính: Debug bằng cách chỉnh sửa code lặp lại (iteratively modifying) và reload dịch vụ mà KHÔNG cần re-deploy toàn bộ service mỗi lần (tránh tốn thời gian và chi phí deploy lên cloud).

Mục tiêu là tìm cách test/debug nhanh chóng, cục bộ trước khi deploy chính thức lên AKS. Đây là best practice trong Azure ML để troubleshoot entry script (score.py hoặc tương tự). 📘

✅ Đáp án đúng

Create a local web service deployment configuration and deploy the model to a local Docker container.

Lý do lựa chọn:

  • Phương án này cho phép triển khai cục bộ (local deployment) sử dụng Docker container trên máy local, giúp chỉnh sửa entry script ngay lập tức và restart container nhanh chóng mà không cần re-deploy lên AKS (chỉ mất vài giây thay vì hàng phút/giờ).
  • Azure ML hỗ trợ LocalDeployment qua SDK (python/cli), tích hợp Docker để simulate môi trường production giống AKS.
  • Sau khi debug xong, bạn có thể apply code đã fix trực tiếp lên deployment AKS mà không thay đổi model. Đây là cách hiệu quả nhất theo docs Azure ML 2024-2026. 🛠️🚀

📋 Giải thích tất cả các phương án

Dưới đây là phân tích chi tiết từng lựa chọn, giữ nguyên văn bản gốc tiếng Anh. Tôi đánh dấu ✅/❌ và giải thích lý do đúng/sai dựa trên tính năng Azure ML mới nhất (v4 SDK, hỗ trợ AKS v1.5+ inference clusters đến 2026).

  • [SAI] Modify the AKS service deployment configuration to enable application insights and re-deploy to AKS.
    ❌ Giải thích sai: Application Insights chỉ giúp monitor logs/telemetry sau khi deploy thành công, không hỗ trợ chỉnh sửa code lặp lại mà không re-deploy. Bạn vẫn phải re-deploy mỗi lần thay đổi config, vi phạm yêu cầu "without requiring a re-deployment". Không giải quyết gốc rễ entry script error. 🕵️‍♂️

  • [SAI] Create an Azure Container Instances (ACI) web service deployment configuration and deploy the model on ACI.
    ❌ Giải thích sai: ACI phù hợp test nhanh hơn AKS (scale nhanh, rẻ hơn), nhưng vẫn yêu cầu re-deploy đầy đủ mỗi lần chỉnh sửa entry script (upload image mới). Không hỗ trợ iterative debug/reload cục bộ, chỉ là "deploy khác cluster" chứ không tránh re-deployment. ACI dùng cho staging, không phải local debug. ⚠️

  • [SAI] Add a breakpoint to the first line of the entry script and redeploy the service to AKS.
    ❌ Giải thích sai: Breakpoint chỉ hữu ích trong IDE (như VS Code), nhưng trên AKS (containerized), bạn không attach debugger trực tiếp mà không customize image phức tạp. Hơn nữa, vẫn yêu cầu re-deploy mỗi lần, không iterative/reload nhanh. Không khả thi cho production AKS. 🐛

  • [ĐÚNG] Create a local web service deployment configuration and deploy the model to a local Docker container.
    ✅ Giải thích đúng (như phần trên): Local Docker deployment qua LocalWebservice.deploy() hoặc CLI az ml model deploy --target local cho phép edit entry script live, restart container ngay (docker restart), test endpoint localhost:port. Hoàn hảo cho debug iterative, sau đó push fix lên AKS. Hỗ trợ full environment giống production (conda/docker). 🌟

  • [SAI] Register a new version of the model and update the entry script to load the new version of the model from its registered path.
    ❌ Giải thích sai: Việc register model version mới không fix entry script error (lỗi ở code script, không phải model artifact). Bạn vẫn phải re-deploy service để load version mới, và entry script vẫn lỗi nếu không edit. Phức tạp hóa vấn đề, không iterative. 📦

📚 Tài liệu tham khảo

  • Azure ML Docs (cập nhật 2026): Troubleshoot model deployment – Phần "Debug entry script locally with Docker".
  • Local Deployment Guide: Deploy to local – Code sample với LocalWebservice.
  • AKS Best Practices: Deploy to AKS – Khuyến nghị test local trước.
  • SDK v2 (Python): from azure.ai.ml.entities import LocalDeployment (phiên bản mới nhất 1.17+).

Hy vọng phân tích giúp bạn nắm rõ! Nếu cần code sample cụ thể, hãy hỏi thêm nhé. 😊

Câu 75 Chọn nhiều đáp án
You are a data scientist building a deep convolutional neural network (CNN) for image classification.
The CNN model you build shows signs of overfitting.
You need to reduce overfitting and converge the model to an optimal fit.
Which two actions should you perform? Each correct answer presents a complete solution.
NOTE: Each correct selection is worth one point.
  1. A Add an additional dense layer with 512 input units.
  2. B Add L1/L2 regularization.
  3. C Use training data augmentation.
  4. D Reduce the amount of training data.
  5. E Add an additional dense layer with 64 input units.
Xem giải thích

🧠 Phân tích câu hỏi trắc nghiệm bởi Microsoft Azure Data Scientist

🧩 Nội dung câu hỏi được giải thích chi tiết:
Câu hỏi này mô tả tình huống một data scientist đang xây dựng mô hình deep convolutional neural network (CNN) để thực hiện nhiệm vụ phân loại hình ảnh (image classification). Mô hình CNN đã được xây dựng nhưng đang gặp vấn đề overfitting – tức là mô hình học quá tốt trên dữ liệu huấn luyện (training data) nhưng hiệu suất kém trên dữ liệu kiểm tra (test data), dẫn đến không tổng quát hóa tốt. Nhiệm vụ yêu cầu chọn hai hành động (actions) để giảm overfitting và giúp mô hình converge đến optimal fit (hội tụ về mức độ phù hợp tối ưu). Đây là câu hỏi trắc nghiệm kiểu multiple correct answers (mỗi đáp án đúng đáng 1 điểm), thường xuất hiện trong các kỳ thi chứng chỉ AWS như AWS Certified Machine Learning - Specialty.
📘 Lưu ý: Overfitting là vấn đề phổ biến trong deep learning, đặc biệt với CNN trên dữ liệu hình ảnh hạn chế. Giải pháp tập trung vào việc tăng độ tổng quát hóa (generalization) mà không làm giảm capacity của mô hình một cách không cần thiết. Kiến thức dựa trên các thực hành tốt nhất AWS SageMaker và TensorFlow/Keras cập nhật đến 2026 (không có thay đổi lớn về regularization/data aug trong các version mới nhất).

✅ Đáp án đúng và lý do lựa chọn:
Hai đáp án đúng là:
🛠️ Add L1/L2 regularization – Thêm regularization L1 (Lasso: penalize absolute weights) hoặc L2 (Ridge: penalize squared weights) vào loss function giúp giảm độ phức tạp của mô hình bằng cách phạt các trọng số lớn, ngăn chặn overfitting mà vẫn giữ khả năng học. Điều này thúc đẩy mô hình hội tụ ổn định hơn đến optimal fit.
🛠️ Use training data augmentation – Sử dụng kỹ thuật mở rộng dữ liệu huấn luyện (data augmentation) như xoay, lật, thay đổi độ sáng hình ảnh để tạo ra các biến thể dữ liệu mới từ dataset gốc. Điều này tăng kích thước và đa dạng dữ liệu hiệu quả, giúp mô hình học các đặc trưng tổng quát hơn, giảm overfitting đáng kể – đặc biệt hiệu quả cho CNN trên image data.

🧩 Giải thích chi tiết tất cả các phương án (đúng/sai):
Dưới đây là phân tích từng lựa chọn một cách rõ ràng, giữ nguyên văn bản gốc tiếng Anh. Tôi đánh dấu ✅ đúng hoặc ❌ sai, kèm lý do bằng tiếng Việt dựa trên nguyên tắc machine learning hiện đại (AWS/TensorFlow 2026).

  • Add an additional dense layer with 512 input units.
    ❌ Sai: Việc thêm một lớp dense (fully connected) với 512 units sẽ tăng đáng kể số lượng tham số (parameters), làm mô hình phức tạp hơn và dễ dẫn đến overfitting nặng hơn, vì nó tăng capacity học thuộc lòng dữ liệu train mà không cải thiện generalization. Không giúp converge optimal fit.

  • Add L1/L2 regularization.
    ✅ Đúng: Như đã giải thích, L1/L2 regularization thêm penalty term vào loss function (ví dụ: λ * ||weights||), giúp sparse weights và kiểm soát variance, giảm overfitting hiệu quả. Đây là kỹ thuật chuẩn trong Keras/TensorFlow trên AWS SageMaker, khuyến nghị cho CNN.

  • Use training data augmentation.
    ✅ Đúng: Data augmentation (qua ImageDataGenerator trong Keras hoặc SageMaker Data Wrangler) tạo dữ liệu mới on-the-fly, tăng effective dataset size lên gấp nhiều lần, giúp CNN học invariant features (kháng nhiễu). Giảm overfitting lên đến 20-50% trong thực tế image tasks.

  • Reduce the amount of training data.
    ❌ Sai: Giảm dữ liệu huấn luyện sẽ làm mô hình thiếu thông tin, dẫn đến underfitting hoặc overfitting nghiêm trọng hơn (vì model dễ memorize dữ liệu ít ỏi). Hoàn toàn ngược lại với nguyên tắc "more data is better" trong deep learning.

  • Add an additional dense layer with 64 input units.
    ❌ Sai: Tương tự phương án đầu, thêm lớp dense với 64 units vẫn tăng parameters (dù nhỏ hơn), làm model sâu hơn và phức tạp hơn, dễ gây overfitting ở CNN (đặc biệt nếu đặt sau convolutional layers). Không phải giải pháp regularization thực sự.

📘 Tài liệu tham khảo:

Hy vọng phân tích này giúp bạn nắm vững! Nếu cần code demo trên Azure ML Studio hoặc AWS SageMaker, hãy cho tôi biết nhé 🚀.

Câu 76
You are planning to host practical training to acquaint learners with data visualization creation using Python. Learner devices are able to connect to the internet.
Learner devices are currently NOT configured for Python development. Also, learners are unable to install software on their devices as they lack administrator permissions. Furthermore, they are unable to access Azure subscriptions.
It is imperative that learners are able to execute Python-based data visualization code.
Which of the following actions should you take?
  1. A You should consider configuring the use of Azure Container Instance.
  2. B You should consider configuring the use of Azure BatchAI.
  3. C You should consider configuring the use of Azure Notebooks.
  4. D You should consider configuring the use of Azure Kubernetes Service.
Xem giải thích

🧩 Phân tích chi tiết nội dung câu hỏi

Câu hỏi mô tả tình huống tổ chức buổi đào tạo thực hành về tạo biểu đồ dữ liệu (data visualization) bằng Python cho học viên. Các điều kiện cụ thể:

  • Thiết bị của học viên có kết nối internet.
  • Thiết bị chưa được cấu hình phát triển Python và học viên không có quyền admin để cài đặt phần mềm (như Python, Jupyter, libraries).
  • Học viên không thể truy cập Azure subscriptions (không có tài khoản Azure đầy đủ).
  • Yêu cầu bắt buộc: Học viên phải có thể chạy mã Python tạo data visualization ngay lập tức, không cần cài đặt cục bộ.

Mục tiêu là chọn giải pháp cloud-based, không yêu cầu cài đặt local, không cần subscription Azure đầy đủ, cho phép chạy Jupyter notebooks/Python trực tiếp qua trình duyệt. Đây là kịch bản lý tưởng cho môi trường đào tạo nhanh chóng, serverless và dễ tiếp cận. 📱✨

✅ Đáp án đúng và lý do lựa chọn

Đáp án đúng: You should consider configuring the use of Azure Notebooks.

Lý do (dựa trên kiến thức Azure cập nhật đến 2026):
Azure Notebooks (nay tích hợp vào Azure Machine Learning Studio và Jupyter ecosystem với hỗ trợ free tier) là dịch vụ Jupyter notebooks hosted hoàn toàn trên cloud Microsoft, cho phép:

  • Chạy Python code trực tiếp qua trình duyệt web, không cần cài đặt Python/Anaconda/Jupyter local.
  • Hỗ trợ data visualization libraries như Matplotlib, Seaborn, Plotly mà không cần admin rights.
  • Không yêu cầu Azure subscription đầy đủ – có thể sử dụng tài khoản Microsoft cá nhân (free tier) hoặc public notebooks từ Microsoft Learn/GitHub.
  • Learners chỉ cần internet để truy cập và execute code ngay.
    🛠️ Đây là lựa chọn tối ưu cho đào tạo, đặc biệt với ràng buộc "no install, no admin, no subscription". Theo docs Azure 2026, nó hỗ trợ seamless integration với Azure ML cho data viz training.
    📘 Nguồn tham khảo: Azure Notebooks Documentation (legacy, transitioned to Azure ML Studio) & Azure ML Notebooks for free tier.

📋 Giải thích tất cả các phương án (đúng/sai)

Dưới đây là phân tích từng lựa chọn một cách chi tiết. Tôi giữ nguyên văn bản gốc tiếng Anh của phương án, chỉ giải thích bằng tiếng Việt với lý do đúng/sai dựa trên tính phù hợp với yêu cầu câu hỏi.

  • You should consider configuring the use of Azure Container Instance.
    ❌ Sai. Azure Container Instances (ACI) dùng để chạy containers Docker đơn lẻ hoặc job ngắn hạn trên cloud, yêu cầu tạo ACI resource group và Azure subscription. Người dùng phải build/push Docker image chứa Python/Jupyter (phức tạp cho learners không có dev setup). Không hỗ trợ trực tiếp notebooks qua browser, và học viên không có quyền tạo resource. Không phù hợp cho đào tạo nhanh. 🛑
    📘 Nguồn: Azure Container Instances docs.

  • You should consider configuring the use of Azure BatchAI.
    ❌ Sai. Azure Batch AI (nay là Azure Batch với ML extension) dành cho batch training AI/ML quy mô lớn trên GPU clusters, yêu cầu Azure subscription và setup job queues. Quá phức tạp cho data viz đơn giản, không phải môi trường interactive notebooks. Learners không thể tự execute code dễ dàng mà cần admin config. Không khớp với "no subscription, no install". 🚫
    📘 Nguồn: Azure Batch for ML (updated 2026).

  • You should consider configuring the use of Azure Notebooks.
    ✅ Đúng (như đã giải thích ở trên). Hoàn hảo cho execute Python code browser-based, hỗ trợ data viz ngay lập tức với ràng buộc zero-setup. Learners chỉ share link notebook là chạy được! 🌟
    📘 Nguồn: Như phần đáp án đúng.

  • You should consider configuring the use of Azure Kubernetes Service.
    ❌ Sai. Azure Kubernetes Service (AKS) là managed Kubernetes clusters cho container orchestration quy mô lớn, yêu cầu Azure subscription cao cấp, kubectl config và kiến thức DevOps. Quá nặng cho training đơn giản, learners không thể tự deploy/run Python code mà không có admin/cluster access. Không interactive cho notebooks. ⚠️
    📘 Nguồn: Azure Kubernetes Service docs.

Kết luận: Azure Notebooks là lựa chọn duy nhất đơn giản, miễn phí cơ bản và phù hợp 100% với kịch bản đào tạo. Nếu dùng phiên bản mới 2026, khuyến nghị migrate sang Azure ML Studio Notebooks free workspace để tương thích lâu dài! 🚀

Câu 77
You use Azure Machine Learning designer to create a training pipeline for a regression model.
You need to prepare the pipeline for deployment as an endpoint that generates predictions asynchronously for a dataset of input data values.
What should you do?
  1. A Clone the training pipeline.
  2. B Create a batch inference pipeline from the training pipeline.
  3. C Create a real-time inference pipeline from the training pipeline.
  4. D Replace the dataset in the training pipeline with an Enter Data Manually module.
Xem giải thích

🧩 Phân tích nội dung câu hỏi

Câu hỏi tập trung vào Azure Machine Learning designer (nay là một phần của Azure Machine Learning studio), nơi bạn đã tạo một training pipeline cho mô hình hồi quy (regression model).
📌 Mục tiêu chính: Chuẩn bị pipeline này để deploy thành endpoint có khả năng tạo dự đoán bất đồng bộ (asynchronously) cho một dataset đầu vào lớn (không phải dự đoán thời gian thực cho từng input đơn lẻ).
🛠️ Ngữ cảnh kỹ thuật:

  • Training pipeline dùng để huấn luyện mô hình.
  • Để deploy inference (dự đoán), cần chuyển đổi pipeline thành dạng phù hợp với batch inference (xử lý hàng loạt dữ liệu lớn một cách bất đồng bộ, tiết kiệm tài nguyên và phù hợp với dataset lớn).
  • Điều này khác với real-time inference (dự đoán ngay lập tức cho input đơn).
    ✅ Câu hỏi kiểm tra kiến thức về quy trình chuyển từ training sang inference pipeline trong Azure ML (cập nhật đến phiên bản Azure ML studio 2026, hỗ trợ batch endpoints với managed compute).

✅ Đáp án đúng và lý do lựa chọn

Đáp án đúng: Create a batch inference pipeline from the training pipeline.
🧩 Lý do chi tiết:

  • Trong Azure Machine Learning designer/studio, để deploy training pipeline thành batch endpoint (hỗ trợ predictions bất đồng bộ cho dataset), bạn cần tạo batch inference pipeline từ training pipeline gốc.
  • Quy trình: Right-click pipeline → "Create inference pipeline" → Chọn "Batch". Pipeline mới sẽ thay thế các module training bằng module inference (như Apply Transformation), sử dụng mô hình đã train để xử lý dataset input lớn (ví dụ: file CSV/Parquet qua batch endpoint).
  • Điều này phù hợp hoàn hảo với yêu cầu "asynchronously for a dataset", vì batch inference chạy trên compute cluster, queue jobs và trả kết quả sau (không real-time).
  • Cập nhật 2026: Azure ML hỗ trợ managed batch endpoints với auto-scaling, versioning, và integration với MLflow.

📋 Giải thích tất cả các phương án

Dưới đây là phân tích từng lựa chọn (giữ nguyên văn bản gốc tiếng Anh), với lý do đúng/sai dựa trên tài liệu Azure ML mới nhất:

  • ❌ [SAI] Clone the training pipeline.
    🧩 Giải thích: Clone chỉ sao chép pipeline training gốc để chỉnh sửa độc lập, nhưng không tự động chuyển đổi thành inference pipeline. Bạn vẫn phải huấn luyện lại mô hình mỗi lần chạy, không phù hợp deploy endpoint cho predictions (vẫn là training-focused, không có module inference). Không giải quyết yêu cầu batch/async.

  • ✅ [ĐÚNG] Create a batch inference pipeline from the training pipeline.
    🧩 Giải thích: Như đã nêu ở phần đáp án đúng. Đây là bước chuẩn chính thức trong designer: Tạo pipeline mới với model từ training, thêm module batch inference (Score Model), deploy thành batch endpoint qua Azure ML studio. Hỗ trợ async jobs cho dataset lớn (ví dụ: input từ Blob Storage, output job status qua API).

  • ❌ [SAI] Create a real-time inference pipeline from the training pipeline.
    🧩 Giải thích: Real-time inference pipeline dùng cho online endpoints với predictions đồng bộ (synchronously), phù hợp input đơn lẻ (single data points) qua REST API (low latency <1s). Không hỗ trợ "dataset of input data values" lớn và async; sẽ gây overload nếu dùng cho batch data. Phân biệt rõ: real-time cho apps tương tác, batch cho bulk processing.

  • ❌ [SAI] Replace the dataset in the training pipeline with an Enter Data Manually module.
    🧩 Giải thích: Module "Enter Data Manually" chỉ dùng để test nhanh với dữ liệu mẫu nhỏ trong designer (hardcode values). Thay thế dataset không làm pipeline thành inference endpoint, vẫn giữ logic training (huấn luyện mô hình thay vì predict). Không deploy được async batch, chỉ hữu ích cho debugging cá nhân.

📘 Tài liệu tham khảo

Câu 78
Note: This question is part of a series of questions that present the same scenario. Each question in the series contains a unique solution that might meet the stated goals. Some question sets might have more than one correct solution, while others might not have a correct solution.
After you answer a question in this section, you will NOT be able to return to it. As a result, these questions will not appear in the review screen.
You are creating a model to predict the price of a student's artwork depending on the following variables: the student's length of education, degree type, and art form.
You start by creating a linear regression model.
You need to evaluate the linear regression model.
Solution: Use the following metrics: Mean Absolute Error, Root Mean Absolute Error, Relative Absolute Error, Accuracy, Precision, Recall, F1 score, and AUC.
Does the solution meet the goal?
  1. A Yes
  2. B No
Xem giải thích

🧩 Phân tích chi tiết câu hỏi trắc nghiệm

📘 Nội dung câu hỏi:
Câu hỏi thuộc dạng series (chuỗi câu hỏi có scenario chung), nơi mỗi câu đưa ra một giải pháp độc lập để đánh giá xem có đạt mục tiêu không. Bạn đang xây dựng mô hình linear regression để dự đoán giá tác phẩm nghệ thuật của học sinh dựa trên các biến đầu vào: độ dài thời gian học tập (length of education), loại bằng cấp (degree type), và hình thức nghệ thuật (art form).
Mục tiêu: Đánh giá mô hình linear regression.
Giải pháp đề xuất: Sử dụng các metrics sau: Mean Absolute Error, Root Mean Absolute Error, Relative Absolute Error, Accuracy, Precision, Recall, F1 score, and AUC.
Câu hỏi: Does the solution meet the goal? (Giải pháp này có đạt mục tiêu không?).
✅ Đây là bài toán REGRESSION (dự đoán giá trị liên tục - continuous value như giá tiền), không phải classification (phân loại). Do đó, cần chọn metrics phù hợp cho regression để đánh giá chính xác hiệu suất mô hình.

✅ Đáp án đúng: No
🛠️ Lý do lựa chọn:
Giải pháp KHÔNG đạt mục tiêu vì nó trộn lẫn metrics dành cho regression (như Mean Absolute Error - MAE, Relative Absolute Error - RAE) với các metrics dành cho classification (Accuracy, Precision, Recall, F1 score, AUC). Trong bài toán regression dự đoán giá trị số liên tục, các metrics classification không áp dụng được vì không có "nhãn lớp" (class labels) để tính toán. Ngoài ra, "Root Mean Absolute Error" không phải là metric chuẩn (thường dùng Root Mean Squared Error - RMSE thay thế). Sử dụng metrics sai sẽ dẫn đến đánh giá không chính xác, không phản ánh đúng chất lượng mô hình linear regression. Theo kiến thức ML cập nhật đến 2026 (AWS SageMaker, scikit-learn v1.5+), đánh giá regression phải ưu tiên MAE, MSE, RMSE, R², MAPE.

🔍 Giải thích tất cả các phương án (giữ nguyên văn bản gốc bằng tiếng Anh)

  • Yes ❌ SAI
    Phương án này sai vì giải pháp không phù hợp hoàn toàn. Mặc dù một số metrics như MAE và RAE dùng được cho regression, nhưng Accuracy, Precision, Recall, F1 score, AUC là dành cho classification (dự đoán lớp rời rạc). AUC đo lường khả năng phân biệt lớp dương/âm, không áp dụng cho giá trị liên tục. "Root Mean Absolute Error" cũng không chuẩn (thường là RMSE = √MSE). Kết quả: Đánh giá lệch lạc, không meet goal.

  • No ✅ ĐÚNG
    Phương án này đúng vì giải pháp KHÔNG đạt mục tiêu. Lý do chính: Trộn metrics regression và classification, vi phạm nguyên tắc đánh giá mô hình theo loại bài toán (regression vs. classification). Metrics phù hợp cho linear regression bao gồm: MAE, MSE, RMSE, R², Adjusted R², MAPE. AWS khuyến nghị dùng các metrics này trong SageMaker Model Monitor (cập nhật 2025-2026 với auto-scaling evaluations).

📚 Tài liệu tham khảo (cập nhật mới nhất đến 2026)

  • AWS SageMaker Documentation: "Evaluate Models" - https://docs.aws.amazon.com/sagemaker/latest/dg/model-evaluation.html (Metrics cho regression: MAE, RMSE; tránh classification metrics). Phiên bản 2026 hỗ trợ built-in regression evaluators.
  • Scikit-learn Metrics Guide (v1.5.1+): https://scikit-learn.org/stable/modules/model_evaluation.html (Phân biệt rõ regression metrics vs. classification).
  • Azure ML (tương đương, từ góc nhìn Data Scientist): Docs.microsoft.com/en-us/azure/machine-learning/how-to-understand-automated-ml#regression (Xác nhận MAE/RMSE cho regression, không dùng Accuracy/AUC).
  • Nguồn chung: "Hands-On Machine Learning with Scikit-Learn" (Aurélien Géron, 3rd Ed. 2022+, cập nhật 2026) - Chương 2: Regression Evaluation.

🧠 Lời khuyên: Trong thực tế AWS SageMaker hoặc Azure ML Studio, luôn kiểm tra loại bài toán trước khi chọn metrics để tránh overfitting đánh giá sai! 🚀

Câu 79 Chọn nhiều đáp án
You plan to provision an Azure Machine Learning Basic edition workspace for a data science project.
You need to identify the tasks you will be able to perform in the workspace.
Which three tasks will you be able to perform? Each correct answer presents a complete solution.
NOTE: Each correct selection is worth one point.
  1. A Create a Compute Instance and use it to run code in Jupyter notebooks.
  2. B Create an Azure Kubernetes Service (AKS) inference cluster.
  3. C Use the designer to train a model by dragging and dropping pre-defined modules.
  4. D Create a tabular dataset that supports versioning.
  5. E Use the Automated Machine Learning user interface to train a model.
Xem giải thích

🧩 Giải thích nội dung câu hỏi

Câu hỏi tập trung vào Azure Machine Learning (Azure ML) Basic edition workspace – một phiên bản cơ bản (miễn phí hoặc entry-level) được cung cấp bởi Microsoft Azure cho các dự án khoa học dữ liệu. Bạn đang lập kế hoạch tạo workspace này và cần xác định ba nhiệm vụ cụ thể có thể thực hiện bên trong nó.

✅ Đây là câu hỏi trắc nghiệm multi-select (chọn nhiều đáp án đúng), mỗi đáp án đúng chiếm 1 điểm.
🛠️ Basic edition (cập nhật đến năm 2026 theo tài liệu Azure ML v2 mới nhất) hỗ trợ các tính năng cơ bản như compute instances hạn chế, designer, AutoML UI, nhưng không hỗ trợ các tính năng nâng cao như AKS clusters hay versioning datasets đầy đủ (yêu cầu Standard hoặc Enterprise edition).
📘 Nguồn tham khảo:

✅ Đáp án đúng và lý do lựa chọn

Ba đáp án đúng là:

  1. Create a Compute Instance and use it to run code in Jupyter notebooks.
  2. Use the designer to train a model by dragging and dropping pre-defined modules.
  3. Use the Automated Machine Learning user interface to train a model.

Lý do lựa chọn: Trong Basic edition, các tính năng cốt lõi này được hỗ trợ đầy đủ mà không cần nâng cấp. Chúng phù hợp cho người mới bắt đầu, cho phép phát triển mô hình ML đơn giản qua notebooks, giao diện kéo-thả (Designer) và tự động hóa (AutoML UI). Điều này giúp workspace Basic edition trở thành lựa chọn lý tưởng cho dự án thử nghiệm nhỏ. (Xác nhận từ Azure ML v2, 2025+).

🛠️ Phân tích chi tiết tất cả các phương án

Dưới đây là phân tích từng lựa chọn một cách rõ ràng. Tôi giữ nguyên văn bản gốc bằng tiếng Anh, chỉ giải thích bằng tiếng Việt với emoji để nổi bật:

  • ✅ Create a Compute Instance and use it to run code in Jupyter notebooks.
    Đúng: Basic edition cho phép tạo Compute Instance (máy ảo cá nhân hóa, giới hạn 1 instance/48GB RAM) và chạy code trực tiếp trong Jupyter notebooks qua Azure ML Studio. Tính năng này là cốt lõi, không yêu cầu tier cao hơn. Hoàn hảo cho lập trình tương tác!
    📘 Nguồn: Compute Instance docs.

  • ❌ Create an Azure Kubernetes Service (AKS) inference cluster.
    Sai: Basic edition không hỗ trợ tạo AKS inference cluster để triển khai mô hình quy mô lớn. Tính năng này chỉ có ở Standard/Enterprise edition (yêu cầu pay-as-you-go và Kubernetes integration). Basic chỉ dùng Compute Instance đơn giản cho inference cơ bản.

  • ✅ Use the designer to train a model by dragging and dropping pre-defined modules.
    Đúng: Azure ML Designer (giao diện kéo-thả) được tích hợp đầy đủ trong Basic edition, cho phép xây dựng pipeline ML bằng các module sẵn có mà không cần code. Rất thân thiện cho người không chuyên!
    📘 Nguồn: Designer overview.

  • ❌ Create a tabular dataset that supports versioning.
    Sai: Basic edition không hỗ trợ versioning cho datasets (tabular hoặc khác). Versioning chỉ khả dụng ở tier cao hơn (Standard+), nơi bạn có thể đăng ký và quản lý phiên bản dữ liệu. Basic chỉ hỗ trợ data assets cơ bản không versioned.

  • ✅ Use the Automated Machine Learning user interface to train a model.
    Đúng: Automated ML (AutoML) UI hoàn toàn khả dụng trong Basic edition, giúp tự động hóa quá trình train model qua giao diện wizard. Hỗ trợ classification, regression, forecasting mà không cần code chuyên sâu.
    📘 Nguồn: AutoML UI docs.

Hy vọng phân tích này giúp bạn nắm vững sự khác biệt giữa các edition Azure ML! 🚀 Nếu cần demo code hoặc ví dụ thực tế, hãy cho tôi biết nhé!

Câu 80 Chọn nhiều đáp án
You plan to run a script as an experiment using a Script Run Configuration. The script uses modules from the scipy library as well as several Python packages that are not typically installed in a default conda environment.
You plan to run the experiment on your local workstation for small datasets and scale out the experiment by running it on more powerful remote compute clusters for larger datasets.
You need to ensure that the experiment runs successfully on local and remote compute with the least administrative effort.
What should you do?
  1. A Do not specify an environment in the run configuration for the experiment. Run the experiment by using the default environment.
  2. B Create a virtual machine (VM) with the required Python configuration and attach the VM as a compute target. Use this compute target for all experiment runs.
  3. C Create and register an Environment that includes the required packages. Use this Environment for all experiment runs.
  4. D Create a config.yaml file defining the conda packages that are required and save the file in the experiment folder.
  5. E Always run the experiment with an Estimator by using the default packages.
Xem giải thích

🧠 Phân tích câu hỏi trắc nghiệm Azure Machine Learning

🧩 Giải thích nội dung câu hỏi:
Câu hỏi mô tả tình huống bạn đang lập kế hoạch chạy một script như một experiment bằng ScriptRunConfig trong Azure Machine Learning (Azure ML). Script này sử dụng thư viện scipy cùng một số gói Python khác không có sẵn trong môi trường conda mặc định. Bạn muốn chạy experiment trên local workstation cho dữ liệu nhỏ, đồng thời mở rộng quy mô (scale out) lên remote compute clusters mạnh hơn cho dữ liệu lớn. Mục tiêu là đảm bảo experiment chạy thành công trên cả hai môi trường (local và remote) với ít nỗ lực quản trị nhất (least administrative effort).

Vấn đề cốt lõi: Cần một cách tái sử dụng và tự động hóa việc cài đặt dependencies (các gói cần thiết) để tương thích linh hoạt giữa local và remote, tránh cấu hình thủ công phức tạp. Đây là chủ đề quen thuộc trong Azure ML, liên quan đến Environments và ScriptRunConfig (theo docs Azure ML phiên bản mới nhất đến 2024-2026, hỗ trợ MLflow integration và CLI v2).

✅ Đáp án đúng và lý do lựa chọn:
Có hai đáp án đúng (loại câu hỏi "select all that apply"):

  • Create and register an Environment that includes the required packages. Use this Environment for all experiment runs.
  • Create a config.yaml file defining the conda packages that are required and save the file in the experiment folder.

Lý do chọn:
Cả hai phương án đều đảm bảo tự động cài đặt packages (scipy và các gói khác) cho cả local và remote compute với least admin effort.

  • Environment đăng ký (registered Environment): Là cách chuẩn và linh hoạt nhất trong Azure ML (hỗ trợ Docker/Conda), tái sử dụng cho mọi run, tự động pull/install trên remote mà không cần can thiệp thủ công. Hoạt động tốt trên local (azureml-examples repo).
  • config.yaml (thực tế là conda_dependencies.yml): ScriptRunConfig tự động detect file này trong script folder, tạo transient environment với packages chỉ định, phù hợp cho quick setup mà không cần register.

Cả hai đều scale seamlessly giữa local/remote, tránh rebuild môi trường thủ công.

📋 Phân tích tất cả các phương án (đúng/sai):
Dưới đây là phân tích chi tiết từng lựa chọn, giữ nguyên văn bản gốc tiếng Anh:

  • ❌ Do not specify an environment in the run configuration for the experiment. Run the experiment by using the default environment.
    Giải thích sai: Môi trường default (Curated hoặc base conda) không có scipy đầy đủ và các gói custom, dẫn đến lỗi import/module not found trên cả local/remote. Không đáp ứng "least effort" vì phải fix thủ công sau mỗi run.

  • ❌ Create a virtual machine (VM) with the required Python configuration and attach the VM as a compute target. Use this compute target for all experiment runs.
    Giải thích sai: VM chỉ dùng cho remote compute (như Azure VM), không hỗ trợ local workstation. Phải tạo/maintain VM riêng tốn kém admin effort cao, không linh hoạt scale (không auto-install packages động). Không phù hợp ScriptRunConfig local.

  • ✅ Create and register an Environment that includes the required packages. Use this Environment for all experiment runs.
    Giải thích đúng: Environment (tạo bằng Environment(conda_specification=...) hoặc YAML/Dockerfile) chứa chính xác scipy + packages cần thiết. Đăng ký vào workspace (ml_client.environments.create_or_update()), dùng cho ScriptRunConfig (ScriptRunConfig(environment=env)). Tự động install trên local/remote, tái sử dụng, zero-downtime scale. Hỗ trợ versioning đến 2026.

  • ✅ Create a config.yaml file defining the conda packages that are required and save the file in the experiment folder.
    Giải thích đúng: File conda_dependencies.yml (YAML format: name: exp-env, dependencies: - pip: - scipy==1.12.0 ...) đặt trong script folder. ScriptRunConfig tự tạo transient Environment từ file này (conda_file="conda_dependencies.yml"). Least effort cho local/remote, không cần register, phù hợp dev/test nhanh (docs khuyên dùng cho custom deps).

  • ❌ Always run the experiment with an Estimator by using the default packages.
    Giải thích sai: Estimator là API cũ (legacy từ SDK v1), không khuyến khích từ 2022+ (thay bằng Command/ScriptRunConfig v2). Default packages thiếu scipy/custom, gây fail. Không hỗ trợ tốt local/remote scale mà không effort cao.

🛠️ Khuyến nghị thực hành:

  • Ưu tiên registered Environment cho production (reusable, versioned).
  • Dùng conda_dependencies.yml cho prototyping nhanh.
  • Test: az ml job create --file script.yml với CLI v2 (2024+).

📘 Tài liệu tham khảo (cập nhật mới nhất 2024-2026):

Hy vọng phân tích giúp bạn nắm vững Azure ML! 🚀 Nếu cần code sample, hỏi thêm nhé!