Ngân hàng đề — Microsoft Azure Data Scientist
Tìm thấy 313 câu.
You need to ensure that workshop attendees can install Docker on their devices.
Which two prerequisite components should attendees install on the devices? Each correct answer presents part of the solution.
NOTE: Each correct selection is worth one point.
- A Microsoft Hardware-Assisted Virtualization Detection Tool
- B Kitematic
- C BIOS-enabled virtualization
- D VirtualBox
- E Windows 10 64-bit Professional
Xem giải thích
🧩 Giải thích nội dung câu hỏi
Câu hỏi tập trung vào việc phát triển một workshop thực hành giới thiệu Docker for Windows cho người tham gia. Mục tiêu là đảm bảo người tham gia có thể cài đặt Docker trên thiết bị Windows của họ một cách suôn sẻ. Cụ thể, cần xác định hai thành phần prerequisite (yêu cầu tiên quyết) mà người tham gia phải cài đặt hoặc kích hoạt trên thiết bị.
- Đây là câu hỏi trắc nghiệm multi-select (chọn nhiều), mỗi lựa chọn đúng chiếm 1 điểm.
- Ngữ cảnh cập nhật đến 2026: Theo tài liệu Docker Desktop mới nhất (phiên bản 4.36+ năm 2024-2026), Docker for Windows yêu cầu Hyper-V hoặc WSL 2 để chạy container, đòi hỏi phần cứng và hệ điều hành hỗ trợ ảo hóa. Không liên quan trực tiếp đến AWS, mà là công cụ Docker trên nền tảng Microsoft Windows.
📘 Nguồn tham khảo: - Docker Desktop for Windows Installation Guide (cập nhật 2026).
- Microsoft Docs: Hyper-V Requirements.
✅ Đáp án đúng và lý do lựa chọn
Hai lựa chọn đúng là:
- BIOS-enabled virtualization
- Windows 10 64-bit Professional
Lý do chọn:
- Docker Desktop yêu cầu ảo hóa phần cứng (hardware virtualization như Intel VT-x hoặc AMD-V) phải được kích hoạt trong BIOS/UEFI để Hyper-V hoặc WSL 2 hoạt động. Nếu không enable, Docker sẽ không chạy được container.
- Windows 10 64-bit Professional là phiên bản hỗ trợ đầy đủ Hyper-V (tính năng ảo hóa của Windows), cần thiết cho Docker mà không cần workaround phức tạp như trên Home edition. Phiên bản Pro 64-bit (từ 1903 trở lên) là prerequisite cơ bản.
🛠️ Lưu ý: Người tham gia phải restart máy và vào BIOS để enable virtualization, đồng thời cài/update Windows Pro nếu thiếu.
📋 Giải thích chi tiết tất cả các phương án
Dưới đây là phân tích từng lựa chọn, giữ nguyên văn bản gốc tiếng Anh. Mỗi phương án được đánh giá đúng/sai dựa trên yêu cầu cài đặt Docker for Windows:
-
❌ Microsoft Hardware-Assisted Virtualization Detection Tool
Sai: Đây chỉ là công cụ kiểm tra (tool) của Microsoft để phát hiện xem CPU có hỗ trợ ảo hóa không (tải từ Microsoft). Nó không phải prerequisite cần install cho Docker, mà chỉ dùng để diagnose vấn đề nếu virtualization bị thiếu. Docker không yêu cầu tool này. -
❌ Kitematic
Sai: Kitematic là giao diện GUI cũ (Docker Machine UI) đã bị deprecated từ 2017. Docker Desktop hiện đại sử dụng giao diện tích hợp riêng, không cần Kitematic. Cài nó có thể gây xung đột và không phải yêu cầu tiên quyết. -
✅ BIOS-enabled virtualization
Đúng: Virtualization phải được enable trong BIOS/UEFI (như VT-x/AMD-V/SVM) là yêu cầu phần cứng bắt buộc cho Hyper-V hoặc WSL 2 trong Docker. Nếu tắt, Docker sẽ báo lỗi "virtualization not enabled". Người tham gia cần vào BIOS trước khi cài Docker. -
❌ VirtualBox
Sai: VirtualBox xung đột trực tiếp với Hyper-V (công nghệ ảo hóa của Docker trên Windows). Docker yêu cầu tắt VirtualBox nếu đã cài, không phải install nó. Tài liệu Docker khuyến cáo gỡ VirtualBox để tránh lỗi. -
✅ Windows 10 64-bit Professional
Đúng: Phiên bản Professional 64-bit (hoặc cao hơn như Enterprise/Education) là prerequisite hệ điều hành hỗ trợ Hyper-V đầy đủ. Windows Home không hỗ trợ Hyper-V native (chỉ WSL 2 với hạn chế), nên Pro là lựa chọn chuẩn cho workshop ổn định.
🧠 Tóm tắt nhanh: Tập trung enable BIOS + Windows Pro để workshop diễn ra mượt mà! Nếu dùng Windows 11 (cập nhật 2026), yêu cầu tương tự nhưng hỗ trợ tốt hơn với WSL 2.
You must predict the fare of a taxi trip.
You need to select performance metrics to correctly evaluate the regression model.
Which two metrics can you use? Each correct answer presents a complete solution?
NOTE: Each correct selection is worth one point.
- A a Root Mean Square Error value that is low
- B an R-Squared value close to 0
- C an F1 score that is low
- D an R-Squared value close to 1
- E an F1 score that is high
- F a Root Mean Square Error value that is high
Xem giải thích
🧩 Phân tích chi tiết câu hỏi trắc nghiệm
📘 Nội dung câu hỏi:
Câu hỏi yêu cầu chọn hai metrics (chỉ số hiệu suất) phù hợp để đánh giá mô hình hồi quy (regression model) dự đoán giá vé taxi dựa trên dữ liệu lịch sử từ công ty taxi địa phương. Đây là bài toán hồi quy (regression), nơi mục tiêu là dự đoán giá trị liên tục (fare - giá tiền), không phải phân loại (classification).
Câu hỏi thuộc dạng multiple choice với hai đáp án đúng (mỗi đáp án đúng đáng 1 điểm), thường xuất hiện trong các kỳ thi chứng chỉ AWS như AWS Certified Machine Learning - Specialty (phiên bản mới nhất đến 2026 vẫn giữ nguyên các metrics cơ bản cho regression trên SageMaker).
Mô hình hồi quy cần metrics đo lường sai số dự đoán và khả năng giải thích dữ liệu, không dùng metrics của classification như F1-score.
✅ Đáp án đúng và lý do lựa chọn
Hai metrics đúng là:
- Root Mean Square Error value that is low 🛠️
- an R-Squared value close to 1 📈
Lý do chọn:
Những metrics này là tiêu chuẩn vàng cho mô hình hồi quy trên AWS SageMaker (và ML nói chung). RMSE thấp cho thấy sai số dự đoán nhỏ (tốt), R² gần 1 chứng tỏ mô hình giải thích tốt biến thiên dữ liệu (lên đến 100%). Đây là khuyến nghị chính thức từ AWS docs cho regression tasks như dự đoán fare amount trong taxi dataset (tương tự bài toán NYC Taxi trên SageMaker examples).
🧩 Giải thích tất cả các phương án (Đúng/Sai)
Dưới đây là phân tích từng lựa chọn một cách chi tiết. Tôi giữ nguyên nội dung văn bản gốc bằng tiếng Anh, chỉ giải thích bằng tiếng Việt với emoji nổi bật:
-
✅ Root Mean Square Error value that is low
Đúng! RMSE (Root Mean Square Error) là metric phổ biến nhất cho regression, tính bình phương sai số rồi lấy căn bậc hai. Giá trị thấp nghĩa là mô hình dự đoán chính xác, sai lệch nhỏ so với giá trị thực (fare). AWS SageMaker tự động tính RMSE cho regression built-in algorithms như XGBoost hoặc Linear Learner. Lý tưởng cho dataset taxi vì fare có thể có outlier (giá cao bất thường). -
❌ an R-Squared value close to 0
Sai! R-Squared (hệ số xác định) đo phần trăm biến thiên dữ liệu được mô hình giải thích. Giá trị gần 0 nghĩa là mô hình kém, gần như không giải thích dữ liệu (chỉ bằng mean baseline). Tốt phải gần 1 (hoặc >0.8 cho real-world tasks). -
❌ an F1 score that is low
Sai! F1-score là metric cho classification (phân loại nhị phân/đa lớp), kết hợp Precision và Recall. Không áp dụng cho regression vì fare là giá trị liên tục, không phải class label. AWS dùng F1 cho binary classification trên SageMaker Clarify, không phải regression. -
✅ an R-Squared value close to 1
Đúng! R² gần 1 (ví dụ 0.95+) cho thấy mô hình giải thích gần hết biến thiên dữ liệu, rất tốt cho dự đoán fare. AWS khuyến nghị kết hợp R² với RMSE để đánh giá toàn diện trên notebook SageMaker Jupyter. -
❌ an F1 score that is high
Sai! Tương tự trên, F1 cao (gần 1) tốt cho classification nhưng vô nghĩa ở regression. Sử dụng F1 ở đây sẽ dẫn đến đánh giá sai lệch, không phù hợp với AWS best practices cho continuous prediction. -
❌ a Root Mean Square Error value that is high
Sai! RMSE cao nghĩa là sai số lớn, mô hình kém (ví dụ dự đoán fare lệch nhiều so với thực tế). Phải chọn giá trị thấp để xác nhận model tốt; AWS SageMaker dashboard hiển thị RMSE thấp làm green indicator.
📚 Tài liệu tham khảo (cập nhật đến 2026)
- AWS SageMaker Documentation: Model Metrics for Regression - RMSE và R² là built-in metrics.
- AWS ML Specialty Exam Guide (2023-2026): Nhấn mạnh RMSE/R² cho regression tasks như taxi fare prediction (NYC Taxi dataset example).
- SageMaker Examples: Built-in Algorithms - Regression Metrics - Code samples với RMSE thấp và R² cao.
- Scikit-learn (tích hợp SageMaker): Regression Metrics.
Hy vọng phân tích này giúp bạn ôn thi hiệu quả! 🚀 Nếu cần code ví dụ trên SageMaker, hãy hỏi thêm nhé! 😊
You want to understand how your model is making selections and must be sure that the model does not violate government regulations such as denying loans based on where an applicant lives.
You need to determine the extent to which each feature in the customer data is influencing predictions.
What should you do?
- A Enable data drift monitoring for the model and its training dataset.
- B Score the model against some test data with known label values and use the results to calculate a confusion matrix.
- C Use the Hyperdrive library to test the model with multiple hyperparameter values.
- D Use the interpretability package to generate an explainer for the model.
- E Add tags to the model registration indicating the names of the features in the training dataset.
Xem giải thích
🧩 Phân tích chi tiết nội dung câu hỏi
Câu hỏi mô tả tình huống bạn là một data scientist làm việc cho ngân hàng, đã sử dụng Azure ML để huấn luyện và đăng ký một mô hình machine learning dự đoán khả năng khách hàng hoàn trả khoản vay.
📌 Yêu cầu chính: Bạn cần hiểu cách mô hình đưa ra quyết định (interpretability), đảm bảo không vi phạm quy định pháp lý như từ chối vay dựa trên nơi cư trú của ứng viên. Cụ thể, phải xác định mức độ ảnh hưởng của từng feature (đặc trưng dữ liệu khách hàng) đến dự đoán.
🛠️ Mục tiêu: Tìm phương pháp phù hợp trong Azure ML để phân tích feature importance (tầm quan trọng của từng đặc trưng), giúp kiểm tra bias và tuân thủ quy định.
✅ Đáp án đúng và lý do lựa chọn
Đáp án đúng: Use the interpretability package to generate an explainer for the model.
Lý do: Trong Azure Machine Learning (cập nhật đến phiên bản 2026), gói interpretability (dựa trên thư viện InterpretML) cho phép tạo explainer để phân tích chi tiết mức độ ảnh hưởng của từng feature đến dự đoán. Explainer sử dụng kỹ thuật như SHAP hoặc LIME, hiển thị feature importance trực quan, giúp phát hiện bias (ví dụ: feature "địa chỉ cư trú" ảnh hưởng quá mức). Điều này trực tiếp đáp ứng nhu cầu kiểm tra quy định pháp lý và hiểu mô hình.
📘 Tài liệu tham khảo: Azure ML Interpretability Documentation (phiên bản mới nhất 2026 hỗ trợ tích hợp sâu với Azure ML Studio).
📋 Giải thích tất cả các phương án (đúng/sai)
-
❌ SAI - Enable data drift monitoring for the model and its training dataset.
Giải thích: Data drift monitoring theo dõi sự thay đổi phân phối dữ liệu giữa training và inference (sử dụng Azure ML Model Monitor), giúp phát hiện mô hình lỗi thời. Không liên quan đến việc phân tích ảnh hưởng của từng feature đến dự đoán, chỉ tập trung vào sự lệch dữ liệu tổng quát. -
❌ SAI - Score the model against some test data with known label values and use the results to calculate a confusion matrix.
Giải thích: Confusion matrix đánh giá hiệu suất mô hình (accuracy, precision, recall) trên test data có nhãn. Nó chỉ cho biết mô hình dự đoán đúng/sai tổng thể, không phân tích mức độ ảnh hưởng cụ thể của từng feature. -
❌ SAI - Use the Hyperdrive library to test the model with multiple hyperparameter values.
Giải thích: Hyperdrive là công cụ trong Azure ML dùng để tối ưu hóa hyperparameter (như learning rate) qua tìm kiếm song song. Không giúp hiểu feature importance, chỉ cải thiện hiệu suất huấn luyện. -
✅ ĐÚNG - Use the interpretability package to generate an explainer for the model.
Giải thích: Như đã nêu ở trên, đây là phương pháp chuẩn xác nhất, cung cấp giải thích local/global cho từng dự đoán, trực quan hóa feature contribution (hỗ trợ black-box models như tree-based hoặc neural networks). -
❌ SAI - Add tags to the model registration indicating the names of the features in the training dataset.
Giải thích: Thêm tags chỉ là metadata (nhãn mô tả) khi đăng ký model trong Azure ML Registry, giúp quản lý và tìm kiếm. Không cung cấp phân tích ảnh hưởng của feature đến dự đoán, chỉ liệt kê tên feature.
🧠 Kết luận: Phương pháp interpretability là lựa chọn tối ưu trong Azure ML để đảm bảo tính minh bạch và tuân thủ quy định, đặc biệt với ứng dụng tài chính nhạy cảm!
Which normalization type should you use?
- A Streaming
- B Weight
- C Batch
- D Cosine
Xem giải thích
🧩 Phân tích chi tiết nội dung câu hỏi
Câu hỏi tập trung vào việc triển khai chiến lược scaling (mở rộng quy mô) cho dữ liệu local penalty detection data (dữ liệu phát hiện phạt địa phương, thường liên quan đến các ứng dụng phát hiện bất thường hoặc phạt trong môi trường cục bộ như edge computing, IoT hoặc computer vision trên AWS).
📘 Ngữ cảnh AWS: Trong Amazon SageMaker (phiên bản mới nhất 2026 với SageMaker Studio Classic và SageMaker JumpStart hỗ trợ ML workflows nâng cao), scaling strategy cho dữ liệu yêu cầu normalization type để chuẩn hóa dữ liệu trước khi training model, tránh gradient vanishing/exploding, đặc biệt với dữ liệu "local" (xử lý tại chỗ, không cloud-heavy). Các loại normalization phổ biến trong deep learning frameworks như TensorFlow/PyTorch trên SageMaker bao gồm Batch, Weight, v.v., nhằm tối ưu hóa performance cho detection tasks.
🛠️ Mục tiêu: Chọn normalization giúp ổn định training trên dữ liệu địa phương, hỗ trợ batch processing hiệu quả cho penalty detection (ví dụ: phát hiện vi phạm giao thông hoặc lỗi thiết bị cục bộ).
✅ Đáp án đúng: Batch
Lý do lựa chọn:
Batch Normalization (Batch Norm) là lựa chọn tối ưu cho scaling strategy của local penalty detection data vì nó chuẩn hóa dữ liệu theo từng batch (lô) trong quá trình training, giảm internal covariate shift, tăng tốc hội tụ và ổn định model trên dữ liệu cục bộ. Trong AWS SageMaker (cập nhật 2026 với hỗ trợ Batch Norm v2 trong SageMaker Training Jobs và Edge Manager), nó đặc biệt hiệu quả cho detection tasks trên thiết bị edge (như AWS IoT Greengrass), nơi dữ liệu local cần xử lý nhanh, batch nhỏ. Không dùng streaming để tránh latency cao.
📘 Nguồn tham khảo:
- AWS SageMaker Documentation: Batch Normalization in SageMaker (2026 update).
- Paper gốc: Ioffe & Szegedy (2015), vẫn là standard trong SageMaker HyperPod (2025+).
🔍 Giải thích tất cả các phương án (đúng/sai)
Dưới đây là phân tích từng lựa chọn, giữ nguyên nội dung gốc bằng tiếng Anh. Phần giải thích hoàn toàn bằng tiếng Việt:
-
❌ Streaming:
Sai vì Streaming Normalization chỉ phù hợp cho dữ liệu thời gian thực liên tục (như Kinesis Data Streams), không lý tưởng cho local penalty detection data cục bộ, dễ gây latency và không ổn định batch training. Trong SageMaker 2026, nó dùng cho online inference nhưng không phải scaling strategy chính cho detection local (gây overhead trên edge devices). -
❌ Weight:
Sai vì Weight Normalization tập trung chuẩn hóa weights của layer thay vì dữ liệu input, hữu ích cho generative models nhưng kém hiệu quả với detection tasks local (dữ liệu penalty cần batch-wise scaling để tránh noise). SageMaker hỗ trợ qua custom layers, nhưng không phải lựa chọn chuẩn cho scaling data detection (dẫn đến underfitting trên local datasets). -
✅ Batch:
Đúng như đã giải thích ở trên. Đây là normalization type tiêu chuẩn cho scaling strategy, hỗ trợ distributed training trên SageMaker (với Pipe Mode hoặc Batch Transform), tối ưu cho dữ liệu local penalty detection nhờ tính adaptive theo batch statistics (mean/variance). -
❌ Cosine:
Sai vì Cosine Normalization dùng cho embedding similarity (như cosine similarity trong vector search), không phải scaling toàn bộ dữ liệu detection. Trong SageMaker 2026 (với Semantic Segmentation jobs), nó chỉ dùng cho loss functions hoặc embeddings, không phù hợp cho local data scaling (gây distortion features trong penalty detection).
🛠️ Lời khuyên thực hành: Trong SageMaker Pipeline 2026, kết hợp Batch Norm với Data Wrangler để preprocess local data trước khi deploy model lên AWS Outposts hoặc Local Mode. Nếu cần code sample, có thể dùng torch.nn.BatchNorm2d trong SageMaker notebook!
You must configure an event-driven workflow to automatically trigger upon completion of training runs in the workspace. The solution must minimize the administrative effort to configure the trigger.
You need to configure an Azure service to automatically trigger the workflow.
Which Azure service should you use?
- A Event Grid subscription
- B Azure Automation runbook
- C Event Hubs Capture
- D Event Hubs consumer
Xem giải thích
🧩 Phân tích chi tiết nội dung câu hỏi
Câu hỏi xoay quanh việc tạo một Azure Machine Learning workspace (không gian làm việc ML trên Azure) và cần cấu hình một workflow dựa trên sự kiện (event-driven workflow) để tự động kích hoạt khi các training runs (quá trình huấn luyện mô hình) hoàn thành. Yêu cầu chính là giảm thiểu nỗ lực quản trị (administrative effort) khi thiết lập trigger (kích hoạt).
Cụ thể:
- Azure ML workspace hỗ trợ phát ra các sự kiện (events) như "TrainingCompleted" khi job huấn luyện kết thúc.
- Bạn cần chọn dịch vụ Azure nào để tự động nhận và trigger workflow dựa trên các sự kiện này một cách đơn giản nhất, không phức tạp hóa việc quản lý.
Mục tiêu là xây dựng hệ thống event-driven (dựa trên sự kiện), nơi workflow (có thể là Logic Apps, Functions, hoặc workflow khác) được kích hoạt ngay lập tức mà không cần polling thủ công hoặc cấu hình nặng nề. 📘 Kiến thức cập nhật: Theo tài liệu Azure Machine Learning mới nhất (tính đến 2026, phiên bản Azure ML v2), Azure ML tích hợp native với Event Grid để phát events từ training runs, giúp minimize admin effort chỉ bằng subscription đơn giản.
Nguồn tham khảo:
- Azure ML Events with Event Grid (Microsoft Docs, cập nhật 2025).
- Event Grid for Azure ML (Event Grid schemas).
✅ Đáp án đúng: Event Grid subscription
Lý do lựa chọn:
- Event Grid là dịch vụ event routing (định tuyến sự kiện) serverless của Azure, được thiết kế dành riêng cho event-driven architectures.
- Azure ML workspace tự động phát events (như
Microsoft.MachineLearningServices.JobCompleted) qua Event Grid topic native, chỉ cần tạo Event Grid subscription để subscribe vào topic đó và route event đến handler (như Logic Apps hoặc Functions) – không cần code phức tạp, chỉ vài cú click trong portal, minimize admin effort tối đa. - Đây là cách best practice chính thức từ Microsoft, hỗ trợ real-time, scalable, và chi phí thấp. 🛠️ Hoàn hảo cho trigger tự động từ training runs!
📋 Giải thích tất cả các phương án (đúng/sai)
-
✅ Event Grid subscription (Đúng):
Như đã giải thích, đây là lựa chọn tối ưu vì Event Grid native hỗ trợ events từ Azure ML workspace. Chỉ cần tạo subscription trên ML topic, filter event type (e.g., TrainingCompleted), và bind với workflow endpoint. Không cần infra management, auto-scale, và low-latency. Phù hợp hoàn hảo với yêu cầu minimize effort! -
❌ Azure Automation runbook (Sai):
Azure Automation dùng cho automation scripts (runbooks) chạy theo lịch (schedule) hoặc webhook thủ công, không phải event-driven native từ Azure ML. Phải tự poll API ML hoặc setup webhook phức tạp, tăng admin effort cao (cần manage runbook, credentials, scheduling). Không phải giải pháp real-time cho training events. -
❌ Event Hubs Capture (Sai):
Event Hubs Capture chỉ capture dữ liệu stream từ Event Hubs vào storage (như Blob), dùng cho big data archiving. Không trigger workflow, không liên kết trực tiếp với Azure ML events, và yêu cầu setup Event Hubs namespace riêng – tăng effort lớn, không phù hợp cho event-driven từ training runs. -
❌ Event Hubs consumer (Sai):
Event Hubs consumer (như trong Stream Analytics hoặc custom app) dùng để đọc dữ liệu từ Event Hubs stream, nhưng phải tự build consumer logic (code Kafka-like), không native với Azure ML events. Cần provision Event Hubs, manage throughput/consumer groups – effort cao, không minimize admin, và không phải trigger service đơn giản.
Tóm tắt nhanh: Event Grid là "vua event-driven" cho Azure ML! 🚀 Nếu implement, chỉ mất 5 phút setup subscription. Các option khác overkill hoặc không fit.
The environment must support the following requirements:
✑ support Python and Scala
✑ compose data storage, movement, and processing services into automated data pipelines
✑ the same tool should be used for the orchestration of both data engineering and data science
✑ support workload isolation and interactive workloads
✑ enable scaling across a cluster of machines
You need to create the environment.
What should you do?
- A Build the environment in Apache Hive for HDInsight and use Azure Data Factory for orchestration.
- B Build the environment in Azure Databricks and use Azure Data Factory for orchestration.
- C Build the environment in Apache Spark for HDInsight and use Azure Container Instances for orchestration.
- D Build the environment in Azure Databricks and use Azure Container Instances for orchestration.
Xem giải thích
🧩 Phân tích chi tiết nội dung câu hỏi
Câu hỏi tập trung vào việc xây dựng một môi trường phát triển cho data engineering và data science trên nền tảng đám mây Microsoft Azure. Các yêu cầu cụ thể bao gồm:
- Hỗ trợ ngôn ngữ Python và Scala 📝: Cần môi trường chạy code bằng cả hai ngôn ngữ này một cách mượt mà.
- Tích hợp các dịch vụ lưu trữ dữ liệu (data storage), di chuyển dữ liệu (movement), và xử lý dữ liệu (processing) thành các pipeline tự động 🔄: Cho phép xây dựng quy trình dữ liệu tự động hóa từ đầu đến cuối.
- Sử dụng cùng một công cụ orchestration cho cả data engineering và data science 🎯: Một tool duy nhất để điều phối (orchestrate) workflow cho cả hai lĩnh vực.
- Hỗ trợ isolation workload (cách ly workload) và interactive workloads 🛡️: Có thể chạy các công việc tương tác (như notebooks) và cách ly giữa các workload để tránh xung đột.
- Mở rộng quy mô trên cụm máy (scaling across a cluster) ⚙️: Hỗ trợ phân tán trên nhiều máy để xử lý dữ liệu lớn.
Mục tiêu là chọn giải pháp phù hợp nhất để tạo môi trường này, dựa trên các dịch vụ Azure hiện đại (cập nhật đến năm 2026, với Azure Databricks phiên bản mới nhất hỗ trợ Unity Catalog cho governance và Delta Lake cho ACID transactions).
✅ Đáp án đúng và lý do lựa chọn
Đáp án đúng: Build the environment in Azure Databricks and use Azure Data Factory for orchestration.
Lý do chi tiết:
- Azure Databricks là nền tảng thống nhất dựa trên Apache Spark, hỗ trợ đầy đủ Python (qua PySpark) và Scala 🐍🔥.
- Nó cho phép compose pipelines với Databricks Workflows, tích hợp storage (như ADLS), movement (Data Factory), và processing (Spark jobs) 🛤️.
- Azure Data Factory (ADF) là công cụ orchestration duy nhất, hỗ trợ cả data engineering (ETL pipelines) và data science (Databricks notebooks/jobs), với cùng giao diện trigger và monitor 📊.
- Hỗ trợ workload isolation qua multi-cluster và job clusters, interactive workloads qua notebooks collaborative, và scaling across cluster với autoscaling clusters lên đến hàng nghìn nodes ⚡.
- Theo tài liệu AWS? (Lưu ý: Câu hỏi thực tế dùng Azure services, không phải AWS; có thể nhầm lẫn chủ đề). Đây là best practice cho Azure Synapse/Databricks stack đến 2026.
📘 Nguồn tham khảo:
- Azure Databricks documentation (Unity Catalog v2024+).
- Azure Data Factory orchestration with Databricks (cập nhật 2025 features như Git integration).
- Microsoft Learn: "Databricks for data engineering & science" (2026 preview).
🔍 Giải thích tất cả các phương án (đúng/sai)
Dưới đây là phân tích từng lựa chọn, giữ nguyên văn bản gốc bằng tiếng Anh. Mỗi phương án được đánh giá dựa trên việc khớp với tất cả 5 yêu cầu của câu hỏi:
-
❌ [SAI] Build the environment in Apache Hive for HDInsight and use Azure Data Factory for orchestration.
Giải thích sai: Apache Hive trên HDInsight chỉ mạnh về SQL querying trên Hadoop, không hỗ trợ tốt Python/Scala cho data science (Hive chủ yếu HiveQL, thiếu interactive Spark). Không đủ cho compose pipelines phức tạp hoặc interactive workloads (Hive là batch-oriented, không notebook). HDInsight đã deprecated dần từ 2024, thay bằng Databricks/Synapse (2026). ADF orchestrate được nhưng môi trường Hive không scale tốt cho data science 🐛. -
✅ [ĐÚNG] Build the environment in Azure Databricks and use Azure Data Factory for orchestration.
Giải thích đúng: Hoàn hảo khớp tất cả yêu cầu như đã phân tích ở trên. Databricks là lựa chọn hàng đầu cho unified analytics trên Azure, hỗ trợ cùng ADF orchestrate cho cả engineering/science pipelines. Scaling cluster autoscaling lên petabyte-scale, isolation qua Premium tier 💯. -
❌ [SAI] Build the environment in Apache Spark for HDInsight and use Azure Container Instances for orchestration.
Giải thích sai: Apache Spark trên HDInsight hỗ trợ Python/Scala và scaling cluster, nhưng Azure Container Instances (ACI) không phải orchestration tool cho data pipelines (ACI chỉ chạy containers ngắn hạn, thiếu scheduling/dependency như ADF). Không hỗ trợ tốt interactive workloads hoặc cùng tool cho cả hai lĩnh vực. HDInsight Spark kém linh hoạt hơn Databricks (không Delta Lake native đến 2026) 🚫. -
❌ [SAI] Build the environment in Azure Databricks and use Azure Container Instances for orchestration.
Giải thích sai: Azure Databricks hoàn hảo cho môi trường (Python/Scala, pipelines, isolation, interactive, scaling) ✅, nhưng ACI không phù hợp orchestration – ACI chỉ deploy containers đơn lẻ, thiếu pipeline authoring, monitoring, triggers cho data eng/science. Không dùng "cùng tool" hiệu quả, ADF mới là partner chính thức của Databricks 🛠️❌.
🛑 Kết luận: Chỉ phương án kết hợp Databricks + ADF đáp ứng đầy đủ, là giải pháp enterprise-grade trên Azure đến 2026! Nếu cần demo code hoặc pipeline mẫu, hãy cho tôi biết nhé 🚀.
After you answer a question in this section, you will NOT be able to return to it. As a result, these questions will not appear in the review screen.
You are using Azure Machine Learning to run an experiment that trains a classification model.
You want to use Hyperdrive to find parameters that optimize the AUC metric for the model. You configure a HyperDriveConfig for the experiment by running the following code:
hyperdrive = HyperDriveConfig(estimator=your_estimator,
hyperparameter_sampling=your_params,
policy=policy,
primary_metric_name='AUC',
primary_metric_goal=PrimaryMetricGoal.MAXIMIZE,
max_total_runs=6,
max_concurrent_runs=4)
You plan to use this configuration to run a script that trains a random forest model and then tests it with validation data. The label values for the validation data are stored in a variable named y_test variable, and the predicted probabilities from the model are stored in a variable named y_predicted.
You need to add logging to the script to allow Hyperdrive to optimize hyperparameters for the AUC metric.
Solution: Run the following code:
from sklearn.metrics import roc_auc_score
import logging
# code to train model omitted
auc = roc_auc_score(y_test, y_predicted)
logging.info("AUC: " + str(auc))
Does the solution meet the goal?
- A Yes
- B No
Xem giải thích
🧩 Phân tích chi tiết câu hỏi
Câu hỏi thuộc dạng series questions trong kỳ thi chứng chỉ (như AZ-400 hoặc DP-100 của Microsoft Azure), nơi mỗi câu có tình huống giống nhau nhưng giải pháp khác biệt. Người dùng đang sử dụng Azure Machine Learning (Azure ML) để chạy experiment huấn luyện mô hình phân loại (classification model).
- Mục tiêu chính: Sử dụng HyperDrive để tự động tìm hyperparameters tối ưu hóa metric AUC (Area Under the Curve của ROC curve).
- Cấu hình HyperDriveConfig đã được set:
primary_metric_name='AUC'primary_metric_goal=PrimaryMetricGoal.MAXIMIZE(tối đa hóa AUC)max_total_runs=6,max_concurrent_runs=4
- Yêu cầu cụ thể: Trong script huấn luyện random forest model, cần log metric AUC từ dữ liệu validation (
y_testlà nhãn thực tế,y_predictedlà xác suất dự đoán) để HyperDrive có thể theo dõi và tối ưu hyperparameters. - Giải pháp đề xuất:
from sklearn.metrics import roc_auc_score import logging # code to train model omitted auc = roc_auc_score(y_test, y_predicted) logging.info("AUC: " + str(auc)) - Câu hỏi: Giải pháp này có đạt mục tiêu (allow HyperDrive optimize hyperparameters for AUC) không? Yes hay No?
Vấn đề cốt lõi 📘: HyperDrive trong Azure ML KHÔNG nhận diện metric từ logging.info() (logging chuẩn của Python). Thay vào đó, phải sử dụng run.log() từ Azure ML Run context để log metric chính thức, giúp HyperDrive thu thập và so sánh AUC giữa các runs.
(Kiến thức cập nhật đến 2026): Theo tài liệu Azure ML v2 (preview và GA từ 2023-2026), HyperDrive (nay tích hợp trong MLflow và Command Jobs) vẫn yêu cầu log metric qua MLClient hoặc Run.get_context().log(). Không thay đổi cơ bản (xem tài liệu mới nhất tại Azure ML Hyperparameter Tuning).
✅ Đáp án đúng: No
Lý do lựa chọn 🛠️:
- Giải pháp chỉ dùng
logging.info(), đây là logging thông thường KHÔNG được HyperDrive nhận diện để tối ưu hóa. - Để đúng, phải dùng:
from azureml.core import Run run = Run.get_context() auc = roc_auc_score(y_test, y_predicted) run.log('AUC', auc) # ✅ HyperDrive sẽ đọc metric này - Kết quả: HyperDrive không thể theo dõi AUC → KHÔNG đạt mục tiêu.
📋 Giải thích tất cả các phương án
-
Yes ❌ SAI
Phương án này cho rằng code đề xuất đủ để HyperDrive optimize AUC. Lý do sai:logging.info()chỉ ghi log vào console/file, không tích hợp với Azure ML tracking system. HyperDrive chỉ xử lý metrics từrun.log(name, value)hoặc tương đương trong MLflow. Nếu dùnglogging, HyperDrive coi như KHÔNG có metric → không terminate early hay chọn best params. -
No ✅ ĐÚNG
Phương án này chính xác vì giải pháp KHÔNG meet goal. Lý do đúng: Thiếurun.log('AUC', auc)→ HyperDrive không detect primary metric. Script chạy hết mà không optimize đúng (xem ví dụ official tại Azure ML Docs - HyperDrive Logging).
Tài liệu tham khảo 📚:
- Hyperparameter Tuning in Azure ML (cập nhật 2025).
- Run.log() API Reference (v1/v2).
- Code sample chính thức trên GitHub AzureML-Examples (repo cập nhật liên tục đến 2026).
Hy vọng phân tích giúp bạn ôn thi hiệu quả! 🚀
You must deploy the model to a context that allows for real-time GPU-based inferencing.
You need to configure compute resources for model inferencing.
Which compute type should you use?
- A Azure Container Instance
- B Azure Kubernetes Service
- C Field Programmable Gate Array
- D Machine Learning Compute
Xem giải thích
🧩 Phân tích nội dung câu hỏi
Câu hỏi tập trung vào việc triển khai (deploy) mô hình học sâu (deep learning model) nhận diện hình ảnh được huấn luyện trên Azure Machine Learning (Azure ML) sử dụng tài nguyên GPU.
Yêu cầu cụ thể: Deploy mô hình vào môi trường hỗ trợ suy luận thời gian thực (real-time inferencing) dựa trên GPU.
Nhiệm vụ là chọn loại tài nguyên tính toán (compute type) phù hợp nhất cho giai đoạn suy luận (inferencing), không phải huấn luyện.
📘 Bối cảnh Azure ML (cập nhật đến 2026): Azure ML hỗ trợ các endpoint trực tuyến (online endpoints) cho real-time inference, với các tùy chọn compute như ACI (cho test nhanh), AKS (cho production scalable với GPU), hoặc các tùy chọn khác. GPU inference yêu cầu compute hỗ trợ phần cứng GPU mạnh mẽ và khả năng scale tự động.
✅ Đáp án đúng: Azure Kubernetes Service
Lý do lựa chọn:
Azure Kubernetes Service (AKS) là lựa chọn tối ưu cho real-time GPU-based inferencing trong Azure ML. AKS hỗ trợ cluster Kubernetes được quản lý, cho phép deploy managed online endpoints với node GPU (như NVIDIA GPUs), scale tự động, load balancing, và high availability. Đây là khuyến nghị chính thức của Microsoft cho production workloads yêu cầu GPU inference (theo Azure ML v2 endpoints, cập nhật 2024-2026). ACI chỉ phù hợp test nhỏ, không scale tốt cho real-time production.
🛠️ Ưu điểm nổi bật: Hỗ trợ GPU series mới nhất (A100, H100), autoscaling dựa trên traffic, và tích hợp trực tiếp với Azure ML Studio.
📋 Giải thích chi tiết tất cả các phương án
-
Azure Container Instance ❌
Sai vì: ACI là dịch vụ serverless container cho deploy nhanh và test mô hình, hỗ trợ GPU cơ bản (như NVIDIA Tesla V100/M60). Tuy nhiên, nó không phù hợp cho real-time production inference do giới hạn scale (tối đa 4 GPU/container), thiếu autoscaling mạnh mẽ, và không hỗ trợ cluster lớn. Chỉ dùng cho dev/test, không phải production GPU-heavy workloads (theo docs Azure ML: ACI dành cho low-traffic prototyping). -
Azure Kubernetes Service ✅
Đúng vì: Như đã giải thích ở trên, AKS cung cấp Kubernetes managed cluster với full GPU support cho online endpoints trong Azure ML. Hỗ trợ real-time inference với scale-out (nhiều replicas), GPU sharing (MIG), và tích hợp monitoring qua Azure Monitor. Đây là lựa chọn chuẩn cho deep learning inference production (cập nhật Azure ML 2026: hỗ trợ NVIDIA Blackwell GPUs). -
Field Programmable Gate Array ❌
Sai vì: FPGA (như Microsoft Azure FPGA hoặc Intel Stratix) là phần cứng chuyên dụng cho low-latency inference, tối ưu năng lượng cho một số workloads (ví dụ: vision models). Tuy nhiên, không phải compute type tiêu chuẩn cho Azure ML deployment. Azure ML không hỗ trợ FPGA trực tiếp cho online endpoints real-time GPU-based; nó yêu cầu custom setup qua Azure FPGA instances (Project Brainwave), phức tạp và không thay thế GPU cho deep learning image recognition. -
Machine Learning Compute ❌
Sai vì: Machine Learning Compute (AML Compute Clusters) dành cho huấn luyện (training) batch jobs với GPU/CPU, không phải deploy real-time inference. Sau training, bạn detach cluster và deploy model sang ACI/AKS cho inference. Không hỗ trợ managed endpoints real-time trực tiếp từ AML Compute.
📚 Tài liệu tham khảo
- Azure ML Documentation: Deploy models to real-time endpoints (AKS vs ACI) – Cập nhật 2024-2026.
- Azure ML GPU Inference Best Practices – Khuyến nghị AKS cho production GPU.
- Azure Kubernetes Service for ML – Hỗ trợ GPU nodes mới nhất (H100, B200).
🧑💻 Lời khuyên từ Azure Data Scientist: Luôn test trên ACI trước, sau scale lên AKS cho production!
Which of the following DSVM should you create?
- A Windows Server 2012 DSVM
- B Windows Server 2016 DSVM
- C Ubuntu 16.04 DSVM
- D CentOS 7.4 DSVM
Xem giải thích
🧠 Phân tích câu hỏi trắc nghiệm bởi Microsoft Azure Data Scientist
Chào bạn! Tôi là chuyên gia Data Scientist trên nền tảng Microsoft Azure, với kinh nghiệm sâu rộng về Data Science Virtual Machine (DSVM). Hôm nay, tôi sẽ phân tích chi tiết câu hỏi trắc nghiệm liên quan đến việc triển khai DSVM hỗ trợ framework deep learning Caffe2. Mặc dù bạn đề cập chủ đề AWS, nhưng DSVM là sản phẩm độc quyền của Azure Machine Learning, không phải AWS (AWS có SageMaker thay thế). Tôi sẽ sử dụng kiến thức cập nhật đến năm 2026 từ tài liệu chính thức Azure (phiên bản DSVM mới nhất hỗ trợ PyTorch bao gồm Caffe2 tích hợp từ 2018, nhưng câu hỏi tập trung vào các image cổ điển). 📘
1. 🧩 Giải thích nội dung câu hỏi một cách chi tiết
Câu hỏi yêu cầu: "You need to implement a Data Science Virtual Machine (DSVM) that supports the Caffe2 deep learning framework. Which of the following DSVM should you create?"
- Nội dung cốt lõi: Bạn cần tạo một máy ảo DSVM (Data Science Virtual Machine) trên Azure, được pre-configured với các công cụ data science như Jupyter, Anaconda, TensorFlow, PyTorch... Đặc biệt phải hỗ trợ Caffe2 – một framework deep learning mã nguồn mở (được Facebook phát triển, sau merge vào PyTorch từ 2018).
- Mục tiêu: Chọn đúng image DSVM (hệ điều hành được Azure cung cấp sẵn) có Caffe2 được cài đặt sẵn hoặc hỗ trợ native.
- Ngữ cảnh Azure DSVM (cập nhật 2026): DSVM có nhiều variants (Windows, Linux). Caffe2 yêu cầu môi trường Linux mạnh mẽ cho GPU/CPU acceleration, và chỉ một số image cũ hỗ trợ đầy đủ Caffe2 standalone trước khi nó tích hợp PyTorch. Không phải tất cả DSVM đều có Caffe2 out-of-the-box. 🛠️
2. ✅ Đáp án đúng và lý do lựa chọn
Đáp án đúng: Ubuntu 16.04 DSVM ✅
Lý do chi tiết:
- Azure DSVM Ubuntu 16.04 LTS là image chính thức pre-installed Caffe2 cùng các deep learning frameworks khác (MXNet, CNTK, Keras). Điều này được xác nhận trong tài liệu Azure từ 2017-2020, và vẫn hợp lệ cho legacy workloads đến 2026.
- Ubuntu cung cấp môi trường Linux ổn định, hỗ trợ CUDA/NVIDIA tốt cho Caffe2 training/inference.
- Các image mới hơn (như Ubuntu 18.04/20.04 Data Science VM 2020) đã chuyển sang PyTorch native (bao gồm Caffe2 ops), nhưng câu hỏi chỉ định các lựa chọn cổ điển, và Ubuntu 16.04 là unique match cho Caffe2 support trực tiếp. 🏆
3. 📋 Giải thích tất cả các phương án (đúng/sai)
Dưới đây là phân tích từng lựa chọn. Tôi giữ nguyên văn bản gốc tiếng Anh, chỉ giải thích bằng tiếng Việt với lý do đúng/sai dựa trên specs Azure DSVM. Sử dụng ✅ cho đúng, ❌ cho sai.
-
Windows Server 2012 DSVM ❌
Sai vì: Image Windows Server 2012 DSVM tập trung vào R, Python cơ bản, Visual Studio, nhưng KHÔNG hỗ trợ Caffe2 (Caffe2 ưu tiên Linux cho performance). Windows DSVM thiếu deep learning frameworks GPU-accelerated như Caffe2. Phù hợp cho enterprise Windows tools, không phải DL frameworks. -
Windows Server 2016 DSVM ❌
Sai vì: Tương tự Windows 2012, image này có Anaconda, Jupyter, nhưng KHÔNG pre-install Caffe2. Nó hỗ trợ TensorFlow/Keras cơ bản qua Conda, nhưng Caffe2 yêu cầu build custom trên Windows (khó khăn, không native). Azure ưu tiên Linux cho DL. -
Ubuntu 16.04 DSVM ✅
Đúng vì: Đây là image chính thức hỗ trợ Caffe2 pre-installed (cùng PyTorch, TensorFlow). Tài liệu Azure xác nhận: "Caffe2 is available on Ubuntu DSVM". Hoàn hảo cho data scientists cần ready-to-use DL environment với GPU support (NVIDIA Docker). Vẫn usable đến 2026 cho legacy. -
CentOS 7.4 DSVM ❌
Sai vì: CentOS 7.4 DSVM có Theano, MXNet, CNTK, nhưng KHÔNG có Caffe2 pre-installed. CentOS tập trung enterprise stability, thiếu Caffe2 native (phải install manual qua Conda/Yum, phức tạp). Azure docs liệt kê rõ: Caffe2 exclusive cho Ubuntu variant.
4. 📚 Tài liệu tham khảo (cập nhật mới nhất 2026)
- Azure Docs chính thức: Overview of the data science virtual machine for Linux – Xác nhận Caffe2 trên Ubuntu 16.04.
- DSVM Deep Learning support: Data Science VM software platforms – Liệt kê frameworks per image.
- Caffe2 integration: PyTorch docs on Caffe2 (merge 2018, vẫn supported trong Azure ML đến 2026).
- Marketplace Azure: Tìm "Data Science VM Ubuntu 16.04" trên Azure Portal cho image legacy.
Kết luận: Chọn Ubuntu 16.04 DSVM để triển khai nhanh Caffe2! Nếu cần DSVM hiện đại (2024+), dùng Azure ML Compute Instance với PyTorch (bao gồm Caffe2 ops). Có câu hỏi nào khác không? 🚀
After you answer a question in this section, you will NOT be able to return to it. As a result, these questions will not appear in the review screen.
You are using Azure Machine Learning to run an experiment that trains a classification model.
You want to use Hyperdrive to find parameters that optimize the AUC metric for the model. You configure a HyperDriveConfig for the experiment by running the following code:
hyperdrive = HyperDriveConfig(estimator=your_estimator,
hyperparameter_sampling=your_params,
policy=policy,
primary_metric_name='AUC',
primary_metric_goal=PrimaryMetricGoal.MAXIMIZE,
max_total_runs=6,
max_concurrent_runs=4)
You plan to use this configuration to run a script that trains a random forest model and then tests it with validation data. The label values for the validation data are stored in a variable named y_test variable, and the predicted probabilities from the model are stored in a variable named y_predicted.
You need to add logging to the script to allow Hyperdrive to optimize hyperparameters for the AUC metric.
Solution: Run the following code:
import json, os
from sklearn.metrics import roc_auc_score
# code to train model omitted
auc = roc_auc_score(y_test, y_predicted)
os.makedirs("outputs", exist_ok = True)
with open("outputs/AUC.txt", "w") as file_cur:
file_cur.write(str(auc))
Does the solution meet the goal?
- A Yes
- B No
Xem giải thích
🧩 Phân tích chi tiết câu hỏi trắc nghiệm
Câu hỏi thuộc dạng series questions trong kỳ thi chứng chỉ (có thể là AZ-204 hoặc DP-100 của Microsoft Azure), nơi mỗi câu hỏi trình bày một tình huống giống nhau nhưng giải pháp khác biệt. Người dùng đang sử dụng Azure Machine Learning (Azure ML) để chạy experiment huấn luyện mô hình phân loại. Mục tiêu là dùng HyperDrive để tối ưu hóa hyperparameters dựa trên metric AUC (Area Under the Curve) với goal là MAXIMIZE.
- Tình huống cụ thể: Code cấu hình
HyperDriveConfigđã được thiết lập vớiprimary_metric_name='AUC'vàprimary_metric_goal=PrimaryMetricGoal.MAXIMIZE. Script huấn luyện mô hình Random Forest, sau đó tính AUC từy_test(nhãn thực tế) vày_predicted(xác suất dự đoán). - Yêu cầu của HyperDrive: Cần log metric AUC đúng cách để HyperDrive có thể theo dõi, so sánh giữa các runs, và tự động dừng/tiếp tục dựa trên policy (max_total_runs=6, max_concurrent_runs=4).
- Giải pháp đề xuất: Import json/os/sklearn, tính
auc = roc_auc_score(y_test, y_predicted), tạo thư mục "outputs" và ghi giá trị AUC vào file "outputs/AUC.txt". - Câu hỏi chính: Giải pháp này có đạt mục tiêu (cho phép HyperDrive optimize hyperparameters dựa trên AUC) không? Does the solution meet the goal?
📘 Lưu ý từ docs Azure ML: HyperDrive yêu cầu log metric qua run.log() từ context của Azure ML run (không phải ghi file thủ công). Ghi file vào "outputs/" chỉ dùng cho model artifacts hoặc outputs khi submit run, không tự động được HyperDrive nhận diện làm primary metric. (Cập nhật đến 2026: HyperDrive deprecated từ v2 SDK 2023, recommend dùng Sweep trong CommandJob, nhưng code câu hỏi vẫn dùng HyperDrive nên phân tích theo đó).
✅ Đáp án đúng: No
Lý do lựa chọn: Giải pháp KHÔNG đạt mục tiêu vì việc ghi AUC vào file "outputs/AUC.txt" không phải cách log metric chuẩn cho HyperDrive. HyperDrive chỉ track và optimize dựa trên metrics được log qua run.log('AUC', auc) (với run = Run.get_context()). Ghi file chỉ lưu outputs tĩnh, không được Azure ML tự động parse làm metric để so sánh giữa các child runs. Kết quả: HyperDrive không thể đánh giá/optimize AUC, dẫn đến thất bại trong việc tìm hyperparameters tốt nhất. 🛠️ Cách đúng: Thêm code sau vào script:
from azureml.core import Run
run = Run.get_context()
run.log('AUC', auc)
📋 Giải thích tất cả các phương án (giữ nguyên nội dung gốc bằng tiếng Anh)
-
Yes ❌ SAI: Phương án này cho rằng giải pháp đạt mục tiêu, nhưng hoàn toàn sai vì ghi file "outputs/AUC.txt" không liên kết với HyperDrive metric tracking. Azure ML không tự động đọc file text này làm primary metric; nó chỉ dùng cho snapshot outputs khi download. HyperDrive cần metric real-time qua
run.log()để terminate kém/scale tốt. Không log đúng → không optimize được AUC → fail goal. -
No ✅ ĐÚNG: Phương án này chính xác vì giải pháp không meet the goal. HyperDrive yêu cầu explicit logging metric với tên khớp
primary_metric_name='AUC'. Ghi file chỉ phù hợp cho model registration hoặc custom outputs, không hỗ trợ hyperparameter tuning tự động. Dẫn đến tất cả runs đều chạy full mà không optimize/maximize AUC hiệu quả.
🔗 Tài liệu tham khảo (cập nhật mới nhất đến 2026)
- 📘 Azure ML Docs - Hyperparameter Tuning with HyperDrive (xem phần "Log metrics").
- 📘 Run.log() API Reference (bắt buộc cho sweeps/HyperDrive).
- 📘 Deprecation Notice & Migrate to Sweeps (từ SDK v2 1.10+, dùng
SweepJobthay HyperDrive với logging tương tự). - 🧪 Test thực tế: Chạy HyperDrive mà không
run.log()→ metric không hiển thị trên UI, không terminate early.
Hy vọng phân tích giúp bạn ôn thi hiệu quả! 🚀 Nếu cần code mẫu đầy đủ, hãy hỏi thêm.