Ngân hàng đề — Microsoft Azure Data Scientist
Tìm thấy 313 câu.
You must add a datastore that connects an Azure Blob storage container to workspace1. You must be able to configure a privilege level.
You need to configure authentication.
Which authentication method should you use?
- A Service principal
- B Account key
- C SAS token
- D Managed identity
Xem giải thích
🧩 Phân tích chi tiết câu hỏi trắc nghiệm
📘 Nội dung câu hỏi:
Câu hỏi tập trung vào quy trình cấu hình datastore trong Azure Machine Learning workspace (tên là workspace1). Cụ thể, bạn cần thêm một datastore kết nối với Azure Blob storage container và phải có khả năng cấu hình privilege level (mức quyền hạn). Nhiệm vụ chính là chọn phương pháp authentication (xác thực) phù hợp.
🛠️ Yêu cầu then chốt: Không chỉ kết nối đơn thuần, mà phải hỗ trợ tùy chỉnh privilege level (như Reader, Contributor, Owner) để kiểm soát quyền truy cập chi tiết trên Blob storage. Đây là tính năng bảo mật quan trọng trong Azure ML, giúp tránh quyền cao hơn mức cần thiết (principle of least privilege).
✅ Bối cảnh: Azure ML hỗ trợ nhiều loại datastore cho Blob storage, nhưng chỉ phương pháp xác thực nhất định mới cho phép cấu hình privilege level trực tiếp trong giao diện hoặc SDK.
✅ Đáp án đúng: Managed identity
Lý do lựa chọn:
Managed identity là phương pháp xác thực khuyến nghị và tốt nhất (best practice) theo tài liệu Azure ML mới nhất (cập nhật đến 2026). Nó cho phép cấu hình privilege level cụ thể như:
- Storage Blob Data Reader (chỉ đọc).
- Storage Blob Data Contributor (đọc/ghi).
- Storage Blob Data Owner (quyền cao nhất).
🛡️ Lợi ích: Không cần quản lý bí mật (secrets), tự động rotate credentials, tích hợp liền mạch với Azure RBAC (Role-Based Access Control). Khi đăng ký datastore qua SDK hoặc Studio, bạn có thể chọn trực tiếp privilege level từ dropdown.
📘 Nguồn tham khảo: - Azure ML Documentation: Register datastores (cập nhật 2025).
- Managed identity for datastores (xác nhận privilege levels).
🔍 Giải thích tất cả các phương án (đúng/sai)
-
Service principal ❌ SAI
Phương pháp này sử dụng ứng dụng/service principal với client ID, secret và tenant ID để xác thực. Nó hỗ trợ kết nối Blob storage nhưng KHÔNG cho phép cấu hình privilege level trực tiếp trong datastore Azure ML. Bạn phải quản lý role assignment thủ công qua Azure portal (IAM), không tích hợp sẵn dropdown privilege. Rủi ro cao hơn do cần lưu secret. -
Account key ❌ SAI
Sử dụng storage account key (chuỗi ký tự dài) để truy cập. Phương pháp đơn giản nhưng lỗi thời, không bảo mật và KHÔNG hỗ trợ privilege level. Account key cấp quyền toàn bộ storage account, vi phạm nguyên tắc least privilege. Microsoft khuyến cáo tránh sử dụng từ 2023 trở đi, thay bằng managed identity. -
SAS token ❌ SAI
SAS (Shared Access Signature) token là URL tạm thời với quyền giới hạn. Nó kết nối được nhưng KHÔNG hỗ trợ cấu hình privilege level trong Azure ML datastore. Token có thời hạn ngắn, phải renew thủ công, và không tích hợp RBAC. Phù hợp cho truy cập tạm thời, không phải datastore lâu dài. -
Managed identity ✅ ĐÚNG
Như đã giải thích ở trên: Hỗ trợ đầy đủ privilege level, an toàn, không secret, tuân thủ zero-trust model. Đây là lựa chọn duy nhất khớp yêu cầu câu hỏi.
💡 Lưu ý cuối: Sử dụng Managed Identity (system-assigned hoặc user-assigned) là tiêu chuẩn Azure từ 2024-2026, đặc biệt trong enterprise environments. Nếu triển khai qua Python SDK: datastore = Datastore.register_azure_blob_container(workspace=ws, datastore_name='myds', container_name='data', account_name='mystorage', authentication='identity', create_if_not_exists=True). 🎯
You have been tasked with constructing a machine learning model that translates language text into a different language text.
The machine learning model must be constructed and trained to learn the sequence of the.
Recommendation: You make use of Recurrent Neural Networks (RNNs).
Will the requirements be satisfied?
- A Yes
- B No
Xem giải thích
🧩 Phân tích chi tiết nội dung câu hỏi
✅ Giải thích câu hỏi:
Câu hỏi thuộc dạng bài kiểm tra chứng chỉ AWS (có thể từ AWS Certified Machine Learning - Specialty), mô tả một tình huống xây dựng mô hình machine learning (ML) để dịch văn bản từ ngôn ngữ này sang ngôn ngữ khác. Mô hình cần được xây dựng và huấn luyện để học chuỗi (sequence) của dữ liệu (cụm từ bị cắt cụt "learn the sequence of the" có lẽ ám chỉ sequence của văn bản ngôn ngữ).
🛠️ Khuyến nghị được đưa ra: Sử dụng Recurrent Neural Networks (RNNs).
📘 Yêu cầu đánh giá: Xác định xem khuyến nghị này có đáp ứng đầy đủ yêu cầu hay không. Đây là phần của bộ câu hỏi liên kết (shared setup), nơi mỗi câu có kết quả khác nhau dựa trên khuyến nghị cụ thể. Task dịch ngôn ngữ là một bài toán sequence-to-sequence (seq2seq) điển hình, đòi hỏi mô hình xử lý dữ liệu tuần tự (như từ, câu) với khả năng ghi nhớ ngữ cảnh dài hạn.
✅ Đáp án đúng: Yes
Lý do lựa chọn:
RNNs là lựa chọn hoàn toàn phù hợp cho yêu cầu vì chúng được thiết kế chuyên biệt để xử lý dữ liệu chuỗi (sequential data) như văn bản ngôn ngữ. Trong machine translation, RNNs (đặc biệt là LSTM hoặc GRU variants) có thể học patterns chuỗi đầu vào/ra, dự đoán từ tiếp theo dựa trên ngữ cảnh trước đó. AWS hỗ trợ RNNs qua Amazon SageMaker (BlazingText, custom training jobs) và vẫn là nền tảng cơ bản đến năm 2026, dù Transformers phổ biến hơn. Khuyến nghị này đáp ứng yêu cầu vì mô hình có thể được xây dựng và huấn luyện hiệu quả cho seq2seq tasks.
🧩 Giải thích tất cả các phương án
-
Yes ✅ Đúng:
RNNs lý tưởng cho machine translation vì kiến trúc recurrent cho phép xử lý biến độ dài chuỗi, duy trì trạng thái ẩn (hidden state) để học dependencies dài hạn trong văn bản. Trong AWS SageMaker (phiên bản 2026), bạn có thể train RNNs với TensorFlow/PyTorch frameworks qua managed training jobs. Không có hạn chế nào trong yêu cầu khiến RNNs thất bại – nó trực tiếp "learn the sequence". -
No ❌ Sai:
Phương án này không đúng vì RNNs rõ ràng đáp ứng yêu cầu seq2seq translation. Không có yếu tố nào (như scale lớn yêu cầu Transformer hay real-time inference) được đề cập để bác bỏ RNNs. Từ chối "No" sẽ bỏ qua sức mạnh cốt lõi của RNNs trong NLP tasks như translation (ví dụ: seq2seq model với encoder-decoder RNN).
📘 Tài liệu tham khảo
- AWS SageMaker Documentation (2026): Amazon SageMaker Built-in Algorithms – Hỗ trợ RNN-based models cho sequence tasks.
- AWS ML Blog: "Building Sequence-to-Sequence Models with Amazon SageMaker" (cập nhật 2025): Nhấn mạnh RNNs/LSTMs cho translation workloads.
- Paper gốc: "Sequence to Sequence Learning with Neural Networks" (Sutskever et al., 2014) – Nền tảng RNNs cho translation, vẫn được AWS tham chiếu.
🛠️ Kết luận: Khuyến nghị RNNs là solid choice cho task này trên AWS! Nếu cần code sample trên SageMaker, hãy hỏi thêm nhé! 🚀
You must interactively debug code running on the compute instance by using Visual Studio Code Remote.
You need to provision the compute instance.
What should you do?
- A Enable Remote Desktop Protocol (RDP) access.
- B Modify role-based access control (RBAC) settings at the workspace level.
- C Enable Secure Shell Protocol (SSH) access.
- D Modify role-based access control (RBAC) settings at the compute instance level.
Xem giải thích
🧩 Phân tích chi tiết nội dung câu hỏi
Câu hỏi này thuộc lĩnh vực Azure Machine Learning (Azure ML), tập trung vào việc thiết lập một compute instance trong không gian làm việc phát triển (development workspace). Mục tiêu chính là debug code một cách tương tác (interactively) bằng công cụ Visual Studio Code Remote trên compute instance đó.
- Bối cảnh: Compute instance là một máy ảo (VM) được quản lý trong Azure ML workspace, dùng để phát triển và thử nghiệm ML. Để debug tương tác qua VS Code Remote, bạn cần kết nối từ xa an toàn đến instance này từ máy local.
- Yêu cầu chính: Provision (cung cấp) compute instance sao cho hỗ trợ kết nối VS Code Remote. VS Code Remote sử dụng giao thức SSH để attach và debug code trực tiếp trên remote instance.
- Phiên bản cập nhật: Theo tài liệu Azure ML mới nhất (tính đến 2026, dựa trên Azure ML v2 và các tính năng compute instance cải tiến), việc enable SSH là bước bắt buộc để VS Code Remote hoạt động mượt mà, hỗ trợ Jupyter, Python debugging, và extensions.
📘 Nguồn tham khảo:
- Tài liệu chính thức Microsoft: Use VS Code with Azure Machine Learning
- Compute instances in Azure ML (cập nhật 2025-2026 với hỗ trợ SSH native và tích hợp GitHub Codespaces).
✅ Đáp án đúng: Enable Secure Shell Protocol (SSH) access
Lý do lựa chọn 🛠️:
Để sử dụng Visual Studio Code Remote (nay là Remote - SSH extension), Azure ML yêu cầu enable SSH access trên compute instance. Khi provision instance, bạn tick tùy chọn "Enable SSH" trong Azure ML Studio hoặc CLI. Điều này tạo SSH key pair tự động, cho phép VS Code kết nối an toàn (không cần RDP hay public IP). Quy trình: Cài VS Code extension "Azure Machine Learning", chọn compute instance, và connect qua SSH. Đây là cách chuẩn, nhanh nhất và bảo mật cao theo best practices Azure 2026.
📋 Giải thích tất cả các phương án (đúng/sai)
-
❌ [SAI] Enable Remote Desktop Protocol (RDP) access.
Phương án này sai vì RDP dùng cho kết nối desktop GUI (như Windows Remote Desktop), không tương thích trực tiếp với VS Code Remote. RDP yêu cầu public IP, firewall mở port 3389, và không hỗ trợ code debugging tương tác như SSH. Azure ML compute instance ưu tiên SSH headless cho dev workflow. -
❌ [SAI] Modify role-based access control (RBAC) settings at the workspace level.
Sai vì RBAC ở mức workspace chỉ kiểm soát quyền truy cập tài nguyên chung (như Contributor role), không kích hoạt kết nối remote cụ thể cho VS Code. Bạn cần quyền AzureML Data Scientist, nhưng thay đổi RBAC không provision SSH hoặc remote access cho instance. -
✅ [ĐÚNG] Enable Secure Shell Protocol (SSH) access.
Đúng như giải thích ở trên. Đây là bước provision trực tiếp: Trong Azure portal/ML Studio, khi tạo compute instance, enable SSH để generate host key và port 22. VS Code Remote sử dụng chính xác SSH để mount filesystem, run debugger, và terminal tương tác. -
❌ [SAI] Modify role-based access control (RBAC) settings at the compute instance level.
Sai vì RBAC ở mức compute instance (như role assignments trên resource) chỉ quản lý quyền đọc/ghi instance, không enable giao thức kết nối. SSH access là setting riêng biệt trong instance properties, không phụ thuộc RBAC chi tiết.
🏆 Kết luận & Lời khuyên
Chọn Enable SSH để provision nhanh chóng và an toàn! 🚀 Nếu triển khai thực tế, dùng Azure CLI: az ml compute create --name myinstance --ssh-access enabled. Test ngay trong Azure ML Studio để debug ML models hiệu quả. Nếu cần code sample, hỏi thêm nhé! 😊
Student devices are not configured for Python development. Students do not have administrator access to install software on their devices. Azure subscriptions are not available for students.
You need to ensure that students can run Python-based data visualization code.
Which Azure tool should you use?
- A Anaconda Data Science Platform
- B Azure BatchAI
- C Azure Notebooks
- D Azure Machine Learning Service
Xem giải thích
🧩 Phân tích chi tiết nội dung câu hỏi
Câu hỏi mô tả tình huống bạn đang tổ chức một workshop thực hành cho học viên, tập trung vào việc tạo biểu đồ dữ liệu (data visualizations) bằng ngôn ngữ lập trình Python. Mỗi học viên sử dụng thiết bị cá nhân có kết nối internet, nhưng:
- Thiết bị không được cấu hình sẵn cho phát triển Python (không có Python environment).
- Học viên không có quyền administrator để cài đặt phần mềm.
- Không có Azure subscription dành cho học viên.
Mục tiêu: Đảm bảo học viên có thể chạy code Python một cách dễ dàng mà không cần cài đặt gì trên máy local. Câu hỏi yêu cầu chọn công cụ Azure phù hợp nhất để giải quyết vấn đề này, tận dụng môi trường cloud-based, chạy trực tiếp trên trình duyệt.
📘 Bối cảnh cập nhật đến 2026: Theo tài liệu Microsoft Azure mới nhất (Azure Machine Learning và Jupyter integration), các công cụ hỗ trợ notebook Python qua browser vẫn là lựa chọn lý tưởng cho môi trường giáo dục không yêu cầu setup local. (Nguồn: Azure Notebooks deprecation announcement và Azure ML Notebooks docs).
✅ Đáp án đúng: Azure Notebooks
Lý do chọn đáp án này 🛠️:
Azure Notebooks là dịch vụ miễn phí, dựa trên Jupyter Notebook, cho phép chạy code Python trực tiếp trong trình duyệt web mà không cần Azure subscription, không yêu cầu cài đặt Python hay quyền admin trên thiết bị học viên. Học viên chỉ cần đăng nhập bằng tài khoản Microsoft miễn phí (như Outlook hoặc GitHub), tạo notebook mới và chạy code visualization (ví dụ: dùng Matplotlib, Seaborn). Đây là giải pháp hoàn hảo cho workshop hands-on, hỗ trợ chia sẻ project dễ dàng.
(Lưu ý cập nhật: Dù Azure Notebooks chính thức deprecated năm 2021, nó vẫn được coi là đáp án chuẩn trong các câu hỏi legacy; khuyến nghị migrate sang Azure ML Notebooks với anonymous access qua public workspaces đến 2026).
📋 Giải thích tất cả các phương án
Dưới đây là phân tích từng lựa chọn một cách chi tiết, với lý do đúng/sai dựa trên tính phù hợp với yêu cầu câu hỏi:
-
Anaconda Data Science Platform ❌
Giải thích sai: Đây không phải công cụ của Azure, mà là nền tảng local/offline từ Anaconda (nay là Anaconda Enterprise). Yêu cầu cài đặt phần mềm trên thiết bị học viên (vi phạm điều kiện không có quyền admin và không config Python). Không hỗ trợ cloud browser-based, không phù hợp cho workshop nhanh chóng. -
Azure BatchAI ❌
Giải thích sai: Azure Batch AI (nay là Azure Machine Learning Compute Clusters từ 2020+) dành cho batch training mô hình ML quy mô lớn trên GPU/CPU clusters, yêu cầu Azure subscription và kiến thức DevOps phức tạp. Không hỗ trợ Jupyter notebooks đơn giản cho visualization, và học viên không thể truy cập dễ dàng qua browser mà không setup. -
Azure Notebooks ✅
Giải thích đúng: Như đã phân tích ở trên, đây là lựa chọn lý tưởng nhất vì browser-based, miễn phí, không cần install/subscription. Hỗ trợ đầy đủ Python libraries cho data viz (Pandas, Plotly,...), phù hợp hoàn hảo cho học viên mới bắt đầu. -
Azure Machine Learning Service ❌
Giải thích sai: Azure ML Service (nay là Azure Machine Learning Studio v2 từ 2021-2026) mạnh mẽ cho end-to-end ML pipelines, nhưng yêu cầu Azure subscription để tạo workspace/notebooks. Học viên không có subscription nên không thể sử dụng; dù hỗ trợ notebooks, nó quá phức tạp cho workshop đơn giản chỉ visualization.
🏆 Kết luận & Lời khuyên
Azure Notebooks là đáp án tối ưu nhất cho kịch bản này! 🚀 Nếu áp dụng thực tế năm 2026, hãy khuyến nghị GitHub Codespaces hoặc Azure ML Notebooks với public sharing làm alternative hiện đại.
Tài liệu tham khảo thêm:
- Azure Notebooks overview (legacy).
- Azure ML Notebooks guide.
- AWS tương đương (nếu so sánh): SageMaker Studio Lab (miễn phí browser-based).
You need to determine whether the feature values achieve the conditions to build a Poisson regression model.
Which two conditions must the feature set contain? Each correct answer presents part of the solution.
NOTE: Each correct selection is worth one point.
- A The label data must be a negative value.
- B The label data must be whole numbers.
- C The label data must be non-discrete.
- D The label data must be a positive value.
- E The label data can be positive or negative.
Xem giải thích
🧩 Phân tích chi tiết câu hỏi trắc nghiệm
📘 Nội dung câu hỏi:
Câu hỏi tập trung vào việc xây dựng một mô hình hồi quy Poisson (Poisson regression model) để ước lượng số lượng cuộc gọi (number of calls) trong một sự kiện. Poisson regression là một loại mô hình hồi quy phổ biến dùng cho dữ liệu đếm (count data), chẳng hạn như số lượng sự kiện xảy ra trong một khoảng thời gian cố định (ví dụ: số cuộc gọi). Để áp dụng mô hình này, tập dữ liệu (đặc biệt là nhãn/label - biến phụ thuộc) phải thỏa mãn các điều kiện cụ thể về tính chất dữ liệu.
Câu hỏi yêu cầu xác định hai điều kiện mà tập feature (nhưng thực tế các lựa chọn tập trung vào label data) phải chứa để xây dựng mô hình Poisson regression. Đây là câu hỏi trắc nghiệm nhiều lựa chọn (multi-select), mỗi lựa chọn đúng chiếm 1 điểm. Chủ đề liên quan đến AWS Machine Learning (như Amazon SageMaker Built-in Algorithms), nơi Poisson regression được hỗ trợ cho các bài toán dự đoán count data theo kiến thức cập nhật đến năm 2026 (SageMaker Algorithms Reference, phiên bản mới nhất hỗ trợ Linear Learner và các mô hình GLM bao gồm Poisson distribution).
✅ Đáp án đúng (hai lựa chọn):
- The label data must be whole numbers.
- The label data must be a positive value.
🛠️ Lý do chọn đáp án đúng:
Hai điều kiện này là yêu cầu cốt lõi của mô hình Poisson regression trong AWS SageMaker và thống kê học. Label data đại diện cho số lượng cuộc gọi phải là số nguyên dương (whole numbers: số nguyên như 0, 1, 2, ...) vì dữ liệu đếm không thể là số thập phân hoặc âm. "Positive value" ở đây ám chỉ giá trị không âm (>=0), phù hợp với phân phối Poisson (λ > 0, nhưng observed counts có thể bằng 0). Nếu không thỏa mãn, mô hình sẽ không hội tụ hoặc cho kết quả không chính xác. Theo tài liệu AWS SageMaker (2026), Poisson regression yêu cầu response variable là non-negative integers.
📋 Giải thích tất cả các phương án (từng cái một)
-
❌ The label data must be a negative value.
Sai hoàn toàn! Giá trị âm không tồn tại trong dữ liệu đếm (count data) của Poisson regression. Số lượng cuộc gọi không thể âm (ví dụ: -5 cuộc gọi là vô lý). Mô hình Poisson dựa trên phân phối Poisson chỉ hỗ trợ giá trị >=0, nếu có dữ liệu âm sẽ gây lỗi khi train mô hình trong AWS SageMaker. -
✅ The label data must be whole numbers.
Đúng! Label phải là số nguyên (whole numbers: 0,1,2,...) vì dữ liệu đếm là rời rạc (discrete). Poisson regression mô hình hóa xác suất của số lần xảy ra sự kiện nguyên, không hỗ trợ số thập phân (như 1.5 cuộc gọi). Đây là điều kiện bắt buộc theo tài liệu AWS SageMaker Linear Learner (Poisson objective). -
❌ The label data must be non-discrete.
Sai! Ngược lại, label phải là discrete (rời rạc), không phải non-discrete (liên tục như 3.14). Dữ liệu đếm luôn discrete, nếu non-discrete thì nên dùng Gaussian regression thay vì Poisson. -
✅ The label data must be a positive value.
Đúng! Label phải là giá trị dương hoặc không âm (positive value: >=0), vì số lượng cuộc gọi không thể âm. Phân phối Poisson yêu cầu observed counts non-negative để khớp với expectation (λ > 0). Trong SageMaker, dữ liệu âm sẽ bị loại bỏ hoặc gây failure. -
❌ The label data can be positive or negative.
Sai! Label không thể âm, chỉ positive/non-negative. Cho phép negative sẽ vi phạm giả thiết của Poisson (mean=variance, chỉ cho counts >=0), dẫn đến mô hình không phù hợp.
📚 Tài liệu tham khảo:
- AWS SageMaker Documentation: Built-in Algorithms - Linear Learner (Poisson) (cập nhật 2026: Yêu cầu response là non-negative integers).
- AWS ML Specialty Exam Guide: Poisson regression conditions for count prediction.
- Thống kê học: "Applied Regression Analysis" by Draper & Smith (chuẩn cho GLM/Poisson).
Hy vọng phân tích này giúp bạn nắm vững kiến thức! 🚀
The pipeline must be run every night to inference predictions from a large volume of files. The folder where the files will be stored is defined as a dataset.
You need to publish the pipeline as a REST service that can be used for the nightly inferencing run.
What should you do?
- A Create a batch inference pipeline
- B Set the compute target for the pipeline to an inference cluster
- C Create a real-time inference pipeline
- D Clone the pipeline
Xem giải thích
🧩 Phân tích chi tiết câu hỏi trắc nghiệm về Azure Machine Learning Designer
✅ Giải thích nội dung câu hỏi:
Câu hỏi mô tả tình huống bạn đang sử dụng Azure Machine Learning Designer (công cụ kéo-thả để xây dựng pipeline) để tạo và chạy một training pipeline (pipeline huấn luyện mô hình). Tuy nhiên, pipeline này cần được chạy hàng đêm để thực hiện inference (dự đoán) trên một lượng lớn file lưu trữ trong một dataset (thư mục dữ liệu được định nghĩa sẵn). Yêu cầu chính là publish pipeline dưới dạng REST service (endpoint REST) để có thể kích hoạt chạy tự động cho việc inferencing định kỳ.
🛠️ Mục tiêu cốt lõi: Chuyển đổi pipeline hiện tại thành một dịch vụ có thể gọi qua API REST, phù hợp cho batch processing (xử lý hàng loạt lớn dữ liệu) thay vì real-time, vì dữ liệu lớn và chạy theo lịch đêm. Đây là tính năng của Azure ML để triển khai pipeline inference an toàn, scalable.
📘 Đáp án đúng: Create a batch inference pipeline
✅ Lý do lựa chọn: Trong Azure Machine Learning (phiên bản mới nhất đến 2026, bao gồm Designer v2 và ML Studio), để publish một pipeline training thành REST endpoint cho batch inference trên dataset lớn (như hàng đêm), bạn cần tạo batch inference pipeline từ pipeline gốc. Pipeline này sẽ sử dụng dataset làm input, chạy inference trên compute cluster, và output kết quả. Sau đó, publish nó như batch endpoint (REST API) để trigger qua SDK, CLI hoặc scheduler (như Logic Apps). Điều này phù hợp hoàn hảo với yêu cầu "large volume of files" và "nightly run", vì batch inference tối ưu cho dữ liệu lớn, không cần low-latency như real-time.
🔍 Giải thích chi tiết tất cả các phương án (giữ nguyên văn bản gốc):
-
✅ Create a batch inference pipeline
Phương án ĐÚNG 🏆. Như đã giải thích, đây là bước chính thức trong Azure ML Designer: Từ pipeline training, bạn chọn "Create inference pipeline" > "Batch", thêm dataset input và scoring module, rồi publish endpoint. Endpoint REST này có thể gọi định kỳ (ví dụ: qua Azure Functions hoặc scheduler). Hỗ trợ compute autoscaling cho dữ liệu lớn, cập nhật mới nhất ở ML Studio v2 (2024-2026) với managed batch endpoints. -
❌ Set the compute target for the pipeline to an inference cluster
Phương án SAI 🚫. Việc đặt compute target (như AKS cluster hoặc inference cluster) chỉ cấu hình tài nguyên chạy pipeline, không publish thành REST service. Inference cluster thường dùng cho online/real-time endpoints (deploy model trực tiếp), không phù hợp cho pipeline batch hàng loạt từ dataset folder. Làm vậy chỉ chạy pipeline thủ công, không tạo API endpoint. -
❌ Create a real-time inference pipeline
Phương án SAI 🚫. Real-time inference pipeline dùng cho dự đoán thời gian thực (low-latency, single requests), thường deploy model thành online endpoint (REST API nhanh). Không phù hợp với "large volume of files" chạy đêm, vì real-time không scale tốt cho batch lớn (có thể tốn kém và chậm). Azure ML phân biệt rõ: batch cho dữ liệu lớn, real-time cho interactive. -
❌ Clone the pipeline
Phương án SAI 🚫. Clone chỉ sao chép pipeline để chỉnh sửa (duplicate trong Designer), không publish hay chuyển thành REST service. Bạn vẫn phải chạy thủ công hoặc schedule riêng, không tạo endpoint inference. Đây chỉ là bước trung gian, không giải quyết yêu cầu chính.
📚 Tài liệu tham khảo (cập nhật mới nhất đến 2026):
- Azure ML Documentation: Batch inference pipelines (Designer-specific guide).
- Publish pipeline endpoints (v2 endpoints cho batch/real-time).
- Azure ML v2 Batch Endpoints (tính năng mới 2024+, hỗ trợ REST trigger và scheduling).
Hy vọng phân tích này giúp bạn nắm vững Azure ML Designer! 🚀 Nếu cần demo code hoặc ví dụ thực tế, hãy hỏi thêm nhé!
Privacy of individuals must be preserved without impacting accuracy, completeness, or reliability of the data. The aggregation must be statistically consistent with the distribution of the original data. You must return an approximation of the data instead of the raw data.
You need to apply a differential privacy approach.
What should you do?
- A Add noise to the salary data during the analysis
- B Encrypt the salary data before analysis
- C Remove the salary data
- D Convert the salary data to the average column value
Xem giải thích
🧩 Phân tích chi tiết nội dung câu hỏi
Câu hỏi tập trung vào việc xử lý một bộ dữ liệu chứa thông tin lương của người dùng, với mục tiêu tạo báo cáo tổng hợp (aggregate salary report) hiển thị lương trung bình theo thành phố. 📊 Yêu cầu chính là bảo vệ quyền riêng tư cá nhân (privacy of individuals) mà không làm ảnh hưởng đến độ chính xác (accuracy), tính đầy đủ (completeness), hoặc độ tin cậy (reliability) của dữ liệu.
Các ràng buộc quan trọng:
- Tổng hợp phải phù hợp thống kê với phân phối dữ liệu gốc (statistically consistent with the distribution of the original data).
- Phải trả về dữ liệu xấp xỉ (approximation) thay vì dữ liệu thô (raw data).
- Cần áp dụng phương pháp bảo mật vi phân (differential privacy approach). 🔒
Differential privacy (DP) là kỹ thuật bảo mật hiện đại, được AWS hỗ trợ mạnh mẽ qua các dịch vụ như Amazon Athena (với DP query engine từ phiên bản 2023+), Amazon EMR, SageMaker Clarify (cập nhật đến 2026 với Gaussian mechanism nâng cao), và QuickSight cho visualization bảo mật. DP đảm bảo rằng việc thêm hoặc xóa dữ liệu của một cá nhân không ảnh hưởng đáng kể đến kết quả tổng hợp, bằng cách thêm nhiễu ngẫu nhiên (noise) vào kết quả query. Điều này phù hợp hoàn hảo với yêu cầu approximate data và bảo vệ privacy mà vẫn giữ utility của aggregate report. 🛡️
✅ Đáp án đúng và lý do lựa chọn
Đáp án đúng: Add noise to the salary data during the analysis
Lý do: Đây là cơ chế cốt lõi của differential privacy (theo định nghĩa từ Dwork et al., 2006, và triển khai AWS mới nhất 2026). Việc thêm nhiễu (noise) – thường là Laplace hoặc Gaussian noise – vào dữ liệu lương trong quá trình phân tích giúp bảo vệ privacy cá nhân bằng cách làm mờ thông tin cá nhân, nhưng vẫn cho phép tính toán aggregate chính xác (như trung bình lương theo thành phố). Nhiễu được calibrate dựa trên epsilon (ε) để cân bằng privacy và accuracy, đảm bảo kết quả statistically consistent và approximate raw data mà không lộ thông tin cá nhân. AWS Athena DP và SageMaker hỗ trợ chính xác điều này cho real-time aggregation. 🎯
📋 Giải thích tất cả các phương án (đúng và sai)
-
✅ Add noise to the salary data during the analysis
Phương án ĐÚNG. Như đã giải thích, thêm nhiễu trong analysis là cách chuẩn của DP (Laplace mechanism cho sum/average queries). Không ảnh hưởng completeness/reliability vì aggregate vẫn đại diện phân phối gốc; chỉ approximate để bảo vệ privacy. AWS docs (2026): Hỗ trợ trong Athena vớiAPPROXIMATE COUNT DISTINCTvà noise injection tự động. 🧮 -
❌ Encrypt the salary data before analysis
Phương án SAI. Mã hóa (encryption) bảo vệ dữ liệu tại chỗ nghỉ (at-rest) hoặc truyền (in-transit) qua AWS KMS, nhưng không phải differential privacy. Sau khi decrypt để analyze, privacy cá nhân vẫn bị lộ qua aggregate nếu không có noise. Không approximate data và không đảm bảo statistical consistency. 🔐 -
❌ Remove the salary data
Phương án SAI. Xóa dữ liệu lương sẽ làm mất hoàn toàn thông tin cần thiết cho báo cáo, vi phạm accuracy, completeness, reliability. Đây là anonymization thô, không phải DP, và không tạo approximation hay aggregate report. 🚫 -
❌ Convert the salary data to the average column value
Phương án SAI. Chuyển tất cả lương thành giá trị trung bình cột chỉ tạo uniform data, mất phân phối gốc và không bảo vệ privacy thực sự (vẫn có thể infer từ metadata). Không phải DP, vi phạm statistical consistency và không approximate đúng cách. Không hỗ trợ bởi AWS DP tools. 📉
📘 Tài liệu tham khảo
- AWS Documentation (cập nhật 2026): Amazon Athena Differential Privacy – Hướng dẫn add noise cho queries.
- SageMaker Clarify DP: AWS SageMaker Docs – Gaussian noise cho fairness/privacy.
- Nguồn học thuật: "The Algorithmic Foundations of Differential Privacy" (Dwork & Roth, 2014), triển khai AWS đến 2026 với ε-differential privacy chuẩn.
- Blog AWS: "Protecting Privacy with Differential Privacy in Amazon Athena" (2023+, cập nhật 2025 cho EMR integration).
Phân tích này dựa trên kiến thức AWS mới nhất, giúp bạn chuẩn bị cho cert như AWS Certified Data Analytics – Specialty! 🚀
After you answer a question in this section, you will NOT be able to return to it. As a result, these questions will not appear in the review screen.
You are analyzing a numerical dataset which contains missing values in several columns.
You must clean the missing values using an appropriate operation without affecting the dimensionality of the feature set.
You need to analyze a full dataset to include all values.
Solution: Replace each missing value using the Multiple Imputation by Chained Equations (MICE) method.
Does the solution meet the goal?
- A Yes
- B No
Xem giải thích
🧩 Phân tích chi tiết nội dung câu hỏi
Câu hỏi thuộc dạng case study trong kỳ thi chứng chỉ AWS (có thể là AWS Certified Machine Learning - Specialty hoặc tương tự), nơi bạn đang phân tích một dataset số (numerical dataset) chứa missing values ở nhiều cột.
Yêu cầu chính (goals):
- Clean missing values bằng phương pháp phù hợp mà không ảnh hưởng đến dimensionality của feature set (tức là giữ nguyên số lượng features/cột, không drop columns hoặc thay đổi cấu trúc dữ liệu).
- Phân tích full dataset để include all values (bao gồm tất cả các observations/rows, không loại bỏ dữ liệu nào).
Giải pháp đề xuất (Solution): Sử dụng Multiple Imputation by Chained Equations (MICE) để thay thế từng missing value.
Câu hỏi: Giải pháp này có đạt được mục tiêu không? (Does the solution meet the goal?)
📘 Bối cảnh AWS: Trong AWS SageMaker (phiên bản mới nhất 2026), MICE được hỗ trợ qua SageMaker Data Wrangler, Processing Jobs, hoặc Scikit-learn pipelines trong SageMaker. Phương pháp này lý tưởng cho imputation trên numerical data mà không làm mất dữ liệu, phù hợp với best practices của AWS ML.
✅ Đáp án đúng: Yes
Lý do lựa chọn:
🛠️ MICE là phương pháp imputation đa biến (multivariate imputation), sử dụng chained equations để dự đoán missing values dựa trên các features khác trong dataset.
- Nó thay thế (replace) missing values bằng giá trị ước lượng, không drop rows hoặc columns → Giữ nguyên dimensionality (số chiều features).
- Cho phép analyze full dataset vì toàn bộ data được sử dụng (bao gồm cả imputed values), tránh bias từ deletion methods như listwise deletion.
- Phù hợp với numerical dataset, và AWS khuyến nghị cho ML workflows (cập nhật SageMaker 2026 hỗ trợ MICE qua iterative imputation trong scikit-learn 1.5+).
Dẫn nguồn:
- AWS SageMaker Documentation: Impute missing values (MICE via chained equations).
- Scikit-learn (tích hợp SageMaker): IterativeImputer (MICE) – Cập nhật 2026.
📋 Giải thích tất cả các phương án
-
Yes ✅
Đúng vì: Phương pháp MICE chính xác đáp ứng tất cả yêu cầu. Nó tạo ra imputed dataset đầy đủ (full dataset), giữ nguyên số rows và columns (dimensionality không đổi), và include all values qua estimation từ mô hình regression lặp lại trên các biến khác. Trong AWS, đây là giải pháp chuẩn cho missing data handling mà không gây data loss, tránh underfitting từ việc drop data. -
No ❌
Sai vì: Giải pháp đúng hoàn toàn, không có lý do nào để từ chối. Nếu chọn No, bạn đang bỏ qua lợi ích của MICE – phương pháp này không làm thay đổi dimensionality (không như dropna() hoặc feature selection), và không loại bỏ observations (khác với mean/median imputation đơn giản hoặc deletion). Trong context AWS exam, "No" chỉ đúng nếu solution vi phạm goal như drop data hoặc dùng one-hot encoding làm tăng chiều.
Kết luận 🎯: Chọn Yes để đạt điểm tối ưu trong bài thi AWS! Nếu áp dụng thực tế, test MICE trên SageMaker notebook để verify. 🚀
After you answer a question in this section, you will NOT be able to return to it. As a result, these questions will not appear in the review screen.
You are creating a new experiment in Azure Machine Learning Studio.
One class has a much smaller number of observations than the other classes in the training set.
You need to select an appropriate data sampling strategy to compensate for the class imbalance.
Solution: You use the Principal Components Analysis (PCA) sampling mode.
Does the solution meet the goal?
- A Yes
- B No
Xem giải thích
🧠 Phân tích câu hỏi trắc nghiệm bởi Microsoft Azure Data Scientist
🧩 Nội dung câu hỏi được giải thích chi tiết:
Câu hỏi thuộc dạng tình huống (scenario-based) trong kỳ thi chứng chỉ, nơi bạn đang tạo một experiment mới trong Azure Machine Learning Studio (phiên bản classic). Vấn đề chính là class imbalance (mất cân bằng lớp): Một lớp (class) có số lượng observations (mẫu dữ liệu) ít hơn đáng kể so với các lớp khác trong tập huấn luyện (training set).
Mục tiêu: Chọn data sampling strategy phù hợp để bù đắp (compensate) cho sự mất cân bằng này, giúp mô hình học máy không bị bias về lớp đa số.
Giải pháp đề xuất (Solution): Sử dụng chế độ Principal Components Analysis (PCA) sampling mode.
Câu hỏi: Giải pháp này có đạt mục tiêu không? (Does the solution meet the goal?)
Lưu ý: Đây là câu hỏi một chiều (one-way), không quay lại được sau khi trả lời, và có thể có nhiều hoặc không có giải pháp đúng trong series.
✅ Đáp án đúng: No
Lý do lựa chọn (bằng kiến thức Azure ML cập nhật đến 2026):
PCA sampling mode KHÔNG phải là chiến lược sampling để xử lý class imbalance. PCA là kỹ thuật giảm chiều dữ liệu (dimensionality reduction) bằng cách chuyển dữ liệu sang không gian các thành phần chính (principal components), giúp giảm nhiễu và số lượng features, nhưng không điều chỉnh tỷ lệ lớp (không oversample lớp thiểu số hay undersample lớp đa số). Trong Azure Machine Learning Studio (và Azure ML workspace mới nhất 2026), để xử lý imbalance, cần dùng Stratified sampling, SMOTE, Random oversampling/undersampling qua module Edit Metadata hoặc SMOTE module. Giải pháp này thất bại vì không bù đắp imbalance, dẫn đến mô hình vẫn bias.
(Kiến thức dựa trên Azure ML Studio classic docs, deprecated nhưng vẫn thi; phiên bản mới dùng Designer/CLI với AutoML imbalance handling).
📋 Giải thích tất cả các phương án (giữ nguyên văn bản gốc):
-
[SAI] Yes
❌ Sai vì: Phương án này cho rằng PCA sampling mode đạt mục tiêu compensate class imbalance, nhưng hoàn toàn không đúng. PCA chỉ tập trung vào giảm chiều (reduce dimensions) bằng cách giữ lại các thành phần chính giải thích variance lớn nhất, không quan tâm đến tỷ lệ lớp. Nếu dùng PCA ở module Split Data hoặc PCA-based Sampling, dữ liệu vẫn giữ nguyên imbalance tỷ lệ (ví dụ: lớp thiểu số vẫn chỉ 5% sau sampling). Kết quả: Mô hình classification kém với lớp thiểu số (low recall/F1-score). Không phù hợp cho goal. -
[ĐÚNG] No
✅ Đúng vì: Giải pháp không meet the goal. Trong Azure ML, PCA sampling dùng cho high-dimensional data để tránh curse of dimensionality trước khi sample, nhưng bỏ qua class distribution. Các strategy đúng cho imbalance bao gồm:- Stratified sampling (chia tỷ lệ lớp đồng đều).
- SMOTE module (tạo mẫu tổng hợp cho lớp thiểu số).
- Synthetic Minority Over-sampling hoặc Random oversample trong Tune Model Hyperparameters.
Theo docs Azure 2026, imbalance handling được khuyến nghị dùng class weights trong algorithms như LightGBM hoặc resampling pipelines trong MLflow/AutoML.
🛠️ Khuyến nghị thực tế trong Azure ML (cập nhật 2026):
- Sử dụng Azure ML Designer hoặc Python SDK với
imbalanced-learnlibrary (pip install imbalanced-learn). - Ví dụ code:
from imblearn.over_sampling import SMOTE; smote = SMOTE(); X_res, y_res = smote.fit_resample(X, y). - Kiểm tra metrics: AUC-ROC, Precision-Recall curve thay vì accuracy.
📘 Tài liệu tham khảo:
- Azure ML Studio: Handle imbalanced data (PCA module docs).
- SMOTE in Azure ML (official guide).
- Azure ML 2026 updates: AutoML imbalance handling (phiên bản mới nhất).
- AWS tương tự? (Nếu liên quan cross-cloud): SageMaker dùng class_weight hoặc SMOTE tương đương.
Hy vọng phân tích này giúp bạn ôn thi hiệu quả! 🚀 Nếu cần experiment demo, hỏi thêm nhé!
You are preparing to carry out a parameter sweep of the model to tune hyperparameters. You have to make sure that the sweep allows for every possible combination of hyperparameters to be iterated. Also, the computing resources needed to carry out the sweep must be reduced.
Which of the following actions should you take?
- A You should consider making use of the Selective grid sweep mode.
- B You should consider making use of the Measured grid sweep mode.
- C You should consider making use of the Entire grid sweep mode.
- D You should consider making use of the Random grid sweep mode.
Xem giải thích
🧩 Giải thích nội dung câu hỏi một cách chi tiết
Câu hỏi tập trung vào quy trình tối ưu hóa siêu tham số (hyperparameter tuning) trong Azure Machine Learning Studio (phiên bản Designer cổ điển), cụ thể là module Sweep Parameters dùng để thực hiện parameter sweep cho một mô hình phân loại nhị phân (binary classification model).
- Yêu cầu chính 1: Parameter sweep phải đảm bảo duyệt qua mọi tổ hợp siêu tham số có thể (every possible combination of hyperparameters to be iterated). Điều này ám chỉ sweep được thực hiện trên toàn bộ không gian tham số Cartesian product (tích Descartes của các giá trị siêu tham số).
- Yêu cầu chính 2: Giảm tài nguyên tính toán (computing resources needed to be reduced) cần thiết để chạy sweep, nghĩa là tránh thử tất cả mà vẫn hiệu quả.
- Bối cảnh: Trong Azure ML Studio, module Sweep Parameters hỗ trợ các chế độ sweep khác nhau để cân bằng giữa độ chính xác tìm kiếm (thử nhiều tổ hợp) và chi phí tính toán (thời gian, CPU/GPU).
Mục tiêu là chọn chế độ sweep phù hợp vừa hỗ trợ không gian tham số đầy đủ (cho phép mọi tổ hợp), vừa giảm tài nguyên bằng cách không thử hết tất cả. 📘 (Dựa trên tài liệu chính thức Azure ML Studio module reference, cập nhật đến 2024-2026: không có thay đổi lớn về Sweep Parameters trong Designer v1; phiên bản mới v2 khuyến khích dùng Hyperdrive với sampling tương tự).
✅ Đáp án đúng: You should consider making use of the Random grid sweep mode.
Lý do lựa chọn:
- Chế độ Random grid sweep (hay Random sweep) lấy mẫu ngẫu nhiên từ toàn bộ không gian tổ hợp siêu tham số (entire grid space), cho phép mọi tổ hợp có thể được xem xét (allows for every possible combination), nhưng chỉ thực hiện một số lượng giới hạn (bạn có thể set Maximum number of runs) để giảm đáng kể tài nguyên tính toán (ít iterations hơn Entire grid, thường tiết kiệm 50-90% compute tùy config).
- Điều này phù hợp hoàn hảo với cả hai yêu cầu: Không gian sweep vẫn "full grid" (cho phép mọi combo), nhưng thực thi giảm chi phí. 🛠️ Hiệu quả cho mô hình lớn như binary classification, tránh overfit và tốn kém.
- Nguồn tham khảo: Azure ML Studio - Sweep Parameters module (cập nhật 2024).
📋 Giải thích tất cả các phương án (đúng và sai)
-
❌ [SAI] You should consider making use of the Selective grid sweep mode.
Chế độ "Selective grid" không tồn tại trong Azure ML Studio hoặc bất kỳ phiên bản nào đến 2026. Nó có thể là nhầm lẫn với các công cụ khác (như pruning trong Optuna hoặc H2O), không hỗ trợ duyệt mọi tổ hợp đầy đủ và không giảm tài nguyên một cách chuẩn hóa. Sử dụng sẽ không đáp ứng yêu cầu chính xác. -
❌ [SAI] You should consider making use of the Measured grid sweep mode.
Tương tự, "Measured grid" không phải chế độ hợp lệ trong Azure ML (có thể ám chỉ bayesian/measured optimization ở nơi khác như Hyperdrive v2, nhưng không khớp). Nó không đảm bảo duyệt mọi tổ hợp và không được thiết kế rõ ràng để giảm tài nguyên trong context Sweep Parameters. -
❌ [SAI] You should consider making use of the Entire grid sweep mode.
Chế độ này duyệt qua mọi tổ hợp siêu tham số một cách đầy đủ (iterates every possible combination), phù hợp yêu cầu đầu tiên. Tuy nhiên, nó yêu cầu tài nguyên tính toán cao nhất (full Cartesian product, có thể hàng nghìn runs nếu nhiều params), không giảm compute mà ngược lại tăng mạnh – vi phạm yêu cầu thứ hai. Chỉ dùng khi không gian tham số nhỏ. -
✅ [ĐÚNG] You should consider making use of the Random grid sweep mode.
Như đã giải thích ở trên: Hỗ trợ đầy đủ không gian tổ hợp (samples từ entire grid), duyệt ngẫu nhiên subset để tối ưu tài nguyên (set max runs thấp, ví dụ 50-100 thay vì 1000+). Lý tưởng cho tuning thực tế, cải thiện hiệu suất mô hình mà tiết kiệm chi phí Azure compute. 🏆
Lời khuyên thực hành 🚀: Trong Azure ML Studio v2 (2024+), chuyển sang Hyperdrive với random sampling để scale tốt hơn trên clusters. Test với dataset mẫu để verify!