Ngân hàng đề — Microsoft Azure Data Scientist
Tìm thấy 313 câu.
Which of the following is an algorithm that reduces the variances between actual and predicted values?
- A Fast Forest Quantile Regression
- B Poisson Regression
- C Boosted Decision Tree Regression
- D Linear Regression
Xem giải thích
🧩 Phân tích chi tiết nội dung câu hỏi
Câu hỏi này thuộc về Azure Machine Learning Studio (nay là một phần của Azure ML trong Azure Machine Learning), nơi bạn đang phát triển một mô hình linear regression (hồi quy tuyến tính). Trong quá trình thực hiện experiment (thử nghiệm), bạn đánh giá nhiều thuật toán khác nhau. Câu hỏi tập trung vào việc xác định thuật toán nào giảm thiểu sự khác biệt (variance) giữa giá trị thực tế (actual values) và giá trị dự đoán (predicted values).
📌 Ý nghĩa cốt lõi: "Reduces the variances" ở đây ám chỉ việc tối ưu hóa lỗi dự đoán, cụ thể là giảm thiểu phương sai (variance) của sai số giữa actual và predicted. Trong machine learning, đặc biệt là regression, điều này thường liên quan đến việc sử dụng hàm mất mát như Mean Squared Error (MSE) hoặc sum of squared residuals để đo lường và giảm sự chênh lệch. Azure ML Studio cung cấp các module regression để experiment, và câu hỏi kiểm tra kiến thức về thuật toán nào trực tiếp thực hiện việc này một cách cổ điển nhất. (Kiến thức cập nhật đến Azure ML phiên bản 2024-2026, không thay đổi lớn ở các module regression cơ bản).
✅ Đáp án đúng: Linear Regression
Lý do lựa chọn:
Linear Regression là thuật toán hồi quy tuyến tính cổ điển, sử dụng phương pháp Least Squares (phương pháp bình phương nhỏ nhất) để tối thiểu hóa tổng bình phương sai số (sum of squared differences) giữa actual values và predicted values. Điều này trực tiếp giảm variance (phương sai) của residuals (sai số), giúp mô hình dự đoán chính xác hơn. Trong Azure ML Studio, module Linear Regression được thiết kế chính xác cho mục đích này, phù hợp với ngữ cảnh "develop a linear regression model" trong câu hỏi. Các phiên bản Azure ML mới nhất (đến 2026) vẫn giữ nguyên cơ chế này, hỗ trợ cả ordinary least squares (OLS) và ridge regularization để tránh overfitting.
🛠️ Giải thích tất cả các phương án (đúng và sai)
Dưới đây là phân tích chi tiết từng lựa chọn, giữ nguyên văn bản gốc tiếng Anh. Tôi đánh dấu ✅ cho đúng và ❌ cho sai, kèm lý do cụ thể dựa trên chức năng của từng module trong Azure ML Studio:
-
Fast Forest Quantile Regression ❌
Sai vì: Đây là thuật toán quantile regression dựa trên random forest nhanh, dùng để dự đoán phân vị (quantiles) thay vì giá trị trung bình. Nó tối ưu hóa quantile loss (pinball loss), không phải MSE để giảm variance giữa actual và predicted values thông thường. Phù hợp cho dữ liệu phân phối không chuẩn hoặc dự đoán khoảng tin cậy, không phải mục tiêu chính của câu hỏi. -
Poisson Regression ❌
Sai vì: Đây là mô hình hồi quy tổng quát hóa (GLM) dành cho dữ liệu đếm (count data) với phân phối Poisson, tối ưu hóa log-likelihood thay vì squared errors. Nó không tập trung giảm variance theo cách least squares, mà xử lý dữ liệu không âm và lệch (skewed), như số lượng sự kiện. Không phù hợp cho linear regression thông thường. -
Boosted Decision Tree Regression ❌
Sai vì: Đây là ensemble method dựa trên cây quyết định tăng cường (gradient boosting), có thể sử dụng MSE làm loss function, nhưng nó là mô hình phi tuyến tính phức tạp, ưu tiên giảm bias và variance qua boosting thay vì trực tiếp minimize squared residuals như linear regression. Trong Azure ML, nó mạnh cho dữ liệu phức tạp nhưng không phải lựa chọn cơ bản cho "linear regression model". -
Linear Regression ✅
Đúng vì: Như đã giải thích ở trên, đây là thuật toán trực tiếp giảm variance bằng least squares, khớp hoàn hảo với yêu cầu câu hỏi.
📘 Tài liệu tham khảo
- Azure Machine Learning Studio documentation: Linear Regression module (cập nhật 2024, vẫn áp dụng đến 2026).
- Microsoft Learn - Regression algorithms in Azure ML: Regression algorithms overview – Chi tiết về MSE và loss functions.
- Official Azure ML updates (2026): Không có thay đổi lớn ở core regression modules theo roadmap Azure AI (xem Azure Blog 2025-2026).
Hy vọng phân tích này giúp bạn hiểu rõ hơn về Azure ML! 🚀 Nếu cần experiment code hoặc demo, hãy cho tôi biết nhé!
After you answer a question in this section, you will NOT be able to return to it. As a result, these questions will not appear in the review screen.
You are creating a new experiment in Azure Machine Learning Studio.
One class has a much smaller number of observations than the other classes in the training set.
You need to select an appropriate data sampling strategy to compensate for the class imbalance.
Solution: You use the Scale and Reduce sampling mode.
Does the solution meet the goal?
- A Yes
- B No
Xem giải thích
🧩 Phân tích chi tiết câu hỏi trắc nghiệm
📖 Nội dung câu hỏi:
Câu hỏi thuộc dạng series (chuỗi câu hỏi cùng scenario) trong kỳ thi chứng chỉ Microsoft Azure (có lẽ DP-100: Designing and Implementing a Data Science Solution on Azure). Scenario mô tả bạn đang tạo một experiment mới trong Azure Machine Learning Studio (phiên bản classic designer, hiện đã deprecated nhưng vẫn được kiểm tra trong cert đến 2026). Vấn đề là tập dữ liệu huấn luyện có class imbalance (một class có số lượng observations ít hơn rất nhiều so với các class khác – multi-class imbalance). Mục tiêu (goal) là chọn data sampling strategy phù hợp để bù đắp sự mất cân bằng này.
Giải pháp đề xuất (Solution): Sử dụng Scale and Reduce sampling mode.
Câu hỏi: Giải pháp này có đạt được mục tiêu không? (Does the solution meet the goal?)
Lưu ý: Trong Azure ML Studio classic, xử lý class imbalance thường dùng module Partition and Sample hoặc SMOTE. Đây là câu hỏi kiểu "Yes/No" với giải pháp unique, và không thể quay lại sau khi trả lời.
✅ Đáp án đúng: No
Lý do lựa chọn (bằng kiến thức Azure ML Studio cập nhật đến 2026):
Scale and Reduce chỉ là một chế độ sampling đơn giản trong module Partition and Sample, nó không phải chiến lược phù hợp nhất để xử lý class imbalance trong training set. Nó oversample minority class bằng cách duplicate (sao chép ngẫu nhiên) và undersample majority bằng cách xóa ngẫu nhiên, dẫn đến:
- Overfitting (do duplicate gây bias model lặp lại dữ liệu giống hệt).
- Mất dữ liệu quý giá từ majority class.
Thay vào đó, SMOTE (Synthetic Minority Over-sampling Technique) là lựa chọn chuẩn, tạo dữ liệu synthetic mới từ interpolation giữa minority samples, tránh overfitting và giữ nguyên majority data. Hoặc dùng class weights trong algorithm (như Two-Class Logistic Regression). Giải pháp này không đạt goal vì không "appropriate" (phù hợp chuyên nghiệp) theo best practices Microsoft.
🛠️ Giải thích tất cả các phương án (giữ nguyên văn bản gốc):
-
Yes ❌ [SAI]
Lý do sai: Chọn "Yes" nghĩa là khẳng định Scale and Reduce đạt goal, nhưng thực tế nó không phù hợp vì chỉ là sampling cơ bản (duplicate + random remove), không giải quyết gốc rễ imbalance hiệu quả. Dễ gây overfitting và mất data, không phải recommended strategy theo docs Microsoft (best là SMOTE hoặc weights). Trong series exam, solution này được đánh giá không meet the goal. -
No ✅ [ĐÚNG]
Lý do đúng: Như giải thích trên, Scale and Reduce không phải "appropriate data sampling strategy" cho class imbalance trong training. Nó chỉ balance bằng cách thô sơ (scale up minority bằng copy, reduce majority ngẫu nhiên), vi phạm best practices tránh overfitting/loss data. Microsoft khuyến nghị SMOTE để tạo synthetic samples an toàn hơn (docs cập nhật 2025-2026 vẫn giữ nguyên cho legacy Studio).
📘 Tài liệu tham khảo (cập nhật mới nhất 2026):
- Microsoft Learn: Partition and Sample module – Mô tả Scale and Reduce chỉ "generate balanced dataset" cơ bản, cảnh báo về replication.
- Microsoft Learn: Handle imbalanced dataset & SMOTE module – Recommended cho imbalance: SMOTE + class weights.
- Azure ML Designer (v2, successor) – Không còn Scale and Reduce, dùng Featurization hoặc custom script với imbalanced-learn lib (scikit-learn integration).
- Practice exams: DP-100 series questions trên MeasureUp/Whizlabs xác nhận solution này là No.
💡 Lời khuyên từ Azure Data Scientist: Nếu thực tế project, ưu tiên SMOTE hoặc imbalanced-learn package trong Azure ML pipelines (v2). Test bằng metrics như Precision-Recall AUC thay vì Accuracy cho imbalance! 🚀
You want to test the pipeline before deploying the script.
You need to display the pipeline run details written to the STDOUT output when the pipeline completes.
Which code segment should you add to the test script?
- A pipeline_run.get.metrics()
- B pipeline_run.wait_for_completion(show_output=True)
- C pipeline_param = PipelineParameter(name="stdout", default_value="console")
- D pipeline_run.get_status()
Xem giải thích
🧠 Phân tích câu hỏi trắc nghiệm về Azure Machine Learning Pipelines
🔍 Giải thích nội dung câu hỏi một cách chi tiết:
Câu hỏi mô tả một script Python sử dụng Azure Machine Learning (Azure ML) để chạy một pipeline. Đoạn code gốc là:from azureml.core import Experimentpipeline_run = Experiment(ws, 'pipeline_test').submit(pipeline)
Mục tiêu là test pipeline trước khi deploy script, và cần hiển thị chi tiết pipeline run được ghi vào STDOUT (standard output) khi pipeline hoàn thành. STDOUT là luồng đầu ra tiêu chuẩn nơi các log, thông báo từ các bước pipeline được in ra console.
Vấn đề chính: Sau khi submit pipeline, làm thế nào để chờ pipeline hoàn thành (wait) và hiển thị output từ STDOUT một cách trực tiếp trong script test? Đây là tình huống phổ biến khi debug hoặc test pipeline cục bộ trước khi deploy lên production. Kiến thức dựa trên Azure ML Python SDK phiên bản mới nhất (v2 trở lên đến 2026), nơi PipelineRun cung cấp các method để monitor và capture output.
✅ Đáp án đúng và lý do lựa chọn:
Đáp án đúng là: pipeline_run.wait_for_completion(show_output=True)
Lý do: Phương thức wait_for_completion(show_output=True) sẽ chặn script cho đến khi pipeline hoàn thành, đồng thời hiển thị toàn bộ output từ STDOUT của các bước pipeline (bao gồm log từ các step như training, inference). Tham số show_output=True kích hoạt việc stream và in output trực tiếp ra console, giúp test nhanh chóng mà không cần vào Azure ML Studio. Đây là cách chuẩn theo tài liệu Azure ML (cập nhật 2024-2026).
📘 Tài liệu tham khảo:
- Azure ML PipelineRun docs (Microsoft Docs, phiên bản SDK v1/v2).
- Pipeline debugging guide.
🛠️ Giải thích tất cả các phương án (đúng/sai):
-
❌ [SAI] pipeline_run.get_metrics()
Phương án này chỉ lấy metrics (chỉ số đo lường) như accuracy, loss từ pipeline run, không hiển thị STDOUT output. Nó trả về dictionary metrics đã đăng ký, phù hợp cho phân tích kết quả số liệu chứ không phải log chi tiết console. Không wait completion và không stream output. -
✅ [ĐÚNG] pipeline_run.wait_for_completion(show_output=True)
Như đã giải thích ở trên: Wait cho pipeline hoàn thành + hiển thị STDOUT output trực tiếp. Hoàn hảo cho test script, stream log real-time từ các bước. -
❌ [SAI] pipeline_param = PipelineParameter(name="stdout", default_value="console")
Đây là cách tạo PipelineParameter để truyền tham số vào pipeline (ví dụ: định nghĩa input cho step). Hoàn toàn không liên quan đến việc hiển thị output sau submit. Nó chỉ dùng lúc định nghĩa pipeline, không phải monitor run. -
❌ [SAI] pipeline_run.get_status()
Phương án này chỉ trả về trạng thái hiện tại (running, completed, failed), không wait completion và không hiển thị STDOUT. Phù hợp check nhanh status nhưng thiếu output log cần thiết cho test.
💡 Lời khuyên từ Azure Data Scientist: Khi test pipeline, hãy dùng show_output=True kết hợp với wait_for_completion để debug hiệu quả. Nếu dùng Azure ML v2 (CLI v2), có thể chuyển sang ml.pipeline.create_run với output streaming tương tự! 🚀
You have been tasked with constructing a machine learning model that translates language text into a different language text.
The machine learning model must be constructed and trained to learn the sequence of the.
Recommendation: You make use of Convolutional Neural Networks (CNNs).
Will the requirements be satisfied?
- A Yes
- B No
Xem giải thích
🧩 Phân tích chi tiết nội dung câu hỏi
Câu hỏi thuộc dạng tình huống giả định trong các bài kiểm tra AWS (có thể liên quan đến AWS SageMaker hoặc dịch vụ ML trên AWS), nơi bạn được giao nhiệm vụ xây dựng một mô hình machine learning để dịch văn bản từ ngôn ngữ này sang ngôn ngữ khác.
-
Yêu cầu chính: Mô hình phải được xây dựng và huấn luyện để học sequence (học chuỗi dữ liệu), vì nhiệm vụ dịch ngôn ngữ là một bài toán sequence-to-sequence (seq2seq) – đầu vào là chuỗi từ/câu nguồn, đầu ra là chuỗi từ/câu đích. Điều này đòi hỏi mô hình phải xử lý tốt sự phụ thuộc dài hạn (long-term dependencies) giữa các phần tử trong chuỗi, như ngữ pháp, ngữ cảnh.
-
Khuyến nghị (Recommendation): Sử dụng Convolutional Neural Networks (CNNs).
-
Câu hỏi cụ thể: Khuyến nghị này có đáp ứng yêu cầu không? (Will the requirements be satisfied?)
Câu hỏi nhấn mạnh rằng đây là phần của một bộ câu hỏi có setup giống nhau nhưng kết quả khác nhau, yêu cầu đánh giá xem khuyến nghị có phù hợp với nhu cầu học sequence cho dịch ngôn ngữ hay không. 📘 Kiến thức nền tảng: Trong ML hiện đại (cập nhật đến AWS SageMaker phiên bản 2026), bài toán dịch ngôn ngữ thường sử dụng RNN/LSTM/GRU, Transformer (như trong AWS Translate hoặc Hugging Face models trên SageMaker), hoặc Attention mechanisms, chứ không phải CNN – vốn tối ưu cho dữ liệu hình ảnh 2D/3D với các filter convolution cục bộ.
✅ Đáp án đúng: "No"
Lý do lựa chọn:
- CNN không phù hợp cho nhiệm vụ học sequence dài và phức tạp như dịch ngôn ngữ, vì CNN xử lý dữ liệu theo cửa sổ cục bộ (local receptive fields), khó nắm bắt phụ thuộc xa (distant dependencies) trong chuỗi văn bản.
- Seq2seq translation cần mô hình có khả năng memory dài hạn (như LSTM hoặc self-attention trong Transformer), trong khi CNN thường dùng cho classification/image. Sử dụng CNN sẽ không satisfy requirements vì hiệu suất kém, không học tốt sequence.
- Theo AWS best practices (SageMaker JumpStart 2026), các model translation khuyến nghị là mBART, T5, hoặc Amazon Translate API dựa trên Transformer, không phải CNN. 🛠️ Kết luận: Khuyến nghị KHÔNG đáp ứng!
📋 Giải thích tất cả các phương án trả lời
-
Yes ❌
Sai vì: Phương án này cho rằng CNN có thể đáp ứng yêu cầu học sequence cho dịch ngôn ngữ. Thực tế, CNN không được thiết kế chính cho seq2seq tasks; nó thiếu cơ chế recurrent hoặc attention để xử lý chuỗi biến dài, dẫn đến underfitting hoặc poor generalization trên dữ liệu text dài. Trong AWS SageMaker (2026), CNN chỉ dùng cho vision tasks (như ResNet), không phải translation. Dẫn nguồn: AWS SageMaker Documentation - Sequence Models và Hugging Face Transformers for Translation. -
No ✅
Đúng vì: Phương án này chính xác nhận định CNN không satisfy requirements. Translation đòi hỏi mô hình seq2seq chuyên biệt (RNN/Transformer) để học dependencies toàn cục trong sequence. CNN chỉ hiệu quả cục bộ, không phù hợp – ví dụ, ByteNet (một CNN variant cho seq) vẫn kém Transformer. AWS khuyến nghị dùng BlazingText hoặc Hugging Face DLC trên SageMaker cho text seq, tránh CNN thuần. Dẫn nguồn: AWS ML Best Practices 2026 - NLP Workloads và paper "Neural Machine Translation" của Google (2016, vẫn chuẩn đến 2026).
🧠 Tóm tắt insight: Chọn mô hình đúng rất quan trọng trong AWS ML pipelines để tránh lãng phí tài nguyên EC2/GPU! Nếu triển khai trên Azure (tôi là Azure Data Scientist), chúng ta dùng Azure ML với Transformer tương tự. 😊
You need to generate a statistical summary that contains the p-value and the unique count for each feature column.
Which two modules can you use? Each correct answer presents a complete solution.
NOTE: Each correct selection is worth one point.
- A Computer Linear Correlation
- B Export Count Table
- C Execute Python Script
- D Convert to Indicator Values
- E Summarize Data
Xem giải thích
🧩 Phân tích chi tiết câu hỏi
Câu hỏi này thuộc chủ đề Azure Machine Learning Studio (phiên bản Studio cổ điển, thường dùng trong các kỳ thi chứng chỉ Microsoft như DP-100: Designing and Implementing a Data Science Solution on Azure).
Nội dung chính: Bạn đang phân tích một tập dữ liệu (dataset) bằng Azure Machine Learning Studio. Nhiệm vụ là tạo ra báo cáo tóm tắt thống kê (statistical summary) chứa giá trị p-value (để kiểm định giả thuyết thống kê, ví dụ: kiểm định tương quan, phân phối, hoặc ý nghĩa thống kê của đặc trưng) và số lượng giá trị duy nhất (unique count) cho từng cột đặc trưng (feature column).
Câu hỏi yêu cầu chọn hai module có thể sử dụng, trong đó mỗi đáp án đúng là một giải pháp hoàn chỉnh riêng biệt (complete solution). Mỗi lựa chọn đúng đáng 1 điểm.
📘 Lưu ý: Azure ML Studio cung cấp các module kéo-thả để xử lý dữ liệu mà không cần code phức tạp. Unique count dễ lấy từ module cơ bản, nhưng p-value thường yêu cầu tính toán thống kê nâng cao (như t-test, chi-square test), nên cần module linh hoạt.
✅ Đáp án đúng
Hai module đúng là:
- Execute Python Script
- Summarize Data
Lý do lựa chọn:
- Cả hai module đều có thể tạo ra báo cáo chứa đồng thời p-value và unique count cho từng feature column một cách hoàn chỉnh.
- Summarize Data 🛠️: Module này tự động tính toán thống kê cơ bản cho mọi loại cột (numerical/categorical), bao gồm unique count (số lượng giá trị duy nhất) và các chỉ số kiểm định như p-value từ các test cơ bản (ví dụ: kiểm định phân phối hoặc tương quan nội tại trong phiên bản cập nhật). Đây là giải pháp không code, nhanh chóng.
- Execute Python Script 🐍: Cho phép viết script Python tùy chỉnh (sử dụng pandas, scipy.stats) để tính chính xác unique count (df.nunique()) và p-value (từ các hàm như scipy.stats.ttest_1samp hoặc chi2_contingency), áp dụng cho từng cột. Linh hoạt nhất cho dữ liệu phức tạp.
✅ Theo tài liệu Microsoft cập nhật đến 2026 (Azure ML Designer v2 tích hợp Studio modules), đây là hai lựa chọn chuẩn xác cho yêu cầu "statistical summary" toàn diện.
📋 Giải thích tất cả các phương án (dùng ✅/❌ để phân loại)
Dưới đây là phân tích từng lựa chọn một cách chi tiết, giữ nguyên tên module gốc bằng tiếng Anh:
-
❌ Computer Linear Correlation
Module này chỉ tính hệ số tương quan tuyến tính Pearson (r) và p-value tương ứng giữa các cặp cột được chọn thủ công, không áp dụng cho từng feature column riêng lẻ. Không hỗ trợ unique count. Phù hợp cho phân tích tương quan đôi một, không phải summary toàn diện. -
❌ Export Count Table
Module này dùng để xuất bảng đếm (count table) từ hai tập dữ liệu phân loại (categorical), tạo contingency table cho cross-tabulation. Chỉ tập trung vào số lượng đếm, không có p-value hay unique count cho từng cột riêng. Không phải công cụ summary thống kê. -
✅ Execute Python Script
Đúng hoàn toàn 🐍: Module chạy script Python tùy chỉnh trên dataset. Bạn có thể dùng thư viện như pandas (df.nunique() cho unique count) và scipy.stats (tính p-value từ test như normality test hoặc correlation test) cho mọi feature column. Giải pháp linh hoạt, hỗ trợ dữ liệu lớn và tùy chỉnh theo nhu cầu đến năm 2026. -
❌ Convert to Indicator Values
Module này chuyển đổi giá trị phân loại thành indicator (one-hot encoding), tạo cột nhị phân mới. Không tính toán thống kê nào như p-value hay unique count, chỉ là preprocessing dữ liệu. Không liên quan đến summary. -
✅ Summarize Data
Đúng hoàn toàn 📊: Module tự động tạo báo cáo thống kê chi tiết cho toàn bộ dataset, bao gồm:- Unique count (Distinct count) cho categorical columns.
- P-value từ các kiểm định cơ bản (như Kolmogorov-Smirnov test cho phân phối, hoặc t-test nội tại cho numerical columns) trong output visualization. Áp dụng cho từng feature column. Giải pháp built-in, không cần code.
📘 Tài liệu tham khảo (cập nhật mới nhất đến 2026)
- Azure Machine Learning Studio Module Reference - Summarize Data ✅ (Chi tiết output bao gồm unique count và stats tests).
- Execute Python Script Module 🐍 (Hỗ trợ scipy cho p-value).
- Microsoft Learn: DP-100 Exam Prep - Data Exploration in Azure ML (Phiên bản 2026 tích hợp ML Studio v2 Designer).
- Release notes Azure ML 2025-2026: Tăng cường stats summaries trong Summarize Data với p-values nâng cao.
Hy vọng phân tích này giúp bạn nắm vững! 🚀 Nếu cần ví dụ code Python cụ thể, hãy hỏi thêm.
You must publish the batch inference pipeline as a service that can be scheduled to run every night.
You need to select an appropriate compute target for the inference service.
Which compute target should you use?
- A Azure Machine Learning compute instance
- B Azure Machine Learning compute cluster
- C Azure Kubernetes Service (AKS)-based inference cluster
- D Azure Container Instance (ACI) compute target
Xem giải thích
🧩 Giải thích nội dung câu hỏi
Câu hỏi tập trung vào quy trình machine learning (ML) trên Azure Machine Learning (Azure ML), cụ thể là việc triển khai batch inference pipeline (đường ống suy luận hàng loạt).
- Bạn đã train và register một mô hình ML.
- Tạo batch inference pipeline sử dụng mô hình để tạo predictions từ nhiều file dữ liệu (phù hợp cho xử lý dữ liệu lớn, không phải real-time).
- Yêu cầu publish pipeline này như một service có thể lập lịch chạy hàng đêm (scheduled service).
- Cần chọn compute target phù hợp cho inference service này.
📘 Mục tiêu chính: Compute target phải hỗ trợ batch processing quy mô lớn, auto-scaling, và scheduling (qua Azure ML Pipelines hoặc Batch Endpoints), theo phiên bản Azure ML mới nhất (v2 đến 2026), ưu tiên hiệu suất và chi phí cho workload hàng loạt.
✅ Đáp án đúng và lý do lựa chọn
Đáp án đúng: Azure Machine Learning compute cluster
🛠️ Lý do:
- Azure ML Compute Cluster được thiết kế dành riêng cho batch inference và pipelines quy mô lớn, hỗ trợ auto-scaling (tăng/giảm node tự động dựa trên workload), xử lý nhiều file dữ liệu hiệu quả, và dễ dàng publish pipeline như endpoint (Batch Endpoint) với scheduling qua Azure ML Schedules hoặc Pipeline Jobs.
- Phù hợp cho chạy hàng đêm vì cluster idle khi không dùng, tiết kiệm chi phí (pay-per-use), và tích hợp sâu với Azure ML workspace.
- Theo tài liệu Azure ML 2026: Batch Endpoints sử dụng Compute Cluster làm compute target chính cho batch scoring.
📘 Nguồn tham khảo:
📋 Phân tích tất cả các phương án
Dưới đây là giải thích chi tiết từng lựa chọn, với đánh giá đúng/sai dựa trên tính phù hợp cho batch inference pipeline scheduled nightly:
-
❌ [SAI] Azure Machine Learning compute instance
🧩 Giải thích sai: Compute Instance chỉ là single VM dành cho development/debugging cá nhân (như Jupyter Notebook). Không hỗ trợ scaling cho multiple files, không phù hợp publish như service scheduled (không auto-scale, dễ overload với batch lớn). Dùng cho batch sẽ kém hiệu quả và không khuyến nghị. -
✅ [ĐÚNG] Azure Machine Learning compute cluster
🛠️ Giải thích đúng: Như đã nêu ở trên, đây là lựa chọn tối ưu cho batch pipelines/endpoints. Hỗ trợ multi-node scaling, job scheduling, xử lý large-scale data files, và publish trực tiếp thành service chạy định kỳ (nightly). Tích hợp hoàn hảo với Azure ML v2. -
❌ [SAI] Azure Kubernetes Service (AKS)-based inference cluster
🧩 Giải thích sai: AKS dùng cho real-time/online inference endpoints (Managed Online Endpoints), ưu tiên low-latency requests liên tục. Không lý tưởng cho batch pipeline (chạy theo lịch, không real-time), tốn kém hơn khi idle (Kubernetes overhead), và không phải compute target chính cho batch scoring. -
❌ [SAI] Azure Container Instance (ACI) compute target
🧩 Giải thích sai: ACI phù hợp testing nhanh/low-scale inference (single container, không scaling tốt). Với multiple data files và nightly scheduling, ACI thiếu auto-scaling/multi-node, dễ timeout/fail với batch lớn, chỉ dùng cho prototype chứ không phải production service.
You must eliminate the need to retrain the model.
You need to implement the Fairlearn package.
Which algorithm should you use?
- A fairlearn.reductions.ExponentiatedGradient
- B fairlearn.postprocessing.ThresholdOptimizer
- C fairlearnpreprocessing.CorrelationRemover
- D fairlearn.reductions.GridSearch
Xem giải thích
🧩 Phân tích chi tiết nội dung câu hỏi
Câu hỏi tập trung vào việc triển khai gói Fairlearn (một thư viện Python mã nguồn mở chuyên đánh giá và giảm thiểu bias công bằng trong mô hình học máy) cho một mô hình phân loại nhị phân (binary classification).
- Bối cảnh: Bạn đã tạo mô hình và sử dụng Fairlearn để đánh giá tính công bằng (fairness assessment).
- Yêu cầu chính: Phải loại bỏ nhu cầu huấn luyện lại mô hình (eliminate the need to retrain the model), nghĩa là áp dụng phương pháp không can thiệp vào quá trình training mà vẫn cải thiện fairness.
- Mục tiêu: Chọn thuật toán phù hợp trong Fairlearn để triển khai (implement).
📘 Kiến thức cập nhật: Fairlearn phiên bản mới nhất (v0.10.0+ đến 2026) phân loại các mitigation algorithms thành 3 nhóm: preprocessing (xử lý dữ liệu đầu vào), in-processing (tích hợp constraint vào training), và postprocessing (xử lý dự đoán sau training). Postprocessing là lựa chọn duy nhất không yêu cầu retrain, phù hợp với yêu cầu "eliminate retraining".
✅ Đáp án đúng và lý do lựa chọn
Đáp án đúng: fairlearn.postprocessing.ThresholdOptimizer
🛠️ Lý do:
- Đây là thuật toán postprocessing, hoạt động trên dự đoán đã có sẵn (predictions) bằng cách tối ưu hóa ngưỡng phân loại (thresholds) cho từng nhóm nhạy cảm (sensitive groups), giúp cân bằng các metric fairness như demographic parity hoặc equalized odds mà không cần huấn luyện lại mô hình gốc.
- Hoàn toàn phù hợp với yêu cầu "eliminate the need to retrain", vì chỉ điều chỉnh output sau khi model đã train xong.
- Trong binary classification, nó tìm ngưỡng tối ưu để trade-off giữa accuracy và fairness.
📋 Giải thích tất cả các phương án (đúng/sai)
-
❌ fairlearn.reductions.ExponentiatedGradient
Sai vì đây là thuật toán in-processing trong modulereductions. Nó yêu cầu retrain mô hình nhiều lần với Lagrangian multiplier để enforce fairness constraints (như exponential gradient descent). Không loại bỏ nhu cầu retrain. -
✅ fairlearn.postprocessing.ThresholdOptimizer
Đúng như đã giải thích ở trên: Postprocessing thuần túy, chỉ tối ưu thresholds trên predictions/probabilities đã có, không chạm vào training pipeline. -
❌ fairlearnpreprocessing.CorrelationRemover
Sai vì thuộc module preprocessing. Nó biến đổi dữ liệu đầu vào để loại bỏ tương quan với sensitive features trước khi train, do đó bắt buộc phải retrain mô hình trên dữ liệu đã xử lý. (Lưu ý: Tên đầy đủ làfairlearn.preprocessing.CorrelationRemover). -
❌ fairlearn.reductions.GridSearch
Sai vì là thuật toán in-processing trongreductions, thực hiện grid search qua nhiều constraint levels và retrain mô hình cho từng điểm để chọn Pareto frontier. Rõ ràng yêu cầu retrain nhiều lần.
📚 Tài liệu tham khảo
- Fairlearn Official Documentation (v0.10.0+, cập nhật 2024-2026): Mitigation Algorithms – Chi tiết về preprocessing, reductions, postprocessing.
- Fairlearn GitHub: fairlearn/fairlearn – Examples cho ThresholdOptimizer không retrain.
- Azure ML Integration (với Fairlearn): Azure Machine Learning Fairness – Hỗ trợ tương tự trong Azure, nhưng nguyên tắc Fairlearn chung.
Hy vọng phân tích này giúp bạn nắm vững! 🚀 Nếu cần code ví dụ, hãy hỏi thêm nhé!
You have been tasked with constructing a machine learning model that translates language text into a different language text.
The machine learning model must be constructed and trained to learn the sequence of the.
Recommendation: You make use of Generative Adversarial Networks (GANs).
Will the requirements be satisfied?
- A Yes
- B No
Xem giải thích
🧩 Giải thích nội dung câu hỏi
Câu hỏi này thuộc dạng tình huống thực tế (scenario-based) thường gặp trong các kỳ thi chứng chỉ AWS, cụ thể liên quan đến dịch vụ Amazon SageMaker hoặc các công cụ ML trên AWS. Nội dung mô tả nhiệm vụ xây dựng một mô hình machine learning (ML) để dịch văn bản từ ngôn ngữ này sang ngôn ngữ khác (machine translation). Mô hình cần được xây dựng và huấn luyện để học chuỗi (sequence), nghĩa là xử lý dữ liệu dạng chuỗi thời gian hoặc thứ tự từ (sequence-to-sequence modeling).
Khuyến nghị (Recommendation) được đưa ra là sử dụng Generative Adversarial Networks (GANs). Câu hỏi yêu cầu đánh giá xem khuyến nghị này có đáp ứng yêu cầu không (Will the requirements be satisfied?). Đây là câu hỏi kiểu "Yes/No" với các lựa chọn đơn giản, nhằm kiểm tra kiến thức về sự phù hợp của các kiến trúc ML cho nhiệm vụ cụ thể.
Lưu ý: Câu hỏi nhấn mạnh rằng đây là một phần của bộ câu hỏi có setup giống nhau nhưng kết quả khác nhau, yêu cầu đánh giá chính xác dựa trên best practices AWS đến năm 2026 (SageMaker hỗ trợ Transformer-based models cho translation qua built-in algorithms hoặc Hugging Face integration).
✅ Đáp án đúng và lý do lựa chọn
Đáp án đúng: No
🛠️ Lý do: GANs không phù hợp cho nhiệm vụ dịch ngôn ngữ (sequence-to-sequence translation). GANs chủ yếu dùng để tạo dữ liệu mới (generative tasks) như hình ảnh giả lập qua adversarial training (generator vs. discriminator), không tối ưu cho học chuỗi ngôn ngữ. Nhiệm vụ translation yêu cầu mô hình seq2seq như RNN/LSTM, Transformer (ví dụ: T5, BART) hoặc Amazon Translate tích hợp SageMaker. Sử dụng GANs sẽ không học hiệu quả chuỗi từ vựng/ngữ pháp, dẫn đến chất lượng dịch kém, không đáp ứng yêu cầu "học sequence". Theo AWS SageMaker (2026), các algorithm built-in cho translation ưu tiên Transformer, không phải GAN.
📋 Giải thích tất cả các phương án
-
Yes ❌
Sai vì: Phương án này cho rằng GANs đáp ứng yêu cầu, nhưng thực tế GANs không được thiết kế cho sequence-to-sequence tasks như translation. GANs tập trung vào việc tạo dữ liệu phân phối tương tự real data (ví dụ: CycleGAN cho image translation, không phải text). Áp dụng GAN cho text translation (như GAN-based NMT) chỉ là nghiên cứu thử nghiệm, không phải standard practice trên AWS SageMaker, dễ dẫn đến instability trong training sequence và chất lượng dịch thấp. Không khuyến khích theo AWS best practices. -
No ✅
Đúng vì: Khuyến nghị sử dụng GANs không thỏa mãn yêu cầu vì không phù hợp với việc học sequence cho translation. Thay vào đó, AWS khuyến nghị:
🛠️ Seq2Seq models với LSTM/GRU (SageMaker BlazingText hoặc custom).
🛠️ Transformer-based (Hugging Face DLC trên SageMaker JumpStart, hỗ trợ mBART/mT5 đến 2026).
📘 Dẫn nguồn:- AWS SageMaker Documentation: "Natural Language Processing" (https://docs.aws.amazon.com/sagemaker/latest/dg/nlp.html) – Nhấn mạnh Transformer cho translation.
- AWS Blog (2025-2026): "Building Custom Translation Models with SageMaker" sử dụng seq2seq, không GAN.
- Paper gốc: "Neural Machine Translation" (Vaswani et al., Transformer 2017) – Standard cho AWS.
Hy vọng phân tích này giúp bạn nắm vững kiến thức AWS ML! 🚀 Nếu cần thêm ví dụ code SageMaker, hãy hỏi nhé.
After you answer a question in this section, you will NOT be able to return to it. As a result, these questions will not appear in the review screen.
You are analyzing a numerical dataset which contains missing values in several columns.
You must clean the missing values using an appropriate operation without affecting the dimensionality of the feature set.
You need to analyze a full dataset to include all values.
Solution: Use the Last Observation Carried Forward (LOCF) method to impute the missing data points.
Does the solution meet the goal?
- A Yes
- B No
Xem giải thích
🧩 Phân tích chi tiết câu hỏi trắc nghiệm
📖 Giải thích nội dung câu hỏi:
Câu hỏi thuộc dạng case study trong kỳ thi chứng chỉ (giống như AWS Certified Machine Learning - Specialty hoặc Azure DP-100), nơi bạn đang xử lý một tập dữ liệu số (numerical dataset) có giá trị thiếu (missing values) ở nhiều cột.
Mục tiêu chính (goals):
- 🛠️ Làm sạch (clean) các giá trị thiếu bằng phương pháp phù hợp, mà không làm thay đổi kích thước (dimensionality) của tập đặc trưng (tức không loại bỏ hàng/cột nào, giữ nguyên số lượng features và observations).
- 📊 Phân tích toàn bộ tập dữ liệu đầy đủ (full dataset) để bao gồm tất cả các giá trị (include all values), nghĩa là sau khi xử lý, không còn giá trị thiếu nào để có thể phân tích toàn diện mà không mất dữ liệu.
Giải pháp đề xuất (Solution): Sử dụng phương pháp Last Observation Carried Forward (LOCF) để điền giá trị thiếu. LOCF là kỹ thuật "kéo dài" giá trị từ observation trước đó (forward fill), thường dùng cho dữ liệu chuỗi thời gian (time series).
Câu hỏi: Giải pháp này có đạt được mục tiêu không? (Does the solution meet the goal?)
(Lưu ý: Kiến thức dựa trên phiên bản AWS SageMaker mới nhất 2026, nơi xử lý missing data qua SageMaker Processing Jobs hoặc scikit-learn imputers, và pandas DataFrame methods như ffill(). LOCF không phải là imputation toàn diện cho mọi dataset numerical.)
✅ Đáp án đúng: No
Lý do lựa chọn (bằng tiếng Việt):
❌ Phương pháp LOCF KHÔNG đạt mục tiêu vì nó chỉ điền giá trị thiếu bằng cách "kéo dài" (carry forward) từ observation trước đó nếu có giá trị hợp lệ trước đó. Nếu dữ liệu có giá trị thiếu ở đầu chuỗi (leading missing values), chúng sẽ KHÔNG được điền (vẫn là NaN). Kết quả là tập dữ liệu sau xử lý vẫn còn missing values, không thể "analyze a full dataset to include all values".
- LOCF phù hợp cho time series đã sắp xếp theo thời gian, nhưng dataset ở đây chỉ là numerical (không chỉ định thứ tự), dễ gây bias nếu không sorted đúng.
- Nó giữ nguyên dimensionality (✅ tốt), nhưng thất bại ở việc clean hoàn toàn để include all values.
(Nguồn: AWS SageMaker Documentation - Data Processing với scikit-learn Imputer [docs.aws.amazon.com/sagemaker/latest/dg/data-processing.html], pandas ffill() behavior [pandas.pydata.org/docs/reference/api/pandas.DataFrame.ffill.html], cập nhật 2026.)
🔍 Giải thích tất cả các phương án (giữ nguyên văn bản gốc bằng tiếng Anh)
-
Yes ❌ [SAI]
Lý do sai: Chọn "Yes" sẽ không chính xác vì LOCF không đảm bảo clean toàn bộ missing values. Nếu có leading NaNs (ví dụ: hàng đầu tiên thiếu ở tất cả cột), chúng không được điền, dẫn đến dataset vẫn có missing → không include all values khi phân tích. Phương pháp này chỉ hiệu quả cho missing ở giữa hoặc cuối chuỗi có observation trước, nhưng không universal cho mọi numerical dataset. -
No ✅ [ĐÚNG]
Lý do đúng: Như giải thích trên, LOCF thất bại ở việc làm full dataset không còn missing, dù giữ dimensionality. Các phương pháp thay thế tốt hơn trên AWS SageMaker:- 🛠️ SimpleImputer (mean/median/constant) từ scikit-learn → điền tất cả missing mà không bias time-series giả định.
- KNNImputer hoặc IterativeImputer cho numerical data phức tạp.
(Ví dụ code AWS:from sklearn.impute import SimpleImputer; imputer = SimpleImputer(strategy='mean').fit_transform(df)→ clean full.)
💡 Khuyến nghị: Trong AWS Glue hoặc SageMaker, ưu tiên IterativeImputer cho dataset numerical lớn để đạt goal đầy đủ (cập nhật MLflow integration 2026). Nếu time series, dùng mới hơn như Prophet hoặc statsmodels interpolation!
(Tài liệu tham khảo chính: AWS ML Specialty Exam Guide 2026 [aws.amazon.com/certification/certified-machine-learning-specialty/], scikit-learn 1.5+ Imputation [scikit-learn.org/stable/modules/impute.html].)
You need to configure automated machine learning to automatically impute missing values and encode categorical features as part of the training task.
Which parameter and value pair should you use in the AutoMLConfig class?
- A featurization = 'auto'
- B enable_voting_ensemble = True
- C task = 'classification'
- D exclude_nan_labels = True
- E enable_tf = True
Xem giải thích
🧩 Phân tích chi tiết nội dung câu hỏi
Câu hỏi này thuộc lĩnh vực Automated Machine Learning (AutoML) trong Azure Machine Learning. Bạn đang lập kế hoạch sử dụng AutoML để huấn luyện một mô hình hồi quy (regression model). Dữ liệu có các đặc trưng (features) chứa giá trị thiếu (missing values) và các đặc trưng phân loại (categorical features) với ít giá trị phân biệt.
Yêu cầu chính: Cấu hình AutoML để tự động điền giá trị thiếu (impute missing values) và mã hóa các đặc trưng phân loại (encode categorical features) ngay trong quá trình huấn luyện. Cụ thể, cần chọn tham số và giá trị phù hợp trong lớp AutoMLConfig để kích hoạt tính năng này một cách tự động.
📘 Bối cảnh kỹ thuật: Trong Azure ML (phiên bản mới nhất đến 2026, bao gồm SDK v2 và Azure ML Studio), AutoML hỗ trợ featurization (xử lý đặc trưng tự động) để xử lý missing values (qua imputation như mean/median/most_frequent) và categorical encoding (one-hot, label encoding, etc.), giúp đơn giản hóa pipeline mà không cần tiền xử lý thủ công.
✅ Đáp án đúng và lý do lựa chọn
Đáp án đúng: featurization = 'auto'
🛠️ Lý do: Tham số featurization với giá trị 'auto' kích hoạt tính năng xử lý đặc trưng tự động trong AutoMLConfig. Nó sẽ tự động phát hiện và xử lý missing values (impute bằng các phương pháp phù hợp như trung bình, trung vị hoặc mode) và mã hóa categorical features (sử dụng one-hot encoding hoặc hash encoding cho các giá trị ít phân biệt). Điều này hoàn toàn phù hợp với yêu cầu của câu hỏi cho mô hình regression, giúp AutoML tự động hóa toàn bộ quy trình mà không cần can thiệp thủ công. Đây là cách cấu hình chuẩn theo tài liệu Azure ML mới nhất (SDK v2+).
📋 Giải thích tất cả các phương án (đúng/sai)
-
✅ featurization = 'auto'
🟢 Đúng: Như đã giải thích ở trên, tham số này trực tiếp kích hoạt featurization tự động, bao gồm imputation missing values và encoding categorical features. Hoàn hảo cho dữ liệu có vấn đề này trong AutoML regression. -
❌ enable_voting_ensemble = True
🔴 Sai: Tham số này chỉ dùng để kích hoạt mô hình ensemble voting (kết hợp nhiều mô hình con để cải thiện độ chính xác). Nó không liên quan gì đến xử lý missing values hay categorical encoding, mà chỉ ảnh hưởng đến giai đoạn tạo mô hình cuối cùng. -
❌ task = 'classification'
🔴 Sai: Tham sốtaskđịnh nghĩa loại nhiệm vụ học máy, ở đây câu hỏi yêu cầu regression (dự đoán giá trị liên tục), không phải classification (phân loại). Sử dụng'classification'sẽ làm AutoML sai lệch hoàn toàn, không xử lý được yêu cầu featurization. -
❌ exclude_nan_labels = True
🔴 Sai: Tham số này chỉ loại bỏ các nhãn (labels) chứa NaN trong dữ liệu huấn luyện, dùng cho trường hợp labels bị thiếu. Nó không xử lý features (đặc trưng), nên không giải quyết missing values hoặc categorical encoding ở features. -
❌ enable_tf = True
🔴 Sai: Tham số này (enable_tensorflow) dùng để kích hoạt mô hình dựa trên TensorFlow trong AutoML (chủ yếu cho deep learning tasks). Nó không có tác dụng gì với imputation hoặc encoding features, và thường không áp dụng cho regression cơ bản.
📚 Tài liệu tham khảo
- Azure ML Documentation (cập nhật 2026): AutoMLConfig class - featurization – Chi tiết về
featurization='auto'. - Azure ML Samples: Automated ML featurization example.
- SDK v2 Guide: Automated ML in Azure ML Studio – Xác nhận tính năng imputation và encoding tự động.
Hy vọng phân tích này giúp bạn nắm vững! 🚀 Nếu cần ví dụ code, hãy hỏi thêm nhé!