Ngân hàng đề — AWS Certified Machine Learning Engineer Associate
Tìm thấy 635 câu.
An organization using Amazon SageMaker has deployed a machine learning model into production. To adhere to responsible AI practices, they want to continuously monitor the model for fairness and transparency over time.
Which SageMaker feature should they use to ensure that biases do not emerge in the model as it processes new data?
-
A
SageMaker Model Monitor to track data distribution and performance.
-
B
SageMaker Autopilot for automatic tuning and optimization of the model’s hyperparameters.
-
C
SageMaker Pipelines to automate model retraining when bias is detected.
-
D
SageMaker Data Wrangler for pre-training data processing.
Xem giải thích
Đáp án
A — SageMaker Model Monitor
Vì sao đúng
Đề cần theo dõi liên tục sau khi triển khai, và Model Monitor là dịch vụ duy nhất trong danh sách làm việc đó. Nó lấy thống kê nền từ dữ liệu huấn luyện rồi so với dữ liệu thật đi vào endpoint theo lịch, phát hiện trôi phân bố, chất lượng giảm, thiên lệch, và trôi đóng góp đặc trưng — đúng bốn thứ mà thực hành AI có trách nhiệm đòi hỏi phải giám sát.
Vì sao các phương án khác sai
- B. Autopilot — tự dựng và tinh chỉnh mô hình, thuộc giai đoạn trước khi triển khai.
- C. Pipelines để tự huấn luyện lại khi phát hiện thiên lệch — Pipelines là phản ứng sau khi có cảnh báo; nó không phải thứ phát hiện ra vấn đề.
- D. Data Wrangler — chuẩn bị dữ liệu trước khi huấn luyện.
A company stores a large dataset in S3 that consists of multiple CSV files. They want to run queries on the data and visualize it using QuickSight. However, the dataset lacks a predefined schema.
How should the company set up the data infrastructure to meet these requirements?
-
A
Use Glue crawlers to infer the schema, store the schema in Glue Data Catalog, and use Athena to run queries directly on the CSV files in S3.
-
B
Use Redshift Spectrum to read the CSV files from S3 and manually create a schema for Redshift to query the data.
-
C
Use Glue ETL to convert CSV files into JSON format, create a schema in Glue Data Catalog, and then import data into Redshift for querying.
-
D
Use Glue ETL to transform the CSV data into a Parquet format, store the schema in the Glue Data Catalog, and use Athena to query the data.
Xem giải thích
Đáp án
A — Dùng Glue crawler suy ra lược đồ, lưu vào Data Catalog, rồi truy vấn
Vì sao đúng
Vấn đề của đề là dữ liệu không có lược đồ. Crawler quét tệp CSV trên S3, tự suy ra tên cột và kiểu dữ liệu, rồi đăng ký thành bảng trong Glue Data Catalog. Từ đó Athena truy vấn được bằng SQL và QuickSight nối vào Athena để vẽ biểu đồ. Cách này ít bước nhất và không phải khai tay gì.
Vì sao các phương án khác sai
- B. Spectrum rồi khai lược đồ bằng tay — làm tay, không mở rộng được khi thêm tệp mới, và kéo theo cả một cụm Redshift.
- C. Đổi CSV sang JSON — JSON không giải quyết chuyện thiếu lược đồ, và còn tốn dung lượng hơn.
- D. Đổi sang Parquet — rất nên làm cho hiệu năng, nhưng vẫn cần crawler để có lược đồ; bản thân việc đổi định dạng không trả lời câu hỏi của đề.
You are using SageMaker Data Wrangler to preprocess data from Amazon S3 for a machine learning model. After performing one-hot encoding on a categorical feature, you notice that some features are dominating the learning process due to large numerical ranges. What technique should you apply to ensure all features are treated equally by the model?
-
A
Drop the dominating features to balance the dataset
-
B
Label encoding for categorical features
-
C
Feature normalization using Min-Max scaling
-
D
Use recursive feature elimination to remove unimportant features
Xem giải thích
Đáp án
C — Chuẩn hoá đặc trưng bằng Min-Max scaling
Vì sao đúng
Sau khi mã hoá một-nóng, các cột mới chỉ nhận giá trị 0 và 1, trong khi những cột số sẵn có có thể nằm ở thang hàng nghìn. Chênh lệch thang đó khiến các thuật toán dựa trên khoảng cách hoặc gradient bị đặc trưng có đơn vị lớn áp đảo. Min-Max đưa mọi đặc trưng về cùng khoảng 0–1 nên tất cả đóng góp công bằng.
Vì sao các phương án khác sai
- A. Bỏ những đặc trưng đang áp đảo — vứt bỏ thông tin để né một vấn đề chỉ cần chuẩn hoá là xong.
- B. Mã hoá nhãn cho biến phân loại — thay một-nóng bằng số nguyên, nhưng làm vậy tạo ra thứ tự giả giữa các hạng mục vốn không có thứ tự.
- D. Loại đặc trưng bằng RFE — chọn đặc trưng, không giải quyết chuyện lệch thang.
A company needs to ensure that its machine learning models are ethically developed by reducing bias and detecting potential vulnerabilities in the output. How can Amazon SageMaker Ground Truth help in this process?
-
A
By leveraging Ground Truth’s human-in-the-loop feedback mechanism to review and correct model outputs for bias and vulnerabilities.
-
B
By using Ground Truth only for labeling data, leaving bias detection to other AWS services like SageMaker Clarify.
-
C
By exclusively relying on third-party vendors to detect bias and vulnerabilities in model outputs.
-
D
By using Ground Truth's fully automated labeling system to eliminate all bias from the training data.
Xem giải thích
Đáp án
A — Dùng cơ chế người-trong-vòng-lặp của Ground Truth để rà soát
Vì sao đúng
Ground Truth kết hợp gán nhãn tự động với người thật xem lại những trường hợp mô hình không chắc chắn. Với AI có trách nhiệm, đó là chỗ then chốt: thiên lệch thường nằm ngay trong nhãn, và chỉ con người mới nhận ra những mẫu bị gán nhãn lệch một cách hệ thống. Người rà soát cũng phát hiện được đầu ra có vấn đề trước khi nó thành dữ liệu huấn luyện.
Vì sao các phương án khác sai
- B. Chỉ dùng Ground Truth để gán nhãn, để dịch vụ khác lo thiên lệch — bỏ phí đúng tính năng hữu ích nhất của nó cho mục đích này.
- C. Phó thác hoàn toàn cho bên thứ ba — không phải giải pháp kỹ thuật, và trách nhiệm vẫn là của bạn.
- D. Hệ thống gán nhãn hoàn toàn tự động loại bỏ mọi thiên lệch — sai: gán nhãn tự động học từ dữ liệu có sẵn nên nó nhân bản thiên lệch chứ không loại bỏ.
Which of the following best describes a trust policy in AWS IAM?
-
A
A policy attached to a user that allows them to assume roles in different AWS accounts.
-
B
A policy that defines permissions to access AWS resources from external services but only for AWS-managed resources like Lambda functions.
-
C
A policy that defines all actions permitted for an AWS account’s root user.
-
D
A policy that specifies which identities (users, services, or accounts) are allowed to assume a role, commonly used for cross-account access.
Xem giải thích
Đáp án
D — Chính sách quy định những danh tính nào được phép đóng vai
Vì sao đúng
Mỗi IAM role có hai chính sách và đây là chỗ hay nhầm nhất. Chính sách quyền nói vai được làm gì; trust policy nói ai được mượn vai này. Trust policy liệt kê principal — dịch vụ AWS như ec2.amazonaws.com, một tài khoản AWS khác, hay danh tính liên kết — kèm hành động sts:AssumeRole. Không có trust policy phù hợp thì không ai dùng được vai, dù quyền có đủ tới đâu.
Vì sao các phương án khác sai
- A. Chính sách gắn vào người dùng cho phép họ đóng vai — đó là chính sách phía người gọi; trust policy nằm ở phía vai. Thực tế cần cả hai khớp nhau.
- B. Chính sách cấp quyền truy cập tài nguyên — đó là chính sách quyền, không phải trust policy.
- C. Chính sách cho tài khoản gốc — không liên quan.
A company uses Amazon SageMaker Pipelines to orchestrate its machine learning workflows. They need to reuse the same preprocessing step across multiple different models. How can SageMaker Pipelines help with reusability?
-
A
By enabling the same pipeline step to be reused across different pipelines without redefinition.
-
B
By storing steps in Amazon S3, which can be manually imported into each pipeline.
-
C
By requiring each pipeline to be redefined from scratch for different models.
-
D
By allowing steps to be manually copied and pasted across different pipeline definitions.
Xem giải thích
Đáp án
A — Cùng một bước dùng lại được ở nhiều pipeline khác nhau
Vì sao đúng
Bước trong SageMaker Pipelines là đối tượng khai báo được, nên định nghĩa bước tiền xử lý một lần rồi tham chiếu nó ở nhiều pipeline. Kết hợp với pipeline parameter, cùng một bước chạy được cho nhiều bộ dữ liệu hoặc nhiều mô hình. Lợi ích thật nằm ở chỗ sửa một chỗ là mọi nơi cùng đổi — không còn ba bản sao lệch nhau âm thầm.
Vì sao các phương án khác sai
- B. Cất bước trên S3 rồi nhập tay — không phải cách Pipelines hoạt động.
- C. Phải định nghĩa lại từ đầu cho mỗi mô hình — chính là điều đề muốn tránh.
- D. Chép dán giữa các pipeline — chạy được nhưng là cách tệ nhất: mỗi bản sao trôi dần theo hướng riêng.
Which of the following best describes the "human-in-the-loop" (HITL) approach in Amazon SageMaker Ground Truth?
-
A
A process where human laborers label all the data to ensure the highest accuracy.
-
B
A combination of machine learning and human feedback where human workers only intervene in complex tasks, improving labeling efficiency.
-
C
A method of labeling data that eliminates the need for human feedback entirely through automation.
-
D
A system where human labelers work in parallel with machines to label data simultaneously.
Xem giải thích
Đáp án
B — Kết hợp học máy với phản hồi của con người, người chỉ can thiệp khi mô hình không chắc chắn
Vì sao đúng
Ground Truth gán nhãn tự động phần lớn dữ liệu bằng một mô hình học dần, và chỉ chuyển cho người những mẫu mà mô hình có độ tin cậy thấp. Nhãn do người làm lại được đưa ngược vào để mô hình tốt lên, nên tỷ lệ cần người giảm dần. Đó là cân bằng giữa chi phí và độ chính xác: rẻ hơn gán nhãn thủ công toàn bộ mà vẫn giữ được chất lượng ở những ca khó.
Vì sao các phương án khác sai
- A. Người gán nhãn toàn bộ — chính xác nhưng đắt và chậm; đó là gán nhãn thủ công, không phải người-trong-vòng-lặp.
- C. Bỏ hẳn phản hồi của con người — thì không còn "human" trong vòng lặp nữa.
- D. Người và máy gán nhãn song song cùng lúc — mô tả sai; điểm cốt lõi là định tuyến theo độ tin cậy, không phải làm song song.
A data scientist at a healthcare company is tasked with building a machine learning model to predict patient outcomes based on clinical data. The team decides to test different algorithms, hyperparameters, and feature sets to find the most accurate model. To manage and compare these variations, the data scientist decides to use SageMaker Experiments.
Which of the following strategies will BEST allow the team to track and compare their experiments, ensuring reproducibility and organized management of model configurations?
-
A
Use SageMaker Experiments to organize model runs into trials under a single experiment, where each trial logs configurations and metrics, enabling easy comparison of different models and hyperparameters.
-
B
Log every hyperparameter and configuration change manually to a spreadsheet and compare the metrics offline after each run.
-
C
Create a single trial with one configuration and manually adjust hyperparameters each time for new tests.
-
D
Use SageMaker Ground Truth to label datasets and organize each training run as a separate trial component under different experiments.
Xem giải thích
Đáp án
A — Dùng SageMaker Experiments, gom các lần chạy thành trial dưới một experiment
Vì sao đúng
Experiments dựng cho đúng bài toán này. Một experiment là cả dự án; mỗi trial là một cấu hình được thử; mỗi trial component là một bước trong trial đó. Cấu trúc ba tầng này giữ được siêu tham số, dữ liệu và chỉ số của từng lần chạy, rồi cho xếp cạnh nhau để so — thay vì sau vài chục lần chạy chẳng ai nhớ bản tốt nhất đã dùng gì.
Vì sao các phương án khác sai
- B. Ghi tay vào bảng tính — sẽ sai và sẽ thiếu; đây đúng là thứ Experiments thay thế.
- C. Một trial duy nhất rồi sửa siêu tham số bằng tay — mất luôn khả năng so sánh giữa các lần chạy.
- D. Ground Truth để tổ chức các lần chạy — Ground Truth là dịch vụ gán nhãn dữ liệu.
A fintech company is building a machine learning pipeline to predict credit card fraud. They plan to use SageMaker Pipelines to automate the entire workflow, including data preprocessing, model training, hyperparameter tuning, and deployment. To ensure that the pipeline produces the most accurate model, they want to test multiple configurations of the model, including variations in the algorithm and feature sets. They also need to track and compare each configuration to determine the best performing model.
Which of the following solutions BEST fits their needs?
-
A
Use Amazon S3 to store training data, manually track hyperparameter configurations, and SageMaker Pipelines to handle training and deployment.
-
B
Use SageMaker Pipelines to automate the workflow and SageMaker Experiments to track and compare multiple configurations.
-
C
Use SageMaker Feature Store to manage model versions and SageMaker Autopilot to automatically deploy the best model based on accuracy.
-
D
Use SageMaker Ground Truth to create a labeled dataset, SageMaker Autopilot to automate model training, and SageMaker Feature Store to track hyperparameters and metrics.
Xem giải thích
Đáp án
B — Pipelines để tự động hoá quy trình, Experiments để theo dõi các lần chạy
Vì sao đúng
Hai dịch vụ bổ sung nhau và đề cần cả hai. Pipelines đóng gói chuỗi tiền xử lý – huấn luyện – đánh giá – đăng ký thành một quy trình chạy lại được và tự động. Experiments ghi lại mỗi lần chạy kèm siêu tham số và chỉ số, để so được các phiên bản mô hình. Có Pipelines mà không có Experiments thì tự động hoá xong không biết bản nào tốt hơn.
Vì sao các phương án khác sai
- A. Theo dõi siêu tham số bằng tay — không mở rộng được, trái yêu cầu tự động hoá.
- C. Feature Store để quản lý phiên bản mô hình — Feature Store quản đặc trưng; phiên bản mô hình là việc của Model Registry.
- D. Ground Truth để tạo tập dữ liệu có nhãn — đúng là công cụ gán nhãn, nhưng đề không nói tới việc thiếu nhãn.
A company is training a deep learning model with billions of parameters, which is too large to fit on a single machine. They decide to use model parallelism on Amazon SageMaker.
What key feature of SageMaker makes model parallelism easier to implement, and how does it work?
-
A
SageMaker Model Monitor automatically manages and optimizes the model splitting process across multiple GPUs.
-
B
SageMaker’s Model Parallelism Library automatically splits the model across multiple GPUs or machines, based on the model architecture and available memory.
-
C
SageMaker’s built-in algorithms dynamically adjust the batch size to ensure the model can be trained on multiple machines.
-
D
SageMaker handles model parallelism by dividing the dataset across multiple machines and averaging the model gradients.
Xem giải thích
Đáp án
B — Thư viện Model Parallelism của SageMaker tự chia mô hình ra nhiều GPU
Vì sao đúng
Khi mô hình không vừa bộ nhớ một GPU, phải chia chính mô hình — theo lớp hoặc theo tensor — ra nhiều thiết bị. Thư viện của SageMaker tự phân tích đồ thị mô hình, chia sao cho cân bằng, và lo phần truyền dữ liệu giữa các phần. Nhờ vậy bạn không phải tự viết logic chia rất dễ sai.
Vì sao các phương án khác sai
- A. Model Monitor quản lý việc chia mô hình — Model Monitor giám sát mô hình đã triển khai, không liên quan gì tới huấn luyện.
- C. Tự điều chỉnh kích thước lô cho vừa bộ nhớ — giảm lô giúp được phần dữ liệu, nhưng trọng số mô hình vẫn phải nằm trong bộ nhớ; không giải quyết được vấn đề.
- D. Chia tập dữ liệu ra nhiều máy — đó là song song theo dữ liệu, và nó đòi mỗi máy giữ một bản sao đầy đủ của mô hình, tức là không dùng được ở đây.