Ngân hàng đề — AWS Certified Machine Learning Engineer Associate
Tìm thấy 635 câu.
A company is using Amazon Bedrock to develop a generative AI application that creates personalized email content based on customer preferences. They need to store customer interaction data, securely fine-tune the foundation models with their own dataset, and monitor model performance.
Which combination of AWS services should the company use to meet these requirements? (Choose THREE.)
-
A
Amazon SageMaker for model fine-tuning
-
B
AWS CloudWatch for storing and querying model logs
-
C
Amazon Kinesis for streaming real-time customer interaction data to the model
-
D
AWS CloudTrail for monitoring and auditing access to the Bedrock models
-
E
AWS Identity and Access Management (IAM) for securing access to Bedrock APIs
-
F
Amazon S3 for storing customer interaction data
Xem giải thích
Đáp án
A, E và F — SageMaker để tinh chỉnh, IAM để bảo vệ API, S3 để lưu dữ liệu tương tác
Vì sao đúng
Ba mảnh ghép đúng ba nhu cầu đề nêu:
- F. S3 lưu dữ liệu tương tác của khách — rẻ, bền, và là nguồn để tinh chỉnh sau này.
- A. SageMaker lo phần tinh chỉnh mô hình bằng chính dữ liệu đó.
- E. IAM kiểm soát ai gọi được API của Bedrock, phần bảo mật bắt buộc.
Vì sao các phương án khác sai
- B. CloudWatch để lưu và truy vấn log mô hình — hữu ích cho vận hành, nhưng không phải nơi lưu dữ liệu tương tác để huấn luyện.
- C. Kinesis để truyền dữ liệu thời gian thực — đề không nêu yêu cầu thời gian thực nào.
- D. CloudTrail để kiểm toán — nên có, nhưng đề hỏi ba mảnh cốt lõi và CloudTrail là lớp bổ sung chứ không phải thứ thiếu thì hệ thống không chạy.
You are developing an AI model for image classification that shows poor performance on both training and new data. The model exhibits high bias, meaning it is unable to capture the complexity of the data. According to responsible AI practices, which TWO strategies should you implement to reduce bias and improve model performance? (Choose TWO)
-
A
Use cross-validation to ensure the model is generalizing well across different subsets of data.
-
B
Apply early stopping to prevent the model from learning noise in the training data.
-
C
Reduce the number of features by applying dimensionality reduction techniques like PCA.
-
D
Implement oversampling to duplicate samples from the majority class in the dataset.
-
E
Add more training data to increase the model's ability to learn patterns from diverse examples.
Xem giải thích
Đáp án
A và E — dùng kiểm định chéo, và thêm dữ liệu huấn luyện
Vì sao đúng
Đề mô tả thiên lệch cao: mô hình kém trên cả tập huấn luyện lẫn dữ liệu mới, tức là chưa học nổi quy luật trong dữ liệu.
- E. Thêm dữ liệu huấn luyện cho mô hình nhiều ví dụ đa dạng hơn để học ra quy luật.
- A. Kiểm định chéo cho ước lượng đáng tin về năng lực thật, nhờ vậy biết chắc vấn đề là thiếu khớp chứ không phải chia tập không may.
Vì sao các phương án khác sai
- B. Dừng sớm — dùng để chống quá khớp; ở đây dừng sớm còn làm mô hình học được ít hơn nữa.
- C. Giảm chiều bằng PCA — bớt thông tin đầu vào, làm thiên lệch nặng thêm.
- D. Nhân bản mẫu của lớp đa số — vừa sai hướng (thường người ta tăng lớp thiểu số), vừa không liên quan tới thiên lệch cao.
A company needs to perform regular ETL operations on large semi-structured datasets stored in Amazon S3 and then load the processed data into Amazon Redshift for analytics. They also want to automatically extract metadata from the S3 files and query the data using SQL without managing the infrastructure.
Which combination of AWS Glue services should the company use to meet their requirements?
-
A
AWS Glue Data Catalog for metadata extraction, Glue crawlers for processing data into Redshift, and Glue ETL jobs to transform the data.
-
B
AWS Glue Data Catalog for metadata extraction, Glue ETL jobs for data transformation, and Athena for querying the data directly from S3.
-
C
AWS Glue Data Catalog to manage S3 data, manual scripts to process the data, and Redshift for analytics.
-
D
AWS Glue Data Catalog for metadata extraction, Glue ETL jobs to process the data, and Glue crawlers to schedule the jobs.
Xem giải thích
Đáp án
B — Data Catalog cho siêu dữ liệu, Glue ETL job để biến đổi, rồi nạp vào Redshift
Vì sao đúng
Đây là đường ống Glue tiêu chuẩn và mỗi thành phần đúng vai: Data Catalog giữ lược đồ của dữ liệu bán cấu trúc trên S3; ETL job chạy Spark để biến đổi và ghi vào Redshift qua connector dựng sẵn. Toàn bộ không máy chủ, chạy theo lịch, và có bookmark để lần sau chỉ xử lý dữ liệu mới.
Vì sao các phương án khác sai
- A. Dùng crawler để xử lý dữ liệu — hiểu sai vai trò: crawler chỉ suy ra lược đồ, nó không biến đổi gì.
- C. Script thủ công — trái yêu cầu tự động hoá và phải tự vận hành.
- D — đúng phần đầu nhưng sai ở khâu cuối, không đưa dữ liệu vào Redshift theo cách hợp lý.
Your organization wants to perform image classification using Amazon SageMaker’s built-in algorithms.
Which steps are required to train a model using one of SageMaker’s pre-packaged algorithms for this task? (Choose Two)
-
A
Use SageMaker Ground Truth to automatically label the data before training.
-
B
Write custom code to build and deploy a container with a pre-trained model for image classification.
-
C
Select an appropriate algorithm such as XGBoost, which is optimized for image classification.
-
D
Provide a labeled dataset for training the model and define the necessary hyperparameters.
-
E
Define the compute resources (e.g., instance type) and run a training job by referencing the pre-built container.
Xem giải thích
Đáp án
D và E — cung cấp dữ liệu đã gán nhãn cùng siêu tham số, và khai tài nguyên rồi chạy job huấn luyện
Vì sao đúng
Với thuật toán dựng sẵn, bạn không viết mã mô hình. Việc còn lại đúng hai bước:
- D. Dữ liệu đã gán nhãn và siêu tham số — thuật toán cần biết học từ đâu và học thế nào.
- E. Khai loại máy rồi chạy job, trỏ tới ảnh container của thuật toán — SageMaker cấp máy, chạy, rồi trả máy về.
Vì sao các phương án khác sai
- A. Ground Truth tự gán nhãn — là dịch vụ riêng và không bắt buộc; đề giả định dữ liệu đã có nhãn.
- B. Tự dựng container — chính là thứ dùng thuật toán dựng sẵn để khỏi phải làm.
- C. Dùng XGBoost cho phân loại ảnh — sai thuật toán: XGBoost cho dữ liệu dạng bảng, phân loại ảnh dùng thuật toán Image Classification.
What is the key challenge that results from a high variance model in the context of responsible AI, and what technique is most effective to combat it?
-
A
Overfitting, and the solution is early stopping
-
B
Underfitting, and the solution is reducing the complexity of the model
-
C
Overfitting, and the solution is adding more training data
-
D
Underfitting, and the solution is cross-validation
Xem giải thích
Đáp án
A — Quá khớp, và cách chữa hiệu quả nhất là dừng sớm
Vì sao đúng
Phương sai cao nghĩa là mô hình quá nhạy với dữ liệu cụ thể nó đã thấy — biểu hiện ra thành quá khớp. Dừng sớm theo dõi chỉ số trên tập kiểm định và ngắt huấn luyện đúng lúc nó bắt đầu xấu đi, tức là chặn ngay tại thời điểm mô hình chuyển từ học quy luật sang học thuộc nhiễu. Rẻ, không phải đổi kiến trúc, và có sẵn ở mọi khung huấn luyện.
Vì sao các phương án khác sai
- B và D. Thiếu khớp — sai chẩn đoán: thiếu khớp là thiên lệch cao, kém trên cả hai tập.
- C. Quá khớp nhưng chữa bằng thêm dữ liệu — chẩn đoán đúng, và thêm dữ liệu có giúp, nhưng nó tốn kém và không phải lúc nào cũng làm được; dừng sớm là biện pháp trực tiếp và rẻ nhất.
A company is developing a machine learning model using a proprietary machine learning framework that is not supported by SageMaker. They decide to use SageMaker's "bring your own container" approach to handle both training and inference. What advantages does this approach provide, and which tasks are still the company’s responsibility?
-
A
SageMaker will fully manage the environment, and the company only needs to provide their training code.
-
B
SageMaker will automatically handle container creation and distribution, but the company must manage data preprocessing steps.
-
C
The company gains full control over the training and inference environment but must manage the Docker image creation, container configuration, and deployment.
-
D
The company can still use SageMaker’s built-in training algorithms, and only needs to customize the inference process with the custom container.
Xem giải thích
Đáp án
C — Toàn quyền kiểm soát môi trường, đổi lại phải tự dựng và tự bảo trì container
Vì sao đúng
"Bring your own container" là sự đánh đổi rõ ràng. Bạn đóng gói khung học máy riêng, thư viện và mã vào một ảnh Docker theo giao ước của SageMaker (đường dẫn dữ liệu, nơi ghi mô hình, cổng phục vụ). Đổi lại bạn sở hữu vòng đời của ảnh đó: vá bảo mật, nâng phiên bản thư viện, sửa khi hỏng — AWS không làm hộ phần bên trong container.
Vì sao các phương án khác sai
- A. SageMaker quản lý hoàn toàn môi trường — sai; đó là điểm khác biệt giữa BYOC và container dựng sẵn.
- B. SageMaker tự tạo container — sai; chính bạn tạo và đẩy lên ECR.
- D. Vẫn dùng được thuật toán dựng sẵn — không; dùng container riêng nghĩa là dùng mã của chính bạn.
A data scientist needs to set up monitoring for a deployed machine learning model using Amazon SageMaker. They are primarily concerned with detecting when the incoming data used for predictions becomes significantly different from the training data. What type of drift should they monitor for in this case?
-
A
Bias Drift
-
B
Data Drift
-
C
Model Quality Drift
-
D
Feature Attribution Drift
Xem giải thích
Đáp án
B — Data Drift (trôi dữ liệu)
Vì sao đúng
Đề mô tả đúng định nghĩa: phân bố thống kê của dữ liệu đi vào đã khác so với dữ liệu lúc huấn luyện. Model Monitor phát hiện bằng cách so với thống kê nền — thay đổi về khoảng giá trị, giá trị trung bình, tỷ lệ thiếu, hay tần suất các hạng mục. Đây là loại trôi phát hiện sớm nhất, vì nó chỉ cần dữ liệu vào chứ không cần biết nhãn thật.
Vì sao các phương án khác sai
- A. Bias Drift — thiên lệch giữa các nhóm thay đổi theo thời gian.
- C. Model Quality Drift — chất lượng dự đoán giảm; phát hiện được nhưng phải có nhãn thật, mà nhãn thường tới rất muộn.
- D. Feature Attribution Drift — mức đóng góp của từng đặc trưng vào dự đoán thay đổi.
Which of the following is a benefit of using SageMaker Pipelines for machine learning workflows?
-
A
It automates and organizes machine learning workflows, making them reusable and scalable.
-
B
It allows users to run SQL queries on large datasets stored in Amazon S3.
-
C
It provides a platform for building deep learning models with low-latency inference.
-
D
It enables real-time analytics without batch processing.
Xem giải thích
Đáp án
A — Tự động hoá và tổ chức quy trình học máy, làm chúng dùng lại và mở rộng được
Vì sao đúng
Đây đúng là lý do Pipelines tồn tại: gói chuỗi bước — tiền xử lý, huấn luyện, đánh giá, đăng ký, triển khai — thành một quy trình khai báo bằng mã, chạy lại được, có phiên bản và có lịch sử. Nhờ vậy việc huấn luyện lại không còn là chuỗi thao tác tay mà là một lần chạy pipeline.
Vì sao các phương án khác sai
- B. Chạy SQL trên dữ liệu ở S3 — đó là Athena.
- C. Nền tảng dựng mô hình học sâu độ trễ thấp — mô tả lẫn lộn giữa huấn luyện và phục vụ mô hình.
- D. Phân tích thời gian thực không cần xử lý theo lô — đó là dịch vụ xử lý luồng, không phải công cụ điều phối quy trình ML.
A company is using Amazon SageMaker for hyperparameter tuning. They want a technique that stops poorly performing models early to allocate resources more efficiently to better performing models. Which tuning strategy should they use?
-
A
Random Search
-
B
Grid Search
-
C
Bayesian Optimization
-
D
Hyperband
Xem giải thích
Đáp án
D — Hyperband
Vì sao đúng
Đặc điểm riêng của Hyperband là cắt sớm: nó chạy nhiều cấu hình với ngân sách nhỏ, đánh giá giữa chừng, dừng hẳn những cấu hình đang tụt lại, rồi dồn tài nguyên cho số ít cấu hình còn triển vọng. Đó chính xác là điều đề mô tả — dừng mô hình kém sớm để phân bổ tài nguyên hiệu quả hơn.
Vì sao các phương án khác sai
- A. Random Search và B. Grid Search — chạy hết mỗi cấu hình rồi mới so; không có cơ chế dừng giữa chừng.
- C. Bayesian Optimization — thông minh ở chỗ chọn cấu hình tiếp theo dựa trên kết quả trước đó, nhưng mỗi lần thử vẫn chạy tới cùng.
A company is training a reinforcement learning model in SageMaker to optimize energy usage in a smart grid. After training the model, they need to evaluate its performance before deployment. Which SageMaker feature is most appropriate for this evaluation?
-
A
Use Amazon Athena to run SQL queries on the training results to evaluate performance.
-
B
Use the SageMaker model monitor to automatically track and evaluate the model's performance on new data.
-
C
Deploy the model to an endpoint and evaluate performance using Amazon QuickSight.
-
D
Use SageMaker's built-in evaluation tools and plot training metrics using SageMaker SDK.
Xem giải thích
Đáp án
D — Dùng công cụ đánh giá sẵn có của SageMaker và vẽ chỉ số huấn luyện trong Studio
Vì sao đúng
Đề cần đánh giá trước khi triển khai. Với học tăng cường, thứ phải nhìn là đường phần thưởng tích luỹ qua các tập huấn luyện — nó cho biết tác nhân có đang học hay không và đã hội tụ chưa. SageMaker ghi các chỉ số đó ra CloudWatch và Studio vẽ chúng ngay, không phải dựng gì thêm.
Vì sao các phương án khác sai
- A. Dùng Athena chạy SQL trên kết quả — Athena truy vấn dữ liệu trên S3, không phải công cụ theo dõi quá trình huấn luyện.
- B. Model Monitor — chỉ hoạt động với mô hình đã triển khai; ở đây còn chưa triển khai.
- C. Triển khai rồi đánh giá bằng QuickSight — đưa mô hình chưa kiểm chứng ra dùng, đúng thứ đề muốn tránh.