Ngân hàng đề — AWS Certified Machine Learning Engineer Associate
Tìm thấy 635 câu.
A machine learning engineer is evaluating a binary classification model that predicts whether a transaction is fraudulent or not. The model has the following evaluation metrics:
Precision: 85%
Recall: 60%
Which of the following scenarios BEST describes what this model is achieving?
-
A
The model often predicts non-fraudulent transactions as fraudulent, leading to a high number of false positives.
-
B
The model is good at correctly identifying most fraudulent transactions but occasionally misclassifies non-fraudulent transactions.
-
C
The model correctly identifies a high proportion of fraudulent transactions but often misses actual fraudulent cases.
-
D
The model is good at identifying fraudulent transactions, but it misses a significant portion of actual fraudulent transactions.
Xem giải thích
Đáp án
D — Mô hình nhận diện tốt giao dịch gian lận nhưng bỏ sót một phần đáng kể
Vì sao đúng
Hai chỉ số nói hai chuyện khác nhau:
- Precision = trong những giao dịch mô hình gọi là gian lận, bao nhiêu phần trăm đúng. Cao nghĩa là ít báo động giả.
- Recall = trong những giao dịch thực sự gian lận, mô hình bắt được bao nhiêu phần trăm. Thấp nghĩa là bỏ lọt nhiều.
Precision cao cộng recall thấp cho ra đúng bức tranh phương án D mô tả: những gì mô hình chỉ ra thì đáng tin, nhưng nó im lặng trước rất nhiều ca gian lận thật.
Vì sao các phương án khác sai
- A. Hay báo nhầm giao dịch sạch thành gian lận — đó là precision thấp, ngược lại.
- B và C — mô tả không khớp với cặp chỉ số đang có.
Nhớ nhanh
Với phát hiện gian lận, bỏ sót thường đắt hơn báo nhầm — nên recall thấp là vấn đề đáng lo hơn.
Your team is tasked with building a recommendation engine using Amazon SageMaker’s built-in algorithms. After training the model, you want to deploy it for real-time inference. Which of the following SageMaker services would be MOST appropriate for model deployment?
-
A
SageMaker Endpoints, which allow for real-time model deployment and scaling.
-
B
AWS Lambda, which should be used to directly host the trained model and serve predictions.
-
C
SageMaker Model Monitor to automatically deploy the model in a real-time environment.
-
D
Amazon EC2 instances to host and serve the trained model.
Xem giải thích
Đáp án
A — SageMaker Endpoint
Vì sao đúng
Endpoint là cơ chế phục vụ dự đoán thời gian thực của SageMaker: mô hình luôn nạp sẵn trong bộ nhớ nên độ trễ thấp và ổn định, trải qua nhiều vùng sẵn sàng, và bật tự co giãn thì số bản sao bám theo lưu lượng. Triển khai chỉ là một lời gọi từ mô hình đã huấn luyện.
Vì sao các phương án khác sai
- B. Lambda tự host mô hình — làm được với mô hình nhỏ, nhưng khởi động nguội và trần bộ nhớ khiến độ trễ không ổn định.
- C. Model Monitor để triển khai — hiểu sai vai trò: Model Monitor giám sát endpoint đã có, không tạo ra endpoint.
- D. Tự host trên EC2 — phải tự co giãn, tự cân bằng tải, tự vá.
An e-learning platform wants to generate audio versions of its course materials in multiple languages. The platform stores text-based course content in Amazon S3 and wants to automate the process of translating the text, generating audio files, and storing the audio back in Amazon S3 for easy access. Which combination of AWS services will BEST achieve this?
-
A
Use Amazon Translate to translate the text, Amazon Polly to generate the speech in the desired languages, and an AWS Lambda function to store the audio files back in Amazon S3.
-
B
Use Amazon Comprehend to detect the language, Amazon Polly to generate the speech, and AWS Glue to store the audio files in Amazon S3.
-
C
Use AWS Lambda to translate the text, Amazon Transcribe to convert the text to speech, and Amazon SageMaker to store the audio files in Amazon S3.
-
D
Use Amazon Polly to translate the text, Amazon Lex to generate the speech, and Amazon DynamoDB to store the audio files.
Xem giải thích
Đáp án
A — Amazon Translate để dịch, Amazon Polly để tạo giọng nói
Vì sao đúng
Hai bước đúng thứ tự cho nhu cầu "tạo bản ghi âm nhiều thứ tiếng từ văn bản": Translate dịch nội dung khoá học sang các ngôn ngữ đích, rồi Polly đọc bản dịch thành âm thanh với giọng tự nhiên cho từng ngôn ngữ. Kết quả ghi thẳng về S3.
Vì sao các phương án khác sai
- B. Comprehend để nhận diện ngôn ngữ — làm được, nhưng đề đã biết cần dịch sang ngôn ngữ nào; phương án này thiếu hẳn bước dịch.
- C. Transcribe để chuyển văn bản thành giọng nói — ngược chiều: Transcribe làm giọng nói → văn bản.
- D. Polly để dịch — Polly chỉ đọc, không dịch.
A data science team is using SageMaker Ground Truth to perform text classification labeling. They are interested in reducing their labeling costs by automating some tasks while ensuring sensitive data is handled by trusted individuals.
Which combination of strategies should the team use to achieve this?
-
A
Use a third-party vendor for sensitive data while relying on fully automated models for all labeling tasks.
-
B
Set up Mechanical Turk workers for sensitive data and automate labeling for complex tasks.
-
C
Use a private workforce for sensitive data, and leverage active learning to automate simple tasks.
-
D
Rely entirely on private workforce labelers to handle both simple and complex tasks.
Xem giải thích
Đáp án
C — Dùng đội ngũ riêng cho dữ liệu nhạy cảm, và học chủ động để tự động hoá phần còn lại
Vì sao đúng
Phương án này giải cả hai vế cùng lúc. Đội ngũ riêng (nhân viên nội bộ hoặc nhà thầu đã ký cam kết) xử lý dữ liệu nhạy cảm — điều bắt buộc khi không được đưa dữ liệu ra ngoài. Học chủ động của Ground Truth gán nhãn tự động những mẫu mô hình đã tự tin, và chỉ chuyển cho người những mẫu khó; tỷ lệ cần người giảm dần khi mô hình tốt lên, nên chi phí giảm theo.
Vì sao các phương án khác sai
- A. Giao dữ liệu nhạy cảm cho bên thứ ba — trái thẳng yêu cầu bảo mật.
- B. Dùng Mechanical Turk cho dữ liệu nhạy cảm — đó là đội ngũ công cộng, càng không được.
- D. Để người làm hết — an toàn nhưng bỏ qua đúng mục tiêu giảm chi phí của đề.
A machine learning team needs to regularly transform and load large datasets from Amazon S3 into a data warehouse for model training. They are considering using AWS Glue for this ETL process but want to ensure the process is scalable, cost-efficient, and able to handle incremental updates. Which features of AWS Glue should they leverage to meet these requirements? (Choose Two)
-
A
Use AWS Glue’s built-in scheduling to trigger ETL jobs at regular intervals and process the entire dataset each time for consistency.
-
B
Utilize AWS Glue’s serverless architecture and auto-scaling capabilities to manage Spark clusters automatically, ensuring scalability.
-
C
Use AWS Glue to configure incremental ETL jobs that only process new or modified data.
-
D
Use AWS Glue crawlers to infer the schema and classify the data in real-time, ensuring all new files are processed immediately.
-
E
Pre-configure fixed Spark cluster resources to avoid unexpected scaling charges.
Xem giải thích
Đáp án
B và C — dựa vào kiến trúc không máy chủ tự co giãn, và cấu hình ETL tăng dần
Vì sao đúng
- B. Không máy chủ và tự co giãn — Glue tự cấp phát worker theo khối lượng rồi thu hồi khi xong, tính tiền theo giây. Không phải đoán trước kích thước cụm, cũng không trả tiền lúc rảnh.
- C. ETL tăng dần — dùng job bookmark để mỗi lần chạy chỉ xử lý dữ liệu mới hoặc đã đổi. Với tập dữ liệu lớn dần theo thời gian, đây là đòn giảm chi phí mạnh nhất.
Vì sao các phương án khác sai
- A. Chạy theo lịch định kỳ — quyết định khi nào chạy, không giảm khối lượng mỗi lần chạy.
- D. Crawler phân loại dữ liệu thời gian thực — crawler chạy theo lịch hoặc theo yêu cầu, không phải thời gian thực, và nó chỉ lo lược đồ.
- E. Cố định tài nguyên cụm Spark — trái thẳng lợi thế tự co giãn.
A company is building a machine learning pipeline using SageMaker. They want to automatically set up an environment where multiple data scientists can collaborate, manage various machine learning tasks, and store their work in a persistent and scalable environment. Which feature of SageMaker would best support these requirements?
-
A
SageMaker Studio
-
B
Amazon EMR
-
C
AWS Glue
-
D
SageMaker Notebook Instances
Xem giải thích
Đáp án
A — SageMaker Studio
Vì sao đúng
Đề cần môi trường cho nhiều nhà khoa học dữ liệu cùng làm việc và quản lý được. Studio tổ chức theo domain: quản trị viên tạo domain một lần với cấu hình mạng và quyền chung, sau đó mỗi người có một user profile với không gian lưu trữ riêng. Các công cụ khác — Experiments, Pipelines, Model Registry — mở thẳng trong cùng giao diện.
Vì sao các phương án khác sai
- D. Notebook Instances — máy đơn lẻ cho một người; muốn cả nhóm thì thành nhiều máy rời rạc không quản lý tập trung được.
- B. Amazon EMR — cụm xử lý dữ liệu lớn, không phải nền tảng cộng tác cho vòng đời ML.
- C. AWS Glue — dịch vụ ETL.
A company is building a generative AI application using Amazon Bedrock. The company needs to quickly integrate a foundation model for generating product recommendations based on customer interactions. They also want to ensure the infrastructure is scalable and secure without managing it directly.
Which features of Amazon Bedrock make it the best choice for this use case? (Choose Two)
-
A
Data encryption in transit and at rest
-
B
Serverless environment with automatic scaling
-
C
Custom instances for high-complexity models
-
D
On-premises infrastructure for enhanced security
-
E
Direct access to GPUs for model training
Xem giải thích
Đáp án
A và B — mã hoá dữ liệu khi truyền và khi lưu, và môi trường không máy chủ tự co giãn
Vì sao đúng
Hai điều này là đặc điểm cốt lõi của Bedrock và cũng là điều đề cần. Không máy chủ nghĩa là gọi API là dùng được mô hình nền, không cấp phát hay quản lý hạ tầng nào, và năng lực tự bám theo lưu lượng. Mã hoá cả hai chiều là mặc định, cộng với việc dữ liệu bạn gửi không được dùng để huấn luyện mô hình gốc — điều kiện quan trọng khi xử lý dữ liệu khách hàng.
Vì sao các phương án khác sai
- C. Máy tuỳ chỉnh cho mô hình phức tạp — Bedrock không cho chọn loại máy; đó là đặc điểm của SageMaker.
- D. Hạ tầng tại chỗ — Bedrock là dịch vụ đám mây.
- E. Truy cập trực tiếp GPU để huấn luyện — Bedrock không phơi GPU ra; muốn vậy thì dùng SageMaker.
A data scientist is running multiple machine learning experiments using Amazon SageMaker to determine the best hyperparameter configurations for their model. They want to track each experiment's metadata, compare the results, and ensure that the process is fully reproducible. Which SageMaker feature would BEST meet these requirements?
-
A
SageMaker Experiments
-
B
SageMaker Pipelines
-
C
SageMaker Autopilot
-
D
SageMaker Debugger
Xem giải thích
Đáp án
A — SageMaker Experiments
Vì sao đúng
Đề mô tả đúng bài toán Experiments giải: chạy nhiều thí nghiệm với các bộ siêu tham số khác nhau rồi cần so sánh để chọn cấu hình tốt nhất. Nó ghi lại từng lần chạy kèm siêu tham số, dữ liệu và chỉ số, tổ chức thành experiment và trial, rồi hiển thị thành bảng sắp xếp và lọc được trong Studio.
Vì sao các phương án khác sai
- B. Pipelines — điều phối các bước của quy trình, không phải công cụ so sánh kết quả.
- C. Autopilot — tự chọn mô hình và siêu tham số thay bạn; ở đây người dùng đang chủ động thiết kế thí nghiệm.
- D. Debugger — nhìn vào bên trong một lần huấn luyện, không so sánh giữa nhiều lần.
Your team has deployed a machine learning model for batch inference on Amazon SageMaker. You want to monitor the model's performance and be notified if the model's accuracy declines over time, indicating a potential model quality drift.
Which steps should you take to set up model quality monitoring for this batch inference model using SageMaker Model Monitor? (Choose Two)
-
A
Enable CloudTrail logs to track the data drift in batch jobs.
-
B
Manually track the model’s prediction results on a daily basis.
-
C
Merge the ground truth labels with the captured predictions to assess the model’s accuracy.
-
D
Schedule monitoring jobs to capture the incoming data and baseline comparison results.
-
E
Deploy a new version of the model every time drift is detected.
Xem giải thích
Đáp án
C và D — ghép nhãn thật với dự đoán đã ghi lại, và hẹn lịch chạy job giám sát
Vì sao đúng
Đo độ chính xác khác với đo trôi dữ liệu ở một điểm cốt lõi: nó cần biết đáp án đúng.
- C. Ghép nhãn thật với dự đoán — Model Monitor không tự biết kết quả thực tế; bạn phải đưa nhãn vào và nó ghép theo mã định danh để tính độ chính xác.
- D. Hẹn lịch job giám sát — so kết quả với mốc theo chu kỳ và ghi vi phạm ra CloudWatch để đặt cảnh báo.
Vì sao các phương án khác sai
- A. CloudTrail để theo dõi trôi — CloudTrail ghi lời gọi API, không biết gì về chất lượng mô hình.
- B. Kiểm tay hằng ngày — không mở rộng được và sẽ bị bỏ quên.
- E. Cứ phát hiện trôi là triển khai bản mới — phản ứng quá vội; phải xem nguyên nhân trước, vì đôi khi dữ liệu đổi là do lỗi ở khâu thu thập.
A company is developing an AI solution that needs to reduce both underfitting and overfitting to ensure a balanced model. Which combination of strategies can the data scientist apply to mitigate bias and variance in the model? (Choose Two)
-
A
Ignore high variance to focus on reducing bias.
-
B
Use early stopping to prevent the model from overfitting during training.
-
C
Increase the model complexity by adding more parameters.
-
D
Limit the dataset size to reduce noise in the model.
-
E
Use cross-validation to assess model performance on multiple data subsets.
Xem giải thích
Đáp án
B và E — dừng sớm, và kiểm định chéo
Vì sao đúng
Đề cần cân bằng cả hai phía chứ không nghiêng về một bên:
- E. Kiểm định chéo đánh giá trên nhiều cách chia dữ liệu nên cho ước lượng đáng tin về năng lực thật; đây là cách biết mình đang lệch về thiếu khớp hay quá khớp.
- B. Dừng sớm ngắt huấn luyện đúng điểm mà kết quả trên tập kiểm định bắt đầu xấu đi — tức là điểm cân bằng giữa học chưa đủ và học thuộc nhiễu.
Vì sao các phương án khác sai
- A. Bỏ qua phương sai để tập trung giảm thiên lệch — trái thẳng yêu cầu cân bằng.
- C. Tăng độ phức tạp mô hình — giảm thiên lệch nhưng tăng phương sai, chỉ giải một nửa.
- D. Giới hạn kích thước tập dữ liệu — ít dữ liệu hơn làm quá khớp nặng thêm.