Ngân hàng đề — AWS Certified Machine Learning Engineer Associate

Tìm thấy 635 câu.

Câu 421 Deployment and Orchestration of ML Workflows

A data scientist is developing a machine learning model for a healthcare application. During model evaluation, they observe that the model has high bias and is underfitting the data. They decide to implement strategies to address the bias and variance issues to ensure the model generalizes well on new data.

Which combination of strategies would be MOST effective to balance bias and variance and avoid both underfitting and overfitting?

  1. A

    Use early stopping during training to prevent overfitting and add regularization to simplify the model.

  2. B

    Add more training data and implement cross-validation to reduce overfitting and ensure better generalization.

  3. C

    Implement early stopping and dimensionality reduction to reduce the complexity of the model and prevent underfitting.

  4. D

    Increase the number of model parameters and reduce the training data size to reduce variance.

Xem giải thích

Đáp án chuẩn

B — Thêm dữ liệu huấn luyện và dùng kiểm định chéo

Vì sao phương án này hợp lý

Với mô hình thiếu khớp, kiểm định chéo là công cụ chẩn đoán quan trọng: nó đánh giá trên nhiều cách chia dữ liệu nên cho ước lượng đáng tin về năng lực thật, giúp xác nhận vấn đề là thiếu khớp chứ không phải chia tập không may. Thêm dữ liệu cũng giúp khi dữ liệu hiện có quá ít để mô hình nắm được quy luật.

Một điểm cần nói thẳng

Phần chữ của phương án này ghi mục đích là "giảm quá khớp", trong khi đề mô tả mô hình đang thiếu khớp — hai chuyện ngược nhau. Với thiếu khớp, cách chữa trực tiếp nhất là tăng độ phức tạp mô hình, thêm đặc trưng, giảm chính quy hoá, hoặc huấn luyện lâu hơn; thêm dữ liệu tác động lên phương sai nhiều hơn lên thiên lệch. Hãy coi đây là câu có phần diễn đạt lệch.

Vì sao các phương án khác sai

  • A và C. Dừng sớm, chính quy hoá, giảm chiều — đều là biện pháp chống quá khớp; áp vào mô hình đang thiếu khớp sẽ làm nó học được ít hơn nữa.
  • D. Tăng tham số nhưng giảm dữ liệu — nửa đầu đúng hướng, nửa sau sai hẳn.
Câu 422 Deployment and Orchestration of ML Workflows

A financial company is concerned about bias in its AI models and wants to assess the influence of individual features on model predictions. The company aims to build trust with stakeholders and ensure regulatory compliance by explaining how certain features impact predictions.
Which feature of Amazon SageMaker Clarify would best meet these needs?

  1. A

    Bias Detection

  2. B

    SHAP (Shapley Additive Explanations) values for feature attribution

  3. C

    Data Wrangling

  4. D

    Early stopping

Xem giải thích

Đáp án

B — Giá trị SHAP để phân bổ đóng góp cho từng đặc trưng

Vì sao đúng

SHAP trả lời đúng câu hỏi đề đặt ra: mỗi đặc trưng đẩy dự đoán đi bao xa và theo hướng nào. Nó phân bổ phần chênh lệch giữa dự đoán thực tế và dự đoán trung bình cho từng đặc trưng, dựa trên lý thuyết trò chơi nên cách phân bổ có tính nhất quán. SageMaker Clarify tính sẵn cho cả mức từng dự đoán lẫn mức toàn mô hình.

Vì sao các phương án khác sai

  • A. Phát hiện thiên lệch — trả lời câu hỏi về sự công bằng giữa các nhóm, khác với việc giải thích ảnh hưởng của từng đặc trưng.
  • C. Data Wrangling — chuẩn bị dữ liệu.
  • D. Dừng sớm — kỹ thuật chống quá khớp lúc huấn luyện.
Câu 423 ML Solution Monitoring, Maintenance, and Security

A company has developed a machine learning model using XGBoost and plans to deploy it on edge devices with limited compute resources. The model needs to be optimized for performance without significantly affecting accuracy. The company decides to use SageMaker Neo for this task.

Which of the following steps should the company take to optimize and deploy the model using SageMaker Neo?

  1. A

    Use SageMaker Neo to automatically compile the model for the target hardware and deploy it using AWS IoT Greengrass.

  2. B

    Deploy the unoptimized model directly on the edge devices and monitor the performance through SageMaker Debugger.

  3. C

    Retrain the model with a simplified architecture to reduce compute demand before deploying on edge devices.

  4. D

    Use SageMaker Profiler to analyze edge device resource utilization before optimizing the model with SageMaker Neo.

Xem giải thích

Đáp án

A — Dùng SageMaker Neo biên dịch mô hình cho phần cứng đích

Vì sao đúng

Neo nhận mô hình đã huấn luyện và biên dịch lại cho kiến trúc cụ thể của thiết bị biên: tối ưu đồ thị tính toán, gộp phép tính, sinh mã riêng cho chip đó. Kết quả thường nhanh hơn nhiều lần và chiếm ít bộ nhớ hơn mà không đổi kiến trúc mô hình, nên độ chính xác giữ nguyên.

Vì sao các phương án khác sai

  • B. Triển khai bản chưa tối ưu rồi theo dõi — thiết bị biên có tài nguyên rất hạn chế; nhiều khả năng mô hình không chạy nổi.
  • C. Huấn luyện lại với kiến trúc đơn giản hơn — giảm được tài nguyên nhưng đánh đổi độ chính xác, đúng thứ đề muốn tránh.
  • D. Dùng Profiler để phân tích thiết bị biên — Profiler làm việc trong lúc huấn luyện, không đo thiết bị biên.
Câu 424 ML Solution Monitoring, Maintenance, and Security

A machine learning engineer is responsible for deploying a model in Amazon SageMaker. After deployment, the engineer needs to monitor the model to detect data drift, model quality drift, and feature attribution drift over time. What are the most appropriate steps to take to monitor the deployed model effectively?

  1. A

    Implement a baseline job, define constraints based on training data, and schedule monitoring jobs.

  2. B

    Monitor only the model predictions for accuracy and retrain the model when performance declines.

  3. C

    Use Amazon S3 to store logs manually and monitor changes in the input data via manual inspection.

  4. D

    Perform model re-training without any active monitoring to avoid unnecessary processing costs.

Xem giải thích

Đáp án

A — Chạy job tạo mốc, khai ràng buộc từ dữ liệu huấn luyện, rồi hẹn lịch giám sát

Vì sao đúng

Đây là đúng ba bước thiết lập Model Monitor. Baseline job tính thống kê từ dữ liệu huấn luyện; constraints là các ràng buộc sinh ra từ đó (kiểu dữ liệu, khoảng giá trị, tỷ lệ thiếu cho phép); lịch giám sát chạy định kỳ để so dữ liệu thật với ràng buộc và ghi vi phạm ra CloudWatch. Nhớ bật data capture ở endpoint, nếu không job chạy mà không có dữ liệu để so.

Vì sao các phương án khác sai

  • B. Chỉ theo dõi độ chính xác rồi huấn luyện lại — độ chính xác cần nhãn thật, mà nhãn thường tới rất muộn; lúc đó đã thiệt hại rồi.
  • C. Tự lưu log vào S3 rồi xem bằng mắt — không mở rộng được.
  • D. Huấn luyện lại mà không giám sát — vừa tốn kém vừa mù: không biết khi nào cần và cần vì sao.
Câu 425 ML Solution Monitoring, Maintenance, and Security

You are deploying a model in production and want to ensure that only the most trusted model versions are used. Which feature of the SageMaker Model Registry will help you achieve this?

  1. A

    Model lineage

  2. B

    Model approval status

  3. C

    Model group

  4. D

    Model metrics

Xem giải thích

Đáp án

B — Trạng thái phê duyệt mô hình

Vì sao đúng

Trạng thái phê duyệt là chốt chặn trước sản xuất. Pipeline đăng ký mô hình mới ở trạng thái chờ duyệt; người có thẩm quyền xem chỉ số đánh giá rồi mới chuyển sang Approved, và chính việc đó kích hoạt quy trình triển khai. Nhờ vậy chỉ những bản đã được xem qua mới ra sản xuất.

Vì sao các phương án khác sai

  • A. Model lineage — dấu vết nguồn gốc, phục vụ truy nguyên chứ không kiểm soát phát hành.
  • C. Model group — nơi gom các phiên bản của cùng một mô hình.
  • D. Model metrics — chỉ số đánh giá; nó là căn cứ để phê duyệt, nhưng bản thân không chặn được gì.
Câu 426 Data Preparation for Machine Learning

Which of the following scenarios best describes the use of supervised learning?

  1. A

    A financial institution segments its customers based on spending patterns without predefined categories.

  2. B

    A company develops a predictive model to classify emails as either spam or not spam using historical labeled data.

  3. C

    A retail business uses machine learning to automatically group products based on their similarity without providing labeled data.

  4. D

    A gaming company implements a system where an AI learns to improve its strategy by playing games and receiving feedback from wins and losses.

Xem giải thích

Đáp án

B — Xây mô hình phân loại email là thư rác hay không

Vì sao đúng

Học có giám sát cần cặp đầu vào và nhãn đúng. Ở đây mỗi email trong tập huấn luyện đã được đánh dấu sẵn là thư rác hay không, mô hình học ánh xạ từ nội dung sang nhãn đó rồi áp cho email mới. Đó là định nghĩa chuẩn.

Vì sao các phương án khác sai

  • A. Phân nhóm khách theo thói quen chi tiêu mà không có nhãn — phân cụm, thuộc học không giám sát.
  • C. Tự gom sản phẩm theo đặc điểm — cũng là phân cụm.
  • D. AI tự cải thiện chiến thuật chơi game — học tăng cường, học từ phần thưởng qua tương tác.
Câu 427 ML Model Development

A financial firm is using Amazon SageMaker to develop a reinforcement learning (RL) model for optimizing portfolio management. The agent is tasked with adjusting the portfolio by buying, selling, or holding assets in a fluctuating market. To ensure the agent maximizes the long-term return while minimizing risk, how should the reward function be structured?

  1. A

    The reward function should penalize any change in the portfolio and reward only large gains in asset value.

  2. B

    The reward function should reward every transaction made by the agent to encourage exploration of different strategies.

  3. C

    The reward function should provide small rewards for gains in asset value and larger penalties for significant losses, to encourage both risk management and profit maximization.

  4. D

    The reward function should only reward short-term profit increases, ensuring the agent takes immediate action for portfolio growth.

Xem giải thích

Đáp án

C — Thưởng nhỏ cho phần tăng giá trị tài sản và phạt khi giảm

Vì sao đúng

Thiết kế hàm phần thưởng quyết định tác nhân học ra hành vi gì. Thưởng theo mức tăng giá trị danh mục ở mỗi bước cho tín hiệu thường xuyên và bám đúng mục tiêu thật; kèm phạt khi giảm thì tác nhân học được cả việc tránh rủi ro chứ không chỉ đuổi theo lợi nhuận.

Tín hiệu đều đặn cũng là điều kiện thực tế: phần thưởng quá thưa khiến tác nhân đi hàng nghìn bước mới nhận một phản hồi, gần như không học được.

Vì sao các phương án khác sai

  • A. Phạt mọi thay đổi danh mục — dạy tác nhân đứng yên, tức là không quản lý gì.
  • B. Thưởng cho mỗi giao dịch — dạy nó giao dịch liên tục để lấy thưởng, đốt sạch tiền vào phí.
  • D. Chỉ thưởng lợi nhuận ngắn hạn — dẫn tới hành vi rủi ro cao và bỏ qua mục tiêu dài hạn.
Câu 428 Chọn nhiều đáp án ML Solution Monitoring, Maintenance, and Security

A large e-commerce company is using Amazon Fraud Detector to prevent fraudulent account signups. The company wants to automate the detection process using machine learning models and receive fraud scores in real-time. What steps should the company take to implement this solution efficiently? (Choose TWO)

  1. A

    Ingest historical data such as past account signups and user details to train the Amazon Fraud Detector model

  2. B

    Use Amazon Personalize to generate fraud scores based on user interaction data and account creation activities

  3. C

    Set up Amazon Fraud Detector to automatically extract relevant features, such as user location and device type, for model training

  4. D

    Deploy AWS Glue to periodically retrain the fraud detection model on newly ingested data

  5. E

    Use Amazon Fraud Detector to assign a fraud score in real-time, allowing the company to take immediate actions based on the score

Xem giải thích

Đáp án

A và E — nạp dữ liệu lịch sử để huấn luyện, và dùng điểm gian lận theo thời gian thực

Vì sao đúng

Đây là hai đầu của quy trình Amazon Fraud Detector:

  • A. Nạp dữ liệu lịch sử — các lượt đăng ký trước cùng nhãn gian lận hay hợp lệ là thứ mô hình học từ đó. Không có dữ liệu này thì không có gì để huấn luyện.
  • E. Chấm điểm gian lận theo thời gian thực — mỗi lượt đăng ký mới nhận một điểm, và bạn khai quy tắc theo điểm đó để cho qua, giữ lại xem xét, hay chặn.

Vì sao các phương án khác sai

  • B. Dùng Amazon Personalize để chấm điểm gian lận — Personalize là dịch vụ gợi ý, sai hoàn toàn mục đích.
  • C. Fraud Detector tự trích xuất đặc trưng — nó có bổ sung một số tín hiệu sẵn có, nhưng bạn vẫn phải khai các thực thể và biến của mình.
  • D. Dùng Glue để huấn luyện lại định kỳ — Glue là ETL; việc huấn luyện lại nằm trong chính Fraud Detector.
Câu 429 ML Solution Monitoring, Maintenance, and Security

A retail company is planning to use Amazon Q Business to automate customer support by integrating with third-party applications like ServiceNow and Zendesk. They want to ensure smooth communication between Amazon Business and these tools.
What feature of Amazon Business enables this integration?

  1. A

    Use IAM Identity Center to control access to ServiceNow and Zendesk.

  2. B

    Set up plugins to enable interaction with third-party applications.

  3. C

    Configure pre-built connectors to synchronize all data between Amazon S3 and the third-party tools.

  4. D

    Manually code the integration between Amazon Business and ServiceNow or Zendesk.

Xem giải thích

Đáp án

B — Thiết lập plugin để tương tác với ứng dụng bên thứ ba

Vì sao đúng

Amazon Q Business phân biệt hai cơ chế. Connector dùng để đọc và đánh chỉ mục tài liệu làm nguồn trả lời. Plugin dùng để thực hiện hành động trong ứng dụng bên ngoài — tạo ticket ServiceNow, cập nhật phiếu Zendesk — ngay từ trong cuộc trò chuyện. Đề cần tương tác chứ không chỉ tra cứu, nên plugin là câu trả lời.

Vì sao các phương án khác sai

  • A. IAM Identity Center — quản danh tính và quyền của người dùng, không phải cơ chế tích hợp ứng dụng.
  • C. Connector đồng bộ dữ liệu với S3 — connector đúng là để lấy dữ liệu, nhưng đề hỏi phần tương tác.
  • D. Tự viết mã tích hợp — làm được nhưng bỏ qua tính năng đã có sẵn.
Câu 430 Data Preparation for Machine Learning

A financial firm needs to create a scheduled ETL process using AWS Glue that extracts transaction data from Amazon Redshift, transforms it, and loads it into another Redshift cluster for reporting. The process should avoid reprocessing the same data repeatedly and only process newly added transactions.
Which AWS Glue feature will allow the firm to achieve this?

  1. A

    AWS Glue Crawler

  2. B

    AWS Glue Incremental Processing

  3. C

    AWS Glue Triggers

  4. D

    AWS Glue Development Endpoint

Xem giải thích

Đáp án

B — Xử lý tăng dần trong AWS Glue

Vì sao đúng

Với đường ống chạy theo lịch trên bảng giao dịch lớn dần, vấn đề cốt lõi là đừng xử lý lại phần đã xong. Glue dùng job bookmark để ghi nhớ vị trí đã đọc tới, nên mỗi lần chạy chỉ lấy dữ liệu mới. Đây là thứ quyết định chi phí và thời gian của cả đường ống.

Vì sao các phương án khác sai

  • C. Glue Triggers — lo phần hẹn lịch và nối các job với nhau. Đây là phương án dễ nhầm nhất vì đề có chữ "theo lịch", nhưng trigger chỉ quyết định khi nào chạy, không quyết định chạy trên bao nhiêu dữ liệu.
  • A. Glue Crawler — suy ra lược đồ, không xử lý dữ liệu.
  • D. Development Endpoint — môi trường để phát triển và gỡ lỗi script, không phải thành phần của đường ống chạy sản xuất.