Ngân hàng đề — AWS Certified Machine Learning Engineer Associate

Tìm thấy 635 câu.

Câu 361 ML Solution Monitoring, Maintenance, and Security

A machine learning engineer wants to ensure that their deployed model remains unbiased over time. They are concerned that the model may begin favoring a particular group in the predictions, which did not exist during training.

What specific type of drift should the engineer monitor using Amazon SageMaker Model Monitor to detect this issue?

  1. A

    Feature attribution drift

  2. B

    Model quality drift

  3. C

    Data drift

  4. D

    Bias drift

Xem giải thích

Đáp án

D — Bias drift (trôi thiên lệch)

Vì sao đúng

Đề mô tả đúng định nghĩa: mô hình bắt đầu ưu ái một nhóm nhất định so với lúc mới triển khai. Nguyên nhân thường là dân số thực tế đã đổi so với dữ liệu huấn luyện. SageMaker Clarify tính các chỉ số thiên lệch theo nhóm làm mốc, còn Model Monitor so theo lịch và cảnh báo khi vượt ngưỡng.

Vì sao các phương án khác sai

  • A. Feature attribution drift — mức đóng góp của từng đặc trưng thay đổi; nó nói về lý do quyết định, không nói về sự công bằng giữa các nhóm.
  • B. Model quality drift — độ chính xác tổng thể giảm; mô hình vẫn có thể chính xác cao mà thiên lệch nặng với một nhóm nhỏ.
  • C. Data drift — phân bố dữ liệu vào thay đổi, chưa nói gì về đối xử giữa các nhóm.
Câu 362 Chọn nhiều đáp án Deployment and Orchestration of ML Workflows

An organization is using SageMaker to train and deploy a reinforcement learning (RL) model that optimizes a portfolio of financial assets. Which of the following features of SageMaker RL would benefit their use case?

  1. A

    The RL model must always be deployed on real-world environments; simulated environments are not supported.

  2. B

    SageMaker supports pre-built RL toolkits like Intel Coach and Ray RLlib for state-of-the-art algorithms.

  3. C

    Training jobs can only run on external instances and not locally on notebook instances.

  4. D

    SageMaker allows monitoring and adjusting the training through Python SDK integration.

Xem giải thích

Đáp án

B và D — có sẵn bộ công cụ RL như Intel Coach và Ray RLlib, và điều khiển được qua Python SDK

Vì sao đúng

  • B. Bộ công cụ dựng sẵn — SageMaker đóng gói sẵn container cho Coach và RLlib cùng nhiều môi trường mô phỏng, nên bạn không phải tự dựng hạ tầng học tăng cường từ đầu.
  • D. Theo dõi và điều chỉnh qua Python SDK — khai môi trường, hàm phần thưởng và siêu tham số bằng mã, chạy job rồi xem chỉ số ngay trong notebook.

Vì sao các phương án khác sai

  • A. Bắt buộc triển khai trên môi trường thật, không dùng mô phỏng — sai hẳn: với tối ưu danh mục tài sản thì mô phỏng là cách duy nhất an toàn; thả tác nhân chưa huấn luyện vào thị trường thật là mất tiền thật.
  • C. Chỉ chạy được trên máy bên ngoài, không chạy cục bộ — sai; chạy thử ngay trên notebook instance được, và đó là cách người ta hay làm khi dò lỗi.
Câu 363 Data Preparation for Machine Learning

A company is using AWS Glue to run ETL jobs on large datasets stored in Amazon S3. The data is organized into partitions based on the year the data was collected, with each year having its own folder structure. The team frequently runs queries that filter data by year, such as retrieving records only from 2023. How does this partitioning strategy benefit their data processing and querying?

  1. A

    It increases the IOPS operations required, slowing down query response times.

  2. B

    It allows AWS Glue to skip irrelevant partitions, reducing data scanned and improving query performance.

  3. C

    It increases the storage costs due to more files being created in S3.

  4. D

    It causes AWS Glue to process all partitions equally, regardless of the query conditions.

Xem giải thích

Đáp án

B — Cho phép Glue bỏ qua những phân vùng không liên quan, giảm lượng dữ liệu phải quét

Vì sao đúng

Khi dữ liệu được chia theo năm và truy vấn chỉ hỏi một khoảng thời gian, Glue chỉ đọc những thư mục khớp và bỏ qua phần còn lại — gọi là cắt bớt phân vùng. Ít dữ liệu quét nghĩa là vừa nhanh hơn vừa rẻ hơn. Thêm nữa, các phân vùng độc lập nhau nên Spark chia việc cho nhiều worker một cách tự nhiên.

Vì sao các phương án khác sai

  • A. Tăng số thao tác IOPS làm chậm truy vấn — ngược lại, phân vùng giảm lượng đọc.
  • C. Tăng chi phí lưu trữ vì nhiều tệp hơn — phân vùng là cách tổ chức thư mục, tổng dung lượng không đổi. (Có một vấn đề thật liên quan là quá nhiều tệp nhỏ, nhưng đó là chuyện phân vùng quá mịn chứ không phải bản chất của phân vùng.)
  • D. Xử lý mọi phân vùng như nhau bất kể truy vấn — đúng là điều phân vùng sinh ra để tránh.
Câu 364 ML Model Development

A machine learning engineer is tasked with training a custom PyTorch model using Amazon SageMaker. They want to take advantage of SageMaker's pre-built PyTorch container while maintaining control over the training logic. The engineer also needs to include several custom Python libraries to handle specific pre-processing tasks.

What steps should the engineer follow to set up and train the model using SageMaker's Script Mode?

  1. A

    Create a custom Docker container for the model, push it to Amazon ECR, and pull it into SageMaker for training.

  2. B

    Use AWS Lambda to trigger a training job, passing the model and training script from the notebook instance.

  3. C

    Write a Python script with the training logic, specify it as an entry point in the SageMaker estimator, and include a requirements.txt file to install custom libraries during training.

  4. D

    Install the required Python packages directly on the SageMaker notebook instance and run the training using the SageMaker built-in algorithms.

Xem giải thích

Đáp án

C — Viết script Python chứa logic huấn luyện và khai nó làm entry point

Vì sao đúng

Đây chính là Script Mode. Bạn viết mã PyTorch bình thường, khai entry_point là tệp khởi động và source_dir là thư mục mã, rồi SageMaker chạy nó bên trong container PyTorch dựng sẵn. Thư viện thêm thì khai trong requirements.txt. Không phải dựng ảnh Docker nào.

Vì sao các phương án khác sai

  • A. Tự dựng container rồi đẩy lên ECR — làm được nhưng trái yêu cầu "tận dụng container dựng sẵn"; chỉ cần khi khung học máy của bạn không có trong danh sách.
  • B. Dùng Lambda kích hoạt job huấn luyện — Lambda có thể khởi động job, nhưng nó không phải cách truyền mã huấn luyện vào.
  • D. Cài gói thẳng trên notebook instance — chỉ ảnh hưởng môi trường notebook, không ảnh hưởng container chạy job huấn luyện.
Câu 365 Deployment and Orchestration of ML Workflows

Team of data scientists is working on a computer vision project and wants to leverage AWS SageMaker’s built-in algorithms. They plan to use SageMaker JumpStart to streamline the process. What are the key advantages of using SageMaker JumpStart for this project?

  1. A

    SageMaker JumpStart only supports text-based models, so it will not be useful for image classification tasks.

  2. B

    JumpStart forces data scientists to only use SageMaker Studio for deployment, limiting flexibility.

  3. C

    SageMaker JumpStart allows the use of pre-built solutions that come with end-to-end pipelines, reducing time to deployment.

  4. D

    Using JumpStart will eliminate the need for any hyperparameter tuning and data preparation.

Xem giải thích

Đáp án

C — JumpStart cho dùng các giải pháp dựng sẵn kèm quy trình từ đầu tới cuối

Vì sao đúng

JumpStart là kho mô hình và giải pháp dựng sẵn: chọn một mô hình thị giác máy tính đã huấn luyện, triển khai bằng vài cú bấm, hoặc tinh chỉnh bằng dữ liệu của mình. Nhiều mục còn kèm notebook mẫu chạy được ngay từ chuẩn bị dữ liệu tới triển khai — đó là phần "từ đầu tới cuối" mà đề nhắc.

Vì sao các phương án khác sai

  • A. Chỉ hỗ trợ mô hình văn bản — sai; có sẵn nhiều mô hình phân loại ảnh và phát hiện vật thể.
  • B. Bắt buộc triển khai qua Studio — sai; dùng được cả qua SDK.
  • D. Bỏ hẳn nhu cầu tinh chỉnh và chuẩn bị dữ liệu — sai và nguy hiểm: mô hình dựng sẵn vẫn cần tinh chỉnh trên dữ liệu của bạn thì mới đạt độ chính xác dùng được.
Câu 366 Chọn nhiều đáp án Deployment and Orchestration of ML Workflows

A healthcare company needs to ensure compliance with data privacy regulations like HIPAA and GDPR for their sensitive information stored in S3 buckets. They plan to use AWS Macie to monitor and secure this data. Which of the following are the key benefits of using AWS Macie in this scenario? (Choose TWO)

  1. A

    Automatically classifies sensitive data such as PII, financial data, and health records stored in S3.

  2. B

    Monitors the performance of S3 buckets to ensure optimal read/write operations.

  3. C

    Automatically rotates sensitive data keys in S3 buckets for enhanced security.

  4. D

    Detects anomalous access patterns to identify potential unauthorized access to sensitive data.

  5. E

    Provides encryption for sensitive data using AWS KMS without additional configuration.

Xem giải thích

Đáp án

A và D — tự phân loại dữ liệu nhạy cảm, và phát hiện kiểu truy cập bất thường

Vì sao đúng

Hai năng lực chính của Macie và cả hai đều phục vụ yêu cầu tuân thủ:

  • A. Phân loại dữ liệu nhạy cảm — quét bucket và nhận ra thông tin cá nhân, dữ liệu tài chính, hồ sơ y tế. Không biết dữ liệu nhạy cảm nằm ở đâu thì không bảo vệ được nó.
  • D. Phát hiện truy cập bất thường — cảnh báo khi có kiểu truy cập lệch khỏi thói quen, dấu hiệu sớm của rò rỉ dữ liệu.

Vì sao các phương án khác sai

  • B. Theo dõi hiệu năng đọc ghi của bucket — đó là chuyện của CloudWatch.
  • C. Tự xoay vòng khoá — việc của KMS, Macie không làm.
  • E. Tự mã hoá bằng KMS — Macie phát hiện bucket chưa mã hoá, nhưng nó không tự mã hoá gì.
Câu 367 ML Solution Monitoring, Maintenance, and Security

A company is managing multiple AWS accounts and wants to implement a centralized user management system. They need to ensure that users can seamlessly access resources across all accounts without managing multiple credentials. The company also requires the ability to control access through policies and track user activities.

Which solution will meet these requirements MOST effectively?

  1. A

    Set up AWS Organizations and enable Single Sign-On (SSO) for centralized access management across all accounts.

  2. B

    Configure IAM roles in each account and allow users to switch roles as needed.

  3. C

    Create IAM users in each AWS account and assign the necessary permissions.

  4. D

    Use AWS Directory Service to create a single directory and link it to all AWS accounts.

Xem giải thích

Đáp án

A — Dùng AWS Organizations kèm đăng nhập một lần (SSO) để quản lý tập trung

Vì sao đúng

Đây là mô hình AWS khuyến nghị cho môi trường nhiều tài khoản. Organizations gom các tài khoản vào một tổ chức có cấu trúc OU. IAM Identity Center (tên mới của AWS SSO) cho người dùng đăng nhập một lần rồi chọn tài khoản và vai muốn vào, với quyền khai bằng permission set áp xuống nhiều tài khoản. Danh tính nối được tới hệ thống có sẵn của công ty.

Vì sao các phương án khác sai

  • B. Tạo vai ở từng tài khoản rồi tự chuyển vai — chạy được nhưng phải quản lý vai rời rạc ở mỗi tài khoản, và người dùng vẫn cần một tài khoản gốc để xuất phát.
  • C. Tạo IAM user ở từng tài khoản — tệ nhất: mỗi người nhiều bộ đăng nhập, và gỡ quyền khi ai đó nghỉ việc là phải làm ở từng nơi.
  • D. Directory Service nối tới mọi tài khoản — cấp được thư mục nhưng thiếu tầng quản lý quyền tập trung mà Identity Center cung cấp.
Câu 368 Deployment and Orchestration of ML Workflows

A data engineering team is tasked with setting up an automated ETL pipeline using AWS Glue. They have a semi-structured data file stored in Amazon S3 and need to extract, transform, and load this data into Amazon Redshift for further analysis. Additionally, they want to catalog the data schema and make it queryable via SQL. How should the team implement this solution efficiently using AWS Glue?

  1. A

    Manually create the schema in Redshift before loading the data to avoid unnecessary processing by AWS Glue crawlers and run AWS Glue ETL jobs to load the data.

  2. B

    Use AWS Glue crawlers to automatically infer the schema from the data in S3 and store the schema in the Glue Data Catalog. Then, run AWS Glue ETL jobs to extract, transform, and load the data into Amazon Redshift.

  3. C

    Use AWS Lambda to manually trigger AWS Glue jobs and control costs, avoiding automatic cataloging and schema inference.

  4. D

    Use AWS Glue ETL jobs to extract the data from S3, transform it using pre-built transformations, and load it directly into Amazon Redshift without any further processing.

Xem giải thích

Đáp án

B — Dùng Glue crawler tự suy ra lược đồ từ dữ liệu trên S3

Vì sao đúng

Dữ liệu bán cấu trúc thì lược đồ không hiển nhiên, và khai tay là việc phải làm lại mỗi khi cấu trúc đổi. Crawler quét tệp, tự suy ra tên cột và kiểu dữ liệu, rồi đăng ký vào Glue Data Catalog. Từ đó job ETL đọc theo lược đồ đã đăng ký, và crawler chạy lại thì tự cập nhật khi nguồn thay đổi.

Vì sao các phương án khác sai

  • A. Khai lược đồ tay trong Redshift trước — làm tay, và phải sửa mỗi lần nguồn đổi.
  • C. Dùng Lambda kích hoạt job bằng tay để tiết kiệm — quyết định khi nào chạy, không giải quyết chuyện lược đồ.
  • D — đúng phần dùng ETL job nhưng bỏ mất bước lấy lược đồ, nên job không biết đọc dữ liệu theo cấu trúc nào.
Câu 369 ML Model Development

Which of the following is the most appropriate problem type for regression models?

  1. A

    Estimating the future sales revenue based on advertising spend and historical sales data.

  2. B

    Predicting whether a customer will churn or not based on past behavior.

  3. C

    Classifying images into different categories such as cats, dogs, and birds.

  4. D

    Grouping users into segments based on browsing patterns without knowing specific user behaviors in advance.

Xem giải thích

Đáp án

A — Ước tính doanh thu tương lai dựa trên chi phí quảng cáo và dữ liệu lịch sử

Vì sao đúng

Hồi quy dự đoán một giá trị số liên tục. Doanh thu là con số có thể nhận vô số giá trị trong một khoảng, nên đây đúng là bài toán hồi quy. Chỉ số đánh giá cũng khác hẳn phân loại — dùng sai số bình phương trung bình hoặc sai số tuyệt đối trung bình chứ không dùng độ chính xác.

Vì sao các phương án khác sai

  • B. Dự đoán khách có rời bỏ hay không — hai lựa chọn rời rạc, là phân loại nhị phân.
  • C. Phân loại ảnh thành mèo, chó, chim — nhiều lựa chọn rời rạc, là phân loại nhiều lớp.
  • D. Gom nhóm người dùng khi chưa biết nhóm — không có nhãn, là phân cụm thuộc học không giám sát.
Câu 370 Chọn nhiều đáp án Data Preparation for Machine Learning

Which of the following are valid sources for importing data into Amazon SageMaker Data Wrangler? (Choose TWO)

  1. A

    Amazon S3

  2. B

    Amazon Kinesis

  3. C

    SageMaker Feature Store

  4. D

    AWS Glue DataBrew

  5. E

    Amazon RDS

Xem giải thích

Đáp án

A và C — Amazon S3 và SageMaker Feature Store

Vì sao đúng

Data Wrangler nối trực tiếp tới một số nguồn, trong đó S3 là nguồn phổ biến nhất (đọc CSV, Parquet, JSON) và Feature Store cho phép lấy lại đặc trưng đã tính từ trước để dùng tiếp hoặc biến đổi thêm. Ngoài hai cái này còn có Athena, Redshift và một số nguồn qua JDBC.

Vì sao các phương án khác sai

  • B. Amazon Kinesis — luồng dữ liệu thời gian thực; Data Wrangler làm việc trên tập dữ liệu tĩnh, không nối vào luồng.
  • D. AWS Glue DataBrew — là công cụ tương tự, không phải nguồn dữ liệu.
  • E. Amazon RDS — nối được gián tiếp nếu qua Athena hoặc JDBC, nhưng không nằm trong danh sách nguồn trực tiếp mà đề đang hỏi.