Ngân hàng đề — AWS Certified Machine Learning Engineer Associate

Tìm thấy 635 câu.

Câu 401 ML Solution Monitoring, Maintenance, and Security

An organization uses SageMaker Pipelines to automate its ML workflow. After training a model, they need to register it with the SageMaker Model Registry, which tracks different versions of the model. They want to ensure that only approved models are deployed to production.

Which feature of SageMaker Model Registry should be used to control the deployment of models?

  1. A

    Model Group

  2. B

    Approval Status

  3. C

    Model Package

  4. D

    Model Lineage

Xem giải thích

Đáp án

B — Approval Status (trạng thái phê duyệt)

Vì sao đúng

Mỗi model package trong registry mang một trạng thái: PendingManualApproval, Approved hoặc Rejected. Đây là chốt chặn giữa huấn luyện và sản xuất: pipeline đăng ký mô hình ở trạng thái chờ, người có thẩm quyền xem chỉ số rồi mới phê duyệt, và chính việc chuyển sang Approved kích hoạt quy trình triển khai. Nhờ vậy không có bản nào ra sản xuất mà chưa ai nhìn qua.

Vì sao các phương án khác sai

  • A. Model Group — nhóm chứa các phiên bản, không quyết định bản nào được dùng.
  • C. Model Package — chính là một phiên bản mô hình; trạng thái là thuộc tính của nó.
  • D. Model Lineage — dấu vết nguồn gốc, phục vụ truy nguyên chứ không phải kiểm soát phát hành.
Câu 402 ML Model Development

A retail company wants to predict if a customer will purchase a product based on historical data, including past purchases, browsing behavior, and demographic details. Which type of machine learning model is best suited for this task?

  1. A

    K-Means Clustering

  2. B

    Regression

  3. C

    Binary Classification

  4. D

    Reinforcement Learning

Xem giải thích

Đáp án

C — Phân loại nhị phân

Vì sao đúng

Kết quả cần dự đoán chỉ có hai khả năng: khách sẽ mua hoặc không mua. Đó đúng là định nghĩa phân loại nhị phân. Mô hình thường trả về xác suất mua, rồi bạn đặt ngưỡng để quyết định — và ngưỡng đó chỉnh được theo việc bỏ sót hay báo nhầm cái nào đắt hơn.

Vì sao các phương án khác sai

  • B. Hồi quy — dự đoán giá trị số liên tục, ví dụ khách sẽ chi bao nhiêu tiền.
  • A. Phân cụm K-Means — học không giám sát, dùng khi không có nhãn; ở đây lịch sử mua hàng chính là nhãn.
  • D. Học tăng cường — học từ phần thưởng qua tương tác; không có môi trường nào ở đây.
Câu 403 ML Model Development

A data scientist is training a machine learning model to classify emails as either spam or not spam. They want to evaluate the model using various metrics. If the model correctly classifies 85% of the emails as spam or not spam, which metric is being used in this scenario?

  1. A

    Precision

  2. B

    Recall

  3. C

    Accuracy

  4. D

    F1 Score

Xem giải thích

Đáp án

C — Accuracy (độ chính xác)

Vì sao đúng

Accuracy là tỷ lệ dự đoán đúng trên tổng số dự đoán, tính cả hai lớp. Nó là thước đo hợp lý khi hai lớp cân bằng nhau và hai loại sai có giá ngang nhau — đúng điều kiện đề nêu.

Vì sao các phương án khác sai

  • A. Precision — chỉ nhìn vào những mẫu mô hình gọi là thư rác, bỏ qua phần bỏ sót.
  • B. Recall — chỉ nhìn vào việc bắt được bao nhiêu thư rác thật, bỏ qua báo động giả.
  • D. F1 — trung bình điều hoà của hai cái trên; hữu ích khi dữ liệu mất cân bằng, nhưng ở đây accuracy đã phản ánh đủ.

Nhớ nhanh

Accuracy chỉ đáng tin khi hai lớp cân bằng. Với dữ liệu 98/2 thì nó gây hiểu nhầm nặng.

Câu 404 Chọn nhiều đáp án ML Solution Monitoring, Maintenance, and Security

Which of the following are key features of Amazon Bedrock that simplify the management and scaling of generative AI applications? (Choose TWO)

  1. A

    Provisioned throughput mode for handling large, steady workloads.

  2. B

    Ability to directly modify the foundation models' source code for deeper customization.

  3. C

    Serverless infrastructure with automatic scaling and built-in data encryption.

  4. D

    Requirement to configure and manage underlying EC2 instances for model hosting.

  5. E

    Fine-tuning models with custom data to improve performance for specific tasks.

Xem giải thích

Đáp án

A và C — chế độ provisioned throughput, và hạ tầng không máy chủ tự co giãn kèm mã hoá sẵn

Vì sao đúng

Hai đặc điểm này bao trọn hai kiểu tải:

  • C. Không máy chủ, tự co giãn, mã hoá sẵn — gọi API là dùng được mô hình nền, không cấp phát hạ tầng, và dữ liệu được mã hoá cả khi truyền lẫn khi lưu.
  • A. Provisioned throughput — mua trước một mức thông lượng cam kết, hợp khi tải lớn và ổn định; đổi lại được giá tốt hơn và năng lực đảm bảo.

Vì sao các phương án khác sai

  • B. Sửa trực tiếp mã nguồn mô hình nền — không thể; Bedrock cho tinh chỉnh bằng dữ liệu chứ không mở mã nguồn.
  • D. Phải tự cấu hình và quản lý EC2 — trái hẳn bản chất không máy chủ của Bedrock.
  • E. Tinh chỉnh bằng dữ liệu riêng — là tính năng có thật, nhưng nó thuộc nhóm tuỳ biến mô hình chứ không phải "đơn giản hoá quản lý và mở rộng" mà đề hỏi.
Câu 405 Chọn nhiều đáp án Data Preparation for Machine Learning

A retail company plans to use Amazon Bedrock to build a product recommendation system that generates personalized suggestions for users. The company wants to enhance the accuracy of the recommendations using real-time data and integrate additional knowledge sources to improve model responses.
Which features of Amazon Bedrock should the company use to meet these needs? (Choose TWO)

  1. A

    Use agents in Amazon Bedrock to break down tasks and connect to real-time data via APIs.

  2. B

    Leverage AWS Lambda to trigger model updates after each user interaction.

  3. C

    Use Amazon Bedrock's knowledge bases to incorporate private data into the recommendation model.

  4. D

    Configure EC2 instances to run additional AI models for better performance.

  5. E

    Enable cross-region data sharing for better model accuracy.

Xem giải thích

Đáp án

A và C — dùng agent để chia nhỏ tác vụ và nối tới dữ liệu thời gian thực, và dùng knowledge base để đưa dữ liệu riêng vào

Vì sao đúng

Đây là hai cơ chế Bedrock cung cấp để mô hình nền biết những gì nó vốn không được huấn luyện:

  • C. Knowledge base đưa dữ liệu riêng của công ty vào bằng truy xuất tăng cường — mô hình tra kho tài liệu rồi mới trả lời, nên gợi ý bám theo danh mục sản phẩm thật.
  • A. Agent chia yêu cầu phức tạp thành nhiều bước và gọi được API bên ngoài, ví dụ kiểm tồn kho hoặc lịch sử mua hàng ngay lúc đang trả lời.

Vì sao các phương án khác sai

  • B. Lambda cập nhật mô hình sau mỗi lượt tương tác — mô hình nền không huấn luyện lại theo từng lượt; đó là hiểu sai cách chúng hoạt động.
  • D. Chạy thêm mô hình trên EC2 — thêm hạ tầng phải vận hành, trái tinh thần không máy chủ.
  • E. Chia sẻ dữ liệu liên vùng — không cải thiện độ chính xác của gợi ý.
Câu 406 ML Solution Monitoring, Maintenance, and Security

A company is setting up an AI-powered assistant using Amazon Q Business to streamline internal operations. They want to generate summaries of meetings and ensure that the assistant can retrieve relevant information from a knowledge base to provide accurate responses.
What key feature of Amazon Business should be implemented to meet these requirements?

  1. A

    Use the Retrieval Augmented Generation (RAG) system to pull information from the knowledge base.

  2. B

    Set up a custom plugin to generate responses based on Jira tickets.

  3. C

    Deploy the assistant with access to only Amazon S3 as the primary data source.

  4. D

    Disable the knowledge base integration to ensure faster response times.

Xem giải thích

Đáp án

A — Dùng truy xuất tăng cường (RAG) để lấy thông tin từ nguồn dữ liệu đã kết nối

Vì sao đúng

RAG là cách để trợ lý trả lời dựa trên tài liệu thật của công ty thay vì chỉ dựa vào những gì mô hình từng học. Khi có câu hỏi, hệ thống tìm đoạn tài liệu liên quan rồi đưa vào ngữ cảnh cho mô hình trả lời. Nhờ vậy bản tóm tắt cuộc họp bám sát nội dung thật, và quan trọng hơn là trích dẫn được nguồn để người đọc kiểm chứng.

Vì sao các phương án khác sai

  • B. Plugin sinh câu trả lời từ ticket Jira — plugin để thao tác với ứng dụng bên thứ ba, không phải cơ chế trả lời dựa trên tài liệu.
  • C. Chỉ cho truy cập mỗi S3 — thu hẹp nguồn dữ liệu một cách không cần thiết.
  • D. Tắt tích hợp knowledge base cho nhanh — đánh đổi sai: bỏ đi đúng thứ khiến câu trả lời chính xác.
Câu 407 Deployment and Orchestration of ML Workflows

An organization has large volumes of log data stored in Amazon S3. They plan to process this data using AWS Glue ETL jobs, which will run daily to extract, transform, and load the data into Amazon Redshift. The organization wants to ensure that only the newly added log files are processed in each ETL run to reduce cost and optimize performance.

Which AWS Glue feature can be leveraged to achieve this goal most cost-effectively?

  1. A

    AWS Glue Crawler with automatic schema detection

  2. B

    Incremental loading using partitioning

  3. C

    Using AWS Lambda to trigger ETL jobs on every new file upload

  4. D

    Defining custom transformations in AWS Glue to identify new data

Xem giải thích

Đáp án

B — Nạp tăng dần bằng cách dùng phân vùng

Vì sao đúng

Job chạy hằng ngày trên log tích luỹ dần, nên nếu mỗi lần đều quét lại toàn bộ thì thời gian và chi phí tăng vô hạn. Phân vùng theo ngày cho phép job chỉ đọc đúng phân vùng của hôm nay, kết hợp với job bookmark để không xử lý lại phần đã xong. Đây là đòn giảm chi phí mạnh nhất cho đường ống kiểu này.

Vì sao các phương án khác sai

  • A. Crawler tự phát hiện lược đồ — cần thiết để có bảng trong catalog, nhưng nó không giảm lượng dữ liệu mỗi lần job chạy.
  • C. Lambda kích hoạt job mỗi khi có tệp mới — quyết định khi nào chạy, không giảm khối lượng mỗi lần chạy; với log đổ về liên tục còn tạo ra quá nhiều lần chạy nhỏ.
  • D. Tự viết phép biến đổi để nhận ra dữ liệu mới — dựng lại thủ công thứ bookmark và phân vùng đã làm sẵn.
Câu 408 Chọn nhiều đáp án Deployment and Orchestration of ML Workflows

A machine learning team is using AWS Glue to preprocess large datasets for training models. They need to ensure that the Glue ETL jobs are optimized for cost without sacrificing performance. The team wants to apply custom transformations and only pay for the compute resources they use.

What are the best practices the team should follow to manage AWS Glue costs? (Choose TWO)

  1. A

    Use the AWS Glue visual interface to build ETL jobs instead of custom scripts to save on costs.

  2. B

    Configure the Glue job to run with a minimal number of Data Processing Units (DPUs) that meet performance requirements.

  3. C

    Use AWS Glue Crawlers to run on a schedule and detect changes in the data schema, reducing the need for constant job execution.

  4. D

    Implement manual ETL processes using EC2 Spot Instances to lower the compute costs.

  5. E

    Use AWS Glue's built-in auto-scaling feature to automatically scale up DPUs based on workload.

Xem giải thích

Đáp án

B và C — chạy job với số DPU tối thiểu cần thiết, và cho crawler chạy theo lịch

Vì sao đúng

  • B. Số DPU tối thiểu — Glue tính tiền theo DPU nhân thời gian, nên khai dư là trả tiền cho phần nằm không. Nhìn chỉ số sử dụng thật rồi hạ xuống sát nhu cầu.
  • C. Crawler chạy theo lịch — thay vì để crawler chạy liên tục hoặc chạy tay mỗi lần, đặt lịch đúng nhịp dữ liệu về. Crawler cũng tính tiền theo thời gian chạy.

Vì sao các phương án khác sai

  • A. Dùng giao diện trực quan thay vì script — ảnh hưởng cách phát triển, không ảnh hưởng chi phí chạy.
  • D. Tự làm ETL trên EC2 spot — rẻ hơn về đơn giá nhưng phải tự vận hành, và spot bị thu hồi giữa chừng thì job hỏng.
  • E. Bật auto-scaling — giúp thật trong nhiều trường hợp, nhưng đề nhấn "tối ưu chi phí" và auto-scaling chủ yếu tối ưu thời gian; đặt trần DPU vẫn là nút chỉnh chi phí trực tiếp hơn.
Câu 409 Chọn nhiều đáp án Deployment and Orchestration of ML Workflows

A data engineer is tasked with building an ETL pipeline using AWS Glue to process semi-structured data stored in Amazon S3. The pipeline should automatically infer the schema of the input data, perform transformations, and store the output back to S3 in a different format. The process must be efficient and scalable, without the need for infrastructure management. Which of the following AWS Glue features best fulfill this requirement? (Choose Two)

  1. A

    AWS Glue Crawler

  2. B

    AWS Glue Data Catalog

  3. C

    AWS Glue Auto Scaling

  4. D

    Amazon EC2-based Spark Cluster

  5. E

    AWS Glue Triggers

Xem giải thích

Đáp án

A và B — AWS Glue Crawler và AWS Glue Data Catalog

Vì sao đúng

Hai thành phần này là một cặp không tách rời. Crawler quét dữ liệu bán cấu trúc trên S3, tự suy ra tên cột và kiểu dữ liệu. Data Catalog là nơi lưu kết quả đó dưới dạng bảng, để job ETL, Athena và Redshift Spectrum cùng dùng chung một định nghĩa. Không có catalog thì lược đồ crawler tìm được chẳng đi đâu cả.

Vì sao các phương án khác sai

  • C. Glue Auto Scaling — điều chỉnh tài nguyên lúc job chạy, không liên quan tới lược đồ.
  • D. Cụm Spark tự dựng trên EC2 — trái hẳn hướng dùng dịch vụ được quản lý.
  • E. Glue Triggers — quyết định khi nào chạy job, không suy ra lược đồ.
Câu 410 Data Preparation for Machine Learning

A machine learning is preparing a large dataset for machine learning model training using AWS Glue and AWS Glue Databrew. The goal is to clean and preprocess the data, including removing duplicates and converting text columns to uppercase. What is the BEST way to achieve this using AWS Glue Databrew?

  1. A

    Use Databrew’s visual interface to apply transformation steps, such as removing duplicates and converting text to uppercase, then save these transformations as a recipe.

  2. B

    Manually write code to perform the transformations, and run it on an Amazon EC2 instance.

  3. C

    Use AWS Lambda functions to apply text transformations and remove duplicates before importing the data into Databrew.

  4. D

    Store the dataset in Amazon RDS and use SQL queries to preprocess the data.

Xem giải thích

Đáp án

A — Dùng giao diện trực quan của DataBrew để áp các bước biến đổi

Vì sao đúng

DataBrew cho chọn trong hơn 250 phép biến đổi bằng chuột — bỏ trùng lặp, chuẩn hoá định dạng, điền giá trị thiếu — và xem trước kết quả trên mẫu dữ liệu trước khi áp cho toàn bộ. Các bước được lưu thành công thức chạy lại được, nên việc làm sạch một lần biến thành quy trình.

Vì sao các phương án khác sai

  • B. Tự viết mã rồi chạy trên EMR — phải viết Spark và vận hành cụm; đó chính là thứ DataBrew sinh ra để thay thế.
  • C. Dùng Lambda để biến đổi văn bản và bỏ trùng — trần 15 phút và trần bộ nhớ không kham nổi tập dữ liệu lớn, và phát hiện trùng lặp cần nhìn toàn bộ dữ liệu.
  • D. Đưa vào RDS rồi xử lý bằng SQL — thêm một chặng nạp dữ liệu, và RDS không hợp cho tập dữ liệu lớn kiểu này.