Ngân hàng đề — AWS Certified Machine Learning Engineer Associate

Tìm thấy 635 câu.

Câu 231 ML Model Development

A machine learning engineer is conducting multiple model training sessions in SageMaker using different sets of hyperparameters and algorithms to find the best configuration for their model. They want to keep track of every trial and ensure the reproducibility of their experiments. Which AWS service feature would help them organize and compare these configurations effectively?

  1. A

    SageMaker Experiments

  2. B

    SageMaker Autopilot

  3. C

    Amazon EC2 Spot Instances

  4. D

    SageMaker Ground Truth

Xem giải thích

Đáp án

A — SageMaker Experiments

Vì sao đúng

Đề mô tả đúng bài toán Experiments giải: nhiều lần huấn luyện với bộ siêu tham số và thuật toán khác nhau, cần theo dõi và so sánh để tìm cấu hình tốt nhất. Nó ghi lại từng lần chạy kèm cấu hình, dữ liệu và chỉ số, rồi cho xếp cạnh nhau — thay vì phải tự ghi chép ra bảng tính.

Vì sao các phương án khác sai

  • B. Autopilot — tự chọn mô hình và siêu tham số thay bạn; ở đây kỹ sư đang chủ động thiết kế các thí nghiệm của mình.
  • C. Spot Instances — cách tiết kiệm chi phí máy, không liên quan tới theo dõi.
  • D. Ground Truth — dịch vụ gán nhãn dữ liệu.
Câu 232 ML Solution Monitoring, Maintenance, and Security

Which of the following statements about AWS IAM roles is correct?

  1. A

    IAM roles are used only by AWS services and cannot be assumed by IAM users or external identities.

  2. B

    IAM roles can be assumed by AWS services or external identities and can have multiple policies attached to manage permissions.

  3. C

    IAM roles do not support inline policies and can only be defined with AWS managed policies.

  4. D

    IAM roles are associated directly with an IAM user and always tied to a specific user account.

Xem giải thích

Đáp án

B — Vai có thể được dịch vụ AWS hoặc danh tính bên ngoài đóng, và gắn được nhiều chính sách

Vì sao đúng

Đây là mô tả đúng bản chất của IAM role. Vai không thuộc về một người cụ thể và không có mật khẩu hay khoá dài hạn; thay vào đó ai đóng được vai là do trust policy quyết định — có thể là dịch vụ AWS như EC2 hay Lambda, tài khoản AWS khác, hoặc danh tính liên kết qua SAML. Vai gắn được nhiều chính sách quản lý, cộng chính sách nội tuyến. Khi đóng vai, bên gọi nhận khoá tạm thời tự hết hạn.

Vì sao các phương án khác sai

  • A. Chỉ dịch vụ AWS mới đóng được vai — sai; người dùng và danh tính ngoài cũng đóng được.
  • C. Vai không hỗ trợ chính sách nội tuyến — sai; hỗ trợ cả hai loại.
  • D. Vai gắn trực tiếp với một IAM user — sai, và đây chính là điểm khác biệt cốt lõi giữa vai và người dùng.
Câu 233 Data Preparation for Machine Learning

You are working with large datasets stored in an Amazon S3 bucket and need to optimize the performance of querying and processing the data in AWS Glue. The data is frequently queried for specific years. Which of the following strategies will MOST effectively reduce query execution time and cost in this scenario?

  1. A

    Store the data in an Amazon RDS database and run queries directly from there.

  2. B

    Store all data in a single folder and apply a custom filter during each query.

  3. C

    Partition the data by year and define Glue crawlers to automatically recognize these partitions.

  4. D

    Use AWS Glue to compress the data, but do not partition it.

Xem giải thích

Đáp án

C — Phân vùng dữ liệu theo năm và dùng Glue crawler để tự nhận diện phân vùng

Vì sao đúng

Truy vấn thường lọc theo khoảng thời gian, nên phân vùng theo năm cho phép engine bỏ qua hẳn những thư mục không khớp thay vì quét hết. Crawler tự phát hiện phân vùng mới và cập nhật vào Data Catalog, nên thêm dữ liệu năm mới không phải khai tay. Ít dữ liệu quét hơn nghĩa là vừa nhanh hơn vừa rẻ hơn.

Vì sao các phương án khác sai

  • A. Chuyển sang Amazon RDS — CSDL quan hệ không hợp cho tập dữ liệu lớn kiểu hồ dữ liệu, và đi ngược kiến trúc đang có.
  • B. Để chung một thư mục rồi lọc lúc truy vấn — vẫn phải đọc toàn bộ rồi mới bỏ đi; đúng thứ phân vùng sinh ra để tránh.
  • D. Nén nhưng không phân vùng — nén giảm dung lượng nhưng vẫn phải đọc mọi tệp.
Câu 234 ML Model Development

You are evaluating the performance of a machine learning model and want to ensure that it generalizes well on unseen data. You decide to partition your dataset into three distinct sets: training, validation, and testing. However, your model performs exceptionally well on the training set but poorly on the validation and test sets. What is the likely cause of this performance discrepancy?

  1. A

    The model is underfitting the data.

  2. B

    The model is overfitting the training data.

  3. C

    The model has a high bias and low variance.

  4. D

    The training set is too small for meaningful evaluation.

Xem giải thích

Đáp án

B — Mô hình đang quá khớp tập huấn luyện

Vì sao đúng

Dấu hiệu kinh điển của quá khớp là kết quả rất tốt trên tập huấn luyện nhưng kém hẳn trên tập kiểm định hoặc tập kiểm tra. Mô hình đã học thuộc cả nhiễu và chi tiết riêng của dữ liệu đã thấy, nên không tổng quát hoá được sang dữ liệu mới. Cách chữa: chính quy hoá, dừng sớm, thêm dữ liệu, hoặc giảm độ phức tạp của mô hình.

Vì sao các phương án khác sai

  • A. Thiếu khớp — biểu hiện ngược lại: kém trên cả tập huấn luyện lẫn tập kiểm tra.
  • C. Thiên lệch cao, phương sai thấp — đó chính là mô tả của thiếu khớp.
  • D. Tập huấn luyện quá nhỏ — có thể là nguyên nhân dẫn tới quá khớp, nhưng câu hỏi hỏi hiện tượng đang xảy ra là gì.
Câu 235 ML Solution Monitoring, Maintenance, and Security

A company needs to ensure that their data storage solutions on AWS comply with industry regulations that require encryption of data at rest. Which AWS service and feature should be implemented to meet this compliance requirement across multiple storage services?

  1. A

    Use AWS Lambda to apply encryption to data as it is stored in each service.

  2. B

    Enable Amazon S3 server-side encryption (SSE) with AWS KMS-managed keys (SSE-KMS).

  3. C

    Configure AWS IAM policies to enforce encryption on data storage services.

  4. D

    Implement AWS Shield Advanced for automatic data encryption across all AWS services.

Xem giải thích

Đáp án

B — Bật mã hoá phía máy chủ cho S3 bằng khoá KMS (SSE-KMS)

Vì sao đúng

Yêu cầu là mã hoá dữ liệu khi lưu để đạt chuẩn ngành. SSE-KMS mã hoá mọi đối tượng ghi vào bucket, và điểm quan trọng với việc tuân thủ là mọi lần dùng khoá đều được ghi vào CloudTrail — tức là có dấu vết kiểm toán ai đã giải mã cái gì, lúc nào. Dùng khoá do khách hàng quản lý thì còn kiểm soát được key policy và xoay vòng khoá.

Vì sao các phương án khác sai

  • A. Lambda tự mã hoá khi ghi — tự dựng lại thứ có sẵn, và bỏ sót mọi đường ghi không đi qua hàm đó.
  • C. Chính sách IAM để bắt buộc mã hoá — IAM ép được yêu cầu phải kèm mã hoá, nhưng bản thân nó không mã hoá gì; đó là hàng rào chứ không phải cơ chế.
  • D. AWS Shield Advanced — chống tấn công từ chối dịch vụ, hoàn toàn không liên quan.
Câu 236 ML Model Development

A financial firm wants to use reinforcement learning to optimize trading strategies using Amazon SageMaker. They want to train an agent that interacts with a simulated trading environment and receives feedback in the form of profits or losses. Which of the following elements must be included to formulate the reinforcement learning problem in this context?

  1. A

    Defining the agent, environment, actions, and rewards

  2. B

    Configuring manual data labeling for the agent's learning

  3. C

    Training the model using a supervised learning algorithm

  4. D

    Creating static rules for decision-making

Xem giải thích

Đáp án

A — Định nghĩa tác nhân, môi trường, hành động và phần thưởng

Vì sao đúng

Đây là bốn thành phần cấu thành mọi bài toán học tăng cường. Tác nhân là thứ ra quyết định; môi trường là mô phỏng thị trường nó tương tác; hành động là tập lựa chọn (mua, bán, giữ); phần thưởng là tín hiệu định nghĩa thế nào là tốt — ở đây thường là lợi nhuận có điều chỉnh theo rủi ro. Thiết kế hàm phần thưởng là phần khó nhất và quyết định nhất.

Vì sao các phương án khác sai

  • B. Gán nhãn dữ liệu bằng tay — học tăng cường không cần nhãn; nó học từ phần thưởng.
  • C. Dùng thuật toán học có giám sát — khác hẳn dạng bài toán; có giám sát cần cặp đầu vào và đáp án đúng.
  • D. Viết luật tĩnh — đó là hệ chuyên gia, không phải học máy.
Câu 237 Deployment and Orchestration of ML Workflows

A machine learning team is using SageMaker Pipelines to automate the training and deployment of multiple machine learning models. They want to scale the pipeline to handle thousands of workflows simultaneously while ensuring that steps, such as model training and evaluation, are executed in a specific sequence. Which feature of SageMaker Pipelines ensures that steps are executed in a defined order?

  1. A

    Model Package

  2. B

    Pipeline Parameters

  3. C

    Directed Acyclic Graph (DAG)

  4. D

    SageMaker Model Monitor

Xem giải thích

Đáp án

C — Đồ thị có hướng không chu trình (DAG)

Vì sao đúng

SageMaker Pipelines mô tả quy trình bằng DAG: mỗi bước là một đỉnh, phụ thuộc dữ liệu giữa các bước là các cạnh. Nhờ cấu trúc đó, dịch vụ tự suy ra bước nào chạy song song được và bước nào phải chờ, nên mở rộng lên hàng nghìn lần chạy mà không phải điều phối tay. "Không chu trình" là điều kiện đảm bảo quy trình luôn kết thúc.

Vì sao các phương án khác sai

  • A. Model Package — đơn vị đóng gói mô hình để đăng ký, không phải cấu trúc điều phối.
  • B. Pipeline Parameters — giá trị truyền vào lúc chạy.
  • D. Model Monitor — giám sát mô hình đã triển khai.
Câu 238 Chọn nhiều đáp án ML Model Development

A retail company wants to use machine learning to predict customer churn. The company does not have enough expertise to build and train a model from scratch, but they need a reliable model that can quickly be deployed and customized with their customer data. The company is considering Amazon SageMaker JumpStart as a solution.
Which of the following actions should the company take to achieve its goal using SageMaker JumpStart? (Choose TWO.)

  1. A

    Train a custom model on SageMaker from scratch using their own algorithms to meet the customer churn prediction requirements.

  2. B

    Fine-tune a pre-built customer churn model available on SageMaker JumpStart using the company's proprietary data.

  3. C

    Browse the SageMaker JumpStart model hub to find a pre-built customer churn prediction model and deploy it directly.

  4. D

    Manually configure the infrastructure, storage, and compute resources required to deploy the pre-trained model from SageMaker JumpStart.

  5. E

    Deploy a SageMaker endpoint without any modifications or fine-tuning to ensure model accuracy on their data.

Xem giải thích

Đáp án

B và C — tìm mô hình dựng sẵn trong JumpStart, rồi tinh chỉnh bằng dữ liệu của mình

Vì sao đúng

Đề nói rõ công ty không đủ chuyên môn để tự xây từ đầu. JumpStart giải đúng chỗ đó:

  • C. Duyệt kho mô hình để tìm mô hình dự báo rời bỏ khách hàng đã dựng sẵn — không phải bắt đầu từ con số không.
  • B. Tinh chỉnh bằng dữ liệu riêng — vì hành vi khách hàng của mỗi công ty mỗi khác, mô hình dùng nguyên si sẽ kém; tinh chỉnh là bước biến nó thành hữu dụng.

Vì sao các phương án khác sai

  • A. Tự huấn luyện từ đầu — chính là thứ đề nói không làm được.
  • D. Tự cấu hình hạ tầng — JumpStart lo phần đó.
  • E. Triển khai mà không tinh chỉnh gì — nghe thì nhanh nhưng mô hình chưa thấy dữ liệu của công ty, độ chính xác sẽ không đủ tin cậy.
Câu 239 Chọn nhiều đáp án Data Preparation for Machine Learning

A data engineer is tasked with creating an Extract, Transform, Load (ETL) pipeline using AWS Glue to process sales data from various sources. The data, in CSV format, is stored in Amazon S3. The processed data needs to be stored in a columnar format for faster querying using Amazon Athena. The engineer also needs to ensure the schema is automatically detected and stored for future use.

Which of the following steps should the data engineer take to meet these requirements? (Choose TWO)

  1. A

    Manually create a schema in Amazon Athena and upload it to the Glue Data Catalog to enable querying.

  2. B

    Set up manual scripts to define the schema for each data source and store it in Amazon RDS.

  3. C

    Configure AWS Lambda to process and load the data into Athena for schema inference and storage.

  4. D

    Use an AWS Glue crawler to automatically detect the schema of the CSV files and store the metadata in the AWS Glue Data Catalog.

  5. E

    Use AWS Glue's built-in transformation to convert the CSV data into Apache Parquet before saving it back to S3.

Xem giải thích

Đáp án

D và E — dùng Glue crawler tự nhận lược đồ, và đổi CSV sang Parquet

Vì sao đúng

Hai bước ghép thành đường ống Glue tiêu chuẩn:

  • D. Crawler quét tệp CSV, tự suy ra lược đồ và ghi vào Data Catalog. Không có bước này thì chẳng công cụ nào biết dữ liệu có những cột gì.
  • E. Đổi sang Parquet — định dạng cột, nén tốt, nên mọi truy vấn về sau đọc ít dữ liệu hơn hẳn và rẻ hơn.

Vì sao các phương án khác sai

  • A. Tự khai lược đồ trong Athena rồi tải lên catalog — làm tay, không tự động hoá được.
  • B. Viết script khai lược đồ cho từng nguồn — cũng làm tay, và phải sửa mỗi khi nguồn đổi.
  • C. Dùng Lambda để Athena suy lược đồ — Athena không suy lược đồ giúp bạn; đó là việc của crawler.
Câu 240 Deployment and Orchestration of ML Workflows

An ML engineer wants to build a sentiment analysis model using pre-built solutions in SageMaker JumpStart. They need a model that can quickly be deployed and then customized using their own dataset.

What features of SageMaker JumpStart would be most useful for the ML engineer's needs?

  1. A

    Only the use of prompt engineering to modify the inputs without needing to retrain the model.

  2. B

    Pre-built solutions that automatically perform both data preprocessing and model training without user intervention.

  3. C

    The ability to fine-tune foundation models with custom datasets and perform hyperparameter tuning.

  4. D

    The option to use custom-built proprietary models with full infrastructure control.

Xem giải thích

Đáp án

C — Tinh chỉnh mô hình nền bằng dữ liệu riêng, kèm tối ưu siêu tham số

Vì sao đúng

Đề cần triển khai nhanh rồi tuỳ biến bằng dữ liệu của mình. JumpStart cho đúng điều đó: chọn một mô hình nền có sẵn, tinh chỉnh với tập dữ liệu cảm xúc của công ty, và chạy tối ưu siêu tham số ngay trong cùng quy trình. Nhờ vậy vừa nhanh hơn tự xây, vừa hợp với dữ liệu thật.

Vì sao các phương án khác sai

  • A. Chỉ dùng kỹ thuật viết lời nhắc — có tác dụng với mô hình sinh, nhưng đề nói rõ cần tuỳ biến bằng dữ liệu, mà lời nhắc không học được từ tập dữ liệu.
  • B. Tự động làm cả tiền xử lý lẫn huấn luyện — đó là mô tả của Autopilot, không phải JumpStart.
  • D. Mô hình độc quyền tự xây kèm toàn quyền hạ tầng — ngược hẳn mục tiêu triển khai nhanh.