Ngân hàng đề — AWS Certified Machine Learning Engineer Associate

Tìm thấy 635 câu.

Câu 311 Data Preparation for Machine Learning

An organization wants to visually preprocess and clean its data before using it in machine learning models. They need a tool that allows non-coding users to create data transformation workflows and schedule them for periodic execution. Which AWS service should they use to meet these requirements?

  1. A

    AWS Glue Databrew

  2. B

    Amazon SageMaker Data Wrangler

  3. C

    AWS Glue ETL jobs

  4. D

    AWS Lambda

Xem giải thích

Đáp án

A — AWS Glue DataBrew

Vì sao đúng

Điều kiện quyết định là người dùng không viết mã. DataBrew cho chọn trong hơn 250 phép biến đổi bằng chuột, xem trước kết quả trên mẫu dữ liệu trước khi áp, và lưu các bước thành công thức chạy lại được. Không dòng mã nào.

Vì sao các phương án khác sai

  • B. SageMaker Data Wrangler — cũng trực quan và rất giống về mục đích, nên đây là phương án dễ nhầm nhất. Khác biệt: Data Wrangler nằm trong Studio và hướng tới kỹ sư ML đang chuẩn bị dữ liệu cho một mô hình cụ thể, còn DataBrew là công cụ chuẩn bị dữ liệu độc lập cho người phân tích nói chung.
  • C. Glue ETL jobs — phải viết Spark bằng Python hoặc Scala.
  • D. AWS Lambda — phải viết mã hoàn toàn.
Câu 312 Chọn nhiều đáp án Deployment and Orchestration of ML Workflows

An e-commerce company is training a recommendation model using SageMaker, but they observe that the training process is slow, and resource utilization is uneven. The ML engineer decides to use SageMaker Profiler to investigate the issue.

What are two potential actions the engineer can take after analyzing the profiler’s metrics to improve resource utilization? (Choose two.)

  1. A

    Optimize the I/O operations based on disk usage metrics to prevent bottlenecks in data loading.

  2. B

    Set up custom metrics to monitor CPU utilization and dynamically increase the batch size if CPU usage is low.

  3. C

    Monitor GPU utilization and adjust the data pipeline if GPU underutilization is detected.

  4. D

    Use SageMaker Profiler to detect overfitting and stop the training early to save resources.

Xem giải thích

Đáp án

A và C — tối ưu thao tác I/O theo chỉ số ổ đĩa, và theo dõi mức dùng GPU để chỉnh đường nạp dữ liệu

Vì sao đúng

"Chậm và tài nguyên dùng không đều" gần như luôn có nghĩa GPU đang đói dữ liệu: khâu đọc và tiền xử lý trên CPU không theo kịp tốc độ tính toán. Hai phương án này đánh đúng vào đó:

  • C. Theo dõi GPU để xác nhận đúng là GPU nhàn rỗi chứ không phải nguyên nhân khác.
  • A. Tối ưu I/O để gỡ nút thắt: tăng số luồng đọc, nạp trước, hoặc đổi định dạng dữ liệu.

Vì sao các phương án khác sai

  • B. Tăng số máy khi CPU cao — thêm máy không chữa được mất cân đối giữa CPU và GPU trong cùng một máy, chỉ nhân bản vấn đề lên.
  • D. Dùng Profiler để phát hiện quá khớp — Profiler đo tài nguyên; phát hiện quá khớp là việc của Debugger.
Câu 313 Chọn nhiều đáp án ML Model Development

Which of the following strategies is best suited to address both bias and variance in the context of responsible AI? (Choose two)

  1. A

    Early stopping

  2. B

    Cross-validation

  3. C

    Data Augmentation

  4. D

    Principal Component Analysis (PCA)

  5. E

    Using a more complex model with more features

Xem giải thích

Đáp án

A và B — dừng sớm, và kiểm định chéo

Vì sao đúng

Đề hỏi cách xử lý cả thiên lệch lẫn phương sai, và hai kỹ thuật này bổ sung nhau:

  • B. Kiểm định chéo cho ước lượng đáng tin về năng lực thật bằng cách đánh giá trên nhiều cách chia dữ liệu. Đây là công cụ chẩn đoán — nó cho biết bạn đang lệch về phía nào.
  • A. Dừng sớm là công cụ điều trị cho phương sai cao: ngắt huấn luyện đúng lúc mô hình bắt đầu học thuộc nhiễu.

Vì sao các phương án khác sai

  • C. Tăng cường dữ liệu — hữu ích và giảm quá khớp thật, nhưng chủ yếu áp dụng cho ảnh và âm thanh, không phổ quát bằng hai cái trên.
  • D. PCA — giảm chiều dữ liệu; có thể giảm quá khớp nhưng đánh đổi bằng mất thông tin, và làm thiên lệch nặng thêm.
  • E. Mô hình phức tạp hơn — giảm thiên lệch nhưng tăng phương sai, chỉ giải một nửa.
Câu 314 Deployment and Orchestration of ML Workflows

In SageMaker Pipelines, which component is used to define the sequence of operations such as data pre-processing, model training, and model registration?

  1. A

    Pipeline Definition

  2. B

    Model Group

  3. C

    Model Package

  4. D

    Pipeline SDK

Xem giải thích

Đáp án

A — Pipeline Definition

Vì sao đúng

Định nghĩa pipeline là tài liệu JSON mô tả toàn bộ quy trình: danh sách bước, phụ thuộc giữa chúng, và các tham số. SageMaker đọc nó để dựng DAG rồi thực thi. Đây là thứ bạn viết ra (thường bằng SDK Python) và cũng là thứ được lưu lại có phiên bản.

Vì sao các phương án khác sai

  • B. Model Group — nhóm các phiên bản của cùng một mô hình trong Model Registry.
  • C. Model Package — một phiên bản mô hình cụ thể đã đóng gói trong registry.
  • D. Pipeline SDK — thư viện bạn dùng để viết định nghĩa; nó là công cụ, không phải thành phần mô tả trình tự.
Câu 315 ML Model Development

A data scientist is working with a large dataset that cannot fit into the memory of a single machine and decides to use distributed training in Amazon SageMaker. The model is small enough to fit in memory on each worker, but the data is too large for one machine. Which distributed training approach should they use, and how will SageMaker manage the process?

  1. A

    Model parallelism, where each worker trains the same data on a subset of the model layers.

  2. B

    Model parallelism, where the model is split across different workers, and each worker trains a portion of the model.

  3. C

    Data parallelism, where the dataset is split into chunks across multiple workers, and each worker trains the same model on its chunk of data.

  4. D

    Data parallelism, where the model is divided into smaller components, and each component is trained on a different machine.

Xem giải thích

Đáp án

C — Song song theo dữ liệu: chia tập dữ liệu thành nhiều phần cho các worker

Vì sao đúng

Đề nói rõ vấn đề là tập dữ liệu không vừa bộ nhớ, còn mô hình thì không có gì bất thường. Đó đúng là tình huống của song song theo dữ liệu: mỗi worker giữ một bản sao đầy đủ của mô hình và xử lý một phần dữ liệu, gradient được gộp lại rồi mọi bản sao cùng cập nhật giống nhau.

Vì sao các phương án khác sai

  • A và B. Song song theo mô hình — dùng khi mô hình quá lớn cho một GPU, không phải khi dữ liệu quá lớn.
  • D. Gọi là song song theo dữ liệu nhưng mô tả việc chia mô hình — lẫn lộn hai khái niệm.

Nhớ nhanh

Dữ liệu quá lớn → chia dữ liệu. Mô hình quá lớn → chia mô hình.

Câu 316 ML Model Development

You are designing a reinforcement learning workflow in Amazon SageMaker for an AI agent to play a game. Which of the following components are critical to defining the reinforcement learning problem?

  1. A

    The preset files, policy gradient, and reward function.

  2. B

    The reward function, policy gradient, and training job metrics.

  3. C

    The action space, state space, and training job parameters.

  4. D

    The state, actions, environment, and reward function.

Xem giải thích

Đáp án

D — Trạng thái, hành động, môi trường, và hàm phần thưởng

Vì sao đúng

Đây là bốn thành phần định nghĩa mọi bài toán học tăng cường. Môi trường là trò chơi; trạng thái là những gì tác nhân quan sát được ở mỗi thời điểm; hành động là tập lựa chọn nó có; hàm phần thưởng định nghĩa thế nào là tốt. Bốn thứ này là bài toán; thuật toán và tham số huấn luyện chỉ là cách giải.

Vì sao các phương án khác sai

  • A và B. Có gradient chính sách — đó là thuật toán để giải, không phải thành phần định nghĩa bài toán.
  • C. Có tham số của job huấn luyện — cũng là chi tiết thực thi; và phương án này thiếu hàm phần thưởng, thứ quan trọng nhất.
Câu 317 ML Solution Monitoring, Maintenance, and Security

A legal firm wants to build an intelligent document retrieval system where users can search for case files using natural language queries. The system should be able to extract key legal terms like case names, judges, and dates from the documents, and allow users to find relevant cases based on specific legal topics. The documents are stored in various formats, including PDFs and Word documents.

Which combination of AWS services would BEST suit this use case?

  1. A

    Amazon Textract for text extraction, Amazon Comprehend for identifying legal entities, and Amazon Kendra for creating a natural language search interface.

  2. B

    Amazon Textract for extracting text, Amazon Rekognition for facial recognition in legal documents, and Amazon Kendra for providing search functionality.

  3. C

    Amazon Rekognition for identifying objects in the legal documents, Amazon Kendra for search, and Amazon Lex for creating a conversational interface.

  4. D

    Amazon Comprehend for both text extraction and entity recognition, Amazon S3 for storing the documents, and Amazon Elasticsearch for search functionality.

Xem giải thích

Đáp án

A — Textract trích văn bản, Comprehend nhận diện thực thể pháp lý

Vì sao đúng

Ba bước đúng thứ tự cho hệ tìm kiếm tài liệu. Textract chuyển hồ sơ quét thành văn bản, giữ được bảng và cấu trúc biểu mẫu. Comprehend rút ra thực thể — tên bên liên quan, ngày tháng, số hiệu vụ án — và bản Comprehend tuỳ chỉnh còn học được loại thực thể riêng của ngành luật. Phần tìm kiếm bằng ngôn ngữ tự nhiên thì để Kendra đảm nhiệm.

Vì sao các phương án khác sai

  • B. Rekognition để nhận diện khuôn mặt — lệch hoàn toàn nhu cầu.
  • C. Rekognition để nhận vật thể trong tài liệu pháp lý — Rekognition dựng cho ảnh đời thường, không cho tài liệu nhiều trang.
  • D. Comprehend vừa trích văn bản vừa nhận thực thể — Comprehend làm việc trên văn bản, nó không đọc được ảnh quét.
Câu 318 ML Solution Monitoring, Maintenance, and Security

A data scientist is tasked with monitoring feature attribution drift for a deployed model in SageMaker. What does feature attribution drift indicate?

  1. A

    The model's predictions differ from actual outcomes, affecting model quality.

  2. B

    The input data no longer follows the distribution used during model training.

  3. C

    The model shows a preference for specific categories or groups in a biased way.

  4. D

    Certain features in the input data have a varying level of importance in the model’s predictions over time.

Xem giải thích

Đáp án

D — Mức quan trọng của một số đặc trưng trong dự đoán của mô hình đã thay đổi

Vì sao đúng

Trôi đóng góp đặc trưng theo dõi mô hình đang dựa vào cái gì để quyết định. SageMaker Clarify tính đóng góp của từng đặc trưng (dựa trên SHAP) lúc huấn luyện làm mốc, rồi Model Monitor so với đóng góp trên dữ liệu thật. Khi thứ hạng thay đổi — ví dụ một đặc trưng từng quan trọng nhất tụt xuống — đó là dấu hiệu quan hệ giữa dữ liệu và kết quả đã đổi, dù phân bố dữ liệu vào có thể vẫn y nguyên.

Vì sao các phương án khác sai

  • A. Dự đoán lệch so với thực tế — đó là trôi chất lượng mô hình.
  • B. Dữ liệu vào không còn theo phân bố cũ — đó là trôi dữ liệu.
  • C. Mô hình ưu ái một số nhóm — đó là trôi thiên lệch.

Nhớ nhanh

Bốn loại trôi khác nhau ở chỗ nhìn vào đâu: dữ liệu vào, kết quả ra, sự công bằng, hay lý do quyết định.

Câu 319 ML Solution Monitoring, Maintenance, and Security

A financial services company is managing sensitive data such as database credentials, API keys, and access tokens in AWS Secrets Manager. They need to ensure that their secrets are accessible across multiple regions for high availability and also want to enable automatic secret rotation for enhanced security.

Which of the following steps should they take to meet these requirements?

  1. A

    Enable cross-region replication for secrets and set up customer-managed KMS keys to manage encryption policies across regions.

  2. B

    Manually rotate secrets by scheduling Lambda functions that update the secret values across regions.

  3. C

    Store secrets only in one region and rely on AWS Global Accelerator for multi-region access.

  4. D

    Create separate secrets for each region manually and use AWS KMS default keys for encryption.

Xem giải thích

Đáp án

A — Bật nhân bản liên vùng cho secret và dùng khoá KMS do khách hàng quản lý

Vì sao đúng

Secrets Manager có sẵn tính năng nhân bản secret sang vùng khác: bản sao tự đồng bộ khi secret gốc đổi, nên ứng dụng ở vùng thứ hai luôn đọc được giá trị mới nhất mà không ai phải sao chép tay. Dùng khoá KMS của chính bạn ở mỗi vùng thì kiểm soát được key policy và kiểm toán được việc dùng khoá — điều kiện gần như bắt buộc với dữ liệu tài chính.

Vì sao các phương án khác sai

  • B. Tự xoay vòng bằng Lambda theo lịch — Secrets Manager đã có xoay vòng tích hợp; tự viết là dựng lại thứ có sẵn và dễ sai.
  • C. Chỉ lưu ở một vùng rồi dựa vào Global Accelerator — Global Accelerator định tuyến lưu lượng mạng, không nhân bản dữ liệu; mất vùng đó là mất truy cập.
  • D. Tạo secret riêng cho từng vùng bằng tay — chúng sẽ lệch nhau ngay lần xoay vòng đầu tiên.
Câu 320 ML Model Development

A financial services firm is building a fraud detection system and is considering whether to use custom models or built-in algorithms in Amazon SageMaker. In which scenario would a custom algorithm be MORE appropriate than a built-in algorithm?

  1. A

    When the task requires basic machine learning models like Linear Learner or XGBoost.

  2. B

    When your goal is to minimize infrastructure management and focus only on tuning hyperparameters.

  3. C

    When built-in algorithms in SageMaker are optimized for the task at hand, such as fraud detection.

  4. D

    When you need to use proprietary machine learning models that are not available as built-in algorithms in SageMaker.

Xem giải thích

Đáp án

D — Khi cần dùng mô hình độc quyền không có trong danh sách dựng sẵn

Vì sao đúng

Nguyên tắc chọn rất đơn giản: dùng thuật toán dựng sẵn nếu có cái phù hợp, vì chúng đã được tối ưu, có sẵn container và hỗ trợ phân tán. Chỉ chuyển sang mô hình tự viết khi bài toán đòi hỏi thứ mà danh sách dựng sẵn không có — thuật toán riêng của công ty, kiến trúc đặc thù, hoặc khung học máy không được hỗ trợ. Đó chính là điều phương án D mô tả.

Vì sao các phương án khác sai

  • A. Khi chỉ cần mô hình cơ bản như Linear Learner hay XGBoost — đó đúng là lúc nên dùng thuật toán dựng sẵn.
  • B. Khi muốn giảm việc quản lý hạ tầng — cũng là lý do chọn dựng sẵn, không phải tự viết.
  • C. Khi thuật toán dựng sẵn đã tối ưu cho bài toán — càng là lý do dùng chúng.