Ngân hàng đề — AWS Certified Machine Learning Engineer Associate

Tìm thấy 635 câu.

Câu 251 ML Model Development

What is the main difference between model parameters and hyperparameters in machine learning?

  1. A

    Hyperparameters are set before training, while model parameters are learned during training.

  2. B

    Model parameters are set before training, while hyperparameters are learned during training.

  3. C

    Both model parameters and hyperparameters are set before training.

  4. D

    Both model parameters and hyperparameters are learned during training.

Xem giải thích

Đáp án

A — Siêu tham số đặt trước khi huấn luyện, tham số mô hình học ra trong lúc huấn luyện

Vì sao đúng

Đây là ranh giới cần thuộc lòng. Siêu tham số do bạn chọn trước: tốc độ học, số lớp, độ sâu cây, hệ số chính quy hoá — chúng điều khiển cách mô hình học. Tham số mô hình là thứ thuật toán tự tìm ra từ dữ liệu: trọng số và độ chệch của mạng nơ-ron, điểm cắt của cây quyết định.

Hệ quả thực tế: việc "tinh chỉnh siêu tham số" nghĩa là thử nhiều bộ giá trị của nhóm thứ nhất, mỗi lần thử lại chạy huấn luyện để tìm ra nhóm thứ hai.

Vì sao các phương án khác sai

  • B — đảo ngược hoàn toàn hai khái niệm.
  • C — nếu tham số mô hình cũng đặt trước thì chẳng còn gì để học.
  • D — nếu siêu tham số cũng học ra được thì đã không cần tinh chỉnh.
Câu 252 Deployment and Orchestration of ML Workflows

A data scientist is designing a SageMaker pipeline to automate an ML workflow. The pipeline needs to train a model, process data, and register the model for future deployments. Which features of SageMaker Pipelines help automate and manage the workflow effectively?

  1. A

    SageMaker Pipelines use a manual step-by-step execution, allowing better control over each task.

  2. B

    Pipelines are defined using a directed acyclic graph (DAG), specifying the sequence of steps, and include reusable parameters for customization.

  3. C

    Each step in the pipeline is manually executed, but results are stored for reuse in future workflows.

  4. D

    Pipelines can only handle small-scale projects due to limitations in scaling concurrent workflows.

Xem giải thích

Đáp án

B — Pipeline được định nghĩa bằng đồ thị có hướng không chu trình (DAG)

Vì sao đúng

SageMaker Pipelines mô tả quy trình bằng DAG: mỗi bước là một đỉnh, phụ thuộc dữ liệu giữa các bước là cạnh. Nhờ cấu trúc đó dịch vụ tự suy ra bước nào chạy song song được, bước nào phải chờ, và toàn bộ quy trình chạy tự động từ đầu tới cuối chứ không cần ai bấm từng bước.

Vì sao các phương án khác sai

  • A và C. Phải chạy tay từng bước — sai hẳn mục đích: Pipelines sinh ra để tự động hoá.
  • D. Chỉ kham được dự án nhỏ — sai; nó dựng cho quy mô sản xuất, chạy được hàng nghìn lần.
Câu 253 Chọn nhiều đáp án ML Model Development

A team at a media company wants to use Amazon SageMaker Jumpstart to quickly deploy a pre-trained model for text generation. They are considering whether to customize the model to better suit their specific use case. Which of the following customization methods available in Jumpstart should the team use to adapt the pre-trained model to their needs? (Choose TWO)

  1. A

    Use prompt engineering to design and refine the input prompts so that the model output aligns better with their business requirements.

  2. B

    Use SageMaker Autopilot to automatically generate new models from scratch based on their dataset, bypassing the need for pre-trained models.

  3. C

    Perform manual hyperparameter tuning using SageMaker Studio, as Jumpstart models do not support automatic hyperparameter tuning.

  4. D

    Customize the pre-trained model by changing the underlying model architecture to better suit text analysis tasks.

  5. E

    Fine-tune the pre-trained model using their own dataset to improve performance for their specific task.

Xem giải thích

Đáp án

A và E — kỹ thuật viết lời nhắc, và tinh chỉnh bằng dữ liệu riêng

Vì sao đúng

Với mô hình sinh văn bản dựng sẵn, có hai mức tuỳ biến và đề hỏi cả hai:

  • A. Viết lời nhắc — rẻ nhất và nhanh nhất, không huấn luyện gì, chỉ thiết kế đầu vào để mô hình cho ra đúng dạng đầu ra mong muốn. Luôn nên thử trước.
  • E. Tinh chỉnh — khi lời nhắc không đủ, huấn luyện tiếp trên dữ liệu của công ty để mô hình học giọng văn và thuật ngữ riêng.

Vì sao các phương án khác sai

  • B. Autopilot sinh mô hình mới từ đầu — Autopilot dựng cho dữ liệu dạng bảng, không phải để tạo mô hình sinh văn bản.
  • C. JumpStart không cho tinh chỉnh — sai; tinh chỉnh là tính năng chính của nó.
  • D. Đổi kiến trúc bên dưới — với mô hình nền thì gần như không khả thi, và cũng không cần.
Câu 254 Deployment and Orchestration of ML Workflows

A company wants to use Amazon SageMaker to deploy a real-time machine learning model for high-traffic online predictions. The model has moderate memory and CPU requirements, but scalability and low latency are critical due to unpredictable traffic spikes.

Which of the following deployment options is best suited for this scenario?

  1. A

    Use AWS Lambda to serve predictions from the model, scaling as per incoming requests.

  2. B

    Deploy the model on an Amazon EC2 instance to manually manage scaling.

  3. C

    Use Amazon SageMaker batch transform to process requests in large batches.

  4. D

    Deploy the model on an Amazon SageMaker endpoint with auto-scaling enabled.

Xem giải thích

Đáp án

D — Triển khai lên endpoint của SageMaker và bật tự co giãn

Vì sao đúng

Đề cần dự đoán thời gian thực, lưu lượng cao. Endpoint của SageMaker giữ mô hình luôn nạp sẵn trong bộ nhớ nên độ trễ thấp và ổn định, trải qua nhiều vùng sẵn sàng, và bật tự co giãn thì số bản sao tự tăng giảm theo số yêu cầu — không phải trả tiền cho công suất lúc vắng.

Vì sao các phương án khác sai

  • A. Dùng Lambda phục vụ dự đoán — làm được với mô hình nhỏ, nhưng khởi động nguội và trần bộ nhớ khiến độ trễ không ổn định dưới tải cao.
  • B. Tự quản lý EC2 — phải tự co giãn, tự vá, tự cân bằng tải.
  • C. Batch transform — dựng cho xử lý theo lô trên tập dữ liệu lớn, không phải cho từng yêu cầu thời gian thực.
Câu 255 Deployment and Orchestration of ML Workflows

A financial services company records customer service calls and needs to perform sentiment analysis on these calls to assess customer satisfaction. They also require the ability to review the transcripts of these calls for compliance purposes. Which combination of AWS services will BEST achieve these requirements?

  1. A

    Use Amazon Transcribe to convert the call recordings into text, store the transcripts in Amazon S3, and use Amazon Comprehend for sentiment analysis on the transcripts.

  2. B

    Use Amazon Transcribe to convert the call recordings into text, and Amazon Lex to analyze the sentiment of the calls.

  3. C

    Use AWS Lambda to convert the call recordings into text, store the transcripts in Amazon S3, and use Amazon Rekognition for sentiment analysis.

  4. D

    Use Amazon Polly to convert the call recordings into text, store the transcripts in Amazon DynamoDB, and use Amazon SageMaker to perform sentiment analysis.

Xem giải thích

Đáp án

A — Transcribe chuyển cuộc gọi thành văn bản, lưu lại, rồi Comprehend phân tích cảm xúc

Vì sao đúng

Ba bước đúng thứ tự. Transcribe làm nhận dạng giọng nói, tách được người nói nên phân biệt lời khách với lời nhân viên. Lưu bản chép lại giúp tra cứu và kiểm toán về sau, đó là vế thứ hai đề yêu cầu. Comprehend đọc văn bản đó và cho ra điểm cảm xúc, dùng để đo mức hài lòng.

Vì sao các phương án khác sai

  • B. Lex để phân tích cảm xúc — Lex dựng chatbot theo ý định người dùng, không đo cảm xúc.
  • C. Lambda để nhận dạng giọng nói — Lambda chỉ chạy mã, tự nó không có năng lực nhận dạng nào.
  • D. Polly để chuyển giọng nói thành văn bản — ngược chiều: Polly biến văn bản thành giọng nói.
Câu 256 Data Preparation for Machine Learning

A company is planning to utilize AWS Kinesis Data Firehose for the ingestion of large log files from various devices. Their goal is to ensure data consistency and optimize API call usage. What configuration would best meet their requirements?

  1. A

    Enable immediate data processing in AWS Lambda without buffering.

  2. B

    Use AWS Glue to handle data ingestion without buffering.

  3. C

    Directly send unbuffered data to Amazon S3 for cost efficiency.

  4. D

    Configure Kinesis Data Firehose to buffer data based on maximum time intervals.

Xem giải thích

Đáp án

D — Cấu hình Firehose gom dữ liệu theo ngưỡng thời gian

Vì sao đúng

Firehose gom dữ liệu vào bộ đệm rồi mới ghi xuống đích, theo hai ngưỡng chạy song song: đủ dung lượng, hoặc đủ thời gian — chạm cái nào trước thì ghi. Ngưỡng thời gian là thứ đảm bảo dữ liệu vẫn được ghi đều đặn cả khi lưu lượng thấp, và việc gom lô làm giảm mạnh số lời gọi API xuống đích, đúng mục tiêu đề nêu.

Vì sao các phương án khác sai

  • A. Xử lý ngay bằng Lambda, không đệm — mỗi bản ghi một lời gọi, nhiều lời gọi API hơn hẳn.
  • B. Dùng Glue để nhận dữ liệu — Glue là ETL theo mẻ, không phải dịch vụ nhận luồng.
  • C. Gửi thẳng không đệm xuống S3 — sinh ra vô số tệp nhỏ, vừa tốn lời gọi vừa làm truy vấn sau này rất chậm.
Câu 257 ML Model Development

A data scientist is facing the challenge of high variance in a machine learning model, where the model performs well on training data but poorly on new, unseen data. Which of the following methods would MOST LIKELY improve the model's ability to generalize, adhering to responsible AI principles?

  1. A

    Focus on training the model using a smaller subset of the data to prevent overfitting.

  2. B

    Remove cross-validation steps to speed up model training and testing.

  3. C

    Increase the number of parameters in the model to capture more complex patterns in the data.

  4. D

    Use early stopping to halt the training once the model's performance starts to degrade on the validation set.

Xem giải thích

Đáp án

D — Dùng dừng sớm, ngắt huấn luyện khi kết quả trên tập kiểm định bắt đầu xấu đi

Vì sao đúng

Phương sai cao là mô tả khác của quá khớp: tốt trên dữ liệu đã thấy, kém trên dữ liệu mới. Dừng sớm theo dõi chỉ số trên tập kiểm định qua từng epoch và dừng ngay khi nó ngừng cải thiện — đó chính là thời điểm mô hình chuyển từ học quy luật sang học thuộc nhiễu. Rẻ, không phải đổi kiến trúc, và có sẵn trong hầu hết khung huấn luyện.

Vì sao các phương án khác sai

  • A. Huấn luyện trên tập nhỏ hơn — ít dữ liệu hơn thì quá khớp nặng thêm.
  • B. Bỏ bước kiểm định chéo — bỏ đi đúng công cụ dùng để phát hiện vấn đề.
  • C. Tăng số tham số — mô hình phức tạp hơn học thuộc nhiễu dễ hơn nữa.
Câu 258 Data Preparation for Machine Learning

A data scientist is using SageMaker Data Wrangler for feature engineering and needs to determine which features contribute most to the model's predictions. Which feature of Data Wrangler helps visualize and estimate the importance of different features?

  1. A

    Quick Model

  2. B

    Min-Max Scaling

  3. C

    Recursive Feature Elimination

  4. D

    One-hot Encoding

Xem giải thích

Đáp án

A — Quick Model

Vì sao đúng

Quick Model của Data Wrangler huấn luyện nhanh một mô hình cây trên chính dữ liệu đang chuẩn bị, rồi trả về điểm quan trọng của từng đặc trưng cùng một ước lượng độ chính xác. Nhờ vậy bạn biết ngay đặc trưng nào đáng giữ mà không phải rời khỏi giao diện hay dựng quy trình huấn luyện đầy đủ.

Vì sao các phương án khác sai

  • B. Min-Max Scaling — phép biến đổi đưa giá trị về cùng thang, không đánh giá gì.
  • C. Recursive Feature Elimination — là kỹ thuật chọn đặc trưng có thật, nhưng không phải tính năng của Data Wrangler; đây là bẫy hay gặp.
  • D. One-hot Encoding — mã hoá biến phân loại, cũng là phép biến đổi chứ không phải đánh giá.
Câu 259 Chọn nhiều đáp án ML Model Development

A data scientist is building a fraud detection model using Amazon SageMaker. The dataset is highly imbalanced, with only 2% of the data representing fraudulent cases. The scientist wants to ensure the model can effectively detect fraud while minimizing false negatives.

Which techniques should the scientist use to handle this issue? (Choose TWO.)

  1. A

    Use oversampling techniques, such as SMOTE, to balance the dataset.

  2. B

    Use Amazon SageMaker Random Cut Forest (RCF) algorithm for anomaly detection.

  3. C

    Use weighted loss functions during training to penalize misclassification of the minority class.

  4. D

    Perform dimensionality reduction to reduce the number of features and make the dataset more manageable.

  5. E

    Train the model on the original dataset and rely on evaluation metrics for adjustments.

Xem giải thích

Đáp án

A và C — dùng SMOTE để tăng mẫu lớp thiểu số, và dùng hàm mất mát có trọng số

Vì sao đúng

Với 2% mẫu gian lận, mô hình đoán "không gian lận" cho tất cả là đã đạt 98% độ chính xác mà vô dụng. Hai cách chữa ở hai tầng khác nhau:

  • A. SMOTE sinh thêm mẫu lớp thiểu số bằng nội suy giữa các mẫu có thật, nên mô hình nhìn thấy chúng đủ nhiều — khác với việc chỉ nhân bản y hệt.
  • C. Hàm mất mát có trọng số phạt nặng hơn khi bỏ sót ca gian lận, kéo gradient về phía học lớp hiếm. Làm ngay trong lúc huấn luyện, không đụng tới dữ liệu.

Vì sao các phương án khác sai

  • B. Dùng Random Cut Forest — là thuật toán phát hiện bất thường không giám sát; đề đang xây mô hình có giám sát trên dữ liệu đã gán nhãn.
  • D. Giảm chiều dữ liệu — giải quyết chuyện quá nhiều đặc trưng, không liên quan tới mất cân bằng lớp.
  • E. Huấn luyện nguyên trạng rồi dựa vào chỉ số — chỉ số cho biết có vấn đề, không sửa được vấn đề.
Câu 260 Chọn nhiều đáp án Deployment and Orchestration of ML Workflows

"A company needs to automatically resize images uploaded to an Amazon S3 bucket and store the resized images in another S3 bucket. How can this be accomplished using AWS services? (Choose Two)

  1. A

    Use AWS Batch to process the images and store the results in another S3 bucket.

  2. B

    Use Amazon EC2 instances to constantly monitor the S3 bucket and resize images.

  3. C

    Configure AWS Glue to transform and resize the images as they are uploaded.

  4. D

    Create a Lambda function to resize images and configure it to be triggered by S3 'ObjectCreated' events.

  5. E

    Set up an S3 Event Notification to trigger the Lambda function when a new object is created.

Xem giải thích

Đáp án

D và E — hàm Lambda đổi cỡ ảnh, và S3 Event Notification kích hoạt hàm đó

Vì sao đúng

Hai phương án này là hai nửa của cùng một giải pháp không máy chủ:

  • E. S3 Event Notification phát sự kiện s3:ObjectCreated khi có ảnh mới, và gọi hàm Lambda. Đây là mắt xích khiến mọi thứ tự động.
  • D. Lambda đọc ảnh, đổi cỡ và ghi sang bucket thứ hai. Nó co giãn theo số ảnh tải lên, không máy nào phải trông.

Lưu ý thực tế: ghi ảnh kết quả sang bucket khác là bắt buộc, ghi lại cùng bucket sẽ kích hoạt lại chính hàm đó và tạo vòng lặp vô tận.

Vì sao các phương án khác sai

  • A. AWS Batch — dựng cho công việc tính toán theo lô chạy dài, quá nặng cho việc đổi cỡ ảnh.
  • B. EC2 liên tục dò bucket — tốn tiền cả lúc không có ảnh nào, và trễ hơn hẳn.
  • C. Glue để đổi cỡ ảnh — Glue là ETL cho dữ liệu có cấu trúc, không xử lý ảnh.