Ngân hàng đề — AWS Certified Machine Learning Engineer Associate

Tìm thấy 635 câu.

Câu 431 Chọn nhiều đáp án Data Preparation for Machine Learning

A company is preparing to automate the transformation and loading of log data from an Amazon S3 bucket using AWS Glue. The data should be transformed into a columnar format to enhance query performance and stored back into S3 for subsequent analysis using business intelligence tools. Considering cost optimization and effective data transformation, which TWO of the following strategies should the company implement? (Choose Two)

  1. A

    Configure an AWS Glue crawler to detect and update the data schema, enabling automatic partitioning by adding new partitions as data grows.

  2. B

    Directly use Amazon S3 to perform ETL operations on the data, bypassing AWS Glue to minimize costs and avoid complex configurations.

  3. C

    Utilize AWS Glue's built-in capability to transform the data format to Apache Parquet for optimized analytical querying before storing it back to S3.

  4. D

    Implement manual ETL processes that rely on EC2 instances to periodically transform and overwrite data in S3 to ensure data is up-to-date.

  5. E

    Set up AWS Glue ETL jobs to run on a minimal number of Data Processing Units (DPUs) to effectively balance cost and performance.

Xem giải thích

Đáp án

C và E — dùng khả năng đổi định dạng sang Parquet của Glue, và chạy job với số DPU tối thiểu

Vì sao đúng

  • C. Đổi sang Parquet — định dạng cột, nén tốt, nên mọi truy vấn về sau chỉ đọc đúng cột cần. Với log thì đây thường là đòn giảm chi phí mạnh nhất, vì Athena tính tiền theo lượng dữ liệu quét.
  • E. Số DPU tối thiểu — Glue tính tiền theo DPU nhân thời gian; khai dư là trả tiền cho phần nằm không.

Vì sao các phương án khác sai

  • A. Crawler cập nhật lược đồ — cần thiết cho việc truy vấn, nhưng không phải biện pháp tối ưu chi phí mà đề đang hỏi.
  • B. Dùng S3 để làm ETL, bỏ qua Glue — S3 là kho lưu trữ, không xử lý dữ liệu.
  • D. Tự làm ETL trên EC2 — trái hướng dịch vụ được quản lý và phải tự vận hành.
Câu 432 Chọn nhiều đáp án Data Preparation for Machine Learning

A media company uses AWS Glue for processing and analyzing streaming video metadata stored in Amazon S3, with a requirement to make the processed data available in a SQL-like queryable format for quick insights. Given the need to regularly update the metadata catalog and the integration with analytics services, which TWO actions should be implemented to optimize the processing workflow in AWS Glue? (Choose Two)

  1. A

    Utilize AWS Glue crawlers to automatically infer schema from new data and update the Glue Data Catalog, ensuring data remains queryable with updated schema.

  2. B

    Schedule AWS Glue ETL jobs to perform transformations only during off-peak hours to reduce impact on operational costs and resource utilization.

  3. C

    Enable AWS Glue Studio to manage ETL jobs and transformations visually, thereby simplifying the modification and deployment of data pipelines.

  4. D

    Rely on Amazon Redshift Spectrum to handle the ETL processes directly from the S3 data lake, eliminating the need for AWS Glue.

  5. E

    Configure incremental data loads in Glue ETL jobs to ensure only newly added data is processed, thus minimizing compute resources and processing time.

Xem giải thích

Đáp án

A và E — crawler tự suy lược đồ từ dữ liệu mới, và cấu hình nạp tăng dần

Vì sao đúng

Hai vế của bài toán "dữ liệu đổ về liên tục và phải sẵn sàng cho phân tích":

  • A. Crawler phát hiện tệp mới và cập nhật lược đồ vào Data Catalog, nên bảng luôn phản ánh đúng dữ liệu hiện có mà không ai phải khai tay.
  • E. Nạp tăng dần — dùng bookmark để job chỉ xử lý phần mới, giữ thời gian chạy ổn định thay vì dài dần theo khối lượng tích luỹ.

Vì sao các phương án khác sai

  • B. Chỉ chạy ETL ngoài giờ cao điểm — làm dữ liệu chậm sẵn sàng, trái yêu cầu.
  • C. Dùng Glue Studio để quản lý trực quan — ảnh hưởng cách phát triển, không ảnh hưởng độ mới của dữ liệu.
  • D. Để Redshift Spectrum lo ETL — Spectrum truy vấn dữ liệu trên S3, nó không biến đổi và không nạp gì.
Câu 433 Data Preparation for Machine Learning

A retail company uses AWS Lambda to process images uploaded to an Amazon S3 bucket. The company wants to enhance the Lambda function to extract metadata from the images (such as resolution and file format), store the metadata in an Amazon DynamoDB table, and trigger a machine learning model hosted on SageMaker to classify the images. Which of the following options is the most proper and scalable for described workflow?

  1. A

    Use an S3 event trigger to invoke the Lambda function, extract metadata, store it in DynamoDB, and directly invoke the SageMaker endpoint for classification within the same Lambda function.

  2. B

    Use an S3 event trigger to invoke the Lambda function, extract metadata, and store it in DynamoDB. Then, trigger a separate Lambda function to invoke the SageMaker endpoint for classification.

  3. C

    Set up an Amazon S3 batch operation to invoke the Lambda function, extract metadata, and invoke the SageMaker endpoint. Use a separate process to store the metadata in DynamoDB after classification.

  4. D

    Use Amazon EventBridge to monitor S3 uploads, triggering the Lambda function to extract metadata, store it in DynamoDB, and schedule a periodic invocation of SageMaker for classification.

Xem giải thích

Đáp án

B — S3 event kích hoạt Lambda, trích siêu dữ liệu rồi lưu vào cơ sở dữ liệu

Vì sao đúng

Đây là khuôn mẫu không máy chủ chuẩn cho việc xử lý theo sự kiện: S3 phát sự kiện s3:ObjectCreated khi có ảnh mới, gọi Lambda; hàm đọc siêu dữ liệu rồi ghi vào một CSDL truy vấn được như DynamoDB. Không có thành phần nào phải trông, và độ trễ chỉ tính bằng mili giây.

Vì sao các phương án khác sai

  • A — cùng cơ chế kích hoạt nhưng nơi lưu kết quả không phù hợp cho việc tra cứu về sau.
  • C. S3 Batch Operations — dùng để xử lý hàng loạt đối tượng đã có sẵn, không phải cơ chế phản ứng khi có ảnh mới.
  • D. Dùng EventBridge để theo dõi S3 — làm được và hữu ích khi cần lọc phức tạp hay gửi tới nhiều đích, nhưng ở đây thêm một tầng không cần thiết.
Câu 434 Chọn nhiều đáp án ML Model Development

A data scientist is training a machine learning model using a large dataset with various features. During the initial evaluation, the model appears to be overfitting. Which combination of techniques can the data scientist apply to reduce overfitting and improve generalization? (Choose TWO)

  1. A

    Use cross-validation by rotating through training and validation sets.

  2. B

    Increase the number of parameters in the model to capture more data patterns.

  3. C

    Apply regularization to penalize extreme model parameters.

  4. D

    Reduce the amount of training data to limit the complexity of the model.

  5. E

    Avoid using dimensionality reduction techniques to retain all feature information.

Xem giải thích

Đáp án

A và C — kiểm định chéo, và chính quy hoá

Vì sao đúng

Hai kỹ thuật bổ sung nhau cho vấn đề quá khớp:

  • A. Kiểm định chéo là công cụ chẩn đoán: xoay vòng qua nhiều cách chia tập huấn luyện và kiểm định để có ước lượng đáng tin, thay vì bị đánh lừa bởi một lần chia may mắn.
  • C. Chính quy hoá là công cụ điều trị: thêm số hạng phạt theo độ lớn trọng số, ép mô hình chọn lời giải trơn hơn thay vì uốn theo từng điểm dữ liệu.

Vì sao các phương án khác sai

  • B. Tăng số tham số — mô hình phức tạp hơn học thuộc nhiễu dễ hơn nữa.
  • D. Giảm dữ liệu huấn luyện — ít dữ liệu hơn thì quá khớp nặng thêm.
  • E. Tránh giảm chiều để giữ mọi đặc trưng — giữ cả những đặc trưng nhiễu chính là một nguồn gây quá khớp.
Câu 435 Data Preparation for Machine Learning

A machine learning team is developing a model to predict customer churn. They need to address bias and ensure fairness in their model outputs. Which Amazon SageMaker feature can they use to analyze and mitigate bias during and after the training phase?

  1. A

    SageMaker Clarify

  2. B

    SageMaker Data Wrangler

  3. C

    SageMaker Debugger

  4. D

    SageMaker Ground Truth

Xem giải thích

Đáp án

A — SageMaker Clarify

Vì sao đúng

Clarify là công cụ chuyên cho thiên lệch và tính công bằng. Nó đo thiên lệch ở hai thời điểm: trước khi huấn luyện (dữ liệu có mất cân đối giữa các nhóm không) và sau khi huấn luyện (mô hình có đối xử khác nhau giữa các nhóm không), với nhiều chỉ số chuẩn. Nó cũng giải thích dự đoán bằng giá trị SHAP, nên biết được đặc trưng nào đang đẩy kết quả.

Vì sao các phương án khác sai

  • B. Data Wrangler — chuẩn bị dữ liệu; có xem được phân bố nhưng không đo thiên lệch theo các chỉ số công bằng.
  • C. Debugger — theo dõi bên trong quá trình huấn luyện (gradient, mất mát), không liên quan tới công bằng.
  • D. Ground Truth — gán nhãn dữ liệu; có giảm thiên lệch ở khâu nhãn nhờ người rà soát, nhưng không đo thiên lệch của mô hình.
Câu 436 ML Model Development

A machine learning engineer is using Amazon SageMaker Debugger to monitor a training job. The engineer notices that the model’s validation loss starts to increase while the training loss continues to decrease. What action should the engineer take to address this issue?

  1. A

    Increase the learning rate to improve the model's performance.

  2. B

    Use early stopping to prevent further overfitting.

  3. C

    Add more features to the model to increase its complexity.

  4. D

    Reduce the amount of training data to prevent overfitting.

Xem giải thích

Đáp án

B — Dùng dừng sớm để chặn quá khớp

Vì sao đúng

Triệu chứng "mất mát trên tập kiểm định bắt đầu tăng trong khi mất mát huấn luyện vẫn giảm" là định nghĩa trực quan nhất của quá khớp: từ điểm đó trở đi mô hình học thuộc nhiễu chứ không học thêm quy luật. Dừng sớm ngắt huấn luyện ngay tại điểm rẽ đó và giữ lại bộ trọng số tốt nhất.

Vì sao các phương án khác sai

  • A. Tăng tốc độ học — không liên quan tới quá khớp, và thường làm huấn luyện mất ổn định.
  • C. Thêm đặc trưng để tăng độ phức tạp — làm quá khớp nặng thêm.
  • D. Giảm dữ liệu huấn luyện — cũng làm nặng thêm; ít dữ liệu thì dễ học thuộc hơn.
Câu 437 ML Model Development

A data scientist is working to improve the generalization of their machine learning model and reduce overfitting. They have been advised to use cross-validation, add more training data, and apply regularization techniques. Which of the following best describes the purpose and impact of using regularization?

  1. A

    Regularization simplifies the model by penalizing extreme parameter values, reducing overfitting risk.

  2. B

    Regularization increases model complexity to improve performance on diverse datasets.

  3. C

    Regularization rotates through different subsets of data to enhance model generalization.

  4. D

    Regularization augments data size by adding synthetic samples from minority classes.

Xem giải thích

Đáp án

A — Chính quy hoá làm mô hình đơn giản đi bằng cách phạt các tham số cực đoan

Vì sao đúng

Chính quy hoá thêm một số hạng vào hàm mất mát tỷ lệ với độ lớn của trọng số (L1 hoặc L2). Mô hình vì thế phải cân giữa việc khớp dữ liệu và việc giữ trọng số nhỏ, nên nó chọn lời giải trơn hơn thay vì uốn theo từng điểm. Kết quả là tổng quát hoá tốt hơn trên dữ liệu chưa thấy.

Vì sao các phương án khác sai

  • B. Tăng độ phức tạp mô hình — ngược hẳn tác dụng của chính quy hoá.
  • C. Xoay vòng qua các tập con dữ liệu — đó là kiểm định chéo, một kỹ thuật khác.
  • D. Sinh thêm mẫu tổng hợp cho lớp thiểu số — đó là SMOTE, dùng cho dữ liệu mất cân bằng.
Câu 438 ML Solution Monitoring, Maintenance, and Security

A machine learning specialist is using SageMaker Clarify to evaluate potential bias in a customer satisfaction prediction model. The data includes sensitive attributes like gender and age. Which of the following actions can SageMaker Clarify perform to detect and address bias in this context?

  1. A

    It will generate new features from the existing data to balance all classes.

  2. B

    It will run an analysis on specified sensitive attributes and generate a report with bias metrics.

  3. C

    It will optimize the model by re-training it on only the sensitive features to reduce bias.

  4. D

    It will apply synthetic data generation to equalize sample sizes across all categories.

Xem giải thích

Đáp án

B — Chạy phân tích trên các thuộc tính nhạy cảm đã khai và sinh báo cáo

Vì sao đúng

Clarify là công cụ đo và báo cáo, không phải công cụ tự sửa. Bạn khai thuộc tính nhạy cảm (giới tính, độ tuổi, khu vực) và nhóm cần so, nó tính một loạt chỉ số thiên lệch — chênh lệch tỷ lệ được dự đoán tích cực giữa các nhóm, chênh lệch độ chính xác, v.v. — rồi xuất báo cáo. Việc quyết định làm gì với kết quả đó thuộc về con người.

Vì sao các phương án khác sai

  • A. Sinh đặc trưng mới để cân bằng các lớp — Clarify không biến đổi dữ liệu.
  • C. Huấn luyện lại chỉ trên thuộc tính nhạy cảm — vô nghĩa về mặt phương pháp, và làm thiên lệch nặng thêm.
  • D. Sinh dữ liệu tổng hợp để cân bằng cỡ mẫu — là kỹ thuật xử lý mất cân bằng, nhưng không phải việc Clarify làm.
Câu 439 ML Solution Monitoring, Maintenance, and Security

A team is training a neural network model in Amazon SageMaker. During training, they notice that the model's performance has plateaued, and suspect a vanishing gradient issue. How can they leverage SageMaker Debugger to diagnose and address this problem?

  1. A

    Set up custom debug rules to capture disappearing gradients and adjust the learning rate as needed.

  2. B

    Enable SageMaker Clarify to detect vanishing gradients during training.

  3. C

    Use cross-validation to rotate training data, preventing gradient loss.

  4. D

    Increase the training epochs until SageMaker Debugger resolves the issue.

Xem giải thích

Đáp án

A — Đặt luật gỡ lỗi riêng để bắt gradient biến mất rồi chỉnh tốc độ học

Vì sao đúng

"Hiệu năng chững lại" cộng nghi ngờ gradient biến mất chỉ thẳng tới Debugger. Nó lấy mẫu tensor gradient trong lúc huấn luyện; luật VanishingGradient có sẵn kích hoạt khi giá trị nhỏ dần tới mức trọng số gần như không đổi. Từ đó bạn chỉnh tốc độ học, đổi hàm kích hoạt, hoặc thêm chuẩn hoá theo lô.

Vì sao các phương án khác sai

  • B. Dùng Clarify để phát hiện gradient biến mất — Clarify lo thiên lệch và khả năng giải thích, không nhìn vào gradient.
  • C. Kiểm định chéo để tránh mất gradient — kiểm định chéo là cách đánh giá, không ảnh hưởng tới việc lan truyền gradient.
  • D. Tăng số epoch cho tới khi Debugger tự xử lý — Debugger chỉ phát hiện và báo; nó không tự sửa, và huấn luyện thêm với gradient đã biến mất thì không cải thiện gì.
Câu 440 Deployment and Orchestration of ML Workflows

A mobile application requires occasional, unpredictable access to machine learning predictions. The app’s usage fluctuates significantly throughout the day, leading to periods of high traffic and very low usage at off-peak times. Which deployment strategy in Amazon SageMaker would optimize costs while still ensuring scalability during peak periods?

  1. A

    Batch Transform

  2. B

    Real-Time Inference Endpoint

  3. C

    Serverless Inference Endpoint

  4. D

    Asynchronous Inference Endpoint

Xem giải thích

Đáp án

C — Serverless Inference Endpoint

Vì sao đúng

Đề mô tả tải thưa thớt và khó đoán, có những quãng dài không ai gọi. Serverless Inference tự cấp phát năng lực khi có yêu cầu và thu về bằng 0 khi rảnh, tính tiền theo thời gian xử lý thật. Đó là lý do nó tiết kiệm hơn hẳn endpoint thường trong tình huống này.

Đánh đổi cần biết: có khởi động nguội ở lần gọi đầu sau một quãng nghỉ, nên không hợp khi mọi yêu cầu đều phải trả lời trong vài chục mili giây.

Vì sao các phương án khác sai

  • B. Real-Time Endpoint — máy chạy liên tục, trả tiền cả lúc không ai dùng.
  • A. Batch Transform — chạy trên tập dữ liệu theo lô, không phục vụ yêu cầu lẻ từ ứng dụng.
  • D. Asynchronous Inference — dành cho payload lớn hoặc thời gian xử lý dài, không phải cho tải thưa.