Ngân hàng đề — AWS Certified Machine Learning Engineer Associate
Tìm thấy 635 câu.
A company needs to create a machine learning model to detect fraudulent transactions in real-time. They plan to use Amazon SageMaker for model training and deployment. The data for training is stored in Amazon S3, and they require the ability to preprocess the data, perform hyperparameter tuning, and deploy the model to an endpoint for real-time inference. The company also wants to automate the entire workflow from data preprocessing to model deployment.
Which solution will meet these requirements MOST effectively?
-
A
Use Amazon SageMaker Processing for data preprocessing, SageMaker built-in algorithms for training, SageMaker Automatic Model Tuning for hyperparameter tuning, and SageMaker Endpoint for deployment.
-
B
Use AWS Glue for data preprocessing, train the model on a custom EC2 instance, use Amazon SageMaker for hyperparameter tuning, and deploy it using Amazon API Gateway.
-
C
Use Amazon EMR for data preprocessing, SageMaker Script Mode for custom training scripts, perform hyperparameter tuning manually, and deploy the model using Amazon SageMaker Hosting Services.
-
D
Use Amazon SageMaker Data Wrangler for data preprocessing, SageMaker built-in algorithms for training, SageMaker Experiments for tracking, and deploy the model using AWS Lambda.
Xem giải thích
Đáp án
A — SageMaker Processing để tiền xử lý, thuật toán dựng sẵn để huấn luyện
Vì sao đúng
Cả hai đều là dịch vụ được quản lý và nối liền mạch trong cùng một quy trình. Processing job chạy tiền xử lý trên máy do SageMaker cấp phát rồi tự trả máy, nên chỉ trả tiền cho thời gian chạy thật. Thuật toán dựng sẵn như XGBoost đã tối ưu cho bài toán phân loại như phát hiện gian lận, không phải viết mã mô hình.
Vì sao các phương án khác sai
- B. Huấn luyện trên EC2 tự quản — mất hết lợi thế được quản lý và phải tự co giãn.
- C. Dùng EMR để tiền xử lý — dựng cả cụm cho việc Processing job làm gọn hơn.
- D. Data Wrangler để tiền xử lý — Data Wrangler mạnh ở khâu khám phá và làm sạch bằng giao diện; với đường ống sản xuất chạy lặp lại thì Processing job đúng vai hơn.
Which of the following correctly describes the relationship between trials and trial components within SageMaker Experiments?
-
A
A trial consists of multiple experiments, and each experiment captures metadata about data processing.
-
B
A trial component tracks the hardware resources used during training, while a trial compares different algorithms.
-
C
A trial captures different models trained in parallel, and trial components represent different datasets used.
-
D
A trial is a single training run with specific configurations, and trial components capture different stages of the workflow such as data processing or model training.
Xem giải thích
Đáp án
D — Trial là một lần chạy với cấu hình cụ thể, trial component là các giai đoạn trong đó
Vì sao đúng
Cấu trúc đi từ ngoài vào trong: experiment (cả dự án) chứa nhiều trial (mỗi trial là một lần thử với một cấu hình), và mỗi trial gồm nhiều trial component ứng với các bước — tiền xử lý, huấn luyện, đánh giá. Nhờ phân tầng này bạn so được giữa các trial mà vẫn xem được chi tiết từng bước bên trong.
Vì sao các phương án khác sai
- A. Trial chứa nhiều experiment — đảo ngược thứ bậc.
- B. Trial component theo dõi tài nguyên phần cứng — đó là việc của Profiler.
- C. Trial chứa các mô hình huấn luyện song song — mỗi trial là một cấu hình; chạy song song thì thành nhiều trial.
A media company is ingesting high-velocity log data using Amazon Kinesis Data Firehose. They need to analyze this data in near real-time using SQL queries. The data is semi-structured and needs to be loaded into a data warehouse for fast querying. Which combination of services should the company use to accomplish this?
-
A
Use Amazon Kinesis Data Firehose to load the data into Amazon Redshift using the native Firehose to Redshift integration for fast querying.
-
B
Stream data into Amazon Kinesis Data Streams, then use a Lambda function to transform and store the data in Amazon DynamoDB
-
C
Use Amazon Kinesis Data Firehose to stream the data into Amazon RDS with a PostgreSQL database for querying.
-
D
Use Amazon Kinesis Data Firehose to stream the data into an Amazon S3 bucket, then use Amazon Athena to run SQL queries on the data stored in S3.
Xem giải thích
Đáp án
A — Dùng Firehose nạp dữ liệu vào Amazon Redshift
Vì sao đúng
Đề cần truy vấn SQL gần thời gian thực trên dữ liệu bán cấu trúc đang đổ về liên tục. Firehose nhận Redshift làm đích có sẵn: nó gom lô, ghi tạm ra S3 rồi chạy lệnh COPY vào bảng — không phải viết consumer nào. Từ đó phân tích bằng SQL trên kho dữ liệu, đúng nhu cầu.
Vì sao các phương án khác sai
- B. Data Streams rồi Lambda — làm được nhưng phải tự viết và tự vận hành phần tiêu thụ, trong khi Firehose đã có đích Redshift sẵn.
- C. Đưa vào RDS — CSDL giao dịch, không hợp cho phân tích trên dữ liệu log khối lượng lớn.
- D. Xuống S3 rồi mới xử lý — làm được với Athena, nhưng thêm một chặng và trễ hơn so với nạp thẳng vào kho.
What does data drift refer to in the context of machine learning model monitoring, and why is it important to detect?
-
A
The sudden failure of a model due to an error in the underlying algorithm.
-
B
A situation where the model's predictions deviate from expected outcomes in a systematic way.
-
C
A change in the input data distribution over time, making it different from the data used for model training.
-
D
An issue that arises when the system running the model experiences infrastructure downtime.
Xem giải thích
Đáp án
C — Phân bố dữ liệu đầu vào thay đổi theo thời gian, khác với lúc huấn luyện
Vì sao đúng
Đây đúng là định nghĩa của trôi dữ liệu, và lý do phải phát hiện nó rất thực tế: mô hình học được quan hệ trên phân bố cũ, nên khi dữ liệu thật lệch đi thì dự đoán kém dần mà không có lỗi nào được ném ra. Hệ thống vẫn trả về kết quả bình thường, chỉ là kết quả sai nhiều hơn.
Ưu điểm của việc theo dõi trôi dữ liệu: nó chỉ cần dữ liệu vào, phát hiện được ngay, trong khi đo độ chính xác phải chờ có nhãn thật mà nhãn thường tới rất muộn.
Vì sao các phương án khác sai
- A. Mô hình hỏng đột ngột do lỗi thuật toán — đó là lỗi phần mềm, không phải trôi.
- B. Dự đoán lệch so với kết quả mong đợi — đó là trôi chất lượng mô hình, hệ quả chứ không phải nguyên nhân.
- D. Sự cố hạ tầng — chuyện vận hành, không liên quan.
A data engineering team needs to analyze large datasets stored in an Amazon S3 data lake using SQL queries. The data is in semi-structured JSON format, and the team wants to improve query performance by converting it into a columnar format. They also want to ensure the schema is automatically inferred and stored, so that the data can be queried directly from Amazon S3 without loading it into a relational database. Which of the following steps should the team implement using AWS Glue and Amazon Athena? (Choose Two)
-
A
Set up an AWS Glue Crawler to automatically infer the schema from the JSON files and store the metadata in the Glue Data Catalog.
-
B
Use Amazon Athena to run a query that converts JSON data to Apache ORC format and saves it directly into Amazon Redshift.
-
C
Manually create an Amazon Athena schema for each dataset and register it in the Glue Data Catalog.
-
D
Use AWS Glue ETL jobs to convert the JSON data into Apache Parquet format and store it back in S3.
-
E
Enable partitioning in Athena to automatically split large datasets by date, optimizing query performance.
Xem giải thích
Đáp án
A và D — dùng Glue Crawler suy ra lược đồ, và Glue ETL đổi JSON sang Parquet
Vì sao đúng
Hai bước ghép thành cách chuẩn để truy vấn hồ dữ liệu JSON bằng SQL:
- A. Crawler tự suy ra lược đồ từ tệp JSON và đăng ký bảng vào Data Catalog, nên Athena biết dữ liệu có những trường gì.
- D. Đổi sang Parquet — định dạng cột, nén tốt, nên Athena chỉ đọc đúng cột cần. Với JSON thì đây thường là đòn giảm chi phí mạnh nhất, vì Athena tính tiền theo lượng dữ liệu quét.
Vì sao các phương án khác sai
- B. Dùng Athena để đổi sang ORC — Athena
CTASlàm được, nhưng đề đang hỏi cách dựng đường ống và Glue ETL đúng vai hơn cho việc chạy lặp lại. - C. Khai lược đồ tay cho từng tập dữ liệu — không mở rộng được.
- E. Bật phân vùng để Athena tự chia theo ngày — Athena không tự phân vùng; phân vùng là cách bạn tổ chức dữ liệu trên S3 rồi đăng ký vào catalog.
An e-commerce platform ingests high volumes of real-time customer behavior data and has multiple applications consuming this data. Due to high throughput needs, the company wants to avoid bottlenecks when scaling the number of consumers. Which Kinesis Data Streams feature should they configure?
-
A
Enhanced Fan-Out
-
B
On-Demand Sharding
-
C
Provisioned Throughput
-
D
Partition Key
Xem giải thích
Đáp án
A — Enhanced Fan-Out
Vì sao đúng
Không bật thì mọi consumer chia nhau 2 MB/giây của mỗi shard và phải hỏi liên tục, nên càng thêm ứng dụng đọc thì mỗi bên càng chậm. Enhanced fan-out cấp cho từng consumer một đường riêng 2 MB/giây trên mỗi shard và đẩy dữ liệu sang, đưa độ trễ về khoảng 70 mili giây.
Vì sao các phương án khác sai
- B. On-Demand Sharding — chế độ on-demand tự điều chỉnh số shard theo lưu lượng ghi vào; nó không giải quyết chuyện các consumer giành nhau băng thông.
- C. Provisioned Throughput — cách khai năng lực, cùng lý do như trên.
- D. Partition Key — quyết định bản ghi rơi vào shard nào, không liên quan tới phía đọc.
A data scientist is working on a binary classification problem to detect fraudulent transactions. The model has a high precision but a relatively low recall. What does this indicate about the model’s performance?
-
A
The model is poorly identifying true negatives.
-
B
The model is accurately identifying most of the fraudulent transactions.
-
C
The model has a high rate of correctly predicted frauds, but misses many actual frauds.
-
D
The model's predictions are consistent, but it makes many false positive predictions.
Xem giải thích
Đáp án
C — Tỷ lệ dự đoán gian lận đúng cao, nhưng bỏ sót nhiều ca gian lận thật
Vì sao đúng
Hai chỉ số có mẫu số khác nhau, và đó là chìa khoá:
- Precision — trong những giao dịch mô hình gọi là gian lận, bao nhiêu phần trăm đúng. Cao nghĩa là ít báo động giả.
- Recall — trong những giao dịch thực sự gian lận, mô hình bắt được bao nhiêu. Thấp nghĩa là bỏ lọt nhiều.
Precision cao cộng recall thấp cho ra đúng bức tranh: mô hình ít khi nói sai, nhưng nó im lặng trước rất nhiều ca gian lận thật.
Vì sao các phương án khác sai
- A. Kém ở việc nhận đúng ca không gian lận — precision cao cho thấy điều ngược lại.
- B. Bắt được hầu hết ca gian lận — đó là recall cao, trái với đề.
- D. Nhiều dự đoán dương tính giả — cũng là precision thấp.
A data scientist at a retail company needs to quickly build a machine learning model to predict customer churn. The data scientist has limited time and prefers to avoid the complexity of setting up custom infrastructure or algorithms. Which approach would be most suitable for this scenario using Amazon SageMaker?
-
A
Set up a custom model using a proprietary algorithm on Amazon EC2, ensuring complete control over the infrastructure.
-
B
Use SageMaker Jumpstart to deploy a pre-built solution for customer churn prediction without customization.
-
C
Use SageMaker built-in algorithms, such as XGBoost, with the provided dataset, specifying only the hyperparameters and instance type.
-
D
Build a custom algorithm using TensorFlow on a SageMaker notebook instance, with manual setup for data processing and infrastructure management.
Xem giải thích
Đáp án
C — Dùng thuật toán dựng sẵn như XGBoost trên dữ liệu có sẵn
Vì sao đúng
Đề nêu hai ràng buộc: ít thời gian và tránh phức tạp hạ tầng. XGBoost dựng sẵn của SageMaker phù hợp tuyệt đối với dự báo rời bỏ khách hàng — đây là bài toán phân loại nhị phân trên dữ liệu dạng bảng, đúng sở trường của nó. Chỉ cần trỏ tới dữ liệu, khai vài siêu tham số và chạy job.
Vì sao các phương án khác sai
- A. Thuật toán độc quyền trên EC2 — tự quản hạ tầng, trái yêu cầu.
- B. JumpStart cho giải pháp dựng sẵn — cũng là phương án hợp lý và đây là câu dễ phân vân; nhưng khi dữ liệu đã có sẵn dạng bảng thì XGBoost thẳng thắn và ít bước hơn.
- D. Tự viết mô hình TensorFlow — tốn thời gian nhất, và mạng nơ-ron thường không hơn cây tăng cường trên dữ liệu bảng.
A machine learning engineer is using Amazon SageMaker to develop a model. They want to use a managed Jupyter notebook environment that will allow them to write and execute code, visualize data, and train models without needing to configure or maintain the underlying infrastructure.
Which of the following options provides the most suitable solution?
-
A
AWS Lambda
-
B
Amazon EMR
-
C
SageMaker Notebook Instances
-
D
AWS Glue
Xem giải thích
Đáp án
C — SageMaker Notebook Instances
Vì sao đúng
Đề mô tả nhu cầu đơn giản: một môi trường Jupyter được quản lý để viết và chạy mã. Notebook instance đúng là thứ đó — một máy do AWS quản lý, cài sẵn Jupyter cùng các thư viện học máy phổ biến, bật lên là dùng được và có lưu trữ bền qua các lần dừng máy.
Vì sao các phương án khác sai
- A. AWS Lambda — chạy hàm ngắn theo sự kiện, không phải môi trường notebook.
- B. Amazon EMR — cụm xử lý dữ liệu lớn; có notebook nhưng đó là để làm việc với Spark.
- D. AWS Glue — dịch vụ ETL.
Ghi chú
Nếu đề thêm yêu cầu cộng tác nhiều người thì câu trả lời chuyển thành Studio. Bộ đề có nhiều câu chỉ khác nhau đúng ở chi tiết này.
A machine learning team wants to identify the most important features in their dataset using Amazon SageMaker Data Wrangler's "Quick Model" feature. What is the primary purpose of using this feature?
-
A
To apply advanced deep learning techniques for feature engineering.
-
B
To automatically split the dataset, train a simple model, and evaluate feature importance.
-
C
To visualize the correlation matrix of the dataset to identify highly correlated features.
-
D
To perform automated hyperparameter tuning for the best model performance.
Xem giải thích
Đáp án
B — Tự chia dữ liệu, huấn luyện một mô hình đơn giản, rồi đánh giá mức quan trọng của đặc trưng
Vì sao đúng
Quick Model làm đúng ba bước đó trong nền: chia tập huấn luyện và kiểm tra, huấn luyện nhanh một mô hình cây, rồi trả về điểm quan trọng của từng đặc trưng kèm một ước lượng độ chính xác. Mục đích không phải tạo ra mô hình để dùng, mà là định hướng cho khâu kỹ thuật đặc trưng — biết ngay cột nào đáng giữ trước khi đầu tư vào quy trình huấn luyện đầy đủ.
Vì sao các phương án khác sai
- A. Áp dụng kỹ thuật học sâu — Quick Model cố ý dùng mô hình đơn giản để chạy nhanh.
- C. Vẽ ma trận tương quan — là một công cụ phân tích khác của Data Wrangler.
- D. Tinh chỉnh siêu tham số tự động — đó là Automatic Model Tuning, thuộc giai đoạn huấn luyện.