Ngân hàng đề — AWS Certified Machine Learning Engineer Associate
Tìm thấy 635 câu.
A data analyst wants to extract meaningful insights from unstructured customer feedback stored in Amazon S3. The insights should include key entities like people, organizations, and locations mentioned in the feedback, as well as the overall sentiment of the feedback. Which combination of Amazon Comprehend features should the analyst use to achieve this goal?
-
A
Text Classification and Entity Recognition
-
B
Keyphrase Extraction and Topic Modeling
-
C
Topic Modeling and Keyphrase Extraction
-
D
Entity Recognition and Sentiment Analysis
Xem giải thích
Đáp án
D — Entity Recognition và Sentiment Analysis
Vì sao đúng
Đề nêu hai nhu cầu rõ ràng và Amazon Comprehend có đúng hai tính năng tương ứng: nhận diện thực thể rút ra tên người, tổ chức, địa điểm — chính là danh sách đề liệt kê; phân tích cảm xúc cho biết phản hồi của khách là tích cực, tiêu cực hay trung tính.
Vì sao các phương án khác sai
- A. Phân loại văn bản — gán nhãn theo bộ nhãn bạn tự định nghĩa, không rút ra thực thể.
- B và C. Trích cụm khoá và mô hình chủ đề — cho biết văn bản nói về cái gì, nhưng không nhận ra thực thể có tên và không đo được cảm xúc.
A data scientist is building a machine learning pipeline using Amazon SageMaker Pipelines. The pipeline includes data preprocessing, model training, and model registration. The data scientist wants to ensure that parameters used for model training can be easily adjusted without modifying the pipeline itself. Which feature of SageMaker Pipelines should the data scientist use to achieve this?
-
A
Pipeline Steps
-
B
Directed Acyclic Graph (DAG)
-
C
Pipeline Parameters
-
D
SageMaker Model Registry
Xem giải thích
Đáp án
C — Pipeline Parameters
Vì sao đúng
Tham số của pipeline cho phép khai những giá trị truyền vào lúc chạy — đường dẫn dữ liệu, loại máy, siêu tham số — thay vì viết cứng trong định nghĩa. Nhờ vậy cùng một pipeline chạy được cho nhiều bộ dữ liệu hoặc nhiều môi trường mà không phải định nghĩa lại.
Vì sao các phương án khác sai
- A. Pipeline Steps — là các bước công việc, không phải cơ chế truyền giá trị.
- B. DAG — mô tả thứ tự và phụ thuộc giữa các bước.
- D. Model Registry — nơi đăng ký và quản lý phiên bản mô hình, nằm ở cuối quy trình.
An e-commerce company uses a Lambda function triggered by Amazon SNS to preprocess customer transaction data before sending it to an Amazon SageMaker model for fraud detection. The transaction data is then stored in Amazon RDS for long-term analytics. The company wants to ensure that only valid transactions (based on a predefined schema) are passed to the SageMaker model and that invalid transactions are logged and stored in Amazon S3 for further analysis.
Which of the following solutions BEST fits the company's requirements?
-
A
Use Lambda to validate the schema of each transaction, send valid data to SageMaker for inference, and write invalid data directly to Amazon S3.
-
B
Use Amazon Kinesis Data Firehose to preprocess and validate the data, then trigger Lambda to send valid data to SageMaker, while invalid data is redirected to S3.
-
C
Set up a Step Functions workflow to manage validation and invoke Lambda for processing valid data and storing invalid data in S3.
-
D
Use Lambda to validate the schema, send valid data to SageMaker, and forward invalid data to an Amazon SQS queue, which will trigger another Lambda function to log and store it in S3.
Xem giải thích
Đáp án
D — Lambda kiểm lược đồ, dữ liệu hợp lệ gửi sang SageMaker, dữ liệu hỏng chuyển sang nơi khác
Vì sao đúng
Điểm mấu chốt là không im lặng bỏ đi bản ghi hỏng. Lambda kiểm lược đồ ngay khi nhận, phần hợp lệ đi tiếp tới mô hình, phần không hợp lệ được đẩy sang hàng đợi hoặc nơi lưu riêng để soi sau. Nhờ vậy đường ống không gãy vì một bản ghi lạ, mà bạn cũng không mất dấu vết để sửa nguồn.
Vì sao các phương án khác sai
- A. Chỉ gửi phần hợp lệ đi tiếp — phần hỏng biến mất không dấu vết; khi tỷ lệ phát hiện gian lận tụt thì không ai biết vì sao.
- B. Firehose kiểm dữ liệu — Firehose biến đổi được bằng Lambda nhưng không phải chỗ đặt logic kiểm và phân luồng.
- C. Step Functions điều phối — mạnh cho quy trình nhiều bước, nhưng ở đây thừa: chỉ có một bước kiểm rồi rẽ nhánh.
A data scientist is using SageMaker Experiments to track and compare model training runs. They want to ensure that detailed metadata, such as hyperparameters, datasets, and code changes, are logged automatically for each trial. Which feature of SageMaker Experiments provides this functionality?
-
A
Trackers
-
B
Model Monitor
-
C
Trial Components
-
D
SageMaker Feature Store
Xem giải thích
Đáp án
A — Trackers
Vì sao đúng
Trong SageMaker Experiments, tracker là thứ bạn dùng ngay trong mã để ghi lại siêu tham số, vị trí dữ liệu, phiên bản mã và các chỉ số của một lần chạy. Nó gắn dữ liệu đó vào trial component tương ứng, nhờ vậy sau này so sánh các lần chạy là có đủ ngữ cảnh chứ không chỉ có con số cuối cùng.
Vì sao các phương án khác sai
- B. Model Monitor — theo dõi mô hình đã triển khai, không ghi siêu dữ liệu lúc huấn luyện.
- C. Trial Components — là nơi chứa dữ liệu đó; tracker mới là công cụ ghi vào.
- D. Feature Store — kho đặc trưng, không liên quan tới theo dõi thí nghiệm.
A company wants to optimize the data ingestion process for a machine learning pipeline in Amazon SageMaker. The data, stored in Amazon S3, consists of large JSON files, and the current ETL job takes a long time to process the data before training. To improve performance, they want to minimize read and I/O times, especially for downstream analysis using Amazon Athena.
Which format should the company use to store their data in S3 for better processing and analytics performance?
-
A
Compress the data as a ZIP file and upload it to S3.
-
B
Use Apache Parquet to store the data in S3.
-
C
Convert the data to CSV format and store it in S3.
-
D
Convert the data to JSON Lines format to reduce file size.
Xem giải thích
Đáp án
B — Lưu dữ liệu dạng Apache Parquet trên S3
Vì sao đúng
JSON là định dạng văn bản theo dòng: mỗi bản ghi lặp lại tên trường, không nén sẵn, và phải phân tích cú pháp từng dòng. Parquet lưu theo cột, nén tốt và mang sẵn lược đồ, nên vừa giảm mạnh dung lượng phải đọc từ S3 vừa bỏ được phần phân tích cú pháp tốn kém — hai nguyên nhân chính khiến khâu nạp dữ liệu chậm.
Vì sao các phương án khác sai
- A. Nén thành ZIP — giảm dung lượng nhưng không tách được để đọc song song, và vẫn phải giải nén rồi phân tích JSON.
- C. Đổi sang CSV — vẫn là định dạng dòng, không mang lược đồ, và mất kiểu dữ liệu.
- D. JSON Lines — dễ đọc theo dòng hơn nhưng vẫn là văn bản, cải thiện rất ít.
A technology company uses AWS CloudFormation to manage its infrastructure as code. The team wants to create a CloudFormation stack that includes an Amazon S3 bucket and an Amazon EC2 instance. The S3 bucket should only be created if the EC2 instance is successfully launched. If the EC2 instance creation fails, the stack creation should be rolled back, and the S3 bucket should not be created.
Which configuration will meet these requirements?
-
A
Use the DependsOn attribute in the S3 bucket resource to specify the EC2 instance resource.
-
B
Use a CreationPolicy on the EC2 instance resource and an UpdatePolicy on the S3 bucket resource.
-
C
Use a custom resource to check the status of the EC2 instance creation and create the S3 bucket based on that status.
-
D
Use the Condition attribute to create a condition that checks if the EC2 instance is created and use that condition in the S3 bucket resource.
Xem giải thích
Đáp án
A — Dùng thuộc tính DependsOn
Vì sao đúng
Mặc định CloudFormation tạo tài nguyên song song khi chúng không tham chiếu lẫn nhau. DependsOn là cách khai tường minh "tài nguyên này chỉ được tạo sau khi tài nguyên kia xong", đúng thứ đề cần khi hai tài nguyên không có tham chiếu tự nhiên nào giữa chúng.
Vì sao các phương án khác sai
- B. CreationPolicy và UpdatePolicy —
CreationPolicybắt chờ tín hiệu báo thành công từ bên trong máy, giải bài toán khác;UpdatePolicydành cho Auto Scaling group. - C. Custom resource để kiểm tra trạng thái — tự viết lại thứ
DependsOnlàm sẵn. - D. Thuộc tính
Condition— quyết định tài nguyên có được tạo hay không, không quyết định thứ tự.
A company is using Amazon S3 to store sensitive business documents. To enhance security, they want to grant access to the S3 bucket only to certain IAM users, while denying access to others. Additionally, the company requires the S3 bucket to be accessed by an EC2 instance running in a different AWS account, but only for reading data.
Which combination of AWS IAM features should be used to meet these requirements? (Choose TWO)
-
A
Use an identity-based policy to attach to IAM users that grants or denies access to the S3 bucket.
-
B
Use AWS Lambda to check the IAM users’ permissions before allowing access to the S3 bucket.
-
C
Create a role in the other AWS account with a trust policy allowing the EC2 instance to assume the role and read from the S3 bucket.
-
D
Use a customer-managed IAM policy attached to the S3 bucket to define granular access for the EC2 instance and the IAM users.
-
E
Apply a resource-based bucket policy in Amazon S3 to explicitly deny access from all users except the EC2 instance and required IAM users.
Xem giải thích
Đáp án
A và C — chính sách gắn theo danh tính cho IAM user, và vai có trust policy ở tài khoản kia
Vì sao đúng
Hai yêu cầu, hai cơ chế:
- A. Chính sách theo danh tính gắn thẳng vào IAM user, cho hoặc từ chối quyền trên bucket. Đây là cách quản quyền trong cùng tài khoản.
- C. Vai kèm trust policy là cách chuẩn cho truy cập liên tài khoản: tài khoản chủ bucket tạo vai, trust policy cho phép instance ở tài khoản kia đóng vai, và quyền được cấp cho vai đó. Không có khoá dài hạn nào phải chia sẻ.
Vì sao các phương án khác sai
- B. Lambda kiểm quyền trước khi cho vào — tự dựng lại tầng phân quyền; IAM đã làm việc đó ở tầng thấp hơn và không đi vòng được.
- D. Gắn chính sách IAM do khách hàng quản lý vào bucket — sai khái niệm: gắn vào bucket là bucket policy, không phải chính sách IAM.
- E. Bucket policy từ chối mọi tài khoản khác — nghe hợp lý nhưng chặn luôn cả truy cập liên tài khoản hợp lệ mà đề đang cần.
A machine learning engineer wants to collaborate with a team on a project in AWS SageMaker. The team needs to share notebooks, manage multiple users, and ensure that they can easily scale resources based on their deep learning model's GPU requirements. They also prefer to work in an integrated environment that allows seamless transition between data preparation, training, and model deployment. Which SageMaker tool would BEST meet these collaboration and scaling requirements?
-
A
SageMaker Studio
-
B
SageMaker Notebook Instances
-
C
AWS Lambda with integrated Jupyter notebooks
-
D
Amazon EMR with SageMaker integration
Xem giải thích
Đáp án
A — SageMaker Studio
Vì sao đúng
Từ khoá của đề là làm việc nhóm: chia sẻ notebook, quản lý nhiều người dùng. Studio là môi trường phát triển tích hợp có khái niệm domain và user profile, nên mỗi thành viên có không gian riêng trong cùng một domain, chia sẻ được notebook, và quản trị viên cấp quyền tập trung. Đổi loại máy tính toán mà không mất phiên làm việc.
Vì sao các phương án khác sai
- B. Notebook Instances — mỗi instance là một máy riêng lẻ gắn với một người; không có mô hình nhiều người dùng hay chia sẻ tập trung.
- C. Lambda kèm Jupyter — không tồn tại; Lambda không phải môi trường notebook.
- D. EMR tích hợp SageMaker — cụm xử lý dữ liệu lớn, không phải nền tảng cộng tác cho nhóm ML.
A DevOps team needs to monitor the CPU and memory utilization of their containerized applications running in Amazon ECS. They also need to monitor custom metrics such as the number of active users. Which combination of AWS services and features is the MOST appropriate for this scenario?
-
A
Use AWS Lambda to regularly query ECS task performance and push CPU and memory metrics into CloudWatch for analysis.
-
B
Enable AWS Config to track ECS task performance and set up CloudWatch Alarms for CPU and memory metrics.
-
C
Configure CloudTrail to capture ECS API calls and use EventBridge to push the CPU and memory metrics into CloudWatch.
-
D
Use AWS CloudWatch to monitor ECS task-level metrics such as CPU and memory utilization. Install the CloudWatch Agent to push custom metrics for active users.
Xem giải thích
Đáp án
D — Dùng CloudWatch cho chỉ số ở mức task, và cho cả chỉ số tự định nghĩa
Vì sao đúng
ECS đẩy sẵn chỉ số CPU và bộ nhớ vào CloudWatch; bật Container Insights thì có thêm số liệu ở mức task và container chứ không chỉ mức cụm. Chỉ số riêng của ứng dụng — như số yêu cầu đã xử lý — thì ứng dụng tự đẩy lên bằng API PutMetricData hoặc qua embedded metric format. Một nơi, hai loại chỉ số, đặt cảnh báo chung.
Vì sao các phương án khác sai
- A. Lambda hỏi rồi đẩy chỉ số lên — tự viết lại thứ đã có sẵn.
- B. AWS Config theo dõi hiệu năng — Config theo dõi cấu hình, không thu chỉ số.
- C. CloudTrail bắt lời gọi API — ghi ai gọi gì, không phải chỉ số hiệu năng.
A company uses AWS Glue to automate their ETL processes for data stored in various formats. They are planning to optimize the performance of their Glue ETL jobs which currently handle large volumes of Parquet files. What would be the most cost-effective way to optimize these jobs without compromising on performance?
-
A
Increase the number of DPUs in each ETL job to process data faster.
-
B
Implement job bookmarking to track data processed between job runs and reduce data redundancy.
-
C
Convert all Parquet files into CSV format to simplify processing.
-
D
Manually trigger ETL jobs instead of scheduling them to control when resources are utilized.
Xem giải thích
Đáp án
B — Bật job bookmark để chỉ xử lý dữ liệu mới giữa các lần chạy
Vì sao đúng
Nguyên nhân chậm ở đây là mỗi lần chạy lại quét toàn bộ dữ liệu cũ. Bookmark ghi nhớ đã xử lý tới đâu, nên lần sau Glue chỉ đọc phần thêm vào. Đây là thay đổi một dòng cấu hình mà giảm khối lượng công việc theo tỷ lệ dữ liệu cũ trên tổng — thường là giảm hàng chục lần.
Vì sao các phương án khác sai
- A. Tăng số DPU — làm nhanh hơn bằng cách trả nhiều tiền hơn, không chạm tới nguyên nhân.
- C. Đổi Parquet sang CSV — đi lùi: Parquet là định dạng cột nén tốt, CSV thì không.
- D. Chạy tay thay vì hẹn giờ — chỉ đổi thời điểm chạy, không đổi khối lượng công việc.