Ngân hàng đề — AWS Certified Machine Learning Engineer Associate
Tìm thấy 635 câu.
A company is using SageMaker built-in algorithms for text analysis. They need to optimize the model’s performance on their dataset by adjusting parameters such as learning rate and batch size. Which of the following approaches would be MOST effective for tuning these parameters?
-
A
Use SageMaker’s built-in support for automatic hyperparameter tuning to efficiently explore different configurations.
-
B
Perform feature engineering on the dataset before training to eliminate the need for hyperparameter tuning.
-
C
Utilize pre-trained models in SageMaker Jumpstart without any further tuning, as they are optimized out-of-the-box for all datasets.
-
D
Write custom Python code to perform a manual grid search for the best hyperparameters.
Xem giải thích
Đáp án
A — Dùng tính năng tinh chỉnh siêu tham số tự động của SageMaker
Vì sao đúng
Automatic Model Tuning chạy nhiều job huấn luyện với các bộ giá trị khác nhau trong khoảng bạn khai, và dùng tối ưu Bayes để chọn lần thử tiếp theo dựa trên kết quả các lần trước — nên tìm ra cấu hình tốt với ít lần thử hơn hẳn dò ngẫu nhiên. Chạy song song được, và dừng sớm được những nhánh kém.
Vì sao các phương án khác sai
- B. Kỹ thuật đặc trưng để khỏi phải tinh chỉnh — đặc trưng tốt rất quan trọng, nhưng nó không thay thế việc chọn tốc độ học hay số vòng lặp.
- C. Dùng mô hình JumpStart mà không tinh chỉnh gì — bỏ qua đúng việc đề đang hỏi.
- D. Tự viết dò lưới bằng Python — làm được nhưng phải tự lo điều phối, chạy song song và theo dõi; đó là thứ dịch vụ đã gói sẵn.
A company uses a robotic arm to pick and place objects in a factory. The robot continuously learns through trial and error by interacting with its environment and receiving feedback based on its actions. Which machine learning paradigm is the robot using?
-
A
Supervised Learning
-
B
Unsupervised Learning
-
C
Reinforcement Learning
-
D
Semi-supervised Learning
Xem giải thích
Đáp án
C — Học tăng cường
Vì sao đúng
Đề mô tả đúng ba đặc trưng của học tăng cường: tác nhân thử và sai, tương tác với môi trường, và nhận phản hồi dạng phần thưởng. Không ai đưa cho cánh tay robot bảng đáp án "động tác đúng cho mỗi tình huống"; nó tự khám phá bằng cách hành động rồi xem kết quả tốt hay xấu.
Vì sao các phương án khác sai
- A. Học có giám sát — cần tập dữ liệu đã gán nhãn sẵn đáp án đúng.
- B. Học không giám sát — tìm cấu trúc ẩn trong dữ liệu tĩnh, không có khái niệm hành động hay phần thưởng.
- D. Học bán giám sát — kết hợp ít dữ liệu có nhãn với nhiều dữ liệu không nhãn; vẫn là học từ tập dữ liệu, không phải từ tương tác.
A telecommunications company is building a machine learning model to predict customer churn. The model requires features such as call duration, number of support tickets, and customer feedback scores. The company wants to store these features in a centralized repository for reuse across multiple models. The system also needs to provide low-latency access to features for real-time predictions while supporting batch updates for periodic model training.
Which of the following options provides the MOST effective solution for their requirements?
-
A
Store features in SageMaker Feature Store’s offline store for real-time predictions and in Amazon S3 for batch updates.
-
B
Use SageMaker Feature Store’s online store for real-time predictions and offline store for batch model training.
-
C
Store all features in Amazon RDS for batch updates and in SageMaker Feature Store’s online store for real-time predictions.
-
D
Use SageMaker Ground Truth to create labeled features and store them in SageMaker Feature Store’s offline store for real-time predictions.
Xem giải thích
Đáp án
B — Online store cho dự đoán thời gian thực, offline store cho huấn luyện
Vì sao đúng
Đây là cách Feature Store được thiết kế và cũng là lý do nó tồn tại. Online store giữ giá trị mới nhất của mỗi khách hàng, trả về theo khoá trong vài mili giây — đúng nhịp khi hệ thống đang chờ để quyết định. Offline store giữ toàn bộ lịch sử trên S3 kèm dấu thời gian, dùng để huấn luyện và phân tích.
Lợi ích lớn nhất không phải tốc độ mà là cùng một định nghĩa đặc trưng cho cả hai, nên tránh được chuyện đặc trưng lúc huấn luyện tính khác lúc chạy thật.
Vì sao các phương án khác sai
- A. Dùng offline store cho dự đoán thời gian thực — offline nằm trên S3, độ trễ hoàn toàn không hợp.
- C. Lưu trong RDS rồi mới sang Feature Store — thêm một CSDL phải vận hành mà chẳng được gì.
- D. Ground Truth để tạo đặc trưng — Ground Truth gán nhãn, không tạo đặc trưng.
A machine learning team has deployed several models using Amazon SageMaker. To ensure the models perform optimally in production, they need to monitor the models for data drift and performance degradation. Additionally, they want to track which version of the dataset and hyperparameters were used in the experiments that produced these models. Which combination of SageMaker services will help them achieve this?
-
A
SageMaker Feature Store and SageMaker Model Monitor
-
B
SageMaker Clarify and SageMaker Studio
-
C
SageMaker Experiments and SageMaker Neo
-
D
SageMaker Model Monitor and SageMaker Experiments
Xem giải thích
Đáp án
D — Model Monitor và Experiments
Vì sao đúng
Đề cần theo dõi mô hình đang chạy sản xuất và so sánh giữa các phiên bản. Model Monitor lo vế đầu: so dữ liệu thật với thống kê nền theo lịch, phát hiện trôi dữ liệu và chất lượng giảm. Experiments lo vế sau: giữ lại siêu tham số và chỉ số của từng lần huấn luyện, nên khi huấn luyện lại thì so được bản mới với bản đang chạy.
Vì sao các phương án khác sai
- A. Feature Store và Model Monitor — Model Monitor đúng, nhưng Feature Store quản đặc trưng chứ không so sánh phiên bản mô hình.
- B. Clarify và Studio — Clarify lo thiên lệch và khả năng giải thích; Studio là giao diện.
- C. Experiments và Neo — Neo biên dịch mô hình cho phần cứng đích, không giám sát gì.
When using Amazon SageMaker's automatic hyperparameter tuning, which of the following must be specified to start the tuning job? (Choose Two)
-
A
Performance metric
-
B
Batch size for model training
-
C
A fixed set of hyperparameter values
-
D
Training algorithm
-
E
Number of EC2 spot instances
Xem giải thích
Đáp án
A và D — chỉ số đánh giá, và thuật toán huấn luyện
Vì sao đúng
Một job tinh chỉnh cần biết hai điều tối thiểu: huấn luyện bằng gì (thuật toán hoặc ảnh container) và thế nào là tốt hơn (chỉ số mục tiêu cùng hướng tối ưu). Thiếu chỉ số thì dịch vụ không có cơ sở để so hai lần chạy và không biết chọn cấu hình tiếp theo ra sao.
Vì sao các phương án khác sai
- C. Một tập giá trị siêu tham số cố định — sai bản chất: bạn khai khoảng để dịch vụ dò trong đó; cố định thì chẳng còn gì để tinh chỉnh.
- B. Kích thước lô — có thể là một trong những siêu tham số cần dò, nhưng không bắt buộc.
- E. Số máy spot — tuỳ chọn tiết kiệm chi phí, không phải điều kiện để job chạy.
A data scientist is using Amazon SageMaker Data Wrangler to preprocess data for a machine learning project. The data is stored in Amazon Redshift and contains missing values. The scientist needs to handle these missing values before training a model.
Which of the following options are valid methods for handling missing values in Data Wrangler? (Choose TWO)
-
A
Impute missing values using the mean or median of the column
-
B
Use interpolation to estimate missing values based on related features
-
C
Automatically replace missing values with zeros
-
D
Use SageMaker Data Wrangler’s feature store to store missing values for later use
-
E
Drop all rows that contain missing values
Xem giải thích
Đáp án
A và B — điền bằng trung bình hoặc trung vị, và nội suy dựa trên đặc trưng liên quan
Vì sao đúng
Hai cách này giữ lại được dữ liệu thay vì vứt đi:
- A. Điền bằng trung bình hoặc trung vị — đơn giản và hiệu quả; trung vị an toàn hơn khi phân bố lệch hoặc có giá trị dị thường.
- B. Nội suy theo đặc trưng liên quan — dùng thông tin từ các cột khác hoặc từ trật tự thời gian, nên thường sát thực tế hơn một hằng số duy nhất.
Vì sao các phương án khác sai
- C. Thay hết bằng 0 — số 0 thường mang nghĩa thật trong dữ liệu (chi tiêu bằng 0 khác với không biết chi tiêu), nên cách này bịa ra thông tin sai.
- D. Lưu giá trị thiếu vào feature store — không giải quyết gì, và không phải công dụng của nó.
- E. Bỏ mọi dòng có ô trống — với dữ liệu thiếu rải rác thì có thể mất phần lớn tập dữ liệu, và nếu việc thiếu không ngẫu nhiên thì còn tạo ra thiên lệch.
A fintech company is using Amazon Kinesis Data Firehose to collect sensitive financial data, which is then stored in Amazon S3 for compliance reporting. The company is required to meet strict encryption and data integrity requirements. Which of the following steps should the company take to secure the data stream?
-
A
Store the data in Amazon S3 without any additional encryption since S3 already provides security.
-
B
Use Amazon Kinesis Data Streams instead of Firehose to ensure stronger encryption of the data.
-
C
Use AWS Shield to secure the streaming data from Distributed Denial of Service (DDoS) attacks.
-
D
Enable encryption at rest using AWS KMS for S3 and encryption in transit using HTTPS.
Xem giải thích
Đáp án
D — Bật mã hoá khi lưu bằng KMS cho S3, và mã hoá đường truyền bằng TLS
Vì sao đúng
Yêu cầu tuân thủ với dữ liệu tài chính luôn đòi bảo vệ ở cả hai trạng thái. Mã hoá khi lưu bằng KMS cho phép dùng khoá bạn kiểm soát, và mọi lần dùng khoá đều vào CloudTrail — đó là dấu vết kiểm toán. TLS bảo vệ dữ liệu trên đường từ nguồn tới Firehose và từ Firehose xuống S3.
Vì sao các phương án khác sai
- A. Dựa vào mã hoá mặc định của S3 — S3 có mã hoá mặc định, nhưng bằng khoá do AWS quản lý nên bạn không kiểm soát và không kiểm toán được việc dùng khoá; thường không đủ cho tuân thủ.
- B. Đổi sang Data Streams để mã hoá mạnh hơn — cả hai đều hỗ trợ mã hoá bằng KMS; đổi dịch vụ không cải thiện gì.
- C. AWS Shield — chống tấn công từ chối dịch vụ, không mã hoá gì.
A company wants to collaborate on an ongoing machine learning project. They need an environment where multiple team members can work on different Jupyter notebooks in a persistent workspace with shared access to project resources. Which of the following options should the company choose to meet this requirement?
-
A
Amazon EC2
-
B
Amazon SageMaker Ground Truth
-
C
Amazon SageMaker Studio
-
D
Amazon SageMaker Notebook Instances
Xem giải thích
Đáp án
C — Amazon SageMaker Studio
Vì sao đúng
Ba từ khoá trong đề — nhiều thành viên, notebook khác nhau, môi trường dùng chung — đều chỉ về Studio. Nó tổ chức theo domain và user profile: mỗi người có không gian riêng nhưng cùng nằm trong một domain có cấu hình chung, chia sẻ notebook kèm ngữ cảnh, và quản trị viên cấp quyền tập trung.
Vì sao các phương án khác sai
- D. Notebook Instances — mỗi instance là một máy riêng lẻ gắn với một người; muốn cả nhóm làm việc thì phải dựng nhiều máy rời rạc, không chia sẻ được.
- A. Amazon EC2 — phải tự cài Jupyter, tự vá, tự dựng phần phân quyền.
- B. Ground Truth — dịch vụ gán nhãn dữ liệu.
A data scientist needs to implement a custom machine learning algorithm that is not natively supported by Amazon SageMaker. They want to modularize their code to separate the model definition, training, and inference logic into distinct components, and they need to include additional Python libraries for the project.
Which of the following strategies should they follow?
-
A
Write the entire code in one Python script, and SageMaker will automatically handle dependencies without any need to modularize the code.
-
B
Use SageMaker Script Mode to modularize the code across multiple Python scripts, specifying the entry point script and including additional dependencies via a requirements.txt file.
-
C
Use SageMaker only for built-in algorithms, as it does not support custom libraries or complex modularization in Script Mode.
-
D
Build a custom Docker container from scratch, package the code, libraries, and dependencies manually, and deploy it in SageMaker.
Xem giải thích
Đáp án
B — Dùng Script Mode để tách mã ra nhiều tệp Python
Vì sao đúng
Script Mode là điểm cân bằng giữa "dùng thuật toán dựng sẵn" và "tự dựng container": bạn viết mã theo cấu trúc bình thường, khai source_dir trỏ tới cả thư mục và entry_point là tệp khởi động. SageMaker đóng gói thư mục đó vào container dựng sẵn của khung học máy tương ứng và chạy. Cài thêm thư viện thì khai trong requirements.txt.
Vì sao các phương án khác sai
- A. Nhồi hết vào một tệp — chạy được nhưng trái yêu cầu tách mã của đề.
- C. SageMaker không hỗ trợ thư viện tự chọn — sai; Script Mode sinh ra chính để hỗ trợ.
- D. Tự dựng container từ đầu — làm được nhưng nặng hơn hẳn; chỉ cần khi khung học máy bạn dùng không nằm trong danh sách container dựng sẵn.
A team of data scientists is building a recommendation system to suggest movies to users based on their previous viewing behavior and ratings. They are considering using the factorization machines algorithm in Amazon SageMaker. Why is the factorization machines algorithm particularly suited for this task?
-
A
It creates clusters of similar users and movies based on behavior.
-
B
It models interactions between features and is effective for sparse datasets, such as recommendation systems.
-
C
It identifies outliers in user behavior that may indicate anomalies in preferences.
-
D
It assigns a label to each user and movie, allowing personalized recommendations.
Xem giải thích
Đáp án
B — Nó mô hình hoá tương tác giữa các đặc trưng và hiệu quả với dữ liệu thưa
Vì sao đúng
Ma trận người dùng × phim của một hệ gợi ý cực kỳ thưa — mỗi người chỉ xem một phần rất nhỏ kho phim. Factorization Machines xử lý đúng tình huống đó: nó phân rã tương tác giữa các cặp đặc trưng thành tích của các vector ẩn, nên ước lượng được cả những cặp chưa từng xuất hiện cùng nhau trong dữ liệu. Hồi quy tuyến tính thường không làm được điều này.
Vì sao các phương án khác sai
- A. Tạo cụm người dùng và phim giống nhau — đó là phân cụm, một họ thuật toán khác.
- C. Phát hiện điểm bất thường — đó là việc của Random Cut Forest.
- D. Gán nhãn cho từng người dùng và phim — mô tả sai; nó dự đoán điểm tương tác, không gán nhãn.