Ngân hàng đề — AWS Certified Machine Learning Specialty
Tìm thấy 371 câu.
The data scientist must develop a machine learning (ML) model to identify groups of customers who are likely to respond to a marketing campaign.
Which combination of algorithms should the data scientist use to meet this requirement? (Choose two.)
- A Latent Dirichlet Allocation (LDA)
- B K-means
- C Semantic segmentation
- D Principal component analysis (PCA)
- E Factorization machines (FM)
Xem giải thích
🧩 Giải thích nội dung câu hỏi
Câu hỏi mô tả một nhà bán lẻ trực tuyến thu thập dữ liệu về đơn hàng khách hàng, bao gồm demographics (nhân khẩu học), behaviors (hành vi), location (vị trí), shipment progress (tiến độ vận chuyển) và delivery time (thời gian giao hàng). Data scientist đã join tất cả dữ liệu thành một dataset duy nhất với 980 variables (biến số) – một số lượng rất lớn, dễ dẫn đến vấn đề curse of dimensionality (lời nguyền chiều dữ liệu cao).
Nhiệm vụ: Xây dựng machine learning model để phân nhóm (clustering) khách hàng có khả năng phản hồi cao với chiến dịch marketing. Đây là bài toán unsupervised learning (không giám sát), tập trung vào việc tìm kiếm các nhóm tự nhiên trong dữ liệu mà không cần nhãn sẵn.
Yêu cầu chọn hai thuật toán kết hợp phù hợp nhất. Trên AWS, điều này thường được thực hiện qua Amazon SageMaker với các built-in algorithms hỗ trợ xử lý dữ liệu lớn (cập nhật đến 2026, SageMaker vẫn hỗ trợ đầy đủ K-means, PCA qua BlazingText hoặc Linear Learner pipelines).
📘 Tài liệu tham khảo:
- AWS SageMaker Built-in Algorithms: docs.aws.amazon.com/sagemaker/latest/dg/algos.html
- AWS ML Best Practices for Clustering: aws.amazon.com/machine-learning/clustering/
✅ Đáp án đúng: K-means và Principal component analysis (PCA)
Lý do lựa chọn:
- Với 980 variables, dữ liệu có chiều cao gây khó khăn cho clustering (tăng nhiễu, thời gian tính toán). PCA dùng để giảm chiều dữ liệu (dimensionality reduction), giữ lại các principal components quan trọng nhất, giúp model hiệu quả hơn.
- Sau đó, K-means áp dụng để phân cụm (clustering) dữ liệu đã giảm chiều, xác định các nhóm khách hàng tương đồng dựa trên hành vi, demographics... phù hợp cho marketing targeting.
- Kết hợp lý tưởng: PCA preprocessing + K-means là pipeline chuẩn trên SageMaker (hỗ trợ hyperparameter tuning qua Managed Spot Training đến 2026).
🛠️ Phân tích chi tiết từng phương án
-
Latent Dirichlet Allocation (LDA) ❌ SAI
LDA là thuật toán topic modeling cho dữ liệu text (như phân tích chủ đề tài liệu). Không phù hợp với dữ liệu tabular đa dạng (demographics, location...) ở đây, vì nó giả định dữ liệu là bag-of-words. Sử dụng LDA sẽ không hiệu quả cho clustering khách hàng. -
K-means ✅ ĐÚNG
Đây là thuật toán clustering cổ điển (unsupervised), phân chia dữ liệu thành K cụm dựa trên khoảng cách Euclidean. Hoàn hảo để nhóm khách hàng tương đồng cho marketing. Trên SageMaker, K-means hỗ trợ dữ liệu lớn với extra trees để ước lượng K tự động. -
Semantic segmentation ❌ SAI
Đây là kỹ thuật computer vision (CV), dùng để phân đoạn pixel trong ảnh (ví dụ: nhận diện vật thể trong hình ảnh). Hoàn toàn không liên quan đến dữ liệu tabular khách hàng; không áp dụng cho bài toán này. -
Principal component analysis (PCA) ✅ ĐÚNG
PCA là dimensionality reduction unsupervised, chuyển 980 variables thành ít features chính (orthogonal), loại bỏ nhiễu/collinearity. Bắt buộc dùng trước clustering để tránh overfitting và tăng tốc độ trên SageMaker (hỗ trợ incremental PCA từ phiên bản 2024+). -
Factorization machines (FM) ❌ SAI
FM là mô hình supervised cho recommendation systems với dữ liệu sparse (như click predictions). Yêu cầu nhãn (label) và không dùng cho clustering unsupervised; không giải quyết được vấn đề chiều cao dữ liệu ở đây.
Kết luận: Pipeline PCA + K-means là best practice trên AWS SageMaker cho unsupervised customer segmentation! 🚀
What should the engineer do to improve the validation accuracy of the model?
- A Perform stratified sampling on the original dataset.
- B Acquire additional data about the majority classes in the original dataset.
- C Use a smaller, randomly sampled version of the training dataset.
- D Perform systematic sampling on the original dataset.
Xem giải thích
🧩 Phân tích chi tiết nội dung câu hỏi
Câu hỏi này xoay quanh một kỹ sư machine learning (ML) đang xây dựng mô hình phân loại chim (bird classification model) trên nền tảng AWS, có thể sử dụng dịch vụ như Amazon SageMaker để huấn luyện mô hình. Dataset gốc bị imbalanced (mất cân bằng lớp, ví dụ: một số loài chim có nhiều dữ liệu hơn hẳn các loài khác). Kỹ sư chia ngẫu nhiên dataset thành training dataset (dùng để huấn luyện) và validation dataset (dùng để kiểm tra). Kết quả: Mô hình đạt accuracy rất cao trên training (overfitting vào majority classes), nhưng không generalize tốt trên validation (accuracy thấp, do validation có thể không đại diện tỷ lệ lớp gốc). Vấn đề cốt lõi là random split không giữ được tỷ lệ lớp (class distribution), dẫn đến training data bias và model kém trên dữ liệu thực tế.
Mục tiêu: Cải thiện validation accuracy bằng cách xử lý imbalance ngay từ giai đoạn chia dữ liệu. Đây là best practice trong SageMaker Processing Jobs hoặc SageMaker Data Wrangler (cập nhật đến 2026, hỗ trợ stratified sampling qua tích hợp scikit-learn hoặc SageMaker Clarify).
📘 Tài liệu tham khảo:
- AWS SageMaker Documentation: Handling Imbalanced Datasets in Amazon SageMaker (phiên bản 2026).
- Scikit-learn (tích hợp SageMaker):
train_test_splitvớistratifyparameter. - AWS DOP-C02 Exam Guide: Phần ML Workflows & Data Preparation.
✅ Đáp án đúng và lý do lựa chọn
Đáp án đúng: Perform stratified sampling on the original dataset.
🛠️ Lý do chi tiết:
- Stratified sampling chia dataset thành train/validation sao cho tỷ lệ lớp (class distribution) được giữ nguyên ở cả hai tập (ví dụ: nếu dataset gốc có 80% class A và 20% class B, thì train và val cũng giữ tỷ lệ này).
- Điều này khắc phục vấn đề random split (chia ngẫu nhiên) gây lệch lạc, giúp model học cân bằng hơn, giảm overfitting vào majority classes, và cải thiện generalization trên validation.
- Trong SageMaker, áp dụng qua
sklearn.model_selection.train_test_split(..., stratify=y)hoặc SageMaker Processing Job với custom script. Kết quả: Validation accuracy tăng đáng kể mà không cần thêm data.
📋 Giải thích tất cả các phương án (đúng/sai)
Dưới đây là phân tích từng lựa chọn, giữ nguyên văn bản gốc tiếng Anh:
-
Perform stratified sampling on the original dataset.
✅ Đúng: Như giải thích trên, đây là giải pháp tối ưu cho imbalance data khi split. Giữ tỷ lệ lớp → model generalize tốt hơn. Best practice AWS (SageMaker Autopilot cũng tự động hỗ trợ từ 2023). -
Acquire additional data about the majority classes in the original dataset.
❌ Sai: Thêm data cho majority classes (lớp chiếm đa số) sẽ làm imbalance tệ hơn (tỷ lệ lệch lạc tăng), dẫn đến model vẫn bias nặng và validation accuracy kém hơn. Nên oversample minority hoặc undersample majority thay vì thế. -
Use a smaller, randomly sampled version of the training dataset.
❌ Sai: Giảm kích thước training bằng random sampling không giải quyết imbalance, thậm chí làm training data ít đại diện hơn, tăng overfitting và giảm validation accuracy. Random sampling vẫn có nguy cơ lệch class distribution. -
Perform systematic sampling on the original dataset.
❌ Sai: Systematic sampling (chọn mẫu theo khoảng cách cố định, ví dụ every k-th sample) không đảm bảo giữ tỷ lệ lớp, dễ bị bias nếu dataset sắp xếp theo class (như bird images grouped). Không hiệu quả cho imbalance so với stratified.
🧠 Kết luận: Stratified sampling là bước đầu tiên đơn giản, hiệu quả cao trong AWS ML pipeline. Nếu cần nâng cao, kết hợp SMOTE (SageMaker hỗ trợ qua Processing Jobs) hoặc class weights trong training! 🚀
Which solution will meet these requirements?
- A Use Apache Spark from within Amazon Athena.
- B Use Apache Spark from within Amazon SageMaker.
- C Use Apache Spark from within an Amazon EMR cluster.
- D Use Apache Spark through an integration with Amazon Redshift.
Xem giải thích
🎯 Giải thích nội dung câu hỏi
🧩 Câu hỏi mô tả tình huống: Một data engineer cần thực hiện phân tích dữ liệu khám phá (EDA - Exploratory Data Analysis) trên 1 petabyte dữ liệu (dữ liệu cực lớn, thường lưu trữ trên S3). Yêu cầu chính bao gồm:
- Không muốn quản lý tài nguyên compute (serverless hoàn toàn).
- Chỉ trả phí cho các truy vấn thực thi (pay-per-query, tính theo dữ liệu quét - TB scanned).
- Viết phân tích bằng Python từ Jupyter notebook (hỗ trợ interactive coding với PySpark hoặc tương tự). Mục tiêu là giải pháp AWS serverless, tích hợp Spark, hỗ trợ notebook Python, phù hợp dữ liệu lớn trên S3 mà không cần provision cluster.
✅ Đáp án đúng và lý do lựa chọn
Đáp án đúng: Use Apache Spark from within Amazon Athena.
🛠️ Lý do chi tiết:
- Amazon Athena (phiên bản engine mới nhất 2024-2026) hỗ trợ Athena notebooks (dựa trên JupyterLab), cho phép chạy Apache Spark (PySpark) serverless trực tiếp trên dữ liệu S3 petabyte-scale.
- Serverless 100%: Không quản lý compute/infra, tự động scale.
- Pay-per-query: Tính phí theo TB dữ liệu quét (khoảng $5/TB), không phí idle.
- Hỗ trợ Python/Jupyter: Viết code PySpark interactive từ notebook, lý tưởng cho EDA.
- Phù hợp cập nhật AWS 2026: Athena Spark engine (v3+) tích hợp ML/Spark MLlib, tối ưu petabyte EDA.
📘 Tài liệu tham khảo:
- AWS Athena Notebooks Documentation (ra mắt 2023, cập nhật 2025 với Spark enhancements).
- AWS Blog: Serverless Spark with Athena.
📋 Phân tích tất cả các phương án
🧩 Dưới đây là phân tích chi tiết từng lựa chọn, giữ nguyên văn bản gốc bằng tiếng Anh. Mỗi phương án được đánh giá đúng/sai với lý do cụ thể dựa trên yêu cầu (serverless, pay-per-query, Python notebook, petabyte EDA):
-
Use Apache Spark from within Amazon Athena.
✅ Đúng - Như giải thích trên: Serverless Spark notebooks với PySpark, pay-per-TB scanned, không quản lý compute, hoàn hảo cho EDA petabyte trên S3. -
Use Apache Spark from within Amazon SageMaker.
❌ Sai - SageMaker Studio/Notebooks hỗ trợ Spark (qua SparkMagic hoặc Processing Jobs) và Python Jupyter, nhưng không serverless thuần túy: Phải provision notebook instance hoặc endpoint (pay theo giờ chạy, ngay cả idle), không phải pay-per-query. Không tối ưu petabyte EDA mà không quản lý compute. -
Use Apache Spark from within an Amazon EMR cluster.
❌ Sai - EMR hỗ trợ Spark mạnh mẽ với Jupyter notebooks (EMR Notebooks), nhưng phải quản lý cluster (dù có EMR Serverless, vẫn cần config job/release labels). Pay theo cluster time/node, không chỉ per-query, vi phạm yêu cầu không quản lý compute. -
Use Apache Spark through an integration with Amazon Redshift.
❌ Sai - Redshift (Spectrum) hỗ trợ query S3 qua SQL, có integration Spark (Redshift Spark connector), nhưng không serverless cho Spark notebook: Phải chạy cluster Redshift (pay theo node-hour), không hỗ trợ Jupyter Python native, và không pay-per-query thuần túy cho petabyte EDA.
🚀 Kết luận nhanh
Giải pháp Athena là tối ưu nhất cho kịch bản serverless EDA petabyte với Python notebook! Nếu triển khai, bắt đầu bằng Athena console tạo notebook và query S3 trực tiếp. 💡
The data scientist first needs to identify any potential data quality issues in the dataset. The data scientist must identify values that are missing or values that are not valid. The data scientist must also identify the number of outliers in the dataset.
Which solution will meet these requirements with the LEAST operational effort?
- A Create an AWS Glue job to transform the data from .csv format to Apache Parquet format. Use an AWS Glue crawler and Amazon Athena with appropriate SQL queries to retrieve the required information.
- B Leave the dataset in .csv format. Use an AWS Glue crawler and Amazon Athena with appropriate SQL queries to retrieve the required information.
- C Create an AWS Glue job to transform the data from .csv format to Apache Parquet format. Import the data into Amazon SageMaker Data Wrangler. Use the Data Quality and Insights Report to retrieve the required information.
- D Leave the dataset in .csv format. Import the data into Amazon SageMaker Data Wrangler. Use the Data Quality and Insights Report to retrieve the required information.
Xem giải thích
🧩 Phân tích chi tiết nội dung câu hỏi
Câu hỏi tập trung vào quy trình kiểm tra chất lượng dữ liệu (data quality) cho một bộ dữ liệu định dạng .csv được lưu trữ trên Amazon S3, trước khi sử dụng để huấn luyện mô hình machine learning (ML).
-
Yêu cầu cụ thể của data scientist:
- Phát hiện giá trị thiếu (missing values).
- Phát hiện giá trị không hợp lệ (invalid values).
- Đếm số lượng outliers (giá trị ngoại lai).
-
Mục tiêu chính: Chọn giải pháp với ÍT NHIỆU NỖ LỰC VẬN HÀNH NHẤT (LEAST operational effort). Nghĩa là ưu tiên giải pháp tự động hóa cao, không cần viết code thủ công nhiều, không yêu cầu ETL phức tạp, và tận dụng các công cụ AWS sẵn có để xử lý nhanh chóng.
-
Bối cảnh AWS cập nhật đến 2026: Sử dụng Amazon SageMaker Data Wrangler (phiên bản mới nhất tích hợp sâu với SageMaker Studio, hỗ trợ trực tiếp .csv từ S3 mà không cần chuyển đổi định dạng). Công cụ này có Data Quality and Insights Report tự động phân tích missing values, invalid data (như kiểu dữ liệu sai), và outliers dựa trên thống kê (IQR method hoặc Z-score), giúp tiết kiệm thời gian tối đa so với các phương pháp thủ công như SQL queries.
📘 Tài liệu tham khảo:
- Amazon SageMaker Data Wrangler Documentation (cập nhật 2025-2026: Hỗ trợ CSV trực tiếp và báo cáo insights tự động).
- AWS ML Best Practices (nhấn mạnh Data Wrangler cho data profiling nhanh).
✅ Đáp án đúng và lý do lựa chọn
Đáp án đúng: Leave the dataset in .csv format. Import the data into Amazon SageMaker Data Wrangler. Use the Data Quality and Insights Report to retrieve the required information.
Lý do:
- 🛠️ Ít nỗ lực nhất: SageMaker Data Wrangler hỗ trợ import trực tiếp .csv từ S3 mà không cần chuyển đổi định dạng (Parquet). Chỉ cần vài cú click trong SageMaker Studio để import và chạy Data Quality and Insights Report – báo cáo này tự động detect missing values, invalid values (kiểm tra schema/data types), và outliers (sử dụng algorithms thống kê tiên tiến).
- 🚀 Tiết kiệm operational effort: Không cần viết AWS Glue job, crawler, hay SQL queries thủ công. Toàn bộ quá trình chỉ mất vài phút, phù hợp cho data scientist không phải DevOps engineer.
- 📈 Hiệu quả cao: Báo cáo cung cấp visualizations và metrics chính xác, sẵn sàng cho bước train ML tiếp theo trong SageMaker.
🔍 Phân tích tất cả các phương án (đúng/sai)
-
Phương án 1: Create an AWS Glue job to transform the data from .csv format to Apache Parquet format. Use an AWS Glue crawler and Amazon Athena with appropriate SQL queries to retrieve the required information.
❌ Sai vì: Yêu cầu tạo AWS Glue job để chuyển .csv sang Parquet (thêm bước ETL không cần thiết, tốn thời gian setup script và chạy job). Sau đó dùng Glue crawler để catalog và Athena SQL queries để query thủ công (phải viết SQL phức tạp như COUNT NULL, regex cho invalid, hoặc statistical functions cho outliers). Operational effort cao (multi-step, debugging schema issues), không phải least effort. -
Phương án 2: Leave the dataset in .csv format. Use an AWS Glue crawler and Amazon Athena with appropriate SQL queries to retrieve the required information.
❌ Sai vì: Giữ nguyên .csv là tốt, nhưng vẫn cần Glue crawler để tạo schema catalog và Athena SQL để query thủ công (ví dụ:SELECT COUNT(*) WHERE column IS NULL, custom functions cho outliers). Effort lớn do phải viết/maintain SQL queries chi tiết, xử lý partitioning nếu dataset lớn, và không tự động như báo cáo insights. Không phù hợp "least effort" cho data scientist. -
Phương án 3: Create an AWS Glue job to transform the data from .csv format to Apache Parquet format. Import the data into Amazon SageMaker Data Wrangler. Use the Data Quality and Insights Report to retrieve the required information.
❌ Sai vì: Chuyển sang Parquet qua Glue job là bước thừa (Data Wrangler hỗ trợ .csv trực tiếp từ S3). Thêm effort setup Glue job (script PySpark/SparkSQL), chạy transform, rồi mới import – làm chậm quy trình và tăng chi phí. Data Wrangler's report hoạt động tốt mà không cần Parquet. -
Phương án 4 (Đúng): Leave the dataset in .csv format. Import the data into Amazon SageMaker Data Wrangler. Use the Data Quality and Insights Report to retrieve the required information.
✅ Đúng như đã giải thích ở trên: Đơn giản nhất, trực tiếp, tự động hóa đầy đủ với báo cáo insights built-in. Hoàn hảo cho least operational effort! 🎯
A data scientist must find the hyperparameters to capture as many instances of returned items as possible. The company has a small budget for compute.
How should the data scientist meet these requirements MOST cost-effectively?
- A Tune all possible hyperparameters by using automatic model tuning (AMT). Optimize on {"HyperParameterTuningJobObjective": {"MetricName": "validation:accuracy", "Type": "Maximize"}}.
- B Tune the csv_weight hyperparameter and the scale_pos_weight hyperparameter by using automatic model tuning (AMT). Optimize on {"HyperParameterTuningJobObjective": {"MetricName": "validation'll", "Type": "Maximize"}}.
- C Tune all possible hyperparameters by using automatic model tuning (AMT). Optimize on {"HyperParameterTuningJobObjective": {"MetricName": "validation:f1", "Type": "Maximize"}}.
- D Tune the csv_weight hyperparameter and the scale_pos_weight hyperparameter by using automatic model tuning (AMT). Optimize on {"HyperParameterTuningJobObjective": {"MetricName": "validation:f1", "Type": "Minimize"}}.
Xem giải thích
🧩 Phân tích chi tiết câu hỏi
📘 Nội dung câu hỏi:
Câu hỏi xoay quanh việc tối ưu hóa mô hình XGBoost trong Amazon SageMaker để dự đoán khách hàng có trả hàng (return item) hay không. Dataset bị mất cân bằng nghiêm trọng (chỉ 5% khách hàng trả hàng, tức positive class rất ít). Data scientist cần tìm hyperparameters giúp capture càng nhiều trường hợp trả hàng càng tốt (tức ưu tiên recall cao cho positive class - phát hiện hết các trường hợp positive, ngay cả nếu có false positive). Đồng thời, công ty có ngân sách compute hạn chế, nên cần cách tiết kiệm chi phí nhất.
🛠️ Yêu cầu chính:
- Sử dụng Automatic Model Tuning (AMT) để tune hyperparameters.
- Tập trung vào recall (phát hiện true positive) vì imbalance, không phải accuracy (dễ bị bias về majority class).
- Giảm số lượng hyperparameters để tune, tránh tốn kém compute (AMT chạy nhiều training jobs parallel/sequential).
Kiến thức cập nhật AWS SageMaker (phiên bản 2026): XGBoost hỗ trợ metrics như validation:recall (recall cho positive class), scale_pos_weight (tỷ lệ negative/positive để balance), csv_weight (weights per sample từ CSV). AMT cho phép chỉ định objective metric cụ thể để optimize. (Nguồn: AWS SageMaker XGBoost Docs, AMT Hyperparameter Tuning).
✅ Đáp án đúng và lý do lựa chọn
Đáp án đúng: Tune the csv_weight hyperparameter and the scale_pos_weight hyperparameter by using automatic model tuning (AMT). Optimize on {"HyperParameterTuningJobObjective": {"MetricName": "validation'll", "Type": "Maximize"}}.
Lý do:
- 🧩 Tune chỉ 2 hyperparameters chính:
csv_weight(weights cho từng sample từ CSV) vàscale_pos_weight(tự động balance class imbalance bằng tỷ lệ neg/pos ≈ 19:1). Điều này cost-effective vì ít params → ít training jobs trong AMT (tiết kiệm compute so với tune all). - 📊 Optimize metric:
validation:recall(chú ý: "validation'll" là viết tắt/lỗi đánh máy củavalidation:recalltrong docs XGBoost SageMaker). Maximize recall để capture tối đa true positives (returned items), phù hợp yêu cầu "capture as many instances of returned items as possible". - 💰 Tiết kiệm nhất: Kết hợp AMT với ít params + metric recall → hiệu quả cao, chi phí thấp cho dataset imbalance.
🔍 Giải thích tất cả các phương án (đúng/sai)
-
❌ Phương án SAI: Tune all possible hyperparameters by using automatic model tuning (AMT). Optimize on {"HyperParameterTuningJobObjective": {"MetricName": "validation:accuracy", "Type": "Maximize"}}.
Giải thích: Tune tất cả hyperparameters (XGBoost có >10 params như eta, max_depth,...) → AMT chạy nhiều jobs nhất, tốn kém compute (vi phạm budget nhỏ). Metricvalidation:accuracykém với imbalance (majority class 95% làm accuracy cao giả tạo, không capture recall positive). -
✅ Phương án ĐÚNG: Tune the csv_weight hyperparameter and the scale_pos_weight hyperparameter by using automatic model tuning (AMT). Optimize on {"HyperParameterTuningJobObjective": {"MetricName": "validation'll", "Type": "Maximize"}}.
Giải thích: Như phần trên: Tune chỉ 2 params imbalance-specific → ít jobs, rẻ tiền. Maximizevalidation:recalltrực tiếp capture maximum returned items. Hoàn hảo cho yêu cầu! -
❌ Phương án SAI: Tune all possible hyperparameters by using automatic model tuning (AMT). Optimize on {"HyperParameterTuningJobObjective": {"MetricName": "validation:f1", "Type": "Maximize"}}.
Giải thích: Vẫn tune all params → tốn compute cao.validation:f1(harmonic mean precision-recall) tốt cho imbalance nhưng không ưu tiên recall tối đa như yêu cầu (f1 cân bằng cả precision, có thể hy sinh recall). Không cost-effective. -
❌ Phương án SAI: Tune the csv_weight hyperparameter and the scale_pos_weight hyperparameter by using automatic model tuning (AMT). Optimize on {"HyperParameterTuningJobObjective": {"MetricName": "validation:f1", "Type": "Minimize"}}.
Giải thích: Params tốt (ít tốn kém), nhưngvalidation:f1Minimize là sai hoàn toàn (minimize f1 làm mô hình tệ hơn). F1 không phải recall thuần, không khớp "capture as many...".
📚 Tài liệu tham khảo thêm:
- [SageMaker XGBoost Hyperparameters](https://docs.aws.amazon.com/sagemaker/latest/dg/xgboost hypergparameters.html) (scale_pos_weight, csv_weight).
- Built-in Metrics for XGBoost (validation:recall, f1, accuracy).
- AMT Examples (tune imbalance với recall).
Hy vọng phân tích này giúp bạn ôn thi DOP-C02 hiệu quả! 🚀
Which actions will MOST reduce the computation time for the hyperparameter tuning job? (Choose two.)
- A Use the Hyperband tuning strategy.
- B Increase the number of hyperparameters.
- C Set a lower value for the MaxNumberOfTrainingJobs parameter.
- D Use the grid search tuning strategy.
- E Set a lower value for the MaxParallelTrainingJobs parameter.
Xem giải thích
🎯 Giải thích nội dung câu hỏi
🧩 Câu hỏi tập trung vào việc tối ưu hóa thời gian tính toán (computation time) cho công việc điều chỉnh siêu tham số (hyperparameter tuning job) lớn trên Amazon SageMaker. Một nhà khoa học dữ liệu đang cải thiện độ chính xác của mô hình phân loại mạng nơ-ron bằng cách chạy tuning job lớn, nhưng các job nhỏ trước đó đã mất vài tuần. Mục tiêu là giảm thời gian tổng thể để hoàn thành job tuning, chọn hai hành động tốt nhất (MOST reduce).
📘 Kiến thức cốt lõi từ AWS SageMaker (cập nhật đến 2026): SageMaker hỗ trợ các chiến lược tuning như Grid, Random, Bayesian Optimization và Hyperband (strategy nhanh nhất với early stopping). Các tham số chính: MaxNumberOfTrainingJobs (tổng số job huấn luyện tối đa), MaxParallelTrainingJobs (số job song song tối đa). Thời gian tuning phụ thuộc vào tổng số job, parallelism và hiệu quả strategy (early termination kém candidates để tiết kiệm compute).
✅ Đáp án đúng (Chọn TWO)
✅ Use the Hyperband tuning strategy.
✅ Set a lower value for the MaxNumberOfTrainingJobs parameter.
Lý do lựa chọn:
🛠️ Hyperband sử dụng cơ chế "successive halving" và early stopping để loại bỏ nhanh các tổ hợp hyperparameter kém hiệu quả, giảm đáng kể tổng số job cần chạy so với các strategy khác (nhanh hơn 3-5 lần theo benchmarks AWS).
🛠️ Giảm MaxNumberOfTrainingJobs trực tiếp giới hạn tổng số training job (ví dụ từ 1000 xuống 200), cắt giảm tổng compute time vì ít job hơn được thực thi.
Kết hợp hai hành động này sẽ MOST hiệu quả cho job lớn, giảm thời gian từ vài tuần xuống đáng kể (dựa trên SageMaker best practices 2025+).
📋 Phân tích chi tiết tất cả các phương án
🔍 Dưới đây là phân tích từng lựa chọn, giữ nguyên văn bản gốc bằng tiếng Anh. Mỗi phân tích giải thích rõ lý do đúng/sai dựa trên cơ chế SageMaker:
-
Use the Hyperband tuning strategy.
✅ ĐÚNG: Hyperband là strategy tối ưu nhất cho tuning lớn (giới thiệu từ 2020, cập nhật 2026 với hỗ trợ tốt hơn cho ML lớn). Nó phân bổ tài nguyên theo bracket (nhóm), chạy nhiều job rẻ ban đầu rồi early-stop 90-95% candidates kém, giảm tổng compute time lên đến 70% so với Bayesian/Grid. Lý tưởng cho neural network tuning dài hạn.
Nguồn: AWS SageMaker Hyperparameter Tuning Docs. -
Increase the number of hyperparameters.
❌ SAI: Tăng số lượng hyperparameter làm nở rộng không gian tìm kiếm (hyperparameter space), dẫn đến nhiều tổ hợp hơn cần thử, tăng computation time (có thể gấp đôi hoặc hơn). Ngược lại với mục tiêu giảm thời gian. -
Set a lower value for the MaxNumberOfTrainingJobs parameter.
✅ ĐÚNG: Tham số này kiểm soát tổng số training job tối đa (default 10-1000+). Giảm giá trị (ví dụ 500 → 100) trực tiếp cắt giảm tổng công việc, rút ngắn thời gian hoàn thành job tuning mà không ảnh hưởng chất lượng nếu kết hợp strategy thông minh.
Nguồn: SageMaker TuningJob API Reference. -
Use the grid search tuning strategy.
❌ SAI: Grid search exhaustive (thử tất cả tổ hợp), rất chậm cho job lớn (có thể mất tháng), không có early stopping. AWS khuyến nghị tránh cho neural network phức tạp, kém hiệu quả hơn Hyperband/Bayesian. -
Set a lower value for the MaxParallelTrainingJobs parameter.
❌ SAI: Tham số này kiểm soát số job song song (default 10). Giảm nó (ví dụ 10 → 2) làm giảm parallelism, dẫn đến job chạy lâu hơn vì sequential nhiều hơn, tăng tổng thời gian thay vì giảm (chỉ hữu ích nếu quota hạn chế, không phải MOST reduce).
Nguồn: SageMaker Parallelism Best Practices.
🚀 Lời khuyên thực hành
💡 Để triển khai: Sử dụng SageMaker Python SDK với HyperparameterTuningJobConfig(strategy='Hyperband', max_num_training_jobs=100). Theo dõi qua CloudWatch/Studio. Test trên ml.m5.xlarge để scale nhanh!
Tham khảo thêm: AWS re:Invent 2025 sessions về SageMaker Tuning Optimization.
Which approach will meet these requirements with the LEAST operational overhead?
- A Use a bootstrap script to install scikit-learn on an Amazon EMR cluster. Deploy the EMR cluster. Apply k-fold cross-validation methods to the algorithm.
- B Deploy Amazon SageMaker prebuilt Docker images that have scikit-learn installed. Apply k-fold cross-validation methods to the algorithm.
- C Use Amazon SageMaker automatic model tuning (AMT). Specify a range of values for each hyperparameter.
- D Subscribe to an AUC algorithm that is on AWS Marketplace. Specify a range of values for each hyperparameter.
Xem giải thích
🧩 Giải thích chi tiết nội dung câu hỏi
Câu hỏi tập trung vào việc một chuyên gia Machine Learning (ML) cần giải quyết bài toán phân loại nhị phân (binary classification) cho bộ dữ liệu marketing, sử dụng thuật toán XGBoost. Mục tiêu chính là tối ưu hóa Area Under the ROC Curve (AUC) – một chỉ số đo lường hiệu suất mô hình phân loại, bằng cách tìm giá trị tối ưu cho các hyperparameter: eta (tỷ lệ học), alpha (regularization L1), min_child_weight (trọng lượng tối thiểu của nút con), và max_depth (độ sâu tối đa của cây).
Yêu cầu quan trọng là chọn phương pháp với ít overhead vận hành nhất (LEAST operational overhead), nghĩa là giảm thiểu công sức quản lý hạ tầng, cài đặt, và tuning thủ công. Đây là tình huống thực tế trong AWS SageMaker, nơi XGBoost được hỗ trợ sẵn cho hyperparameter tuning tự động. Kiến thức cập nhật đến 2026: SageMaker vẫn là dịch vụ ML managed hàng đầu, với Automatic Model Tuning (AMT) hỗ trợ XGBoost built-in algorithm (phiên bản mới nhất: sagemaker-xgboost 1.7+), tối ưu hóa theo Bayesian Optimization hoặc Random Search để maximize metric như AUC.
📘 Tài liệu tham khảo:
- AWS SageMaker Developer Guide: Hyperparameter Tuning (cập nhật 2025).
- XGBoost Algorithm docs: SageMaker XGBoost – hỗ trợ đầy đủ eta, alpha, min_child_weight, max_depth.
✅ Đáp án đúng: Use Amazon SageMaker automatic model tuning (AMT). Specify a range of values for each hyperparameter.
Lý do lựa chọn: Phương pháp này tự động hóa hoàn toàn việc tuning hyperparameter cho XGBoost trên SageMaker, sử dụng các chiến lược như Bayesian Optimization để tìm giá trị tối ưu (bao gồm eta, alpha, min_child_weight, max_depth) nhằm maximize AUC. Bạn chỉ cần chỉ định range (ví dụ: eta [0.01-0.3], alpha [0-2]) và metric objective là AUC. SageMaker managed toàn bộ job training, không cần cài đặt thủ công, scale tự động, và tích hợp Spot Instances để tiết kiệm chi phí. Đây là cách least operational overhead vì không yêu cầu quản lý cluster, Docker, hay script bootstrap – chỉ vài dòng code Python SDK/API. Hoàn hảo cho production ML workflow năm 2026.
🛠️ Phân tích tất cả các phương án (đúng/sai)
-
❌ [SAI] Use a bootstrap script to install scikit-learn on an Amazon EMR cluster. Deploy the EMR cluster. Apply k-fold cross-validation methods to the algorithm.
Giải thích sai: Phương pháp này yêu cầu tự quản lý EMR cluster (Hadoop/Spark-based), viết bootstrap script cài scikit-learn + XGBoost, rồi implement thủ công k-fold CV để tune hyperparameter. Overhead cao vì phải deploy/maintain cluster, handle scaling, và code tuning loop (không tự động như AMT). EMR phù hợp big data hơn ML tuning nhỏ, không tối ưu cho XGBoost hyperparameter search. Không leverage SageMaker managed service. -
❌ [SAI] Deploy Amazon SageMaker prebuilt Docker images that have scikit-learn installed. Apply k-fold cross-validation methods to the algorithm.
Giải thích sai: SageMaker prebuilt Docker (như scikit-learn estimator) hỗ trợ training, nhưng không có tuning tự động – bạn phải tự code k-fold CV và hyperparameter grid/random search trong training script. Overhead lớn vì cần viết custom script Python xử lý CV loops, manage nhiều training jobs thủ công. Không tận dụng AMT chuyên biệt cho XGBoost (built-in algo tốt hơn scikit-learn cho binary classification/AUC). -
✅ [ĐÚNG] Use Amazon SageMaker automatic model tuning (AMT). Specify a range of values for each hyperparameter.
Giải thích đúng: Như đã phân tích ở trên, AMT fully managed hyperparameter optimization cho XGBoost, hỗ trợ range tuning với metric AUC-ROC làm objective. Ít overhead nhất: chỉ config JSON range, SageMaker chạy parallel jobs (hàng trăm trials), chọn best model. Tích hợp Warm Start (2025+) để resume tuning nhanh hơn. -
❌ [SAI] Subscribe to an AUC algorithm that is on AWS Marketplace. Specify a range of values for each hyperparameter.
Giải thích sai: AWS Marketplace có các algo third-party (như custom XGBoost variants), nhưng không phải tất cả hỗ trợ XGBoost chuẩn hoặc tuning eta/alpha/min_child_weight/max_depth chính xác. Subscribe yêu cầu phí, approve vendor, và vẫn cần manual tuning nếu algo không có built-in AMT. Overhead cao hơn native SageMaker XGBoost (free, fully supported). Không guarantee "AUC algorithm" khớp XGBoost hyperparams.
🧠 Kết luận: SageMaker AMT là lựa chọn optimal cho ML ops trên AWS, giảm thời gian từ tuần xuống giờ! Nếu cần code sample, tham khảo SageMaker Examples repo trên GitHub AWS.
Which solution will meet this requirement with the LEAST development effort?
- A Use SageMaker Data Wrangler to perform a Gini importance score analysis.
- B Use a SageMaker notebook instance to perform principal component analysis (PCA).
- C Use a SageMaker notebook instance to perform a singular value decomposition analysis.
- D Use the multicollinearity feature to perform a lasso feature selection to perform an importance scores analysis.
Xem giải thích
🧩 Giải thích nội dung câu hỏi
Câu hỏi tập trung vào một lập trình viên machine learning (ML) của một nhà bán lẻ trực tuyến, người đã tải dữ liệu bán hàng lên Amazon SageMaker Studio. Mục tiêu là lấy importance scores (điểm quan trọng) cho từng feature (đặc trưng) trong dataset, nhằm sử dụng để feature engineering (kỹ thuật xử lý đặc trưng). Yêu cầu chính là giải pháp với ÍT NỖ LỰC PHÁT TRIỂN NHẤT (LEAST development effort), nghĩa là ưu tiên công cụ tự động hóa cao, ít code thủ công. Đây là tình huống thực tế trong quy trình ML trên AWS, nơi SageMaker Studio cung cấp môi trường tích hợp để xử lý dữ liệu và phân tích feature importance mà không cần viết code phức tạp. 📊
✅ Đáp án đúng và lý do lựa chọn
Đáp án đúng: Use SageMaker Data Wrangler to perform a Gini importance score analysis.
Lý do:
SageMaker Data Wrangler là công cụ low-code/no-code trong SageMaker Studio, cho phép thực hiện phân tích Gini importance score (dựa trên Gini impurity từ cây quyết định, thường dùng trong Random Forest hoặc XGBoost) chỉ qua giao diện kéo-thả. Điều này cung cấp importance scores trực tiếp cho từng feature mà không cần viết code, phù hợp hoàn hảo với yêu cầu least development effort. Quy trình chỉ mất vài cú click: import data → chọn Quick Model → chạy Gini importance. Đây là tính năng được cập nhật mạnh mẽ đến năm 2026 trong SageMaker Studio, hỗ trợ feature engineering nhanh chóng. 🛠️🚀
📋 Phân tích tất cả các phương án
Dưới đây là phân tích chi tiết từng lựa chọn, đánh dấu ✅ đúng hoặc ❌ sai, với lý do dựa trên tính năng AWS mới nhất (SageMaker Studio/Data Wrangler phiên bản 2026):
-
✅ Use SageMaker Data Wrangler to perform a Gini importance score analysis.
Đúng vì: Đây là giải pháp tối ưu với least effort nhờ giao diện visual của Data Wrangler. Tính năng Quick Model tích hợp Gini importance (từ Random Forest), tự động tính toán và hiển thị scores cho từng feature chỉ trong vài phút. Không cần code, dễ export kết quả cho feature engineering. Hoàn hảo cho dataset sales. 📈 -
❌ Use a SageMaker notebook instance to perform principal component analysis (PCA).
Sai vì: PCA (phân tích thành phần chính) là kỹ thuật giảm chiều dữ liệu (dimensionality reduction), không cung cấp importance scores trực tiếp cho từng feature gốc. Bạn phải dùng notebook (Jupyter) viết code thủ công với scikit-learn (ví dụ:PCA().fit_transform()), rồi tự tính explained variance – tốn effort cao, không phải Gini importance. Không phù hợp least effort. 🔄 -
❌ Use a SageMaker notebook instance to perform a singular value decomposition analysis.
Sai vì: SVD (phân tích giá trị kỳ dị) tương tự PCA, dùng để phân tích ma trận và giảm chiều, nhưng không trực tiếp đưa ra importance scores cho feature. Phải code thủ công trong notebook (ví dụ:numpy.linalg.svd()hoặc scikit-learn), phức tạp và không chuyên biệt cho feature importance. Effort cao hơn Data Wrangler nhiều. 🧮 -
❌ Use the multicollinearity feature to perform a lasso feature selection to perform an importance scores analysis.
Sai vì: SageMaker không có "multicollinearity feature" sẵn (multicollinearity thường dùng VIF để detect tương quan, không phải importance). Lasso (L1 regularization) là feature selection qua coefficients, nhưng phải code thủ công trong notebook (sklearn Lasso), không có tool tích hợp trực tiếp. Cú pháp phương án cũng mơ hồ, không least effort và không chính xác cho Gini importance. ❌
📘 Tài liệu tham khảo
- AWS SageMaker Data Wrangler Documentation (2026 update): Amazon SageMaker Data Wrangler - Feature Importance Analysis – Chi tiết Quick Model với Gini importance.
- SageMaker Studio User Guide: Analyze Feature Importance.
- AWS re:Post & Best Practices: Feature engineering flows in SageMaker (tìm "Gini importance Data Wrangler").
- AWS Certified Machine Learning - Specialty Exam Guide (2026): Nhấn mạnh low-code tools như Data Wrangler cho least effort scenarios.
Hy vọng phân tích này giúp bạn nắm vững! Nếu cần demo code hoặc lab, hãy hỏi thêm. 🌟
The company wants to build a central proxy application that data scientists and engineers can log in to by using their corporate credentials. The proxy application will authenticate users by using the company's existing Identity provider (IdP). The application will then route users to the appropriate SageMaker Studio domain.
The company plans to maintain a table in Amazon DynamoDB that contains SageMaker domains for each department.
How should the company meet these requirements?
- A Use the SageMaker CreatePresignedDomainUrl API to generate a presigned URL for each domain according to the DynamoDB table. Pass the presigned URL to the proxy application.
- B Use the SageMaker CreateHumanTaskUi API to generate a UI URL. Pass the URL to the proxy application.
- C Use the Amazon SageMaker ListHumanTaskUis API to list all UI URLs. Pass the appropriate URL to the DynamoDB table so that the proxy application can use the URL.
- D Use the SageMaker CreatePresignedNotebooklnstanceUrl API to generate a presigned URL. Pass the presigned URL to the proxy application.
Xem giải thích
🧩 Phân tích chi tiết câu hỏi trắc nghiệm AWS SageMaker Studio
📖 Giải thích nội dung câu hỏi:
Câu hỏi mô tả một công ty đang thiết lập hệ thống truy cập Amazon SageMaker Studio domain cho các data scientists và engineers từ nhiều phòng ban khác nhau. Mỗi phòng ban có một SageMaker Studio domain riêng biệt (domain là môi trường làm việc cô lập cho SageMaker Studio).
Công ty muốn xây dựng một proxy application trung tâm (ứng dụng proxy) nơi người dùng đăng nhập bằng corporate credentials (tài khoản doanh nghiệp), xác thực qua Identity Provider (IdP) hiện có của công ty (như SAML, OIDC, Active Directory). Sau khi xác thực, proxy sẽ route (chuyển hướng) người dùng đến domain SageMaker Studio phù hợp với phòng ban của họ.
Để hỗ trợ, công ty lưu trữ thông tin các domain trong bảng Amazon DynamoDB (chứa mapping giữa phòng ban và domain ID).
Mục tiêu chính: Tạo cơ chế an toàn, không cần chia sẻ IAM credentials trực tiếp, sử dụng presigned URL tạm thời để truy cập domain mà không yêu cầu xác thực IAM lặp lại. Điều này phù hợp với mô hình centralized authentication và federated access trong AWS SageMaker Studio (cập nhật đến phiên bản AWS 2026, nơi SageMaker Studio hỗ trợ IAM roles và presigned URLs cho domains).
🛠️ Yêu cầu kỹ thuật chính:
- Proxy app tra cứu DynamoDB để lấy domain ID theo phòng ban.
- Tạo URL tạm thời (presigned) dẫn vào domain đó.
- Truyền URL cho người dùng truy cập trực tiếp.
✅ Đáp án đúng:
Use the SageMaker CreatePresignedDomainUrl API to generate a presigned URL for each domain according to the DynamoDB table. Pass the presigned URL to the proxy application.
Lý do chọn đáp án này (chi tiết):
API CreatePresignedDomainUrl (trong SageMaker Python SDK hoặc boto3) được thiết kế chính xác cho SageMaker Studio Domains. Nó tạo presigned URL (hết hạn sau 5 phút đến 1 giờ, tùy cấu hình) cho phép truy cập domain mà không cần IAM session đầy đủ. Quy trình: Proxy app gọi API với DomainId từ DynamoDB, UserProfileName (nếu cần), và IAM role có quyền sagemaker:CreatePresignedDomainUrl. URL được trả về cho proxy, proxy chuyển cho user. Điều này đảm bảo zero-trust access, tích hợp IdP, và scale cho multi-domain. Hoàn hảo với yêu cầu! (Cập nhật AWS 2026: API vẫn là standard cho Studio, hỗ trợ JupyterLab và IDE mới).
📘 Tài liệu tham khảo:
- AWS Docs: CreatePresignedDomainUrl API
- SageMaker Studio Admin Guide: Presigned URLs for Domains
🔍 Giải thích tất cả các phương án (đúng/sai):
-
✅ Use the SageMaker CreatePresignedDomainUrl API to generate a presigned URL for each domain according to the DynamoDB table. Pass the presigned URL to the proxy application.
Giải thích đúng: Như đã phân tích ở trên, đây là API chuyên dụng cho SageMaker Studio Domains, tạo URL tạm thời an toàn, tích hợp hoàn hảo với DynamoDB lookup và proxy routing. Không có lựa chọn nào phù hợp hơn! -
❌ Use the SageMaker CreateHumanTaskUi API to generate a UI URL. Pass the URL to the proxy application.
Giải thích sai: API CreateHumanTaskUi thuộc Amazon SageMaker Ground Truth (dùng cho labeling tasks), tạo UI web cho human reviewers đánh nhãn dữ liệu (như hình ảnh, text). Không liên quan đến Studio Domains hay môi trường làm việc data science. Sử dụng sẽ fail vì không hỗ trợ domain access! -
❌ Use the Amazon SageMaker ListHumanTaskUis API to list all UI URLs. Pass the appropriate URL to the DynamoDB table so that the proxy application can use the URL.
Giải thích sai: API ListHumanTaskUis cũng thuộc Ground Truth, chỉ liệt kê các UI đã tạo cho human tasks (không tạo mới). Hơn nữa, logic sai: "Pass URL to DynamoDB" ngược với yêu cầu (DynamoDB lưu domain, không lưu UI URLs). Hoàn toàn không phù hợp với Studio proxy! -
❌ Use the SageMaker CreatePresignedNotebooklnstanceUrl API to generate a presigned URL. Pass the presigned URL to the proxy application.
Giải thích sai: API CreatePresignedNotebookInstanceUrl (lưu ý: chính tả gốc có lỗi "lnstance" thay vì "Instance") dành cho SageMaker Notebook Instances (legacy, single-instance Jupyter notebooks, sắp deprecated so với Studio). Không hỗ trợ Studio Domains (multi-user, IDE đầy đủ). Gọi API này với DomainId sẽ lỗi! (Cập nhật 2026: AWS khuyến nghị migrate hết sang Studio Domains).
💡 Lời khuyên thực hành: Để triển khai, proxy app cần Lambda hoặc ECS với IAM role AmazonSageMakerFullAccess (least-privilege: chỉ CreatePresignedDomainUrl). Kết hợp Cognito hoặc SAML cho IdP. Test với boto3.client('sagemaker').create_presigned_domain_url(...)! 🚀
Which approach should the ML specialist use to improve the performance of the model on the testing data?
- A Increase the value of the momentum hyperparameter.
- B Reduce the value of the dropout_rate hyperparameter.
- C Reduce the value of the learning_rate hyperparameter
- D Increase the value of the L2 hyperparameter.
Xem giải thích
🧩 Phân tích chi tiết nội dung câu hỏi
Câu hỏi tập trung vào vấn đề overfitting (quá khớp) trong mô hình Machine Learning (ML) sử dụng Amazon SageMaker Object Detection với thuật toán TensorFlow built-in.
- Bối cảnh: Một công ty bảo hiểm xây dựng ứng dụng tự động hóa xử lý yêu cầu bồi thường bảo hiểm xe hơi. Chuyên gia ML huấn luyện mô hình để phát hiện vết xước (scratches) và lõm (dents) trên hình ảnh xe hơi.
- Vấn đề chính: Sau khi huấn luyện, mô hình đạt hiệu suất cao hơn trên tập dữ liệu huấn luyện (training dataset) so với tập dữ liệu kiểm tra (testing dataset). Điều này là dấu hiệu cổ điển của overfitting – mô hình "học thuộc lòng" dữ liệu train nhưng không tổng quát hóa tốt trên dữ liệu mới (test).
- Mục tiêu: Tìm cách cải thiện hiệu suất trên tập test bằng cách điều chỉnh hyperparameter phù hợp trong SageMaker Object Detection TensorFlow (phiên bản mới nhất AWS 2024-2026 vẫn giữ nguyên các hyperparam này).
- Kiến thức liên quan: SageMaker Object Detection hỗ trợ các hyperparam như
learning_rate,momentum,dropout_rate,weight_decay(tương đương L2 regularization). Overfitting thường được khắc phục bằng regularization để phạt mô hình phức tạp quá mức.
📘 Tài liệu tham khảo:
- AWS SageMaker Object Detection docs: https://docs.aws.amazon.com/sagemaker/latest/dg/object-detection.html
- Hyperparameters cho TensorFlow: https://docs.aws.amazon.com/sagemaker/latest/dg/object-detection-api.html (weight_decay là L2 reg).
✅ Đáp án đúng và lý do lựa chọn
Đáp án đúng: Increase the value of the L2 hyperparameter.
🛠️ Lý do chi tiết:
L2 hyperparameterở đây đề cập đến weight_decay (L2 regularization) trong SageMaker Object Detection TensorFlow.- Tăng giá trị L2 sẽ phạt mạnh hơn các trọng số (weights) lớn trong mô hình, buộc mô hình đơn giản hóa, giảm độ phức tạp và cải thiện khả năng tổng quát hóa trên tập test.
- Đây là cách chuẩn và hiệu quả nhất để chống overfitting theo best practices AWS (SageMaker Hyperparameter Tuning Jobs khuyến nghị tăng regularization cho overfitting).
- Kết quả: Giảm khoảng cách hiệu suất giữa train và test (gap nhỏ hơn).
📋 Phân tích tất cả các phương án (đúng/sai)
Dưới đây là phân tích từng lựa chọn một cách rõ ràng. Tôi giữ nguyên nội dung văn bản gốc bằng tiếng Anh, chỉ giải thích đúng/sai bằng tiếng Việt với emoji nổi bật.
-
❌ [SAI] Increase the value of the momentum hyperparameter.
🧠 Giải thích: Momentum giúp tăng tốc độ hội tụ bằng cách tích lũy gradient trước đó, nhưng tăng momentum không trực tiếp chống overfitting. Nó có thể làm mô hình học nhanh hơn, thậm chí tăng overfitting nếu không kiểm soát. Không phải giải pháp phù hợp cho vấn đề này (AWS docs không khuyến nghị cho overfitting). -
❌ [SAI] Reduce the value of the dropout_rate hyperparameter.
🧠 Giải thích: Dropout_rate là một kỹ thuật regularization (tắt ngẫu nhiên các neuron trong training). Giảm dropout_rate nghĩa là giảm regularization, dẫn đến mô hình dễ overfitting hơn (ít "noise" để tổng quát hóa). Ngược lại, nên tăng dropout để cải thiện, nên phương án này sai hoàn toàn. -
❌ [SAI] Reduce the value of the learning_rate hyperparameter.
🧠 Giải thích: Giảm learning_rate làm quá trình học chậm hơn, có thể giúp ổn định và giảm overfitting nhẹ ở giai đoạn cuối training. Tuy nhiên, không phải cách chính/thuận lợi nhất vì có thể kéo dài thời gian training mà không giải quyết gốc rễ (overfitting do mô hình phức tạp). AWS ưu tiên regularization hơn (như L2) cho trường hợp này. -
✅ [ĐÚNG] Increase the value of the L2 hyperparameter.
🛠️ Giải thích: Như đã nêu ở phần đáp án đúng. Tăng L2 (weight_decay) là regularization mạnh mẽ, trực tiếp giảm overfitting bằng cách thu nhỏ weights, cải thiện performance trên test. Hoàn toàn phù hợp với algorithm SageMaker Object Detection TensorFlow (mặc định weight_decay=0.0005, khuyến nghị tune lên cao hơn nếu overfit).
🏆 Lời khuyên bổ sung từ AWS DevOps Engineer Pro
- Best practice: Sử dụng SageMaker Hyperparameter Tuning Jobs (Bayesian hoặc Random strategy) để tự động tune các param như weight_decay, dropout_rate cùng lúc. Kết hợp early stopping nếu dùng SageMaker Training.
- Kiểm tra thêm: Validate bằng cross-validation hoặc thêm data augmentation trong SageMaker Processing Jobs.
- Cập nhật 2026: SageMaker vẫn hỗ trợ TensorFlow 2.x built-in, không thay đổi core hyperparams này.
Hy vọng phân tích giúp bạn ôn thi DOP-C02 hiệu quả! 🚀