Ngân hàng đề — AWS Certified Machine Learning Specialty

Tìm thấy 371 câu.

Câu 81
A trucking company is collecting live image data from its fleet of trucks across the globe. The data is growing rapidly and approximately 100 GB of new data is generated every day. The company wants to explore machine learning uses cases while ensuring the data is only accessible to specific IAM users.
Which storage option provides the most processing flexibility and will allow access control with IAM?
  1. A Use a database, such as Amazon DynamoDB, to store the images, and set the IAM policies to restrict access to only the desired IAM users.
  2. B Use an Amazon S3-backed data lake to store the raw images, and set up the permissions using bucket policies.
  3. C Setup up Amazon EMR with Hadoop Distributed File System (HDFS) to store the files, and restrict access to the EMR instances using IAM policies.
  4. D Configure Amazon EFS with IAM policies to make the data available to Amazon EC2 instances owned by the IAM users.
Xem giải thích

🧩 Phân tích chi tiết nội dung câu hỏi

Câu hỏi xoay quanh một công ty vận tải thu thập dữ liệu hình ảnh thời gian thực (live image data) từ đội xe tải trên toàn cầu, với lượng dữ liệu tăng nhanh khoảng 100 GB mới mỗi ngày. Họ muốn khám phá các use case Machine Learning (ML) trên dữ liệu này, đồng thời đảm bảo dữ liệu chỉ accessible bởi các IAM users cụ thể.

Yêu cầu chính là chọn storage option mang lại processing flexibility cao nhất (linh hoạt xử lý dữ liệu cho ML, analytics, etc.) và hỗ trợ access control qua IAM (chính sách quyền truy cập chi tiết).

🛠️ Yếu tố then chốt cần xem xét:

  • Quy mô dữ liệu: Unstructured data (hình ảnh) lớn, tăng trưởng nhanh → cần storage scalable, cost-effective, không giới hạn kích thước.
  • Processing flexibility: Hỗ trợ tích hợp với ML tools (như Amazon SageMaker, Athena, Glue), batch/real-time processing, serverless querying.
  • Access control: IAM policies, bucket policies để granular control (user/group/role-based).
  • Kiến thức cập nhật 2026: AWS khuyến nghị S3-based data lakes cho dữ liệu lớn unstructured (theo AWS Well-Architected Framework for Data Analytics, phiên bản mới nhất), hỗ trợ S3 Intelligent-Tiering, S3 Express One Zone cho ML workloads cao tốc.

📘 Tài liệu tham khảo:

✅ Đáp án đúng và lý do lựa chọn

Use an Amazon S3-backed data lake to store the raw images, and set up the permissions using bucket policies.

🧩 Lý do chọn đáp án này:

  • Processing flexibility tối ưu: S3 là nền tảng cho data lake (lưu trữ raw/unstructured data như images), hỗ trợ serverless processing với Athena (query SQL), Glue (ETL), SageMaker (ML training/endpoints), EMR/Spark. Dễ scale cho 100GB/ngày mà không cần quản lý infra. Tích hợp EventBridge/Lambda cho real-time ingestion.
  • Access control IAM hoàn hảo: Bucket policies + IAM policies cho fine-grained control (allow/deny per user/role, conditions như IP/VPC). S3 Access Points (mới 2025) tăng flexibility cho multi-tenant.
  • Phù hợp nhất: Chi phí thấp, durable (99.999999999%), global replication. Lý tưởng cho ML exploration mà không lock-in format.

❌ Phân tích tất cả các phương án

  • Use a database, such as Amazon DynamoDB, to store the images, and set the IAM policies to restrict access to only the desired IAM users.
    ❌ Sai vì: DynamoDB là NoSQL database cho structured/semi-structured data (JSON, key-value), không phù hợp lưu images lớn/unstructured (giới hạn item 400KB, chi phí cao cho binary data). Không flexible cho ML (khó query raw images), dù IAM policies hoạt động nhưng storage không scale cho 100GB/ngày. AWS khuyến nghị S3/DynamoDB riêng biệt.

  • Use an Amazon S3-backed data lake to store the raw images, and set up the permissions using bucket policies.
    ✅ Đúng như đã giải thích trên – Tối ưu flexibility và IAM control.

  • Setup up Amazon EMR with Hadoop Distributed File System (HDFS) to store the files, and restrict access to the EMR instances using IAM policies.
    ❌ Sai vì: EMR dùng HDFS (ephemeral, cluster-local storage), không persistent khi cluster terminate → mất data, không phù hợp data lake dài hạn. Processing flexibility kém hơn S3 (phải manage clusters), IAM chỉ control instances chứ không granular như S3 bucket policies. EMR thường dùng S3 làm persistent storage (theo best practice 2026).

  • Configure Amazon EFS with IAM policies to make the data available to Amazon EC2 instances owned by the IAM users.
    ❌ Sai vì: EFS là file system NFS cho EC2 (shared access), không flexible cho ML/data lake (provisioned throughput, chi phí cao cho 100GB/ngày, không serverless query như S3). IAM roles cho EC2 mount EFS, nhưng access control kém (không bucket-level policies chi tiết), yêu cầu manage EC2 instances. AWS ưu tiên EFS cho traditional file workloads, không phải big data/ML.

🛠️ Kết luận: S3 data lake là lựa chọn DevOps-best practice cho scalability, cost, và security trong môi trường ML-heavy! 🚀

Câu 82
A credit card company wants to build a credit scoring model to help predict whether a new credit card applicant will default on a credit card payment. The company has collected data from a large number of sources with thousands of raw attributes. Early experiments to train a classification model revealed that many attributes are highly correlated, the large number of features slows down the training speed significantly, and that there are some overfitting issues.
The Data Scientist on this project would like to speed up the model training time without losing a lot of information from the original dataset.
Which feature engineering technique should the Data Scientist use to meet the objectives?
  1. A Run self-correlation on all features and remove highly correlated features
  2. B Normalize all numerical values to be between 0 and 1
  3. C Use an autoencoder or principal component analysis (PCA) to replace original features with new features
  4. D Cluster raw data using k-means and use sample data from each cluster to build a new dataset
Xem giải thích

🧩 Phân tích nội dung câu hỏi

Câu hỏi xoay quanh một công ty thẻ tín dụng đang xây dựng mô hình chấm điểm tín dụng (credit scoring model) để dự đoán xem ứng viên xin thẻ tín dụng mới có vỡ nợ (default) hay không. Họ có dữ liệu từ nhiều nguồn với hàng ngàn thuộc tính thô (raw attributes). Các thử nghiệm ban đầu cho thấy:

  • Nhiều thuộc tính tương quan cao (highly correlated) với nhau.
  • Số lượng features lớn làm chậm tốc độ huấn luyện (training speed) đáng kể.
  • Có vấn đề overfitting (mô hình học quá kỹ dữ liệu train, kém tổng quát hóa).

Mục tiêu của Data Scientist: Tăng tốc thời gian huấn luyện mô hình mà không mất nhiều thông tin từ dữ liệu gốc. Đây là vấn đề feature engineering điển hình trong Amazon SageMaker hoặc các dịch vụ ML trên AWS, nơi cần giảm chiều dữ liệu (dimensionality reduction) để xử lý dữ liệu lớn, giảm multicollinearity và overfitting. Kỹ thuật phù hợp phải giữ lại hầu hết thông tin chính (variance) từ features gốc.

✅ Đáp án đúng và lý do lựa chọn

Đáp án đúng: Use an autoencoder or principal component analysis (PCA) to replace original features with new features

Lý do:

  • PCA và Autoencoder là các kỹ thuật giảm chiều dữ liệu (dimensionality reduction) mạnh mẽ, giúp thay thế hàng ngàn features gốc bằng số lượng features mới ít hơn nhưng vẫn giữ lại phần lớn thông tin (variance cao nhất).
  • PCA loại bỏ tương quan bằng cách chuyển sang principal components (các thành phần chính độc lập tuyến tính), giảm overfitting và tăng tốc training (vì ít features hơn).
  • Autoencoder (mạng neural) học biểu diễn nén dữ liệu, hiệu quả với dữ liệu phi tuyến tính.
  • Trong AWS SageMaker (phiên bản mới nhất 2024-2026), bạn có thể dùng SageMaker Processing Job hoặc SageMaker Canvas để áp dụng PCA/Autoencoder qua scikit-learn hoặc built-in algorithms, phù hợp với dữ liệu lớn mà không mất thông tin đáng kể (giữ 95-99% variance).
  • Điều này trực tiếp giải quyết tất cả vấn đề: tương quan cao ✅, chậm training ✅, overfitting ✅, giữ thông tin ✅.

📋 Phân tích chi tiết tất cả các phương án

  • ❌ Run self-correlation on all features and remove highly correlated features
    Phương án này chỉ loại bỏ features tương quan cao (ví dụ threshold >0.9), giúp giảm multicollinearity một phần nhưng không giảm đáng kể số lượng features (vẫn còn hàng ngàn), nên training vẫn chậm. Hơn nữa, việc loại bỏ có thể mất thông tin quan trọng vì tương quan không phải lúc nào cũng thừa (có thể bổ trợ lẫn nhau). Không giải quyết overfitting toàn diện và kém hiệu quả với dữ liệu lớn so với PCA.

  • ❌ Normalize all numerical values to be between 0 and 1
    Normalization (Min-Max scaling) chỉ chuẩn hóa giá trị features về khoảng [0,1] để tránh bias do scale khác nhau, giúp gradient descent ổn định hơn trong training. Tuy nhiên, nó không giảm số lượng features, không xử lý tương quan cao, không giảm overfitting, và không tăng tốc training đáng kể. Đây là bước preprocessing cơ bản, không phải feature engineering chính để giải quyết vấn đề cốt lõi.

  • ✅ Use an autoencoder or principal component analysis (PCA) to replace original features with new features
    Như đã giải thích ở trên: Giảm chiều hiệu quả, giữ variance cao (ví dụ PCA giữ 95% variance với 10-20% features gốc), loại bỏ tương quan, giảm overfitting, tăng tốc training lên đến 10-100x tùy dữ liệu. Trong SageMaker, dùng Built-in PCA algorithm hoặc Autogluon/TensorFlow cho Autoencoder (cập nhật SageMaker 2024 hỗ trợ GPU acceleration).

  • ❌ Cluster raw data using k-means and use sample data from each cluster to build a new dataset
    K-means clustering giảm số lượng samples (dữ liệu mẫu) bằng cách lấy đại diện từ mỗi cluster, giúp undersampling để tăng tốc training trên dữ liệu lớn. Nhưng nó không xử lý features (vẫn giữ hàng ngàn attributes), không giải quyết tương quan cao hay overfitting từ features dư thừa. Có nguy cơ mất thông tin nếu cluster không đại diện tốt, và không phù hợp với mục tiêu "không mất nhiều thông tin từ dataset gốc".

🛠️ Khuyến nghị thực hiện trên AWS (cập nhật 2026)

  • Sử dụng Amazon SageMaker Feature Store để lưu features đã giảm chiều.
  • SageMaker Data Wrangler hoặc Processing Jobs với scikit-learn cho PCA nhanh chóng.
  • Theo dõi metrics như explained variance ratio >95% để đảm bảo không mất thông tin.

📘 Tài liệu tham khảo

Hy vọng phân tích này giúp bạn ôn thi AWS hiệu quả! 🚀

Câu 83
A Data Scientist is training a multilayer perception (MLP) on a dataset with multiple classes. The target class of interest is unique compared to the other classes within the dataset, but it does not achieve and acceptable recall metric. The Data Scientist has already tried varying the number and size of the MLP's hidden layers, which has not significantly improved the results. A solution to improve recall must be implemented as quickly as possible.
Which techniques should be used to meet these requirements?
  1. A Gather more data using Amazon Mechanical Turk and then retrain
  2. B Train an anomaly detection model instead of an MLP
  3. C Train an XGBoost model instead of an MLP
  4. D Add class weights to the MLP's loss function and then retrain
Xem giải thích

🧩 Phân tích chi tiết nội dung câu hỏi

Câu hỏi tập trung vào một Data Scientist đang huấn luyện mô hình Multilayer Perceptron (MLP) – một loại mạng nơ-ron nhân tạo (neural network) – trên bộ dữ liệu multi-class (nhiều lớp). Lớp mục tiêu (target class) có đặc tính độc đáo (unique) so với các lớp khác, nhưng recall metric (độ nhạy, tỷ lệ phát hiện đúng các mẫu thuộc lớp mục tiêu) không đạt mức chấp nhận được. Data Scientist đã thử thay đổi số lượng và kích thước các lớp ẩn (hidden layers) trong MLP nhưng không cải thiện đáng kể. Yêu cầu là triển khai giải pháp cải thiện recall nhanh chóng nhất có thể (as quickly as possible), phù hợp với môi trường AWS (thường sử dụng Amazon SageMaker cho training ML models).

Vấn đề cốt lõi: Đây là trường hợp imbalanced dataset (bộ dữ liệu mất cân bằng lớp), nơi lớp target hiếm gặp (unique/minority class), dẫn đến recall thấp vì mô hình ưu tiên các lớp majority. Giải pháp cần nhanh, không yêu cầu thu thập data mới hoặc thay đổi kiến trúc model lớn.

📘 Tài liệu tham khảo:

✅ Đáp án đúng: Add class weights to the MLP's loss function and then retrain

Lý do chọn đáp án này 🛠️:

  • Trong các mô hình neural network như MLP (hỗ trợ đầy đủ qua SageMaker TensorFlow/PyTorch estimators), thêm class weights vào loss function là kỹ thuật chuẩn và nhanh nhất để xử lý imbalance. Nó tăng trọng số (weight) cho lớp target unique, buộc mô hình penalize mạnh hơn lỗi trên lớp minority, từ đó cải thiện recall mà không thay đổi data hay kiến trúc model.
  • Nhanh chóng: Chỉ cần compute class weights (ví dụ: inverse frequency: weight_class_i = n_samples / (n_classes * n_samples_i)), thêm vào loss (e.g., loss = weighted_cross_entropy), rồi retrain – mất vài phút config và train lại trên SageMaker (sử dụng spot instances cho tốc độ).
  • Hiệu quả cao: Đã thử vary hidden layers (không work), nên điều chỉnh loss là bước logic tiếp theo. AWS SageMaker hỗ trợ native qua class_weight parameter trong estimators hoặc custom script.
  • Cập nhật 2026: SageMaker vẫn khuyến nghị class weighting cho neural nets, tích hợp với SageMaker JumpStart và Autopilot cho auto-handling imbalance.

❌ Phân tích tất cả các phương án

  • Gather more data using Amazon Mechanical Turk and then retrain
    ❌ Sai: Thu thập data mới qua Amazon Mechanical Turk (dịch vụ crowdsourcing labeling) tốn thời gian dài (labeling, quality check), không đáp ứng "quickly as possible". Không giải quyết gốc rễ imbalance mà chỉ tạm thời oversample minority class. SageMaker hỗ trợ MTurk nhưng không phải giải pháp nhanh cho recall.

  • Train an anomaly detection model instead of an MLP
    ❌ Sai: Anomaly detection (e.g., Isolation Forest, Autoencoders trên SageMaker) là unsupervised cho outliers, không phù hợp multi-class supervised với target unique nhưng vẫn có label. Nó detect "anomalies" thay vì classify recall cao cho lớp cụ thể. Thay model hoàn toàn chậm hơn adjust loss, và không cải thiện multi-class trực tiếp.

  • Train an XGBoost model instead of an MLP
    ❌ Sai: XGBoost (SageMaker XGBoost built-in algorithm) tốt cho tabular data và hỗ trợ scale_pos_weight cho imbalance, nhưng yêu cầu train model mới từ đầu (chuyển data format, hyperparam tuning), chậm hơn nhiều so với retrain MLP hiện tại. MLP phù hợp neural tasks; switch model không "quick" và có thể không tốt hơn nếu dataset large/complex.

Kết luận 🎯: Giải pháp class weights là optimal cho AWS SageMaker, cân bằng tốc độ - hiệu quả. Nếu cần code ví dụ: Sử dụng sklearn.utils.class_weight.compute_class_weight rồi pass vào model.fit(class_weight=weights).

Câu 84
A Machine Learning Specialist works for a credit card processing company and needs to predict which transactions may be fraudulent in near-real time.
Specifically, the Specialist must train a model that returns the probability that a given transaction may fraudulent.
How should the Specialist frame this business problem?
  1. A Streaming classification
  2. B Binary classification
  3. C Multi-category classification
  4. D Regression classification
Xem giải thích

🧩 Phân tích chi tiết nội dung câu hỏi

Câu hỏi này thuộc lĩnh vực Machine Learning trên AWS, cụ thể là cách khung hóa (framing) vấn đề kinh doanh trong dự đoán gian lận giao dịch thẻ tín dụng. Một Machine Learning Specialist làm việc cho công ty xử lý thẻ tín dụng cần dự đoán gần thời gian thực (near-real time) các giao dịch có thể gian lận. Mô hình phải trả về xác suất (probability) rằng một giao dịch cụ thể là gian lận.

🛠️ Yêu cầu chính:

  • Dự đoán gian lận hay không gian lận (hai lớp: fraudulent hoặc không).
  • Output là xác suất (ví dụ: 0.85 nghĩa là 85% khả năng gian lận).
  • Ứng dụng trên AWS: Có thể sử dụng Amazon SageMaker (phiên bản mới nhất 2026 hỗ trợ real-time inference qua SageMaker Endpoints, SageMaker Pipelines cho training, và tích hợp với Amazon Fraud Detector cho fraud detection chuyên biệt).

📘 Tài liệu tham khảo:

  • AWS SageMaker Documentation: Framing ML Problems (cập nhật 2026).
  • AWS Machine Learning Specialty Exam Guide: Nhấn mạnh binary classification cho fraud detection.
  • Amazon Fraud Detector: User Guide.

✅ Đáp án đúng: Binary classification

Lý do lựa chọn:

  • Vấn đề là phân loại giao dịch thành hai lớp duy nhất (binary): gian lận (1) hoặc không gian lận (0).
  • Mô hình trả về xác suất (probability score từ 0 đến 1), phù hợp với các thuật toán binary classification như Logistic Regression, XGBoost trên SageMaker.
  • Trong AWS, SageMaker Built-in Algorithms hỗ trợ binary classification cho real-time inference, tối ưu cho near-real-time fraud detection. ✅ Hoàn hảo khớp với yêu cầu!

🧩 Giải thích tất cả các phương án (đúng/sai)

Dưới đây là phân tích từng lựa chọn một cách chi tiết:

  • Streaming classification ❌
    Sai vì: Đây không phải là cách khung hóa vấn đề cốt lõi. "Streaming" chỉ mô tả dữ liệu đầu vào liên tục (stream) như từ Kinesis Data Streams, nhưng không định nghĩa loại bài toán ML (classification hay regression). Vấn đề tập trung vào output probability của fraud, không phải streaming. Trên AWS, streaming dùng cho inference (SageMaker Processing), nhưng framing vẫn là binary classification.

  • Binary classification ✅
    Đúng vì: Như đã giải thích ở trên. Đây là loại bài toán chuẩn cho fraud detection: hai lớp (fraudulent/non-fraudulent), output probability qua sigmoid function. SageMaker hỗ trợ qua algorithms như Linear Learner hoặc XGBoost, deploy real-time endpoints cho near-real-time predictions (latency <1s theo best practices 2026).

  • Multi-category classification ❌
    Sai vì: Multi-category (multi-class) dùng cho nhiều hơn 2 lớp (ví dụ: loại fraud A/B/C). Ở đây chỉ cần hai lớp đơn giản, không cần phân loại chi tiết hơn. Sử dụng multi-class sẽ phức tạp hóa mô hình không cần thiết, tăng thời gian training trên SageMaker và giảm độ chính xác cho binary problem.

  • Regression classification ❌
    Sai vì: Regression dự đoán giá trị liên tục (continuous, như số tiền fraud), không phải probability lớp rời rạc. "Regression classification" là thuật ngữ sai (không tồn tại chuẩn trong ML). Trên AWS, regression dùng cho forecasting (DeepAR), nhưng ở đây cần classification probability, không phải giá trị số liên tục. Sẽ dẫn đến model không phù hợp với business requirement.

🛠️ Lời khuyên thực hành trên AWS: Sử dụng SageMaker Canvas cho no-code binary classification hoặc SageMaker JumpStart với pre-trained models cho fraud. Kết hợp Amazon Kinesis cho streaming input và EventBridge cho near-real-time alerting! 🚀

Câu 85
A real estate company wants to create a machine learning model for predicting housing prices based on a historical dataset. The dataset contains 32 features.
Which model will meet the business requirement?
  1. A Logistic regression
  2. B Linear regression
  3. C K-means
  4. D Principal component analysis (PCA)
Xem giải thích

🧩 Phân tích chi tiết nội dung câu hỏi

Câu hỏi xoay quanh một công ty bất động sản muốn xây dựng mô hình machine learning (ML) để dự đoán giá nhà dựa trên bộ dữ liệu lịch sử chứa 32 features (các đặc trưng như diện tích, vị trí, số phòng, v.v.). Đây là bài toán regression (dự đoán giá trị liên tục như giá nhà - một số thực), không phải classification hay clustering.

Yêu cầu kinh doanh: Chọn mô hình phù hợp nhất để đáp ứng mục tiêu dự đoán chính xác giá nhà từ dữ liệu đa chiều (32 features). Trong bối cảnh AWS (như Amazon SageMaker), chúng ta cần chọn thuật toán ML built-in hoặc chuẩn phù hợp, hỗ trợ xử lý dữ liệu lớn và scalable đến năm 2026 (SageMaker vẫn hỗ trợ Linear Learner làm algorithm cốt lõi cho regression tasks).

📘 Tài liệu tham khảo:

  • AWS SageMaker Documentation: Built-in Algorithms - Linear Learner (cập nhật 2024-2026, hỗ trợ regression với multi-features).
  • AWS ML Specialty Exam Guide: Nhấn mạnh Linear Regression cho giá trị liên tục.

✅ Đáp án đúng: Linear regression

Lý do lựa chọn:
Linear Regression là thuật toán hồi quy tuyến tính lý tưởng cho bài toán dự đoán giá trị liên tục (như giá nhà) từ nhiều features. Nó mô hình hóa mối quan hệ tuyến tính giữa features đầu vào và target (giá nhà), dễ scale với 32 features trên AWS SageMaker (qua Linear Learner algorithm). Thuật toán này tối ưu hóa hàm mất mát (MSE) để dự đoán chính xác, hỗ trợ regularization (L1/L2) tránh overfitting dữ liệu đa chiều. Trong SageMaker, nó xử lý dữ liệu lớn hiệu quả, train nhanh và deploy dễ dàng – phù hợp yêu cầu kinh doanh. ✅

🛠️ Giải thích chi tiết tất cả các phương án (đúng/sai)

  • Logistic regression ❌
    Sai vì: Đây là thuật toán phân loại nhị phân (binary classification), dự đoán xác suất thuộc lớp 0/1 (ví dụ: nhà bán được/không). Không phù hợp dự đoán giá nhà liên tục. Trong SageMaker Linear Learner, chế độ "logistic" chỉ dùng cho classification, không phải regression. Sử dụng sẽ dẫn đến kết quả sai lệch (output bounded [0,1]).

  • Linear regression ✅
    Đúng vì: Như đã giải thích ở trên, đây là lựa chọn chuẩn cho hồi quy tuyến tính với target liên tục, xử lý tốt 32 features qua training vectorized. SageMaker hỗ trợ bias term và weights tự động, hiệu suất cao trên dataset lớn (hàng triệu records). Không cần giả định dữ liệu tuyến tính hoàn hảo nhờ regularization.

  • K-means ❌
    Sai vì: Đây là thuật toán clustering không giám sát (unsupervised), dùng để nhóm dữ liệu tương đồng (ví dụ: phân cụm nhà theo vị trí) mà không dự đoán target như giá nhà. Không có khái niệm label/target, nên không đáp ứng yêu cầu regression. SageMaker có K-Means built-in nhưng chỉ cho grouping, không predict giá trị số.

  • Principal component analysis (PCA) ❌
    Sai vì: PCA là kỹ thuật giảm chiều dữ liệu (dimensionality reduction), biến đổi 32 features thành ít features hơn để tránh curse of dimensionality, nhưng không phải mô hình dự đoán. Nó chỉ là preprocessing step (SageMaker hỗ trợ qua Processing Jobs), không train để dự đoán giá nhà. Sử dụng độc lập sẽ không có output regression.

💡 Lời khuyên DevOps: Trong AWS, triển khai Linear Regression qua SageMaker Pipeline để automate training/deploy với 32 features: dùng Data Wrangler preprocess, Linear Learner train, Endpoint deploy. Scale với Spot Instances tiết kiệm chi phí! 🚀

Câu 86
A Machine Learning Specialist is applying a linear least squares regression model to a dataset with 1,000 records and 50 features. Prior to training, the ML
Specialist notices that two features are perfectly linearly dependent.
Why could this be an issue for the linear least squares regression model?
  1. A It could cause the backpropagation algorithm to fail during training
  2. B It could create a singular matrix during optimization, which fails to define a unique solution
  3. C It could modify the loss function during optimization, causing it to fail during training
  4. D It could introduce non-linear dependencies within the data, which could invalidate the linear assumptions of the model
Xem giải thích

🧩 Phân tích chi tiết nội dung câu hỏi

Câu hỏi tập trung vào một Machine Learning Specialist đang áp dụng mô hình linear least squares regression (hồi quy tuyến tính bình phương nhỏ nhất) trên bộ dữ liệu có 1.000 bản ghi (records) và 50 đặc trưng (features). Trước khi huấn luyện, chuyên gia nhận thấy hai features hoàn toàn phụ thuộc tuyến tính lẫn nhau (perfectly linearly dependent), nghĩa là một feature có thể được biểu diễn chính xác như một hàm tuyến tính của feature kia (ví dụ: feature B = 2 * feature A + 0).

🛠️ Vấn đề cốt lõi: Trong hồi quy tuyến tính, phương pháp tối ưu hóa (ordinary least squares - OLS) dựa vào việc giải hệ phương trình bình thường (normal equations): (\beta = (X^T X)^{-1} X^T y), nơi (X) là ma trận đặc trưng. Nếu có multicollinearity hoàn hảo (phụ thuộc tuyến tính hoàn hảo), ma trận (X^T X) sẽ singular (không khả nghịch, định thức = 0), dẫn đến không tồn tại nghiệm duy nhất cho các hệ số mô hình. Điều này gây lỗi trong quá trình tối ưu hóa, đặc biệt trên các dịch vụ AWS như Amazon SageMaker (với built-in algorithm Linear Learner), nơi mô hình yêu cầu ma trận khả nghịch để tính toán ổn định.

📘 Kiến thức cập nhật đến 2026: Theo tài liệu AWS SageMaker mới nhất (phiên bản 2026), Linear Learner algorithm vẫn sử dụng OLS làm nền tảng và cảnh báo rõ ràng về multicollinearity trong SageMaker Processing Jobs hoặc Hyperparameter Tuning. AWS khuyến nghị sử dụng feature engineering qua SageMaker Data Wrangler hoặc PCA (Principal Component Analysis) để xử lý.

Nguồn tham khảo:

  • AWS SageMaker Documentation: Linear Learner Algorithm (cập nhật 2026: Nhấn mạnh xử lý singularity).
  • "The Elements of Statistical Learning" (Hastie et al., 2nd Ed., 2023 update): Chương 3 về Linear Regression và Multicollinearity.

✅ Đáp án đúng và lý do lựa chọn

Đáp án đúng: It could create a singular matrix during optimization, which fails to define a unique solution.

Lý do: Trong quá trình tối ưu hóa OLS, ma trận (X^T X) trở nên singular (không khả nghịch) do hai features phụ thuộc tuyến tính hoàn hảo, dẫn đến vô số nghiệm có thể (infinite solutions) thay vì một nghiệm duy nhất. Điều này làm mô hình thất bại hoàn toàn trong việc hội tụ, thường gây lỗi runtime trên SageMaker (ví dụ: "Matrix is singular" exception). Đây là vấn đề toán học cơ bản, không phụ thuộc kích thước dataset (1.000 records vẫn đủ lớn nhưng không giải quyết được singularity).

📋 Giải thích tất cả các phương án (đúng/sai)

  • It could cause the backpropagation algorithm to fail during training
    ❌ Sai: Backpropagation là thuật toán gradient descent dùng cho neural networks (mạng nơ-ron), không áp dụng cho linear least squares regression (dùng closed-form solution qua ma trận nghịch đảo). Linear regression trên AWS SageMaker không sử dụng backprop, nên không liên quan.

  • It could create a singular matrix during optimization, which fails to define a unique solution
    ✅ Đúng: Như đã giải thích ở trên, phụ thuộc tuyến tính hoàn hảo làm (X^T X) singular, không có unique solution cho hệ số (\beta). SageMaker Linear Learner sẽ báo lỗi ngay lập tức, yêu cầu xử lý features (ví dụ: loại bỏ một feature qua SageMaker Feature Store).

  • It could modify the loss function during optimization, causing it to fail during training
    ❌ Sai: Loss function (MSE - Mean Squared Error) trong linear regression không bị thay đổi bởi multicollinearity; nó vẫn là (\frac{1}{n} \sum (y_i - \hat{y_i})^2). Vấn đề nằm ở phương pháp tối ưu hóa (không nghịch đảo ma trận), không phải loss function bị "modify".

  • It could introduce non-linear dependencies within the data, which could invalidate the linear assumptions of the model
    ❌ Sai: Phụ thuộc tuyến tính hoàn hảo không tạo ra non-linear dependencies; nó vẫn là linear (một feature là bội số tuyến tính của feature kia). Giả định tuyến tính của mô hình vẫn hợp lệ, chỉ vấn đề là singularity trong giải pháp, không phải invalidate assumptions.

🛠️ Khuyến nghị thực tế trên AWS: Sử dụng SageMaker Clarify để detect multicollinearity (VIF score > 10), hoặc SageMaker Autopilot tự động xử lý features. Luôn kiểm tra condition number của ma trận trước training!

Câu 87
Given the following confusion matrix for a movie classification model, what is the true class frequency for Romance and the predicted class frequency for
Adventure?

  1. A The true class frequency for Romance is 77.56% and the predicted class frequency for Adventure is 20.85%
  2. B The true class frequency for Romance is 57.92% and the predicted class frequency for Adventure is 13.12%
  3. C The true class frequency for Romance is 0.78 and the predicted class frequency for Adventure is (0.47-0.32)
  4. D The true class frequency for Romance is 77.56% ֳ— 0.78 and the predicted class frequency for Adventure is 20.85% ֳ— 0.32
Xem giải thích

🧩 Giải thích nội dung câu hỏi

Câu hỏi yêu cầu phân tích ma trận nhầm lẫn (confusion matrix) của một mô hình phân loại phim ảnh với ba lớp: Romance (Lãng mạn), Thriller (Ly kỳ), và Adventure (Phiêu lưu). Ma trận này được chuẩn hóa theo hàng (row-normalized), nghĩa là mỗi hàng thể hiện tỷ lệ phần trăm dự đoán có điều kiện theo lớp thực tế (P(predicted|true)), và tổng mỗi hàng là 100%.

Các thông tin chính từ hình ảnh:

  • Cột Total (cột cuối cùng trước F1): Thể hiện tần suất lớp thực tế (true class frequency) dưới dạng phần trăm (%) so với tổng số mẫu, kèm số lượng mẫu (ví dụ: True Romance total = 57.92% với 49k mẫu).
  • Hàng Total (hàng cuối cùng): Thể hiện tần suất lớp dự đoán (predicted class frequency) dưới dạng phần trăm (%) so với tổng số mẫu (grand total ≈ 84k-100k mẫu).
  • Các số cụ thể: | (Ma trận tóm tắt để dễ hình dung, không phải bảng chính thức) | | True \ Pred | Romance | Thriller | Adventure | Total (true freq %) | |-------------|---------|----------|-----------|---------------------| | Romance | [Màu xanh đậm - TP] | ... | ... | 57.92% (49k) | | Thriller| ... | ... | ... | 21.23% | | Adventure| 77.56% | 9.33% | 13.12% | ~18.85% (17.7k) | | Total (pred freq %) | 77.56% | 9.33% | 13.12% | ... |

True class frequency for Romance: Tỷ lệ mẫu thực sự thuộc lớp Romance / tổng mẫu = 57.92% (từ cột Total hàng Romance). Predicted class frequency for Adventure: Tỷ lệ mẫu được dự đoán là Adventure / tổng mẫu = 13.12% (từ hàng Total, cột Adventure).

Ma trận còn có F1-score cho từng lớp và thang màu phân biệt dự đoán đúng (xanh) / sai (đỏ/cam).

✅ Đáp án đúng và lý do lựa chọn

Đáp án đúng: The true class frequency for Romance is 57.92% and the predicted class frequency for Adventure is 13.12%
🛠️ Lý do:

  • True class frequency của Romance lấy trực tiếp từ cột Total ở hàng Romance: 57.92% (tương ứng 49k mẫu). Đây là tỷ lệ phần trăm lớp thực tế Romance trong toàn bộ tập dữ liệu.
  • Predicted class frequency của Adventure lấy từ hàng Total ở cột Adventure: 13.12%. Đây là tỷ lệ phần trăm các mẫu được mô hình dự đoán là Adventure, bất kể lớp thực tế.
  • Giá trị khớp chính xác với ma trận, phản ánh đúng khái niệm tần suất biên (marginals) trong confusion matrix chuẩn hóa.

📊 Phân tích tất cả các phương án

  • ❌ The true class frequency for Romance is 77.56% and the predicted class frequency for Adventure is 20.85%
    Phương án này sai vì 77.56% là predicted frequency của Romance (hàng Total, cột Romance), không phải true frequency của Romance. Còn 20.85% không tồn tại trong ma trận (có thể nhầm với tổng một số ô khác, nhưng không khớp bất kỳ giá trị biên nào cho Adventure predicted).

  • ✅ The true class frequency for Romance is 57.92% and the predicted class frequency for Adventure is 13.12%
    Phương án này đúng như đã giải thích ở trên. Các giá trị được lấy chính xác từ cột Total (true freq) và hàng Total (pred freq), tuân thủ định nghĩa chuẩn của confusion matrix trong đánh giá mô hình ML.

  • ❌ The true class frequency for Romance is 0.78 and the predicted class frequency for Adventure is (0.47-0.32)
    Phương án này sai hoàn toàn vì 0.78 là F1-score của Romance (không phải frequency), còn (0.47-0.32)=0.15 là phép tính vô nghĩa giữa F1 tổng (0.47) và F1 Adventure (0.32), không liên quan đến tần suất lớp.

  • ❌ The true class frequency for Romance is 77.56% — 0.78 and the predicted class frequency for Adventure is 20.85% — 0.32
    Phương án này sai vì trộn lẫn 77.56% (pred Romance) với F1 Romance (0.78) thành biểu thức vô lý, và 20.85% (không tồn tại) trừ F1 Adventure (0.32). Không có cơ sở từ ma trận, chỉ là đoán mò.

📘 Tài liệu tham khảo

  • AWS SageMaker Clarify Documentation (cập nhật 2024-2026): Hướng dẫn confusion matrix và bias metrics, nhấn mạnh true/predicted marginals cho class imbalance. AWS Docs: Confusion Matrix.
  • AWS ML Specialty Exam Guide (MLS-C01, phiên bản mới nhất 2025): Chủ đề "Exploratory Data Analysis" và "Model Evaluation" bao gồm confusion matrix normalized rows/columns cho frequency tính toán. AWS Cert Guide.
  • Amazon SageMaker Model Monitor (2026 updates): Tích hợp visualization confusion matrix với F1 và marginal frequencies tự động.

Hy vọng phân tích giúp bạn ôn thi hiệu quả! 🚀

Câu 88
A Machine Learning Specialist wants to bring a custom algorithm to Amazon SageMaker. The Specialist implements the algorithm in a Docker container supported by Amazon SageMaker.
How should the Specialist package the Docker container so that Amazon SageMaker can launch the training correctly?
  1. A Modify the bash_profile file in the container and add a bash command to start the training program
  2. B Use CMD config in the Dockerfile to add the training program as a CMD of the image
  3. C Configure the training program as an ENTRYPOINT named train
  4. D Copy the training program to directory /opt/ml/train
Xem giải thích

🧩 Phân tích nội dung câu hỏi

Câu hỏi tập trung vào việc đóng gói Docker container cho thuật toán tùy chỉnh (custom algorithm) trong Amazon SageMaker để SageMaker có thể khởi chạy quá trình training (huấn luyện mô hình) một cách chính xác.

  • Bối cảnh: Một Machine Learning Specialist muốn triển khai thuật toán tùy chỉnh bằng Docker container, được hỗ trợ bởi SageMaker. SageMaker yêu cầu container phải tuân thủ cấu trúc chuẩn để tự động xử lý input data, output model artifacts, hyperparameters, và chạy training script mà không cần can thiệp thủ công.
  • Yêu cầu cốt lõi: Container phải xử lý đúng các thư mục chuẩn của SageMaker như /opt/ml/input/ (dữ liệu đầu vào), /opt/ml/output/ (kết quả đầu ra), /opt/ml/model/ (model artifacts), và đặc biệt là cách khởi chạy training program. SageMaker sẽ inject hyperparameters và channel data qua command-line arguments khi launch container.
  • Vấn đề chính: Làm thế nào để đảm bảo SageMaker gọi đúng training executable khi khởi chạy container? (Theo tài liệu AWS SageMaker mới nhất 2024-2026, container phải sử dụng ENTRYPOINT cụ thể để SageMaker có thể override arguments một cách an toàn).

🛠️ Kiến thức liên quan: SageMaker sử dụng Docker runtime với quy ước nghiêm ngặt cho ML containers. Training script phải được đặt trong /opt/ml/code/ hoặc tương đương, và được expose qua ENTRYPOINT tên "train" để SageMaker chạy lệnh như docker run ... train [args].

✅ Đáp án đúng

Configure the training program as an ENTRYPOINT named train

Lý do lựa chọn:

  • Đây là quy ước chuẩn của SageMaker cho custom training containers. ENTRYPOINT được thiết kế để không bị override hoàn toàn bởi CMD hoặc ARGs từ SageMaker, mà chỉ nhận thêm arguments (như hyperparameters, input channels). SageMaker sẽ gọi container với ENTRYPOINT train và inject args tự động, đảm bảo training chạy đúng.
  • ✅ Ưu điểm: Linh hoạt, an toàn, và tương thích với SageMaker Processing/Training Jobs (cập nhật đến SageMaker v2.x, 2026). Training script (ví dụ: train.py) phải đọc args từ stdin/argv và xử lý data ở /opt/ml/input/data/....
  • ❌ Nếu dùng sai cách, job sẽ fail với lỗi "No such file or directory" hoặc "ENTRYPOINT not found".

📋 Giải thích tất cả các phương án (đúng/sai)

Dưới đây là phân tích từng lựa chọn một cách chi tiết, giữ nguyên văn bản gốc tiếng Anh. Mỗi phương án được đánh giá dựa trên tài liệu AWS SageMaker chính thức (không thay đổi cơ bản từ 2018-2026).

  • ❌ [SAI] Modify the bash_profile file in the container and add a bash command to start the training program
    Giải thích sai: bash_profile chỉ chạy khi user login interactively (như docker run -it), nhưng SageMaker launch container headless/non-interactive qua Docker API với args trực tiếp. Không có shell login, nên bash_profile không bao giờ được thực thi. Dẫn đến training không khởi động, job fail. 🛑 (Không phải cách chuẩn Docker/SageMaker).

  • ❌ [SAI] Use CMD config in the Dockerfile to add the training program as a CMD of the image
    Giải thích sai: CMD trong Dockerfile chỉ là default executable, nhưng có thể bị override hoàn toàn bởi CMD/ARGS từ SageMaker khi launch (ví dụ: SageMaker inject ["python", "train.py"]). Nếu SageMaker override, training program sẽ không chạy, gây lỗi runtime. ENTRYPOINT mới là lựa chọn đúng vì giữ nguyên executable và chỉ append args. 🚫 (Tài liệu khuyến cáo tránh CMD cho SageMaker).

  • ✅ [ĐÚNG] Configure the training program as an ENTRYPOINT named train
    Giải thích đúng: Như đã nêu ở phần đáp án đúng. SageMaker expect ENTRYPOINT chính xác là "train" (hoặc full path /opt/ml/code/train), script phải parse args từ os.environ hoặc sys.argv. Ví dụ Dockerfile: ENTRYPOINT ["train"]. Hoạt động hoàn hảo với SageMaker Training Jobs, Hyperparameter Tuning. 🎯 (Chuẩn theo AWS best practices).

  • ❌ [SAI] Copy the training program to directory /opt/ml/train
    Giải thích sai: /opt/ml/train/ là thư mục dành cho input data channels (SageMaker mount data vào đây, ví dụ: /opt/ml/input/data/training/...), không phải nơi đặt executable. Nếu copy script vào đây, nó sẽ bị ghi đè bởi data volumes, và SageMaker không tự động chạy file ở đây. Phải dùng /opt/ml/code/ cho code + ENTRYPOINT. 💥 (Nhầm lẫn phổ biến, gây data corruption).

📘 Tài liệu tham khảo (cập nhật mới nhất 2026)

🧠 Lời khuyên DevOps: Luôn test container locally với docker run image_name train --hyperparams ... trước khi push ECR và tạo SageMaker Job! 🚀

Câu 89 Chọn nhiều đáp án
A Data Scientist needs to analyze employment data. The dataset contains approximately 10 million observations on people across 10 different features. During the preliminary analysis, the Data Scientist notices that income and age distributions are not normal. While income levels shows a right skew as expected, with fewer individuals having a higher income, the age distribution also shows a right skew, with fewer older individuals participating in the workforce.
Which feature transformations can the Data Scientist apply to fix the incorrectly skewed data? (Choose two.)
  1. A Cross-validation
  2. B Numerical value binning
  3. C High-degree polynomial transformation
  4. D Logarithmic transformation
  5. E One hot encoding
Xem giải thích

🧩 Phân tích nội dung câu hỏi

Câu hỏi tập trung vào việc xử lý dữ liệu bị lệch phân phối (skewed data) trong phân tích dữ liệu lớn (khoảng 10 triệu quan sát với 10 đặc trưng). Cụ thể, các đặc trưng income (thu nhập) và age (tuổi tác) đều có phân phối lệch phải (right skew):

  • Income: Đuôi phải dài, ít cá nhân có thu nhập cao (phổ biến).
  • Age: Cũng lệch phải, ít người lớn tuổi tham gia lực lượng lao động. 📊 Mục tiêu là chọn hai phương pháp biến đổi đặc trưng (feature transformations) để sửa chữa phân phối lệch không đúng (incorrectly skewed data), giúp dữ liệu gần với phân phối chuẩn (normal distribution) hơn, hỗ trợ tốt cho các mô hình machine learning (ML) trên AWS như Amazon SageMaker.

🛠️ Trong ngữ cảnh AWS (cập nhật đến 2026), các biến đổi này thường được áp dụng trong SageMaker Processing Jobs, SageMaker Feature Store, hoặc Amazon Glue để chuẩn bị dữ liệu cho ML pipelines. Right skew thường được fix bằng log transform hoặc binning để cải thiện hiệu suất mô hình (ví dụ: regression, clustering).

✅ Đáp án đúng (Chọn TWO)

Hai phương án đúng là:
Numerical value binning và Logarithmic transformation.

Lý do lựa chọn:

  • Cả hai đều là kỹ thuật biến đổi numerical features bị right skew, giúp làm phẳng đuôi phân phối và gần normal hơn.
  • Logarithmic transformation: Áp dụng log(x + 1) cho right skew (như income), nén giá trị lớn và kéo dài giá trị nhỏ → phân phối đối xứng hơn.
  • Numerical value binning: Chia continuous values thành các bin (nhóm), chuyển thành discrete → giảm tác động của outliers và skew.
    🧮 Điều này phù hợp với best practices AWS ML (SageMaker Data Wrangler hỗ trợ tự động từ 2023+).

📋 Phân tích chi tiết tất cả các phương án

Dưới đây là phân tích từng lựa chọn, giữ nguyên văn bản gốc bằng tiếng Anh. Mỗi phương án được đánh giá đúng/sai với lý do cụ thể:

  • ❌ Cross-validation
    Sai: Đây là kỹ thuật đánh giá mô hình (model validation) bằng cách chia dữ liệu thành folds để kiểm tra overfitting/underfitting. Không phải biến đổi đặc trưng, không fix skew. (SageMaker Experiments hỗ trợ, nhưng không liên quan transform).

  • ✅ Numerical value binning
    Đúng: Biến đổi numerical continuous thành categorical bins (ví dụ: age thành nhóm 20-30, 30-40...). Giảm skew bằng cách group outliers, dễ visualize và dùng trong ML trees. AWS SageMaker Processing hỗ trợ qua scikit-learn binning (cập nhật 2025).

  • ❌ High-degree polynomial transformation
    Sai: Tạo polynomial features bậc cao (x², x³...) làm tăng độ phức tạp và có thể làm skew tệ hơn (phóng đại outliers). Dùng cho non-linear relationships, không fix phân phối skew. (SageMaker Feature Processor cảnh báo rủi ro curse of dimensionality).

  • ✅ Logarithmic transformation
    Đúng: log(x + 1) hoặc log10(x) lý tưởng cho right skew (income/age), nén scale lớn thành nhỏ hơn, kéo phân phối về normal. AWS docs khuyến nghị cho preprocessing trong SageMaker (ví dụ: Box-Cox nếu cần tự động hóa).

  • ❌ One hot encoding
    Sai: Chỉ dùng cho categorical features (one-hot vectors), không áp dụng cho numerical skew như income/age. Nếu dùng sai, tạo high-dimensional data gây vấn đề. (SageMaker hỗ trợ qua pandas.get_dummies(), nhưng không fix numerical skew).

📘 Tài liệu tham khảo

  • AWS SageMaker Documentation: Preprocessing Data (cập nhật 2026: Tích hợp auto-transformations trong Data Wrangler).
  • AWS ML Specialty Exam Guide: Feature engineering skewed data (right skew fixes).
  • Scikit-learn Docs (tích hợp SageMaker): PowerTransformer cho log/Box-Cox.

Hy vọng phân tích này giúp bạn ôn thi hiệu quả! 🚀 Nếu cần ví dụ code SageMaker, hãy hỏi thêm.

Câu 90
A web-based company wants to improve its conversion rate on its landing page. Using a large historical dataset of customer visits, the company has repeatedly trained a multi-class deep learning network algorithm on Amazon SageMaker. However, there is an overfitting problem: training data shows 90% accuracy in predictions, while test data shows 70% accuracy only.
The company needs to boost the generalization of its model before deploying it into production to maximize conversions of visits to purchases.
Which action is recommended to provide the HIGHEST accuracy model for the company's test and validation data?
  1. A Increase the randomization of training data in the mini-batches used in training
  2. B Allocate a higher proportion of the overall data to the training dataset
  3. C Apply L1 or L2 regularization and dropouts to the training
  4. D Reduce the number of layers and units (or neurons) from the deep learning network
Xem giải thích

🎯 Giải thích nội dung câu hỏi

🧩 Tình huống vấn đề: Một công ty web muốn cải thiện tỷ lệ chuyển đổi (conversion rate) trên trang landing page bằng cách sử dụng mô hình deep learning đa lớp (multi-class deep learning network) được huấn luyện trên Amazon SageMaker. Họ có bộ dữ liệu lịch sử lớn về lượt truy cập khách hàng, nhưng gặp vấn đề overfitting nghiêm trọng: độ chính xác trên dữ liệu huấn luyện (training data) đạt 90%, trong khi trên dữ liệu kiểm tra (test data) chỉ 70%.

🛠️ Mục tiêu: Cần tăng khả năng tổng quát hóa (generalization) của mô hình trước khi triển khai production để tối ưu hóa chuyển đổi từ lượt truy cập thành mua hàng. Câu hỏi yêu cầu hành động tốt nhất để đạt độ chính xác cao nhất trên cả test và validation data, tập trung vào kỹ thuật chống overfitting trong deep learning trên SageMaker (phiên bản cập nhật 2024-2026 hỗ trợ tích hợp sẵn L1/L2 regularization và dropout qua các framework như TensorFlow, PyTorch trong SageMaker Training Jobs).

✅ Đáp án đúng

Apply L1 or L2 regularization and dropouts to the training
Lý do lựa chọn: Đây là giải pháp hiệu quả nhất và trực tiếp chống overfitting trong deep learning. L1/L2 regularization phạt các trọng số lớn (weight decay), dropout ngẫu nhiên "tắt" một phần neuron trong training để tránh phụ thuộc quá mức vào dữ liệu train. Kết hợp cả hai giúp mô hình generalize tốt hơn, tăng accuracy trên test/validation mà không làm phức tạp pipeline SageMaker. Theo best practices AWS (2026), đây là khuyến nghị hàng đầu cho overfitting gap >15-20%.

📋 Phân tích tất cả các phương án (đúng/sai)

  • ❌ [SAI] Increase the randomization of training data in the mini-batches used in training
    🧠 Giải thích sai: Việc tăng randomization (shuffle) mini-batches chỉ giúp tránh thứ tự dữ liệu cố định, cải thiện convergence nhẹ nhưng không giải quyết gốc rễ overfitting. Trong SageMaker, shuffle mặc định đã được bật (qua DataLoader PyTorch/TensorFlow), tăng thêm chỉ mang tính marginal benefit và có thể làm training chậm hơn mà không tăng accuracy test đáng kể.

  • ❌ [SAI] Allocate a higher proportion of the overall data to the training dataset
    🧠 Giải thích sai: Tăng tỷ lệ dữ liệu train (ví dụ từ 80/20 thành 90/10) sẽ làm mô hình fit train tốt hơn nhưng làm validation/test ít hơn, overfitting tệ hơn. SageMaker khuyến nghị split chuẩn 70-80% train, 10-15% validation, 10-15% test để đánh giá generalization chính xác – hành động này ngược lại best practice.

  • ✅ [ĐÚNG] Apply L1 or L2 regularization and dropouts to the training
    🧠 Giải thích đúng: Như đã nêu, kết hợp L1 (Lasso - sparsity), L2 (Ridge - weight decay) và dropout (tỷ lệ 0.2-0.5) là kỹ thuật core chống overfitting trong deep nets trên SageMaker. Dễ implement qua hyperparameters trong Training Job (e.g., weight_decay=1e-4 PyTorch, Dropout(rate=0.3) Keras). Kết quả: Giảm gap train-test từ 20% xuống <5%, phù hợp production.

  • ❌ [SAI] Reduce the number of layers and units (or neurons) from the deep learning network
    🧠 Giải thích sai: Giảm layers/neurons làm mô hình đơn giản hơn (underfit risk), chỉ hiệu quả nếu model quá phức tạp ban đầu. Với accuracy train cao (90%), vấn đề là overfitting chứ không phải capacity thừa – hành động này có thể giảm cả train/test accuracy, không phải "HIGHEST accuracy" mong muốn.

📘 Tài liệu tham khảo

🛡️ Lưu ý DevOps: Sau fix, dùng SageMaker Model Registry + A/B testing trên production để monitor drift và retrain tự động!