Ngân hàng đề — AWS Certified Machine Learning Engineer Associate

Tìm thấy 635 câu.

Câu 631
An ML engineer is collecting data to train a classification ML model by using Amazon SageMaker AI. The target column can have two possible values: Class A or Class B. The ML engineer wants to ensure that the number of samples for both Class A and Class B are balanced, without losing any existing training data. The ML engineer must test the balance of the training data.

Which solution will meet this requirement?
  1. A Use SageMaker Clarify to check for class imbalance (CI). If the value is equal to 0, then use random undersampling in SageMaker Data Wrangler to balance the classes.
  2. B Use SageMaker Clarify to check for class imbalance (CI). If the value is greater than 0, then use synthetic minority oversampling technique (SMOTE) in SageMaker Data Wrangler to balance the classes.
  3. C Use SageMaker JumpStart to generate a class imbalance (CI) report. If the value is greater than 0, then use random undersampling in SageMaker Studio to balance the classes.
  4. D Use SageMaker JumpStart to generate a class imbalance (CI) report. If the value is equal to 0, then use synthetic minority oversampling technique (SMOTE) in SageMaker Studio to balance the classes.
Xem giải thích

🧩 Giải thích nội dung câu hỏi

Câu hỏi tập trung vào việc xử lý dữ liệu không cân bằng (class imbalance) trong huấn luyện mô hình phân loại (classification) trên Amazon SageMaker AI.

  • Kỹ sư ML đang thu thập dữ liệu với target column chỉ có 2 giá trị: Class A hoặc Class B.
  • Yêu cầu chính: Đảm bảo số lượng mẫu (samples) cho cả hai class cân bằng, không mất bất kỳ dữ liệu huấn luyện nào (no data loss).
  • Ngoài ra, cần kiểm tra (test) mức độ cân bằng của dữ liệu huấn luyện trước khi xử lý.
  • Giải pháp phải sử dụng các công cụ SageMaker phù hợp, ưu tiên oversampling (tạo dữ liệu tổng hợp) thay vì undersampling (giảm dữ liệu) để tránh mất data.
  • Đây là tình huống phổ biến trong ML, nơi class thiểu số (minority) cần được tăng lên mà không làm mất thông tin từ class đa số (majority). Kiến thức dựa trên SageMaker phiên bản mới nhất 2026, với Clarify cho bias detection và Data Wrangler cho data prep.

✅ Đáp án đúng và lý do lựa chọn

Đáp án đúng là phương án thứ 2:
Use SageMaker Clarify to check for class imbalance (CI). If the value is greater than 0, then use synthetic minority oversampling technique (SMOTE) in SageMaker Data Wrangler to balance the classes.

Lý do:

  • SageMaker Clarify chính xác để kiểm tra class imbalance (CI): Chỉ số CI > 0 cho thấy dữ liệu không cân bằng (imbalanced), phù hợp với yêu cầu "test the balance".
  • SMOTE (Synthetic Minority Oversampling Technique) tạo dữ liệu tổng hợp cho class thiểu số, không mất data gốc, lý tưởng cho binary classification.
  • SageMaker Data Wrangler (tích hợp trong SageMaker Studio) hỗ trợ SMOTE trực tiếp qua data flow transformations, dễ dàng balance classes mà giữ nguyên data.
  • Hoàn hảo khớp yêu cầu: Kiểm tra trước → Xử lý nếu imbalanced → Không mất data. 🛠️

📋 Phân tích chi tiết tất cả các phương án

Dưới đây là phân tích từng lựa chọn, giữ nguyên nội dung gốc bằng tiếng Anh. Mỗi phương án được đánh giá đúng/sai với lý do cụ thể dựa trên tính năng AWS SageMaker (cập nhật 2026).

  • ❌ Phương án 1 (SAI):
    Use SageMaker Clarify to check for class imbalance (CI). If the value is equal to 0, then use random undersampling in SageMaker Data Wrangler to balance the classes.
    Lý do sai:

    • Clarify đúng để check CI, nhưng CI = 0 nghĩa là đã cân bằng (balanced), không cần xử lý gì cả → Sai logic (nếu =0 thì không undersample).
    • Random undersampling loại bỏ data ngẫu nhiên từ class đa số → Mất data, vi phạm yêu cầu "without losing any existing training data". Data Wrangler hỗ trợ undersampling nhưng không phù hợp đây.
  • ✅ Phương án 2 (ĐÚNG):
    Use SageMaker Clarify to check for class imbalance (CI). If the value is greater than 0, then use synthetic minority oversampling technique (SMOTE) in SageMaker Data Wrangler to balance the classes.
    Lý do đúng: Như đã giải thích ở trên. Clarify detect CI >0 (imbalanced) → SMOTE oversample minority class → Balance hoàn hảo, zero data loss. Data Wrangler có sẵn SMOTE rule trong Balance classes transform. 🏆

  • ❌ Phương án 3 (SAI):
    Use SageMaker JumpStart to generate a class imbalance (CI) report. If the value is greater than 0, then use random undersampling in SageMaker Studio to balance the classes.
    Lý do sai:

    • SageMaker JumpStart dùng cho deploy pre-trained models (như foundation models), không generate CI report hay bias detection → Sai công cụ.
    • Random undersampling lại mất data, không đáp ứng yêu cầu. SageMaker Studio là IDE tổng quát, nhưng undersampling không phải giải pháp chính ở đây.
  • ❌ Phương án 4 (SAI):
    Use SageMaker JumpStart to generate a class imbalance (CI) report. If the value is equal to 0, then use synthetic minority oversampling technique (SMOTE) in SageMaker Studio to balance the classes.
    Lý do sai:

    • JumpStart không hỗ trợ CI report, giống phương án 3.
    • CI = 0 nghĩa là đã cân bằng, không cần SMOTE → Sai logic hoàn toàn. SMOTE trong Studio/Data Wrangler đúng nhưng điều kiện if sai và công cụ check sai.

📘 Tài liệu tham khảo (AWS Docs cập nhật 2026)

Giải pháp này tối ưu cho production, dễ scale với SageMaker Pipelines! 🚀

Câu 632
An ML engineer is building a logistic regression model to predict customer churn for subscription services. The ML engineer is using a dataset that contains two string variables: location and job_seniority_level. The location variable has 3 distinct values, and the job_seniority_level variable has over 10 distinct values.

The ML engineer must perform preprocessing on the variables.

Which solution will meet this requirement?
  1. A Apply tokenization to location. Apply ordinal encoding to job_seniority_level.
  2. B Apply one-hot encoding to location. Apply ordinal encoding to job_seniority_level
  3. C Apply binning to location. Apply standard scaling to job_seniority_level.
  4. D Apply one-hot encoding to location. Apply standard scaling to job_seniority_level.
Xem giải thích

🧩 Phân tích chi tiết câu hỏi trắc nghiệm AWS ML Preprocessing

📘 Giải thích nội dung câu hỏi:
Câu hỏi tập trung vào việc tiền xử lý (preprocessing) dữ liệu cho mô hình logistic regression dự đoán khách hàng rời bỏ dịch vụ đăng ký (customer churn). Dataset chứa hai biến chuỗi (string variables):

  • location: Có 3 giá trị phân biệt (distinct values), đây là biến phân loại danh nghĩa (nominal categorical) không có thứ tự tự nhiên (ví dụ: "US", "EU", "Asia").
  • job_seniority_level: Có hơn 10 giá trị phân biệt, đây là biến phân loại có thứ tự (ordinal categorical), như cấp bậc công việc (ví dụ: "Junior", "Mid-level", "Senior", "Lead").

Mục tiêu là chuyển đổi các biến này thành dạng số phù hợp cho logistic regression (một mô hình tuyến tính yêu cầu input số, tránh giả định thứ tự sai lệch). Trong AWS SageMaker (phiên bản mới nhất 2024-2026), preprocessing thường dùng SageMaker Processing Jobs, Data Wrangler hoặc SageMaker Canvas với các công cụ như scikit-learn hoặc SageMaker Feature Store. Giải pháp phải hiệu quả, tránh overfitting với biến có cardinality cao (>10).

✅ Đáp án đúng:
Apply one-hot encoding to location. Apply ordinal encoding to job_seniority_level

🛠️ Lý do lựa chọn đáp án đúng:

  • One-hot encoding cho location: Biến nominal với 3 giá trị thấp → Tạo 3 cột binary (0/1), tránh mô hình học sai thứ tự giả tạo. Phù hợp logistic regression vì không làm tăng chiều dữ liệu nhiều (chỉ +2 cột sau drop one).
  • Ordinal encoding cho job_seniority_level: Biến ordinal với >10 giá trị → Gán số thứ tự (ví dụ: 0=Junior, 1=Mid, 2=Senior), giữ mối quan hệ thứ tự tự nhiên, giảm chiều dữ liệu so với one-hot (tránh "curse of dimensionality" với >10 cột).
    Kết hợp này tối ưu cho SageMaker training jobs (hỗ trợ trực tiếp qua sklearn.preprocessing.OneHotEncoder và OrdinalEncoder trong Processing scripts).

🔍 Giải thích chi tiết tất cả các phương án (đúng/sai)

  • ❌ Phương án SAI: Apply tokenization to location. Apply ordinal encoding to job_seniority_level.
    Tokenization dùng cho text phân tích từ vựng (NLP như BERT), không phù hợp location (categorical ngắn). Sẽ tạo token vô nghĩa, làm mô hình logistic regression không học được pattern churn. Ordinal cho job_seniority_level đúng nhưng tổng thể sai.

  • ✅ Phương án ĐÚNG: Apply one-hot encoding to location. Apply ordinal encoding to job_seniority_level.
    Như đã giải thích: One-hot lý tưởng cho nominal thấp cardinality, ordinal giữ thứ tự cho seniority cao cardinality. Hiệu suất cao trong SageMaker, tránh multicollinearity và high dimensionality.

  • ❌ Phương án SAI: Apply binning to location. Apply standard scaling to job_seniority_level.
    Binning (nhóm bins) dùng cho numerical continuous (ví dụ: age → low/medium/high), không phù hợp categorical discrete như location (chỉ 3 giá trị, binning mất thông tin gốc). Standard scaling (z-score) cho numerical, không áp dụng string/job_seniority_level → lỗi runtime trong SageMaker Processing.

  • ❌ Phương án SAI: Apply one-hot encoding to location. Apply standard scaling to job_seniority_level.
    One-hot cho location đúng, nhưng standard scaling chỉ cho numerical đã chuẩn hóa (mean=0, std=1). Job_seniority_level là categorical ordinal → scaling tạo bias giả (ví dụ: Junior=0 scale thành -1.5), làm logistic regression học sai gradient descent.

📚 Tài liệu tham khảo (AWS cập nhật 2024-2026):

  • AWS SageMaker Documentation: Preprocessing Data – Hướng dẫn OneHotEncoder/OrdinalEncoder trong Processing Jobs.
  • SageMaker Data Wrangler: Feature Transformations – Hỗ trợ trực quan one-hot/ordinal.
  • Scikit-learn (tích hợp SageMaker): Categorical Encoding – Best practices cho logistic regression.
  • AWS ML Specialty Exam Guide (2024): Nhấn mạnh encoding phù hợp tránh overfitting trong churn prediction.

💡 Lời khuyên DevOps: Trong pipeline CI/CD (CodePipeline + SageMaker), automate preprocessing script với Docker container để reproducible. Test với SageMaker Debugger theo dõi feature drift! 🚀

Câu 633
A company needs to deploy a custom-trained classification ML model on AWS. The model must make near real-time predictions with low latency and must handle variable request volumes.

Which solution will meet these requirements?
  1. A Create an Amazon SageMaker AI batch transform job to process inference requests in batches.
  2. B Use Amazon API Gateway to receive prediction requests. Use an Amazon S3 bucket to host and serve the model.
  3. C Deploy an Amazon SageMaker AI endpoint. Configure auto scaling for the endpoint.
  4. D Launch AWS Deep Learning AMIs (DLAMI) on two Amazon EC2 instances. Run the instances behind an Application Load Balancer.
Xem giải thích

🧩 Phân tích chi tiết nội dung câu hỏi

Câu hỏi tập trung vào việc triển khai một mô hình Machine Learning (ML) phân loại tùy chỉnh (custom-trained classification ML model) trên AWS. Yêu cầu chính bao gồm:

  • Near real-time predictions (dự đoán gần thời gian thực): Nghĩa là model phải xử lý yêu cầu inference nhanh chóng, không phải chờ đợi lâu.
  • Low latency (độ trễ thấp): Thời gian phản hồi phải rất ngắn, phù hợp cho ứng dụng cần tốc độ cao.
  • Handle variable request volumes (xử lý lượng yêu cầu biến động): Hệ thống phải tự động scale để chịu tải tăng/giảm đột ngột mà không gián đoạn.

🛠️ Mục tiêu: Tìm giải pháp AWS tối ưu để deploy model này, tận dụng dịch vụ managed, dễ scale và hiệu suất cao. Đây là chủ đề cốt lõi trong Amazon SageMaker – dịch vụ ML end-to-end của AWS (cập nhật đến 2026 với SageMaker Inference phiên bản mới nhất hỗ trợ multi-model endpoints và serverless inference).

📘 Tài liệu tham khảo:

✅ Đáp án đúng và lý do lựa chọn

Đáp án đúng: Deploy an Amazon SageMaker AI endpoint. Configure auto scaling for the endpoint.

Lý do chi tiết:

  • 🛠️ SageMaker Endpoint là giải pháp managed service chuyên dụng cho real-time inference (near real-time predictions) với low latency (thường <1 giây). Nó tự động host model trên infrastructure tối ưu (như Inferentia/Trainium chips cho hiệu suất cao hơn 2026).
  • Auto scaling dựa trên metrics như CPU/GPU utilization hoặc request volume, tự động điều chỉnh instance count (scale out/in/up/down), xử lý variable request volumes mà không cần can thiệp thủ công.
  • ✅ Hoàn hảo match yêu cầu: Fully managed, serverless options (SageMaker Serverless Inference từ 2021, cập nhật 2026), hỗ trợ A/B testing, multi-model endpoints.
  • Không cần quản lý EC2, container hóa tự động qua Docker/TensorFlow/PyTorch.

❌ Giải thích tất cả các phương án (đúng/sai)

  • Create an Amazon SageMaker AI batch transform job to process inference requests in batches.
    ❌ Sai: Batch Transform dùng cho xử lý hàng loạt (batch processing), không phải real-time. Nó yêu cầu input từ S3, xử lý offline và output ra S3 – không hỗ trợ low latency hay near real-time. Phù hợp cho dữ liệu lớn nhưng không handle variable requests động.

  • Use Amazon API Gateway to receive prediction requests. Use an Amazon S3 bucket to host and serve the model.
    ❌ Sai: S3 chỉ lưu trữ object (model artifacts), không serve inference (không chạy model để predict). API Gateway chỉ route requests, thiếu runtime engine cho ML. Kết quả: high latency, không scale tự động, phải tự build backend phức tạp – vi phạm best practices AWS.

  • Deploy an Amazon SageMaker AI endpoint. Configure auto scaling for the endpoint.
    ✅ Đúng: Như giải thích trên, đây là giải pháp chuẩn AWS cho real-time ML inference với auto scaling tích hợp (Target Tracking Scaling trên CloudWatch metrics). Hỗ trợ provisioned concurrency cho low latency ổn định (cập nhật 2026).

  • Launch AWS Deep Learning AMIs (DLAMI) on two Amazon EC2 instances. Run the instances behind an Application Load Balancer.
    ❌ Sai: DLAMI + EC2 + ALB là self-managed, yêu cầu tự container hóa model, handle scaling thủ công (ASG + ALB). High operational overhead, latency cao hơn SageMaker (không optimize inference), khó handle variable volumes mượt mà. Không recommended cho production ML (2026 best practice: Dùng SageMaker thay vì raw EC2).

🧩 Kết luận: SageMaker Endpoint là lựa chọn DevOps-friendly nhất, giảm toil và chi phí (pay-per-use). Trong kỳ thi DOP-C02 (2026), câu này test kiến thức SageMaker vs. tự build infrastructure! 🚀

Câu 634
A company runs a neural network model and retrains the model when the performance degrades. The company uses a training job that uses Amazon SageMaker AI distributed data parallelism (DDP). The training job takes several hours to run.

The company wants to decrease the required time for the training job.

Which solution will meet this requirement?
  1. A Increase the number of epochs.
  2. B Increase the number of neurons in the hidden layers.
  3. C Increase the number of layers.
  4. D Increase the number of instances.
Xem giải thích

🧠 Phân tích chi tiết câu hỏi trắc nghiệm AWS SageMaker

📖 Nội dung câu hỏi được giải thích rõ ràng:
Câu hỏi mô tả một công ty đang chạy mô hình neural network (mạng nơ-ron) trên Amazon SageMaker, và họ retrain (huấn luyện lại) mô hình khi hiệu suất giảm sút. Quy trình huấn luyện sử dụng Amazon SageMaker AI distributed data parallelism (DDP) – một kỹ thuật phân tán dữ liệu song song để tăng tốc độ huấn luyện trên nhiều instance. Thời gian huấn luyện hiện tại mất vài giờ, và mục tiêu là giảm thời gian này một cách hiệu quả.
🛠️ Chủ đề chính: Tối ưu hóa thời gian huấn luyện (training job) trong SageMaker bằng DDP, tập trung vào scaling ngang (horizontal scaling) để xử lý dữ liệu lớn nhanh hơn, phù hợp với kiến thức cập nhật AWS SageMaker phiên bản mới nhất (2024-2026), nơi DDP hỗ trợ các instance ml.p4d/ml.p5 instances với GPU NVIDIA A100/H100 cho AI/ML workloads.

✅ Đáp án đúng: Increase the number of instances.
Lý do lựa chọn: Trong SageMaker DDP, việc tăng số lượng instances (scale out) sẽ phân tán dữ liệu huấn luyện song song qua nhiều node (instances), mỗi node xử lý một phần dữ liệu độc lập. Điều này giảm thời gian tổng thể theo nguyên tắc linear speedup (tăng tốc tuyến tính), ví dụ từ 1 instance mất 10 giờ xuống 4 instances chỉ còn ~2.5 giờ (giảm overhead communication). Đây là giải pháp trực tiếp, hiệu quả nhất cho DDP theo docs AWS mới nhất, không ảnh hưởng đến chất lượng mô hình.

🧩 Phân tích chi tiết TẤT CẢ các phương án (đúng/sai):

  • Increase the number of epochs.
    ❌ Sai. Tăng số epochs nghĩa là lặp lại toàn bộ quá trình huấn luyện nhiều lần hơn trên dataset, dẫn đến thời gian huấn luyện tăng lên đáng kể (có thể gấp đôi hoặc hơn). Điều này không giảm thời gian mà còn làm chậm job, trái ngược yêu cầu. Trong SageMaker DDP, epochs ảnh hưởng đến số vòng lặp, không liên quan đến parallelism.

  • Increase the number of neurons in the hidden layers.
    ❌ Sai. Tăng số neurons (nơ-ron) trong hidden layers làm mô hình phức tạp hơn, tăng số phép tính matrix multiplication và bộ nhớ GPU cần thiết. Kết quả là thời gian huấn luyện mỗi epoch tăng, đặc biệt trên DDP vì communication overhead giữa instances lớn hơn. Không giúp giảm thời gian tổng thể.

  • Increase the number of layers.
    ❌ Sai. Thêm layers (tầng) làm sâu mô hình hơn (deeper network), tăng độ sâu tính toán và thời gian forward/backward pass. Trong SageMaker DDP, điều này làm tăng workload per instance, dẫn đến training chậm hơn do model size lớn, không tận dụng parallelism hiệu quả.

  • Increase the number of instances.
    ✅ Đúng. Như đã giải thích, DDP trong SageMaker được thiết kế để scale data parallelism bằng cách tăng instances (ví dụ: từ 1 lên 8 ml.p5.48xlarge). Mỗi instance xử lý batch dữ liệu riêng, sync gradients qua ring-allreduce, giảm thời gian tuyến tính. Hỗ trợ tối đa 128 instances theo cập nhật 2025.

📘 Tài liệu tham khảo AWS (cập nhật mới nhất 2026):

  • AWS SageMaker Distributed Training Docs: Distributed Data Parallel (DDP) Training – Giải thích scaling với instances để giảm wall-clock time.
  • SageMaker AI Training Best Practices: Model Parallelism & Data Parallelism – Xác nhận increase instances là key cho DDP speedup.
  • AWS re:Invent 2024/2025 Sessions: Track ML – "Scaling Neural Networks with SageMaker DDP on P5 instances".
  • Exam Topic DOP-C02: Domain 3: Automation & Optimization – Scaling SageMaker jobs.

🛡️ Lưu ý: Giải pháp này giữ nguyên chất lượng mô hình, chỉ tối ưu thời gian. Nếu cần tune hyperparams, dùng SageMaker Automatic Model Tuning (AMT).

Câu 635
A healthcare company wants to detect irregularities in patient vital signs that could indicate early signs of a medical condition. The company has an unlabeled dataset that includes patient health records, medication history, and lifestyle changes.

Which algorithm and hyperparameter should the company use to meet this requirement?
  1. A Use the Amazon SageMaker AI XGBoost algorithm. Set max_depth to greater than 100 to regulate tree complexity.
  2. B Use the Amazon SageMaker AI k-means clustering algorithm. Set k to determine the number of clusters.
  3. C Use the Amazon SageMaker AI DeepAR algorithm. Set epochs to the number of training iterations.
  4. D Use the Amazon SageMaker AI Random Cut Forest (RCF) algorithm. Set num_trees to greater than 100.
Xem giải thích

🧩 Phân tích nội dung câu hỏi

Câu hỏi tập trung vào một công ty y tế muốn phát hiện các bất thường (irregularities/anomalies) trong dữ liệu dấu hiệu sinh tồn (patient vital signs) của bệnh nhân, nhằm nhận diện sớm các dấu hiệu bệnh lý. Họ sở hữu bộ dữ liệu không nhãn (unlabeled dataset) bao gồm hồ sơ sức khỏe bệnh nhân (patient health records), lịch sử dùng thuốc (medication history), và thay đổi lối sống (lifestyle changes).

🛠️ Yêu cầu chính: Chọn thuật toán và hyperparameter phù hợp trên Amazon SageMaker để xử lý nhiệm vụ phát hiện bất thường không giám sát (unsupervised anomaly detection). Đây là bài toán không cần nhãn dữ liệu, vì dữ liệu thực tế thường không có nhãn sẵn cho các trường hợp bất thường hiếm gặp. AWS SageMaker cung cấp các built-in algorithms cho ML, và phiên bản cập nhật đến 2026 vẫn hỗ trợ RCF như một lựa chọn tối ưu cho anomaly detection trên dữ liệu đa chiều, không thời gian (non-time-series).

✅ Đáp án đúng và lý do lựa chọn

Đáp án đúng: Use the Amazon SageMaker AI Random Cut Forest (RCF) algorithm. Set num_trees to greater than 100.

Lý do chi tiết 🏆:

  • Random Cut Forest (RCF) là thuật toán unsupervised anomaly detection được tích hợp sẵn trong Amazon SageMaker (SageMaker AI algorithms), chuyên dùng để phát hiện outliers/bất thường trong dữ liệu không nhãn. Nó xây dựng rừng cây ngẫu nhiên (random forest variant) bằng cách cắt không gian dữ liệu thành các cây, và tính điểm bất thường dựa trên đường dẫn dữ liệu qua rừng cây – phù hợp hoàn hảo với dữ liệu y tế đa chiều như hồ sơ sức khỏe, thuốc men, lối sống.
  • Hyperparameter num_trees > 100: Tăng số lượng cây (trees) giúp mô hình ổn định hơn, giảm nhiễu và cải thiện độ chính xác phát hiện anomaly (theo best practices AWS). Giá trị mặc định là 100, nhưng >100 khuyến khích cho dữ liệu phức tạp như y tế để tránh underfitting.
  • Đây là lựa chọn tối ưu vì không cần nhãn, xử lý dữ liệu lớn hiệu quả trên SageMaker, và AWS khuyến nghị RCF cho các use case như fraud detection hoặc medical anomaly (cập nhật 2024-2026).

📋 Phân tích tất cả các phương án

Dưới đây là phân tích từng lựa chọn, giữ nguyên văn bản gốc bằng tiếng Anh. Mỗi phương án được đánh giá đúng/sai với lý do cụ thể dựa trên đặc tính thuật toán SageMaker (phiên bản mới nhất 2026).

  1. Use the Amazon SageMaker AI XGBoost algorithm. Set max_depth to greater than 100 to regulate tree complexity.
    ❌ Sai: XGBoost là thuật toán supervised learning (phân loại/regression), yêu cầu dữ liệu có nhãn (labels) để huấn luyện – không phù hợp với unlabeled dataset. Hơn nữa, max_depth > 100 là quá lớn, gây overfitting nghiêm trọng (tree quá sâu, học nhiễu), trái ngược với mục đích "regulate tree complexity" (nên dùng max_depth thấp như 3-10). Không dùng cho anomaly detection.

  2. Use the Amazon SageMaker AI k-means clustering algorithm. Set k to determine the number of clusters.
    ❌ Sai: k-means là thuật toán unsupervised clustering, phân nhóm dữ liệu thành các cụm dựa trên khoảng cách, nhưng không chuyên phát hiện anomaly (chỉ coi điểm xa trung tâm cụm là outlier, kém chính xác với dữ liệu y tế phức tạp). k xác định số cụm, nhưng cần tuning thủ công và không trực tiếp đo lường anomaly score như RCF. Không phải lựa chọn tối ưu cho yêu cầu.

  3. Use the Amazon SageMaker AI DeepAR algorithm. Set epochs to the number of training iterations.
    ❌ Sai: DeepAR là thuật toán supervised time-series forecasting (dự báo chuỗi thời gian), yêu cầu dữ liệu có cấu trúc thời gian (time-stamped) và nhãn (target values) – không phù hợp với unlabeled dataset không thời gian như hồ sơ sức khỏe tĩnh. epochs chỉ là số lần lặp huấn luyện, không liên quan đến anomaly detection. Dùng cho dự báo, không phải phát hiện bất thường.

  4. Use the Amazon SageMaker AI Random Cut Forest (RCF) algorithm. Set num_trees to greater than 100.
    ✅ Đúng: Như đã giải thích ở trên, RCF lý tưởng cho unsupervised anomaly detection trên dữ liệu không nhãn, và num_trees > 100 tăng độ mạnh mẽ của mô hình.

📘 Tài liệu tham khảo (cập nhật AWS 2026)

Hy vọng phân tích này giúp bạn nắm vững! 🚀 Nếu cần demo code SageMaker RCF, hãy hỏi thêm nhé!