Ngân hàng đề — AWS Certified Machine Learning Engineer Associate
Tìm thấy 635 câu.
An ML engineer is developing a fraud detection model on AWS. The training dataset includes transaction logs, customer profiles, and tables from an on-premises MySQL database. The transaction logs and customer profiles are stored in Amazon S3.
The dataset has a class imbalance that affects the learning of the model's algorithm. Additionally, many of the features have interdependencies. The algorithm is not capturing all the desired underlying patterns in the data.
Before the ML engineer trains the model, the ML engineer must resolve the issue of the imbalanced data.
Which solution will meet this requirement with the LEAST operational effort?
- A Use Amazon Athena to identify patterns that contribute to the imbalance. Adjust the dataset accordingly.
- B Use Amazon SageMaker Studio Classic built-in algorithms to process the imbalanced dataset.
- C Use AWS Glue DataBrew built-in features to oversample the minority class.
- D Use the Amazon SageMaker Data Wrangler balance data operation to oversample the minority class.
Xem giải thích
🧩 Phân tích chi tiết nội dung câu hỏi
Câu hỏi thuộc case study về Machine Learning (ML) trên AWS, cụ thể là phát triển mô hình phát hiện gian lận (fraud detection). Một kỹ sư ML đang xây dựng mô hình với dataset bao gồm:
- Transaction logs và customer profiles lưu trữ trong Amazon S3.
- Bảng dữ liệu từ on-premises MySQL database.
Vấn đề chính:
- Dataset có class imbalance (mất cân bằng lớp), ảnh hưởng đến việc học của thuật toán.
- Nhiều features có interdependencies (tương quan lẫn nhau).
- Thuật toán chưa capture hết các pattern mong muốn.
Yêu cầu cốt lõi: Trước khi train model, phải giải quyết class imbalance (cụ thể là oversample minority class - tăng mẫu cho lớp thiểu số) với LEAST operational effort (ít nỗ lực vận hành nhất, ưu tiên giải pháp managed, no-code/low-code).
Mục tiêu: Chọn giải pháp tự động hóa cao, tích hợp sẵn trên AWS, không cần code phức tạp hay quản lý thủ công. 📘
✅ Đáp án đúng và lý do lựa chọn
Đáp án đúng: Use the Amazon SageMaker Data Wrangler balance data operation to oversample the minority class.
Lý do:
- Amazon SageMaker Data Wrangler là công cụ visual data preparation (chuẩn bị dữ liệu trực quan) trong SageMaker Studio, hỗ trợ built-in operation "Balance data" để tự động oversample minority class (tăng mẫu lớp thiểu số) hoặc undersample majority class, xử lý imbalance mà không cần code.
- Hoàn toàn no-code/low-code, tích hợp trực tiếp với S3 và JDBC (cho MySQL), import data dễ dàng, export dataset đã balance cho training.
- Least operational effort: Chỉ kéo-thả flows trong IDE, scale tự động, managed service - phù hợp nhất cho pre-training step. Phiên bản mới nhất (2024-2026) hỗ trợ ML-specific transforms như imbalance handling. 🛠️
📋 Giải thích tất cả các phương án (đúng/sai)
-
❌ [SAI] Use Amazon Athena to identify patterns that contribute to the imbalance. Adjust the dataset accordingly.
Phương án này không đúng vì Athena là dịch vụ serverless query trên S3 (SQL-like), chỉ dùng để phân tích/identify patterns (query imbalance ratios), không có built-in để oversample/adjust data. Cần code thủ công (Python/Spark) sau query, tốn effort cao (viết script, ETL riêng). Không giải quyết trực tiếp imbalance trước training. -
❌ [SAI] Use Amazon SageMaker Studio Classic built-in algorithms to process the imbalanced dataset.
Phương án không phù hợp vì built-in algorithms (như XGBoost, Linear Learner) trong SageMaker Studio Classic dùng để train model, không phải preprocess data. Một số algo có param nhưscale_pos_weighthandle imbalance trong training, nhưng câu hỏi yêu cầu resolve before training (preprocess dataset). Effort cao hơn vì phải config hyperparams, không visual/oversample trực tiếp. -
❌ [SAI] Use AWS Glue DataBrew built-in features to oversample the minority class.
Sai vì AWS Glue DataBrew là visual data preparation cho data quality (profiling, cleanses, sampling), nhưng không có built-in feature oversample minority class cụ thể cho imbalance (chỉ random sampling, không ML-aware như balance classes). Phiên bản 2026 vẫn tập trung data cleaning, không thay thế Data Wrangler cho ML workflows. Effort cao hơn do thiếu transform chuyên sâu. -
✅ [ĐÚNG] Use the Amazon SageMaker Data Wrangler balance data operation to oversample the minority class.
Như đã giải thích ở trên: Hoàn hảo cho yêu cầu, visual flow hỗ trợ oversample (SMOTE-like), tích hợp S3/MySQL, least effort. Export trực tiếp cho SageMaker training jobs. 🚀
📚 Tài liệu tham khảo (cập nhật mới nhất AWS 2026)
- SageMaker Data Wrangler: AWS Docs - Data Wrangler Transforms (Balance data operation chi tiết).
- Glue DataBrew Features: AWS Docs - DataBrew Recipes (Xác nhận không có oversample imbalance).
- SageMaker Best Practices for Imbalanced Data: AWS ML Blog - Handling Imbalanced Data (Khuyến nghị Data Wrangler).
- Exam Guide DOP-C02: Phần ML Ops nhấn mạnh managed data prep tools.
Giải pháp này đảm bảo scalable, cost-effective cho fraud detection pipeline! 🔍
An ML engineer is developing a fraud detection model on AWS. The training dataset includes transaction logs, customer profiles, and tables from an on-premises MySQL database. The transaction logs and customer profiles are stored in Amazon S3.
The dataset has a class imbalance that affects the learning of the model's algorithm. Additionally, many of the features have interdependencies. The algorithm is not capturing all the desired underlying patterns in the data.
The ML engineer needs to use an Amazon SageMaker built-in algorithm to train the model.
Which algorithm should the ML engineer use to meet this requirement?
- A LightGBM
- B Linear learner
- C К-means clustering
- D Neural Topic Model (NTM)
Xem giải thích
🧩 Phân tích chi tiết nội dung câu hỏi
Câu hỏi thuộc case study về phát triển mô hình phát hiện gian lận (fraud detection) trên AWS, sử dụng Amazon SageMaker với built-in algorithm.
📊 Dữ liệu đầu vào:
- Transaction logs và customer profiles lưu trữ trên Amazon S3.
- Tables từ on-premises MySQL database (cần migrate hoặc integrate vào SageMaker).
🔍 Thách thức chính:
- Class imbalance: Dữ liệu không cân bằng giữa lớp gian lận (ít) và không gian lận (nhiều), ảnh hưởng đến học máy.
- Interdependencies giữa features: Các đặc trưng có mối quan hệ phức tạp lẫn nhau.
- Algorithm hiện tại không capture hết patterns: Cần algorithm mạnh mẽ hơn để phát hiện mẫu ẩn.
🎯 Yêu cầu: Chọn SageMaker built-in algorithm phù hợp để train model (dành cho supervised classification, tabular data như transaction logs).
(Kiến thức cập nhật: SageMaker built-in algorithms phiên bản mới nhất 2024-2026 vẫn hỗ trợ LightGBM qua SageMaker JumpStart và BlazingText, theo AWS re:Invent 2024 và docs SageMaker Algorithms.)
✅ Đáp án đúng: LightGBM
Lý do lựa chọn:
LightGBM là gradient boosting framework built-in trong SageMaker, hoàn hảo cho tabular data như fraud detection. Nó xử lý xuất sắc class imbalance qua tham số scale_pos_weight, captures feature interactions nhờ cây quyết định (tree-based) với leaf-wise growth, giúp mô hình học sâu patterns phức tạp. SageMaker hỗ trợ training nhanh trên GPU/CPU, tích hợp S3 và data từ MySQL (qua SageMaker Processing). Đây là lựa chọn tối ưu cho binary classification với imbalance và dependencies.
(Nguồn: AWS SageMaker Docs - LightGBM Algorithm: https://docs.aws.amazon.com/sagemaker/latest/dg/lightgbm.html)
📋 Giải thích tất cả các phương án (sử dụng emoji đánh dấu đúng/sai)
-
✅ LightGBM (ĐÚNG):
🛠️ Algorithm gradient boosting mạnh mẽ, built-in SageMaker, tự động xử lý class imbalance (scale_pos_weight), feature interdependencies (tree splits sâu), và capture patterns ẩn tốt hơn linear models. Lý tưởng cho fraud detection tabular data từ S3/MySQL. Training hiệu quả, scalable đến 2026. -
❌ Linear learner (SAI):
🧮 Chỉ là linear model (logistic regression hoặc linear regression), không xử lý tốt non-linear interactions giữa features (giả định độc lập tuyến tính). Với class imbalance và complex patterns, hiệu suất kém; cần feature engineering thủ công. Không phù hợp fraud detection phức tạp. -
❌ K-means clustering (SAI):
🔍 Unsupervised clustering algorithm, dùng để phân nhóm dữ liệu mà không cần labels (không phải classification). Không giải quyết class imbalance (vì không supervised), không capture supervised patterns cho fraud detection. SageMaker dùng cho exploration, không train model phân loại. -
❌ Neural Topic Model (NTM) (SAI):
🗨️ Unsupervised topic modeling cho text data (như LDA neural), trích xuất topics từ documents. Không dành cho tabular/transaction data, classification, hoặc class imbalance. Hoàn toàn không liên quan đến fraud detection từ S3/MySQL.
📘 Tài liệu tham khảo chính
- SageMaker Built-in Algorithms: https://docs.aws.amazon.com/sagemaker/latest/dg/algos.html (LightGBM được recommend cho tabular classification).
- Fraud Detection Best Practices: AWS Machine Learning Blog - "Fraud Detection with SageMaker" (2024): https://aws.amazon.com/blogs/machine-learning/.
- Handling Imbalance in SageMaker: https://docs.aws.amazon.com/sagemaker/latest/dg/imbalanced-data.html (LightGBM hỗ trợ tốt nhất).
Hy vọng phân tích này giúp bạn ôn thi DOP-C02 hiệu quả! 🚀 Nếu cần code sample SageMaker LightGBM, hãy hỏi thêm.
During a baseline analysis of model quality, the company recorded a threshold for the F1 score. After several months of no change, the model's F1 score decreases significantly.
What could be the reason for the reduced F1 score?
- A Concept drift occurred in the underlying customer data that was used for predictions.
- B The model was not sufficiently complex to capture all the patterns in the original baseline data.
- C The original baseline data had a data quality issue of missing values.
- D Incorrect ground truth labels were provided to Model Monitor during the calculation of the baseline.
Xem giải thích
🧩 Phân tích chi tiết nội dung câu hỏi
Câu hỏi này xoay quanh Amazon SageMaker Model Monitor, một công cụ mạnh mẽ của AWS dùng để giám sát chất lượng mô hình machine learning (ML) trong môi trường production. Cụ thể:
- Công ty đã triển khai mô hình dự đoán XGBoost trên Amazon SageMaker để dự đoán khả năng khách hàng hủy đăng ký (churn prediction).
- Họ sử dụng Model Monitor để phát hiện sự lệch lạc (deviations) trong chỉ số F1 score – một metric đánh giá chất lượng mô hình cân bằng giữa precision và recall, rất phù hợp cho bài toán classification không cân bằng như churn.
- Trong phân tích baseline (dữ liệu gốc để thiết lập ngưỡng), họ đã ghi nhận một threshold cho F1 score.
- Sau vài tháng không có thay đổi gì (model và dữ liệu đầu vào ổn định), F1 score giảm đáng kể.
🛠️ Vấn đề cốt lõi: Tại sao F1 score (chất lượng dự đoán) giảm sau thời gian dài ổn định? Điều này chỉ ra vấn đề drift (sự thay đổi dữ liệu theo thời gian), không phải lỗi ban đầu của mô hình hoặc baseline. SageMaker Model Monitor (cập nhật đến 2026) hỗ trợ phát hiện concept drift (thay đổi mối quan hệ input-output) và data drift (thay đổi phân phối input), thông qua metrics như F1 score so với baseline.
✅ Đáp án đúng và lý do lựa chọn
Đáp án đúng: Concept drift occurred in the underlying customer data that was used for predictions.
Lý do chi tiết:
🧠 Concept drift xảy ra khi mối quan hệ giữa dữ liệu đầu vào (customer features) và nhãn đầu ra (churn hay không) thay đổi theo thời gian thực tế, ví dụ: hành vi khách hàng thay đổi do kinh tế, mùa vụ, hoặc sự kiện bên ngoài (như đại dịch). Model được huấn luyện trên dữ liệu cũ không còn "hiểu" dữ liệu mới → F1 score giảm.
- Baseline ổn định vài tháng → Không phải vấn đề model/data ban đầu.
- Model Monitor phát hiện deviation trên F1 score (model quality metric), chính xác chỉ ra concept drift (không phải data drift thuần túy).
- Đây là kịch bản kinh điển trong SageMaker (phiên bản 2026 vẫn giữ nguyên), khuyến nghị retrain model định kỳ.
📋 Giải thích tất cả các phương án (đúng/sai)
Dưới đây là phân tích từng lựa chọn, giữ nguyên văn bản gốc bằng tiếng Anh:
-
✅ Concept drift occurred in the underlying customer data that was used for predictions.
🟢 Đúng: Như giải thích trên, concept drift gây giảm F1 score sau thời gian dài vì dữ liệu production thay đổi dần dần. Model Monitor sử dụng ground truth labels để tính F1 và so sánh với baseline, phát hiện drift này hiệu quả. -
❌ The model was not sufficiently complex to capture all the patterns in the original baseline data.
🔴 Sai: Nếu model thiếu phức tạp (underfitting), F1 score sẽ thấp ngay từ baseline và không cải thiện theo thời gian. Vấn đề xảy ra sau vài tháng → Không liên quan đến độ phức tạp model. -
❌ The original baseline data had a data quality issue of missing values.
🔴 Sai: Vấn đề chất lượng dữ liệu (missing values) sẽ làm baseline F1 score thấp ngay từ đầu, và threshold được đặt dựa trên đó. Sau vài tháng ổn định → Không phải nguyên nhân gây giảm đột ngột. -
❌ Incorrect ground truth labels were provided to Model Monitor during the calculation of the baseline.
🔴 Sai: Ground truth sai chỉ ảnh hưởng baseline calculation (threshold sai), dẫn đến false alarm ngay lập tức. Model Monitor cần ground truth đúng để đánh giá F1; vấn đề này không giải thích giảm F1 sau thời gian ổn định.
📘 Tài liệu tham khảo (cập nhật AWS 2026)
- AWS SageMaker Model Monitor Documentation: Amazon SageMaker Model Monitor – Chi tiết về detecting concept drift và F1 score metrics.
- SageMaker Clarify & Model Monitor Best Practices: Model Quality Monitoring – Ví dụ churn prediction với drift detection.
- AWS Certified DevOps Engineer Professional Exam Guide (2026): Bao quát SageMaker operations, drift handling trong DOP-C02.
Hy vọng phân tích này giúp bạn nắm vững! 🚀 Nếu cần đào sâu thêm, hãy hỏi nhé!
The company needs to centralize management of the team's permissions.
Which solution will meet this requirement?
- A Create a single IAM role that has the necessary permissions. Attach the role to each notebook instance that the team uses.
- B Create a single IAM group. Add the data scientists to the group. Associate the group with each notebook instance that the team uses.
- C Create a single IAM user. Attach the AdministratorAccess AWS managed IAM policy to the user. Configure each notebook instance to use the IAM user.
- D Create a single IAM group. Add the data scientists to the group. Create an IAM role. Attach the AdministratorAccess AWS managed IAM policy to the role. Associate the role with the group. Associate the group with each notebook instance that the team uses.
Xem giải thích
🧩 Phân tích chi tiết nội dung câu hỏi
Câu hỏi xoay quanh việc quản lý tập trung quyền truy cập (permissions) cho đội ngũ data scientists sử dụng Amazon SageMaker notebook instances trên AWS.
-
Bối cảnh hiện tại 📝: Đội ngũ data scientists sử dụng SageMaker notebook instances để thử nghiệm mô hình ML. Mỗi khi cần quyền mới (ví dụ: truy cập S3, EC2, hoặc các dịch vụ khác), công ty phải gắn permissions trực tiếp vào từng IAM role riêng lẻ được tạo lúc khởi tạo notebook instance. Điều này dẫn đến tình trạng phân tán, khó quản lý khi scale đội ngũ hoặc thay đổi quyền.
-
Yêu cầu 🎯: Cần một giải pháp tập trung hóa (centralize) quản lý permissions cho toàn đội, giúp dễ dàng cập nhật quyền một lần cho tất cả notebook instances mà không phải chỉnh sửa từng cái riêng lẻ.
-
Kiến thức cốt lõi liên quan 🛠️: SageMaker notebook instances hoạt động dựa trên IAM Execution Role (role được chỉ định lúc tạo instance). Role này quyết định permissions mà notebook có thể thực hiện khi gọi AWS services (như đọc/ghi S3, train models). Theo tài liệu AWS mới nhất (2024-2026), SageMaker hỗ trợ chỉ associate một IAM role duy nhất với mỗi notebook instance, không hỗ trợ trực tiếp IAM groups hoặc users cho execution context của notebook. Centralize đạt được bằng cách reuse một role chung (least privilege principle).
✅ Đáp án đúng và lý do lựa chọn
Đáp án đúng: Create a single IAM role that has the necessary permissions. Attach the role to each notebook instance that the team uses.
Lý do chi tiết 🏆:
- Giải pháp này tập trung hoàn hảo bằng cách tạo một IAM role duy nhất chứa tất cả permissions cần thiết (custom policy hoặc managed policies phù hợp).
- Khi tạo hoặc cập nhật notebook instance, chỉ cần attach role này vào tất cả instances của đội ngũ. Bất kỳ thay đổi permissions nào (add/remove policy) chỉ cần làm một lần trên role chung → scale dễ dàng, tuân thủ nguyên tắc least privilege và IAM best practices.
- SageMaker notebook chính thức hỗ trợ cơ chế này: Execution role được dùng cho kernel execution, API calls từ notebook. Không cần tạo role riêng cho từng user/notebook.
- Cập nhật mới nhất (2026): AWS khuyến nghị sử dụng SageMaker Studio thay notebook instances truyền thống cho quản lý tốt hơn, nhưng với notebook instances, cách này vẫn là standard (không thay đổi).
📋 Giải thích tất cả các phương án (đúng/sai)
-
✅ Create a single IAM role that has the necessary permissions. Attach the role to each notebook instance that the team uses.
(Đã giải thích ở trên - Đây là giải pháp chuẩn, centralize hiệu quả qua IAM role reuse). -
❌ Create a single IAM group. Add the data scientists to the group. Associate the group with each notebook instance that the team uses.
Lý do sai 🚫: IAM groups chỉ dùng cho quản lý users con người (console/CLI access), không thể associate trực tiếp với SageMaker notebook instances. Notebook không "thuộc" group; nó chỉ chấp nhận IAM role cho execution. Giải pháp này sẽ fail khi tạo/update instance (lỗi permission denied). -
❌ Create a single IAM user. Attach the AdministratorAccess AWS managed IAM policy to the user. Configure each notebook instance to use the IAM user.
Lý do sai 🚫: SageMaker notebook không hỗ trợ IAM user cho execution role (chỉ chấp nhận IAM role). Sử dụng user sẽ vi phạm security best practices (users không dành cho services). AdministratorAccess quá rộng (god-mode), không least privilege. Cấu hình sẽ lỗi ngay từ bước tạo instance. -
❌ Create a single IAM group. Add the data scientists to the group. Create an IAM role. Attach the AdministratorAccess AWS managed IAM policy to the role. Associate the role with the group. Associate the group with each notebook instance that the team uses.
Lý do sai 🚫: Kết hợp group + role sai cấu trúc. IAM không cho phép associate role với group (groups chỉ chứa users). Notebook không associate với group mà chỉ với role. AdministratorAccess quá permissive (rủi ro cao). Giải pháp phức tạp vô ích, sẽ fail validation.
📘 Tài liệu tham khảo (AWS Official - Cập nhật 2024-2026)
- SageMaker IAM Roles: docs.aws.amazon.com/sagemaker/latest/dg/sagemaker-roles.html → Xác nhận execution role là bắt buộc cho notebooks.
- Notebook Instance Creation: docs.aws.amazon.com/sagemaker/latest/dg/nbi-iam-role.html → Hướng dẫn attach single role.
- IAM Best Practices: docs.aws.amazon.com/IAM/latest/UserGuide/best-practices.html → Nhấn mạnh roles cho services, tránh users/groups.
- SageMaker Studio (Alternative): docs.aws.amazon.com/sagemaker/latest/dg/studio-iam.html → Nâng cấp từ notebooks với domain-level roles (tương lai 2026).
Giải pháp này giúp công ty tiết kiệm thời gian, an toàn cao! Nếu cần demo code Terraform/CLI, hỏi thêm nhé 🚀.
Which metric should the ML engineer use to evaluate the model's performance?
- A Accuracy
- B Area Under the ROC Curve (AUC)
- C F1 score
- D Mean absolute error (MAE)
Xem giải thích
🧩 Phân tích chi tiết câu hỏi
Câu hỏi tập trung vào việc đánh giá hiệu suất của mô hình Machine Learning (ML) trong nhiệm vụ dự đoán giá căn hộ tại một vị trí cụ thể. Đây là bài toán regression (hồi quy), vì giá căn hộ là giá trị liên tục (continuous), không phải phân loại (classification) nhị phân hay đa lớp. ML engineer cần chọn metric phù hợp nhất để đo lường độ chính xác giữa giá dự đoán và giá thực tế. Trong AWS, các metric này thường được sử dụng qua Amazon SageMaker (như trong SageMaker Processing Jobs hoặc Model Monitor) để đánh giá mô hình regression, giúp tối ưu hóa và triển khai production-ready theo best practices DevOps (CI/CD với SageMaker Pipelines).
✅ Đáp án đúng: Mean absolute error (MAE)
Lý do chọn MAE làm đáp án đúng:
MAE là metric lý tưởng cho regression vì nó tính trung bình độ lệch tuyệt đối giữa giá trị dự đoán và thực tế (MAE = (1/n) * Σ |y_true - y_pred|). Metric này dễ diễn giải (đơn vị giống giá căn hộ, ví dụ: "lệch trung bình 10.000 USD"), không bị ảnh hưởng nặng bởi outlier như MSE, và phù hợp với business context như dự đoán giá bất động sản. Trong AWS SageMaker (phiên bản mới nhất 2026), MAE được hỗ trợ mặc định trong built-in algorithms (như Linear Learner, XGBoost) và SageMaker Clarify cho bias detection. Sử dụng MAE giúp engineer dễ dàng A/B testing và deploy mô hình qua SageMaker Endpoints.
📘 Tài liệu tham khảo:
- AWS SageMaker Documentation: Regression Metrics (cập nhật 2025-2026).
- AWS ML Best Practices: Evaluating Regression Models.
🛠️ Giải thích tất cả các phương án
-
Accuracy ❌ Sai:
Accuracy đo tỷ lệ dự đoán đúng (correct predictions / total), chỉ phù hợp cho classification (ví dụ: phân loại căn hộ đắt/rẻ). Với regression như giá căn hộ, không có "đúng/sai" nhị phân, nên Accuracy vô nghĩa và không áp dụng. Trong SageMaker, nó chỉ dùng cho classification algorithms như Object Detection. -
Area Under the ROC Curve (AUC) ❌ Sai:
AUC đo khả năng phân biệt lớp dựa trên ROC curve (True Positive Rate vs False Positive Rate), dành riêng cho binary classification (ví dụ: dự đoán "mua/không mua"). Không dùng cho regression continuous như giá, vì không có threshold-based scoring. SageMaker hỗ trợ AUC qua BinaryClassificationMetrics, không phải regression. -
F1 score ❌ Sai:
F1 score là harmonic mean của Precision và Recall, dùng cho imbalanced classification (ví dụ: phát hiện gian lận giao dịch). Với regression giá căn hộ, không có precision/recall, nên F1 không liên quan. Trong SageMaker Model Monitor (2026), F1 chỉ báo cáo cho classification tasks. -
Mean absolute error (MAE) ✅ Đúng:
Như đã giải thích ở trên, MAE là metric chuẩn cho regression, trực quan và robust với outliers (phù hợp giá bất động sản biến động). SageMaker tích hợp sẵn MAE trong evaluation scripts và automatic model tuning.
🧠 Lưu ý DevOps: Trong pipeline AWS, dùng MAE để trigger alerts qua Amazon CloudWatch nếu model drift > threshold, đảm bảo MLOps scalable đến 2026 standards!
What should the ML engineer do to improve the training process?
- A Introduce early stopping.
- B Increase the size of the test set.
- C Increase the learning rate.
- D Decrease the learning rate.
Xem giải thích
🧩 Phân tích nội dung câu hỏi
Câu hỏi mô tả một tình huống phổ biến trong huấn luyện mô hình học máy (ML) trên nền tảng AWS, cụ thể là sử dụng Amazon SageMaker để train neural network với thuật toán Stochastic Gradient Descent (SGD).
- Vấn đề chính: Mô hình hoạt động kém trên tập test (test set).
- Triệu chứng cụ thể:
- Giá trị training loss (loss trên tập huấn luyện) và validation loss (loss trên tập kiểm tra chéo) đều cao (chỉ ra underfitting - mô hình chưa học tốt).
- Pattern dao động (oscillating): Loss giảm trong vài epoch, sau đó tăng lên trong vài epoch khác, rồi lặp lại chu kỳ này.
Điều này thường xảy ra trong các training job trên SageMaker khi hyperparameters không tối ưu, đặc biệt là learning rate trong optimizer SGD. Mục tiêu là cải thiện quá trình training để loss giảm dần và ổn định, giúp mô hình generalize tốt hơn trên test set. Đây là kiến thức cơ bản trong SageMaker Training và Hyperparameter Tuning (phiên bản cập nhật đến 2026, hỗ trợ tích hợp với SageMaker JumpStart và Autotuning).
✅ Đáp án đúng: Decrease the learning rate
Lý do chọn đáp án này:
- Với SGD, learning rate (LR) quyết định kích thước bước cập nhật weights. LR quá cao khiến gradient descent "nhảy qua" minima (điểm tối ưu), gây overshooting → loss dao động mạnh (giảm rồi tăng lặp lại) và không converge.
- Giảm LR giúp các bước cập nhật nhỏ hơn, mượt mà hơn, loss giảm dần ổn định, cải thiện underfitting.
- Trong SageMaker (cập nhật 2026), bạn có thể điều chỉnh LR qua Hyperparameter Tuning Jobs với Bayesian Optimization hoặc thủ công trong training script (ví dụ:
optimizer = torch.optim.SGD(lr=0.001)giảm từ 0.1 xuống 0.01). - Kết quả: Mô hình train tốt hơn, performance trên test set cải thiện đáng kể. 🛠️
📋 Giải thích chi tiết tất cả các lựa chọn
Dưới đây là phân tích từng phương án dựa trên best practices ML trên AWS SageMaker (không thay đổi cơ bản đến 2026). Tôi giữ nguyên text tiếng Anh của lựa chọn, chỉ giải thích bằng tiếng Việt:
-
❌ [SAI] Introduce early stopping.
Lý do sai: Early stopping dùng để tránh overfitting (khi validation loss tăng sau khi training loss giảm). Ở đây, cả hai loss đều cao và dao động → underfitting, chưa đạt minima. Early stopping có thể dừng sớm, bỏ lỡ cơ hội học thêm, làm tình trạng tệ hơn. Trong SageMaker, early stopping (qua SageMaker Debugger hoặc callbacks) phù hợp cho overfitting, không phải trường hợp này. 🚫 -
❌ [SAI] Increase the size of the test set.
Lý do sai: Test set chỉ dùng đánh giá cuối cùng, không ảnh hưởng đến quá trình training (loss curve). Vấn đề nằm ở training/validation phase (underfitting và oscillate), tăng test set chỉ làm evaluation chính xác hơn nhưng không fix root cause. SageMaker khuyến nghị tách rõ train/val/test (ví dụ: 70/15/15), nhưng không giải quyết dao động loss. 📊 -
❌ [SAI] Increase the learning rate.
Lý do sai: LR đã cao (gây oscillate do overshooting), tăng thêm sẽ làm dao động mạnh hơn, loss "nhảy múa" dữ dội, diverge hoàn toàn. SGD với LR cao (>0.1 thường) không ổn định. SageMaker Hyperparameter Tuning sẽ tự động thử giảm LR nếu detect oscillate qua metrics. Tệ hại! 🔴 -
✅ [ĐÚNG] Decrease the learning rate.
(Đã giải thích chi tiết ở phần trên: Fix trực tiếp oscillate, cải thiện convergence. Hoàn hảo cho SGD trên SageMaker!) 🎯
📘 Tài liệu tham khảo (cập nhật AWS 2026)
- AWS SageMaker Documentation: Hyperparameter Tuning & Debugging Training Issues – Hướng dẫn detect oscillate loss và tune LR.
- Deep Learning Book (Goodfellow et al.): Chương 8 – SGD và Learning Rate Schedules.
- SageMaker Examples: Built-in Algorithms SGD Tuning – Code mẫu PyTorch/TensorFlow với LR decay.
- AWS re:Invent 2025/2026: Sessions về SageMaker Canvas & Autotuning nhấn mạnh LR optimization cho neural nets.
Áp dụng ngay để training job SageMaker của bạn mượt mà hơn nhé! 🚀
Which solution will meet these requirements with the LEAST operational overhead?
- A Use an Amazon Athena CREATE TABLE AS SELECT (CTAS) statement to create a table based on the transaction date from data in the central S3 bucket. Query the objects from the table.
- B Create a new S3 bucket for processed data. Set up S3 replication from the central S3 bucket to the new S3 bucket. Use S3 Object Lambda to query the objects based on transaction date.
- C Create a new S3 bucket for processed data. Use AWS Glue for Apache Spark to create a job to query the CSV objects based on transaction date. Configure the job to store the results in the new S3 bucket. Query the objects from the new S3 bucket.
- D Create a new S3 bucket for processed data. Use Amazon Data Firehose to transfer the data from the central S3 bucket to the new S3 bucket. Configure Firehose to run an AWS Lambda function to query the data based on transaction date.
Xem giải thích
🧩 Giải thích nội dung câu hỏi
Câu hỏi tập trung vào một kỹ sư ML cần xử lý hàng nghìn file CSV hiện có và các file mới được upload vào một Amazon S3 bucket trung tâm. Các file CSV này có cùng số lượng cột, trong đó có một cột là transaction date (ngày giao dịch). Yêu cầu chính là query dữ liệu dựa trên transaction date một cách hiệu quả. Giải pháp phải đáp ứng với LEAST operational overhead (ít chi phí vận hành nhất), nghĩa là giảm thiểu việc quản lý tài nguyên, code tùy chỉnh, di chuyển dữ liệu hoặc thiết lập phức tạp.
🛠️ Yêu cầu kỹ thuật chính:
- Hỗ trợ dữ liệu tồn tại (existing) và mới (new uploads).
- Query nhanh chóng dựa trên ngày giao dịch mà không cần ETL nặng nề.
- Tận dụng S3 làm nguồn dữ liệu trung tâm, tránh copy dữ liệu không cần thiết.
📘 Kiến thức AWS liên quan (cập nhật đến 2026): Amazon Athena là dịch vụ serverless query trực tiếp trên S3 với SQL, hỗ trợ partitioning để tối ưu query theo date. Không cần quản lý cluster, tự động scale, phù hợp nhất cho trường hợp này.
✅ Đáp án đúng và lý do lựa chọn
Đáp án đúng: Use an Amazon Athena CREATE TABLE AS SELECT (CTAS) statement to create a table based on the transaction date from data in the central S3 bucket. Query the objects from the table.
Lý do chọn 🏆:
- Athena cho phép query trực tiếp trên S3 mà không di chuyển dữ liệu, sử dụng CTAS để tạo bảng partitioned theo
transaction date(ví dụ: PARTITIONED BY (transaction_date STRING)). Điều này tối ưu hóa query (chỉ scan partition cần thiết), hỗ trợ cả dữ liệu cũ và mới (Athena tự phát hiện partition mới qua Glue Catalog hoặc MSCK REPAIR TABLE). - Least operational overhead: Serverless, không cần code ETL, không quản lý job/schedule, chi phí chỉ tính theo dữ liệu scan. Hoàn hảo cho CSV với schema cố định.
- Hỗ trợ federated query và tích hợp Glue Data Catalog để tự động crawl dữ liệu mới.
🔍 Phân tích tất cả các phương án
Dưới đây là phân tích chi tiết từng lựa chọn, giữ nguyên nội dung gốc bằng tiếng Anh. Mỗi phương án được đánh giá ✅ (đúng) hoặc ❌ (sai), kèm giải thích lý do bằng tiếng Việt.
-
Use an Amazon Athena CREATE TABLE AS SELECT (CTAS) statement to create a table based on the transaction date from data in the central S3 bucket. Query the objects from the table.
✅ Đúng 🥇: Như đã giải thích ở trên, CTAS tạo bảng partitioned trên S3 gốc, query nhanh với partition pruning. Overhead thấp nhất vì serverless và native hỗ trợ S3 + SQL. -
Create a new S3 bucket for processed data. Set up S3 replication from the central S3 bucket to the new S3 bucket. Use S3 Object Lambda to query the objects based on transaction date.
❌ Sai 🚫: S3 Replication chỉ copy dữ liệu (không query), còn S3 Object Lambda dùng để transform on-the-fly (như filter/parse CSV bằng Lambda), nhưng không phải để query SQL phức tạp theo date. Overhead cao: quản lý Lambda code, replication rule, bucket mới, và performance kém với hàng nghìn file lớn. -
Create a new S3 bucket for processed data. Use AWS Glue for Apache Spark to create a job to query the CSV objects based on transaction date. Configure the job to store the results in the new S3 bucket. Query the objects from the new S3 bucket.
❌ Sai 🚫: AWS Glue Spark mạnh cho ETL batch, nhưng cần tạo job, script PySpark/SQL, schedule trigger (EventBridge/S3 event), quản lý crawler catalog. Overhead lớn: di chuyển dữ liệu sang bucket mới, chi phí compute cao hơn Athena, không serverless hoàn toàn cho query ad-hoc. -
Create a new S3 bucket for processed data. Use Amazon Data Firehose to transfer the data from the central S3 bucket to the new S3 bucket. Configure Firehose to run an AWS Lambda function to query the data based on transaction date.
❌ Sai 🚫: Kinesis Data Firehose dành cho streaming data (không phù hợp existing objects), chỉ trigger Lambda để transform (không query/filter theo date phức tạp). Không hỗ trợ batch xử lý hàng nghìn file cũ; overhead cao với bucket mới, Lambda code, và không query được từ Firehose output.
📚 Tài liệu tham khảo (AWS Docs cập nhật 2026)
- Amazon Athena CTAS & Partitioning: https://docs.aws.amazon.com/athena/latest/ug/ctas.html & Partitioning.
- S3 Object Lambda limits: https://docs.aws.amazon.com/AmazonS3/latest/userguide/obj-lambda.html.
- AWS Glue vs Athena comparison: https://aws.amazon.com/blogs/big-data/choose-between-aws-glue-and-amazon-athena/.
- Kinesis Data Firehose: https://docs.aws.amazon.com/firehose/latest/dev/data-transformation.html.
Giải pháp Athena là lựa chọn tối ưu nhất cho DevOps/ML workflow trên S3! 🚀
Which solution on AWS will detect duplicates in the dataset with the LEAST code development?
- A Use Amazon Mechanical Turk jobs to detect duplicates.
- B Use Amazon QuickSight ML Insights to build a custom deduplication model.
- C Use Amazon SageMaker Data Wrangler to pre-process and detect duplicates.
- D Use the AWS Glue FindMatches transform to detect duplicates.
Xem giải thích
🧩 Giải thích nội dung câu hỏi
Câu hỏi tập trung vào một công ty sở hữu bộ dữ liệu lớn, không cấu trúc (unstructured dataset), chứa nhiều bản ghi trùng lặp (duplicate records) trên nhiều thuộc tính chính (key attributes). Yêu cầu tìm giải pháp AWS phát hiện trùng lặp với ÍT NHẤT sự phát triển code (LEAST code development).
✅ Điều này nhấn mạnh vào dịch vụ AWS tích hợp sẵn ML (Machine Learning) để xử lý fuzzy matching (khớp gần đúng, không chỉ khớp chính xác), phù hợp với dữ liệu lớn và không cấu trúc, mà không cần viết nhiều code tùy chỉnh.
🛠️ Chủ đề thuộc lĩnh vực ETL (Extract, Transform, Load) và data preparation trên AWS, đặc biệt với dữ liệu lớn (big data).
✅ Đáp án đúng: Use the AWS Glue FindMatches transform to detect duplicates.
Lý do lựa chọn: AWS Glue FindMatches là transform tích hợp sẵn trong AWS Glue (dịch vụ ETL serverless), sử dụng ML để tự động phát hiện trùng lặp gần đúng (fuzzy duplicates) trên dữ liệu lớn mà không cần viết code phức tạp. Bạn chỉ cần định nghĩa schema và primary keys qua Glue Job hoặc Crawler, sau đó chạy transform – đây là giải pháp ít code nhất (low-code/no-code). Phù hợp hoàn hảo với unstructured dataset lớn, hỗ trợ scale tự động trên Spark engine. (Cập nhật đến 2026: Vẫn là feature cốt lõi của AWS Glue 4.0+ với cải tiến ML accuracy).
📋 Phân tích tất cả các phương án
Dưới đây là giải thích chi tiết từng lựa chọn, đánh dấu ✅ đúng hoặc ❌ sai, với lý do dựa trên tính năng AWS mới nhất:
-
❌ Use Amazon Mechanical Turk jobs to detect duplicates.
Sai vì: Amazon Mechanical Turk (MTurk) là nền tảng crowdsourcing thủ công, dùng con người để đánh giá trùng lặp. Với dataset lớn, cần viết code tùy chỉnh để tạo HITs (Human Intelligence Tasks), tích hợp API, và xử lý kết quả – rất nhiều code development, không scale tốt, tốn kém, và không tự động cho unstructured data. Không phải giải pháp ML tự động. -
❌ Use Amazon QuickSight ML Insights to build a custom deduplication model.
Sai vì: Amazon QuickSight ML Insights dùng cho visualization và anomaly detection trên dữ liệu đã cấu trúc, không hỗ trợ build custom deduplication model trực tiếp. Để phát hiện duplicates, phải export data, viết script tùy chỉnh trong QuickSight hoặc tích hợp ML bên ngoài – yêu cầu nhiều code, không tối ưu cho large unstructured dataset. -
❌ Use Amazon SageMaker Data Wrangler to pre-process and detect duplicates.
Sai vì: SageMaker Data Wrangler là tool low-code cho data prep (transform, featurize), nhưng phát hiện duplicates chỉ hỗ trợ basic exact matching qua flows, không có ML fuzzy matching sẵn. Cần thêm custom code Python/Pandas hoặc tích hợp SageMaker ML models – nhiều code hơn so với Glue FindMatches, dù tốt cho prototyping nhưng không ít code nhất cho production-scale. -
✅ Use the AWS Glue FindMatches transform to detect duplicates.
Đúng vì: Như đã giải thích, đây là giải pháp tích hợp ML fuzzy matching trong AWS Glue ETL jobs. Chỉ cần config JSON rules (primary keys, confidence score), chạy job serverless – zero-to-minimal code. Xử lý hàng tỷ records unstructured, tự động scale, tích hợp Lake Formation/S3/Catalog. Hiệu quả nhất cho yêu cầu.
📘 Tài liệu tham khảo (cập nhật AWS 2026):
- AWS Glue FindMatches: docs.aws.amazon.com/glue/latest/dg/find-matches-transform.html 🛠️ (Hướng dẫn chi tiết transform và ML model).
- AWS Well-Architected Framework - Data Analytics Lens: aws.amazon.com/architecture/well-architected 📘 (Khuyến nghị cho deduplication).
- AWS re:Post & Blog: Tìm "Glue FindDuplicates" cho case studies thực tế (Glue 4.0 hỗ trợ Spark 3.3+ với ML cải tiến).
Hy vọng phân tích này giúp bạn ôn thi DOP-C02 hiệu quả! 🚀 Nếu cần thêm ví dụ code Glue Job, hãy hỏi nhé.
Which EC2 instance purchasing option will meet these requirements MOST cost-effectively?
- A Spot Instances
- B Reserved Instances
- C On-Demand Instances
- D Dedicated Instances
Xem giải thích
🧩 Phân tích chi tiết nội dung câu hỏi
Câu hỏi tập trung vào việc chọn phương án mua EC2 instance tiết kiệm chi phí nhất cho một job xử lý dữ liệu batch (batch data-processing job) trên Amazon EC2. Các yêu cầu cụ thể của công ty bao gồm:
- Job chạy vào cuối tuần (weekend), kéo dài 90 phút mỗi lần.
- Job có thể chịu được gián đoạn (handle interruptions), nghĩa là không yêu cầu tính liên tục 100%.
- Job sẽ chạy mỗi cuối tuần trong 6 tháng tới, tức là khoảng 26 lần chạy (52 tuần/năm chia 2, nhưng chỉ 6 tháng ≈ 26 cuối tuần). Tổng thời lượng: Khoảng 26 x 90 phút = ~39 giờ trong 6 tháng, workload ngắn, không liên tục, và fault-tolerant (chịu gián đoạn tốt).
Mục tiêu là tiết kiệm chi phí tối đa (MOST cost-effectively), phù hợp với các workload không critical, có thể tận dụng giá rẻ từ thị trường spot.
✅ Đáp án đúng: Spot Instances
Lý do chọn đáp án này 🛡️:
Spot Instances là lựa chọn tiết kiệm nhất (giảm đến 90% so với On-Demand) cho workload chịu gián đoạn, chạy ngắn và không dự đoán trước chính xác. Job chỉ 90 phút/cuối tuần, tổng ~39 giờ/6 tháng, rất phù hợp vì:
- Spot Instances sử dụng dung lượng dư thừa của AWS với giá bid (đấu giá), rẻ hơn nhiều.
- Hỗ trợ Spot Fleet, Spot Blocks (đảm bảo thời gian chạy lên đến 6 giờ), và với kiến thức AWS 2023-2026, Spot Instance Interruption Notices (2 phút cảnh báo) giúp job graceful shutdown.
- Cuối tuần thường có spot capacity cao, giá thấp. Job fault-tolerant nên dễ recover nếu bị interrupt.
- Không cam kết dài hạn, linh hoạt cho 6 tháng.
📋 Giải thích tất cả các phương án (đúng/sai)
-
✅ Spot Instances (ĐÚNG):
Phương án tối ưu chi phí cho workload ngắn, chịu gián đoạn như batch job. AWS khuyến nghị Spot cho data processing, ML training (giảm 90% chi phí). Với Savings Plans for Compute (cập nhật 2024+), kết hợp Spot vẫn rẻ nhất cho irregular usage. -
❌ Reserved Instances (SAI):
Reserved Instances yêu cầu cam kết 1-3 năm với utilization cao (Standard RI) hoặc linh hoạt hơn (Convertible), nhưng job chỉ ~39 giờ/6 tháng – không hiệu quả, lãng phí nếu không dùng đủ. Phù hợp steady-state workload, không phải batch ngắn. -
❌ On-Demand Instances (SAI):
On-Demand pay-as-you-go, không cam kết, nhưng đắt nhất (baseline giá). Với job ngắn và spot available, dùng On-Demand không tiết kiệm, chỉ phù hợp critical workload không chịu interrupt. -
❌ Dedicated Instances (SAI):
Dedicated Instances chạy trên hardware vật lý riêng (không shared), dùng cho compliance/NIC (Network Isolation). Rất đắt (gấp đôi On-Demand), không cần thiết cho batch job thông thường, và không tiết kiệm.
📘 Tài liệu tham khảo (AWS cập nhật 2023-2026)
- EC2 Spot Instances Best Practices: https://docs.aws.amazon.com/AWSEC2/latest/UserGuide/spot-best-practices.html (Khuyến nghị cho batch jobs chịu interrupt).
- EC2 Purchasing Options: https://aws.amazon.com/ec2/pricing/on-demand/ vs https://aws.amazon.com/ec2/spot/pricing/ (So sánh chi phí, Spot rẻ nhất cho fault-tolerant).
- Spot Instance Advisor (dashboard AWS): Theo dõi interruption rates thấp vào cuối tuần.
- AWS Well-Architected Framework - Cost Optimization Pillar (2024+): Ưu tiên Spot cho non-critical workloads.
Phân tích này dựa trên AWS Certified DevOps Engineer - Professional blueprint (DOP-C02, cập nhật 2024), đảm bảo kiến thức mới nhất! 🚀
Which solution will meet this requirement with the LEAST development effort?
- A Use Amazon S3 to make a copy of the model. Transfer the copy to Account B.
- B Create a resource-based IAM policy. Use the Amazon Comprehend ImportModel API operation to copy the model to Account B.
- C Use AWS DataSync to replicate the model from Account A to Account B.
- D Create an AWS Site-to-Site VPN connection between Account A and Account В to transfer the model.
Xem giải thích
🧩 Phân tích nội dung câu hỏi
Câu hỏi tập trung vào việc sao chép (copy) một mô hình tùy chỉnh Amazon Comprehend từ Account A sang Account B, cả hai đều nằm trong cùng một Region us-east-1. Người dùng là một ML engineer cần giải pháp với ÍT NHIỀM VỤ PHÁT TRIỂN NHẤT (LEAST development effort).
Amazon Comprehend là dịch vụ NLP (Natural Language Processing) của AWS, hỗ trợ tạo mô hình tùy chỉnh (custom model) để phân tích văn bản. Việc copy mô hình giữa các tài khoản AWS yêu cầu hỗ trợ cross-account access, không phải đơn giản như copy file thông thường vì mô hình được quản lý bởi dịch vụ AWS (managed service). Giải pháp phải tận dụng các tính năng native của AWS Comprehend để giảm thiểu code tùy chỉnh hoặc công cụ phức tạp. ✅ Yêu cầu chính: Ít effort nhất, an toàn và tuân thủ best practices AWS.
✅ Đáp án đúng và lý do lựa chọn
Đáp án đúng: Create a resource-based IAM policy. Use the Amazon Comprehend ImportModel API operation to copy the model to Account B.
Lý do chi tiết:
🛠️ Phương án này sử dụng resource-based IAM policy gắn trực tiếp vào mô hình ở Account A để cấp quyền cross-account access cho Account B. Sau đó, từ Account B gọi ImportModel API của Amazon Comprehend để import và copy mô hình một cách tự động. Đây là cách native và chính thức được AWS khuyến nghị, chỉ cần cấu hình policy (JSON đơn giản) và một lệnh API call (qua CLI, SDK hoặc console), không yêu cầu code phức tạp hay công cụ bên thứ ba.
📈 Least development effort vì: Không cần xây dựng pipeline, replication service hay kết nối mạng; chỉ 2 bước đơn giản, hỗ trợ đầy đủ từ phiên bản AWS hiện tại (2024-2026). Mô hình sẽ được copy độc lập ở Account B mà không ảnh hưởng Account A.
📋 Giải thích tất cả các phương án
Dưới đây là phân tích từng lựa chọn một cách chi tiết, giữ nguyên nội dung gốc bằng tiếng Anh. Mỗi phương án được đánh giá đúng/sai với lý do cụ thể dựa trên tài liệu AWS mới nhất.
-
Use Amazon S3 to make a copy of the model. Transfer the copy to Account B.
❌ Sai. Amazon Comprehend custom model không được lưu trữ trực tiếp dưới dạng file đơn lẻ trên S3 mà là tài nguyên managed (ARN-based) với metadata và training data nội bộ. Bạn không thể export model ra S3 như một "copy file" đơn giản để transfer cross-account. Phương án này yêu cầu phát triển tùy chỉnh (export/import thủ công), vi phạm nguyên tắc least effort và có nguy cơ lỗi dữ liệu. 🛑 Không hỗ trợ bởi AWS Comprehend. -
Create a resource-based IAM policy. Use the Amazon Comprehend ImportModel API operation to copy the model to Account B.
✅ Đúng. Như đã giải thích ở trên, đây là cách thức chuẩn sử dụng comprehend:ImportModel permission qua resource policy. Account B chỉ cần ARN của model từ A để import. Hỗ trợ full cross-account trong cùng region, nhanh chóng (API call đơn lẻ). 🏆 Least effort nhất! -
Use AWS DataSync to replicate the model from Account A to Account B.
❌ Sai. AWS DataSync dành cho replication dữ liệu lớn giữa storage (S3, EFS, NFS), không hỗ trợ copy tài nguyên ML model như Comprehend (không phải file-based). Bạn phải tự map model thành file (không khả thi), dẫn đến effort cao và không native. 🚫 DataSync không integrate với Comprehend models (xem limits docs). -
Create an AWS Site-to-Site VPN connection between Account A and Account B to transfer the model.
❌ Sai. Site-to-Site VPN chỉ thiết lập kết nối mạng private giữa on-prem/VPC, không dùng để copy model Comprehend (model không cần network tunnel). Cross-account trong cùng region dùng IAM policy là đủ, VPN thêm effort lớn (cấu hình VPC peering/Transit Gateway tốt hơn nếu cần, nhưng thừa thãi). 🌐 Hoàn toàn không liên quan và tốn kém.
📘 Tài liệu tham khảo (cập nhật AWS 2024-2026)
- AWS Comprehend Developer Guide - Sharing Custom Models: https://docs.aws.amazon.com/comprehend/latest/dg/share-model.html (Hướng dẫn chính thức về resource-based policy và ImportModel API cho cross-account).
- IAM Resource Policies for Comprehend: https://docs.aws.amazon.com/comprehend/latest/dg/security_iam_id-based-policy-examples.html#security_iam_id-based-policy-custommodelactions.
- API Reference - ImportModel: https://docs.aws.amazon.com/comprehend/latest/dg/API_ImportModel.html (Xác nhận hỗ trợ cross-account với policy).
- AWS Exam Topics DOP-C02 (DevOps Pro): Best practices cho ML workflows cross-account.
Hy vọng phân tích này giúp bạn ôn thi hiệu quả! 🚀 Nếu cần ví dụ code policy JSON, hãy hỏi thêm nhé.