Ngân hàng đề — AWS Certified Machine Learning Engineer Associate
Tìm thấy 635 câu.
An ML engineer needs to implement a solution to automatically check the data quality before the data is sent to QuickSight.
Which solution will meet these requirements with the LEAST operational overhead?
- A Run an AWS Glue crawler every month to update the AWS Glue Data Catalog. Use AWS Glue Data Quality rules to check the data quality.
- B Use an AWS Glue trigger to run an AWS Glue crawler every month to update the AWS Glue Data Catalog. Create an AWS Glue job that loads the data into a PySpark DataFrame. Configure the job to apply custom functions and to evaluate the data quality.
- C Run Python scripts on an AWS Lambda function every month to evaluate data quality. Configure the S3 bucket to invoke the Lambda function when objects are added to the S3 bucket.
- D Configure the S3 bucket to send event notifications to an Amazon Simple Queue Service (Amazon SQS) queue when objects are uploaded. Use Amazon CloudWatch insights every month for the SQS queue to evaluate the data quality.
Xem giải thích
🧩 Nội dung câu hỏi được giải thích chi tiết
Câu hỏi mô tả một công ty thu thập dữ liệu khách hàng hàng ngày (daily), lưu trữ dưới dạng file nén trong Amazon S3 bucket được phân vùng theo ngày (partitioned by date, ví dụ: s3://bucket/yyyy/mm/dd/). Hàng tháng, các nhà phân tích (analysts) tải dữ liệu xuống, xử lý để kiểm tra chất lượng dữ liệu (data quality), sau đó upload lên Amazon QuickSight dashboards để trực quan hóa.
Một ML engineer cần triển khai giải pháp tự động kiểm tra chất lượng dữ liệu trước khi dữ liệu được gửi đến QuickSight. Yêu cầu chính là giải pháp có ít nhất gánh nặng vận hành (LEAST operational overhead), nghĩa là phải serverless, tự động hóa cao, ít code tùy chỉnh, ít quản lý thủ công, và tận dụng các dịch vụ AWS native để xử lý dữ liệu lớn trên S3 một cách hiệu quả.
Vấn đề cốt lõi: Dữ liệu tích lũy hàng ngày nhưng kiểm tra chỉ hàng tháng, bucket partitioned giúp dễ crawl metadata. Giải pháp phải phù hợp với quy trình ETL (Extract, Transform, Load) và tích hợp mượt mà với QuickSight (hỗ trợ Glue Data Catalog).
🛠️ Mục tiêu: Tự động hóa data quality check (như kiểm tra nulls, duplicates, schema validity, freshness) mà không cần tải dữ liệu thủ công, ưu tiên các tính năng built-in của AWS Glue (hỗ trợ Data Quality rules từ năm 2021, cập nhật đến 2026 với enhancements như ML-based rules).
✅ Đáp án đúng và lý do lựa chọn
Đáp án đúng:
Run an AWS Glue crawler every month to update the AWS Glue Data Catalog. Use AWS Glue Data Quality rules to check the data quality.
Lý do chọn đáp án này (bằng tiếng Việt):
🔥 Đây là giải pháp tối ưu nhất với LEAST operational overhead vì:
- AWS Glue Crawler chạy hàng tháng để tự động scan S3 bucket partitioned by date, cập nhật AWS Glue Data Catalog (metadata lakehouse) mà không cần code. Crawler native hỗ trợ compression (gzip, etc.) và partitioning, chỉ crawl delta (thay đổi) để tiết kiệm chi phí.
- AWS Glue Data Quality rules là tính năng built-in, serverless (ra mắt 2021, cập nhật 2024-2026 với Glue 4.0 và ML-powered rules), cho phép định nghĩa rules declarative (ví dụ:
column.min > 0,completeness > 95%,freshness < 30 days) trực tiếp trên Data Catalog tables. Kết quả tự động publish đến CloudWatch, Glue job triggers, hoặc QuickSight (dataset quality metrics). - Tự động hoàn toàn: Lên lịch bằng EventBridge (CloudWatch Events) monthly, không custom code, không manage infra. Dữ liệu sau check có thể query trực tiếp qua Athena/QuickSight mà không di chuyển.
- So với các option khác, không cần viết script, không trigger daily (tiết kiệm chi phí), tích hợp native với QuickSight. Hoàn hảo cho data lake trên S3!
📋 Phân tích tất cả các phương án (đúng và sai)
Dưới đây là phân tích chi tiết từng lựa chọn. Tôi giữ nguyên văn bản gốc bằng tiếng Anh của phương án, đánh dấu ✅ (đúng) hoặc ❌ (sai), và giải thích lý do bằng tiếng Việt:
-
✅ Run an AWS Glue crawler every month to update the AWS Glue Data Catalog. Use AWS Glue Data Quality rules to check the data quality.
🟢 Đúng vì: Như giải thích trên, sử dụng Glue Crawler + Data Quality rules là native, serverless, declarative (không code), chạy monthly phù hợp quy trình. Least overhead: chỉ config rules một lần, tự động evaluate trên catalog, tích hợp QuickSight seamless. Cập nhật 2026: Glue Data Quality hỗ trợ 100+ rules pre-built và custom SQL. -
❌ Use an AWS Glue trigger to run an AWS Glue crawler every month to update the AWS Glue Data Catalog. Create an AWS Glue job that loads the data into a PySpark DataFrame. Configure the job to apply custom functions and to evaluate the data quality.
🔴 Sai vì: Mặc dù dùng Glue, nhưng thêm AWS Glue job với PySpark DataFrame + custom functions tạo overhead lớn: phải viết code phức tạp (load full data hàng tháng → tốn chi phí compute), debug/maintain script. Trigger monthly ok nhưng không cần thiết khi Data Quality rules native thay thế được custom logic. Không least overhead so với option đúng. -
❌ Run Python scripts on an AWS Lambda function every month to evaluate data quality. Configure the S3 bucket to invoke the Lambda function when objects are added to the S3 bucket.
🔴 Sai vì: Lambda + Python scripts yêu cầu custom code để đọc S3 (boto3/S3 Select), parse compressed files, implement data quality logic (rất phức tạp với dữ liệu lớn). Trigger "when objects added" là daily (không phải monthly), gây trigger thừa → chi phí cao + cold starts. Lambda giới hạn 15 phút không phù hợp dữ liệu lớn hàng tháng. Overhead vận hành cao (code, error handling). -
❌ Configure the S3 bucket to send event notifications to an Amazon Simple Queue Service (Amazon SQS) queue when objects are uploaded. Use Amazon CloudWatch insights every month for the SQS queue to evaluate the data quality.
🔴 Sai vì: S3 → SQS ok cho event-driven, nhưng CloudWatch Insights chỉ query logs (CloudWatch Logs Insights), không evaluate data quality trên S3 data (không đọc file contents, chỉ metadata). Chạy "every month" thủ công trên queue không tự động. Overhead cao: phải build pipeline parse SQS messages → custom logic, không native cho data quality. Hoàn toàn không phù hợp!
📘 Tài liệu tham khảo (cập nhật đến 2026)
- AWS Glue Data Quality: AWS Documentation - Glue Data Quality (built-in rules, evaluations on catalog).
- AWS Glue Crawler best practices: AWS Glue Developer Guide - Crawlers (partitioning, scheduling via EventBridge).
- QuickSight integration: Amazon QuickSight - Data Sources (Glue Catalog + DQ results).
- Exam content outline DOP-C02 (2024-2026): Domain 4 - Automation (Glue ETL/Data Quality).
- Re:Post & Blogs: AWS Big Data Blog - Automating Data Quality (2021+, updates 2024 với Glue Studio enhancements).
Giải pháp này đảm bảo data mesh compliant và scalable cho data lake! 🚀 Nếu cần demo code hoặc lab, hãy hỏi thêm!
Which solution will meet this requirement with the LEAST operational overhead?
- A Configure SageMaker Model Monitor. Establish a data quality baseline. Ensure that the emit_metrics option is enabled in the baseline constraints file. Configure an Amazon CloudWatch alarm to notify the company about changes in specific metrics that are related to data quality.
- B Configure SageMaker Model Monitor. Establish a model quality baseline. Ensure that the comparison_method option is set to Robust in the baseline constraints file. Configure an Amazon CloudWatch alarm to notify the company about changes in model quality metrics.
- C Use SageMaker Debugger with custom rules to track shifts in feature distributions. Configure Amazon CloudWatch alarms to notify the company when the rules detect significant changes.
- D Use Amazon CloudWatch to directly observe the SageMaker AI endpoint’s performance metrics. Manually analyze the CloudWatch logs for indicators of data drift or shifts in feature distribution.
Xem giải thích
🧩 Giải thích nội dung câu hỏi
Câu hỏi tập trung vào việc triển khai giải pháp giám sát tự động (monitoring) cho mô hình Machine Learning (ML) trên Amazon SageMaker AI, cụ thể là phát hiện thay đổi trong phân phối dữ liệu đầu vào (input data distribution) của các đặc trưng mô hình (model features). Điều này thường được gọi là data drift hoặc feature drift, nơi dữ liệu mới khác biệt so với dữ liệu huấn luyện, có thể làm giảm hiệu suất mô hình.
Yêu cầu chính: Giải pháp phải có ít overhead vận hành nhất (LEAST operational overhead), nghĩa là ưu tiên dịch vụ managed tự động, dễ cấu hình, không cần code tùy chỉnh hoặc phân tích thủ công nhiều. Chủ đề thuộc SageMaker Model Monitor – công cụ chính thức của AWS để giám sát chất lượng dữ liệu và mô hình (cập nhật đến 2026, hỗ trợ tích hợp sâu với SageMaker endpoints và CloudWatch).
✅ Đáp án đúng và lý do lựa chọn
Đáp án đúng:
Configure SageMaker Model Monitor. Establish a data quality baseline. Ensure that the emit_metrics option is enabled in the baseline constraints file. Configure an Amazon CloudWatch alarm to notify the company about changes in specific metrics that are related to data quality.
Lý do:
🛠️ SageMaker Model Monitor là giải pháp managed service chuyên dụng cho việc giám sát data quality (bao gồm data drift trên input features), tự động capture và so sánh baseline với dữ liệu thực tế.
✅ Data quality baseline chính xác phát hiện thay đổi phân phối input data (như thống kê thống kê, phân vị).
✅ Emit_metrics kích hoạt xuất metrics sang CloudWatch, cho phép alarm tự động với overhead thấp nhất – không cần code, chỉ cấu hình JSON baseline.
📈 Đây là cách tối ưu nhất theo best practices AWS (least effort, scalable).
📋 Phân tích tất cả các phương án
-
✅ Configure SageMaker Model Monitor. Establish a data quality baseline. Ensure that the emit_metrics option is enabled in the baseline constraints file. Configure an Amazon CloudWatch alarm to notify the company about changes in specific metrics that are related to data quality.
Giải thích đúng: Phương án này hoàn hảo khớp yêu cầu. Model Monitor tự động xử lý data drift qua data quality checks (statistics, constraints), emit_metrics đẩy metrics (như drift score) vào CloudWatch để alarm ngay lập tức. Overhead thấp vì fully managed, không cần custom logic. Lý tưởng cho production endpoints. -
❌ Configure SageMaker Model Monitor. Establish a model quality baseline. Ensure that the comparison_method option is set to Robust in the baseline constraints file. Configure an Amazon CloudWatch alarm to notify the company about changes in model quality metrics.
Giải thích sai: Model quality baseline chỉ giám sát output predictions so với ground truth (như accuracy, RMSE), không phải input data distribution.comparison_method: Robustdùng cho model bias/explainability, không liên quan data drift. Không đáp ứng yêu cầu detect changes in input features. -
❌ Use SageMaker Debugger with custom rules to track shifts in feature distributions. Configure Amazon CloudWatch alarms to notify the company when the rules detect significant changes.
Giải thích sai: SageMaker Debugger dành cho debugging training jobs (tensor analysis, hyperparameters), không phải monitoring inference endpoints real-time. Cần custom rules code phức tạp (Python), dẫn đến overhead cao (dev effort, maintain). Không managed cho data drift post-deployment. -
❌ Use Amazon CloudWatch to directly observe the SageMaker AI endpoint’s performance metrics. Manually analyze the CloudWatch logs for indicators of data drift or shifts in feature distribution.
Giải thích sai: CloudWatch chỉ cung cấp metrics cơ bản endpoint (latency, invocations), không tự detect data drift (cần parse logs thủ công). Phần "manually analyze" tạo overhead lớn (operational burden cao, không tự động), vi phạm yêu cầu LEAST overhead. Không chuyên sâu cho ML data distribution.
📘 Tài liệu tham khảo
- AWS SageMaker Model Monitor Docs (cập nhật 2026): https://docs.aws.amazon.com/sagemaker/latest/dg/model-monitor.html – Chi tiết data quality monitoring và baseline JSON (emit_metrics).
- Data Drift Best Practices: https://aws.amazon.com/blogs/machine-learning/detecting-data-drift-with-amazon-sagemaker-model-monitor/ – Ví dụ CloudWatch integration.
- Exam Prep DOP-C02: SageMaker monitoring là key topic trong DevOps Professional (least overhead = managed services).
🛡️ Giải pháp này đảm bảo tuân thủ AWS Well-Architected Framework cho ML workloads!
Traffic is variable throughout the day. The company needs to create an inference endpoint for the model.
Which type of inference endpoint will meet these requirements MOST cost-effectively?
- A Batch transform inference endpoint
- B Asynchronous inference endpoint
- C Real-time inference endpoint
- D Serverless inference endpoint
Xem giải thích
🧩 Phân tích chi tiết nội dung câu hỏi
Câu hỏi tập trung vào việc triển khai inference endpoint cho một mô hình recommendation trên Amazon SageMaker AI, dành cho website thương mại điện tử (ecommerce). Các yêu cầu chính bao gồm:
- Input dữ liệu: Sử dụng dữ liệu từ tất cả tương tác của client trên website (như click, xem sản phẩm, mua hàng...).
- Traffic biến đổi: Lưu lượng truy cập thay đổi mạnh suốt ngày (cao điểm và thấp điểm).
- Mục tiêu: Tạo inference endpoint tiết kiệm chi phí nhất (MOST cost-effectively).
🛠️ Bối cảnh kỹ thuật: SageMaker cung cấp nhiều loại endpoint để chạy inference (dự đoán từ model đã train). Với traffic biến đổi, cần loại endpoint scale tự động, không tốn phí idle (khi không có traffic), và hỗ trợ real-time hoặc near-real-time để phục vụ website tương tác nhanh chóng. Đây là bài toán điển hình về cost optimization trong SageMaker, đặc biệt với Serverless Inference – tính năng mới nhất từ AWS (cập nhật đến 2026).
✅ Đáp án đúng và lý do lựa chọn
Đáp án đúng: Serverless inference endpoint
Lý do chi tiết:
- Serverless Inference (ra mắt tại re:Invent 2023 và cập nhật liên tục đến 2026) cho phép scale từ 0 instance lên hàng nghìn tự động, chỉ tính phí theo milliseconds inference thực tế (billed per ms per GB), không mất phí idle hoặc cold start dài.
- Hoàn hảo cho traffic biến đổi (variable throughout the day), vì endpoint không cần provision instance cố định, giảm chi phí lên đến 80-90% so với real-time endpoint truyền thống.
- Hỗ trợ real-time latency thấp (<1 giây), phù hợp website ecommerce cần recommendation nhanh từ dữ liệu client interactions.
- Cost-effective nhất: Không cần quản lý EC2/ML instances, auto-scale theo nhu cầu thực tế.
📋 Giải thích tất cả các phương án (đúng/sai)
Dưới đây là phân tích từng lựa chọn một, giữ nguyên văn bản gốc tiếng Anh. Mỗi phương án được đánh dấu ✅ (đúng) hoặc ❌ (sai), kèm giải thích chi tiết bằng tiếng Việt dựa trên đặc tính SageMaker mới nhất (2026).
-
❌ Batch transform inference endpoint
Phương án này SAI vì Batch Transform chỉ dùng cho xử lý batch lớn (như hàng triệu records offline), không hỗ trợ real-time inference cho website tương tác liên tục. Nó submit job một lần, chờ output file (S3), không scale real-time theo traffic biến đổi, và không tạo "endpoint" liên tục. Không phù hợp với yêu cầu "inference endpoint" cho client interactions ngay lập tức. -
❌ Asynchronous inference endpoint
Phương án này SAI vì Async Inference phù hợp payload lớn/bất đồng bộ (queue-based), scale tự động nhưng vẫn provision instance cố định (như ml.m5.large), dẫn đến chi phí idle cao khi traffic thấp. Latency có thể >1 giây, không lý tưởng cho recommendation real-time trên website. Dù cost tốt hơn real-time, vẫn kém Serverless vì phải trả phí endpoint chạy 24/7. -
❌ Real-time inference endpoint
Phương án này SAI vì Real-time Endpoint (hosted endpoint) cung cấp latency thấp nhất (<100ms), nhưng chi phí cao do phải provision instances liên tục (auto-scaling groups). Với traffic biến đổi, phí idle lớn (trả tiền full instance dù không dùng), không phải "MOST cost-effectively". Phù hợp traffic ổn định cao, không phải trường hợp variable. -
✅ Serverless inference endpoint
Phương án này ĐÚNG như đã giải thích ở trên. Tiết kiệm nhất nhờ model serverless (powered by AWS Lambda-like), hỗ trợ multi-model endpoints, concurrency cao (lên đến 1000+), và tích hợp trực tiếp với API Gateway/SageMaker endpoints. Áp dụng hoàn hảo cho ecommerce với dữ liệu client interactions real-time.
📘 Tài liệu tham khảo (AWS cập nhật mới nhất 2026)
- AWS SageMaker Documentation: Serverless Inference – Chi tiết billing, scaling, và best practices.
- AWS re:Invent 2023/2024 Sessions: "Amazon SageMaker Serverless Inference: Scale to Zero and Pay Per Millisecond" (YouTube/AWS Events).
- AWS Well-Architected Framework - ML Lens: Phần Cost Optimization cho inference endpoints.
- SageMaker Pricing Page: So sánh chi phí Serverless vs. Real-time/Async (tiết kiệm 75%+ cho variable workloads).
Hy vọng phân tích này giúp bạn ôn thi AWS Certified DevOps Engineer Professional hiệu quả! 🚀 Nếu cần thêm ví dụ code Terraform/CloudFormation, hãy hỏi nhé!
Which technique should the ML engineer use to convert this column’s data to binary values?
- A Binary encoding
- B Label encoding
- C One-hot encoding
- D Tokenization
Xem giải thích
🧩 Phân tích chi tiết nội dung câu hỏi
Câu hỏi tập trung vào xử lý dữ liệu categorical (dữ liệu phân loại) trong quy trình xây dựng mô hình machine learning (ML), cụ thể là mô hình phân loại (classification model). Kỹ sư ML phát hiện cột day_of_week chứa các giá trị danh mục rời rạc: Monday, Tuesday, Wednesday, Thursday, Friday, Saturday, Sunday. Đây là dữ liệu nominal categorical (không có thứ tự tự nhiên, ví dụ thứ Hai không "nhỏ hơn" thứ Ba).
Mục tiêu chính: Chuyển đổi cột này thành binary values (giá trị nhị phân 0/1) để phù hợp với các thuật toán ML, tránh mô hình hiểu lầm thứ tự giữa các ngày. Trong AWS SageMaker (dịch vụ ML chính), kỹ thuật này thường được áp dụng trong SageMaker Processing Jobs, SageMaker Feature Store, hoặc Data Wrangler để chuẩn bị dữ liệu cho training (phiên bản mới nhất AWS ML 2024-2026 vẫn khuyến nghị one-hot cho nominal data low-cardinality như 7 giá trị này).
📘 Tài liệu tham khảo:
- AWS SageMaker Documentation: "Prepare Data for Training" (https://docs.aws.amazon.com/sagemaker/latest/dg/data-prep.html).
- AWS ML Best Practices: "Encoding Categorical Variables" trong SageMaker Data Wrangler (cập nhật 2024).
✅ Đáp án đúng: One-hot encoding
Lý do chọn:
- One-hot encoding chuyển mỗi giá trị danh mục thành một vector binary riêng biệt (0/1), ví dụ: "Monday" → [1,0,0,0,0,0,0]; "Tuesday" → [0,1,0,0,0,0,0].
- Phù hợp hoàn hảo cho dữ liệu nominal như ngày trong tuần (7 categories, low-cardinality), tránh bias thứ tự và hỗ trợ tốt cho mô hình classification như logistic regression, decision trees, hoặc neural networks trên SageMaker.
- Trong AWS, SageMaker tích hợp sẵn one-hot qua Scikit-learn OneHotEncoder hoặc SageMaker Processing với Pandas, đảm bảo scalability đến 2026. ✅
🛠️ Giải thích chi tiết tất cả các phương án
-
Binary encoding ❌
Sai vì: Binary encoding chuyển categorical data thành binary (0/1) bằng cách mã hóa nhị phân giống số nhị phân, ví dụ: 7 categories → 3 bits (Monday=001, Tuesday=010,...). Nó phù hợp high-cardinality (>10 categories) để tiết kiệm bộ nhớ, nhưng không phải pure binary per category và có thể tạo thứ tự giả (gần giống ordinal). Không lý tưởng cho low-cardinality nominal như days_of_week, dễ gây nhầm lẫn mô hình. AWS khuyến nghị dùng cho high-dim data trong Feature Store. -
Label encoding ❌
Sai vì: Label encoding gán số nguyên thứ tự (ví dụ: Monday=0, Tuesday=1,..., Sunday=6), không phải binary values. Mô hình sẽ hiểu lầm có thứ tự tự nhiên (Sunday "lớn hơn" Monday), dẫn đến bias nghiêm trọng trong classification. SageMaker tránh dùng cho nominal data; chỉ phù hợp ordinal data như rating (low/medium/high). -
One-hot encoding ✅
Đúng vì: Như đã giải thích ở trên, tạo cột binary độc lập cho từng category (sparse matrix nếu dùng AWS XGBoost/SageMaker), tránh ordinal assumption. Hoàn hảo cho dataset này, hỗ trợ full trong SageMaker BlazingText hoặc Clarify (cập nhật 2025 bias detection). -
Tokenization ❌
Sai vì: Tokenization dùng cho text processing (chia text thành tokens như words/subwords), ví dụ NLP với BERT trong SageMaker JumpStart. Không áp dụng cho categorical discrete values như days_of_week; nó tạo tokens/list indices chứ không phải binary 0/1. Không liên quan đến feature engineering categorical.
🧠 Lưu ý thêm: Trong SageMaker pipeline 2026, dùng Automatic Model Tuning sau one-hot để optimize hyperparameters, đảm bảo model robust!
The company needs to use only private IP addresses in the training. The company also must make sure that no training metadata is shared with AWS.
Which solution will meet these requirements?
- A Set up VPC peering between Account A and Account B. Contact AWS by email to opt out of metadata collection.
- B Set up a VPC endpoint for the S3 bucket. Set the SageMaker AI OPT_OUT_TRACKING environment variable to 1 in the training job.
- C Configure a security group policy that is assigned to the S3 bucket in Account A to allow access from only Account B. Create AI services opt-out policies.
- D Generate presigned URLs with expiration times for the objects that are stored in the S3 bucket. Access the data by using the presigned URLs. Set the SageMaker AI OPT_OUT_TRACKING environment variable to 1 in the training job.
Xem giải thích
🧩 Phân tích chi tiết nội dung câu hỏi
Câu hỏi xoay quanh tình huống một công ty lưu trữ dữ liệu clickstream (dữ liệu theo dõi tương tác người dùng) trong bucket Amazon S3 thuộc AWS Account A. Họ cần sử dụng dữ liệu này để huấn luyện mô hình Machine Learning (ML) trên Amazon SageMaker ở AWS Account B, với thời gian huấn luyện kéo dài 10 ngày.
📋 Yêu cầu chính cần đáp ứng:
- Chỉ sử dụng private IP addresses: Nghĩa là toàn bộ giao tiếp phải diễn ra nội bộ qua mạng riêng (không đi qua public internet), đảm bảo an toàn và tuân thủ chính sách bảo mật.
- Không chia sẻ metadata của quá trình huấn luyện với AWS: Phải opt-out (từ chối) việc thu thập metadata training để bảo vệ quyền riêng tư dữ liệu.
🛠️ Thách thức kỹ thuật:
- Cross-account access: Dữ liệu ở Account A, SageMaker ở Account B → Cần cơ chế chia sẻ tài nguyên an toàn.
- Private connectivity: Sử dụng VPC endpoints hoặc tương đương để tránh public IP.
- SageMaker training dài ngày → Phải hỗ trợ kết nối ổn định, không gián đoạn.
- Dựa trên kiến thức AWS cập nhật đến 2026 (AWS re:Invent 2025 updates cho SageMaker và S3 VPC endpoints với hỗ trợ cross-account PrivateLink nâng cao).
📘 Tài liệu tham khảo:
- AWS Docs: Amazon S3 VPC Endpoints (Gateway) – Hỗ trợ cross-account qua bucket policy.
- AWS Docs: SageMaker Debugger & Tracking Opt-Out – Env var
OPT_OUT_TRACKINGcho SageMaker (cập nhật 2024-2026 để tuân thủ GDPR/CCPA). - AWS Well-Architected Framework: Security Pillar – Private access patterns.
✅ Đáp án đúng và lý do lựa chọn
Đáp án đúng: Set up a VPC endpoint for the S3 bucket. Set the SageMaker AI OPT_OUT_TRACKING environment variable to 1 in the training job.
🧠 Lý do chi tiết:
- VPC endpoint cho S3: Đây là Gateway VPC Endpoint (miễn phí, không cần NAT/IGW), cho phép SageMaker trong VPC của Account B truy cập S3 bucket ở Account A chỉ qua private IP (không public internet). Setup: Tạo endpoint ở VPC Account B, cấu hình bucket policy Account A cho phép principal từ endpoint ARN. Hỗ trợ training dài 10 ngày ổn định, scale tốt.
- OPT_OUT_TRACKING=1: Env var này opt-out hoàn toàn metadata collection (như metrics, hyperparameters) gửi về AWS trong SageMaker training job, đảm bảo không share dữ liệu với AWS.
- Hoàn hảo match yêu cầu: Private, cross-account, no metadata sharing. Không cần peering hay public URLs.
📝 Giải thích tất cả các phương án (đúng/sai)
-
Phương án 1: Set up VPC peering between Account A and Account B. Contact AWS by email to opt out of metadata collection.
❌ Sai: VPC peering kết nối 2 VPC cross-account, nhưng không cần thiết và phức tạp cho S3 access (S3 là regional service, dùng endpoint hiệu quả hơn, peering tốn kém route tables). "Contact AWS by email" không phải quy trình chuẩn để opt-out metadata – SageMaker dùng env var tự động, không cần support ticket. Không đảm bảo private IP thuần túy cho S3. -
Phương án 2: Set up a VPC endpoint for the S3 bucket. Set the SageMaker AI OPT_OUT_TRACKING environment variable to 1 in the training job.
✅ Đúng: Như giải thích trên. Gateway VPC Endpoint lý tưởng cho S3 (private DNS resolution, cross-account via policy), kết hợp env var OPT_OUT_TRACKING=1 (set trongTrainingJobconfig via SDK/Console). Hỗ trợ EFA cho SageMaker training dài ngày (cập nhật 2025). -
Phương án 3: Configure a security group policy that is assigned to the S3 bucket in Account A to allow access from only Account B. Create AI services opt-out policies.
❌ Sai: S3 không hỗ trợ security groups (chỉ dùng bucket policy/IAM). Security groups dành cho EC2/ENI. "AI services opt-out policies" không tồn tại – SageMaker dùng env var cụ thể, không phải IAM policy cho tracking. -
Phương án 4: Generate presigned URLs with expiration times for the objects that are stored in the S3 bucket. Access the data by using the presigned URLs. Set the SageMaker AI OPT_OUT_TRACKING environment variable to 1 in the training job.
❌ Sai: Presigned URLs sử dụng public endpoint của S3 (qua internet, dù có thể restrict), không đảm bảo private IP (vi phạm yêu cầu). Expiration (max 7 ngày) không phù hợp training 10 ngày (phải regenerate, gián đoạn). Env var đúng nhưng phần access sai hoàn toàn.
🛡️ Khuyến nghị DevOps: Test setup với AWS CLI: aws ec2 create-vpc-endpoint --vpc-id vpc-xxx --service-name com.amazonaws.vpce.us-east-1.s3. Bucket policy: {"Statement": [{"Principal": {"AWS": "arn:aws:iam::AccountB:root"}, "Action": "s3:GetObject", "Resource": "arn:aws:s3:::bucket/*", "Condition": {"StringEquals": {"aws:SourceVpce": "vpce-xxx"}}}]}. SageMaker: estimator = Estimator(..., environment={'OPT_OUT_TRACKING': '1'}).
The company has an AWS Glue Data Catalog that is configured with the S3 bucket as the source. An ML engineer needs to implement a solution to create a repository for this data. The solution must ensure that the data stays synchronized during batch training and real-time inference.
Which solution will meet these requirements?
- A Ingest data into SageMaker Feature Store from the S3 bucket. Apply tags and indexes.
- B Use Amazon Athena. Create tables by using CREATE TABLE AS SELECT (CTAS) queries to group data.
- C Use AWS Lake Formation. Apply tag-based control on the data.
- D Use the Generate Data Insights function in SageMaker Data Wrangler.
Xem giải thích
🧩 Phân tích chi tiết câu hỏi trắc nghiệm AWS
📖 Nội dung câu hỏi được giải thích rõ ràng:
Câu hỏi xoay quanh một công ty streaming nhạc liên tục truyền dữ liệu đánh giá bài hát (song ratings) từ ứng dụng vào bucket Amazon S3. Công ty muốn sử dụng dữ liệu này làm đầu vào cho việc huấn luyện (training) và suy luận thời gian thực (inference) mô hình AI trên Amazon SageMaker. Họ đã có AWS Glue Data Catalog cấu hình với S3 bucket làm nguồn dữ liệu. Nhiệm vụ của ML engineer là triển khai giải pháp tạo một repository (kho lưu trữ) cho dữ liệu này, đảm bảo dữ liệu luôn đồng bộ (synchronized) trong quá trình batch training (huấn luyện hàng loạt) và real-time inference (suy luận thời gian thực).
🛠️ Yêu cầu cốt lõi: Giải pháp phải hỗ trợ lưu trữ features (đặc trưng dữ liệu) một cách nhất quán, dễ truy cập cho cả chế độ offline (batch) và online (real-time), tích hợp tốt với S3 và Glue Catalog. Đây là tình huống điển hình trong ML pipeline trên AWS, nơi cần một feature store chuyên dụng để tránh dữ liệu lệch lạc giữa training và serving.
✅ Đáp án đúng và lý do lựa chọn
Đáp án đúng: Ingest data into SageMaker Feature Store from the S3 bucket. Apply tags and indexes.
Lý do chi tiết:
SageMaker Feature Store là dịch vụ feature store chuyên dụng của AWS (cập nhật đến 2026), được thiết kế chính xác để giải quyết vấn đề này. Nó cho phép ingest (nhập dữ liệu) trực tiếp từ S3 bucket qua Glue Catalog, tạo offline store cho batch training (lưu trữ dữ liệu lịch sử lớn) và online store cho real-time inference (truy vấn nhanh với độ trễ thấp). Dữ liệu luôn đồng bộ tự động giữa hai store nhờ cơ chế record versioning và TTL (Time-To-Live). Việc áp dụng tags và indexes giúp quản lý metadata, tối ưu truy vấn và phân quyền. Giải pháp này tích hợp liền mạch với SageMaker Pipelines/Processing Jobs, đảm bảo tính nhất quán end-to-end. Không có giải pháp nào khác đáp ứng đầy đủ cả batch và real-time sync như vậy!
🔍 Phân tích tất cả các phương án (đúng/sai)
Dưới đây là phân tích từng lựa chọn, giữ nguyên văn bản gốc bằng tiếng Anh. Mỗi phương án được đánh giá với lý do cụ thể dựa trên tính năng AWS mới nhất (2026), sử dụng ✅ cho đúng và ❌ cho sai.
-
Ingest data into SageMaker Feature Store from the S3 bucket. Apply tags and indexes.
✅ Đúng hoàn toàn! Như đã giải thích ở trên, đây là giải pháp chuẩn. Feature Store hỗ trợ ingest từ S3/Glue qua APIPutRecordhoặc Processing Jobs, tự động sync online/offline store. Tags/indexes giúp governance và query nhanh (ví dụ: dùng FeatureGroup với EventTime index). Hoàn hảo cho ML workflow với training/inference đồng bộ. -
Use Amazon Athena. Create tables by using CREATE TABLE AS SELECT (CTAS) queries to group data.
❌ Sai! Amazon Athena là công cụ query serverless cho dữ liệu S3 (tích hợp Glue Catalog), nhưng CTAS chỉ tạo bảng mới từ query để group/partition dữ liệu tĩnh, không hỗ trợ real-time sync hay online store cho inference. Athena phù hợp phân tích ad-hoc hoặc ETL batch, nhưng không phải repository cho ML features động – dữ liệu sẽ lệch lạc giữa training và serving, không đáp ứng yêu cầu đồng bộ. -
Use AWS Lake Formation. Apply tag-based control on the data.
❌ Sai! AWS Lake Formation (cập nhật 2026 với Enhanced Governance) quản lý data lake trên S3/Glue, hỗ trợ tag-based access control (LF-Tags) cho security/phân quyền. Tuy nhiên, nó chỉ là lớp governance/metadata, không tạo repository ML-specific với online/offline sync cho SageMaker. Không hỗ trợ real-time inference trực tiếp, chỉ gián tiếp qua query – không giải quyết sync training/inference. -
Use the Generate Data Insights function in SageMaker Data Wrangler.
❌ Sai! SageMaker Data Wrangler (nay tích hợp sâu vào SageMaker Studio, 2026) dùng "Generate Data Insights" để phân tích/explore dữ liệu (tạo visualizations, detect anomalies). Đây là tool preprocessing/visualization, không phải repository lưu trữ hay sync mechanism. Nó xuất dữ liệu ra S3/Feature Store nhưng không tự ingest/sync liên tục cho training/inference.
📘 Tài liệu tham khảo (AWS chính thức, cập nhật 2026)
- SageMaker Feature Store Docs: AWS SageMaker Feature Store – Chi tiết ingest từ S3/Glue và online/offline sync.
- Best Practices ML Features: AWS ML Feature Store Whitepaper – Hướng dẫn sync batch/real-time.
- Glue & Lake Formation Integration: AWS Lake Formation Docs – So sánh với Feature Store.
- Exam Topic DOP-C02: Phần SageMaker Pipelines & Feature Store trong AWS Certified DevOps Engineer Professional (2026 blueprint).
Hy vọng phân tích này giúp bạn nắm vững! 🚀 Nếu cần thêm ví dụ code Terraform/ CDK triển khai, hãy hỏi nhé!
Which solution will meet these requirements?
- A Use direct connections to import data from the data sources into Data Wrangler.
- B Use cataloged connections to import data from the data sources into Data Wrangler.
- C Use AWS Glue to extract data from the data sources. Use AWS Glue also to import the data directly into Data Wrangler.
- D Use AWS Lambda to extract data from the data sources. Use Lambda also to import the data directly into Data Wrangler.
Xem giải thích
🧩 Phân tích chi tiết câu hỏi
Câu hỏi tập trung vào việc ingest (hấp thụ) dữ liệu từ các nguồn khác nhau vào Amazon SageMaker Data Wrangler, cụ thể là từ Amazon S3, Amazon Redshift và Snowflake. Yêu cầu quan trọng nhất là dữ liệu được ingest phải luôn cập nhật (up-to-date) với những thay đổi mới nhất từ hệ thống nguồn.
SageMaker Data Wrangler là công cụ low-code/no-code giúp xây dựng data preparation workflows (ML pipelines), hỗ trợ import dữ liệu từ nhiều nguồn. Tuy nhiên, để đảm bảo dữ liệu luôn đồng bộ và up-to-date, cần sử dụng cơ chế kết nối được quản lý an toàn, có khả năng refresh dữ liệu tự động hoặc thủ công theo lịch. Các nguồn dữ liệu này yêu cầu kết nối cataloged (qua AWS Glue Data Catalog hoặc Lake Formation) để lưu trữ credentials, metadata và hỗ trợ incremental updates hoặc full refresh, tránh hardcode thông tin nhạy cảm và đảm bảo tính nhất quán.
📘 Tài liệu tham khảo cập nhật (AWS 2024-2026):
- Amazon SageMaker Data Wrangler Documentation – Phần "Data Sources" và "Importing Data".
- Supported Data Sources in Data Wrangler – Xác nhận S3, Redshift (JDBC), Snowflake (JDBC) qua cataloged connections.
✅ Đáp án đúng: Use cataloged connections to import data from the data sources into Data Wrangler.
Lý do lựa chọn:
- Cataloged connections (kết nối được catalog hóa qua AWS Glue Data Catalog hoặc Amazon DataZone/Lake Formation) cho phép lưu trữ và quản lý thông tin kết nối (credentials, VPC, IAM roles) một cách an toàn, hỗ trợ import dữ liệu từ S3, Redshift và Snowflake trực tiếp vào Data Wrangler.
- Quan trọng nhất, nó đảm bảo dữ liệu luôn up-to-date bằng cách hỗ trợ refresh data flows (tự động hoặc thủ công), incremental loads, hoặc scheduled jobs qua SageMaker Pipelines. Điều này khớp hoàn hảo với yêu cầu "latest changes in the source systems".
- 🛠️ Cách triển khai: Tạo connection trong Glue Console/Data Wrangler UI, sau đó select connection khi import → Data Wrangler sẽ query dữ liệu mới nhất mà không cần hardcode.
❌ Phân tích tất cả các phương án
-
Use direct connections to import data from the data sources into Data Wrangler.
❌ Sai vì: Direct connections (kết nối trực tiếp) chỉ hỗ trợ import một lần (one-time snapshot), không đảm bảo dữ liệu up-to-date với thay đổi liên tục từ nguồn. Chúng yêu cầu hardcode credentials (không an toàn), không hỗ trợ refresh tự động cho tất cả nguồn (đặc biệt Redshift/Snowflake cần JDBC config phức tạp), và dễ gặp lỗi timeout/security ở môi trường production. -
Use cataloged connections to import data from the data sources into Data Wrangler.
✅ Đúng (như đã giải thích ở trên). Đây là giải pháp chuẩn theo best practices AWS, scalable và secure cho multi-source ingestion với real-time sync. -
Use AWS Glue to extract data from the data sources. Use AWS Glue also to import the data directly into Data Wrangler.
❌ Sai vì: AWS Glue là ETL service mạnh mẽ cho extract/transform, nhưng không có integration trực tiếp để import vào Data Wrangler. Glue jobs output ra S3/ catalogs, không push trực tiếp vào Data Wrangler UI/flows. Việc dùng Glue sẽ tạo overhead phức tạp, không hiệu quả cho interactive data prep, và không tự động giữ up-to-date mà cần custom scheduling. -
Use AWS Lambda to extract data from the data sources. Use Lambda also to import the data directly into Data Wrangler.
❌ Sai vì: Lambda phù hợp cho serverless event-driven tasks, nhưng không phải tool chuẩn cho data ingestion vào Data Wrangler. Không có API trực tiếp để "import directly" vào Data Wrangler flows; Lambda chỉ extract ra S3 tạm thời, đòi hỏi custom code phức tạp (JDBC drivers, error handling), không scalable cho large datasets, và khó đảm bảo up-to-date mà không có scheduler ngoài (như EventBridge).
🛠️ Lời khuyên DevOps: Trong production, kết hợp cataloged connections với SageMaker Processing Jobs hoặc Pipelines để automate refresh, monitor qua CloudWatch. Test trên AWS Free Tier để verify! 🚀
Which metric should the ML engineer use to evaluate the model’s performance?
- A Accuracy
- B InferenceLatency
- C Area Under the ROC Curve (AUC)
- D Root mean square error (RMSE)
Xem giải thích
🧩 Phân tích chi tiết nội dung câu hỏi
Câu hỏi tập trung vào Amazon SageMaker Canvas – một công cụ no-code/low-code của AWS cho phép người dùng xây dựng mô hình machine learning (ML) tùy chỉnh mà không cần viết code. Trong tình huống này:
- ML engineer đang sử dụng SageMaker Canvas để xây dựng mô hình từ dataset được import.
- Mô hình cần thực hiện dự đoán liên tục số học (continuous numeric predictions), tức là nhiệm vụ regression (dự đoán giá trị số liên tục, ví dụ: doanh số bán hàng, giá nhà, nhiệt độ, dựa trên 10 năm dữ liệu lịch sử).
- Mục tiêu: Chọn metric phù hợp nhất để đánh giá hiệu suất mô hình (model performance), không phải tốc độ hay các yếu tố khác.
🛠️ Lưu ý quan trọng: Với nhiệm vụ regression trong SageMaker Canvas (phiên bản cập nhật đến 2026), AWS ưu tiên các metric đo lường sai số giữa giá trị dự đoán và thực tế, như RMSE, MAE. Điều này được xác nhận trong tài liệu chính thức AWS.
📘 Nguồn tham khảo:
- AWS SageMaker Canvas Documentation - Model Evaluation (cập nhật 2024-2026: RMSE là metric mặc định cho regression).
- Amazon SageMaker Canvas User Guide - Regression Metrics.
✅ Đáp án đúng: Root mean square error (RMSE)
Lý do lựa chọn:
- RMSE là metric chuẩn và mặc định cho các mô hình regression trong SageMaker Canvas, đặc biệt phù hợp với dự đoán continuous numeric (giá trị số liên tục).
- Công thức: RMSE = √(1/n * Σ(y_true - y_pred)²), đo sai số trung bình bình phương gốc, phạt nặng hơn với sai số lớn – lý tưởng cho dữ liệu thời gian dài như 10 năm (có thể có outliers).
- SageMaker Canvas tự động hiển thị RMSE làm primary metric khi evaluate regression model, giúp ML engineer dễ dàng so sánh và tinh chỉnh. ✅ Hoàn hảo cho case này!
❌ Giải thích tất cả các phương án
Dưới đây là phân tích từng lựa chọn một cách chi tiết, giữ nguyên văn bản gốc tiếng Anh. Tôi đánh dấu sai vì chúng không phù hợp với nhiệm vụ regression continuous numeric:
-
Accuracy
❌ Sai: Accuracy đo tỷ lệ dự đoán đúng, chỉ dùng cho nhiệm vụ classification (phân loại rời rạc, như cat/dog). Với regression (dự đoán số liên tục), không có "đúng/sai" nhị phân, nên metric này vô nghĩa và không được hỗ trợ trong SageMaker Canvas cho regression. -
InferenceLatency
❌ Sai: Đây là metric đo thời gian suy luận (latency khi model predict), thuộc về performance hệ thống/infrastructure (như endpoint scaling), không phải chất lượng mô hình (model accuracy). SageMaker Canvas không dùng nó để evaluate regression model. -
Area Under the ROC Curve (AUC)
❌ Sai: AUC đo khả năng phân biệt lớp trong binary classification (dựa trên ROC curve). Không áp dụng cho regression (không có probability threshold), và SageMaker Canvas chỉ dùng AUC cho classification tasks, không phải continuous numeric predictions. -
Root mean square error (RMSE)
✅ Đúng (như đã giải thích ở trên): Metric lý tưởng cho regression, được AWS khuyến nghị và tích hợp sẵn trong Canvas để đánh giá trên dataset 10 năm. 🏆
•Model A detects if a transaction is fraudulent based on the IP address, location, and user credentials. This model will be accessed every time a transaction occurs.
•Model B forecasts sales totals for the next month based on historical sales data. This model will be accessed one time each month.
The company must deploy both models to production by using Amazon SageMaker AI.
Which hosting solution for the models should the company use to meet these requirements?
- A Host both models in one container behind one real-time endpoint.
- B Host Model A with an asynchronous endpoint. Host Model B with a real-time endpoint.
- C Host Model A with a real-time endpoint. Use batch transform for Model B.
- D Use batch transform for Model A. Host Model B with an asynchronous endpoint.
Xem giải thích
🧩 Phân tích chi tiết nội dung câu hỏi
Câu hỏi xoay quanh việc triển khai (deploy) hai mô hình Machine Learning (ML) mới lên môi trường production bằng Amazon SageMaker AI của AWS. Công ty cần chọn giải pháp hosting phù hợp cho hai mô hình sau:
-
Model A: Phát hiện giao dịch gian lận dựa trên địa chỉ IP, vị trí và thông tin xác thực người dùng. Mô hình này được truy cập mỗi khi có giao dịch xảy ra (tần suất cao, yêu cầu phản hồi nhanh chóng, real-time inference để tránh độ trễ).
-
Model B: Dự báo tổng doanh số bán hàng cho tháng tiếp theo dựa trên dữ liệu lịch sử. Mô hình này chỉ được truy cập một lần mỗi tháng (tần suất thấp, phù hợp với xử lý hàng loạt offline, không cần endpoint luôn sẵn sàng).
Mục tiêu chính: Chọn hosting solution tối ưu hóa chi phí, hiệu suất và độ tin cậy theo đặc thù sử dụng của từng mô hình. SageMaker hỗ trợ các loại inference chính: Real-time endpoints (phản hồi tức thì), Asynchronous endpoints (xử lý bất đồng bộ cho payload lớn), và Batch Transform (xử lý hàng loạt offline).
Kiến thức cập nhật đến 2026: SageMaker tiếp tục hỗ trợ các tùy chọn này với cải tiến như Multi-Model Endpoints, Serverless Inference (ra mắt 2023), và tối ưu hóa chi phí cho Batch Transform (hỗ trợ GPU/TPU linh hoạt hơn). 📘 Tài liệu tham khảo:
✅ Đáp án đúng và lý do lựa chọn
Đáp án đúng: Host Model A with a real-time endpoint. Use batch transform for Model B.
Lý do 🛠️:
- Model A cần real-time endpoint vì tần suất truy cập cao (mỗi giao dịch), đòi hỏi độ trễ thấp (<1 giây), khả năng scale tự động theo traffic. Real-time endpoints của SageMaker hỗ trợ hosted models luôn sẵn sàng, auto-scaling, và tích hợp với API Gateway/Lambda.
- Model B phù hợp Batch Transform vì chỉ chạy hàng tháng: xử lý offline trên dataset lớn (historical sales data), không tốn chi phí endpoint idle, kết quả lưu vào S3. Batch Transform tiết kiệm chi phí lên đến 80-90% so với endpoint liên tục, và hỗ trợ job lớn mà không cần quản lý endpoint.
- Giải pháp này cân bằng chi phí thấp (batch cho low-frequency), hiệu suất cao (real-time cho high-frequency), và dễ quản lý theo best practices AWS.
📋 Giải thích tất cả các phương án (đúng/sai)
Dưới đây là phân tích từng lựa chọn một cách chi tiết:
-
❌ [SAI] Host both models in one container behind one real-time endpoint.
Phương án này không phù hợp vì Model B chỉ cần chạy hàng tháng, không yêu cầu real-time. Hosting cả hai trong một container real-time endpoint sẽ lãng phí chi phí (endpoint luôn chạy, auto-scaling không cần thiết cho B), tăng độ phức tạp (multi-model endpoint có thể conflict resources), và không tối ưu latency/scale cho Model A riêng biệt. SageMaker Multi-Model Endpoints hỗ trợ nhưng không lý tưởng cho workload khác biệt lớn như vậy. -
❌ [SAI] Host Model A with an asynchronous endpoint. Host Model B with a real-time endpoint.
Sai hoàn toàn vì đảo ngược nhu cầu: Model A cần real-time (fraud detection tức thì), async endpoint (queue-based, độ trễ cao hơn) sẽ gây chậm trễ giao dịch, rủi ro kinh doanh cao. Model B không cần real-time (chỉ monthly), dùng real-time endpoint lãng phí chi phí idle 99% thời gian. Async phù hợp payload lớn (>6MB) hoặc non-urgent, không phải trường hợp này. -
✅ [ĐÚNG] Host Model A with a real-time endpoint. Use batch transform for Model B.
Như đã giải thích ở phần trên: Hoàn hảo khớp yêu cầu – real-time cho high-frequency/low-latency (A), batch offline cho low-frequency/cost-saving (B). SageMaker Batch Transform chạy job on-demand, hỗ trợ split dataset lớn, tích hợp S3 input/output, và scale theo instance types mới nhất (như Trainium/Inferentia 2025+). -
❌ [SAI] Use batch transform for Model A. Host Model B with an asynchronous endpoint.
Không khả thi vì Model A cần real-time (mỗi transaction), batch transform là offline/job-based (chạy theo batch, không phản hồi ngay), sẽ làm chậm fraud detection, mất cơ hội chặn gian lận kịp thời. Model B không cần async (monthly forecast là batch job, async phù hợp streaming/large payload urgent hơn, nhưng vẫn tốn kém hơn batch transform thuần).
Which modeling approach will meet these requirements?
- A Train the model by using the Object2Vec algorithm.
- B Train the model by using the linear learner algorithm.
- C Train a neural network.
- D Train the model by using the k-means algorithm.
Xem giải thích
🧩 Phân tích chi tiết câu hỏi
📘 Nội dung câu hỏi:
Câu hỏi xoay quanh một ngân hàng muốn sử dụng Amazon SageMaker (một dịch vụ ML managed của AWS) để xây dựng mô hình Machine Learning (ML) nhằm xác định khách hàng đủ điều kiện cho một sản phẩm mới. Các yêu cầu chính bao gồm:
- ✅ Phải sử dụng algorithms mà SageMaker trực tiếp hỗ trợ (tức là các built-in algorithms có sẵn trong SageMaker, không cần code custom).
- ✅ Mô hình phải explainable (có thể giải thích rõ ràng) để trình bày cho cơ quan quản lý (regulators), vì lĩnh vực ngân hàng cần tính minh bạch cao để tuân thủ quy định như GDPR hoặc các luật tài chính.
Đây là bài toán supervised learning (phân loại hoặc hồi quy) vì cần dự đoán "qualify" dựa trên dữ liệu khách hàng. SageMaker cung cấp các built-in algorithms như Linear Learner, XGBoost, v.v., và explainability thường đạt được qua các mô hình tuyến tính (linear models) nơi weights/coefficients có thể trực tiếp diễn giải.
🛠️ Đáp án đúng:
Train the model by using the linear learner algorithm.
Lý do lựa chọn:
✅ Linear Learner là một built-in algorithm của SageMaker (hỗ trợ classification và regression), được thiết kế cho các mô hình tuyến tính đơn giản, dễ giải thích. Các hệ số (coefficients) trong mô hình có thể được trích xuất trực tiếp để giải thích tác động của từng feature (ví dụ: thu nhập cao → tăng xác suất qualify). Điều này hoàn hảo cho yêu cầu explainable của regulators. SageMaker hỗ trợ nó qua API đơn giản như sagemaker.LinearLearner. (Cập nhật AWS 2024-2026: Vẫn là standard built-in algo, tích hợp tốt với SageMaker Clarify cho explainability nâng cao).
📋 Giải thích tất cả các phương án
-
❌ Train the model by using the Object2Vec algorithm.
Sai vì Object2Vec là built-in algo của SageMaker dùng cho semantic embeddings (chuyển đổi objects như text/images thành vectors), phù hợp với similarity tasks chứ không phải classification trực tiếp. Nó dựa trên neural networks phức tạp, không explainable (black-box), khó trình bày coefficients cho regulators. Không phù hợp với bài toán qualify khách hàng. -
✅ Train the model by using the linear learner algorithm.
Đúng như đã giải thích ở trên: Built-in, hỗ trợ trực tiếp, explainable cao nhờ tính tuyến tính, dễ tích hợp và scale trên SageMaker. -
❌ Train a neural network.
Sai vì SageMaker không trực tiếp hỗ trợ neural networks như một built-in algorithm đơn lẻ (chỉ qua frameworks như TensorFlow/PyTorch với custom containers hoặc SageMaker JumpStart). Neural networks là black-box, rất khó explainable (cần tools như SHAP/LIME bổ sung), không đáp ứng "directly supports" và yêu cầu minh bạch cho regulators. -
❌ Train the model by using the k-means algorithm.
Sai vì K-means là built-in algo cho unsupervised clustering (nhóm dữ liệu tương đồng), không phù hợp với bài toán supervised classification (dự đoán qualify dựa trên labels). Clustering không có predictions nhị phân và không explainable rõ ràng (chỉ centroids), khó giải thích quyết định cho từng khách hàng.
📚 Tài liệu tham khảo (AWS cập nhật mới nhất 2024-2026)
- SageMaker Built-in Algorithms: docs.aws.amazon.com/sagemaker/latest/dg/algos.html – Chi tiết Linear Learner và các algo khác.
- Explainable AI in SageMaker: docs.aws.amazon.com/sagemaker/latest/dg/clarify.html – Tích hợp với Linear Learner cho feature importance.
- AWS Well-Architected Framework - ML Lens: Nhấn mạnh explainability cho regulated industries như banking.
Hy vọng phân tích này giúp bạn ôn thi AWS Certified DevOps Engineer Professional hiệu quả! 🚀 Nếu cần thêm ví dụ code SageMaker, hãy hỏi nhé!