Ngân hàng đề — AWS Certified AI Practitioner
Tìm thấy 623 câu.
Which AWS service or feature meets these requirements?
- A Amazon SageMaker Data Wrangler
- B Amazon SageMaker Ground Truth Plus
- C Amazon Transcribe
- D Amazon Macie
Xem giải thích
🔎 Phân tích câu hỏi
Công ty muốn gán nhãn (label) cho tập dữ liệu đào tạo bằng cách thu thập phản hồi của con người (human feedback) để fine‑tune một Foundation Model (FM). Điều quan trọng là công ty không muốn tự xây dựng ứng dụng gán nhãn và không muốn quản lý đội ngũ gán nhãn (labeling workforce). Vì vậy họ cần một dịch vụ đã được quản lý hoàn toàn, cung cấp giao diện người dùng để thu thập nhãn và có thể tích hợp trực tiếp vào quy trình Machine Learning trên AWS.
✅ Đáp án đúng
Amazon SageMaker Ground Truth Plus
- Đây là dịch vụ được quản lý cho việc tạo và quản lý nhãn dữ liệu.
- Ground Truth Plus cung cấp Human‑in‑the‑Loop (HITL) labeling với đội ngũ lao động nội bộ của AWS (AWS workforce) hoặc cộng đồng bên ngoài (Mechanical Turk, Scale AI, …) mà không cần công ty tự xây dựng hay quản lý workforce.
- Tính năng Active Learning giúp giảm số lượng mẫu cần gán nhãn, phù hợp cho việc “fine‑tune” một Foundation Model.
- Kết nối liền mạch với SageMaker Studio, SageMaker Pipelines, và Feature Store, cho phép đưa dữ liệu đã gán nhãn vào quy trình huấn luyện mô hình một cách tự động.
- Đến tháng 3/2026, AWS đã cập nhật Ground Truth Plus để hỗ trợ labeling cho các mô hình ngôn ngữ lớn (LLM) và multimodal foundation models, đáp ứng yêu cầu “human feedback for FM fine‑tuning”.
Nguồn tham khảo:
- AWS Documentation – Amazon SageMaker Ground Truth (phiên bản 2026)
- AWS Blog – Introducing SageMaker Ground Truth Plus for foundation model labeling (Jan 2025)
❌ Giải thích các phương án sai
-
Amazon SageMaker Data Wrangler
- 🧩 Chức năng: Dùng để khảo sát, làm sạch, chuyển đổi và chuẩn bị dữ liệu trước khi đưa vào mô hình.
- ❌ Lý do sai: Không cung cấp bất kỳ tính năng nào để gán nhãn bằng con người; nó chỉ là công cụ ETL cho dữ liệu. Do đó không đáp ứng yêu cầu “human feedback” và “no workforce management”.
-
Amazon Transcribe
- 🧩 Chức năng: Dịch vụ chuyển đổi giọng nói thành văn bản (speech‑to‑text).
- ❌ Lý do sai: Không liên quan tới việc gán nhãn dữ liệu; chỉ tạo ra bản ghi âm được chuyển sang text. Không hỗ trợ labeling workflow, không có workforce tích hợp.
-
Amazon Macie
- 🧩 Chức năng: Dịch vụ phát hiện và bảo vệ dữ liệu nhạy cảm (PII, dữ liệu tài chính) trong S3 bằng machine learning.
- ❌ Lý do sai: Macie tập trung vào bảo mật và tuân thủ, không có tính năng gán nhãn hay thu thập phản hồi con người. Vì vậy không phù hợp với yêu cầu của câu hỏi.
🛠️ Tổng kết (điểm mạnh của Ground Truth Plus)
- Quản lý toàn bộ quy trình labeling → không cần phát triển ứng dụng riêng.
- Cung cấp workforce nội bộ của AWS → công ty không phải “manage a labeling workforce”.
- Active Learning & Human‑in‑the‑Loop → giảm chi phí và tăng chất lượng nhãn, rất phù hợp cho việc fine‑tune foundation model.
- Tích hợp sẵn với SageMaker → dữ liệu sau khi gán nhãn có thể đưa thẳng vào pipeline huấn luyện.
Vì vậy, Amazon SageMaker Ground Truth Plus là lựa chọn duy nhất đáp ứng đầy đủ các yêu cầu của câu hỏi. 🚀
Which AWS service meets these requirements?
- A Amazon Comprehend
- B Amazon Personalize
- C Amazon Polly
- D Amazon OpenSearch Service
Xem giải thích
📖 Phân tích câu hỏi
- Mục tiêu của công ty: Cho phép khách hàng tìm kiếm và lọc ảnh dựa trên mô tả ngôn ngữ tự nhiên.
- Yêu cầu kỹ thuật: Khi người dùng nhập một câu mô tả, hệ thống sẽ chuyển câu đó thành một vector embedding (ví dụ dùng mô hình NLP). Sau đó cần tìm các vector ảnh có độ tương đồng cao nhất (similarity search / nearest‑neighbor query).
- Kiến trúc cần: Một cơ sở dữ liệu vector (vector store) hỗ trợ truy vấn k‑Nearest Neighbors (k‑NN) trên các vector có chiều cao (thường 128‑1024).
Với yêu cầu “vector database” để thực hiện similarity searches và nearest‑neighbor queries, dịch vụ AWS phù hợp nhất hiện nay (tính tới năm 2026) là Amazon OpenSearch Service – phiên bản OpenSearch tích hợp plugin k‑NN cho phép lưu trữ và tra‑cứu vector bằng thuật toán HNSW hoặc IVF‑PQ.
✅ Đáp án đúng
🟢 Amazon OpenSearch Service
- OpenSearch Service (trước đây là Amazon Elasticsearch Service) cung cấp tính năng k‑NN cho phép tạo index vector, lưu trữ vector embedding và thực hiện truy vấn tìm kiếm gần nhất với độ trễ thấp.
- Hỗ trợ API RESTful, tích hợp dễ dàng với các mô hình NLP/Computer Vision (ví dụ Amazon SageMaker, Amazon Bedrock) để đưa vector vào index.
- Được quản lý hoàn toàn, khả năng mở rộng tự động, và tích hợp sẵn với IAM, VPC, Encryption, đáp ứng các yêu cầu bảo mật của môi trường doanh nghiệp.
Nguồn tham khảo:
- AWS Documentation – Amazon OpenSearch Service – k‑Nearest Neighbor (k‑NN) Search (https://docs.aws.amazon.com/opensearch-service/latest/developerguide/k-NN.html)
- AWS Blog – Introducing k‑NN vector search on Amazon OpenSearch Service (2023)
🧩 Giải thích các phương án (giữ nguyên nội dung tiếng Anh)
-
Amazon Comprehend
- ❌ Lý do: Amazon Comprehend là dịch vụ xử lý ngôn ngữ tự nhiên (NLP), chuyên về phân tích sentiment, thực thể, key phrases, v.v. Nó không cung cấp khả năng lưu trữ hoặc truy vấn vector. Do đó không phù hợp cho việc thực hiện tìm kiếm ảnh dựa trên vector similarity.
-
Amazon Personalize
- ❌ Lý do: Amazon Personalize là dịch vụ đề xuất (recommendation) dựa trên hành vi người dùng và dữ liệu giao dịch. Mặc dù có thể tạo ra mô hình machine‑learning, nó không phải là một vector database và không hỗ trợ truy vấn k‑NN cho embedding ảnh.
-
Amazon Polly
- ❌ Lý do: Amazon Polly là dịch vụ chuyển văn bản thành giọng nói (text‑to‑speech). Nó không liên quan tới lưu trữ hoặc tra‑cứu vector, nên không đáp ứng yêu cầu “vector database”.
-
Amazon OpenSearch Service
- 🟢 Lý do: Như đã nêu ở mục “Đáp án đúng”, OpenSearch Service cung cấp module k‑NN cho phép tạo index vector, thực hiện similarity search và nearest‑neighbor queries trên các vector embedding. Đây là dịch vụ duy nhất trong danh sách đáp ứng đầy đủ yêu cầu của câu hỏi.
🛠️ Kết luận nhanh
- Để triển khai tìm kiếm ảnh dựa trên mô tả ngôn ngữ tự nhiên cần một cơ sở dữ liệu vector có khả năng k‑NN.
- Amazon OpenSearch Service (với plugin k‑NN) là lựa chọn đúng trong các tùy chọn đã cho.
- Các dịch vụ còn lại (Comprehend, Personalize, Polly) đều không cung cấp chức năng lưu trữ và truy vấn vector, vì vậy không phù hợp.
💡 Gợi ý thực tế: Khi xây dựng pipeline, bạn có thể dùng Amazon SageMaker hoặc Amazon Bedrock để sinh embeddings (ví dụ CLIP, BERT) và sau đó đẩy các vector này vào OpenSearch index để người dùng cuối thực hiện truy vấn tìm kiếm gần nhất.
✨ Chúc bạn ôn luyện thành công và đạt điểm cao trong kỳ thi AWS Certified DevOps Engineer – Professional! 🚀
Which approach will meet this requirement?
- A Classification
- B Continued pre-training
- C Distillation
- D Regression
Xem giải thích
🔎 Phân tích câu hỏi
- Bối cảnh: Công ty đang phát triển một công cụ AI sinh (generative AI). Họ muốn “customize” (tùy biến) một foundation model (FM) bằng cách sử dụng các tài liệu nội bộ của mình.
- Yêu cầu: Chọn phương pháp phù hợp nhất để “điều chỉnh” (customize) mô hình nền tảng sao cho mô hình nắm bắt được kiến thức, ngôn ngữ và phong cách đặc thù của tài liệu nội bộ.
Trong môi trường AWS hiện nay (2024‑2026) :
- Amazon Bedrock và Amazon SageMaker hỗ trợ continued pre‑training (còn gọi là pre‑training tiếp tục hoặc domain‑adaptive pre‑training) để “đào tạo lại” mô hình nền tảng trên tập dữ liệu riêng.
- Các phương pháp như classification, distillation hay regression không phải là cách “tùy biến” mô hình sinh dựa trên dữ liệu văn bản.
✅ Đáp án đúng: Continued pre‑training
📖 Lý do lựa chọn:
- Continued pre‑training (tiếp tục đào tạo) cho phép lấy một foundation model đã được huấn luyện trên một kho dữ liệu lớn (ví dụ: Amazon Titan, Llama‑3, Claude, …) và đào tạo thêm (pre‑train) trên tập dữ liệu nội bộ của công ty.
- Kỹ thuật này giúp mô hình học các thuật ngữ, cấu trúc, phong cách và kiến thức chuyên ngành mà chỉ có trong tài liệu nội bộ, đồng thời vẫn giữ được khả năng sinh nội dung tổng quát.
- AWS SageMaker Data Parallel và Model Parallel cùng với SageMaker JumpStart hoặc Bedrock Custom Model cung cấp workflow “continual pre‑training” chỉ với vài bước cấu hình và chi phí tính theo thời gian tính toán.
❌ Phân tích các phương án còn lại
-
Classification
- Giải thích: Phương pháp này dùng để phân loại đầu vào thành các nhãn (label) cố định (ví dụ: spam/không spam, sentiment).
- Tại sao sai: Không liên quan đến việc “điều chỉnh” một mô hình sinh để hiểu nội dung tài liệu. Classification chỉ tạo ra một mô hình discriminative chứ không thay đổi trọng số của mô hình sinh nền tảng.
-
Distillation
- Giải thích: Model distillation là kỹ thuật tạo mô hình nhẹ (student) từ một mô hình lớn (teacher) bằng cách truyền kiến thức.
- Tại sao sai: Mục tiêu của distillation là giảm kích thước và tốc độ suy luận, không phải tùy biến mô hình để nắm bắt dữ liệu nội bộ. Ngoài ra, quá trình này không “học” thêm kiến thức mới từ tài liệu nội bộ.
-
Regression
- Giải thích: Regression là phương pháp dự đoán một giá trị số liên tục (ví dụ: dự báo giá, thời gian).
- Tại sao sai: Không liên quan tới việc huấn luyện lại một mô hình ngôn ngữ để sinh văn bản. Regression chỉ áp dụng cho các bài toán dự báo số học, không phải cho việc “customize” foundation model.
🛠️ Cách thực hiện Continued Pre‑training trên AWS (2024‑2026)
-
Chuẩn bị dữ liệu
- Thu thập tài liệu nội bộ, chuyển thành text files hoặc JSONL (mỗi dòng một đoạn văn).
- Dùng Amazon S3 để lưu trữ, áp dụng S3 Object Lock/Encryption để bảo mật dữ liệu nhạy cảm.
-
Tạo môi trường SageMaker
- Khởi tạo SageMaker Studio hoặc SageMaker Notebook Instance.
- Cài đặt Hugging Face Deep Learning Container hoặc AWS Trainium‑enabled image (trong trường hợp muốn dùng trainium cho hiệu năng cao).
-
Thiết lập job continued pre‑training
- Sử dụng SageMaker TrainingJob với
training_imagelà một mô hình foundation (ví dụ:huggingface/pytorch‑transformers:latest). - Đặt
hyperparametersnhưlearning_rate,num_train_epochs, vàdo_train=true. - Chỉ định
train_datasettrỏ tới S3 bucket chứa dữ liệu nội bộ.
- Sử dụng SageMaker TrainingJob với
-
Triển khai mô hình đã tùy biến
- Đăng ký mô hình lên SageMaker Model Registry hoặc Amazon Bedrock Custom Model để sử dụng qua API hoặc SDK.
- Kích hoạt inference endpoint (Real‑time hoặc Asynchronous) để tích hợp vào công cụ AI sinh của công ty.
-
Quản lý chi phí và bảo mật
- Kích hoạt SageMaker Savings Plans hoặc Spot Instances cho training để giảm chi phí.
- Áp dụng IAM policies và VPC endpoints để hạn chế truy cập dữ liệu.
📚 Tham khảo tài liệu (đến 2026)
- AWS Documentation – SageMaker Training: https://docs.aws.amazon.com/sagemaker/latest/dg/training.html (phiên bản cập nhật 2025‑12).
- Amazon Bedrock – Custom Model: https://docs.aws.amazon.com/bedrock/latest/userguide/custom-models.html (cập nhật 2026‑02).
- AWS Blog – “Fine‑tuning foundation models with SageMaker” (2024‑08) – hướng dẫn chi tiết về continued pre‑training.
- Hugging Face – “Continual Pre‑training of Large Language Models” (2025‑03) – mô tả thuật toán và best‑practice.
🔚 Kết luận
Để “customize” một foundation model bằng các tài liệu nội bộ, Continued pre‑training là cách tiếp cận đúng nhất trong môi trường AWS hiện đại. Các phương pháp khác (Classification, Distillation, Regression) không đáp ứng yêu cầu về việc học thêm kiến thức ngôn ngữ và nội dung từ dữ liệu nội bộ. 🎯
Which solution will meet these requirements?
- A Restart the SageMaker AI endpoint.
- B Adjust the monitoring sensitivity.
- C Re-train the model with fresh data.
- D Set up experiments tracking.
Xem giải thích
🔎 Phân tích câu hỏi
Một công ty đang dùng Amazon SageMaker Model Monitor để giám sát mô hình dự báo. Khi dữ liệu đầu vào thay đổi (data drift) vượt quá ngưỡng đã định, công ty lo ngại rằng mô hình hiện tại sẽ cho ra kết quả kém, có thể gây ảnh hưởng tiêu cực tới hoạt động kinh doanh.
Yêu cầu: “Mitigate a potentially adverse impact on the predictive model” – tức là phải thực hiện biện pháp để giảm thiểu tác động tiêu cực khi dữ liệu drift xảy ra.
Trong môi trường SageMaker, các cách khắc phục data drift thường là:
- Cập nhật (re‑train) mô hình bằng dữ liệu mới phản ánh đúng phân phối hiện tại.
- Triển khai lại (deploy) phiên bản mô hình mới lên endpoint.
- Tự động hoá quy trình (pipeline) để tái huấn luyện khi drift được phát hiện.
Các hành động như restart endpoint, điều chỉnh độ nhạy của monitor, hay tạo experiment tracking chỉ giúp phát hiện hoặc ghi lại drift, không giải quyết được vấn đề mô hình đã lỗi thời.
✅ Đáp án đúng
✅ Re‑train the model with fresh data.
Lý do:
- Khi drift xảy ra, phân phối dữ liệu mới không còn phù hợp với mô hình đã huấn luyện. Việc tái huấn luyện mô hình bằng dữ liệu mới (có nhãn hoặc không nhãn tùy thuộc vào quy trình) sẽ giúp mô hình học lại các mối quan hệ mới, từ đó giảm thiểu sai số và tác động tiêu cực.
- Sau khi tái huấn luyện, bạn có thể đăng ký phiên bản mới trong SageMaker Model Registry và đổi endpoint hoặc cập nhật Blue/Green deployment để đưa mô hình mới vào sản xuất mà không gây gián đoạn.
- AWS khuyến nghị: “When drift is detected, you should retrain the model on recent data and redeploy the updated model.” (AWS SageMaker Model Monitor documentation, 2026).
❌ Giải thích các phương án sai
-
❌ Restart the SageMaker AI endpoint.
- Giải thích: Restart chỉ làm tái khởi động endpoint hiện tại, không thay đổi bất kỳ gì về trọng số hay kiến trúc mô hình. Khi dữ liệu drift, mô hình cũ vẫn sẽ đưa ra dự đoán sai dù endpoint đã được khởi động lại. Đây chỉ là một thao tác quản trị, không giải quyết vấn đề drift.
-
❌ Adjust the monitoring sensitivity.
- Giải thích: Điều chỉnh độ nhạy (sensitivity) của Model Monitor chỉ ảnh hưởng đến cách phát hiện drift (ví dụ: giảm hoặc tăng ngưỡng cảnh báo). Nó không thay đổi mô hình hay dữ liệu đầu vào. Khi drift đã vượt ngưỡng, việc thay đổi ngưỡng sẽ chỉ làm chậm hoặc bỏ lỡ cảnh báo, không khắc phục tác động tiêu cực.
-
❌ Set up experiments tracking.
- Giải thích: Experiments tracking (SageMaker Experiments) giúp ghi lại, so sánh và quản lý các thử nghiệm mô hình (phiên bản, siêu tham số, dữ liệu). Đây là công cụ giám sát quá trình phát triển, không phải công cụ để giảm thiểu drift trong môi trường sản xuất. Khi drift đã xảy ra, việc chỉ tạo experiment không đưa ra giải pháp khắc phục.
📚 Tham khảo tài liệu (AWS, cập nhật 2026)
- Amazon SageMaker Model Monitor – Detecting Data Drift
- Best Practices for Updating Models in SageMaker
- SageMaker Model Registry and Blue/Green Deployments
- AWS Well‑Architected Framework – Machine Learning Lens (2025 Update)
🧩 Kết luận
- Câu hỏi yêu cầu một giải pháp giảm thiểu tác động tiêu cực khi data drift xảy ra.
- Giải pháp duy nhất đáp ứng yêu cầu là tái huấn luyện mô hình với dữ liệu mới (re‑train with fresh data), sau đó triển khai lại mô hình.
- Các phương án còn lại chỉ liên quan tới việc quản lý, phát hiện hoặc ghi lại drift, không giải quyết được vấn đề mô hình lỗi thời.
👉 Khi gặp data drift thực tế, hãy thiết lập pipeline tự động (SageMaker Pipelines) để:
- Phát hiện drift →
- Thu thập dữ liệu mới →
- Tái huấn luyện →
- Đăng ký mô hình mới →
- Cập nhật endpoint một cách an toàn.
Điều này giúp duy trì độ chính xác dự báo và giảm thiểu rủi ro cho doanh nghiệp. 🚀
Which solution meets these requirements?
- A Use a rule-based system instead of an ML model.
- B Apply explainable AI techniques to show customers which factors influenced the model’s decision.
- C Develop an interactive UI for customers and provide clear technical explanations about the system.
- D Increase the accuracy of the model to reduce the need for transparency.
Xem giải thích
🔎 Phân tích câu hỏi
Công ty tài chính đang sử dụng một mô hình AI sinh ra (generative AI) để gán hạn mức tín dụng cho khách hàng mới.
Mục tiêu: tăng tính minh bạch (transparency) trong quá trình quyết định của mô hình, để khách hàng hiểu được “tại sao” họ nhận được mức hạn mức hiện tại.
Trong môi trường AWS, “giải thích được AI” (Explainable AI – XAI) được hỗ trợ qua các công cụ như Amazon SageMaker Clarify, Amazon SageMaker Model Monitor, và các tính năng Explainability trong Amazon Bedrock. Các công cụ này cho phép trích xuất feature importance, SHAP values, LIME, hoặc counterfactual explanations và hiển thị chúng cho người dùng cuối.
Do đó, đáp án cần cung cấp kỹ thuật explainable AI để trình bày các yếu tố ảnh hưởng tới quyết định, chứ không phải thay thế mô hình bằng quy tắc cứng nhắc, hay chỉ tăng độ chính xác mà không giải thích, hay chỉ tạo UI mà không có nội dung giải thích thực sự.
✅ Đáp án đúng
• Apply explainable AI techniques to show customers which factors influenced the model’s decision.
Giải thích:
- Sử dụng XAI (ví dụ: SageMaker Clarify, SHAP, LIME, hoặc các giải pháp Bedrock Explainability) cho phép trích xuất và hiển thị các yếu tố (features) quan trọng đã ảnh hưởng tới quyết định cấp hạn mức.
- Khách hàng nhận được giải thích có tính chất “why” (ví dụ: “Điểm tín dụng, lịch sử thanh toán, và thu nhập hàng tháng là ba yếu tố quyết định”).
- Giải pháp này phù hợp với yêu cầu minh bạch và vẫn giữ độ hiệu quả của mô hình AI hiện tại.
- AWS cung cấp các dịch vụ và API tích hợp sẵn để tự động sinh explanations và đưa chúng vào UI của công ty mà không cần xây dựng lại toàn bộ pipeline.
❌ Các phương án sai và lý do
-
Use a rule‑based system instead of an ML model.
- ❌ Lý do: Thay đổi hoàn toàn sang hệ thống dựa trên quy tắc sẽ đánh mất lợi thế dự đoán chính xác của mô hình AI, đặc biệt trong lĩnh vực tài chính nơi dữ liệu phức tạp.
- Quy tắc cứng nhắc không thể phản ánh mối quan hệ phi tuyến mà AI đã học được, và không đáp ứng yêu cầu “giải thích các yếu tố ảnh hưởng” mà chỉ cung cấp luật cố định.
- AWS không đề xuất việc bỏ hoàn toàn ML khi mục tiêu chỉ là tăng tính minh bạch; thay vào đó, họ khuyến khích Explainability.
-
Develop an interactive UI for customers and provide clear technical explanations about the system.
- ❌ Lý do: Việc xây dựng UI là một phần quan trọng, nhưng không đủ nếu không có các giải thích dữ liệu thực tế (feature importance) do mô hình tạo ra.
- “Clear technical explanations” mà không dựa trên kết quả thực tế của mô hình sẽ chỉ là mô tả chung (ví dụ: “hệ thống dựa trên học máy”) và không đáp ứng yêu cầu “which factors influenced the decision.”
- Đúng hướng là kết hợp UI với công cụ XAI; tuy nhiên, câu trả lời này chỉ nói tới UI, không đề cập tới công nghệ explainability.
-
Increase the accuracy of the model to reduce the need for transparency.
- ❌ Lý do: Độ chính xác cao không thay thế được độ minh bạch. Ngay cả khi mô hình đạt 99% chính xác, khách hàng và các cơ quan quản lý vẫn yêu cầu giải thích về quyết định (đặc biệt trong ngành tài chính, nơi có các quy định như Fair Lending, GDPR, CCPA).
- AWS luôn nhấn mạnh rằng explainability và accuracy là hai khía cạnh độc lập; một mô hình “đen” dù tốt vẫn không đáp ứng yêu cầu pháp lý và trải nghiệm khách hàng.
- Việc “giảm nhu cầu minh bạch” là quan điểm sai lầm và không phù hợp với các chuẩn model governance hiện đại.
🛠️ Gợi ý triển khai trên AWS (đến năm 2026)
-
Amazon SageMaker Clarify:
- Tự động tính SHAP values hoặc Permutation Feature Importance trong quá trình training hoặc inference.
- Cung cấp API để lấy explanations cho mỗi dự đoán và đẩy chúng tới frontend.
-
Amazon Bedrock (Model Explainability):
- Nếu mô hình generative được triển khai trên Bedrock, có thể bật Explainability để nhận feature attributions cho mỗi response.
-
AWS Lambda + API Gateway:
- Xây dựng endpoint trả về explanations kèm theo kết quả hạn mức.
-
Amazon CloudWatch + SageMaker Model Monitor:
- Theo dõi bias, drift, và explainability metrics để duy trì tính công bằng và minh bạch theo thời gian.
-
AWS IAM & AWS KMS:
- Đảm bảo quyền truy cập và bảo mật cho dữ liệu nhạy cảm khi truyền explanations tới khách hàng.
📚 Tham khảo (đến 2026)
- AWS Documentation – Amazon SageMaker Clarify – https://docs.aws.amazon.com/sagemaker/latest/dg/clarify.html
- AWS Blog – Explainability for Generative AI on Amazon Bedrock – 2025/09/15
- AWS Well‑Architected Framework – Machine Learning Lens – https://aws.amazon.com/architecture/well-architected/ml/
- Regulatory guidance – Fair Lending and Explainability – US CFPB, 2024 update (có liên quan tới yêu cầu giải thích quyết định tín dụng).
📌 Tổng kết
- ✅ Đáp án đúng: Apply explainable AI techniques to show customers which factors influenced the model’s decision.
- ❌ Các đáp án còn lại không đáp ứng yêu cầu minh bạch hoặc không liên quan tới việc cung cấp giải thích dựa trên mô hình AI.
Bằng cách áp dụng các công cụ Explainability của AWS (SageMaker Clarify, Bedrock Explainability) và tích hợp chúng vào giao diện khách hàng, công ty tài chính có thể đảm bảo tính minh bạch, tuân thủ quy định, và cải thiện niềm tin của khách hàng mà không hy sinh hiệu suất của mô hình AI. 🚀
Which solution will meet these requirements?
- A Retrain the model. Monitor model drift by using Amazon SageMaker Clarify.
- B Retrain the model. Monitor model drift by using Amazon SageMaker Model Monitor.
- C Build a new model. Monitor model drift by using Amazon SageMaker Feature Store.
- D Build a new model. Monitor model drift by using Amazon SageMaker JumpStart.
Xem giải thích
🔎 Phân tích câu hỏi
- Bối cảnh: Một công ty đã đưa một mô hình Machine Learning vào môi trường sản xuất (production). Sau 4 tháng, chất lượng suy giảm (model inference quality degraded).
- Yêu cầu:
- Nhận thông báo (notification) ngay khi chất lượng suy giảm.
- Đảm bảo rằng vấn đề không tái diễn trong tương lai (có cơ chế giám sát, cảnh báo và cập nhật mô hình).
=> Câu hỏi đang kiểm tra kiến thức về giám sát drift (model drift / data drift) và cơ chế tự động hoá quy trình tái huấn luyện trong Amazon SageMaker.
✅ Đáp án đúng
Retrain the model. Monitor model drift by using Amazon SageMaker Model Monitor.
Vì sao đây là đáp án đúng?
- Amazon SageMaker Model Monitor (được cập nhật liên tục tới 2026) cho phép:
- Tự động giám sát các thống kê đầu ra của mô hình (feature distribution, prediction distribution) và phát hiện drift so với baseline đã lưu.
- Tạo cảnh báo qua Amazon CloudWatch Events / SNS khi phát hiện drift vượt ngưỡng, đáp ứng yêu cầu “receive a notification”.
- Tích hợp với pipeline CI/CD (SageMaker Pipelines) để tự động re‑train mô hình khi drift được phát hiện, giúp “ensure that the problem does not happen again”.
- Việc re‑train mô hình là bước thực tiễn khi drift đã làm giảm chất lượng, và Model Monitor cung cấp các metric và alerts cần thiết.
❌ Giải thích các phương án sai
1. Retrain the model. Monitor model drift by using Amazon SageMaker Clarify.
- Amazon SageMaker Clarify chủ yếu dùng để đánh giá bias, explainability và một số tính năng phát hiện data bias; không phải công cụ chính để giám sát drift và không cung cấp cảnh báo tự động qua CloudWatch/SNS.
- Dù có thể dùng Clarify để detect bias, nó không đáp ứng yêu cầu “receive a notification if the model inference quality degrades”.
2. Build a new model. Monitor model drift by using Amazon SageMaker Feature Store.
- Amazon SageMaker Feature Store là kho lưu trữ và quản lý feature data (định dạng, versioning, retrieval). Nó không thực hiện giám sát drift hay tạo cảnh báo.
- “Build a new model” là hành động không cần thiết nếu chỉ cần re‑train dựa trên dữ liệu mới; việc xây dựng một mô hình hoàn toàn mới sẽ tốn thời gian và không giải quyết vấn đề cảnh báo.
3. Build a new model. Monitor model drift by using Amazon SageMaker JumpStart.
- Amazon SageMaker JumpStart cung cấp các mẫu (pre‑trained models) và solution templates để khởi tạo nhanh, nhưng không có chức năng giám sát drift hay cảnh báo.
- Tương tự như trên, việc “build a new model” không phải là cách tiếp cận tối ưu khi đã có mô hình đang hoạt động và chỉ cần re‑train khi drift xảy ra.
📚 Tham khảo tài liệu (đến năm 2026)
- Amazon SageMaker Model Monitor – Documentation (cập nhật 2026: hỗ trợ tự động tạo alarm CloudWatch, tích hợp SageMaker Pipelines).
- Amazon SageMaker Clarify – Documentation.
- Amazon SageMaker Feature Store – Documentation.
- Amazon SageMaker JumpStart – Documentation.
🛠️ Kết luận nhanh gọn
- Công cụ đúng: SageMaker Model Monitor + re‑train.
- Lý do: Cung cấp giám sát drift, cảnh báo tự động và dễ tích hợp vào pipeline tái huấn luyện, đáp ứng cả hai yêu cầu “notification” và “prevent recurrence”.
👍 Nếu công ty muốn một giải pháp toàn diện, nên:
- Thiết lập baseline cho các thống kê đầu vào/đầu ra bằng Model Monitor.
- Định nghĩa thresholds và CloudWatch alarms → SNS để gửi email/SMS.
- Kết nối Model Monitor với SageMaker Pipelines để tự động trigger quy trình re‑training và deployment khi drift được phát hiện.
Which metric will meet this requirement?
- A Recall
- B Area under the ROC curve (AUC)
- C Recall-Oriented Understudy for Gisting Evaluation (ROUGE)
- D Mean squared error (MSE)
Xem giải thích
🔎 Phân tích câu hỏi
Công ty đang so sánh một số large language models (LLM) để thực hiện tổng hợp văn bản (text summarization). Để quyết định mô hình nào cho kết quả tốt nhất, họ cần chọn một metric đo lường chất lượng của các bản tóm tắt do LLM sinh ra.
- Yêu cầu: metric phải phản ánh độ tương đồng nội dung giữa bản tóm tắt tự động và bản tóm tắt tham chiếu (ground‑truth).
- Trong các metric truyền thống, ROUGE (Recall‑Oriented Understudy for Gisting Evaluation) là tiêu chuẩn công nghiệp cho việc đánh giá tóm tắt, vì nó tính toán các n‑gram, chuỗi con (skip‑bigram) và longest common subsequence giữa đầu ra và bản chuẩn.
✅ Đáp án đúng
Recall‑Oriented Understudy for Gisting Evaluation (ROUGE)
🟢 Lý do chọn ROUGE
- Thiết kế cho summarization – ROUGE được sinh ra từ nhu cầu đánh giá hệ thống tóm tắt, nên nó đo lường mức độ “gợi nhớ” (recall) của các n‑gram quan trọng trong bản chuẩn.
- Các biến thể phong phú – ROUGE‑1, ROUGE‑2, ROUGE‑L, ROUGE‑SU4… cho phép đo lường chi tiết các khía cạnh:
- ROUGE‑1/2: độ trùng khớp n‑gram.
- ROUGE‑L: longest common subsequence, phản ánh thứ tự câu.
- ROUGE‑SU4: skip‑bigram với tối đa 4 khoảng cách, đánh giá ngữ cảnh linh hoạt.
- Được cộng đồng NLP chấp nhận rộng rãi – Các hội nghị (ACL, EMNLP) và benchmark (GLUE, SuperGLUE, SummEval) vẫn dùng ROUGE làm chỉ số chuẩn cho summarization.
- Triển khai dễ dàng trên AWS – Có sẵn trong các SDK Python (
rouge_score,datasets), có thể chạy trên Amazon SageMaker Processing Jobs hoặc AWS Lambda để tự động hoá pipeline đánh giá.
❌ Giải thích các phương án sai
-
Recall
- Recall chỉ đo tỷ lệ phần tử đúng được “gợi lại” trong một tập hợp, thường dùng cho binary classification hoặc information retrieval.
- Nó không xét đến thứ tự hay cấu trúc ngôn ngữ, vì vậy không đủ để đánh giá chất lượng bản tóm tắt đầy đủ như ROUGE.
-
Area under the ROC curve (AUC)
- AUC là metric cho binary classifier (đánh giá khả năng phân biệt giữa hai lớp).
- Summarization không phải là bài toán phân loại, mà là tạo ra chuỗi văn bản; do đó AUC không áp dụng và không phản ánh độ giống nội dung.
-
Mean squared error (MSE)
- MSE đo sai số trung bình bình phương giữa các giá trị số (ví dụ: dự báo thời gian, giá trị liên tục).
- Khi đầu ra là chuỗi ký tự, việc chuyển sang vector số và tính MSE sẽ mất đi ngữ nghĩa và không cung cấp thông tin về chất lượng nội dung tóm tắt.
📚 Tham khảo (tính đến năm 2026)
- Lin, C.-Y. (2004). “ROUGE: A Package for Automatic Evaluation of Summaries.” – Bài báo gốc giới thiệu ROUGE.
- Bajaj, S. et al. (2023). “SummEval: Reassessing Summarization Evaluation.” – Khảo sát các metric hiện đại, khẳng định ROUGE vẫn là tiêu chuẩn cơ bản.
- AWS Documentation – Amazon SageMaker Processing Jobs (2026). Hướng dẫn tích hợp thư viện
rouge_scoretrong pipeline đánh giá. - Hugging Face Datasets – “rouge” metric (cập nhật 2026). Cung cấp API chuẩn để tính ROUGE trên môi trường AWS.
🛠️ Kết luận nhanh
- ROUGE ✅ là metric duy nhất trong danh sách đáp ứng yêu cầu đánh giá chất lượng tóm tắt do các LLM sinh ra.
- Các metric còn lại (Recall, AUC, MSE) ❌ không được thiết kế cho nhiệm vụ này và sẽ cho kết quả không phản ánh đúng chất lượng nội dung.
💡 Nếu muốn nâng cao hơn, công ty có thể bổ sung BERTScore hoặc GPT‑Eval (đánh giá dựa trên mô hình LLM) để bổ trợ cho ROUGE, nhưng ROUGE vẫn là lựa chọn chuẩn và được chấp nhận rộng rãi.
Which solution will meet these requirements?
- A Use automatic evaluation on Amazon Personalize.
- B Use content moderation on Amazon Rekognition.
- C Use model evaluation on Amazon Bedrock.
- D Use sentiment analysis on Amazon Comprehend.
Xem giải thích
📖 Giải thích nội dung câu hỏi
- Nhóm nghiên cứu muốn so sánh nhiều mô hình generative AI (ví dụ: LLMs, diffusion models…) để tạo ra các bài báo khoa học.
- Họ đã chuẩn bị prompt cố định và cần phương pháp đánh giá kết quả đầu ra của các mô hình.
- Việc đánh giá sẽ được thực hiện bởi đội ngũ nhà khoa học (human‑in‑the‑loop), vì chất lượng của một bài báo cần xem xét về mặt độ chính xác, tính logic, độ sáng tạo, và tuân thủ chuẩn mực khoa học – những tiêu chí mà hiện tại các công cụ tự động chưa thể đo lường hoàn hảo.
Do vậy, câu hỏi đang hỏi: “Giải pháp nào đáp ứng được yêu cầu: (1) đánh giá đầu ra của mô hình generative AI; (2) cho phép một nhóm con người thực hiện đánh giá?”
✅ Đáp án đúng: Use model evaluation on Amazon Bedrock
- Amazon Bedrock (được mở rộng và cập nhật đến 2026) cung cấp Model Evaluation – một tính năng cho phép bạn tạo pipeline đánh giá kết quả của các mô hình foundation (LLM, diffusion, etc.) và kết hợp Human Review thông qua Amazon SageMaker Ground Truth, Amazon A2I (Augmented AI) hoặc các workflow tùy chỉnh.
- Bạn có thể định nghĩa metric (ví dụ: ROUGE, BLEU, factuality, citation correctness) và gửi đầu ra cho nhóm nhà khoa học để chấm điểm, sau đó thu thập phản hồi để tính toán điểm tổng hợp.
- Giải pháp này đáp ứng cả hai yêu cầu: cung cấp môi trường chạy và so sánh các mô hình AI, đồng thời tích hợp human evaluation một cách chuẩn AWS.
❌ Giải thích các phương án sai
-
Use automatic evaluation on Amazon Personalize
- Amazon Personalize là dịch vụ đề xuất cá nhân hoá (recommendation) cho các kịch bản như e‑commerce, streaming, nội dung. Nó không hỗ trợ đánh giá mô hình ngôn ngữ hay tạo nội dung và không cung cấp công cụ cho Human Review.
- Do vậy, không phù hợp để đánh giá đầu ra của các mô hình generative AI.
-
Use content moderation on Amazon Rekognition
- Amazon Rekognition chuyên phân tích hình ảnh/ video (đối tượng, khuôn mặt, nội dung không phù hợp). Nó không liên quan tới văn bản hay đánh giá mô hình ngôn ngữ.
- Việc “content moderation” chỉ giúp lọc nội dung không phù hợp, không đáp ứng yêu cầu kiểm tra chất lượng và độ khoa học của bài báo.
-
Use sentiment analysis on Amazon Comprehend
- Amazon Comprehend cung cấp phân tích cảm xúc, thực thể, key phrases, v.v. Mặc dù là dịch vụ xử lý ngôn ngữ tự nhiên, sentiment analysis chỉ cho biết cảm xúc (positive/negative) của văn bản, không đo lường độ chính xác, tính logic, hay tính học thuật của một bài báo nghiên cứu.
- Ngoài ra, không có cơ chế tích hợp human evaluation cho các nhà khoa học.
🧩 Tổng hợp các điểm mạnh của Amazon Bedrock Model Evaluation
- Đa mô hình: hỗ trợ các LLM của Amazon (Titan, Claude), Mistral, Cohere, Stability AI, v.v.
- Pipeline tùy chỉnh: bạn có thể định nghĩa các metric, tạo batch jobs, và thu thập kết quả trong Amazon S3 hoặc DynamoDB.
- Human‑in‑the‑loop: tích hợp sẵn Amazon A2I để cho phép các nhà khoa học đánh giá mỗi đầu ra và gửi lại nhãn.
- Quy mô tự động: chạy đánh giá trên thousands of prompts đồng thời, tận dụng serverless tính năng của Bedrock.
- Bảo mật & tuân thủ: dữ liệu được mã hoá, IAM fine‑grained, hỗ trợ PCI‑DSS, HIPAA, FedRAMP (đến 2026).
📚 Tham khảo tài liệu
- Amazon Bedrock Developer Guide – Model Evaluation (v2026.03).
- AWS Blog – Human‑in‑the‑loop AI evaluation with Bedrock and A2I (Nov 2025).
- AWS Well‑Architected Framework – Machine Learning Lens (cập nhật 2026).
🔚 Kết luận
Với yêu cầu “đánh giá đầu ra của các mô hình generative AI bằng một đội ngũ nhà khoa học”, Amazon Bedrock – Model Evaluation là giải pháp duy nhất đáp ứng đầy đủ cả khía cạnh công nghệ (đánh giá mô hình) và con người (human review), trong khi các dịch vụ khác (Personalize, Rekognition, Comprehend) không phù hợp.
- A Computer vision
- B Robotics
- C Natural language processing (NLP)
- D Time series forecasting
Xem giải thích
🔍 Phân tích câu hỏi
Câu hỏi: “Sentiment analysis is a subset of which broader field of AI?”
- “Sentiment analysis” (phân tích cảm xúc) là kỹ thuật dùng để xác định thái độ (tích cực, tiêu cực, trung tính) của một đoạn văn bản, tweet, review,…
- Để thực hiện việc này, chúng ta cần xử lý và hiểu ngôn ngữ tự nhiên (các từ, câu, ngữ cảnh). Do đó, sentiment analysis thuộc về Natural Language Processing (NLP) – một nhánh lớn của trí tuệ nhân tạo chuyên về việc cho máy tính “đọc” và “hiểu” ngôn ngữ con người.
✅ Đáp án đúng
Natural language processing (NLP)
✅ Lý do: Sentiment analysis dựa trên việc phân tích văn bản (hoặc lời nói) để nhận diện cảm xúc, vì vậy nó là một phần của NLP – lĩnh vực tập trung vào việc phân tích, hiểu và sinh ra ngôn ngữ tự nhiên.
❌ Giải thích các phương án còn lại
-
Computer vision
- 📌 Giải thích: Computer vision (thị giác máy tính) tập trung vào việc “nhìn” và phân tích dữ liệu hình ảnh/video (nhận dạng khuôn mặt, object detection, …). Sentiment analysis không liên quan tới hình ảnh mà là văn bản, vì vậy đây không phải là lĩnh vực cha.
- ✅ Kết luận: Sai.
-
Robotics
- 📌 Giải thích: Robotics (công nghệ robot) bao gồm phần cứng, điều khiển chuyển động, lập kế hoạch hành động và thường dùng AI để robot tương tác với môi trường. Sentiment analysis không liên quan tới điều khiển robot hay cảm biến vật lý.
- ✅ Kết luận: Sai.
-
Time series forecasting
- 📌 Giải thích: Time series forecasting (dự báo chuỗi thời gian) là kỹ thuật dự đoán giá trị tương lai dựa trên dữ liệu theo thời gian (ví dụ: dự báo doanh thu, giá cổ phiếu). Mặc dù có thể áp dụng các mô hình học sâu, nó không liên quan tới việc xử lý ngôn ngữ tự nhiên để nhận diện cảm xúc.
- ✅ Kết luận: Sai.
📚 Tham khảo (đến năm 2026)
- AWS Documentation – Amazon Comprehend – dịch vụ NLP của AWS hỗ trợ sentiment analysis, entity recognition, keyphrase extraction, … (https://docs.aws.amazon.com/comprehend/latest/dg/what-is.html)
- “Natural Language Processing (NLP) Overview” – AWS Machine Learning Blog, 2025 – mô tả vai trò của NLP trong các dịch vụ AI của AWS.
- “Deep Learning for Natural Language Processing” – AWS re:Invent 2024 Session – trình bày cách các mô hình transformer (BERT, GPT) được dùng cho sentiment analysis.
🧩 Tổng kết
- Câu hỏi yêu cầu xác định lĩnh vực AI rộng hơn mà sentiment analysis thuộc về.
- Đáp án đúng là Natural language processing (NLP) vì sentiment analysis xử lý và hiểu ngôn ngữ tự nhiên.
- Các lựa chọn còn lại (Computer vision, Robotics, Time series forecasting) đều không liên quan tới việc phân tích cảm xúc trong văn bản, nên là sai.
- A Use Amazon CloudFront to restrict access to the company’s private content.
- B Use AWS Glue to set up data encryption across the company’s data catalog.
- C Use AWS Lake Formation to manage centralized data governance and cross-account data sharing.
- D Use AWS PrivateLink to configure a private connection between the company’s VPC and Amazon Bedrock.
Xem giải thích
🔎 Phân tích câu hỏi
Công ty muốn truy cập riêng tư (private access) tới các API của Amazon Bedrock từ tài khoản AWS của mình, đồng thời ngăn dữ liệu bị phơi bày ra Internet.
Yêu cầu thực chất là:
- Kết nối mạng phải được thiết lập trong VPC của công ty, không đi qua internet public.
- Giao tiếp với dịch vụ Bedrock phải được được bảo mật, chỉ cho phép từ VPC (hoặc các tài khoản được ủy quyền).
Do đó câu trả lời phải là một giải pháp network‑level isolation (điểm cuối VPC riêng) chứ không phải các giải pháp ở lớp dữ liệu hoặc CDN.
✅ Đáp án đúng
✔️ Use AWS PrivateLink to configure a private connection between the company’s VPC and Amazon Bedrock.
Tại sao?
- AWS PrivateLink tạo ra VPC endpoint interface cho một dịch vụ AWS (ở đây là Amazon Bedrock).
- Lưu lượng không đi ra Internet; nó được truyền qua Amazon’s private network.
- Bạn có thể kiểm soát truy cập bằng Security Groups và IAM policy; chỉ các tài nguyên trong VPC mới có thể gọi Bedrock API.
- Từ 2024, Amazon Bedrock hỗ trợ PrivateLink (được cập nhật liên tục đến 2026), cho phép các khách hàng thiết lập private connectivity mà không cần NAT, Internet Gateway hoặc VPN.
Do vậy, PrivateLink đáp ứng đầy đủ cả “private access” và “protect data from internet exposure”.
❌ Giải thích các phương án sai
-
Use Amazon CloudFront to restrict access to the company’s private content.
- CloudFront là dịch vụ CDN, chủ yếu dùng để phân phối nội dung công cộng hoặc bảo mật bằng signed URLs/cookies.
- Nó không tạo kết nối riêng tư tới API nội bộ; lưu lượng vẫn phải đi qua Internet (được đưa về các edge location) và không thể ngăn hoàn toàn việc truy cập từ Internet.
- Vì vậy không phù hợp để “private access” tới Amazon Bedrock.
-
Use AWS Glue to set up data encryption across the company’s data catalog.
- AWS Glue là dịch vụ ETL và Data Catalog. Việc encrypt catalog chỉ bảo vệ siêu dữ liệu, không ảnh hưởng tới cách mà các API Bedrock được gọi.
- Không cung cấp mạng riêng hay ngăn chặn truy cập Internet tới Bedrock.
-
Use AWS Lake Formation to manage centralized data governance and cross‑account data sharing.
- Lake Formation tập trung vào quản trị dữ liệu, phân quyền truy cập, và chia sẻ dữ liệu giữa các tài khoản hoặc miền dữ liệu.
- Nó không cung cấp cơ chế mạng riêng để kết nối tới Bedrock và không ngăn chặn lưu lượng Internet.
- Do đó không đáp ứng yêu cầu “private access”.
🛠️ Các bước triển khai AWS PrivateLink cho Amazon Bedrock (2026)
- Mở Service Endpoint: Trong VPC của công ty, tạo Interface VPC Endpoint cho dịch vụ
com.amazonaws.<region>.bedrock. - Chọn Subnets & Security Groups: Gắn endpoint vào các subnet cần thiết, thiết lập Security Group chỉ cho phép traffic đến/đến các IP nội bộ của công ty.
- Cập nhật DNS (tùy chọn): Endpoint tạo một CNAME trong Route 53 (hoặc sử dụng Private DNS) để các ứng dụng gọi
bedrock.<region>.amazonaws.comsẽ được tự động chuyển tới endpoint riêng. - IAM Policy: Gán IAM policy cho role/role policy cho phép gọi
bedrock:*chỉ khi request xuất phát từ VPC endpoint. - Kiểm tra: Dùng AWS CLI hoặc SDK để gọi Bedrock API; nếu cấu hình đúng, bạn sẽ nhận được response và bản ghi CloudWatch Logs sẽ cho thấy traffic đi qua Interface Endpoint (địa chỉ IP private).
📚 Tham khảo
- Amazon Bedrock – PrivateLink integration (AWS Documentation, cập nhật 2025‑2026): https://docs.aws.amazon.com/bedrock/latest/userguide/bedrock-private-link.html
- AWS PrivateLink – How it works (AWS Docs, 2026): https://docs.aws.amazon.com/vpc/latest/privatelink/
- Best practices for securing VPC endpoints (AWS Security Blog, 2025): https://aws.amazon.com/blogs/security/best-practices-for-vpc-endpoints/
🧩 Tổng kết:
Để “private access” tới Amazon Bedrock và bảo vệ dữ liệu khỏi Internet, AWS PrivateLink là giải pháp duy nhất đáp ứng yêu cầu mạng riêng và kiểm soát truy cập. Các lựa chọn khác (CloudFront, Glue, Lake Formation) đều không cung cấp kết nối VPC‑độc lập và do đó không phù hợp. 🚀