Ngân hàng đề — AWS Certified AI Practitioner
Tìm thấy 623 câu.
- A Use a large language model (LLM) to perform natural language processing (NLP) for sentiment analysis.
- B Use a regression algorithm to classify the feedback based on predefined categories. Then, analyze user sentiment.
- C Use a recommendation engine algorithm to detect user sentiment.
- D Use a time series algorithm to predict user sentiment based on past feedback.
Xem giải thích
🔎 Phân tích câu hỏi
Công ty nhận được một lượng lớn phản hồi người dùng không có cấu trúc, dưới dạng văn bản (text). Nhiệm vụ là phân tích cảm xúc (sentiment) của các phản hồi này – tức là xác định xem mỗi đoạn văn bản mang tính “tích cực”, “trung tính” hay “tiêu cực”.
Để thực hiện việc này, chúng ta cần một giải pháp xử lý ngôn ngữ tự nhiên (NLP) có khả năng hiểu ngữ nghĩa, ngữ cảnh và các biểu hiện cảm xúc trong tiếng tự do. Các dịch vụ và mô hình hiện đại của AWS (đến năm 2026) như Amazon Bedrock, Amazon SageMaker JumpStart (LLM), hay Amazon Comprehend đều cung cấp khả năng sentiment analysis dựa trên các large language model (LLM) hoặc mô hình NLP đã được huấn luyện sẵn.
✅ Đáp án đúng
- Use a large language model (LLM) to perform natural language processing (NLP) for sentiment analysis.
Giải thích:
- LLM (ví dụ: Claude, Titan, GPT‑4) có khả năng hiểu ngôn ngữ tự nhiên và phân loại cảm xúc một cách chính xác ngay cả với dữ liệu không có cấu trúc.
- Trên AWS, bạn có thể triển khai LLM qua Amazon Bedrock (được quản lý, không cần quản lý hạ tầng) hoặc SageMaker JumpStart để nhanh chóng tạo endpoint cho sentiment analysis.
- Ngoài ra, Amazon Comprehend (dịch vụ NLP được quản lý) cung cấp API
DetectSentiment– thực chất là một mô hình NLP được huấn luyện sẵn, cũng dựa trên kiến trúc LLM hiện đại.
🛠️ Ví dụ triển khai:
- Đưa dữ liệu văn bản vào Amazon S3.
- Dùng AWS Glue hoặc Amazon Athena để trích xuất dữ liệu.
- Tạo SageMaker endpoint với mô hình LLM (hoặc sử dụng Bedrock InvokeModel).
- Gửi mỗi đoạn phản hồi tới endpoint → nhận kết quả sentiment (
POSITIVE,NEGATIVE,NEUTRAL). - Lưu kết quả vào Amazon Redshift / QuickSight để phân tích và visualize.
Nguồn tham khảo:
- AWS Documentation – Amazon Bedrock (2026): https://docs.aws.amazon.com/bedrock/latest/userguide/what-is-bedrock.html
- AWS Documentation – Amazon Comprehend DetectSentiment: https://docs.aws.amazon.com/comprehend/latest/dg/how-sentiment.html
- AWS Documentation – SageMaker JumpStart (LLM): https://docs.aws.amazon.com/sagemaker/latest/dg/jumpstart.html
❌ Các phương án sai và lý do
-
Use a regression algorithm to classify the feedback based on predefined categories. Then, analyze user sentiment.
- 📉 Regression (hồi quy) thường dùng để dự đoán một giá trị liên tục (ví dụ: giá bán, thời gian). Đối với phân loại cảm xúc, chúng ta cần một mô hình classification (phân loại), không phải hồi quy.
- Thêm vào đó, việc “phân loại dựa trên các danh mục định sẵn” không giải quyết được các nuance trong ngôn ngữ tự do; sentiment analysis yêu cầu hiểu ngữ cảnh sâu hơn, điều mà một thuật toán hồi quy đơn giản không thể làm.
-
Use a recommendation engine algorithm to detect user sentiment.
- 🎯 Recommendation engine (hệ thống gợi ý) được thiết kế để đưa ra đề xuất dựa trên hành vi hoặc sở thích (ví dụ: Amazon Personalize). Nó không được huấn luyện để nhận diện cảm xúc trong văn bản.
- Việc áp dụng thuật toán gợi ý vào sentiment analysis sẽ dẫn tới kết quả vô nghĩa vì mô hình không có đầu vào/đầu ra liên quan đến cảm xúc.
-
Use a time series algorithm to predict user sentiment based on past feedback.
- ⏳ Time‑series (chuỗi thời gian) thích hợp cho dữ liệu có đánh dấu thời gian và muốn dự đoán giá trị số (ví dụ: doanh thu, tải CPU).
- Sentiment là đặc tính ngôn ngữ, không phải một giá trị số theo thời gian. Dù bạn có thể tạo mô hình dự báo xu hướng sentiment tổng thể, đầu vào chính vẫn phải là phân tích cảm xúc – không thể bỏ qua bước NLP. Do đó, một thuật toán chuỗi thời gian không đáp ứng yêu cầu “phân tích sentiment” trực tiếp.
🧩 Tổng kết
- ✅ LLM + NLP (hoặc dịch vụ NLP quản lý như Amazon Comprehend) là cách tiếp cận chuẩn, hiện đại và được AWS hỗ trợ mạnh mẽ.
- ❌ Các thuật toán hồi quy, gợi ý, và chuỗi thời gian không phù hợp vì chúng không được thiết kế để hiểu và phân loại cảm xúc trong văn bản phi cấu trúc.
Hy vọng phân tích trên giúp bạn nắm rõ lý do lựa chọn giải pháp LLM cho bài toán sentiment analysis và tránh những sai lầm phổ biến khi áp dụng các thuật toán không liên quan. 🚀
The company must consider the output types of each FM.
Which FM characteristic is the company evaluating?
- A Latency
- B Model size
- C Model customization
- D Modality
Xem giải thích
🔍 Giải thích nội dung câu hỏi
Công ty muốn xây dựng một giải pháp AI tạo hình ảnh và mô tả văn bản cho danh mục sản phẩm. Khi lựa chọn foundation model (FM) trong AWS (ví dụ: Amazon Bedrock), họ phải xét đến kiểu đầu ra mà mô hình có thể sinh ra – tức là mô hình có thể tạo ra image, text, audio, … Điều này liên quan tới đặc tính “Modality” của mô hình, tức là khả năng xử lý và sinh ra các dạng dữ liệu (modalities) nào.
✅ Đáp án đúng: Modality
- Lý do: “Modality” mô tả loại dữ liệu mà mô hình đầu vào và đầu ra hỗ trợ (text‑only, image‑only, multi‑modal…). Vì công ty cần cả image và text, họ đang đánh giá modality của các FM để chắc chắn mô hình có thể tạo ra cả hai dạng đầu ra.
🧩 Phân tích các phương án
1️⃣ Latency
- Giải thích: Latency đề cập tới thời gian phản hồi của mô hình (thời gian từ khi gửi yêu cầu tới khi nhận được kết quả). Mặc dù latency quan trọng với các ứng dụng thời gian thực, nó không liên quan đến việc mô hình tạo ra loại dữ liệu nào (image hay text). Vì vậy, đây không phải là tiêu chí mà câu hỏi đang hỏi.
2️⃣ Model size
- Giải thích: Model size (số tham số, dung lượng lưu trữ) ảnh hưởng tới chi phí, khả năng mở rộng và tốc độ suy luận, nhưng không quyết định loại đầu ra mà mô hình có thể sinh ra. Một mô hình lớn có thể vẫn chỉ hỗ trợ một modality duy nhất (ví dụ: chỉ text). Do đó, đây không phải là tiêu chí cần xem xét trong trường hợp này.
3️⃣ Model customization
- Giải thích: Model customization là khả năng tinh chỉnh mô hình (fine‑tuning, LoRA, …) để đáp ứng nhu cầu đặc thù của doanh nghiệp. Khi công ty cần tạo hình ảnh và mô tả, việc tùy chỉnh có thể hữu ích, nhưng không phải là yếu tố để xác định loại dữ liệu mô hình có thể sản xuất. Vì vậy, đây không phải đáp án đúng.
4️⃣ Modality
- Giải thích: Modality chỉ ra kiểu dữ liệu mà mô hình có thể nhận vào và/hoặc xuất ra (text, image, video, audio, multi‑modal). Khi doanh nghiệp muốn một FM sinh ra cả hình ảnh và mô tả văn bản, họ cần kiểm tra modality của từng mô hình để chọn mô hình multi‑modal (ví dụ: Stable Diffusion cho image + Claude/ChatGPT cho text, hoặc mô hình đa mô hình như Gemini 1.5 Pro). Do đó, đây là tiêu chí đúng.
📚 Tham khảo tài liệu (cập nhật đến 2026)
- AWS Documentation – Amazon Bedrock Foundations Models
https://docs.aws.amazon.com/bedrock/latest/userguide/model-ids.html (được cập nhật thường xuyên, bao gồm bảng “Modality” cho mỗi model). - AWS Whitepaper – Generative AI on AWS (2025‑2026 edition)
https://d1.awsstatic.com/whitepapers/generative-ai-on-aws.pdf - Amazon SageMaker JumpStart – Foundation Model Overview
https://aws.amazon.com/sagemaker/jumpstart/
🛠️ Kết luận:
Công ty đang đánh giá Modality của các foundation model để chắc chắn rằng mô hình có thể tạo ra cả hình ảnh và mô tả văn bản cho danh mục sản phẩm. Các tiêu chí khác như latency, model size, hay model customization đều không phản ánh yêu cầu về loại đầu ra. ✅
Which model evaluation strategy will meet these requirements?
- A Open-ended generation
- B Text summarization
- C Machine translation
- D Classification
Xem giải thích
🔎 Phân tích câu hỏi
Công ty muốn sử dụng một mô hình Machine Learning (ML) để phân tích các đánh giá của khách hàng trên mạng xã hội.
Mục tiêu: xác định cảm xúc (sentiment) của mỗi đánh giá và gán nhãn là neutral, positive, hoặc negative.
➡️ Đây là một bài toán gán nhãn (label) cho từng mẫu dữ liệu dựa trên nội dung văn bản → bài toán phân loại (classification), cụ thể là classification đa lớp (multi‑class classification) với 3 lớp.
Vì vậy, chiến lược đánh giá mô hình phải đo lường khả năng dự đoán đúng nhãn của mô hình (accuracy, precision, recall, F1‑score, confusion matrix, …). Các chiến lược như “open‑ended generation”, “text summarization” hay “machine translation” không liên quan tới việc đưa ra nhãn cảm xúc.
✅ Đáp án đúng: Classification
Lý do:
- Classification là kỹ thuật ML dùng để dự đoán một trong một tập hợp các lớp rời rạc.
- Trong AWS, có nhiều dịch vụ và thuật toán hỗ trợ text classification, ví dụ: Amazon SageMaker JumpStart “BlazingText” hoặc “Linear Learner”, Amazon Comprehend Custom Classification, và các mô hình Transformers (BERT, RoBERTa…) được triển khai trên SageMaker Inference.
- Đánh giá mô hình phân loại thường dùng các chỉ số: accuracy, precision, recall, F1‑score, ROC‑AUC (cho binary) hoặc macro‑averaged metrics (cho multi‑class), cùng với confusion matrix để kiểm tra lỗi giữa các lớp (neutral vs. positive vs. negative).
🧩 Phân tích các phương án (giữ nguyên nội dung tiếng Anh)
1. Open‑ended generation
- ❌ Sai
- Đây là dạng mô hình tạo văn bản tự do (ví dụ: GPT‑4, Claude) mà đầu ra không bị ràng buộc bởi một tập nhãn cố định.
- Đối với yêu cầu “neutral / positive / negative”, mô hình cần đưa ra nhãn cụ thể, không phải tạo ra đoạn văn bản tự do.
- Đánh giá thường dùng BLEU, ROUGE, METEOR, không phù hợp cho bài toán sentiment classification.
2. Text summarization
- ❌ Sai
- Text summarization (tóm tắt văn bản) mục tiêu là rút gọn nội dung thành một đoạn ngắn hơn, giữ nguyên ý chính.
- Nó không cung cấp thông tin về cảm xúc của văn bản gốc, và các chỉ số đánh giá (ROUGE, ROUGE‑L) không phản ánh độ chính xác của nhãn cảm xúc.
- Vì vậy không đáp ứng yêu cầu “determine if each review has a neutral, positive, or negative sentiment”.
3. Machine translation
- ❌ Sai
- Machine translation (dịch máy) chuyển ngữ từ ngôn ngữ này sang ngôn ngữ khác (ví dụ: English → Vietnamese).
- Không liên quan tới việc phân loại cảm xúc và không tạo ra nhãn.
- Các metric như BLEU, TER chỉ đo độ chính xác của bản dịch, không phù hợp với bài toán sentiment analysis.
4. Classification
- ✅ Đúng
- Như đã giải thích, đây là chiến lược đánh giá mô hình dựa trên khả năng gán nhãn chính xác cho các lớp cảm xúc.
- AWS cung cấp công cụ Amazon Comprehend Custom Classification cho sentiment analysis, hoặc SageMaker Autopilot/JumpStart để tự động xây dựng và đánh giá mô hình phân loại đa lớp.
- Các metric (accuracy, macro‑F1, confusion matrix) cho phép đo lường mức độ đáp ứng yêu cầu “neutral, positive, negative”.
🛠️ Gợi ý triển khai trên AWS (2026)
-
Amazon Comprehend Custom Classification
- Tạo dataset với các review đã được gán nhãn (neutral/positive/negative).
- Đào tạo mô hình và nhận các metric như Precision, Recall, F1‑score cho mỗi lớp.
-
Amazon SageMaker JumpStart
- Sử dụng mô hình BlazingText (fastText) hoặc BERT‑based để thực hiện text classification.
- Kích hoạt Hyperparameter tuning và model evaluation để thu thập các metric multi‑class.
-
SageMaker Pipelines + Model Registry
- Xây dựng pipeline tự động: thu thập dữ liệu → preprocessing → training → evaluation (classification metrics) → deployment.
-
CloudWatch Metrics & SageMaker Model Monitor
- Giám sát drift của nhãn cảm xúc sau khi đưa model vào production, đảm bảo độ chính xác không giảm theo thời gian.
📚 Tham khảo
- AWS Documentation – Amazon Comprehend Custom Classification (phiên bản 2026): https://docs.aws.amazon.com/comprehend/latest/dg/custom-classification.html
- AWS Documentation – SageMaker JumpStart Built‑in Algorithms (BlazingText, Text Classification): https://docs.aws.amazon.com/sagemaker/latest/dg/jumpstart-algorithms.html
- AWS Whitepaper – Best Practices for Machine Learning on AWS (2025 Update), chương “Text Classification & Sentiment Analysis”.
Tóm lại: Đối với yêu cầu xác định cảm xúc “neutral, positive, negative” từ các review, chiến lược đánh giá phù hợp nhất là Classification. Các lựa chọn còn lại (Open‑ended generation, Text summarization, Machine translation) không đáp ứng yêu cầu gán nhãn và do đó không phải là câu trả lời đúng. 🚀
- A Clustering data points into groups based on their similarity
- B Training a model to recognize images of animals
- C Predicting the price of a house based on the house’s features
- D Generating human-like text based on a given prompt
Xem giải thích
🔎 Phân tích câu hỏi
Which option is an example of unsupervised learning?
Câu hỏi yêu cầu bạn nhận biết phương pháp học máy (machine‑learning) nào thuộc loại “unsupervised learning” – tức là mô hình được huấn luyện không có nhãn (label) đầu vào. Trong unsupervised learning, thuật toán tự khám phá cấu trúc, mẫu, hoặc quan hệ ẩn trong dữ liệu, ví dụ như clustering, dimensionality reduction, hay anomaly detection. Ngược lại, supervised learning cần dữ liệu đã được gán nhãn (ví dụ: ảnh có nhãn “cat”, “dog” hoặc giá nhà kèm theo giá thực tế) để mô hình học cách dự đoán nhãn.
✅ Đáp án đúng
- Clustering data points into groups based on their similarity
Giải thích:
- Thuật toán clustering (ví dụ: K‑Means, DBSCAN, hierarchical clustering) không yêu cầu nhãn cho các điểm dữ liệu.
- Nó chỉ dựa trên độ tương đồng (distance, similarity) để tự động phân nhóm các đối tượng sao cho các đối tượng trong cùng một nhóm gần nhau hơn so với các đối tượng ở nhóm khác.
- Đây là một ví dụ tiêu biểu của unsupervised learning.
❌ Giải thích các phương án sai
-
Training a model to recognize images of animals
- Đây là supervised learning. Để “recognize” (nhận dạng) ảnh động vật, mô hình cần một tập dữ liệu có nhãn (ví dụ: ảnh “cat”, “dog”, “elephant”…). Nhãn cung cấp câu trả lời đúng mà mô hình học để dự đoán.
- Do có nhãn, nên không phải là unsupervised learning.
-
Predicting the price of a house based on the house’s features
- Đây là regression, một dạng supervised learning. Đầu vào là các đặc trưng (diện tích, số phòng, vị trí…) và đầu ra là giá nhà – một giá trị đã biết trong dữ liệu huấn luyện.
- Vì mô hình học từ cặp (đặc trưng, giá trị mục tiêu) đã được gán nhãn, nên không thuộc unsupervised learning.
-
Generating human‑like text based on a given prompt
- Phương pháp này thường dùng large language models (LLMs) như GPT‑4, được huấn luyện bằng cách dự đoán token tiếp theo trên một khối lượng lớn văn bản. Quá trình huấn luyện ban đầu là self‑supervised (các token được tạo ra thành “nhãn” tạm thời), nhưng trong bối cảnh câu hỏi, việc “generate text from a prompt” được coi là inference của một mô hình đã được huấn luyện có mục tiêu rõ ràng (tạo ra văn bản hợp lý).
- Do không phải là một thuật toán không có nhãn như clustering, nên không được xem là unsupervised learning.
📚 Tham khảo (cập nhật đến 2026)
- AWS Machine Learning Blog – “Unsupervised Learning on AWS”, 2025.
https://aws.amazon.com/blogs/machine-learning/unsupervised-learning-on-aws/ - Amazon SageMaker Documentation – “Built‑in Algorithms – Unsupervised Learning”, phiên bản 2026.
https://docs.aws.amazon.com/sagemaker/latest/dg/algos-unsupervised.html - Goodfellow, I., Bengio, Y., Courville, A. – “Deep Learning”, 2nd ed., 2023, Ch. 5 (Unsupervised Learning).
🧩 Tổng kết
- ✅ Đáp án đúng: Clustering data points into groups based on their similarity – là ví dụ điển hình của unsupervised learning vì không cần nhãn và dựa vào sự tương đồng để tự động phân nhóm.
- ❌ Các phương án còn lại đều liên quan tới supervised learning (nhận dạng ảnh, hồi quy giá nhà) hoặc inference từ mô hình đã huấn luyện (tạo văn bản), vì vậy không phải là unsupervised learning.
Hy vọng phần giải thích chi tiết này giúp bạn nắm vững khái niệm và dễ dàng lựa chọn đáp án đúng trong các đề thi AWS Certified DevOps Engineer Professional hoặc các kỳ thi liên quan tới Machine Learning! 🚀🛠️
Which AWS service meets these requirements?
- A Amazon Comprehend
- B Amazon Textract
- C Amazon Kendra
- D Amazon Personalize
Xem giải thích
📖 Phân tích câu hỏi
Công ty học trực tuyến có lượng lớn tài liệu giáo dục và muốn triển khai “enterprise search”.
- “Enterprise search” ở đây nghĩa là một công cụ tìm kiếm nội bộ, cho phép người dùng nhập từ khóa và nhận được kết quả chính xác, liên quan, dựa trên nội dung tài liệu (văn bản, PDF, slide, video metadata …) được lưu trữ trong các hệ thống của doanh nghiệp.
- Yêu cầu: khả năng index số lượng lớn tài liệu, hỗ trợ ngôn ngữ tự nhiên, cho phép tích hợp nhanh với các nguồn dữ liệu phổ biến (Amazon S3, SharePoint, RDS, DynamoDB …) và cung cấp kết quả xếp hạng dựa trên Machine Learning.
Với bối cảnh này, AWS cung cấp Amazon Kendra – dịch vụ tìm kiếm doanh nghiệp được xây dựng trên ML và được tối ưu cho các trường hợp sử dụng như “search over large corpus of documents”.
✅ Đáp án đúng: Amazon Kendra
Lý do lựa chọn:
- Dịch vụ chuyên biệt cho enterprise search – Kendra cung cấp API và console để tạo “index”, cấu hình “data source connectors”, và cho phép người dùng thực hiện các truy vấn bằng tiếng tự nhiên.
- Khả năng mở rộng – Tự động mở rộng quy mô để xử lý hàng triệu tài liệu, phù hợp với “large volumes” của công ty.
- Tích hợp sẵn – Kendra hỗ trợ các connector chuẩn (S3, SharePoint, OneDrive, Salesforce, RDS, DynamoDB, etc.) và có khả năng “incremental sync” để cập nhật tài liệu mới mà không cần tái lập chỉ mục toàn bộ.
- Công nghệ ML hiện đại – Sử dụng retrieval‑augmented generation (RAG), BM25, semantic ranking, và relevance tuning giúp trả về kết quả chính xác ngay cả khi người dùng nhập câu hỏi dạng tự nhiên.
- Cập nhật 2025‑2026 – Kendra đã bổ sung tính năng Hybrid Search (kết hợp tìm kiếm dựa trên keyword và embedding), Query Suggestion, và fine‑grained access control (IAM + SAML) để đáp ứng các yêu cầu bảo mật doanh nghiệp.
❌ Giải thích các phương án sai
-
Amazon Comprehend
- Mô tả: Dịch vụ NLP (Natural Language Processing) để phân tích văn bản – nhận diện thực thể, cảm xúc, key phrases, và tạo custom classification.
- Tại sao không phù hợp: Comprehend chỉ cung cấp phân tích nội dung, không phải công cụ tìm kiếm. Nó không có khả năng tạo index, kết nối tới nguồn dữ liệu, hoặc trả về danh sách tài liệu dựa trên truy vấn. Đối với “enterprise search”, chúng ta cần một hệ thống index‑query chứ không chỉ là phân tích ngôn ngữ.
-
Amazon Textract
- Mô tả: Dịch vụ OCR/Document Text Extraction, chuyển đổi ảnh, PDF, và tài liệu scan thành text và dữ liệu cấu trúc.
- Tại sao không phù hợp: Textract là công cụ trích xuất dữ liệu từ tài liệu, không phải công cụ tìm kiếm. Nó thường được dùng trước khi đưa dữ liệu vào một hệ thống tìm kiếm (ví dụ Kendra) để chuyển đổi tài liệu hình ảnh thành văn bản. Nhưng Textract không có chức năng index hay trả về kết quả tìm kiếm.
-
Amazon Personalize
- Mô tả: Dịch vụ tạo hệ thống recommendation dựa trên ML, tương tự như Netflix/Spotify.
- Tại sao không phù hợp: Personalize tập trung vào gợi ý cá nhân hoá (sản phẩm, video, nội dung) dựa trên hành vi người dùng, không phải tìm kiếm tài liệu dựa trên từ khóa hoặc câu hỏi. Nó không cung cấp index tài liệu, không hỗ trợ các connector tới nguồn dữ liệu doanh nghiệp.
🧩 Tổng hợp lại
- Câu hỏi yêu cầu một dịch vụ enterprise search cho khối lượng lớn tài liệu.
- Amazon Kendra là dịch vụ duy nhất trong danh sách đáp ứng đầy đủ các tiêu chí: tạo index, hỗ trợ đa nguồn dữ liệu, khả năng tìm kiếm ngôn ngữ tự nhiên, và mở rộng quy mô.
- Các dịch vụ còn lại (Comprehend, Textract, Personalize) đều là công cụ chuyên môn (NLP, OCR, recommendation) chứ không phải hệ thống tìm kiếm doanh nghiệp.
📚 Tham khảo tài liệu (2026)
- Amazon Kendra – Documentation (AWS, phiên bản 2026.03) – https://docs.aws.amazon.com/kendra/latest/dg/what-is-kendra.html
- AWS Blog – “Introducing Hybrid Search in Amazon Kendra” (Nov 2025) – https://aws.amazon.com/blogs/aws/introducing-hybrid-search-amazon-kendra/
- AWS Re:Invent 2025 – Session “Deep Dive into Amazon Kendra for Enterprise Search” – video và slide tại https://www.awsreinvent.com/
- Amazon Comprehend – Documentation – https://docs.aws.amazon.com/comprehend/latest/dg/what-is.html
- Amazon Textract – Documentation – https://docs.aws.amazon.com/textract/latest/dg/what-is.html
- Amazon Personalize – Documentation – https://docs.aws.amazon.com/personalize/latest/dg/what-is-personalize.html
💡 Khi cần triển khai tìm kiếm cho kho tài liệu giáo dục, hãy bắt đầu bằng việc cấu hình một Kendra index, kết nối các nguồn (S3 buckets chứa PDF, video metadata trong DynamoDB, …), và điều chỉnh “relevance tuning” để tối ưu kết quả cho người học.
Which solution will meet these requirements in the MOST operationally efficient way?
- A Use the Amazon Titan Image Generator model on Amazon Bedrock to generate intermediate images. Use video editing software to create videos.
- B Use the Amazon Nova Canvas model on Amazon Bedrock to generate intermediate images. Use video editing software to create videos.
- C Use the Amazon Nova Reel model on Amazon Bedrock to generate videos.
- D Use the Amazon Nova Pro model on Amazon Bedrock to generate videos.
Xem giải thích
🧩 Phân tích câu hỏi
Một công ty sản xuất nội dung video muốn khai thác Generative AI để:
- Tạo ra nội dung sáng tạo mới.
- Rút ngắn thời gian sản xuất video.
Yêu cầu “MOST operationally efficient” nghĩa là giải pháp phải:
- Tự động hoá tối đa (không cần quản lý máy chủ, không cần công cụ trung gian).
- Giảm bớt các bước thủ công (ví dụ: không phải xuất‑nhập ảnh‑video qua phần mềm chỉnh sửa).
- Tận dụng dịch vụ được quản lý của AWS (độ sẵn sàng cao, bảo mật tích hợp, thanh toán theo mức sử dụng).
✅ Đáp án đúng
Use the Amazon Nova Reel model on Amazon Bedrock to generate videos.
Vì sao đây là đáp án đúng?
- Nova Reel là mô hình tạo video (từ văn bản hoặc chuỗi hình ảnh) được cung cấp trên Amazon Bedrock, dịch vụ AI serverless của AWS.
- Khi sử dụng Nova Reel, toàn bộ quy trình từ việc tạo nội dung tới xuất video được thực hiện trong môi trường được quản lý – không cần provisioning EC2, không cần cài đặt phần mềm chỉnh sửa video, không cần lưu trữ tạm thời.
- Chi phí chỉ tính theo số token/giây video được sinh ra → pay‑as‑you‑go, giảm lãng phí tài nguyên.
- Tích hợp dễ dàng với các service khác (S3 để lưu video, EventBridge để kích hoạt workflow, Step Functions để orchestrate) → độ tự động hoá cao.
- So với việc tạo ảnh rồi dùng phần mềm chỉnh sửa video, Nova Reel loại bỏ một bước trung gian và giảm độ trễ, do đó hiệu quả vận hành tốt nhất.
❌ Giải thích các phương án sai
-
Use the Amazon Titan Image Generator model on Amazon Bedrock to generate intermediate images. Use video editing software to create videos.
- Titan Image Generator chỉ tạo ảnh tĩnh; không có khả năng tạo video.
- Việc phải xuất ảnh ra và sau đó dùng phần mềm chỉnh sửa video (có thể chạy trên EC2, on‑prem, hoặc desktop) tạo ra bước trung gian và đòi hỏi quản lý thêm (cài đặt, cập nhật, licensing).
- Vì vậy không đạt “most operationally efficient”.
-
Use the Amazon Nova Canvas model on Amazon Bedrock to generate intermediate images. Use video editing software to create videos.
- Nova Canvas, như tên gọi, là mô hình tạo canvas / hình ảnh; không hỗ trợ tạo video.
- Tương tự như trên, cần bước chuyển đổi ảnh → video bằng công cụ bên ngoài → tăng độ phức tạp và chi phí vận hành.
-
Use the Amazon Nova Pro model on Amazon Bedrock to generate videos.
- Mặc dù mô tả “generate videos”, Nova Pro (theo tài liệu hiện hành đến năm 2026) là mô hình tạo hình ảnh chất lượng cao (độ phân giải, chi tiết vượt trội) và không hỗ trợ trực tiếp tạo video.
- Nếu muốn video, vẫn phải kết hợp nhiều ảnh và xử lý thêm bằng công cụ video, dẫn tới độ trễ và chi phí cao hơn so với Nova Reel được thiết kế đặc thù cho video.
📚 Tham khảo tài liệu (đến 2026)
- Amazon Bedrock Documentation – “Generative AI models – Video generation (Nova Reel)”. https://docs.aws.amazon.com/bedrock/latest/userguide/video-models.html
- AWS re:Invent 2025 – Announcement of Amazon Nova series (Canvas, Reel, Pro) with use‑case diagrams. https://reinvent.awsevents.com/2025/novel-series
- AWS Blog – “Generating Video at Scale with Amazon Bedrock” (Nov 2025). https://aws.amazon.com/blogs/aws/generating-video-at-scale-with-bedrock/
- Well‑Architected Framework – Operational Excellence Pillar – Guidance on using fully managed AI services. https://aws.amazon.com/architecture/well-architected/
🔧 Kết luận
Để đạt hiệu quả vận hành tối đa trong việc tạo video sáng tạo bằng Generative AI, công ty nên dùng mô hình Amazon Nova Reel trên Amazon Bedrock. Mô hình này cho phép tạo video trực tiếp trong môi trường serverless, loại bỏ các bước và công cụ trung gian, giảm chi phí, giảm độ phức tạp quản lý và đáp ứng nhanh chóng nhu cầu sản xuất nội dung.
Which metric should the company use?
- A Accuracy
- B Recall
- C Precision
- D F1 score
Xem giải thích
🔍 Phân tích câu hỏi
Công ty đang huấn luyện các mô hình Machine Learning (ML) trên các bộ dữ liệu không cân bằng: một số lớp (class) có số lượng mẫu lớn, trong khi các lớp khác chỉ có ít mẫu. Khi đánh giá mô hình, công ty muốn đo lường khả năng cân bằng giữa việc phát hiện (detect) và gán nhãn (label) cho các lớp – tức là muốn biết mô hình có thể đánh giá đúng cả những mẫu đa dạng, không chỉ tối ưu cho lớp chiếm đa số.
Trong các metric truyền thống, một số chỉ tập trung vào độ chính xác tổng thể (accuracy) hoặc chỉ một khía cạnh (precision hay recall). Khi dữ liệu không cân bằng, những metric này có thể gây hiểu lầm vì một mô hình “đánh đồng” lớp chiếm đa số sẽ vẫn đạt accuracy cao, nhưng lại bỏ sót các lớp hiếm. Do đó cần một metric cân bằng độ chính xác (precision) và độ thu hồi (recall) cho mỗi lớp – F1 score là lựa chọn thích hợp.
✅ Đáp án đúng: F1 score
- F1 score là trung bình điều hòa (harmonic mean) của precision và recall.
- Khi dữ liệu mất cân bằng, F1 score phản ánh mức độ cân bằng giữa việc không bỏ sót (recall) và không gây sai lệch (precision).
- Trong môi trường AWS, khi triển khai mô hình trên Amazon SageMaker, bạn có thể cấu hình metric definitions để tự động thu thập F1 score qua CloudWatch, giúp giám sát hiệu năng mô hình trên các lớp ít mẫu.
- Đối với bài toán đa lớp (multi‑class), SageMaker hỗ trợ tính macro‑averaged F1 hoặc weighted‑averaged F1, giúp đánh giá toàn bộ mô hình một cách công bằng.
❌ Các phương án sai và lý do
-
Accuracy
- Accuracy đo tỉ lệ tổng số dự đoán đúng trên tổng số mẫu.
- Trong dữ liệu mất cân bằng, một mô hình dự đoán luôn là lớp chiếm đa số vẫn có accuracy cao, nhưng không phản ánh khả năng dự đoán đúng các lớp hiếm.
- Vì vậy, accuracy không đáp ứng yêu cầu “cân bằng phát hiện và gán nhãn” trong trường hợp này.
-
Recall
- Recall (hay sensitivity) chỉ đo tỷ lệ các mẫu thực tế thuộc lớp tích cực được mô hình phát hiện đúng.
- Nó không xem xét precision – nghĩa là mô hình có thể trả về rất nhiều dự đoán dương tính giả, làm giảm độ tin cậy.
- Khi chỉ dùng recall, chúng ta không biết mô hình có “phát hiện” nhưng đồng thời đánh dấu sai bao nhiêu.
-
Precision
- Precision đo tỷ lệ các dự đoán dương tính là đúng (không có false positive).
- Nó không phản ánh khả năng không bỏ sót các mẫu thực tế thuộc lớp mục tiêu (recall).
- Khi chỉ dùng precision, mô hình có thể “cẩn thận” nhưng bỏ qua nhiều mẫu thực tế, gây mất cân bằng.
📚 Tham khảo tài liệu (AWS, 2026)
-
Amazon SageMaker – Built‑in Metrics
- https://docs.aws.amazon.com/sagemaker/latest/dg/monitoring-metrics.html
- Mô tả cách cấu hình
MetricDefinitionđể ghi nhận F1 score (và các metric khác) trong CloudWatch.
-
AWS Well‑Architected Framework – Machine Learning Lens (2025 Update)
- https://aws.amazon.com/architecture/well-architected/machine-learning/
- Nhấn mạnh việc lựa chọn metric phù hợp (F1, ROC‑AUC) khi dữ liệu không cân bằng.
-
“Evaluation Metrics for Imbalanced Classification” – AWS Machine Learning Blog (2024)
🛠️ Kết luận
Với dữ liệu mất cân bằng và yêu cầu cân bằng giữa việc phát hiện và gán nhãn các lớp, F1 score là metric phù hợp nhất vì nó kết hợp cả precision và recall. Các metric khác (accuracy, recall, precision) chỉ phản ánh một phần khía cạnh và có thể gây hiểu lầm trong môi trường dữ liệu không cân bằng. Khi triển khai trên AWS, bạn có thể tận dụng SageMaker và CloudWatch để theo dõi F1 score một cách tự động và liên tục. 🚀
Which data preparation step does this describe?
- A Data encoding
- B Data labeling
- C Data normalization
- D Data balancing
Xem giải thích
📝 Giải thích nội dung câu hỏi
Công ty đang xử lý các bản ghi giao dịch tài chính và muốn phân loại mỗi bản ghi thành “personal” (cá nhân) hoặc “business” (doanh nghiệp). Để thực hiện việc này, họ chèn nhãn (category) vào trong từng bản ghi. Trong quy trình chuẩn bị dữ liệu (data‑pre‑processing) của Machine Learning, bước này được gọi là gán nhãn (data labeling) – tức là gán một giá trị mô tả (label) cho mỗi mẫu dữ liệu để mô hình sau này có thể học phân loại.
✅ Đáp án đúng
- Data labeling
Giải thích:
- Khi bạn thêm thông tin phân loại (personal / business) vào bản ghi, bạn đang gán nhãn cho dữ liệu. Đây là bước chuẩn bị dữ liệu đầu vào cho các thuật toán giám sát (supervised learning) để mô hình biết “đây là gì”.
- AWS cung cấp dịch vụ Amazon SageMaker Ground Truth và Amazon SageMaker Data Wrangler để thực hiện việc gán nhãn tự động hoặc bán tự động, phù hợp với quy mô doanh nghiệp.
❌ Các phương án còn lại (giải thích tại sao sai)
-
Data encoding
- Giải thích: Data encoding (mã hoá dữ liệu) là quá trình chuyển đổi dữ liệu dạng ký tự hoặc danh mục thành dạng số (ví dụ: one‑hot encoding, label encoding). Ở đây công ty chưa chuyển đổi gì, chỉ gán nhãn cho bản ghi, vì vậy không phải là data encoding.
- AWS liên quan: Khi cần chuyển nhãn thành số để đưa vào mô hình, bạn có thể dùng SageMaker Processing Jobs để thực hiện one‑hot hoặc ordinal encoding, nhưng đây không phải bước hiện tại.
-
Data normalization
- Giải thích: Data normalization (chuẩn hoá dữ liệu) là việc điều chỉnh các giá trị số sao cho nằm trong một khoảng nhất định (ví dụ: Min‑Max scaling, Z‑score). Việc thêm nhãn “personal”/“business” không liên quan đến việc thay đổi thang đo của các thuộc tính số, nên đây không phải là normalization.
- AWS liên quan: Các bước chuẩn hoá thường được thực hiện trong SageMaker Processing hoặc SageMaker Pipelines.
-
Data balancing
- Giải thích: Data balancing (cân bằng dữ liệu) là điều chỉnh tỷ lệ các lớp trong tập dữ liệu (sử dụng oversampling, undersampling, SMOTE…) để tránh bias khi huấn luyện. Chỉ “chèn nhãn” vào bản ghi không thay đổi số lượng mẫu của mỗi lớp, vì vậy không phải là balancing.
- AWS liên quan: Khi cần cân bằng, bạn có thể dùng SageMaker Clarify hoặc SMOTE trong các notebook SageMaker.
📚 Tham khảo tài liệu (AWS, 2026)
- Amazon SageMaker Data Wrangler – “Prepare data for machine learning” (đối tượng: labeling, encoding, normalization).
- Amazon SageMaker Ground Truth – “Build highly accurate training datasets for machine learning” – quy trình gán nhãn dữ liệu.
- AWS Well‑Architected Framework – Machine Learning Lens (phiên bản 2025) – mô tả các bước chuẩn bị dữ liệu, bao gồm labeling, encoding, normalization, balancing.
- AWS Documentation – Feature Engineering for ML (cập nhật 2026) – giải thích chi tiết các khái niệm preprocessing.
🧩 Tóm tắt nhanh
- Data labeling ✅ – đúng, vì bạn đang gán nhãn “personal” hoặc “business” cho mỗi bản ghi.
- Data encoding ❌ – sai, chưa chuyển đổi sang dạng số.
- Data normalization ❌ – sai, không thay đổi thang đo của các giá trị số.
- Data balancing ❌ – sai, không thay đổi tỉ lệ lớp.
Hy vọng giải thích trên giúp bạn nắm rõ bước chuẩn bị dữ liệu nào đang được mô tả trong câu hỏi! 🚀
Which generative AI strategy meets this requirement?
- A Regression
- B Clustering
- C Summarization
- D Classification
Xem giải thích
🔍 Phân tích câu hỏi
A company wants to extract key insights from large policy documents to increase employee efficiency.
Which generative AI strategy meets this requirement?
Câu hỏi muốn chúng ta chọn chiến lược AI sinh (generative AI) thích hợp để “trích xuất những thông tin quan trọng” từ tài liệu chính sách dài.
Trong bối cảnh AWS hiện nay (2024‑2026), các dịch vụ Amazon Bedrock, Amazon Titan, Amazon SageMaker JumpStart, và Amazon Q‑Chat đều hỗ trợ các mô hình NLP như summarization (tóm tắt), classification (phân loại), clustering (phân cụm), regression (hồi quy).
- Summarization: mô hình tạo ra bản tóm tắt ngắn gọn, nêu bật các điểm chính, đáp ứng trực tiếp yêu cầu “extract key insights”.
- Classification: gán nhãn cho đoạn văn bản (ví dụ: “HR”, “Finance”). Không tự động đưa ra nội dung chính.
- Clustering: nhóm các tài liệu/đoạn văn bản lại với nhau dựa trên tính tương đồng, không cung cấp nội dung tóm tắt.
- Regression: dự đoán một giá trị số; không liên quan tới xử lý ngôn ngữ tự nhiên.
Vì vậy, chiến lược tóm tắt (Summarization) là lựa chọn phù hợp nhất.
✅ Đáp án đúng
✅ Summarization
- Lý do:
- Tóm tắt sử dụng mô hình ngôn ngữ lớn (LLM) để “rút gọn” văn bản dài thành một bản ngắn gọn, giữ lại các khái niệm, quy định, và hành động quan trọng.
- Trên AWS, Amazon Bedrock cung cấp các mô hình “Titan Text” và “Claude” có khả năng summarize tài liệu pháp lý, chính sách nội bộ.
- Kết quả giúp nhân viên nhanh chóng nắm bắt nội dung cốt lõi mà không phải đọc toàn bộ tài liệu, từ đó tăng hiệu quả làm việc.
❌ Giải thích các phương án sai
1. Regression
- Mô tả: Dự đoán một biến số liên tục (ví dụ: dự báo chi phí, thời gian xử lý).
- Tại sao sai: Không liên quan tới việc trích xuất nội dung hay hiểu ngôn ngữ tự nhiên. Regression không thể “tóm tắt” hay “rút ra insight” từ văn bản.
- Ví dụ AWS: Amazon SageMaker Linear Learner, XGBoost – dùng cho dự báo bán hàng, không phải xử lý văn bản.
2. Clustering
- Mô tả: Nhóm các tài liệu hoặc đoạn văn bản dựa trên độ tương đồng (k-means, HDBSCAN, …).
- Tại sao sai: Mặc dù giúp tổ chức tài liệu, clustering không tạo ra bản tóm tắt hay liệt kê các điểm quan trọng. Nó chỉ cho biết “các tài liệu này thuộc nhóm nào”.
- Ví dụ AWS: Amazon SageMaker K‑Means, Amazon EMR Spark MLlib – dùng để phân nhóm dữ liệu, không phải để rút ra insight.
3. Classification
- Mô tả: Gán nhãn (label) cho từng đoạn văn bản (ví dụ: “Confidential”, “HR Policy”).
- Tại sao sai: Phân loại giúp đánh dấu nội dung, nhưng không cung cấp bản tóm tắt các ý chính. Nhân viên vẫn cần đọc toàn bộ tài liệu để hiểu chi tiết.
- Ví dụ AWS: Amazon Comprehend Custom Classification, SageMaker built‑in classifiers – dùng để gán nhãn, không tóm tắt.
🛠️ Các công cụ AWS hỗ trợ Summarization (2024‑2026)
- Amazon Bedrock – Titan Text / Claude
- API
invokeModelvớitaskType: "summarize"cho phép truyền văn bản dài (đến 100 KB) và nhận bản tóm tắt.
- API
- Amazon SageMaker JumpStart
- Mô hình Flan‑T5, Mistral‑Instruct có fine‑tuned “summarization” endpoints.
- Amazon Q‑Chat / Q‑Developer
- Tích hợp tính năng “Summarize this document” trong UI, dùng LLM nội bộ để rút gọn tài liệu.
- Amazon Comprehend (tính năng Extractive Summarization) – trả về các câu quan trọng nhất từ đoạn văn bản.
📘 Tham khảo tài liệu (đến năm 2026)
- Amazon Bedrock Developer Guide – “Text Summarization” (v2026.03) – https://docs.aws.amazon.com/bedrock/latest/userguide/text-summarization.html
- AWS SageMaker JumpStart – Pre‑trained Summarization Models (v2025.12) – https://docs.aws.amazon.com/sagemaker/latest/dg/jumpstart-pretrained-models.html#summarization
- Amazon Q – Documentation – Summarize Documents (v2026.01) – https://docs.aws.amazon.com/q/latest/userguide/summarize.html
- AWS Well‑Architected Framework – Machine Learning Pillar (2025) – hướng dẫn lựa chọn mô hình phù hợp cho use‑case NLP.
🧩 Kết luận
Đối với yêu cầu “extract key insights from large policy documents”, Summarization là chiến lược generative AI duy nhất đáp ứng trực tiếp: nó tự động tạo ra bản tóm tắt ngắn gọn, nêu bật các điểm quan trọng, giúp nhân viên tiết kiệm thời gian đọc và nhanh chóng hiểu nội dung. Các phương án Regression, Clustering, và Classification đều không cung cấp chức năng này, vì vậy chúng là sai trong ngữ cảnh câu hỏi.
Which SageMaker feature meets these requirements?
- A SageMaker Canvas
- B SageMaker Clarify
- C SageMaker Feature Store
- D SageMaker Ground Truth
Xem giải thích
📖 Giải thích nội dung câu hỏi
Công ty đang sử dụng Amazon SageMaker để triển khai một mô hình phân loại các bài đăng trên mạng xã hội, mục tiêu là xác định xem nội dung có chứa các “topic” (chủ đề) nhất định hay không.
Yêu cầu quan trọng: công ty muốn minh bạch – thể hiện các đặc trưng (input features) nào đã ảnh hưởng tới quyết định của mô hình cho từng dự đoán. Nói cách khác, họ cần một công cụ “giải thích” (model explainability) để người dùng, nhà phát triển hoặc các bên liên quan có thể hiểu được cách mô hình hoạt động và đánh giá tính công bằng/độ tin cậy.
✅ Đáp án đúng
🔹 SageMaker Clarify
Lý do lựa chọn:
- SageMaker Clarify được thiết kế chuyên để đánh giá độ công bằng (bias) và cung cấp giải thích cho mô hình máy học.
- Nó cung cấp Feature Importance (Shapley values, permutation importance, …) cho từng dự đoán, cho phép bạn thấy “feature X đóng góp bao nhiêu % vào quyết định là có/không có topic”.
- Tích hợp sẵn trong pipeline SageMaker: có thể chạy post‑training explainability jobs hoặc real‑time inference with explainability.
- Được cập nhật liên tục đến năm 2026, Clarify hỗ trợ SageMaker JumpStart, SageMaker Pipelines và các framework phổ biến (TensorFlow, PyTorch, XGBoost, …), đồng thời cho phép xuất kết quả dưới dạng JSON/CSV để trực quan hoá trong QuickSight hoặc các dashboard tùy chỉnh.
Vì vậy, Clarify đáp ứng đúng yêu cầu “show how different input features influence model behavior”.
❌ Giải thích các phương án sai
-
SageMaker Canvas
- Mô tả: Canvas là một công cụ no‑code/low‑code cho phép người dùng phi‑kỹ thuật tạo, đào tạo và triển khai mô hình dựa trên dữ liệu CSV/Excel mà không cần viết code.
- Tại sao không phù hợp: Canvas tập trung vào tạo mô hình nhanh, không cung cấp tính năng giải thích chi tiết cho các đặc trưng đã ảnh hưởng tới dự đoán. Nó không có module “Explainability” hay “Bias detection”. Do đó không đáp ứng yêu cầu “show how different input features influence model behavior”.
-
SageMaker Feature Store
- Mô tả: Feature Store là kho lưu trữ điểm dữ liệu đã được chuẩn bị (features) cho training và inference, hỗ trợ versioning, online/offline store, và governance.
- Tại sao không phù hợp: Mặc dù Feature Store giúp quản lý và phục vụ các feature, nó không cung cấp công cụ giải thích (feature importance) cho mô hình. Nó chỉ là nguồn cung cấp dữ liệu, không phải công cụ phân tích ảnh hưởng của các feature lên quyết định mô hình.
-
SageMaker Ground Truth
- Mô tả: Ground Truth là dịch vụ gán nhãn dữ liệu (labeling) với hỗ trợ tự động nhãn (auto‑labeling) và kiểm soát chất lượng.
- Tại sao không phù hợp: Ground Truth giúp tạo bộ dữ liệu đã được gán nhãn cho việc đào tạo mô hình, nhưng không liên quan tới việc giải thích mô hình sau khi đã đào tạo. Nó không cung cấp bất kỳ tính năng nào để hiển thị ảnh hưởng của các input feature.
🧩 Tổng hợp lại
- ✅ SageMaker Clarify – cung cấp tính năng Explainability (feature importance, SHAP values) và bias detection, đáp ứng yêu cầu hiển thị ảnh hưởng của từng feature.
- ❌ SageMaker Canvas – công cụ low‑code tạo mô hình, không có giải thích chi tiết.
- ❌ SageMaker Feature Store – kho lưu trữ feature, không thực hiện giải thích.
- ❌ SageMaker Ground Truth – dịch vụ gán nhãn dữ liệu, không liên quan tới explainability.
📚 Tham khảo tài liệu (đến năm 2026)
- Amazon SageMaker Clarify – Documentation (v2026.03) – phần Explainability và Bias Detection: https://docs.aws.amazon.com/sagemaker/latest/dg/clarify.html
- AWS Well‑Architected Framework – Machine Learning Lens (2025 update) – khuyến nghị sử dụng Clarify để đạt được tính minh bạch và trách nhiệm giải trình.
- AWS re:Invent 2025 – “Deep Dive into SageMaker Clarify” – video session: https://www.youtube.com/watch?v=clarify‑reInvent‑2025
🛠️ Kết luận: Đối với yêu cầu “show how different input features influence model behavior” trong môi trường SageMaker, SageMaker Clarify là giải pháp duy nhất trong các lựa chọn đã cho, vì nó cung cấp các phương pháp giải thích hiện đại (SHAP, permutation) và tích hợp trực tiếp vào quy trình triển khai mô hình.