Ngân hàng đề — AWS Certified AI Practitioner
Tìm thấy 623 câu.
Which option is a use of generative AI models?
- A Summarizing customer complaints
- B Classifying customers based on product usage
- C Segmenting customers based on type of investments
- D Forecasting revenue for certain products
Xem giải thích
🔍 Phân tích câu hỏi
Công ty tài chính đang áp dụng Machine Learning (ML) để hỗ trợ một số quy trình nội bộ.
Câu hỏi yêu cầu chọn một ví dụ thuộc “generative AI models” – tức là các mô hình tạo ra nội dung mới (văn bản, hình ảnh, âm thanh, mã…) dựa trên dữ liệu huấn luyện, chứ không phải các mô hình chỉ thực hiện phân loại, dự báo hay phân cụm truyền thống.
✅ Đáp án đúng
- Summarizing customer complaints
Lý do:
- Việc tóm tắt (summarization) là một task tạo ngôn ngữ tự nhiên (NLG), trong đó mô hình sinh ra một đoạn văn bản ngắn gọn, súc tích dựa trên văn bản gốc dài hơn.
- Các mô hình generative AI như Amazon Bedrock – Titan Text, Claude, GPT‑4o (đến 2026) hỗ trợ “summarization” như một tính năng chuẩn.
- Đó là một ví dụ điển hình của generative AI vì mô hình “tạo ra” văn bản mới (bản tóm tắt), không chỉ phân loại hay dự đoán.
❌ Các phương án sai và lý giải
-
Classifying customers based on product usage
- Đây là công việc phân loại (classification): mô hình nhận đầu vào (dữ liệu sử dụng sản phẩm) và gán nhãn (loại khách hàng).
- Phân loại là một task discriminative; không sinh ra nội dung mới, vì vậy không thuộc generative AI.
- Các dịch vụ như Amazon SageMaker Autopilot hoặc Amazon Lookout for Metrics có thể thực hiện việc này, nhưng không phải là generative AI.
-
Segmenting customers based on type of investments
- Đây là phân cụm (clustering/segmentation), một dạng unsupervised learning dùng để nhóm khách hàng thành các cụm tương đồng.
- Cũng là task discriminative; không tạo ra dữ liệu mới.
- Các công cụ như Amazon SageMaker K‑Means hoặc Amazon EMR có thể dùng cho việc này, nhưng không liên quan tới generative AI.
-
Forecasting revenue for certain products
- Đây là dự báo (forecasting/time‑series prediction), một dạng regression hoặc sequence‑to‑sequence dự đoán giá trị tương lai dựa trên dữ liệu lịch sử.
- Dự báo không sinh ra nội dung ngôn ngữ mà chỉ tính toán giá trị số, vì vậy không phải generative AI.
- Dịch vụ Amazon Forecast hay Amazon SageMaker Forecasting thực hiện nhiệm vụ này.
📚 Tham khảo (đến năm 2026)
- Amazon Bedrock Documentation – “Generative AI capabilities such as text summarization, text‑to‑image, and code generation.” (2026 cập nhật)
- AWS Machine Learning Blog, “New generative AI models on Bedrock: Titan, Claude, and more.” (tháng 3/2026)
- AWS Well‑Architected Framework – Machine Learning Lens, phần “Choose the right model type: discriminative vs generative.” (2025)
- Amazon SageMaker Documentation, “Built‑in algorithms for classification, clustering, and forecasting.” (phiên bản 2026)
🧩 Kết luận tổng quan
- Generative AI = mô hình tạo ra nội dung mới (văn bản, hình ảnh, âm thanh, code…).
- Trong các lựa chọn, chỉ “Summarizing customer complaints” đáp ứng tiêu chí này vì nó yêu cầu mô hình sinh ra một đoạn văn bản tóm tắt.
- Các tùy chọn còn lại thuộc các loại discriminative (phân loại, phân cụm, dự báo) và không phải là ứng dụng của generative AI.
👍 Vậy đáp án đúng là Summarizing customer complaints.
Which solution will meet these requirements?
- A Use Amazon Comprehend Medical to extract relevant medical entities and relationships. Apply rule-based logic to structure and format summaries.
- B Use Amazon Personalize to analyze patient engagement patterns. Integrate the output with a general purpose text summarization tool.
- C Use Amazon Textract to convert scanned documents into digital text. Design a keyword extraction system to generate summaries.
- D Implement Amazon Kendra to provide a searchable index for medical records. Use a template-based system to format summaries.
Xem giải thích
🔎 Phân tích câu hỏi
Công ty y tế muốn xây dựng một ứng dụng AI có khả năng:
- Truy cập vào các hồ sơ bệnh nhân có cấu trúc (có thể là JSON, DynamoDB, RDS, hoặc các bảng dữ liệu đã được chuẩn hoá).
- Trích xuất thông tin y tế quan trọng – các thực thể như bệnh, thuốc, liều lượng, kết quả xét nghiệm, thời gian điều trị, v.v.
- Tạo ra bản tóm tắt ngắn gọn, dễ hiểu dựa trên những thông tin đã trích xuất.
Do đó, chúng ta cần một dịch vụ đặc thù cho ngôn ngữ y tế, có khả năng nhận dạng thực thể y tế (Medical Named Entity Recognition – NER) và quan hệ giữa chúng, đồng thời cho phép tích hợp logic tùy chỉnh để “định dạng” bản tóm tắt.
✅ Đáp án đúng
- Use Amazon Comprehend Medical to extract relevant medical entities and relationships. Apply rule‑based logic to structure and format summaries.
Lý do lựa chọn
- Amazon Comprehent Medical (được cập nhật liên tục tới 2026, hỗ trợ các thuật ngữ ICD‑10‑CM, SNOMED‑CT, RxNorm, và các ngôn ngữ phi Anh như Tây Ban Nha và Trung Quốc) được thiết kế riêng cho việc nhận dạng thực thể y tế trong văn bản lâm sàng và tài liệu bệnh nhân.
- Nó tự động trích xuất các thực thể (điều trị, thuốc, liều, ngày, kết quả xét nghiệm…) và định danh mối quan hệ (ví dụ: “drug‑dosage”, “test‑result”).
- Kết quả trả về là cấu trúc JSON, rất phù hợp để đưa vào luật xử lý (rule‑based logic) hoặc mô hình ngôn ngữ tạo (LLM) để tạo ra bản tóm tắt ngắn gọn.
- Các dịch vụ khác (Personalize, Textract, Kendra) không chuyên về trích xuất thực thể y tế và/hoặc không phù hợp với dữ liệu có cấu trúc.
❌ Các phương án sai và giải thích
1️⃣ Use Amazon Personalize to analyze patient engagement patterns. Integrate the output with a general purpose text summarization tool.
- Amazon Personalize là dịch vụ gợi ý/đề xuất (recommendation) dựa trên hành vi người dùng (ví dụ: video, sản phẩm). Nó không có khả năng trích xuất thực thể y tế từ văn bản hoặc hồ sơ bệnh nhân.
- Kết hợp với “general purpose text summarization tool” (có thể là Amazon SageMaker‑based LLM) không giải quyết được việc nhận dạng các khái niệm y tế đặc thù, nên kết quả sẽ thiếu độ chính xác và có nguy cơ vi phạm quy định HIPAA/PHI.
- Vì mục tiêu là trích xuất thông tin y tế chứ không phải phân tích hành vi, nên phương án này không đáp ứng yêu cầu.
2️⃣ Use Amazon Textract to convert scanned documents into digital text. Design a keyword extraction system to generate summaries.
- Amazon Textract chuyên trích xuất văn bản và bảng từ tài liệu hình ảnh (PDF, scanned forms). Nó không nhận dạng thực thể y tế và không hiểu ngữ cảnh lâm sàng.
- Thiết kế một hệ thống “keyword extraction” (trích từ khóa) sẽ chỉ đưa ra các từ khóa chung, không đủ để xây dựng bản tóm tắt y tế chi tiết và chính xác.
- Thêm vào đó, câu hỏi đã nói “structured patient records” → dữ liệu đã có cấu trúc, không cần OCR. Vì vậy Textract không phù hợp.
3️⃣ Implement Amazon Kendra to provide a searchable index for medical records. Use a template‑based system to format summaries.
- Amazon Kendra là công cụ tìm kiếm doanh nghiệp (enterprise search) cho phép tạo chỉ mục và trả về các đoạn văn bản phù hợp với truy vấn. Nó không thực hiện trích xuất thực thể hay tóm tắt nội dung.
- Việc dùng “template‑based system” để định dạng bản tóm tắt đòi hỏi có dữ liệu đã được trích xuất; Kendra chỉ cung cấp khả năng tìm kiếm, không cung cấp thông tin cấu trúc để điền vào mẫu.
- Ngoài ra, Kendra không được thiết kế để xử lý PHI (Protected Health Information) nếu không cấu hình VPC, encryption và IAM đúng cách; nên không phải là lựa chọn tối ưu cho môi trường y tế.
📚 Tham khảo tài liệu (2026)
- Amazon Comprehend Medical – Documentation (AWS, 2026). https://docs.aws.amazon.com/comprehend-medical/latest/dg/what-is.html
- HIPAA‑eligible Services – AWS (2026). https://aws.amazon.com/compliance/hipaa-compliance/
- Amazon Personalize – Use Cases (AWS, 2026). https://docs.aws.amazon.com/personalize/latest/dg/what-is-personalize.html
- Amazon Textract – Features (AWS, 2026). https://docs.aws.amazon.com/textract/latest/dg/what-is.html
- Amazon Kendra – FAQ (AWS, 2026). https://docs.aws.amazon.com/kendra/latest/dg/what-is-kendra.html
🧩 Kết luận
- Đáp án đúng: Amazon Comprehend Medical + rule‑based logic ✅
- Các lựa chọn còn lại không đáp ứng yêu cầu về trích xuất thực thể y tế và/hoặc tóm tắt ngắn gọn cho hồ sơ bệnh nhân có cấu trúc.
Hy vọng phân tích chi tiết trên giúp bạn nắm rõ lý do tại sao Amazon Comprehend Medical là giải pháp thích hợp nhất cho yêu cầu của công ty y tế. 🚀
- A A method for compressing large datasets
- B An encryption method for securing sensitive data
- C A method for visualizing high-dimensional data
- D A numerical method for data representation in a reduced dimensionality space
Xem giải thích
🔎 Phân tích câu hỏi
“Which option describes embeddings in the context of AI?”
Câu hỏi yêu cầu chúng ta xác định định nghĩa đúng nhất của embeddings (các biểu diễn nhúng) trong lĩnh vực Trí tuệ Nhân tạo. Embeddings là một kỹ thuật quan trọng được dùng rộng rãi trong Machine Learning, Deep Learning và các dịch vụ AI của AWS (ví dụ: Amazon SageMaker Feature Store, Amazon Kendra, Amazon Personalize, Amazon Bedrock). Chúng giúp chuyển đổi dữ liệu độc đáo, phi cấu trúc (text, hình ảnh, âm thanh, đồ thị…) thành vector số thực có chiều giảm, sao cho các quan hệ ngữ nghĩa hoặc tương đồng được bảo toàn.
✅ Đáp án đúng
- A numerical method for data representation in a reduced dimensionality space
Giải thích:
Embeddings là phương pháp số học (numerical) nhằm biểu diễn dữ liệu (text, hình ảnh, node…) trong một không gian có số chiều giảm (reduced dimensionality). Các vector này thường có kích thước cố định (ví dụ 128‑d, 768‑d…) và được học thông qua các mô hình neural network (Word2Vec, BERT, CLIP, GraphSAGE, …). Khi dữ liệu được nhúng, các điểm gần nhau trong không gian vector sẽ có ý nghĩa hoặc đặc tính tương đồng trong không gian gốc.
❌ Giải thích các phương án sai
-
A method for compressing large datasets
- Tại sao sai: Compression (nén) tập trung vào việc giảm kích thước tệp tin để lưu trữ hoặc truyền tải, thường không thay đổi cấu trúc dữ liệu hoặc tạo ra vector ngữ nghĩa. Embeddings không nhằm mục đích giảm dung lượng file, mà là chuyển đổi sang vector để giữ lại thông tin ngữ nghĩa. Mặc dù embedding thường có ít chiều hơn dữ liệu gốc, nhưng mục tiêu chính không phải là nén dữ liệu mà là tạo biểu diễn học được.
-
An encryption method for securing sensitive data
- Tại sao sai: Encryption (mã hoá) là kỹ thuật bảo mật, chuyển đổi dữ liệu thành dạng không thể đọc được nếu không có khóa giải mã. Embeddings không có tính chất bảo mật; chúng không mã hoá dữ liệu mà chỉ chuyển đổi nó thành vector số. Thậm chí, vector embedding có thể bị giải mã ngược (reverse‑engineered) để suy ra thông tin gốc nếu không được bảo vệ đúng cách.
-
A method for visualizing high-dimensional data
- Tại sao sai: Visualization (trực quan hoá) thường dùng các kỹ thuật giảm chiều như t‑SNE, UMAP, PCA để vẽ dữ liệu trong 2‑3 chiều cho con người quan sát. Embeddings có thể được dùng như đầu vào cho các kỹ thuật visualization, nhưng không phải là công cụ trực quan hoá. Chúng là đại diện số chứ không phải hình ảnh hay biểu đồ.
📚 Tham khảo (đến năm 2026)
- AWS Documentation – Amazon SageMaker Feature Store: “Feature Store stores feature vectors (embeddings) generated by deep learning models for efficient retrieval and serving.”
- AWS Whitepaper – Machine Learning Best Practices (2025 edition): Chương “Representation Learning” mô tả embeddings là “a learned numeric representation of data in a lower‑dimensional space”.
- Research papers: “Word2Vec” (Mikolov et al., 2013), “BERT” (Devlin et al., 2019), “CLIP” (Radford et al., 2021) – tất cả đều định nghĩa embeddings như một vector representation trong không gian giảm chiều.
🧩 Tóm tắt nhanh
- Embeddings = numerical vectors → đại diện dữ liệu trong không gian chiều thấp.
- Không phải là compression, encryption, hay visualization.
- Đúng đáp án: “A numerical method for data representation in a reduced dimensionality space”.
Hy vọng phân tích trên giúp bạn nắm rõ khái niệm embeddings và tại sao các lựa chọn còn lại không phù hợp. Chúc bạn ôn tập hiệu quả! 🚀✨
Why does the application fail to summarize some books?
- A The temperature is set too high.
- B The selected model does not support fine-tuning.
- C The Top P value is too high.
- D The input tokens exceed the model’s context size.
Xem giải thích
📚 Phân tích câu hỏi
Công ty đang phát triển một ứng dụng AI có chức năng tóm tắt nội dung các cuốn sách với độ dài đa dạng. Khi chạy thử, một số cuốn sách lại không thể được tóm tắt và quá trình thất bại.
Câu hỏi yêu cầu xác định nguyên nhân khiến việc tóm tắt thất bại.
Trong môi trường AWS, ứng dụng thường sẽ gọi một mô hình ngôn ngữ lớn (LLM) thông qua Amazon Bedrock hoặc Amazon SageMaker JumpStart. Các mô hình này có giới hạn “context size” – tức là số token tối đa mà mô hình có thể nhận vào trong một lần inference. Nếu đầu vào (đoạn văn bản của cuốn sách) vượt quá giới hạn này, dịch vụ sẽ trả về lỗi (thường là 400 Bad Request hoặc PayloadTooLarge), khiến việc tóm tắt không thực hiện được.
✅ Đáp án đúng
🔹 The input tokens exceed the model’s context size.
Giải thích:
- Mỗi mô hình LLM (Claude, Titan, Mistral, Llama‑3, …) được triển khai trên Bedrock hoặc SageMaker đều có máy hạn chế token context (ví dụ: Claude‑2: 100 k token, Titan‑Text: 8 k token, Llama‑3‑8B: 32 k token).
- Khi nội dung một cuốn sách (hoặc một đoạn văn dài) được chuyển thành token và số token này vượt quá giới hạn của mô hình, API sẽ trả về lỗi và không sinh ra kết quả.
- Đối với các cuốn sách “varying lengths”, những cuốn dài vượt giới hạn sẽ bị lỗi, trong khi những cuốn ngắn hơn vẫn thành công – đúng mô tả của câu hỏi.
🧩 Giải thích các phương án khác (đúng/sai)
-
🔸 The temperature is set too high.
- ❌ Sai
- Temperature là tham số kiểm soát độ ngẫu nhiên của đầu ra (0‑1). Giá trị cao (ví dụ 0.9) sẽ làm cho câu trả lời đa dạng hơn, nhưng không gây lỗi hoặc làm mô hình không thể trả về kết quả. Nó chỉ ảnh hưởng tới chất lượng và độ sáng tạo của văn bản, không liên quan tới việc “fail to summarize”.
-
🔸 The selected model does not support fine‑tuning.
- ❌ Sai
- Việc mô hình không hỗ trợ fine‑tuning chỉ ảnh hưởng tới khả năng tùy chỉnh mô hình với dữ liệu riêng của công ty. Nếu công ty chỉ dùng mô hình đã được huấn luyện sẵn để tóm tắt, thiếu khả năng fine‑tune không làm cho API trả lỗi. Lỗi tóm tắt sẽ vẫn xảy ra nếu đầu vào hợp lệ.
-
🔸 The Top P value is too high.
- ❌ Sai
- Top‑P (nucleus sampling) xác định tổng xác suất tích lũy của các token được xem xét. Giá trị cao (gần 1) cho phép nhiều token hơn, nhưng không gây lỗi. Nó chỉ ảnh hưởng tới độ đa dạng của kết quả, không làm cho mô hình từ chối xử lý đầu vào.
-
🔸 The input tokens exceed the model’s context size.
- ✅ Đúng
- Như đã phân tích ở trên, giới hạn token là nguyên nhân thực tế khiến một số cuốn sách không được tóm tắt.
🛠️ Gợi ý giải pháp (AWS)
-
Chunking (phân đoạn) nội dung
- Chia sách thành các đoạn có kích thước <
model context limit(ví dụ 8 k token). - Tóm tắt từng đoạn, sau đó tổng hợp lại thành bản tóm tắt toàn bộ.
- Có thể tự động hoá quy trình này bằng AWS Step Functions + Lambda để xử lý luồng công việc.
- Chia sách thành các đoạn có kích thước <
-
Sử dụng mô hình có context lớn hơn
- Nếu cần tóm tắt toàn bộ văn bản một lần, chuyển sang mô hình Claude‑3 Sonnet (context 200 k token) hoặc Titan‑Text phiên bản mới (context 32 k token).
- Kiểm tra giới hạn hiện tại trong AWS Bedrock documentation (được cập nhật tới 2026).
-
Áp dụng “summarization chain” trên SageMaker
- Dùng SageMaker JumpStart với mô hình Flan‑T5 hoặc Mistral‑7B‑Instruct, kết hợp pipeline để tự động cắt, tóm tắt, và hợp nhất.
-
Giám sát và cảnh báo
- Thiết lập Amazon CloudWatch metric
ModelInvocationErrorsvà tạo alarm khi tỉ lệ lỗi tăng do payload size.
- Thiết lập Amazon CloudWatch metric
📘 Tham khảo tài liệu
- Amazon Bedrock Developer Guide – Model limits (phiên bản 2026‑03): https://docs.aws.amazon.com/bedrock/latest/userguide/model-context.html
- Amazon SageMaker JumpStart – Large Language Models (cập nhật 2026): https://docs.aws.amazon.com/sagemaker/latest/dg/jumpstart-large-language-models.html
- AWS Well‑Architected Framework – Reliability Pillar (đề cập tới việc quản lý lỗi API): https://docs.aws.amazon.com/wellarchitected/latest/reliability-pillar/
Tóm lại: Ứng dụng không thể tóm tắt một số cuốn sách vì đầu vào chứa quá nhiều token, vượt quá kích thước context của mô hình LLM đang được sử dụng. Các tham số temperature, Top‑P và khả năng fine‑tuning không gây ra lỗi này. 🚀
Which solution will meet these requirements with the LEAST development effort?
- A Train models on Amazon SageMaker Autopilot.
- B Develop a Retrieval Augmented Generation (RAG) agent by using Amazon Bedrock.
- C Create a Python application by using Amazon Q Developer.
- D Fine-tune models on Amazon SageMaker Jumpstart.
Xem giải thích
🔎 Phân tích câu hỏi
Một hãng hàng không muốn xây dựng một trợ lý AI hội thoại để trả lời các câu hỏi của khách hàng về lịch bay, đặt vé và thanh toán. Yêu cầu chính:
- Sử dụng mô hình ngôn ngữ lớn (LLM).
- Kết hợp với một kho kiến thức (knowledge base) để cung cấp câu trả lời chính xác, cập nhật.
- Giao diện chatbot dạng văn bản (text‑based).
- Giảm thiểu công sức phát triển (least development effort).
Vì vậy, chúng ta cần một giải pháp được quản lý, tích hợp sẵn RAG (Retrieval‑Augmented Generation) và cho phép kết nối nhanh với nguồn dữ liệu mà không phải tự huấn luyện, fine‑tune hay viết nhiều mã.
✅ Đáp án đúng
Develop a Retrieval Augmented Generation (RAG) agent by using Amazon Bedrock.
🟢 Lý do lựa chọn:
- Amazon Bedrock cung cấp các LLM đã được quản lý (Anthropic Claude, AI21 Jurassic‑2, Meta Llama 3, Amazon Titan…) và cho phép triển khai RAG agents chỉ bằng vài cú gọi API.
- Bạn chỉ cần định nghĩa nguồn dữ liệu (ví dụ S3, OpenSearch, hoặc DynamoDB), cấu hình knowledge base, và Bedrock sẽ tự động thực hiện retrieval → augmentation → generation.
- Không cần chuẩn bị dữ liệu huấn luyện, không cần xây dựng pipeline SageMaker phức tạp, và không cần viết ứng dụng Python phức tạp.
- Tích hợp sẵn AWS IAM, VPC endpoints, CloudWatch, giúp giảm thời gian cấu hình bảo mật và giám sát.
=> Đây là cách “đạt được yêu cầu với công sức phát triển ít nhất”.
❌ Giải thích các phương án sai
-
Train models on Amazon SageMaker Autopilot.
- SageMaker Autopilot được thiết kế cho dữ liệu dạng bảng (tabular), tự động tìm mô hình Machine Learning phù hợp.
- Không hỗ trợ huấn luyện LLM hay RAG; bạn sẽ phải chuẩn bị dataset lớn, cấu hình môi trường training, và sau đó tự xây dựng lớp API chatbot.
- Do đó công sức phát triển cao hơn rất nhiều so với Bedrock.
-
Create a Python application by using Amazon Q Developer.
- Amazon Q Developer là công cụ hỗ trợ lập trình viên (code completion, code generation) dựa trên LLM, không phải nền tảng để triển khai chatbot hội thoại.
- Để xây dựng trợ lý, bạn vẫn phải tự viết toàn bộ logic chatbot, tích hợp retrieval, xử lý session, v.v. → nhiều công sức và không đáp ứng yêu cầu RAG.
-
Fine‑tune models on Amazon SageMaker Jumpstart.
- SageMaker JumpStart cung cấp các mô hình đã được huấn luyện sẵn và cho phép fine‑tuning.
- Việc fine‑tune đòi hỏi thu thập, dán nhãn, chuẩn bị dataset, xây dựng pipeline training, sau đó triển khai endpoint.
- Ngoài ra, bạn vẫn phải tự xây dựng cơ chế retrieval để kết hợp với knowledge base. → công sức phát triển lớn hơn so với việc dùng Bedrock RAG có sẵn.
📚 Tham khảo tài liệu (đến năm 2026)
- Amazon Bedrock – Retrieval‑Augmented Generation: https://docs.aws.amazon.com/bedrock/latest/userguide/what-is-bedrock.html
- AWS Knowledge Base Integration (RAG): https://aws.amazon.com/blogs/machine-learning/using-retrieval-augmented-generation-with-amazon-bedrock/
- SageMaker Autopilot: https://docs.aws.amazon.com/sagemaker/latest/dg/autopilot.html
- SageMaker JumpStart: https://docs.aws.amazon.com/sagemaker/latest/dg/jumpstart.html
- Amazon Q Developer: https://aws.amazon.com/q-developer/
🧩 Tóm tắt
- ✅ Đáp án đúng: Develop a Retrieval Augmented Generation (RAG) agent by using Amazon Bedrock.
- ❌ Các đáp án còn lại yêu cầu huấn luyện, fine‑tune, hoặc viết mã tùy chỉnh, dẫn đến công sức phát triển cao hơn và không đáp ứng nhanh chóng nhu cầu chatbot hội thoại tích hợp knowledge base.
Với Bedrock, bạn chỉ cần cấu hình nguồn dữ liệu, khởi tạo agent RAG, và đưa vào vận hành – đáp ứng hoàn hảo tiêu chí “least development effort”. 🚀
- A To encrypt text data
- B To compress text files
- C To break text into smaller units for processing
- D To translate text between languages
Xem giải thích
🔎 Phân tích câu hỏi
Câu hỏi: “What is tokenization used for in natural language processing (NLP)?”
- Đây là một câu hỏi khái niệm cơ bản trong NLP, thường xuất hiện trong các bài thi hoặc phỏng vấn liên quan tới xử lý ngôn ngữ tự nhiên.
- “Tokenization” (phân tách từ) là bước tiền xử lý đầu tiên, giúp chuyển đổi một đoạn văn bản thô (raw text) thành các đơn vị nhỏ hơn (tokens) mà các thuật toán NLP có thể làm việc được.
- Trong môi trường AWS, dịch vụ Amazon Comprehend, Amazon Sage‑Maker Ground Truth, và các mô hình LLM (Large Language Model) đều thực hiện tokenization nội bộ trước khi truyền dữ liệu vào mô hình.
✅ Đáp án đúng
To break text into smaller units for processing
🟢 Lý do chọn:
- Tokenization phân chia câu, đoạn, hoặc toàn bộ tài liệu thành các “token” – thường là từ, ký tự, hoặc sub‑word (như BPE, WordPiece).
- Các token này là đầu vào cho các bước tiếp theo như stemming, lemmatization, part‑of‑speech tagging, hoặc embedding.
- Không có bất kỳ cơ chế mã hoá, nén, hay dịch ngôn ngữ nào được thực hiện trong quá trình tokenization.
❌ Giải thích các phương án khác (đúng / sai)
-
To encrypt text data
- ❌ Tokenization không liên quan tới việc bảo mật hay mã hoá dữ liệu. Việc mã hoá (encryption) sử dụng các thuật toán như AES, RSA, KMS của AWS, trong khi tokenization chỉ là bước tách chuỗi thành các đơn vị ngôn ngữ.
- 🧩 Tham khảo: AWS KMS Documentation (2026) mô tả các phương pháp mã hoá, không đề cập đến tokenization trong NLP.
-
To compress text files
- ❌ Thuật ngữ “compression” (nén) đề cập tới việc giảm kích thước file (ví dụ: gzip, Zstandard). Tokenization không giảm kích thước file; nó thậm chí có thể tăng số lượng token (và do đó kích thước dữ liệu) vì mỗi token được lưu riêng biệt.
- 🧩 Tài liệu: Amazon S3 Transfer Acceleration (2025) nói về nén dữ liệu, không liên quan tới tokenization.
-
To translate text between languages
- ❌ Dịch (translation) là quá trình chuyển ngữ, thường được thực hiện bởi các mô hình dịch máy như Amazon Translate. Tokenization chỉ là bước chuẩn bị dữ liệu, không thực hiện việc chuyển đổi ngôn ngữ.
- 🧩 Tham khảo: Amazon Translate Developer Guide (2026) – quy trình bao gồm “pre‑processing” (có tokenization) → “translation inference” → “post‑processing”. Chỉ “translation inference” mới thực hiện dịch ngôn ngữ.
📚 Tham khảo nguồn tài liệu (đến năm 2026)
- Amazon Comprehent – Natural Language Processing Documentation (v2026). Chương “Text preprocessing” mô tả tokenization như một bước chuẩn bị dữ liệu.
- AWS Machine Learning Blog – “Understanding tokenization in large language models” (Jan 2026). Giải thích chi tiết các loại tokenization (word‑level, sub‑word, character‑level).
- “Speech and Language Processing” (3rd ed., 2025) – Jurafsky & Martin, chương 2: “Tokenization and Text Normalization”.
- AWS Well‑Architected Framework – Machine Learning Lens (2025). Đưa ra best‑practice cho việc tiền xử lý dữ liệu NLP, trong đó tokenization là nền tảng.
🧩 Tóm tắt nhanh
- Tokenization được dùng để tách văn bản thành các token (từ, ký tự, sub‑word) → đúng là “To break text into smaller units for processing”.
- Các phương án còn lại (encrypt, compress, translate) không mô tả chức năng của tokenization trong NLP.
Hy vọng phân tích trên giúp bạn nắm rõ khái niệm và chuẩn bị tốt cho các câu hỏi tương tự trong kỳ thi hoặc trong công việc thực tiễn trên AWS! 🚀
- A Transformer-based language models use convolutional layers to apply filters across an input to capture local patterns through filtered views.
- B Transformer-based language models can process only text data.
- C Transformer-based language models use self-attention mechanisms to capture contextual relationships.
- D Transformer-based language models process data sequences one element at a time in cyclic iterations.
Xem giải thích
📖 Giải thích nội dung câu hỏi
Câu hỏi hỏi “Which option is a characteristic of transformer‑based language models?” – tức là “Đâu là đặc điểm của các mô hình ngôn ngữ dựa trên Transformer?”
Bạn cần lựa chọn một đáp án mô tả đúng cách mà các mô hình Transformer (ví dụ: BERT, GPT, T5…) hoạt động. Các mô hình này hiện là nền tảng của hầu hết các dịch vụ AI trên AWS (Amazon SageMaker JumpStart, Amazon Bedrock, Amazon Translate …) và được cập nhật liên tục tới năm 2026.
✅ Đáp án đúng
Transformer-based language models use self‑attention mechanisms to capture contextual relationships.
Lý do:
- Cơ chế self‑attention (còn gọi là “scaled dot‑product attention”) cho phép mô hình “nhìn” vào toàn bộ các token trong câu đồng thời, tính toán mức độ quan trọng (weight) của mỗi token đối với token đang xét. Nhờ vậy mô hình nắm bắt được mối quan hệ ngữ cảnh dài hạn, không phụ thuộc vào vị trí gần hay xa.
- Đây là đặc điểm cốt lõi được giới thiệu lần đầu trong bài báo “Attention Is All You Need” (Vaswani et al., 2017) và vẫn là nền tảng cho các phiên bản mới như Transformer‑XL, Longformer, Switch‑Transformer (2023‑2025) được AWS hỗ trợ qua SageMaker và Bedrock.
🧩 Phân tích các phương án khác (sai)
-
Transformer-based language models use convolutional layers to apply filters across an input to capture local patterns through filtered views.
- Giải thích: Các mô hình convolutional neural networks (CNN) mới dùng các lớp convolution để “lọc” các mẫu cục bộ, thường gặp trong xử lý ảnh hoặc một số mô hình NLP cổ (ví dụ: CharCNN). Transformer không có lớp convolution; thay vào đó dùng self‑attention và feed‑forward layers. Do đó mô tả này không phản ánh kiến trúc thực tế của Transformer.
-
Transformer-based language models can process only text data.
- Giải thích: Ban đầu Transformer được giới thiệu cho text, nhưng từ 2020 trở đi đã mở rộng sang multimodal (Vision‑Transformer, CLIP, DALL·E, Whisper). Trên AWS, các mô hình như Amazon Bedrock’s Titan Multimodal hoặc SageMaker JumpStart cung cấp Transformer cho hình ảnh, âm thanh và video. Vì vậy khẳng định “chỉ xử lý văn bản” là không đúng.
-
Transformer-based language models process data sequences one element at a time in cyclic iterations.
- Giải thích: Đây là mô tả của recurrent neural networks (RNN) hoặc LSTM, nơi dữ liệu được xử lý tuần tự và phụ thuộc vào trạng thái trước. Transformer không xử lý tuần tự; nó thực hiện parallel processing trên toàn bộ chuỗi nhờ self‑attention, giảm thời gian đào tạo và cho phép mô hình học quan hệ dài hạn.
🛠️ Kiến thức cập nhật tới năm 2026
- Long‑Context Transformers (Longformer, BigBird, FlashAttention) đã cải thiện khả năng xử lý chuỗi lên tới hàng trăm nghìn token, vẫn dựa trên self‑attention nhưng tối ưu hoá tính toán.
- Sparse & Mixture‑of‑Experts (MoE) (Switch‑Transformer, GLaM) được triển khai trên Amazon SageMaker để giảm chi phí training mà vẫn duy trì hiệu năng.
- Multimodal Transformers (e.g., Flamingo, CoCa) được tích hợp trong Amazon Bedrock để hỗ trợ các tác vụ kết hợp văn bản‑hình ảnh‑âm thanh.
📚 Tham khảo
- Vaswani, A. et al., “Attention Is All You Need”, 2017 – Bài báo gốc giới thiệu Transformer và self‑attention.
- AWS Documentation – Amazon SageMaker JumpStart, phiên bản 2026‑03 – Hướng dẫn sử dụng các mô hình Transformer đa dạng.
- AWS Blog – “Introducing Amazon Bedrock’s new multimodal and long‑context models”, 2025‑11.
- Brown, T. et al., “Language Models are Few‑Shot Learners”, 2020 – Mô tả GPT‑3, minh hoạ sức mạnh của self‑attention.
Tóm lại: Đáp án đúng là “Transformer‑based language models use self‑attention mechanisms to capture contextual relationships.” vì self‑attention là yếu tố quyết định cho khả năng nắm bắt ngữ cảnh dài và đa dạng, trong khi các phương án còn lại mô tả sai kiến trúc hoặc phạm vi ứng dụng của Transformer. 🎯
Which compliance laws should the company review?
- A Local health data protection laws
- B Local payment card data protection laws
- C Local education privacy laws
- D Local algorithm accountability laws
Xem giải thích
🔍 Phân tích câu hỏi
Công ty tài chính đang dùng hệ thống AI để tính điểm tín dụng của khách hàng trong quy trình cho vay. Khi mở rộng sang thị trường mới ở khu vực địa lý khác, họ phải chắc chắn rằng hoạt động của mình đáp ứng các quy định pháp luật địa phương.
Câu hỏi hỏi: “Which compliance laws should the company review?”
Vì trọng tâm là AI tính điểm tín dụng → liên quan tới độ tin cậy, minh bạch, trách nhiệm của thuật toán (algorithmic accountability). Do đó, công ty cần xem xét các luật địa phương về trách nhiệm/giám sát thuật toán.
✅ Đáp án đúng
- Local algorithm accountability laws
Giải thích
- Các luật về trách nhiệm thuật toán (algorithmic accountability) quy định cách doanh nghiệp phải giải thích, kiểm tra, và chứng minh tính công bằng, không phân biệt đối xử và độ chính xác của mô hình AI khi đưa ra quyết định tài chính như điểm tín dụng.
- Khi mở rộng ra khu vực mới, các khu vực này có thể có EU AI Act, US AI‑risk‑based regulations (ví dụ: Illinois Artificial Intelligence Video Interview Act, New York AI Law), Singapore Model AI Governance Framework, hoặc các quy định quốc gia về trách nhiệm AI trong tài chính.
- Do vậy, việc rà soát Local algorithm accountability laws là cần thiết nhất để tránh rủi ro pháp lý (ví dụ: phạt vì quyết định tín dụng tự động không minh bạch).
❌ Các phương án sai và lý do
-
Local health data protection laws
- Luật bảo vệ dữ liệu y tế (HIPAA, GDPR‑Health, v.v.) chỉ áp dụng khi xử lý thông tin y tế cá nhân. Ở đây công ty chỉ làm việc với dữ liệu tài chính và hành vi tín dụng, không liên quan tới thông tin sức khỏe, nên không cần xem xét các luật này.
-
Local payment card data protection laws
- Các luật bảo vệ dữ liệu thẻ thanh toán (PCI‑DSS, PCI‑CSA) quy định bảo mật dữ liệu thẻ khi lưu trữ, truyền tải. Công ty đang tính điểm tín dụng, không phải xử lý hoặc lưu trữ số thẻ; do đó, các yêu cầu PCI‑DSS không phải là ưu tiên chính khi xem xét mở rộng địa lý.
-
Local education privacy laws
- Luật bảo mật dữ liệu giáo dục (FERPA, GDPR‑Education, v.v.) chỉ áp dụng cho dữ liệu sinh viên, học viên. Các dữ liệu tín dụng không thuộc phạm vi giáo dục, nên luật này không liên quan.
🛠️ Các công cụ AWS hỗ trợ tuân thủ “Algorithmic Accountability”
- AWS Artifact – cung cấp báo cáo tuân thủ (SOC, ISO, PCI, GDPR…) và đánh giá luật địa phương.
- Amazon SageMaker Clarify – giúp phát hiện bias và giải thích mô hình AI, hỗ trợ đáp ứng yêu cầu minh bạch của luật AI.
- AWS Config + AWS Config Rules – giám sát cấu hình tài nguyên để đảm bảo môi trường đáp ứng các tiêu chuẩn bảo mật và tuân thủ.
- AWS Audit Manager – tự động thu thập bằng chứng cho các kiểm toán liên quan đến AI và tài chính.
- AWS Security Hub – tập hợp các phát hiện bảo mật và tuân thủ, bao gồm các đánh giá liên quan tới AI/ML.
📚 Tham khảo (2026)
- EU AI Act (Regulation on Artificial Intelligence) – https://eur-lex.europa.eu
- U.S. State AI Laws Overview – National Conference of State Legislatures (NCSL), 2025 update.
- AWS Artifact Documentation – https://docs.aws.amazon.com/artifact/latest/ug/
- Amazon SageMaker Clarify – https://docs.aws.amazon.com/sagemaker/latest/dg/clarify.html
- PCI DSS v4.0 – https://www.pcisecuritystandards.org
Tóm lại: Khi công ty tài chính mở rộng sang khu vực mới và sử dụng AI để xác định điểm tín dụng, luật địa phương về trách nhiệm/giám sát thuật toán (Local algorithm accountability laws) là yếu tố quan trọng nhất cần xem xét. Các luật về sức khỏe, thẻ thanh toán và giáo dục không liên quan tới trường hợp này. 🚀
Which content categories can the guardrails filter? (Choose two.)
- A Hate
- B Politics
- C Violence
- D Gambling
- E Religion
Xem giải thích
🔎 Phân tích câu hỏi
Câu hỏi yêu cầu xác định hai nội dung (content categories) mà Amazon Bedrock Guardrails có khả năng phát hiện và lọc khi người dùng nhập dữ liệu hoặc mô hình tạo ra kết quả.
Guardrails là tính năng bảo vệ nội dung được tích hợp sẵn trong Amazon Bedrock, cho phép bạn bật các content filters (bộ lọc nội dung) dựa trên các danh mục chuẩn do AWS định nghĩa.
✅ Đáp án đúng
- Hate
- Violence
Hai danh mục này là một trong những pre‑built content filters hiện có trong Guardrails (theo tài liệu AWS cập nhật đến năm 2026). Khi bật Guardrails, bạn có thể cấu hình để tự động chặn hoặc gắn nhãn các đầu vào/đầu ra chứa ngôn ngữ thù địch, kì thị (Hate) hoặc miêu tả bạo lực, hành vi nguy hiểm (Violence).
📖 Giải thích chi tiết từng phương án
-
Hate
✅ Đúng – Guardrails cung cấp bộ lọc “Harassment & Hate”. Nó phát hiện các từ ngữ, cụm từ hoặc ngữ cảnh chứa thù hận, kì thị dựa trên chủng tộc, giới tính, tôn giáo, quốc tịch, v.v. -
Politics
❌ Sai – Mặc dù Guardrails có một filter “Political Persuasion”, nó không được liệt kê dưới dạng “Politics”. “Politics” (chính trị chung) không phải là một danh mục lọc độc lập trong phiên bản hiện tại của Guardrails; chỉ có “Political Persuasion” (cố gắng ảnh hưởng quan điểm chính trị) được hỗ trợ. -
Violence
✅ Đúng – Guardrails bao gồm bộ lọc “Violence”. Nội dung mô tả hành vi bạo lực, khủng bố, hoặc các hình ảnh/đoạn văn có tính chất nguy hiểm sẽ bị phát hiện và có thể bị chặn. -
Gambling
❌ Sai – Tính năng Guardrails không có danh mục “Gambling”. Các nội dung liên quan tới cờ bạc, trò chơi có thưởng không nằm trong các bộ lọc chuẩn của Guardrails (có thể được xử lý bằng custom guardrails do người dùng tự định nghĩa, nhưng không phải là một danh mục mặc định). -
Religion
❌ Sai – Mặc dù “Harassment & Hate” có thể bao gồm ngôn ngữ thù địch dựa trên tôn giáo, Religion không phải là một danh mục lọc độc lập trong Guardrails. Nếu muốn lọc nội dung tôn giáo nhạy cảm, cần tạo custom guardrails hoặc dùng các luật tùy chỉnh.
📚 Tham khảo tài liệu
-
AWS Documentation – Amazon Bedrock Guardrails (phiên bản 2026‑03)
- https://docs.aws.amazon.com/bedrock/latest/userguide/guardrails.html
- Mô tả các bộ lọc nội dung mặc định: Harassment & Hate, Violence, Sexual & Nudity, Self‑harm, Illicit behavior, Political Persuasion.
-
AWS Blog – Introducing Amazon Bedrock Guardrails (cập nhật 2024‑11)
-
AWS re:Invent 2025 – Deep dive into Bedrock Guardrails (video và slide)
🧩 Tổng kết
- Đáp án đúng: Hate và Violence.
- Các lựa chọn còn lại (Politics, Gambling, Religion) không phải là danh mục lọc mặc định trong Guardrails, vì vậy chúng được đánh dấu là sai.
Hy vọng phần phân tích chi tiết này giúp bạn nắm vững cách Guardrails hoạt động và lựa chọn đáp án một cách tự tin! 🚀
- A Prompt engineering does not ensure that the model always produces consistent and deterministic outputs, eliminating the need for validation.
- B Prompt engineering could expose the model to vulnerabilities such as prompt injection attacks.
- C Properly designed prompts reduce but do not eliminate the risk of data poisoning or model hijacking.
- D Prompt engineering does not ensure that the model will consistently generate highly reliable outputs when working with real-world data.
Xem giải thích
🔎 Phân tích câu hỏi
Câu hỏi yêu cầu xác định kịch bản mô tả một rủi ro và giới hạn thực tế của “prompt engineering” (kỹ thuật thiết kế lời nhắc) khi làm việc với mô hình AI sinh (generative AI).
Prompt engineering giúp chúng ta “định hướng” mô hình tạo ra kết quả mong muốn, nhưng nó không phải là một biện pháp bảo mật hay chất lượng tuyệt đối. Do đó, câu trả lời đúng phải nêu ra một rủi ro thực tiễn (ví dụ: tấn công, mất tính nhất quán, độ tin cậy) mà việc chỉ thay đổi lời nhắc không thể loại bỏ.
✅ Đáp án đúng
Prompt engineering could expose the model to vulnerabilities such as prompt injection attacks.
Giải thích:
- Prompt injection là kỹ thuật kẻ tấn công chèn nội dung độc hại vào lời nhắc (prompt) để làm mô hình thực hiện hành động không mong muốn, ví dụ: trả về thông tin nhạy cảm, thực thi lệnh, hoặc tạo nội dung sai lệch.
- Khi người dùng hoặc hệ thống tự động tạo và thay đổi lời nhắc, kẻ tấn công có thể lợi dụng việc “điều khiển” prompt để chèn mã lệnh hoặc thông tin nhạy cảm.
- Đây là rủi ro thực tế đã được ghi nhận trong các dịch vụ AI của AWS (Amazon Bedrock, Amazon SageMaker JumpStart) và trong tài liệu bảo mật AI chung (ví dụ: AWS Security Blog – Guardrails for Generative AI, 2025).
- Prompt engineering không cung cấp cơ chế kiểm tra hoặc ngăn chặn những lời nhắc độc hại; do vậy, cần bổ sung các guardrails (rào cản bảo mật), hệ thống lọc, và kiểm tra đầu ra để giảm thiểu.
❌ Các phương án còn lại (sai) và lý do
-
Prompt engineering does not ensure that the model always produces consistent and deterministic outputs, eliminating the need for validation.
- Giải thích: Câu này khẳng định rằng vì prompt engineering không đảm bảo tính nhất quán nên “không cần validation” – điều này ngược lại với thực tế. Khi mô hình không deterministic, cần có quy trình xác thực (validation) để kiểm tra đầu ra, chứ không phải bỏ qua. Vì vậy, mô tả này không phản ánh một “rủi ro” cụ thể mà chỉ nói về một hạn chế mà không đề cập tới biện pháp cần thiết.
-
Properly designed prompts reduce but do not eliminate the risk of data poisoning or model hijacking.
- Giải thích: Phát biểu này đúng về thực tế (prompt tốt có thể giảm rủi ro, nhưng không thể loại bỏ hoàn toàn). Tuy nhiên, đây không phải là mô tả “rủi ro và giới hạn” mà là một nhận xét chung về mức độ giảm rủi ro. Câu hỏi yêu cầu một kịch bản rủi ro cụ thể; vì vậy phương án này không phù hợp.
-
Prompt engineering does not ensure that the model will consistently generate highly reliable outputs when working with real‑world data.
- Giải thích: Tương tự như phương án đầu tiên, đây chỉ là một giới hạn (không đảm bảo độ tin cậy), nhưng không nêu ra rủi ro cụ thể (ví dụ: lộ thông tin, tấn công). Ngoài ra, câu này còn mâu thuẫn vì việc không có tính nhất quán thực tế đòi hỏi validation, không phải “không cần”. Vì vậy, đây không phải đáp án đúng.
📚 Tham khảo (đến năm 2026)
- AWS Security Blog – “Guardrails for Generative AI” (2025) – mô tả các kỹ thuật phòng ngừa prompt injection và các biện pháp bảo vệ đầu ra.
- Amazon Bedrock Documentation – “Prompt Guardrails” (phiên bản cập nhật 2026) – hướng dẫn cấu hình chính sách để lọc nội dung và phát hiện injection.
- NIST AI Risk Management Framework (2024) – đề cập đến “prompt injection” như một trong các mối đe dọa quan trọng cho các hệ thống AI sinh.
- Paper: “Adversarial Prompt Injection Attacks on Large Language Models”, Proceedings of the 2025 IEEE Security & Privacy Workshops – phân tích chi tiết cách tấn công và biện pháp giảm thiểu.
🛠️ Kết luận
- Prompt engineering là công cụ mạnh mẽ để điều hướng mô hình AI, nhưng không phải là giải pháp bảo mật.
- Rủi ro quan trọng nhất được nêu trong câu hỏi là prompt injection attacks, có thể khai thác lỗ hổng khi lời nhắc được tạo động hoặc do người dùng cung cấp.
- Để triển khai an toàn trên môi trường AWS (Bedrock, SageMaker, Lambda, v.v.), cần kết hợp các guardrails, IAM policies, và hệ thống kiểm tra đầu ra nhằm giảm thiểu rủi ro này.
✅ Hy vọng phân tích trên giúp bạn nắm rõ nguyên nhân chọn đáp án đúng và hiểu vì sao các lựa chọn khác không phù hợp.