Ngân hàng đề — AWS Certified AI Practitioner

Tìm thấy 623 câu.

Câu 241 Fundamentals of Generative AI

A research-focused AI company is developing a suite of machine learning models for tasks such as classification and content generation. The data science team needs to choose between discriminative and generative models depending on the specific use case. To make the right decision, they need to understand the fundamental differences between these two types of models, particularly in the context of generative AI, and how each model type fits into their project goals.

What is the primary distinction between discriminative models and generative models in the context of generative AI?

  1. A

    Generative models focus on generating new data from learned patterns, whereas discriminative models classify data by distinguishing between different classes

  2. B

    Discriminative models are used to generate new data, while generative models are used only for classification

  3. C

    Discriminative models are only used for text classification, while generative models are only used for image classification

  4. D

    Generative models are trained on labeled data, while discriminative models can be trained on both labeled and unlabeled data

Xem giải thích

Đáp án

A — Mô hình sinh tập trung tạo ra dữ liệu mới từ mẫu hình đã học; mô hình phân biệt phân loại dữ liệu bằng cách phân định giữa các lớp

Vì sao đúng

Hai loại mô hình học hai thứ khác nhau về mặt toán học:

Mô hình sinh (generative) Mô hình phân biệt (discriminative)
Học Phân bố của dữ liệu Ranh giới giữa các lớp
Trả lời "Dữ liệu loại này trông như thế nào?" "Mẫu này thuộc lớp nào?"
Làm được Tạo ra mẫu mới chưa từng có Gán nhãn cho mẫu có sẵn
Ví dụ GPT, Stable Diffusion, GAN, VAE Hồi quy logistic, SVM, cây quyết định

Cách phân biệt gọn: mô hình sinh lấy mẫu được từ những gì nó học, mô hình phân biệt thì không — nó chỉ biết vẽ đường chia.

Đáng lưu ý: mô hình sinh cũng phân loại được (bằng cách so xác suất mẫu thuộc từng phân bố), nhưng chiều ngược lại không đúng.

Vì sao các phương án khác sai

  • B — đảo ngược hai định nghĩa; đây là phương án nhiễu chính.
  • C — phân biệt theo loại dữ liệu (văn bản so với ảnh); sai, cả hai áp dụng cho mọi loại dữ liệu.
  • D — phân biệt theo nhãn dữ liệu; sai, và thực tế còn hơi ngược: mô hình sinh thường huấn luyện trên dữ liệu không nhãn.
Câu 242 Applications of Foundation Models

A media company is planning to leverage AWS for its AI and machine learning projects, and the development team is evaluating both Amazon Bedrock and Amazon SageMaker JumpStart to accelerate their workflows. The team needs to understand the primary differences between these two services, particularly in how they provide access to pre-trained models and offer customization options. This knowledge will help the company choose the right tool for their content generation and optimization tasks.

Which of the following best addresses these requirements?

  1. A

    Amazon SageMaker JumpStart provides foundational models for generative AI applications, whereas Amazon Bedrock offers pre-built solutions and one-click deployment for various machine learning models

  2. B

    Amazon SageMaker JumpStart is designed for building and scaling machine learning models, whereas Amazon Bedrock is used for real-time data analytics

  3. C

    Amazon Bedrock provides foundational models for generative AI applications, whereas Amazon SageMaker JumpStart offers pre-built solutions and one-click deployment for various machine learning models

  4. D

    Amazon Bedrock is designed for building and scaling machine learning models, whereas Amazon SageMaker JumpStart is used for real-time data analytics

Xem giải thích

Đáp án

C — Amazon Bedrock cung cấp Foundation Model cho ứng dụng AI sinh; SageMaker JumpStart cung cấp giải pháp dựng sẵn và triển khai một cú bấm cho nhiều loại mô hình học máy

Vì sao đúng

Hai dịch vụ khác nhau ở phạm vi và mức độ quản lý:

Amazon Bedrock SageMaker JumpStart
Trọng tâm AI sinh — Foundation Model Mọi loại mô hình học máy
Truy cập bằng API được quản lý — không có hạ tầng của bạn Triển khai vào tài khoản của bạn
Bạn quản lý gì Không gì cả Endpoint, loại instance, quy mô
Kèm sẵn Knowledge Bases, Agents, Guardrails Notebook mẫu, giải pháp trọn gói

Với công ty truyền thông trong đề, ranh giới chọn lựa khá rõ: cần nhanh và không quản hạ tầng thì Bedrock; cần kiểm soát sâu hoặc dùng mô hình ngoài danh mục Bedrock thì JumpStart.

Vì sao các phương án khác sai

  • A — đảo ngược hai định nghĩa; đây là phương án nhiễu chính.
  • B và D — cả hai gán cho một trong hai dịch vụ vai trò phân tích dữ liệu thời gian thực; không dịch vụ nào làm việc đó (đó là lĩnh vực của Kinesis hay Managed Service for Apache Flink).
Câu 243 Fundamentals of Generative AI

A technology company is considering using Large Language Models (LLMs) to enhance its AI-driven customer support system. The development team is particularly interested in understanding the nature of LLMs, as this knowledge will help the team make decisions on how to manage the variability of responses and how best to apply the models in customer-facing applications.

Which of the following is correct regarding Large Language Models (LLMs)?

  1. A

    The Large Language Models (LLMs) are discriminative

  2. B

    The Large Language Models (LLMs) are non-deterministic

  3. C

    Foundation Models (FMs) are a class of Large Language Models (LLMs)

  4. D

    The Large Language Models (LLMs) are deterministic

Xem giải thích

Đáp án

*B — LLM là phi tất định (non-deterministic)

Vì sao đúng

Cùng một prompt gửi hai lần có thể cho hai câu trả lời khác nhau, vì mô hình lấy mẫu ngẫu nhiên từ phân bố xác suất của token kế tiếp thay vì luôn chọn token cao nhất.

Với đội xây hệ thống hỗ trợ khách hàng, đây là tính chất phải tính đến ngay từ thiết kế:

  • Không kiểm thử được bằng cách so khớp chuỗi chính xác — phải kiểm theo tiêu chí ngữ nghĩa.
  • Cùng câu hỏi, hai khách nhận hai câu trả lời khác nhau — cần chấp nhận hoặc kiểm soát.
  • Hạ temperature về gần 0 làm kết quả ổn định hơn nhiều, nhưng vẫn không bảo đảm tuyệt đối giống nhau.

Vì sao các phương án khác sai

  • D. LLM là tất định — mâu thuẫn trực tiếp với B, và sai.
  • A. LLM là mô hình phân biệt — sai; LLM là mô hình sinh, nó tạo ra văn bản mới chứ không chỉ phân loại.
  • C. Foundation Model là một lớp của LLM — đảo ngược quan hệ bao hàm. Đúng phải là LLM là một lớp của Foundation Model: FM là khái niệm rộng gồm cả mô hình sinh ảnh và mô hình đa phương thức, còn LLM là nhánh chuyên về ngôn ngữ.
Câu 244 Guidelines for Responsible AI

A global e-commerce company is utilizing a foundation model through Amazon Bedrock to enhance its customer service chatbot, providing automated support and answering user queries. However, the company is concerned about the potential for the model to generate inappropriate, sensitive, or malicious content that could harm its reputation or negatively impact customer experience. To mitigate these risks, the company seeks to implement safety measures that ensure the model consistently produces safe, relevant, and context-appropriate responses.

Given this goal, what would be the most effective approach to control these risks and maintain model safety?

  1. A

    The company should develop an API that processes all responses from the model and checks for any risks of exposure, which involves creating a custom layer that monitors and filters all model outputs, scanning them for inappropriate or unsafe content before they are delivered to the end-user

  2. B

    The company should instruct the model to stick to the prompt by adding explicit instructions to ignore any unrelated or potentially malicious content

  3. C

    The company should adjust the model hyperparameters to safeguard the output

  4. D

    The company should retrain the underlying foundation model (FM) from scratch to prevent exposure

Xem giải thích

Đáp án

B — Chỉ dẫn mô hình bám sát prompt, thêm hướng dẫn tường minh yêu cầu bỏ qua mọi nội dung không liên quan hoặc có ý đồ xấu

Vì sao đúng

Trong bốn phương án, đây là biện pháp hiệu quả nhất so với công bỏ ra: chỉ cần viết thêm chỉ dẫn vào system prompt, có tác dụng ngay, không tốn hạ tầng và sửa lại dễ.

Cách viết thường dùng: khai rõ phạm vi được phép ("chỉ trả lời câu hỏi về sản phẩm và đơn hàng"), nói trước cách phản ứng khi gặp yêu cầu ngoài phạm vi, và tách bạch chỉ dẫn hệ thống với nội dung người dùng để chống tiêm prompt.

Vì sao các phương án khác sai

  • A. Tự xây một lớp API lọc mọi đầu ra — về nguyên tắc thì đây là biện pháp mạnh hơn, nhưng nó đòi bạn tự viết và tự duy trì bộ lọc, tự cập nhật khi kiểu tấn công mới xuất hiện. Đề hỏi cách hiệu quả nhất, và tự dựng lại hạ tầng an toàn là chọn đường dài nhất.
  • C. Chỉnh siêu tham số của mô hình — temperature và các tham số suy luận đổi độ ngẫu nhiên, không quyết định được nội dung nào là phù hợp.
  • D. Huấn luyện lại Foundation Model từ đầu — tốn hàng triệu đô la, mất hàng tháng, và vẫn không bảo đảm chặn được mọi đầu vào ác ý.

Ghi chú thực hành

Ngoài đời, câu trả lời đúng nhất cho bài toán này là Guardrails for Amazon Bedrock — nó lọc nội dung, chặn chủ đề và che thông tin cá nhân ở cả đầu vào lẫn đầu ra, mà không cần bạn tự viết gì. Guardrails không có trong bốn phương án, nhưng nếu gặp nó trong một câu khác thì đó mới là lựa chọn đúng.

Câu 245 Applications of Foundation Models

Which type of Machine Learning algorithm is used by the models that are trained, evaluated, and tuned on AWS DeepRacer?

  1. A

    Semi-supervised Learning

  2. B

    Unsupervised Learning

  3. C

    Deep Learning

  4. D

    Reinforcement Learning

Xem giải thích

Đáp án

D — Reinforcement Learning (học tăng cường)

Vì sao đúng

AWS DeepRacer là nền tảng dạy học tăng cường, và mọi thành phần của nó đều là thành phần của một bài toán học tăng cường:

Khái niệm Trong DeepRacer
Tác nhân (agent) Chiếc xe
Môi trường Đường đua
Hành động Góc lái và tốc độ
Trạng thái Ảnh từ camera của xe
Hàm phần thưởng Bạn tự viết — ví dụ thưởng khi bám giữa làn

Điểm cốt lõi: không ai gán nhãn "ở khúc cua này phải lái 15 độ". Xe chạy thử hàng nghìn lượt trong mô phỏng, nhận thưởng hoặc phạt, và dần học ra chính sách lái tốt.

Việc tự viết hàm phần thưởng cũng là bài học chính của DeepRacer: nó cho thấy thiết kế phần thưởng khó thế nào, và phần thưởng đặt sai dẫn tới hành vi kỳ quặc ra sao.

Vì sao các phương án khác sai

  • B. Học không giám sát — tìm cấu trúc trong dữ liệu không nhãn; không có khái niệm hành động hay phần thưởng.
  • A. Học bán giám sát — kết hợp ít nhãn với nhiều dữ liệu không nhãn; vẫn là bài toán dự đoán.
  • C. Học sâu — là kỹ thuật (mạng nơ-ron nhiều tầng), không phải một loại học. DeepRacer có dùng mạng nơ-ron để biểu diễn chính sách, nhưng khung học vẫn là học tăng cường.
Câu 246 Applications of Foundation Models

A company is creating a custom search solution that will bring together the company's data repositories, FAQs, and support tickets. The support tickets might contain personally identifiable information (PII) that needs to be redacted before the tickets are processed to create the search indexes.

Which AWS service will help you redact the PII in support tickets?

  1. A

    Amazon Textract

  2. B

    Amazon Kendra

  3. C

    Amazon Lex

  4. D

    Amazon Comprehend

Xem giải thích

Đáp án

D — Amazon Comprehend

Vì sao đúng

Comprehend có API riêng để nhận diện và che thông tin định danh cá nhân (PII) trong văn bản. Nó nhận ra hàng chục loại thực thể nhạy cảm — tên, địa chỉ, email, số điện thoại, số thẻ tín dụng, số tài khoản — và cho phép thay thế bằng nhãn thay vì xoá trắng:

Trước:  "Khách hàng Nguyễn Văn A, số thẻ 4532-1234-5678-9010, gọi từ 0912345678"
Sau:    "Khách hàng [NAME], số thẻ [CREDIT_DEBIT_NUMBER], gọi từ [PHONE]"

Giữ lại nhãn quan trọng hơn nhiều người nghĩ: câu vẫn còn cấu trúc nên vẫn đánh chỉ mục tìm kiếm được, đúng nhu cầu của đề.

Comprehend cũng chạy được ở chế độ đồng bộ cho từng phiếu hoặc chế độ theo lô cho cả kho phiếu cũ.

Vì sao các phương án khác sai

  • B. Amazon Kendra — là đích đến: nó tạo chỉ mục tìm kiếm. Nhưng nó không che PII, nên phải làm sạch trước khi đưa vào. Đây là bẫy vì Kendra chính là dịch vụ dựng giải pháp tìm kiếm mà đề nhắc tới.
  • A. Amazon Textract — trích chữ từ tài liệu quét; phiếu hỗ trợ đã là chữ rồi.
  • C. Amazon Lex — xây giao diện hội thoại.
Câu 247 Fundamentals of AI and ML

A retail company is developing a machine learning model to improve its customer segmentation and targeting strategies. The data science team is working with both labeled and unlabeled customer data to train their models but needs to clearly understand the distinction between these two types of data to decide how best to use them. Understanding this difference is critical for selecting the appropriate machine learning techniques, such as supervised or unsupervised learning, for different stages of the project.

What is a key difference between labeled data and unlabeled data in the context of machine learning?

  1. A

    Labeled data is inherently more complex to process due to the lack of structure, whereas unlabeled data is easier to handle because it has clear annotations

  2. B

    Labeled data consists of raw information with no tags or annotations, while unlabeled data includes tags that provide meaning to the data

  3. C

    Labeled data is annotated with output labels that provide specific information about each data point and is used for supervised learning, whereas, unlabeled data lacks such annotations and is used for unsupervised learning

  4. D

    Labeled data can only be used for unsupervised learning algorithms, whereas, unlabeled data is exclusively for supervised learning algorithms

Xem giải thích

Đáp án

*C — Dữ liệu có nhãn được gắn nhãn đầu ra mô tả từng điểm dữ liệu và dùng cho học có giám sát; dữ liệu không nhãn thiếu chú thích đó và dùng cho học không giám sát

Vì sao đúng

Định nghĩa này nêu đủ cả bản chất lẫn công dụng của mỗi loại:

Dữ liệu có nhãn Dữ liệu không nhãn
Là gì Dữ liệu kèm đáp án đúng Dữ liệu thô, không chú thích
Ví dụ bán lẻ Hồ sơ khách kèm nhãn "đã rời bỏ" hoặc "còn dùng" Toàn bộ nhật ký giao dịch, chưa phân loại
Dùng cho Học có giám sát — dự đoán, phân loại Học không giám sát — phân cụm, phát hiện bất thường
Chi phí Đắt — cần người gán Rẻ — đã có sẵn
Lượng thực tế Ít Rất nhiều

Hai dòng cuối giải thích tình huống trong đề: công ty có cả hai loại, nên cách làm hợp lý là dùng dữ liệu không nhãn để phân cụm khách hàng trước, rồi dùng phần có nhãn để huấn luyện mô hình dự đoán cho từng nhóm.

Vì sao các phương án khác sai

  • B — đảo ngược hai định nghĩa; đây là phương án nhiễu chính.
  • D — cũng đảo ngược, ở phần công dụng: gán dữ liệu có nhãn cho học không giám sát.
  • A — nói dữ liệu có nhãn khó xử lý hơn vì thiếu cấu trúc; mâu thuẫn nội tại, có nhãn nghĩa là có thêm cấu trúc.
Câu 248 Applications of Foundation Models

A media company is deploying machine learning models using Amazon SageMaker to generate personalized content recommendations. Since the company has intermittent workloads and it does not want to configure or manage the underlying infrastructure, the development team is evaluating different deployment models that offer cost savings by allowing for cold starts. Understanding which deployment model suits this use case will help them balance cost efficiency with operational needs.

What do you suggest?

  1. A

    Serverless Inference

  2. B

    Real-time hosting services

  3. C

    Asynchronous Inference

  4. D

    Batch transform

Xem giải thích

Đáp án

A — Serverless Inference

Vì sao đúng

Ba dấu hiệu trong đề trỏ thẳng vào serverless inference: tải rời rạc, không đều, không muốn cấu hình hay quản lý hạ tầng, và — đặc biệt — chấp nhận khởi động nguội để đổi lấy tiết kiệm chi phí.

Vế cuối là chữ ký nhận dạng. Serverless inference tự co về 0 khi không có yêu cầu nào, nên giữa các đợt bạn không trả tiền. Cái giá phải trả là yêu cầu đầu tiên sau một khoảng im lặng sẽ chậm hơn vì phải khởi tạo lại — chính là cold start.

Không có kiểu suy luận nào khác của SageMaker được mô tả bằng cụm từ đó, nên chỉ cần thấy "cold start" là biết đáp án.

Vì sao các phương án khác sai

  • B. Real-time hosting services — endpoint chạy thường trực, nên không có cold start và cũng không có tiết kiệm khi nhàn rỗi; bạn trả tiền 24/7.
  • C. Asynchronous Inference — cũng co về 0 được, nhưng nó dựng cho payload lớn tới 1 GB và xử lý lâu; đề không nói gì về payload lớn, chỉ nói tải thất thường.
  • D. Batch transform — xử lý cả tập dữ liệu theo job, không phục vụ gợi ý cá nhân hoá theo yêu cầu.
Câu 249 Fundamentals of Generative AI

A healthcare analytics company is developing machine learning models to predict patient outcomes and improve treatment plans. To enhance these models, conduct rigorous testing, and ensure data privacy when sharing with partners, the company needs to generate synthetic data that closely mirrors its existing patient records without compromising sensitive information. The synthetic data must maintain the statistical properties and patterns of the original dataset to be useful for model training and evaluation.

Which of the following methods would be most suitable for generating synthetic data?

  1. A

    The company should use Support Vector Machines (SVMs), a type of supervised learning algorithm used for generating synthetic data

  2. B

    The company should use a Convolutional Neural Network (CNN), a type of deep learning model, best-suited for generating synthetic data

  3. C

    The company should use a Generative Adversarial Network (GAN) for creating realistic synthetic data while preserving the statistical properties of the original data

  4. D

    The company should use WaveNet, a deep generative model specifically designed for generating general-purpose synthetic data across various domains

Xem giải thích

Đáp án

C — Generative Adversarial Network (GAN)

Vì sao đúng

GAN sinh dữ liệu tổng hợp bằng cách cho hai mạng nơ-ron cạnh tranh nhau:

Generator  ──tạo dữ liệu giả──▶  Discriminator  ──phán "thật hay giả"──┐
     ▲                                                                  │
     └──────────────── học từ việc bị bắt bài ────────────────────────┘

Vòng lặp này chạy tới khi discriminator không phân biệt nổi — và đó chính là lúc dữ liệu giả đã giữ được đặc tính thống kê của dữ liệu thật, đúng yêu cầu của đề.

Với hồ sơ bệnh án, giá trị nằm ở chỗ dữ liệu tổng hợp không tương ứng với bệnh nhân có thật nào, nên chia sẻ cho đối tác nghiên cứu được mà không lộ thông tin cá nhân, trong khi vẫn dùng để huấn luyện và kiểm thử mô hình.

Vì sao các phương án khác sai

  • B. CNN — mạng phân biệt dùng cho phân loại ảnh; nó không sinh ra dữ liệu.
  • A. SVM — thuật toán học có giám sát tìm ranh giới phân lớp; cũng không sinh dữ liệu. Mô tả trong phương án gọi nó là "thuật toán dùng để sinh dữ liệu tổng hợp" là sai hoàn toàn.
  • D. WaveNet — đúng là mô hình sinh, nhưng chuyên cho âm thanh và giọng nói; câu mô tả "dùng cho dữ liệu tổng hợp đa mục đích ở mọi lĩnh vực" là phóng đại. Đây là phương án nhiễu tinh vi nhất vì nửa đầu đúng.

Lưu ý

Ngoài GAN, VAE và mô hình diffusion cũng sinh được dữ liệu tổng hợp. GAN là câu trả lời trong bốn phương án này, nhưng đừng nhớ nó như lựa chọn duy nhất.

Câu 250 Applications of Foundation Models

A software development company is evaluating Amazon Q Developer to enhance its application development process by leveraging AI-driven tools for automation, code generation, and workflow optimization. The company is looking to understand the key features and capabilities of Amazon Q Developer. Gaining clarity on its core functionalities will help the company decide if it aligns with their development needs.

What would you suggest to the company regarding the capabilities of Amazon Q Developer?

  1. A

    Amazon Q Developer can only be used in the integrated development environments (IDEs)

  2. B

    Amazon Q Developer can be used in integrated development environments (IDEs) as well as the AWS Management Console

  3. C

    Amazon Q Developer can neither be used in the integrated development environments (IDEs) nor the AWS Management Console

  4. D

    Amazon Q Developer can only be used in the AWS Management Console

Xem giải thích

Đáp án

*B — Amazon Q Developer dùng được cả trong IDE lẫn trong AWS Management Console

Vì sao đúng

Q Developer có mặt ở nhiều nơi trong quy trình làm việc, và hai nơi chính là:

  • Trong IDE (VS Code, JetBrains, Visual Studio) — gợi ý mã theo ngữ cảnh, sinh unit test, giải thích đoạn mã, rà lỗi bảo mật, nâng cấp phiên bản ngôn ngữ.
  • Trong AWS Management Console — trả lời câu hỏi về dịch vụ AWS, giải thích tài nguyên đang có trong tài khoản, hỗ trợ chẩn đoán lỗi ngay tại trang console.

Nó còn xuất hiện trong AWS CLI, Slack và Microsoft Teams qua AWS Chatbot — nhưng hai nơi trên là phần câu hỏi kiểm tra.

Ý nghĩa của việc có mặt ở cả hai: lập trình viên không phải rời chỗ đang làm để đi tra cứu.

Vì sao các phương án khác sai

  • A. Chỉ dùng được trong IDE và D. Chỉ dùng được trong Console — mỗi câu bỏ sót một nửa.
  • C. Không dùng được ở cả hai — sai hoàn toàn.