Ngân hàng đề — AWS Certified AI Practitioner

Tìm thấy 623 câu.

Câu 141 Fundamentals of AI and ML

A research lab is exploring various generative AI models for its project on creating realistic images and data simulations. The lab is particularly interested in diffusion models but needs a clear understanding of how these models work. Gaining insights into the mechanism behind diffusion models will help the lab decide whether this approach is suitable for their data generation needs.

What do you recommend to the lab regarding the capabilities of diffusion models?

  1. A

    Diffusion models work by training two neural networks in a competitive manner

  2. B

    Diffusion models are a type of transformer-based models that use a self-attention mechanism

  3. C

    Diffusion models work by learning a compact representation of data called latent space

  4. D

    Diffusion models create new data by iteratively making controlled random changes to an initial data sample

Xem giải thích

Đáp án

D — Tạo dữ liệu mới bằng cách lặp đi lặp lại việc thay đổi ngẫu nhiên có kiểm soát trên một mẫu ban đầu

Vì sao đúng

Diffusion model hoạt động theo hai chiều, và tên gọi "khuếch tán" đến từ chiều thứ nhất:

Huấn luyện (chiều xuôi):  ảnh thật ──thêm nhiễu dần──▶ nhiễu hoàn toàn
                          (mô hình học cách nhận ra nhiễu đã thêm ở mỗi bước)

Sinh ảnh (chiều ngược):   nhiễu ngẫu nhiên ──khử nhiễu dần──▶ ảnh mới

Điểm quan trọng là lặp nhiều bước: mỗi bước chỉ gỡ đi một phần nhiễu, và qua vài chục bước thì một bức ảnh mạch lạc hiện ra. Đó cũng là lý do sinh ảnh bằng diffusion chậm hơn so với các kiến trúc một lượt.

Đây là kiến trúc đứng sau Stable Diffusion, DALL-E và Midjourney.

Vì sao các phương án khác sai

Ba phương án còn lại mô tả các kiến trúc sinh khác:

  • A. Huấn luyện hai mạng nơ-ron cạnh tranh nhau — GAN. Đây là phương án nhiễu chính vì GAN cũng sinh ảnh.
  • C. Học biểu diễn nén gọi là không gian tiềm ẩn — Autoencoder / VAE.
  • B. Dựa trên Transformer với cơ chế self-attention — Transformer, chủ yếu dùng cho văn bản.
Câu 142 Guidelines for Responsible AI

You are working as an NLP engineer at a tech company tasked with building an advanced text summarization tool to help customers generate concise summaries of lengthy documents. After successfully training your model, your manager asks you to evaluate its performance and quality to ensure it meets the required standards for deployment.

Considering the nature of text summarization, which evaluation method would be most appropriate to assess the model's output effectively?

  1. A

    Test the model on established benchmark datasets to evaluate performance

  2. B

    Conduct code review to analyze the implementation code for logical or structural issues

  3. C

    Use automated testing via metrics like ROUGE or BLEU to measure the similarity between generated and reference summaries

  4. D

    Leverage human evaluation to assess the quality of summaries

Xem giải thích

Đáp án

D — Dùng đánh giá của con người để thẩm định chất lượng bản tóm tắt

Vì sao đúng

Chữ khoá của đề là "chất lượng", và với tóm tắt văn bản thì chất lượng gồm những thứ mà chỉ số tự động không đo được:

  • Trung thực với nội dung gốc — bản tóm tắt có bịa thêm chi tiết nào không?
  • Bắt đúng ý chính — nó giữ điều quan trọng hay giữ điều dễ trích?
  • Mạch lạc và dễ đọc — con người có thấy nó tự nhiên không?

Có một lý do sâu hơn: một văn bản có nhiều bản tóm tắt tốt khác nhau. Bản tóm tắt hoàn toàn đúng nhưng dùng từ khác bản tham chiếu sẽ bị chỉ số n-gram chấm điểm thấp, dù người đọc thấy nó tốt hơn.

Vì sao các phương án khác sai

  • C. Dùng ROUGE hoặc BLEU — đây là câu trả lời gần đúng nhất và cần nói rõ: ROUGE là chỉ số tiêu chuẩn của ngành cho tóm tắt văn bản, và trong thực tế bạn nên dùng nó. Nhưng nó chỉ đo mức trùng khớp từ ngữ với bản tham chiếu — nó không phát hiện được một bản tóm tắt trùng khớp cao mà bịa ra sự kiện không có trong bài gốc. Đề hỏi cách đánh giá chất lượng, nên chấm theo con người.
  • A. Chạy trên bộ dữ liệu chuẩn — cũng dựa vào chỉ số tự động, cùng giới hạn.
  • B. Rà soát mã nguồn — kiểm tra phần cài đặt, không nói gì về chất lượng đầu ra.

Ghi chú thực hành

Cách làm đúng ngoài đời là dùng cả hai: chỉ số tự động để theo dõi liên tục và so sánh nhanh giữa các phiên bản, đánh giá của con người trên một mẫu nhỏ để bắt những lỗi mà chỉ số bỏ qua.

Câu 143 Fundamentals of AI and ML

A video streaming company is developing machine learning models to recommend content and analyze user interactions. The data science team needs to understand the specific capabilities of Convolutional Neural Networks (CNNs) and Recurrent Neural Networks (RNNs).

Which of the following would you suggest to the team?

  1. A

    While RNNs are used for single image analysis, CNNs are used for video analysis

  2. B

    Both RNNs and CNNs are used for video analysis

  3. C

    While CNNs are used for single image analysis, RNNs are used for video analysis

  4. D

    Both RNNs and CNNs are used for single image analysis

Xem giải thích

Đáp án

C — CNN dùng cho phân tích ảnh đơn lẻ, RNN dùng cho phân tích video

Vì sao đúng

Khác biệt nằm ở chỗ có cần nhớ thứ tự hay không:

CNN RNN
Mạnh ở Mẫu hình không gian — cạnh, hình dạng, kết cấu Mẫu hình theo thời gian — chuỗi có thứ tự
Có trí nhớ Không Có — trạng thái ẩn mang thông tin từ bước trước
Dữ liệu Ảnh tĩnh Video, văn bản, âm thanh, chuỗi thời gian

Video là chuỗi khung hình, mà ý nghĩa của nó nằm ở quan hệ giữa các khung: một người "đang ngã" hay "đang ngồi xuống" chỉ phân biệt được khi xét thứ tự. RNN giữ được ngữ cảnh đó.

Trên thực tế hai kiến trúc thường ghép với nhau: CNN trích đặc trưng từ từng khung hình, rồi RNN xử lý chuỗi đặc trưng đó theo thời gian.

Vì sao các phương án khác sai

  • A — đảo ngược hai vai trò; đây là phương án nhiễu chính.
  • B và D — gán cả hai cho cùng một loại dữ liệu, xoá mất sự phân biệt mà câu hỏi kiểm tra.
Câu 144 Fundamentals of AI and ML

A healthcare company is using machine learning to analyze patient data and improve diagnostics. The data science team is considering both supervised and unsupervised machine learning approaches to handle different types of data, as understanding the key differences between these two approaches will help the team determine which method is best suited for tasks like disease prediction versus discovering hidden patterns in patient data.

Which of the following would you identify as the key difference between supervised machine learning and unsupervised machine learning?

  1. A

    Supervised machine learning is used only for clustering tasks, whereas unsupervised machine learning is used only for regression tasks

  2. B

    Supervised machine learning focuses on finding patterns in data without any specific guidance, while unsupervised machine learning uses labeled data to make predictions

  3. C

    Supervised machine learning requires labeled data for training, whereas unsupervised machine learning does not use any data for training

  4. D

    Supervised machine learning involves training models with labeled data to make predictions or classify data, whereas unsupervised machine learning identifies patterns and relationships in unlabeled data

Xem giải thích

Đáp án

*D — Học có giám sát huấn luyện trên dữ liệu có nhãn để dự đoán hoặc phân loại; học không giám sát tìm mẫu hình và quan hệ trong dữ liệu không nhãn

Vì sao đúng

Đây là định nghĩa chính xác và đầy đủ của cả hai vế:

Có giám sát Không giám sát
Dữ liệu Có nhãn Không nhãn
Mục tiêu Dự đoán một kết quả đã biết trước Khám phá cấu trúc chưa biết
Câu hỏi "Bệnh nhân này có nguy cơ không?" "Có những nhóm bệnh nhân nào?"
Đánh giá So với nhãn đúng — đo được rõ ràng Khó đo, thường cần chuyên gia xem lại
Ví dụ trong y tế Dự đoán bệnh từ hồ sơ đã chẩn đoán Tìm nhóm bệnh nhân có mẫu hình giống nhau

Hai cột cuối cho thấy chúng bổ sung cho nhau: không giám sát dùng khi bạn chưa biết mình đang tìm gì, còn có giám sát dùng khi đã biết đích.

Vì sao các phương án khác sai

  • B — đảo ngược hai định nghĩa; đây là phương án nhiễu chính.
  • C — nửa đầu đúng, nhưng nói học không giám sát "không dùng dữ liệu nào"; sai — nó dùng rất nhiều dữ liệu, chỉ là dữ liệu không có nhãn.
  • A — nói có giám sát chỉ để phân cụm và không giám sát chỉ để hồi quy; gán ghép sai cả hai.
Câu 145 Guidelines for Responsible AI

In the context of security and privacy for AI systems on AWS, what is the primary difference between threat detection and vulnerability management?

  1. A

    Threat detection focuses on identifying potential weaknesses in the system, while vulnerability management continuously monitors for malicious activities

  2. B

    Threat detection involves real-time monitoring and identification of active threats, whereas vulnerability management is about identifying, assessing, and mitigating security weaknesses

  3. C

    Threat detection and vulnerability management both exclusively focus on compliance with regulatory requirements

  4. D

    Threat detection is concerned with data encryption and access controls, while vulnerability management deals with incident response and recovery

Xem giải thích

Đáp án

*B — Threat detection là giám sát và phát hiện mối đe doạ đang diễn ra theo thời gian thực; vulnerability management là xác định, đánh giá và khắc phục điểm yếu

Vì sao đúng

Hai lĩnh vực khác nhau ở thời điểm và đối tượng:

Threat detection Vulnerability management
Nhìn vào Hành vi đang diễn ra Điểm yếu tiềm tàng
Thời điểm Thời gian thực, liên tục Theo chu kỳ, chủ động
Câu hỏi "Có ai đang tấn công không?" "Chỗ nào có thể bị tấn công?"
Tính chất Phản ứng Phòng ngừa
Dịch vụ AWS GuardDuty, Detective Inspector, Config

Hai việc bổ sung cho nhau và không thay thế nhau: vá hết lỗ hổng đã biết vẫn không chặn được kẻ tấn công dùng thông tin đăng nhập bị lộ; ngược lại, chỉ giám sát mà không vá thì bạn liên tục phát hiện ra những cuộc tấn công lẽ ra đã ngăn được.

Vì sao các phương án khác sai

  • A — đảo ngược hai định nghĩa; đây là phương án nhiễu chính.
  • C — gộp cả hai thành chuyện tuân thủ quy định; tuân thủ là mục đích khác.
  • D — gán threat detection cho mã hoá và kiểm soát truy cập, vulnerability management cho ứng phó sự cố; cả hai đều là lĩnh vực bảo mật riêng.
Câu 146 Fundamentals of Generative AI

A financial services company is exploring the adoption of generative AI to automate report generation and enhance customer service through chatbots. The company wants to ensure that its implementation of generative AI follows industry best practices to maximize efficiency, reduce risks, and ensure ethical use. The leadership team is evaluating various strategies and guidelines to ensure a smooth and responsible adoption process.

Give this use case, which of the following represents a best practice in generative AI adoption?

  1. A

    Implementing guardrails and enhancing transparency for generative AI applications

  2. B

    Disregarding continuous monitoring and updating of AI models after deployment

  3. C

    Prioritizing rapid deployment over the ethical considerations and potential biases in AI models

  4. D

    Using generative AI exclusively for creative applications and avoiding its use in business operations

Xem giải thích

Đáp án

A — Triển khai guardrail và tăng tính minh bạch cho ứng dụng AI sinh

Vì sao đúng

Hai biện pháp này đánh vào hai nhóm rủi ro lớn nhất của AI sinh trong ngành tài chính:

  • Guardrail — chặn nội dung độc hại, che thông tin cá nhân, và ngăn mô hình bàn tới những chủ đề nó không được phép (ví dụ đưa lời khuyên đầu tư cụ thể).
  • Minh bạch — cho khách hàng biết họ đang nói chuyện với AI, dẫn nguồn cho câu trả lời, và có đường chuyển sang người thật khi cần.

Vì sao các phương án khác sai

Ba phương án còn lại đều là thực hành xấu được phát biểu thẳng, và nhận ra chúng cũng là một phần của việc hiểu đúng:

  • B. Bỏ qua việc theo dõi và cập nhật mô hình sau khi triển khai — mô hình xuống cấp theo thời gian khi dữ liệu thay đổi; không theo dõi thì không biết lúc nào nó bắt đầu sai.
  • C. Ưu tiên triển khai nhanh hơn là cân nhắc đạo đức và sai lệch — trong ngành tài chính, một mô hình lệch không chỉ gây hại cho khách hàng mà còn dẫn tới chế tài pháp lý.
  • D. Chỉ dùng AI sinh cho việc sáng tạo, tránh dùng trong vận hành — hạn chế vô cớ; chính hai việc đề nêu (soạn báo cáo, chatbot hỗ trợ) đều là vận hành.
Câu 147 Fundamentals of Generative AI

A company wants to implement safeguards for its generative AI application using Amazon Bedrock. Specifically, the company wants to filter undesirable and harmful content as well as redact any personally identifiable information (PII).

What do you recommend?

  1. A

    Guardrails for Amazon Bedrock

  2. B

    Knowledge Bases for Amazon Bedrock

  3. C

    Continued pretraining in Amazon Bedrock

  4. D

    Watermark detection for Amazon Bedrock

Xem giải thích

Đáp án

A — Guardrails for Amazon Bedrock

Vì sao đúng

Đề nêu đúng hai việc mà Guardrails làm: lọc nội dung không mong muốn và có hại, và che thông tin định danh cá nhân (PII).

Cụ thể Guardrails cung cấp bốn loại rào chắn:

  • Bộ lọc nội dung theo nhóm (thù ghét, lăng mạ, tình dục, bạo lực) với mức nghiêm ngặt điều chỉnh được.
  • Chủ đề bị chặn do bạn tự khai bằng ngôn ngữ tự nhiên.
  • Bộ lọc PII — nhận ra và che số bảo hiểm, số thẻ, email, số điện thoại.
  • Bộ lọc từ ngữ theo danh sách riêng.

Điểm quan trọng về mặt kiến trúc: Guardrails áp cho cả đầu vào lẫn đầu ra, và hoạt động độc lập với mô hình nên đổi mô hình vẫn giữ nguyên chính sách.

Vì sao các phương án khác sai

  • B. Knowledge Bases — cung cấp tri thức từ tài liệu của bạn (RAG); không lọc nội dung.
  • C. Continued pretraining — huấn luyện tiếp mô hình trên dữ liệu lĩnh vực; không phải cơ chế kiểm soát nội dung, và nó không bảo đảm được gì về đầu ra.
  • D. Watermark detection — nhận biết ảnh do Amazon Titan sinh ra.
Câu 148 Fundamentals of Generative AI

A media company is considering using generative AI to automate content creation for articles, videos, and marketing campaigns. The team wants to understand the underlying mechanics of generative AI, particularly how these models are able to create entirely new content or data, such as text, images, and music, based on patterns learned from existing datasets. This understanding will help the company determine how to best integrate generative AI into its creative workflows.

Given this context, how does generative AI create new content or data?

  1. A

    Through traditional programming methods where each outcome is manually coded

  2. B

    By learning patterns from existing data and using algorithms to generate new content that mimics those patterns

  3. C

    By randomly generating content without any reference to existing data

  4. D

    By using pre-defined rules and templates without any learning from existing data

Xem giải thích

Đáp án

B — Học các mẫu hình từ dữ liệu sẵn có rồi dùng thuật toán sinh ra nội dung mới mô phỏng theo các mẫu đó

Vì sao đúng

Định nghĩa này nêu đủ hai bước của quá trình:

  1. Học mẫu hình — mô hình học được phân bố thống kê của dữ liệu huấn luyện: từ nào thường theo sau từ nào, màu sắc và hình khối thường đi cùng nhau ra sao.
  2. Sinh nội dung mới — lấy mẫu từ phân bố đã học, nên kết quả là thứ chưa từng tồn tại nhưng mang đặc điểm giống dữ liệu gốc.

Vế thứ hai cũng giải thích giới hạn: mô hình không sáng tạo từ hư không, chất lượng đầu ra bị chặn bởi phạm vi dữ liệu huấn luyện.

Vì sao các phương án khác sai

  • C. Sinh nội dung hoàn toàn ngẫu nhiên, không tham chiếu dữ liệu nào — nếu vậy thì kết quả là nhiễu vô nghĩa; chính việc học từ dữ liệu làm nó mạch lạc.
  • A. Lập trình truyền thống, mỗi kết quả được viết tay — đó là cách làm mà AI sinh thay thế; không ai viết tay được mọi câu trả lời có thể có.
  • D. Dùng luật và khuôn mẫu định sẵn, không học gì — mô tả hệ thống mẫu (template), thứ chỉ điền chỗ trống chứ không tạo ra nội dung mới.
Câu 149 Fundamentals of AI and ML

A healthcare company is building a machine learning model to predict patient outcomes based on various health indicators. The data science team is exploring different techniques to improve the model’s accuracy by refining the input data, specifically using feature extraction and feature selection. Understanding the key differences between these two approaches will help the team optimize the model’s performance.

What do you suggest to the company?

  1. A

    Feature extraction involves selecting the most relevant features from the dataset, while feature selection involves creating new features from existing data

  2. B

    Feature extraction reduces the number of features by transforming data into a new space, while feature selection reduces the number of features by selecting the most relevant ones from the existing features

  3. C

    Feature extraction and feature selection are both used to remove irrelevant features but do not reduce the dimensionality of the dataset

  4. D

    Feature extraction is only applicable to supervised learning, while feature selection is only applicable to unsupervised learning

Xem giải thích

Đáp án

*B — Feature extraction giảm số đặc trưng bằng cách biến đổi dữ liệu sang không gian mới; feature selection giảm bằng cách chọn ra những đặc trưng liên quan nhất trong số đã có

Vì sao đúng

Cả hai cùng nhằm giảm số chiều, nhưng theo hai cách khác hẳn:

Feature selection Feature extraction
Làm gì Giữ lại một tập con Tạo ra đặc trưng mới từ tổ hợp cũ
Đặc trưng còn lại Vẫn là cột gốc Cột mới, là tổ hợp của nhiều cột gốc
Diễn giải được Có — vẫn là "huyết áp", "tuổi" Khó — "thành phần chính thứ nhất" là gì?
Ví dụ Chọn 20 chỉ số sức khoẻ quan trọng nhất trong 100 PCA nén 100 chỉ số xuống 20 chiều

Với công ty y tế trong đề, đánh đổi này rất đáng cân nhắc: feature selection giữ được khả năng giải thích — bác sĩ hiểu được "mô hình dựa vào huyết áp và tuổi". Sau PCA thì đặc trưng trở thành những tổ hợp toán học không có ý nghĩa lâm sàng nào.

Vì sao các phương án khác sai

  • A — đảo ngược hai định nghĩa; đây là phương án nhiễu chính.
  • C — nói cả hai không giảm số chiều; sai, giảm số chiều chính là mục đích của cả hai.
  • D — nói mỗi cái chỉ áp dụng cho một kiểu học; sai, cả hai dùng được ở cả có giám sát lẫn không giám sát.
Câu 150 Fundamentals of AI and ML

A technology company is developing a machine learning model to automatically categorize images for its e-commerce platform, which includes tasks like identifying products in photos uploaded by users. The data science team is exploring various types of neural networks and needs to choose the most effective one for image classification. Understanding which neural network architecture is best suited for handling the complexities of image data will help the team ensure accurate and efficient classification.

What do you recommend for the given use case?

  1. A

    Convolutional Neural Networks (CNNs)

  2. B

    Generative Adversarial Networks (GANs)

  3. C

    Retrieval-Augmented Generation (RAG)

  4. D

    Recurrent Neural Networks (RNNs)

Xem giải thích

Đáp án

A — Convolutional Neural Networks (CNN)

Vì sao đúng

CNN được thiết kế riêng cho dữ liệu có cấu trúc không gian như ảnh, nhờ hai đặc điểm:

  • Bộ lọc tích chập trượt khắp ảnh — nhận ra cạnh, kết cấu, hình dạng, rồi các tầng sau ghép chúng thành khái niệm phức tạp hơn (bánh xe → ô tô).
  • Bất biến với vị trí — sản phẩm nằm ở góc trái hay giữa ảnh thì vẫn được nhận ra như nhau. Với ảnh người dùng tự chụp và tải lên như trong đề, tính chất này là điều kiện bắt buộc.

CNN cũng hiệu quả hơn hẳn mạng kết nối đầy đủ vì dùng chung trọng số cho cả ảnh, nên số tham số ít hơn rất nhiều.

Vì sao các phương án khác sai

  • D. RNN — dựng cho dữ liệu tuần tự (văn bản, chuỗi thời gian, video); ảnh tĩnh không có chiều thời gian.
  • B. GAN — sinh ra ảnh mới, không phân loại ảnh có sẵn.
  • C. RAG — kỹ thuật truy xuất tài liệu cho mô hình ngôn ngữ, không liên quan tới ảnh.