Ngân hàng đề — AWS Certified AI Practitioner
Tìm thấy 623 câu.
A research lab is exploring various generative AI models for its project on creating realistic images and data simulations. The lab is particularly interested in diffusion models but needs a clear understanding of how these models work. Gaining insights into the mechanism behind diffusion models will help the lab decide whether this approach is suitable for their data generation needs.
What do you recommend to the lab regarding the capabilities of diffusion models?
-
A
Diffusion models work by training two neural networks in a competitive manner
-
B
Diffusion models are a type of transformer-based models that use a self-attention mechanism
-
C
Diffusion models work by learning a compact representation of data called latent space
-
D
Diffusion models create new data by iteratively making controlled random changes to an initial data sample
Xem giải thích
Đáp án
D — Tạo dữ liệu mới bằng cách lặp đi lặp lại việc thay đổi ngẫu nhiên có kiểm soát trên một mẫu ban đầu
Vì sao đúng
Diffusion model hoạt động theo hai chiều, và tên gọi "khuếch tán" đến từ chiều thứ nhất:
Huấn luyện (chiều xuôi): ảnh thật ──thêm nhiễu dần──▶ nhiễu hoàn toàn
(mô hình học cách nhận ra nhiễu đã thêm ở mỗi bước)
Sinh ảnh (chiều ngược): nhiễu ngẫu nhiên ──khử nhiễu dần──▶ ảnh mới
Điểm quan trọng là lặp nhiều bước: mỗi bước chỉ gỡ đi một phần nhiễu, và qua vài chục bước thì một bức ảnh mạch lạc hiện ra. Đó cũng là lý do sinh ảnh bằng diffusion chậm hơn so với các kiến trúc một lượt.
Đây là kiến trúc đứng sau Stable Diffusion, DALL-E và Midjourney.
Vì sao các phương án khác sai
Ba phương án còn lại mô tả các kiến trúc sinh khác:
- A. Huấn luyện hai mạng nơ-ron cạnh tranh nhau — GAN. Đây là phương án nhiễu chính vì GAN cũng sinh ảnh.
- C. Học biểu diễn nén gọi là không gian tiềm ẩn — Autoencoder / VAE.
- B. Dựa trên Transformer với cơ chế self-attention — Transformer, chủ yếu dùng cho văn bản.
You are working as an NLP engineer at a tech company tasked with building an advanced text summarization tool to help customers generate concise summaries of lengthy documents. After successfully training your model, your manager asks you to evaluate its performance and quality to ensure it meets the required standards for deployment.
Considering the nature of text summarization, which evaluation method would be most appropriate to assess the model's output effectively?
-
A
Test the model on established benchmark datasets to evaluate performance
-
B
Conduct code review to analyze the implementation code for logical or structural issues
-
C
Use automated testing via metrics like ROUGE or BLEU to measure the similarity between generated and reference summaries
-
D
Leverage human evaluation to assess the quality of summaries
Xem giải thích
Đáp án
D — Dùng đánh giá của con người để thẩm định chất lượng bản tóm tắt
Vì sao đúng
Chữ khoá của đề là "chất lượng", và với tóm tắt văn bản thì chất lượng gồm những thứ mà chỉ số tự động không đo được:
- Trung thực với nội dung gốc — bản tóm tắt có bịa thêm chi tiết nào không?
- Bắt đúng ý chính — nó giữ điều quan trọng hay giữ điều dễ trích?
- Mạch lạc và dễ đọc — con người có thấy nó tự nhiên không?
Có một lý do sâu hơn: một văn bản có nhiều bản tóm tắt tốt khác nhau. Bản tóm tắt hoàn toàn đúng nhưng dùng từ khác bản tham chiếu sẽ bị chỉ số n-gram chấm điểm thấp, dù người đọc thấy nó tốt hơn.
Vì sao các phương án khác sai
- C. Dùng ROUGE hoặc BLEU — đây là câu trả lời gần đúng nhất và cần nói rõ: ROUGE là chỉ số tiêu chuẩn của ngành cho tóm tắt văn bản, và trong thực tế bạn nên dùng nó. Nhưng nó chỉ đo mức trùng khớp từ ngữ với bản tham chiếu — nó không phát hiện được một bản tóm tắt trùng khớp cao mà bịa ra sự kiện không có trong bài gốc. Đề hỏi cách đánh giá chất lượng, nên chấm theo con người.
- A. Chạy trên bộ dữ liệu chuẩn — cũng dựa vào chỉ số tự động, cùng giới hạn.
- B. Rà soát mã nguồn — kiểm tra phần cài đặt, không nói gì về chất lượng đầu ra.
Ghi chú thực hành
Cách làm đúng ngoài đời là dùng cả hai: chỉ số tự động để theo dõi liên tục và so sánh nhanh giữa các phiên bản, đánh giá của con người trên một mẫu nhỏ để bắt những lỗi mà chỉ số bỏ qua.
A video streaming company is developing machine learning models to recommend content and analyze user interactions. The data science team needs to understand the specific capabilities of Convolutional Neural Networks (CNNs) and Recurrent Neural Networks (RNNs).
Which of the following would you suggest to the team?
-
A
While RNNs are used for single image analysis, CNNs are used for video analysis
-
B
Both RNNs and CNNs are used for video analysis
-
C
While CNNs are used for single image analysis, RNNs are used for video analysis
-
D
Both RNNs and CNNs are used for single image analysis
Xem giải thích
Đáp án
C — CNN dùng cho phân tích ảnh đơn lẻ, RNN dùng cho phân tích video
Vì sao đúng
Khác biệt nằm ở chỗ có cần nhớ thứ tự hay không:
| CNN | RNN | |
|---|---|---|
| Mạnh ở | Mẫu hình không gian — cạnh, hình dạng, kết cấu | Mẫu hình theo thời gian — chuỗi có thứ tự |
| Có trí nhớ | Không | Có — trạng thái ẩn mang thông tin từ bước trước |
| Dữ liệu | Ảnh tĩnh | Video, văn bản, âm thanh, chuỗi thời gian |
Video là chuỗi khung hình, mà ý nghĩa của nó nằm ở quan hệ giữa các khung: một người "đang ngã" hay "đang ngồi xuống" chỉ phân biệt được khi xét thứ tự. RNN giữ được ngữ cảnh đó.
Trên thực tế hai kiến trúc thường ghép với nhau: CNN trích đặc trưng từ từng khung hình, rồi RNN xử lý chuỗi đặc trưng đó theo thời gian.
Vì sao các phương án khác sai
- A — đảo ngược hai vai trò; đây là phương án nhiễu chính.
- B và D — gán cả hai cho cùng một loại dữ liệu, xoá mất sự phân biệt mà câu hỏi kiểm tra.
A healthcare company is using machine learning to analyze patient data and improve diagnostics. The data science team is considering both supervised and unsupervised machine learning approaches to handle different types of data, as understanding the key differences between these two approaches will help the team determine which method is best suited for tasks like disease prediction versus discovering hidden patterns in patient data.
Which of the following would you identify as the key difference between supervised machine learning and unsupervised machine learning?
-
A
Supervised machine learning is used only for clustering tasks, whereas unsupervised machine learning is used only for regression tasks
-
B
Supervised machine learning focuses on finding patterns in data without any specific guidance, while unsupervised machine learning uses labeled data to make predictions
-
C
Supervised machine learning requires labeled data for training, whereas unsupervised machine learning does not use any data for training
-
D
Supervised machine learning involves training models with labeled data to make predictions or classify data, whereas unsupervised machine learning identifies patterns and relationships in unlabeled data
Xem giải thích
Đáp án
*D — Học có giám sát huấn luyện trên dữ liệu có nhãn để dự đoán hoặc phân loại; học không giám sát tìm mẫu hình và quan hệ trong dữ liệu không nhãn
Vì sao đúng
Đây là định nghĩa chính xác và đầy đủ của cả hai vế:
| Có giám sát | Không giám sát | |
|---|---|---|
| Dữ liệu | Có nhãn | Không nhãn |
| Mục tiêu | Dự đoán một kết quả đã biết trước | Khám phá cấu trúc chưa biết |
| Câu hỏi | "Bệnh nhân này có nguy cơ không?" | "Có những nhóm bệnh nhân nào?" |
| Đánh giá | So với nhãn đúng — đo được rõ ràng | Khó đo, thường cần chuyên gia xem lại |
| Ví dụ trong y tế | Dự đoán bệnh từ hồ sơ đã chẩn đoán | Tìm nhóm bệnh nhân có mẫu hình giống nhau |
Hai cột cuối cho thấy chúng bổ sung cho nhau: không giám sát dùng khi bạn chưa biết mình đang tìm gì, còn có giám sát dùng khi đã biết đích.
Vì sao các phương án khác sai
- B — đảo ngược hai định nghĩa; đây là phương án nhiễu chính.
- C — nửa đầu đúng, nhưng nói học không giám sát "không dùng dữ liệu nào"; sai — nó dùng rất nhiều dữ liệu, chỉ là dữ liệu không có nhãn.
- A — nói có giám sát chỉ để phân cụm và không giám sát chỉ để hồi quy; gán ghép sai cả hai.
In the context of security and privacy for AI systems on AWS, what is the primary difference between threat detection and vulnerability management?
-
A
Threat detection focuses on identifying potential weaknesses in the system, while vulnerability management continuously monitors for malicious activities
-
B
Threat detection involves real-time monitoring and identification of active threats, whereas vulnerability management is about identifying, assessing, and mitigating security weaknesses
-
C
Threat detection and vulnerability management both exclusively focus on compliance with regulatory requirements
-
D
Threat detection is concerned with data encryption and access controls, while vulnerability management deals with incident response and recovery
Xem giải thích
Đáp án
*B — Threat detection là giám sát và phát hiện mối đe doạ đang diễn ra theo thời gian thực; vulnerability management là xác định, đánh giá và khắc phục điểm yếu
Vì sao đúng
Hai lĩnh vực khác nhau ở thời điểm và đối tượng:
| Threat detection | Vulnerability management | |
|---|---|---|
| Nhìn vào | Hành vi đang diễn ra | Điểm yếu tiềm tàng |
| Thời điểm | Thời gian thực, liên tục | Theo chu kỳ, chủ động |
| Câu hỏi | "Có ai đang tấn công không?" | "Chỗ nào có thể bị tấn công?" |
| Tính chất | Phản ứng | Phòng ngừa |
| Dịch vụ AWS | GuardDuty, Detective | Inspector, Config |
Hai việc bổ sung cho nhau và không thay thế nhau: vá hết lỗ hổng đã biết vẫn không chặn được kẻ tấn công dùng thông tin đăng nhập bị lộ; ngược lại, chỉ giám sát mà không vá thì bạn liên tục phát hiện ra những cuộc tấn công lẽ ra đã ngăn được.
Vì sao các phương án khác sai
- A — đảo ngược hai định nghĩa; đây là phương án nhiễu chính.
- C — gộp cả hai thành chuyện tuân thủ quy định; tuân thủ là mục đích khác.
- D — gán threat detection cho mã hoá và kiểm soát truy cập, vulnerability management cho ứng phó sự cố; cả hai đều là lĩnh vực bảo mật riêng.
A financial services company is exploring the adoption of generative AI to automate report generation and enhance customer service through chatbots. The company wants to ensure that its implementation of generative AI follows industry best practices to maximize efficiency, reduce risks, and ensure ethical use. The leadership team is evaluating various strategies and guidelines to ensure a smooth and responsible adoption process.
Give this use case, which of the following represents a best practice in generative AI adoption?
-
A
Implementing guardrails and enhancing transparency for generative AI applications
-
B
Disregarding continuous monitoring and updating of AI models after deployment
-
C
Prioritizing rapid deployment over the ethical considerations and potential biases in AI models
-
D
Using generative AI exclusively for creative applications and avoiding its use in business operations
Xem giải thích
Đáp án
A — Triển khai guardrail và tăng tính minh bạch cho ứng dụng AI sinh
Vì sao đúng
Hai biện pháp này đánh vào hai nhóm rủi ro lớn nhất của AI sinh trong ngành tài chính:
- Guardrail — chặn nội dung độc hại, che thông tin cá nhân, và ngăn mô hình bàn tới những chủ đề nó không được phép (ví dụ đưa lời khuyên đầu tư cụ thể).
- Minh bạch — cho khách hàng biết họ đang nói chuyện với AI, dẫn nguồn cho câu trả lời, và có đường chuyển sang người thật khi cần.
Vì sao các phương án khác sai
Ba phương án còn lại đều là thực hành xấu được phát biểu thẳng, và nhận ra chúng cũng là một phần của việc hiểu đúng:
- B. Bỏ qua việc theo dõi và cập nhật mô hình sau khi triển khai — mô hình xuống cấp theo thời gian khi dữ liệu thay đổi; không theo dõi thì không biết lúc nào nó bắt đầu sai.
- C. Ưu tiên triển khai nhanh hơn là cân nhắc đạo đức và sai lệch — trong ngành tài chính, một mô hình lệch không chỉ gây hại cho khách hàng mà còn dẫn tới chế tài pháp lý.
- D. Chỉ dùng AI sinh cho việc sáng tạo, tránh dùng trong vận hành — hạn chế vô cớ; chính hai việc đề nêu (soạn báo cáo, chatbot hỗ trợ) đều là vận hành.
A company wants to implement safeguards for its generative AI application using Amazon Bedrock. Specifically, the company wants to filter undesirable and harmful content as well as redact any personally identifiable information (PII).
What do you recommend?
-
A
Guardrails for Amazon Bedrock
-
B
Knowledge Bases for Amazon Bedrock
-
C
Continued pretraining in Amazon Bedrock
-
D
Watermark detection for Amazon Bedrock
Xem giải thích
Đáp án
A — Guardrails for Amazon Bedrock
Vì sao đúng
Đề nêu đúng hai việc mà Guardrails làm: lọc nội dung không mong muốn và có hại, và che thông tin định danh cá nhân (PII).
Cụ thể Guardrails cung cấp bốn loại rào chắn:
- Bộ lọc nội dung theo nhóm (thù ghét, lăng mạ, tình dục, bạo lực) với mức nghiêm ngặt điều chỉnh được.
- Chủ đề bị chặn do bạn tự khai bằng ngôn ngữ tự nhiên.
- Bộ lọc PII — nhận ra và che số bảo hiểm, số thẻ, email, số điện thoại.
- Bộ lọc từ ngữ theo danh sách riêng.
Điểm quan trọng về mặt kiến trúc: Guardrails áp cho cả đầu vào lẫn đầu ra, và hoạt động độc lập với mô hình nên đổi mô hình vẫn giữ nguyên chính sách.
Vì sao các phương án khác sai
- B. Knowledge Bases — cung cấp tri thức từ tài liệu của bạn (RAG); không lọc nội dung.
- C. Continued pretraining — huấn luyện tiếp mô hình trên dữ liệu lĩnh vực; không phải cơ chế kiểm soát nội dung, và nó không bảo đảm được gì về đầu ra.
- D. Watermark detection — nhận biết ảnh do Amazon Titan sinh ra.
A media company is considering using generative AI to automate content creation for articles, videos, and marketing campaigns. The team wants to understand the underlying mechanics of generative AI, particularly how these models are able to create entirely new content or data, such as text, images, and music, based on patterns learned from existing datasets. This understanding will help the company determine how to best integrate generative AI into its creative workflows.
Given this context, how does generative AI create new content or data?
-
A
Through traditional programming methods where each outcome is manually coded
-
B
By learning patterns from existing data and using algorithms to generate new content that mimics those patterns
-
C
By randomly generating content without any reference to existing data
-
D
By using pre-defined rules and templates without any learning from existing data
Xem giải thích
Đáp án
B — Học các mẫu hình từ dữ liệu sẵn có rồi dùng thuật toán sinh ra nội dung mới mô phỏng theo các mẫu đó
Vì sao đúng
Định nghĩa này nêu đủ hai bước của quá trình:
- Học mẫu hình — mô hình học được phân bố thống kê của dữ liệu huấn luyện: từ nào thường theo sau từ nào, màu sắc và hình khối thường đi cùng nhau ra sao.
- Sinh nội dung mới — lấy mẫu từ phân bố đã học, nên kết quả là thứ chưa từng tồn tại nhưng mang đặc điểm giống dữ liệu gốc.
Vế thứ hai cũng giải thích giới hạn: mô hình không sáng tạo từ hư không, chất lượng đầu ra bị chặn bởi phạm vi dữ liệu huấn luyện.
Vì sao các phương án khác sai
- C. Sinh nội dung hoàn toàn ngẫu nhiên, không tham chiếu dữ liệu nào — nếu vậy thì kết quả là nhiễu vô nghĩa; chính việc học từ dữ liệu làm nó mạch lạc.
- A. Lập trình truyền thống, mỗi kết quả được viết tay — đó là cách làm mà AI sinh thay thế; không ai viết tay được mọi câu trả lời có thể có.
- D. Dùng luật và khuôn mẫu định sẵn, không học gì — mô tả hệ thống mẫu (template), thứ chỉ điền chỗ trống chứ không tạo ra nội dung mới.
A healthcare company is building a machine learning model to predict patient outcomes based on various health indicators. The data science team is exploring different techniques to improve the model’s accuracy by refining the input data, specifically using feature extraction and feature selection. Understanding the key differences between these two approaches will help the team optimize the model’s performance.
What do you suggest to the company?
-
A
Feature extraction involves selecting the most relevant features from the dataset, while feature selection involves creating new features from existing data
-
B
Feature extraction reduces the number of features by transforming data into a new space, while feature selection reduces the number of features by selecting the most relevant ones from the existing features
-
C
Feature extraction and feature selection are both used to remove irrelevant features but do not reduce the dimensionality of the dataset
-
D
Feature extraction is only applicable to supervised learning, while feature selection is only applicable to unsupervised learning
Xem giải thích
Đáp án
*B — Feature extraction giảm số đặc trưng bằng cách biến đổi dữ liệu sang không gian mới; feature selection giảm bằng cách chọn ra những đặc trưng liên quan nhất trong số đã có
Vì sao đúng
Cả hai cùng nhằm giảm số chiều, nhưng theo hai cách khác hẳn:
| Feature selection | Feature extraction | |
|---|---|---|
| Làm gì | Giữ lại một tập con | Tạo ra đặc trưng mới từ tổ hợp cũ |
| Đặc trưng còn lại | Vẫn là cột gốc | Cột mới, là tổ hợp của nhiều cột gốc |
| Diễn giải được | Có — vẫn là "huyết áp", "tuổi" | Khó — "thành phần chính thứ nhất" là gì? |
| Ví dụ | Chọn 20 chỉ số sức khoẻ quan trọng nhất trong 100 | PCA nén 100 chỉ số xuống 20 chiều |
Với công ty y tế trong đề, đánh đổi này rất đáng cân nhắc: feature selection giữ được khả năng giải thích — bác sĩ hiểu được "mô hình dựa vào huyết áp và tuổi". Sau PCA thì đặc trưng trở thành những tổ hợp toán học không có ý nghĩa lâm sàng nào.
Vì sao các phương án khác sai
- A — đảo ngược hai định nghĩa; đây là phương án nhiễu chính.
- C — nói cả hai không giảm số chiều; sai, giảm số chiều chính là mục đích của cả hai.
- D — nói mỗi cái chỉ áp dụng cho một kiểu học; sai, cả hai dùng được ở cả có giám sát lẫn không giám sát.
A technology company is developing a machine learning model to automatically categorize images for its e-commerce platform, which includes tasks like identifying products in photos uploaded by users. The data science team is exploring various types of neural networks and needs to choose the most effective one for image classification. Understanding which neural network architecture is best suited for handling the complexities of image data will help the team ensure accurate and efficient classification.
What do you recommend for the given use case?
-
A
Convolutional Neural Networks (CNNs)
-
B
Generative Adversarial Networks (GANs)
-
C
Retrieval-Augmented Generation (RAG)
-
D
Recurrent Neural Networks (RNNs)
Xem giải thích
Đáp án
A — Convolutional Neural Networks (CNN)
Vì sao đúng
CNN được thiết kế riêng cho dữ liệu có cấu trúc không gian như ảnh, nhờ hai đặc điểm:
- Bộ lọc tích chập trượt khắp ảnh — nhận ra cạnh, kết cấu, hình dạng, rồi các tầng sau ghép chúng thành khái niệm phức tạp hơn (bánh xe → ô tô).
- Bất biến với vị trí — sản phẩm nằm ở góc trái hay giữa ảnh thì vẫn được nhận ra như nhau. Với ảnh người dùng tự chụp và tải lên như trong đề, tính chất này là điều kiện bắt buộc.
CNN cũng hiệu quả hơn hẳn mạng kết nối đầy đủ vì dùng chung trọng số cho cả ảnh, nên số tham số ít hơn rất nhiều.
Vì sao các phương án khác sai
- D. RNN — dựng cho dữ liệu tuần tự (văn bản, chuỗi thời gian, video); ảnh tĩnh không có chiều thời gian.
- B. GAN — sinh ra ảnh mới, không phân loại ảnh có sẵn.
- C. RAG — kỹ thuật truy xuất tài liệu cho mô hình ngôn ngữ, không liên quan tới ảnh.