Ngân hàng đề — AWS Certified AI Practitioner
Tìm thấy 623 câu.
A financial services company is developing a Deep Learning model to detect fraudulent transactions in real-time. The data science team has decided to use neural networks as the backbone of the model but needs to fully understand how neural networks function, as understanding the working principles of neural networks is crucial for building an effective fraud detection system.
How do neural networks work in the context of Deep Learning?
-
A
Neural networks learn to perform tasks by being explicitly programmed with rules for each task
-
B
Neural networks operate by storing all possible outcomes and selecting the most appropriate one for each input
-
C
Neural networks rely solely on predefined mathematical formulas and do not learn from data
-
D
Neural networks consist of layers of nodes (neurons) that process input data, adjusting the weights of connections between nodes through training to recognize patterns and make predictions
Xem giải thích
Đáp án
D — Mạng nơ-ron gồm các tầng nút (nơ-ron) xử lý dữ liệu đầu vào, điều chỉnh trọng số của các liên kết qua huấn luyện để nhận ra mẫu hình và đưa ra dự đoán
Vì sao đúng
Phương án này nêu đúng ba đặc điểm cấu thành:
- Tổ chức theo tầng — tầng vào, các tầng ẩn, tầng ra. Mỗi tầng biến đổi dữ liệu thêm một mức trừu tượng.
- Trọng số trên liên kết — chính là nơi tri thức được lưu.
- Học bằng cách điều chỉnh trọng số — không phải bằng cách thêm luật.
Với bài toán phát hiện gian lận, sức mạnh nằm ở chỗ mạng tự tìm ra tổ hợp đặc trưng báo hiệu gian lận — ví dụ quan hệ giữa số tiền, thời điểm, vị trí và thói quen chi tiêu — mà không ai phải viết ra luật đó. Mẫu gian lận cũng thay đổi liên tục, nên khả năng học lại từ dữ liệu mới quan trọng hơn bất kỳ bộ luật cố định nào.
Vì sao các phương án khác sai
- A. Được lập trình tường minh bằng luật cho từng nhiệm vụ — đó là hệ dựa trên luật; nếu viết được luật đầy đủ thì đã không cần mạng nơ-ron.
- C. Chỉ dựa vào công thức toán định sẵn, không học từ dữ liệu — phủ nhận đúng chữ "học".
- B. Lưu mọi kết quả có thể rồi chọn cái phù hợp — đó là bảng tra cứu; không thể mở rộng cho đầu vào chưa từng thấy, và mạng nơ-ron sinh ra chính để khái quát sang trường hợp mới.
A healthcare company is evaluating the use of Foundation Models (FMs) in generative AI to automate tasks such as medical report generation, data analysis, and personalized patient communications. The company's data science team wants to better understand the key features and benefits of Foundation Models, particularly how they can be applied to various tasks with minimal fine-tuning and customization. To ensure they choose the right model for their needs, the team is seeking to clarify the essential characteristics of FMs in generative AI.
Which of the following is correct regarding Foundation Models (FMs) in the context of generative AI?
-
A
FMs use labeled training data sets for self-supervised learning
-
B
FMs use unlabeled training data sets for supervised learning
-
C
FMs use unlabeled training data sets for self-supervised learning
-
D
FMs use labeled training data sets for supervised learning
Xem giải thích
Đáp án
*C — FM dùng tập dữ liệu không nhãn cho học tự giám sát
Vì sao đúng
Đây là tổ hợp đúng, và nó là điều kiện làm nên quy mô của Foundation Model:
- Dữ liệu không nhãn — văn bản thô lấy từ web, sách, mã nguồn. Không ai gán nhãn cho hàng nghìn tỷ token, và cũng không ai đủ tiền để làm việc đó.
- Học tự giám sát — nhãn được sinh ra từ chính dữ liệu, bằng cách che một phần rồi bắt mô hình đoán.
Hai vế này gắn với nhau: chính vì tự giám sát tạo được nhãn miễn phí nên mới tận dụng được kho dữ liệu không nhãn khổng lồ.
Vì sao các phương án khác sai
- A — nói dữ liệu có nhãn cho học tự giám sát; mâu thuẫn nội tại, vì tự giám sát có nghĩa là không cần nhãn sẵn.
- B — nói dữ liệu không nhãn cho học có giám sát; cũng mâu thuẫn, có giám sát theo định nghĩa là phải có nhãn.
- D — nói dữ liệu có nhãn cho học có giám sát; nhất quán về mặt logic nhưng mô tả sai giai đoạn: đó là fine-tuning, không phải huấn luyện trước.
Ghi nhớ
| Giai đoạn | Dữ liệu | Kiểu học |
|---|---|---|
| Huấn luyện trước | Không nhãn, quy mô khổng lồ | Tự giám sát |
| Fine-tuning | Có nhãn, quy mô nhỏ | Có giám sát |
Consider the following AI model responses to user prompts. Which response exemplifies hallucination and which exemplifies toxicity?
Prompt 1: "What is the capital of France?"
Response A: "The capital of France is Mars."
Prompt 2: "Tell me a joke."
Response B: "Why don't scientists trust atoms? Because they make up everything!"
Prompt 3: "Describe a good book for children."
Response C: "You should read 'ABC', a great book with fun activities for kids."
Prompt 4: "What do you think about people from [specific group]?"
Response D: "People from [specific group] are inferior and should not be trusted."
-
A
Response C is hallucination; Response B is toxicity
-
B
Response B is hallucination; Response C is toxicity
-
C
Response D is hallucination; Response A is toxicity
-
D
Response A is hallucination; Response D is toxicity
Xem giải thích
Đáp án
D — Response A là ảo giác; Response D là độc hại
Vì sao đúng
Đối chiếu từng phản hồi:
- Response A — "Thủ đô của Pháp là sao Hoả": nội dung sai sự thật nhưng được trình bày như một sự thật. Đó là ảo giác (hallucination) — mô hình sinh ra thông tin bịa với giọng tự tin.
- Response D — nói một nhóm người "hạ đẳng và không đáng tin": nội dung xúc phạm, phân biệt đối xử. Đó là độc hại (toxicity).
| Hallucination | Toxicity | |
|---|---|---|
| Vấn đề | Sai sự thật | Gây hại |
| Ý định | Không có — mô hình "tưởng" là đúng | Nội dung xúc phạm, thù ghét, phân biệt |
| Chữa bằng | RAG, hạ temperature, dẫn nguồn | Guardrails, lọc nội dung |
Điểm phân biệt gọn: ảo giác có thể vô hại (sai một con số), còn độc hại có thể đúng sự thật mà vẫn không được phép xuất ra.
Vì sao các phương án khác sai
- B — gọi Response B là ảo giác; nhưng B là một câu đùa hoàn toàn bình thường và vô hại.
- A — gọi Response C là ảo giác; C là lời gợi ý sách cho trẻ em, không có gì sai.
- C — đảo ngược cặp đúng: gọi D là ảo giác và A là độc hại.
Hai phản hồi B và C được đặt vào để làm nhiễu — chúng hoàn toàn bình thường, và nhận ra điều đó là một nửa lời giải.
A healthcare company is building multiple machine learning models using Amazon SageMaker to support various projects, such as patient outcome prediction and medical image analysis. As the number of models grows, the company needs a tool that provides a centralized view of all models created across its AWS account to easily track, manage, and monitor them. This will help streamline model governance and improve operational efficiency.
Which of the following is the best-fit for the given requirements?
-
A
Amazon SageMaker Clarify
-
B
Amazon SageMaker Model Monitor
-
C
Amazon SageMaker Ground Truth
-
D
Amazon SageMaker Model Dashboard
Xem giải thích
Đáp án
D — Amazon SageMaker Model Dashboard
Vì sao đúng
Đề nêu đúng nhu cầu của Model Dashboard: một chỗ xem tập trung toàn bộ mô hình đã tạo trong tài khoản AWS, để theo dõi và quản trị.
Vấn đề nó giải là vấn đề của quy mô: khi công ty có 5 mô hình thì ai cũng biết chúng ở đâu; khi có 50 thì không còn ai nắm được mô hình nào đang chạy, endpoint nào còn sống, cái nào đã xuống cấp. Dashboard gom lại một nơi, kèm cảnh báo về trôi dữ liệu, trôi chất lượng, sai lệch và độ giải thích.
Vì sao các phương án khác sai
Ba phương án còn lại đều làm một mặt của việc đó, và kết quả của chúng được hiển thị trong Dashboard:
- B. Model Monitor — theo dõi trôi dữ liệu cho từng mô hình; Dashboard là lớp tổng hợp bên trên. Đây là phương án nhiễu chính, và điểm phân biệt là một mô hình so với toàn bộ danh mục.
- A. Clarify — phát hiện sai lệch và giải thích dự đoán.
- C. Ground Truth — gán nhãn dữ liệu, thuộc giai đoạn trước khi có mô hình.
A technology company is considering using Amazon Web Services (AWS) to support its growing application infrastructure and is exploring different cloud computing models. The team is particularly interested in Amazon Elastic Compute Cloud (EC2) to handle its scalable compute needs, as understanding this will help them determine how much control they have over the underlying infrastructure and how best to manage their resources.
Which type of cloud computing does Amazon Elastic Compute Cloud (EC2) represent?
-
A
Infrastructure as a Service (IaaS)
-
B
Platform as a Service (PaaS)
-
C
Network as a Service (NaaS)
-
D
Software as a Service (SaaS)
Xem giải thích
Đáp án
A — Infrastructure as a Service (IaaS)
Vì sao đúng
EC2 cung cấp máy chủ ảo — tức là tài nguyên hạ tầng ở dạng thô. Bạn chọn hệ điều hành, cài phần mềm, cấu hình mạng và tự chịu trách nhiệm vá hệ điều hành. Đó đúng là mô tả của IaaS.
| Mô hình | AWS quản lý | Bạn quản lý | Ví dụ |
|---|---|---|---|
| IaaS | Phần cứng, ảo hoá | Hệ điều hành, thời gian chạy, ứng dụng, dữ liệu | EC2, EBS, VPC |
| PaaS | Thêm hệ điều hành và thời gian chạy | Ứng dụng, dữ liệu | Elastic Beanstalk, RDS |
| SaaS | Gần như mọi thứ | Chỉ dữ liệu và cấu hình | Amazon Q, WorkMail |
Đánh đổi rất rõ: IaaS cho quyền kiểm soát cao nhất nhưng cũng đặt trách nhiệm vận hành nhiều nhất lên bạn.
Vì sao các phương án khác sai
- B. PaaS — nếu là PaaS thì AWS đã lo hệ điều hành và thời gian chạy; với EC2 thì bạn tự lo.
- D. SaaS — là phần mềm dùng ngay qua trình duyệt, không phải máy chủ để bạn cài đặt.
- C. NaaS — không phải một trong ba mô hình chuẩn mà AWS dùng để phân loại.
A retail company is developing a machine learning model to predict customer churn and is in the process of preparing its dataset. The data science team plans to divide the data into a training set, validation set, and test set to ensure the model performs well across different stages of development and evaluation. To proceed effectively, the team needs to fully understand the roles of each of these sets and how they contribute to building a robust model.
Which of the following is correct regarding the training set, validation set, and test set used in the context of machine learning? (Select two)
-
A
Validation sets are optional
-
B
Validation set is used to determine how well the model generalizes
-
C
Test set is used for hyperparameter tuning
-
D
Test set is used to determine how well the model generalizes
-
E
Test sets are optional
Xem giải thích
Đáp án
A và D — tập kiểm định là tuỳ chọn, và tập kiểm tra dùng để đánh giá khả năng khái quát
Vì sao đúng
Ba tập dữ liệu có ba vai trò khác nhau:
| Tập | Dùng để | Mô hình có "thấy" không |
|---|---|---|
| Training | Học trọng số | Có, nhiều lần |
| Validation | Chỉnh siêu tham số, chọn mô hình, dừng sớm | Gián tiếp — bạn ra quyết định dựa trên nó |
| Test | Đánh giá cuối cùng | Không, tới tận lúc kết thúc |
- D. Tập kiểm tra dùng để đánh giá khả năng khái quát — đúng, vì nó là tập duy nhất chưa hề ảnh hưởng tới bất kỳ quyết định nào. Tập kiểm định đã bị dùng để chọn siêu tham số, nên điểm số trên nó lạc quan hơn thực tế.
- A. Tập kiểm định là tuỳ chọn — đúng theo nghĩa: nếu không tinh chỉnh siêu tham số thì không cần, và kiểm định chéo (cross-validation) có thể thay thế bằng cách xoay vòng ngay trong tập huấn luyện.
Vì sao các phương án khác sai
- C. Tập kiểm tra dùng để tinh chỉnh siêu tham số — sai và là lỗi nghiêm trọng trong thực hành. Dùng tập kiểm tra để chỉnh là làm rò rỉ thông tin của nó vào mô hình, và từ đó bạn không còn thước đo trung thực nào nữa.
- E. Tập kiểm tra là tuỳ chọn — bỏ nó đi thì không có cách nào biết mô hình chạy thế nào trên dữ liệu thật.
- B. Tập kiểm định dùng để đánh giá khả năng khái quát — nghe rất hợp lý và đúng một phần, nhưng nó là ước lượng thiên vị lạc quan vì đã tham gia vào quá trình chọn. Vai trò đó thuộc về tập kiểm tra.
A multinational corporation is building machine learning systems on AWS to analyze customer behavior across different regions. As part of ensuring compliance with local regulations, the team must establish strong data governance practices. They are particularly focused on data residency as well as data retention, since clarifying these concepts is critical for the company to meet both legal and operational requirements.
Given this context, what is the primary difference between data residency and data retention?
-
A
Data residency focuses on data encryption and security, while data retention deals with data transformation and processing policies
-
B
Data residency involves setting access controls for data, while data retention is about monitoring real-time data usage
-
C
Data residency is concerned with the physical location of data storage, whereas data retention defines the policies for how long data should be stored and maintained
-
D
Data residency determines the duration for which data is kept, while data retention specifies the geographical location where data is stored
Xem giải thích
Đáp án
*C — Data residency là nơi dữ liệu được lưu về mặt vật lý; data retention là chính sách lưu giữ dữ liệu trong bao lâu
Vì sao đúng
Hai khái niệm quản trị dữ liệu, một về không gian và một về thời gian:
| Data residency | Data retention | |
|---|---|---|
| Câu hỏi | Dữ liệu nằm ở đâu? | Giữ bao lâu? |
| Chi phối bởi | Luật chủ quyền dữ liệu (GDPR, luật nội địa hoá) | Quy định ngành, chính sách công ty |
| Thực thi trên AWS bằng | Chọn Region, dùng SCP chặn region khác | S3 Lifecycle, Object Lock, chính sách xoá |
| Vi phạm thì | Phạt vì chuyển dữ liệu ra ngoài lãnh thổ | Phạt vì giữ quá lâu hoặc xoá quá sớm |
Với tập đoàn đa quốc gia trong đề thì cả hai đều bắt buộc, và chúng không thay thế cho nhau: lưu đúng nước nhưng giữ quá thời hạn vẫn là vi phạm.
Một điểm dễ bỏ sót: retention có cả hai chiều. Xoá sớm hơn quy định cũng là vi phạm — hồ sơ tài chính thường buộc giữ nhiều năm.
Vì sao các phương án khác sai
- D — đảo ngược hai định nghĩa; đây là phương án nhiễu chính.
- A — gán residency cho mã hoá và retention cho chính sách xử lý dữ liệu.
- B — gán residency cho kiểm soát truy cập và retention cho giám sát thời gian thực; cả hai đều là khái niệm khác.
A financial services company is building a machine learning model to improve its credit risk assessment process. The data science team is focused on refining the model’s inputs to enhance accuracy and performance. To do this, they are exploring the concept of Feature Engineering, which is crucial for the team to optimize the model’s predictions.
What is Feature Engineering in the context of machine learning?
-
A
Feature Engineering is the process of tuning hyperparameters in a machine learning model, and it is important because it optimizes the model’s performance
-
B
Feature Engineering involves selecting, modifying, or creating features from raw data to improve the performance of machine learning models, and it is important because it can significantly enhance model accuracy and efficiency
-
C
Feature Engineering is the process of collecting raw data, and it is important because it ensures the availability of data for model training
-
D
Feature Engineering refers to the visualization of data to understand patterns, and it is important because it helps in identifying trends in the dataset
Xem giải thích
Đáp án
B — Chọn, biến đổi hoặc tạo mới đặc trưng từ dữ liệu thô để cải thiện hiệu năng mô hình
Vì sao đúng
Kỹ nghệ đặc trưng gồm ba việc, và cả ba đều nằm trong định nghĩa này:
| Việc | Nghĩa là | Ví dụ trong bài toán tín dụng |
|---|---|---|
| Chọn | Giữ đặc trưng có ích, bỏ đặc trưng nhiễu | Bỏ mã khách hàng — không mang thông tin dự đoán |
| Biến đổi | Đổi dạng cho hợp với mô hình | Lấy log của thu nhập vì phân bố lệch mạnh |
| Tạo mới | Ghép các cột thành đặc trưng có nghĩa hơn | Tỷ lệ nợ trên thu nhập từ hai cột riêng lẻ |
Cột thứ ba giải thích vì sao khâu này quan trọng: mô hình về lý thuyết có thể tự học ra tỷ lệ nợ trên thu nhập, nhưng đưa thẳng nó vào thì mô hình học nhanh hơn, cần ít dữ liệu hơn và chính xác hơn. Đây cũng là chỗ kiến thức nghiệp vụ đóng góp nhiều nhất vào một dự án học máy.
Vì sao các phương án khác sai
- A. Tinh chỉnh siêu tham số — cũng để tối ưu hiệu năng, nhưng đó là giai đoạn khác: kỹ nghệ đặc trưng làm việc với dữ liệu, tinh chỉnh siêu tham số làm việc với quá trình huấn luyện. Đây là phương án nhiễu chính.
- C. Thu thập dữ liệu thô — là bước trước đó.
- D. Trực quan hoá dữ liệu để hiểu mẫu hình — đó là phân tích khám phá (EDA); nó thường dẫn tới ý tưởng về đặc trưng nhưng bản thân không tạo ra đặc trưng nào.
A fintech company is looking to improve its software development lifecycle by adopting cloud-based solutions that allow for faster innovation and more efficient deployment of new features. The development team wants to leverage AWS Cloud to rapidly build, test, and launch its applications, while also minimizing infrastructure management overhead. To achieve this, they need to identify the specific AWS feature that supports accelerated development and faster time-to-market.
Which feature of AWS Cloud offers the ability to innovate faster and rapidly develop, test, and launch software applications?
-
A
Ability to deploy globally in minutes
-
B
Agility
-
C
Cost savings
-
D
Elasticity
Xem giải thích
Đáp án
B — Tính linh hoạt (agility)
Vì sao đúng
Agility là thuật ngữ AWS dùng cho đúng năng lực mà đề mô tả: đổi mới nhanh hơn, xây – thử – ra mắt ứng dụng nhanh hơn.
Nền tảng của nó là chi phí thử nghiệm gần như bằng không. Trên hạ tầng tại chỗ, thử một ý tưởng mới đồng nghĩa với đặt mua máy chủ và chờ nhiều tuần, nên chỉ những ý tưởng chắc ăn mới được thử. Trên đám mây, dựng môi trường mất vài phút và xoá đi cũng vậy — nên thử nhiều hơn, thất bại rẻ hơn, học nhanh hơn.
Với công ty fintech trong đề, đó chính là thứ rút ngắn thời gian đưa tính năng ra thị trường.
Vì sao các phương án khác sai
Ba phương án còn lại đều là lợi ích thật của đám mây nhưng trả lời câu hỏi khác:
- A. Triển khai toàn cầu trong vài phút — nói về phạm vi địa lý, không phải tốc độ phát triển.
- D. Elasticity (co giãn) — khả năng tự tăng giảm tài nguyên theo tải; đó là chuyện vận hành khi đã chạy, không phải chuyện xây và ra mắt.
- C. Tiết kiệm chi phí — là kết quả tài chính, không phải năng lực rút ngắn chu kỳ phát triển.
A company is using a Large Language Model (LLM) on Amazon Bedrock and it wants to regulate the creativity of the model's output.
Which of the following inference parameters would you recommend for the given use case?
-
A
Top P
-
B
Stop sequences
-
C
Temperature
-
D
Top K
Xem giải thích
Đáp án
C — Temperature
Vì sao đúng
Temperature là núm chỉnh độ sáng tạo trực tiếp nhất. Nó tác động vào phân bố xác suất trước khi mô hình chọn token kế tiếp: làm nhọn phân bố thì token đầu bảng gần như luôn thắng, làm phẳng phân bố thì token ít khả năng vẫn có cửa.
| Temperature | Kết quả | Hợp với |
|---|---|---|
| Thấp (0–0,3) | Ổn định, lặp lại được, bám sát khả năng cao nhất | Trích xuất dữ liệu, phân loại, hỏi đáp theo tài liệu |
| Cao (0,8–1,0) | Đa dạng, bất ngờ, đôi khi lạc đề | Viết quảng cáo, đặt tên, sinh ý tưởng |
Vì sao các phương án khác sai
- A. Top P và D. Top K — cũng ảnh hưởng tới độ đa dạng, nhưng theo cách khác: chúng thu hẹp nhóm ứng viên (theo phần trăm xác suất tích luỹ hoặc theo số lượng) chứ không đổi cách chọn trong nhóm đó. Khi đề hỏi thẳng về độ sáng tạo, temperature là câu trả lời.
- B. Stop sequences — chuỗi ký tự khiến mô hình ngừng sinh; chỉ ảnh hưởng tới điểm dừng.