Ngân hàng đề — AWS Certified AI Practitioner
Tìm thấy 623 câu.
A media analytics company utilizes Amazon Bedrock to run inferences with its generative AI models to analyze large volumes of user-generated content and provide insights to its clients. The company frequently processes numerous inference requests and is looking for a way to minimize the costs associated with running these inferences while still maintaining the required level of service. Given that the company can tolerate some delays in receiving responses, it seeks a cost-effective inference method that optimizes resource usage without sacrificing too much on turnaround time.
Which inference approach would be the most suitable for the company to use in order to reduce its overall inference costs?
-
A
The company should use real-time inference, which is designed for low-latency responses and continuous, immediate processing
-
B
The company should use batch inference, thereby allowing it to run multiple inference requests in a single batch
-
C
The company should use on-demand inference, which allows the company to pay only for the resources consumed during each inference
-
D
The company should use serverless inference, which automatically scales resources based on traffic
Xem giải thích
Đáp án
B — Dùng batch inference để chạy nhiều yêu cầu suy luận trong một lô
Vì sao đúng
Hai dữ kiện quyết định nằm trong đề: muốn giảm chi phí và chấp nhận được độ trễ. Đó chính là điều kiện để batch inference thắng.
Batch inference trên Amazon Bedrock có giá rẻ hơn khoảng 50% so với gọi theo yêu cầu, và lý do rất hợp lý: bạn cho AWS quyền linh hoạt về thời điểm xử lý, nên hạ tầng được lấp đầy hiệu quả hơn. Đổi lại, kết quả trả về sau hàng giờ chứ không phải hàng giây.
Với công ty phân tích nội dung do người dùng tạo — khối lượng lớn, không ai chờ từng câu trả lời — đánh đổi này hoàn toàn xứng đáng.
Vì sao các phương án khác sai
- A. Real-time inference — thiết kế cho độ trễ thấp, và trả giá cao nhất; đề nói rõ không cần ngay.
- C. On-demand inference — trả theo token đã dùng, linh hoạt nhưng giá mỗi token cao hơn batch. Đây là phương án nhiễu gần nhất vì "chỉ trả cho phần tiêu thụ" nghe rất tiết kiệm.
- D. Serverless inference — tự co giãn theo lưu lượng, nhưng đó là thuật ngữ của SageMaker và nó giải bài toán tải thất thường, không phải bài toán giá rẻ cho khối lượng lớn.
A retail company is utilizing Amazon Bedrock to generate personalized product descriptions and recommendations. The data science team is experimenting with the Top K inference parameter, since it is crucial to understand how adjusting the Top K parameter impacts the responses for optimizing customer interactions.
What do you suggest to the team regarding the Top K parameter?
-
A
Influences the number of most-likely candidates that the model considers for the next token
-
B
Influences the percentage of most-likely candidates that the model considers for the next token
-
C
Specifies the sequences of characters that stop the model from generating further tokens
-
D
Influences the likelihood of the model selecting lower-probability outputs, thereby impacting the creativity of the model’s output
Xem giải thích
Đáp án
A — Ảnh hưởng tới số lượng ứng viên khả dĩ nhất mà mô hình xem xét cho token kế tiếp
Vì sao đúng
Top K cắt theo con số cố định: đặt K = 50 nghĩa là mô hình xếp mọi token theo xác suất giảm dần, giữ lại đúng 50 cái đầu, rồi chọn trong nhóm đó. Phần còn lại bị loại thẳng dù xác suất bao nhiêu.
| Top K | Nhóm ứng viên | Kết quả |
|---|---|---|
| 1 | Chỉ token cao nhất | Hoàn toàn tất định, lặp lại được |
| 50 | 50 token đầu | Cân bằng — mức thường dùng |
| Rất lớn | Gần như mọi token | Đa dạng, dễ lạc đề |
Vì sao các phương án khác sai
- B. Ảnh hưởng tới phần trăm ứng viên — đó là Top P, cắt theo tổng xác suất tích luỹ. Đây là cặp bị hỏi đối chiếu liên tục nhất, và chữ khoá phân biệt là số lượng so với phần trăm. Khác biệt thực chất: nhóm của Top K luôn cùng kích thước, còn nhóm của Top P co giãn theo độ chắc chắn của mô hình.
- D. Ảnh hưởng tới khả năng chọn đầu ra xác suất thấp, tác động tới độ sáng tạo — đó là Temperature.
- C. Chỉ định chuỗi ký tự làm mô hình ngừng sinh — đó là Stop sequences.
A company is using Amazon Bedrock based Foundation Model in a Retrieval Augmented Generation (RAG) configuration to provide tailored insights and responses based on client data stored in Amazon S3. Each team within the company is assigned to different clients and uses the foundation model to generate insights specific to their clients' data. To maintain data privacy and security, the company needs to ensure that each team can only access the model responses generated from the data of their respective clients, preventing any unauthorized access to other teams' client data.
What is the most effective approach to implement this access control and maintain data security?
-
A
The company should create a single role for Amazon Bedrock with full access to Amazon S3 and then create separate IAM roles for each team that are limited to each team's clients data
-
B
The company should create a single IAM policy that grants read-only access to all S3 buckets for all teams
-
C
The company should create a service role for Amazon Bedrock for each team, granting access only to the specific team's clients data in Amazon S3
-
D
The company should configure S3 bucket policies to allow access to all teams but monitor usage through AWS CloudTrail logs to detect any unauthorized access
Xem giải thích
Đáp án
C — Tạo một service role cho Amazon Bedrock cho từng đội, mỗi role chỉ được truy cập dữ liệu khách hàng của đội đó trên S3
Vì sao đúng
Điểm mấu chốt cần hiểu là: khi Bedrock đọc dữ liệu từ S3 trong cấu hình RAG, nó dùng service role của chính nó, chứ không dùng quyền của người đang gọi. Vì vậy ranh giới cách ly phải nằm ở service role.
Tạo role riêng cho mỗi đội nghĩa là mỗi luồng RAG về mặt kỹ thuật không thể chạm tới dữ liệu của đội khác — không phụ thuộc vào việc ai gọi hay gọi thế nào. Đây là quyền tối thiểu áp ở đúng chỗ.
Vì sao các phương án khác sai
- A. Một service role cho Bedrock có toàn quyền S3, rồi tạo IAM role riêng cho từng đội — đây là bẫy tinh vi nhất và cần nói rõ vì sao hỏng: role của người dùng bị giới hạn, nhưng Bedrock vẫn chạy bằng role toàn quyền của nó. Chỉ cần một cấu hình knowledge base trỏ nhầm là dữ liệu đội khác lọt ra, và IAM role của người dùng không chặn được.
- B. Một chính sách IAM cho phép mọi đội đọc mọi bucket — không có cách ly nào.
- D. Cho mọi đội truy cập rồi giám sát bằng CloudTrail — giám sát là phát hiện sau khi việc đã xảy ra, không phải ngăn chặn. Với dữ liệu khách hàng thì biết mình đã rò rỉ không thay thế được việc không rò rỉ.
A healthcare company is implementing a machine learning solution to predict patient outcomes and improve treatment plans. The data science team is working to structure their workflow effectively, ensuring that they follow the correct steps in the machine learning process. Understanding the proper sequence of these steps will help the team streamline their project and ensure a successful implementation.
Given this context, which of the following would you recommend as the correct sequence of steps in the machine learning process?
-
A
Model training, Data collection, Data preprocessing, Model evaluation
-
B
Model evaluation, Model training, Data collection, Data preprocessing
-
C
Data collection, Data preprocessing, Model training, Model evaluation
-
D
Data preprocessing, Model evaluation, Model training, Data collection
Xem giải thích
Đáp án
C — Thu thập dữ liệu → Tiền xử lý dữ liệu → Huấn luyện mô hình → Đánh giá mô hình
Vì sao đúng
Thứ tự này là bắt buộc vì mỗi bước cần đầu ra của bước trước:
1. Thu thập dữ liệu → chưa có dữ liệu thì không làm gì được
2. Tiền xử lý → làm sạch, xử lý giá trị thiếu, chuẩn hoá, chia tập
3. Huấn luyện → mô hình học từ dữ liệu đã chuẩn bị
4. Đánh giá → đo trên tập kiểm tra, quyết định có triển khai không
Với dự án y tế trong đề, bước 2 thường chiếm nhiều thời gian nhất: dữ liệu bệnh án có giá trị thiếu, đơn vị đo không đồng nhất giữa các bệnh viện, và định dạng ngày tháng khác nhau.
Trong thực tế quy trình này lặp vòng chứ không đi thẳng một lần: đánh giá xong thấy chưa đạt thì quay lại thu thập thêm dữ liệu hoặc làm lại đặc trưng. Nhưng thứ tự các bước trong một vòng vẫn như trên.
Vì sao các phương án khác sai
Ba phương án còn lại đều đặt một bước trước cái mà nó phụ thuộc vào:
- A — huấn luyện trước khi có dữ liệu.
- B — đánh giá trước khi có mô hình.
- D — tiền xử lý trước khi thu thập, và đánh giá trước khi huấn luyện.
A retail company is looking to analyze its sales performance over the past 12 months to identify trends, track key performance indicators, and make informed strategic decisions. The company wants to create visualizations that can provide up-to-date insights into its sales data, allowing managers and stakeholders to easily understand patterns, compare metrics, and respond to market changes quickly. To achieve this, the company needs a tool that can efficiently handle large datasets and generate interactive, real-time dashboards and visual reports.
Which tool would be most suitable for creating visualizations that meet the company’s objectives?
-
A
The company should use CloudWatch Dashboard, which is designed for monitoring and visualizing metrics at scale
-
B
The company should use Amazon QuickSight, a business intelligence (BI) service that allows users to easily create and share interactive dashboards and visualizations from various data sources, including up-to-date sales data, enabling real-time insights and reporting
-
C
The company should use SageMaker Canvas, a no-code tool that allows users to build visualizations created by machine learning models
-
D
The company should use SageMaker Data Wrangler, as it includes built-in analyses that help you generate visualizations and data analyses in a few clicks
Xem giải thích
Đáp án
B — Amazon QuickSight
Vì sao đúng
QuickSight là dịch vụ business intelligence của AWS, dựng đúng cho việc đề mô tả: tạo bảng điều khiển tương tác và biểu đồ từ nhiều nguồn dữ liệu, chia sẻ cho quản lý và các bên liên quan.
Ba đặc điểm khớp trực tiếp với yêu cầu:
- Xử lý được tập dữ liệu lớn nhờ engine SPICE nạp dữ liệu vào bộ nhớ.
- Chia sẻ dễ — người xem chỉ cần trình duyệt, không cần cài gì.
- Trả tiền theo phiên cho người xem, nên mở rộng cho cả công ty không tốn nhiều.
Vì sao các phương án khác sai
- A. CloudWatch Dashboard — trực quan hoá chỉ số vận hành hạ tầng (CPU, độ trễ, lỗi), không phải dữ liệu nghiệp vụ. Đây là bẫy vì nó cũng có chữ "dashboard".
- D. SageMaker Data Wrangler — có biểu đồ dựng sẵn, nhưng chúng phục vụ khám phá dữ liệu trong lúc chuẩn bị, không phải bảng điều khiển cho lãnh đạo xem hằng ngày.
- C. SageMaker Canvas — xây mô hình học máy không cần viết mã; nó dự đoán chứ không phải công cụ báo cáo.
A technology company is planning to implement machine learning to improve its product recommendation system and optimize supply chain management. The data science team is evaluating different types of machine learning approaches. Gaining a clear understanding of these types will help them choose the right strategy for model development.
What of the following option would you suggest to the team as the three main types of machine learning?
-
A
Reinforcement Learning, Transfer Learning, Semi-supervised Learning
-
B
Deep Learning, Self-supervised Learning, Reinforcement Learning
-
C
Transfer Learning, Semi-supervised Learning, Self-supervised Learning
-
D
Supervised learning, Unsupervised learning, Deep Learning
Xem giải thích
Đáp án
D — Supervised learning, Unsupervised learning, Deep Learning
Vì sao đây là phương án được chấm đúng
Trong bốn phương án, chỉ D chứa hai nhánh nền tảng nhất của học máy:
- Học có giám sát — học từ dữ liệu có nhãn để dự đoán. Dùng cho chấm điểm tín dụng, dự báo nhu cầu, phân loại.
- Học không giám sát — tìm cấu trúc ẩn trong dữ liệu không nhãn. Dùng cho phân khúc khách hàng, phát hiện bất thường.
Ba phương án còn lại đều thiếu cả hai nhánh này, chỉ liệt kê các biến thể chuyên biệt (transfer learning, semi-supervised, self-supervised) — những thứ được xây trên nền hai nhánh trên chứ không thay thế chúng.
Ghi chú về chất lượng câu hỏi
Cần nói thẳng: cách phân loại chuẩn của ngành là supervised, unsupervised và reinforcement learning. Deep learning không phải một "loại" ngang hàng — nó là kỹ thuật dùng mạng nơ-ron nhiều tầng, và nó cắt ngang cả ba loại kia:
Học có giám sát ─┐
Học không giám sát ─┼─ đều có thể cài đặt bằng DEEP LEARNING
Học tăng cường ─┘
Không phương án nào trong câu này chứa bộ ba đúng, nên D là lựa chọn ít sai nhất — nó đúng ở hai phần ba. Điều đáng nhớ khi ôn thi vẫn là bộ ba chuẩn: có giám sát, không giám sát, tăng cường.
Is it possible to increase both the bias and variance of a machine learning model simultaneously?
-
A
Yes, it is possible to increase both bias and variance, but this typically leads to a model that performs poorly due to both underfitting and overfitting
-
B
No, increasing bias always decreases variance and vice versa, so they cannot be increased at the same time
-
C
Yes, increasing both bias and variance simultaneously will improve the model's accuracy and generalization capabilities
-
D
No, it is not possible to increase both bias and variance simultaneously, as they are inversely related
Xem giải thích
Đáp án
A — Có, tăng được cả hai, nhưng khi đó mô hình thường rất kém vì vừa thiếu khớp vừa quá khớp
Vì sao đúng
Đây là câu kiểm tra một hiểu lầm rất phổ biến. Bias và variance thường đánh đổi với nhau, nhưng đó không phải một ràng buộc toán học — chúng là hai nguồn lỗi độc lập, và cả hai cùng tệ là chuyện hoàn toàn có thể xảy ra.
Ví dụ cụ thể: một mô hình dùng sai họ hàm cho bài toán (bias cao vì giả định sai) và lại được huấn luyện trên quá ít dữ liệu nhiễu (variance cao vì đổi dữ liệu là kết quả đổi hẳn). Nó vừa không bắt được quy luật thật, vừa dao động mạnh giữa các lần huấn luyện.
Điều này cũng giải thích vì sao cụm "đánh đổi bias–variance" dễ gây hiểu nhầm: nó mô tả biên giới tối ưu — khi bạn đã ở trên đường tối ưu thì giảm cái này phải tăng cái kia. Nhưng một mô hình dở thì nằm hẳn bên trong vùng đó, và cải thiện được cả hai cùng lúc (ví dụ bằng cách thêm dữ liệu và chọn họ mô hình phù hợp hơn).
Vì sao các phương án khác sai
- B và D — đều khẳng định hai đại lượng luôn nghịch biến; đó chính là hiểu lầm mà câu hỏi nhắm tới.
- C. Tăng cả hai sẽ cải thiện độ chính xác và khả năng khái quát — vô lý: cả hai đều là lỗi, tăng lỗi thì mô hình chỉ tệ hơn.
A retail company is using Amazon Bedrock to enhance its product recommendation system with generative AI. To tailor the AI model to the company’s specific needs, the data science team is exploring different model customization methods, since understanding the valid customization options available for Amazon Bedrock is crucial for optimizing the model’s performance.
Which of the following represent valid model customization methods for Amazon Bedrock? (Select two)
-
A
Retrieval Augmented Generation (RAG)
-
B
Fine-tuning
-
C
Chain-of-thought prompting
-
D
Zero-shot prompting
-
E
Continued Pre-training
Xem giải thích
Đáp án
B và E — Fine-tuning và Continued Pre-training
Vì sao đúng
Amazon Bedrock có đúng hai phương pháp tuỳ chỉnh mô hình, và điểm chung của chúng là thay đổi trọng số để tạo ra một bản sao riêng của bạn:
| Fine-tuning | Continued Pre-training | |
|---|---|---|
| Dữ liệu | Có nhãn — cặp prompt và câu trả lời mẫu | Không nhãn — văn bản thô theo lĩnh vực |
| Dạy mô hình | Cách làm một nhiệm vụ cụ thể | Ngôn ngữ và khái niệm của lĩnh vực |
| Công chuẩn bị | Nặng — phải soạn từng cặp | Nhẹ — gom tài liệu sẵn có |
Cả hai đều tạo ra mô hình tuỳ chỉnh, và mô hình đó chỉ chạy được ở chế độ Provisioned Throughput — điểm cần nhớ vì nó quyết định chi phí.
Vì sao các phương án khác sai
Ba phương án còn lại không thay đổi mô hình — chúng chỉ đổi cách bạn dùng nó:
- A. RAG — bổ sung thông tin vào ngữ cảnh của prompt; trọng số giữ nguyên. Đây là phương án nhiễu chính vì RAG cũng "làm mô hình hợp với dữ liệu của bạn", nhưng theo cơ chế khác hẳn.
- C. Chain-of-thought prompting và D. Zero-shot prompting — là kỹ thuật viết prompt, nằm hoàn toàn ở phía người dùng.
A financial services company relies on several Independent Software Vendors (ISVs) for key operational applications and needs to maintain up-to-date compliance records to meet regulatory requirements. To streamline its compliance management process, the company wants to receive email notifications whenever new ISV compliance reports, such as SOC 2 or ISO certifications, become available, ensuring that its compliance team is promptly informed and can take necessary actions.
Which AWS service would be most suitable for automatically providing these notifications?
-
A
The company should use AWS Config to enable continuous monitoring of AWS resource configurations to ensure compliance with best practices and internal policies. Leverage the ntegration with Amazon Simple Notification Service (Amazon SNS) to receive notifications when the compliance reports are available
-
B
The company should use AWS Artifact to facilitate on-demand access to AWS compliance reports and agreements, as well as allow users to receive notifications when new compliance documents or reports, including ISV compliance reports, are available
-
C
The company should use AWS Audit Manager and leverage its integration with Amazon Simple Notification Service (Amazon SNS) to receive notifications when the compliance reports are available
-
D
The company should use AWS Trusted Advisor to receive notification alerts for best practices and recommendations to optimize AWS resources
Xem giải thích
Đáp án
B — AWS Artifact
Vì sao đúng
Chi tiết quyết định trong đề là "báo cáo tuân thủ của ISV" — tức là chứng chỉ SOC 2 và ISO của các nhà cung cấp phần mềm bên thứ ba, không phải của chính công ty.
AWS Artifact là nơi duy nhất cung cấp thứ đó. Nó có hai phần:
- Artifact Reports — báo cáo tuân thủ của AWS (SOC, ISO, PCI).
- Artifact Third-Party Reports — báo cáo tuân thủ của các ISV bán phần mềm trên AWS Marketplace, và đây chính là phần đề hỏi tới.
Artifact có thông báo qua email khi tài liệu mới được đăng, nên đội tuân thủ biết ngay mà không phải vào kiểm tra thủ công.
Vì sao các phương án khác sai
Ba phương án còn lại đều nói về môi trường AWS của chính bạn, không phải tài liệu của bên thứ ba:
- A. AWS Config — theo dõi thay đổi cấu hình tài nguyên của bạn.
- C. AWS Audit Manager — thu thập bằng chứng kiểm toán từ tài khoản của bạn; nó không phân phối chứng chỉ của ISV. Đây là phương án nhiễu gần nhất vì tên nghe rất "tuân thủ".
- D. AWS Trusted Advisor — khuyến nghị tối ưu tài nguyên.
A financial services company is exploring machine learning to automate credit scoring and fraud detection. The leadership team, new to this technology, needs to understand the core concept behind machine learning. Gaining clarity on this central idea will help them decide how to best apply machine learning to their business operations. The company has tasked you, as an AI Practitioner, to convey the central idea behind machine learning to the leadership team.
What do you recommend?
-
A
Machine learning only functions effectively when data is manually labeled and categorized by humans
-
B
Machine learning is primarily based on hardware configurations and does not rely on software algorithms or data analysis
-
C
Machine learning works by using predefined rules to generate outcomes without the need for data input
-
D
Machine learning involves training algorithms on large datasets to identify patterns and make predictions or decisions based on new data
Xem giải thích
Đáp án
D — Huấn luyện thuật toán trên tập dữ liệu lớn để nhận ra mẫu hình, rồi đưa ra dự đoán hoặc quyết định trên dữ liệu mới
Vì sao đúng
Định nghĩa này nêu đủ ba yếu tố làm nên học máy:
- Học từ dữ liệu — không phải được lập trình sẵn quy luật.
- Nhận ra mẫu hình — tìm ra quan hệ mà con người có thể không nhìn thấy.
- Áp dụng lên dữ liệu mới — đây là phần quan trọng nhất. Nhớ lại dữ liệu cũ thì bất kỳ cơ sở dữ liệu nào cũng làm được; giá trị nằm ở khái quát sang trường hợp chưa từng thấy.
Với công ty tài chính trong đề, điều này giải thích vì sao học máy hợp với phát hiện gian lận: mẫu hình gian lận thay đổi liên tục, nên một bộ luật cố định luôn tụt lại phía sau, còn mô hình học lại được từ dữ liệu mới.
Vì sao các phương án khác sai
- C. Dùng luật định sẵn, không cần dữ liệu đầu vào — đó là hệ chuyên gia dựa trên luật, thứ học máy thay thế.
- A. Chỉ hoạt động khi dữ liệu được con người gán nhãn thủ công — đúng với học có giám sát, nhưng bỏ sót học không giám sát và học tăng cường, vốn không cần nhãn.
- B. Chủ yếu dựa vào cấu hình phần cứng, không dựa vào thuật toán hay phân tích dữ liệu — sai hoàn toàn; phần cứng chỉ là phương tiện.