Ngân hàng đề — AWS Certified AI Practitioner
Tìm thấy 623 câu.
A customer service company is exploring ways to improve its AI-powered chatbot, seeking to balance automation with human input to ensure high-quality responses. The company is considering two approaches: Reinforcement Learning from Human Feedback (RLHF) and Amazon Augmented AI (A2I). However, the company needs to understand the primary differences between these two approaches, as it will help the company choose the right approach to enhance the chatbot's accuracy and reliability.
What would you recommend to the company?
-
A
RLHF is used exclusively for natural language processing tasks, whereas A2I is used for image recognition and analysis tasks
-
B
RLHF is a technique used to train AI models using human feedback to refine their behavior, whereas A2I is an AWS service that provides a human review of machine learning predictions to improve model accuracy and reliability
-
C
RLHF focuses on automatically generating data labels for training datasets, while A2I is used for unsupervised learning tasks
-
D
RLHF requires no human involvement during the training process, while A2I automates the entire machine learning workflow without human review
Xem giải thích
Đáp án
B — RLHF là kỹ thuật huấn luyện mô hình bằng phản hồi của con người; A2I là dịch vụ AWS đưa con người vào rà soát dự đoán của mô hình
Vì sao đúng
Hai thứ khác nhau ở bản chất và thời điểm áp dụng:
| RLHF | Amazon A2I | |
|---|---|---|
| Là gì | Kỹ thuật huấn luyện | Dịch vụ AWS |
| Khi nào | Trước khi triển khai | Trong lúc đang phục vụ |
| Con người làm gì | Xếp hạng các câu trả lời để dạy mô hình phần thưởng | Xem lại từng dự đoán độ tin cậy thấp |
| Kết quả | Trọng số mô hình thay đổi | Mô hình không đổi; kết quả đầu ra được sửa |
| Chi phí lâu dài | Một lần huấn luyện | Liên tục — mỗi lượt rà đều tốn công người |
Nói gọn: RLHF dạy mô hình cư xử tốt hơn; A2I bắt lỗi khi mô hình vẫn sai.
Với công ty chăm sóc khách hàng thì hai cái bổ sung cho nhau: A2I chặn câu trả lời tệ trước khi tới khách, và chính dữ liệu người rà soát sửa lại trở thành nguyên liệu cho vòng RLHF sau.
Vì sao các phương án khác sai
- A — phân biệt theo phương thức dữ liệu (RLHF cho văn bản, A2I cho ảnh); sai, cả hai đều không bó hẹp như vậy.
- C — nói RLHF tự động sinh nhãn; mâu thuẫn với chữ HF (human feedback) trong chính tên gọi.
- D — nói RLHF không cần con người và A2I tự động hoá hoàn toàn không có người rà; phủ nhận đúng đặc điểm cốt lõi của cả hai.
A retail company is exploring machine learning algorithms to improve its customer segmentation systems. The data science team is evaluating both K-Means and K-Nearest Neighbors (KNN) algorithms but needs to understand the key differences between them, since understanding these distinctions will help the team choose the right algorithm for their specific tasks.
Given this context, what do you recommend to the company?
-
A
K-Means is primarily used for regression tasks, while KNN is used for reducing the dimensionality of data
-
B
K-Means requires labeled data to form clusters, whereas KNN does not use labeled data for making predictions
-
C
K-Means is a supervised learning algorithm used for classification, while KNN is an unsupervised learning algorithm used for clustering
-
D
K-Means is an unsupervised learning algorithm used for clustering data points into groups, while KNN is a supervised learning algorithm used for classifying data points based on their proximity to labeled examples
Xem giải thích
Đáp án
D — K-Means là thuật toán không giám sát dùng để phân cụm; KNN là thuật toán có giám sát dùng để phân loại dựa trên khoảng cách tới các mẫu đã có nhãn
Vì sao đúng
Hai thuật toán có tên gần giống nhau và cùng dựa trên khoảng cách, nhưng thuộc hai nhóm khác hẳn:
| K-Means | KNN | |
|---|---|---|
| Kiểu học | Không giám sát | Có giám sát |
| Dữ liệu | Không nhãn | Có nhãn |
| Chữ K nghĩa là | Số cụm bạn muốn tạo | Số láng giềng gần nhất được xét |
| Có giai đoạn huấn luyện | Có — tính lặp tới khi tâm cụm ổn định | Không — chỉ lưu dữ liệu, tính lúc dự đoán |
| Kết quả | Nhóm mà thuật toán tự phát hiện | Nhãn cho một điểm mới |
Chữ K mang hai nghĩa khác nhau là chỗ dễ nhầm nhất, đáng nhớ riêng.
Với công ty bán lẻ trong đề, K-Means là lựa chọn cho phân khúc khách hàng: bạn chưa biết có bao nhiêu nhóm khách và mỗi nhóm là ai, thuật toán tự tìm ra.
Vì sao các phương án khác sai
- C — đảo ngược hoàn toàn hai thuật toán; đây là phương án nhiễu chính.
- B — nói K-Means cần dữ liệu có nhãn còn KNN thì không; cũng đảo ngược.
- A — gán K-Means cho hồi quy và KNN cho giảm chiều; sai cả hai.
A technology startup is building an AI-powered recommendation system and wants to streamline the development process. The product team is trying to understand the distinction between machine learning (ML) algorithms and ML models. Clarifying this difference will help the team better structure their project workflow.
What do you recommend?
-
A
An ML algorithm is responsible for the security of the machine learning pipeline, while an ML model manages data preprocessing
-
B
An ML algorithm is a pre-trained neural network, while an ML model is the raw data used to train the algorithm
-
C
An ML algorithm is a set of mathematical instructions for solving a specific type of problem, while an ML model is the output of the algorithm after being trained on data
-
D
An ML algorithm is used for storing large datasets, whereas an ML model is used for deploying applications
Xem giải thích
Đáp án
C — Thuật toán ML là tập chỉ dẫn toán học để giải một loại bài toán; mô hình ML là kết quả thu được sau khi thuật toán đó được huấn luyện trên dữ liệu
Vì sao đúng
Quan hệ giữa hai khái niệm là quy trình và sản phẩm:
Thuật toán + Dữ liệu ──huấn luyện──▶ Mô hình
(công thức) (nguyên liệu) (thành phẩm dùng được)
Ví dụ cụ thể: hồi quy tuyến tính là thuật toán — nó tồn tại độc lập và ai dùng cũng như nhau. Còn "mô hình dự đoán doanh số của công ty A" là mô hình — nó là hồi quy tuyến tính kèm những con số cụ thể học được từ dữ liệu của công ty A.
Hệ quả thực dụng: cùng một thuật toán chạy trên hai bộ dữ liệu khác nhau sinh ra hai mô hình khác nhau. Và khi bạn "triển khai" thứ gì đó lên sản xuất, bạn triển khai mô hình chứ không phải thuật toán.
Vì sao các phương án khác sai
- B — nói thuật toán là mạng nơ-ron đã huấn luyện còn mô hình là dữ liệu thô; đảo lộn cả ba khái niệm.
- A — gán thuật toán cho bảo mật pipeline và mô hình cho tiền xử lý dữ liệu; không liên quan.
- D — gán thuật toán cho lưu trữ dữ liệu và mô hình cho triển khai ứng dụng; cũng sai.
A healthcare company is developing a machine learning model to classify medical conditions based on patient data. The data science team needs to evaluate the model’s performance to ensure that it makes correct predictions, particularly for critical diagnoses. To do so, the team is considering various performance metrics commonly used for classification systems.
Which of the following performance metrics would you recommend to the team for evaluating the effectiveness of its classification system?
-
A
Mean Absolute Error (MAE), Root Mean Squared Error (RMSE) and R-squared
-
B
Precision, Recall and F1-Score
-
C
Throughput, Latency and Uptime
-
D
Bias and Variance
Xem giải thích
Đáp án
B — Precision, Recall và F1-Score
Vì sao đúng
Đây là bài toán phân loại, và ba chỉ số này là bộ tiêu chuẩn cho phân loại. Với chẩn đoán y khoa thì việc phân biệt chúng đặc biệt quan trọng:
| Chỉ số | Trả lời câu hỏi | Ý nghĩa trong chẩn đoán |
|---|---|---|
| Precision | Trong số ca báo dương, bao nhiêu đúng? | Cao thì ít báo động giả — bệnh nhân khoẻ không phải làm xét nghiệm thừa |
| Recall | Trong số ca thật sự có bệnh, bắt được bao nhiêu? | Cao thì ít bỏ sót — điều quan trọng nhất với bệnh nặng |
| F1 | Trung bình điều hoà của hai cái trên | Một con số cân bằng cả hai |
Đề nhấn vào "chẩn đoán quan trọng", và với những ca đó thì recall được ưu tiên: bỏ sót một ca ung thư nguy hiểm hơn nhiều so với báo động giả rồi xét nghiệm lại.
Đây cũng là lý do accuracy không có trong đáp án: với bệnh hiếm gặp ở 1% dân số, mô hình luôn đoán "không bệnh" đạt accuracy 99% mà hoàn toàn vô dụng.
Vì sao các phương án khác sai
- A. MAE, RMSE, R-squared — chỉ số của bài toán hồi quy, đo sai lệch giữa hai con số.
- C. Throughput, Latency, Uptime — chỉ số vận hành, không nói gì về độ đúng.
- D. Bias và Variance — là khái niệm chẩn đoán để hiểu mô hình đang thiếu khớp hay quá khớp, không phải chỉ số đo hiệu năng phân loại.
A hiring platform is developing a machine learning model to help companies screen job candidates. During testing, the data science team notices that the model seems to favor certain demographic groups over others. The team suspects that the training data may reflect historical biases from previous hiring practices, leading to biased predictions. To address this issue, the team wants to understand how human bias can influence machine learning outcomes.
Which of the following represents the best-fit explanation for the given scenario?
-
A
A data scientist selects features for a machine learning model based on their personal beliefs about which attributes are important, leading to a biased model
-
B
A machine learning model trained on historical hiring data consistently recommends male candidates for technical roles
-
C
A machine learning algorithm predicts customer churn based on historical data, but the data is skewed due to seasonal trends
-
D
An automated translation service frequently makes errors when translating idiomatic expressions between languages
Xem giải thích
Đáp án
A — Nhà khoa học dữ liệu chọn đặc trưng dựa trên niềm tin cá nhân về thuộc tính nào quan trọng, dẫn tới mô hình bị lệch
Vì sao đúng
Câu hỏi tìm ví dụ về thiên kiến của con người ảnh hưởng tới kết quả học máy — tức là chỗ con người trực tiếp đưa thiên kiến vào, chứ không phải chỗ mô hình biểu hiện ra sự lệch.
Chọn đặc trưng là một trong những khâu chủ quan nhất của quy trình: quyết định đưa hay không đưa một thuộc tính vào mô hình hoàn toàn nằm ở phán đoán của người làm. Nếu người đó tin rằng "trường đại học danh tiếng là chỉ dấu tốt cho năng lực", niềm tin ấy được mã hoá thẳng vào mô hình — và nó lại tương quan với hoàn cảnh kinh tế xã hội.
Nguy hiểm ở chỗ không có dấu vết nào để lần ra: đặc trưng bị loại không xuất hiện ở đâu cả, nên không ai kiểm tra được quyết định đó.
Vì sao các phương án khác sai
- B. Mô hình huấn luyện trên dữ liệu tuyển dụng lịch sử liên tục đề xuất ứng viên nam — đây chính là tình huống mô tả trong đề, và cũng là một dạng lệch có thật. Nhưng nó là hậu quả quan sát được ở đầu ra, tức là sai lệch thuật toán, chứ không phải mô tả cơ chế con người đưa thiên kiến vào. Câu hỏi hỏi cái sau.
- C. Dữ liệu lệch do yếu tố mùa vụ — là sai lệch thời gian trong dữ liệu, không có con người nào trong đó.
- D. Dịch máy sai thành ngữ — là giới hạn kỹ thuật, không phải thiên kiến.
Ghi chú về cách hỏi
Cần nói thẳng rằng phần đầu đề bài mô tả đúng tình huống của phương án B, nên B rất dễ được chọn. Điểm phân biệt nằm ở câu hỏi cuối: nó hỏi human bias ảnh hưởng thế nào, tức là hỏi nguồn gốc chứ không hỏi biểu hiện. Khi gặp dạng này, hãy đọc lại đúng câu hỏi cuối thay vì khớp theo bối cảnh.
A financial services company is deploying a machine learning model using Amazon Bedrock to predict loan approval risks. The data science team needs to ensure that the model performs effectively before going into production. They are focused on understanding the correct practices and tools for model evaluation on Amazon Bedrock to ensure accuracy, fairness, and reliability in their predictions.
Which of the following are correct regarding model evaluation for Amazon Bedrock? (Select two)
-
A
Automatic model evaluation provides model scores that are calculated using various statistical methods such as BERT Score and F1
-
B
Human model evaluation is valuable for assessing qualitative aspects of the model, whereas, automatic model valuation is valuable for assessing quantitative aspects of the model
-
C
For human model evaluation, you can use either built-in prompt datasets or your own prompt datasets
-
D
Automatic model evaluation is valuable for assessing qualitative aspects of the model, whereas, human model valuation is valuable for assessing quantitative aspects of the model
-
E
Human model evaluation provides model scores that are calculated using various statistical methods such as BERT Score and F1
Xem giải thích
Đáp án
A và B
Vì sao đúng
Amazon Bedrock có hai hình thức đánh giá mô hình, và hai phương án này mô tả đúng phân công của chúng:
- A. Đánh giá tự động cho điểm bằng các phương pháp thống kê như BERT Score và F1 — đúng: nó chạy mô hình trên tập prompt rồi tính chỉ số số học, không cần người tham gia.
- *B. Đánh giá bởi con người dùng cho khía cạnh định tính, đánh giá tự động dùng cho khía cạnh định lượng — đây là sự phân công đúng và cũng là lý do cần cả hai.
| Tự động | Bởi con người | |
|---|---|---|
| Đo | Định lượng — độ chính xác, độ mạnh, độ độc hại | Định tính — giọng điệu, tính hữu ích, phù hợp thương hiệu |
| Cho ra | Điểm số (BERT Score, F1) | Nhận xét và xếp hạng |
| Tốc độ, chi phí | Nhanh, rẻ | Chậm, tốn công |
Vì sao các phương án khác sai
- D — đảo ngược B: gán định tính cho tự động và định lượng cho con người.
- E — đảo ngược A: nói đánh giá bởi con người cho ra BERT Score và F1; những chỉ số đó là phép tính thống kê, con người không chấm theo cách đó.
- C. Đánh giá bởi con người dùng được cả tập prompt dựng sẵn lẫn tập của bạn — nghe rất hợp lý, nhưng ở Bedrock thì tập prompt dựng sẵn thuộc về đánh giá tự động; đánh giá bởi con người dùng tập prompt của chính bạn. Đây là phương án nhiễu tinh vi nhất.
A healthcare company is considering using Amazon Bedrock to develop AI solutions that handle sensitive patient data, such as medical records and diagnostic information. Given the strict regulatory requirements in healthcare, the company needs to ensure that Amazon Bedrock provides robust data security and compliance features. The company is evaluating the platform's capabilities to safeguard data and meet compliance standards like HIPAA.
Which of the following is correct regarding the data security and compliance aspects of Amazon Bedrock for the given use case?
-
A
The company's data is not used to improve the base Foundation Models (FMs) and it is not shared with any model providers
-
B
The company's data is used to improve the base Foundation Models (FMs) and it is also shared with the model providers for model optimization
-
C
The company's data is not used to improve the base Foundation Models (FMs), however, it is shared with the model providers for model optimization
-
D
The company's data is only used to improve the base Foundation Models (FMs), however, it is not shared with any model providers
Xem giải thích
Đáp án
A — Dữ liệu của công ty không được dùng để cải thiện Foundation Model nền, và không được chia sẻ với nhà cung cấp mô hình
Vì sao đúng
Đây là cam kết cốt lõi của Amazon Bedrock về quyền riêng tư dữ liệu, và nó gồm hai vế tách bạch:
- Không dùng để huấn luyện — prompt và phản hồi của bạn không quay lại làm dữ liệu huấn luyện cho mô hình nền.
- Không chia sẻ với nhà cung cấp — kể cả Anthropic, Meta hay AI21 cũng không thấy dữ liệu của bạn.
Kèm theo đó là các đặc điểm kỹ thuật hỗ trợ: dữ liệu mã hoá khi truyền và khi lưu, kết nối riêng qua VPC endpoint không đi ra Internet, và nếu bạn tinh chỉnh thì bản sao mô hình tuỳ chỉnh là của riêng bạn, không ảnh hưởng tới mô hình nền mà người khác dùng.
Với công ty y tế thì đó là điều kiện cần: Bedrock đủ điều kiện HIPAA, và cam kết trên là nền để ký được BAA.
Vì sao các phương án khác sai
Ba phương án còn lại đều vi phạm ít nhất một trong hai vế:
- B — nói dữ liệu vừa dùng để huấn luyện vừa chia sẻ với nhà cung cấp.
- C — không dùng huấn luyện nhưng vẫn chia sẻ với nhà cung cấp.
- D — không chia sẻ nhưng vẫn dùng để huấn luyện.
In the context of the AWS Shared Responsibility Model, which statement best describes the security responsibilities of both AWS and the customer when using Amazon Bedrock for generative AI applications?
-
A
AWS is responsible for the security of the AI models and customer data, while the customer is responsible for securing the physical infrastructure
-
B
AWS is responsible for securing the infrastructure that runs Amazon Bedrock, while the customer is responsible for securing their data and managing access controls
-
C
The customer is responsible for the entire security stack, including the underlying infrastructure and the AI models
-
D
AWS handles all aspects of security for Amazon Bedrock, relieving the customer of any security responsibilities
Xem giải thích
Đáp án
*B — AWS chịu trách nhiệm bảo mật hạ tầng chạy Amazon Bedrock; khách hàng chịu trách nhiệm bảo vệ dữ liệu và quản lý kiểm soát truy cập
Vì sao đúng
Đây là mô hình trách nhiệm chung áp cho Bedrock, và ranh giới không đổi so với các dịch vụ khác:
| AWS | Khách hàng | |
|---|---|---|
| Chịu trách nhiệm | Bảo mật CỦA đám mây | Bảo mật TRONG đám mây |
| Cụ thể với Bedrock | Trung tâm dữ liệu, phần cứng, hạ tầng phục vụ mô hình, vá lỗi nền tảng | Dữ liệu, chính sách IAM, cấu hình Guardrails, mã hoá bằng khoá riêng, nội dung prompt |
Vì Bedrock là dịch vụ được quản lý, AWS gánh phần lớn hơn so với EC2 — bạn không phải vá hệ điều hành hay quản lý máy chủ suy luận. Nhưng dữ liệu và quản lý truy cập thì luôn thuộc về khách hàng, ở mọi dịch vụ không có ngoại lệ.
Một điểm riêng cho AI sinh: nội dung của prompt và cách bạn cấu hình rào chắn cũng là trách nhiệm của bạn. AWS cung cấp Guardrails, nhưng bật nó lên và khai chính sách là việc của bạn.
Vì sao các phương án khác sai
- A — nói AWS chịu trách nhiệm về dữ liệu khách hàng còn khách hàng lo an ninh vật lý; đảo ngược hoàn toàn, và an ninh vật lý là thứ khách hàng không bao giờ chạm tới được.
- D. AWS lo hết, khách hàng không có trách nhiệm gì — sai; cấu hình sai IAM là lỗ hổng của bạn.
- C. Khách hàng lo toàn bộ, kể cả hạ tầng bên dưới — sai theo chiều ngược lại; đó là mô hình tự vận hành tại chỗ.
A technology consulting firm is advising a client on how to integrate AI into their customer service and content creation workflows. The client is particularly interested in using Large Language Models (LLMs) for tasks such as automating customer support, generating marketing content, and processing large volumes of text data. To ensure they choose the right applications, the team needs to understand the potential uses of LLMs across different industries and business functions.
What do you suggest?
-
A
LLMs are used for designing and generating 3D models for use in various applications such as gaming, virtual reality, or industrial design
-
B
LLMs are used for generating human-like text, translating languages, summarizing text, and answering questions based on large datasets
-
C
LLMs are used to synthesize realistic human speech from text inputs
-
D
LLMs are used for creating videos from textual descriptions
Xem giải thích
Đáp án
B — LLM dùng để sinh văn bản giống người viết, dịch ngôn ngữ, tóm tắt văn bản và trả lời câu hỏi dựa trên tập dữ liệu lớn
Vì sao đúng
Phương án này liệt kê đúng bốn nhóm nhiệm vụ cốt lõi của mô hình ngôn ngữ lớn, và cả bốn đều khớp với nhu cầu trong đề:
| Nhiệm vụ | Ứng dụng của khách hàng |
|---|---|
| Sinh văn bản | Soạn nội dung tiếp thị |
| Trả lời câu hỏi | Tự động hoá hỗ trợ khách hàng |
| Tóm tắt | Xử lý khối lượng lớn văn bản |
| Dịch | Phục vụ thị trường nhiều ngôn ngữ |
Sợi chỉ chung: đầu vào và đầu ra đều là văn bản. Đó là ranh giới định nghĩa của LLM.
Vì sao các phương án khác sai
Ba phương án còn lại đều là phương thức dữ liệu khác, thuộc về các loại mô hình khác:
- C. Tổng hợp giọng nói tự nhiên từ văn bản — đó là text-to-speech (Amazon Polly).
- D. Tạo video từ mô tả bằng chữ — mô hình sinh video.
- A. Thiết kế và sinh mô hình 3D — mô hình sinh 3D, một lĩnh vực riêng.
Cả ba nhận đầu vào là văn bản, nên nghe có vẻ liên quan — nhưng đầu ra không phải văn bản, và đó là chỗ chúng nằm ngoài định nghĩa LLM.
In the context of data governance for AI systems on AWS, what is the primary difference between data residency and data logging?
-
A
Data residency refers to where data is physically stored, while data logging tracks data access and changes over time
-
B
Data residency involves monitoring real-time data usage, while data logging manages data lifecycle policies
-
C
Data residency tracks user activities within an AI system, while data logging determines where data can be geographically stored
-
D
Data residency is concerned with data encryption, while data logging focuses on data transformation processes
Xem giải thích
Đáp án
*A — Data residency là nơi dữ liệu được lưu về mặt vật lý; data logging là ghi lại việc truy cập và thay đổi dữ liệu theo thời gian
Vì sao đúng
Hai khái niệm quản trị dữ liệu trả lời hai câu hỏi khác nhau:
| Data residency | Data logging | |
|---|---|---|
| Câu hỏi | Dữ liệu nằm ở đâu? | Ai đã làm gì với dữ liệu? |
| Chi phối bởi | Luật chủ quyền dữ liệu, quy định nội địa hoá | Yêu cầu kiểm toán và truy vết |
| Thực thi trên AWS bằng | Chọn Region, dùng SCP chặn region khác | CloudTrail, S3 access log, CloudWatch Logs |
| Trả lời được | "Dữ liệu bệnh nhân có rời khỏi Việt Nam không?" | "Ai đã đọc hồ sơ này lúc 3 giờ sáng?" |
Với hệ thống AI thì cả hai đều cần và không thay thế nhau: lưu đúng nơi quy định nhưng không ghi nhật ký thì khi có sự cố bạn không chứng minh được điều gì.
Vì sao các phương án khác sai
- C — đảo ngược hai định nghĩa; đây là phương án nhiễu chính.
- B — gán residency cho giám sát thời gian thực và logging cho chính sách vòng đời dữ liệu; cái sau thực ra là data retention, một khái niệm thứ ba.
- D — gán residency cho mã hoá và logging cho biến đổi dữ liệu; cả hai đều lệch.