Ngân hàng đề — AWS Certified AI Practitioner
Tìm thấy 623 câu.
A financial services company is developing machine learning models to improve fraud detection and credit risk assessment. However, given the complexity of these tasks, the team wants to incorporate human input at key stages of the machine learning lifecycle to ensure that the models are accurate and relevant. The company is looking for an AWS service that allows human input and feedback to be integrated into the model development process, improving the overall performance and trustworthiness of the models.
What do you suggest?
-
A
Amazon SageMaker Feature Store
-
B
Amazon SageMaker Clarify
-
C
Amazon SageMaker Role Manager
-
D
Amazon SageMaker Ground Truth
Xem giải thích
Đáp án
D — Amazon SageMaker Ground Truth
Vì sao đúng
Đề nêu đúng khẩu hiệu của Ground Truth: đưa ý kiến và phản hồi của con người vào quy trình phát triển mô hình, xuyên suốt vòng đời học máy chứ không chỉ ở một bước.
Ground Truth cung cấp hạ tầng cho việc đó: đội gán nhãn (nhân viên nội bộ, nhà cung cấp, hoặc lực lượng Mechanical Turk), giao diện làm việc dựng sẵn, cơ chế đồng thuận giữa nhiều người, và gán nhãn tự động cho phần dễ để giảm chi phí.
Với bài toán phát hiện gian lận, sự tham gia của con người có giá trị đặc biệt: chỉ chuyên gia mới xác nhận được một giao dịch đáng ngờ là gian lận thật hay chỉ bất thường vô hại.
Vì sao các phương án khác sai
- B. Clarify — phát hiện sai lệch và giải thích dự đoán; hoàn toàn tự động, không có con người tham gia.
- A. Feature Store — lưu và phục vụ đặc trưng.
- C. Role Manager — công cụ tạo vai IAM cho người dùng SageMaker; là quản trị quyền, không liên quan tới chất lượng mô hình.
Lưu ý về một dịch vụ gần giống
Amazon A2I cũng đưa con người vào, nhưng ở giai đoạn suy luận — rà lại từng dự đoán có độ tin cậy thấp khi mô hình đã chạy. Ground Truth làm việc ở giai đoạn chuẩn bị dữ liệu.
A healthcare company is using machine learning models in Amazon SageMaker to predict patient outcomes based on various health indicators. To comply with regulatory requirements and build trust with medical professionals, the company needs to understand and explain how different input features, such as age, blood pressure, and medical history, contribute to the model’s predictions. The company is exploring which Amazon SageMaker service can provide this level of transparency and interpretability for their machine learning models.
Which Amazon SageMaker service will help the company understand how an input feature contributes to the predictions of a machine learning model?
-
A
Amazon SageMaker JumpStart
-
B
Amazon SageMaker Clarify
-
C
Amazon SageMaker Canvas
-
D
Amazon SageMaker Ground Truth
Xem giải thích
Đáp án
B — Amazon SageMaker Clarify
Vì sao đúng
Clarify là dịch vụ giải thích đặc trưng đầu vào đóng góp bao nhiêu vào dự đoán, dựa trên giá trị SHAP — một phương pháp có nền tảng lý thuyết trò chơi, phân bổ "công" của kết quả cho từng đặc trưng.
Kết quả có dạng rất cụ thể, ví dụ cho một bệnh nhân:
Nguy cơ biến cố tim mạch: 73%
Huyết áp (160/95) +0,28
Tuổi (68) +0,19
Cholesterol (240) +0,15
Không hút thuốc −0,09
Với công ty y tế thì đây đúng thứ cần: bác sĩ đối chiếu được với hiểu biết lâm sàng, và cơ quan quản lý có căn cứ để chấp nhận hệ thống.
Clarify cũng đo được sai lệch ở cả hai giai đoạn — trong dữ liệu huấn luyện và trong dự đoán.
Vì sao các phương án khác sai
- D. Ground Truth — gán nhãn dữ liệu, thuộc giai đoạn trước.
- C. Canvas — xây mô hình không cần viết mã.
- A. JumpStart — kho mô hình dựng sẵn.
A company needs a solution that can convert text into human speech so that it can offer audio courses in multiple languages.
Which AWS service is the best fit for this use case ?
-
A
Amazon Polly
-
B
Amazon Translate
-
C
Amazon Comprehend
-
D
Amazon Lex
Xem giải thích
Đáp án
A — Amazon Polly
Vì sao đúng
Polly là dịch vụ chuyển văn bản thành giọng nói (text-to-speech) của AWS, hỗ trợ hàng chục ngôn ngữ với nhiều giọng cho mỗi ngôn ngữ — đúng nhu cầu làm khoá học âm thanh đa ngôn ngữ.
Hai điểm hữu ích cho bối cảnh giáo dục: giọng Neural TTS nghe tự nhiên hơn hẳn thế hệ cũ, và SSML cho phép điều khiển tốc độ đọc, ngắt nghỉ và nhấn nhá — quan trọng khi đọc nội dung học tập có thuật ngữ.
Vì sao các phương án khác sai
Ba phương án còn lại xử lý văn bản nhưng đầu ra không phải giọng nói:
- B. Amazon Translate — dịch văn bản sang văn bản. Nó là bước bổ trợ hữu ích (dịch nội dung rồi mới cho Polly đọc), nhưng bản thân không tạo ra âm thanh.
- C. Amazon Comprehend — phân tích văn bản (cảm xúc, thực thể, chủ đề).
- D. Amazon Lex — xây giao diện hội thoại; nó dùng Polly để nói, nhưng nó là chatbot chứ không phải dịch vụ chuyển văn bản thành giọng nói.
Ghi nhớ hướng đi của dữ liệu
| Dịch vụ | Vào → Ra |
|---|---|
| Polly | Văn bản → Giọng nói |
| Transcribe | Giọng nói → Văn bản |
A tech startup is customizing a Foundation Model using Amazon Bedrock to enhance its machine learning capabilities for analyzing customer behavior and predicting market trends. As part of this customization, the company needs to perform model validation to ensure the model is accurately trained and tuned for its specific use case. To facilitate this, the company must choose an appropriate dataset storage location that is fully supported by Amazon Bedrock for storing and accessing the large datasets required for validation.
Which of the following storage options would be the most suitable for this task?
-
A
The company should use Amazon EBS , a block storage service designed to provide persistent storage for Amazon Bedrock
-
B
The company should use Amazon EFS, which is a managed file storage service that allows shared access to file data for Amazon Bedrock
-
C
The company should use Amazon RDS, which is a managed relational database service for structured data
-
D
The company should use Amazon S3, which is a scalable object storage service fully integrated with Amazon Bedrock
Xem giải thích
Đáp án
D — Amazon S3
Vì sao đúng
Amazon Bedrock đọc và ghi dữ liệu qua Amazon S3 cho mọi tác vụ liên quan tới dữ liệu: tập huấn luyện khi tinh chỉnh, tập kiểm định, kết quả đầu ra, và cả kết quả của batch inference.
Lý do S3 là lựa chọn kiến trúc đúng ở đây: nó là kho đối tượng nên chứa được tập dữ liệu rất lớn, truy cập qua API từ dịch vụ được quản lý mà không cần gắn vào máy nào, và tích hợp sẵn với IAM để phân quyền.
Cấu hình thực tế: bạn đặt tệp lên S3, rồi khai đường dẫn s3://... trong cấu hình job tuỳ chỉnh mô hình, đồng thời cấp cho service role của Bedrock quyền đọc bucket đó.
Vì sao các phương án khác sai
Ba phương án còn lại không được Bedrock hỗ trợ làm nguồn dữ liệu, và lý do mang tính kiến trúc:
- A. Amazon EBS — kho khối, phải gắn vào một instance EC2 mới dùng được; Bedrock là dịch vụ được quản lý, không có instance nào của bạn để gắn vào.
- B. Amazon EFS — kho tệp chia sẻ qua NFS, cần nằm trong VPC và mount vào máy.
- C. Amazon RDS — cơ sở dữ liệu quan hệ cho dữ liệu có cấu trúc, không phải nơi chứa tập dữ liệu huấn luyện.
A business needs an automated solution that can extract text from thousands of receipts and invoices generated across all its stores.
Which AWS Machine Learning (ML) service can offer the most optimal solution for this use case ?
-
A
Amazon Transcribe
-
B
Amazon Textract
-
C
Amazon Comprehend
-
D
Amazon Rekognition
Xem giải thích
Đáp án
B — Amazon Textract
Vì sao đúng
Textract dựng riêng cho việc trích xuất chữ và dữ liệu từ tài liệu đã quét, và nó làm nhiều hơn một công cụ OCR thông thường: nó hiểu cấu trúc tài liệu.
Với hoá đơn và biên lai — đúng trường hợp trong đề — Textract có API chuyên biệt (AnalyzeExpense) trả về cặp trường và giá trị đã được nhận dạng: tên nhà cung cấp, ngày, tổng tiền, thuế, từng dòng hàng. Bạn nhận được dữ liệu có cấu trúc để nạp thẳng vào hệ thống kế toán, chứ không phải một khối chữ rời rạc cần tự bóc tách.
Nó cũng đọc được bảng và biểu mẫu, thứ mà OCR thuần thường làm hỏng.
Vì sao các phương án khác sai
- D. Amazon Rekognition — có tính năng
DetectText, nhưng nó dựng cho chữ trong cảnh vật (biển hiệu, biển số xe), chỉ trả về chuỗi rời rạc kèm toạ độ. Nó không hiểu đây là hoá đơn và không tách được trường. Đây là phương án nhiễu gần nhất. - C. Amazon Comprehend — phân tích văn bản đã có sẵn; nó là bước sau Textract chứ không đọc được ảnh.
- A. Amazon Transcribe — chuyển giọng nói thành văn bản.
A healthcare organization is deploying machine learning models to assist in patient diagnosis and treatment planning. To ensure responsible use and compliance with healthcare regulations, the data science team needs a tool that offers clear guidance on how each model should be used, along with an assessment of the potential risks associated with its deployment. Understanding these factors is critical for maintaining transparency and trust in the AI models used in such sensitive applications.
Which AWS tool do you recommend for the given use case?
-
A
Amazon SageMaker Model Cards
-
B
Amazon SageMaker Canvas
-
C
Amazon SageMaker Ground Truth
-
D
Amazon SageMaker Model Monitor
Xem giải thích
Đáp án
A — Amazon SageMaker Model Cards
Vì sao đúng
Đề nêu hai thứ cần có: hướng dẫn rõ ràng về cách mỗi mô hình nên được dùng, và đánh giá rủi ro tiềm tàng khi triển khai. Cả hai đều là trường thông tin trong model card.
Model card là hồ sơ đi kèm mô hình, ghi lại: mục đích sử dụng dự kiến, xếp hạng rủi ro (thấp / trung bình / cao), chi tiết huấn luyện, chỉ số đánh giá, kết quả kiểm tra sai lệch, và những quan sát cần lưu ý.
Với tổ chức y tế thì giá trị lớn nhất là tính bền theo thời gian: người xây mô hình có thể chuyển việc, nhưng model card vẫn ở đó để người tiếp quản biết mô hình này được huấn luyện trên dữ liệu nào và không nên dùng cho việc gì.
Vì sao các phương án khác sai
- D. Model Monitor — theo dõi mô hình đang chạy để phát hiện trôi dữ liệu; nó cho biết mô hình đang xuống cấp, không phải tài liệu về cách dùng và rủi ro. Đây là phương án nhiễu gần nhất vì cùng thuộc nhóm quản trị mô hình.
- B. Canvas — xây mô hình không cần viết mã.
- C. Ground Truth — gán nhãn dữ liệu.
A company is using a generative AI model to summarize a text based on a given prompt without providing specific examples in the prompt instructions.
What type of prompting technique does the given use case represent?
-
A
Negative prompting
-
B
Few shot Prompting
-
C
Zero shot Prompting
-
D
Chain-of-thought prompting
Xem giải thích
Đáp án
C — Zero shot Prompting
Vì sao đúng
Zero-shot nghĩa là không đưa ví dụ nào trong prompt — bạn chỉ mô tả nhiệm vụ và giao dữ liệu. Đúng như đề mô tả: tóm tắt một văn bản mà không kèm ví dụ mẫu.
Zero-shot: "Tóm tắt đoạn văn sau: [văn bản]"
Few-shot: "Ví dụ 1: [văn bản A] → [tóm tắt A]
Ví dụ 2: [văn bản B] → [tóm tắt B]
Giờ hãy tóm tắt: [văn bản C]"
Zero-shot làm được là nhờ Foundation Model đã học nhiệm vụ tóm tắt trong giai đoạn huấn luyện trước. Với những nhiệm vụ phổ biến, nó thường đủ tốt — và rẻ hơn vì tốn ít token hơn.
Khi nào cần few-shot: khi bạn muốn định dạng đầu ra cụ thể hoặc nhiệm vụ đặc thù mà mô tả bằng lời không đủ rõ.
Vì sao các phương án khác sai
- B. Few shot Prompting — có kèm ví dụ; đề nói rõ không có ví dụ nào.
- D. Chain-of-thought prompting — yêu cầu mô hình trình bày từng bước suy luận.
- A. Negative prompting — khai những gì không được xuất hiện trong kết quả.
A media company is developing a machine learning model to categorize its vast library of content. The data science team is trying to decide between using multi-class or multi-label classification based on the complexity of the content categories. Understanding the differences between multi-class and multi-label classification will help the team choose the most appropriate approach for organizing their content effectively.
What do you recommend to the company?
-
A
Multi-class classification allows each instance to belong to multiple classes simultaneously, whereas multi-label classification restricts each instance to one class only
-
B
Multi-class classification does not require labeled data, whereas multi-label classification requires labeled data for training
-
C
Multi-class classification assigns each instance to one of several possible classes, while multi-label classification assigns each instance to one or more classes
-
D
Multi-class classification is used exclusively for image data, whereas multi-label classification is used exclusively for text data
Xem giải thích
Đáp án
C — Multi-class gán mỗi mẫu vào một trong nhiều lớp; multi-label gán mỗi mẫu vào một hoặc nhiều lớp
Vì sao đúng
Khác biệt nằm ở chỗ các lớp có loại trừ nhau hay không:
| Multi-class | Multi-label | |
|---|---|---|
| Mỗi mẫu nhận | Đúng một nhãn | Một hoặc nhiều nhãn |
| Các lớp | Loại trừ nhau | Không loại trừ |
| Ví dụ nội dung | Thể loại chính: hành động hoặc hài hoặc kinh dị | Thẻ mô tả: hành động và hài và dành cho gia đình |
| Tầng đầu ra | Softmax — tổng xác suất bằng 1 | Sigmoid cho từng nhãn độc lập |
Với công ty truyền thông trong đề, thường cả hai đều cần: multi-class cho thể loại chính (mỗi phim một thể loại để xếp danh mục), multi-label cho hệ thống thẻ (một phim có thể vừa hành động vừa hài).
Câu hỏi cần đặt ra khi chọn: một mẫu có thể thuộc nhiều nhóm cùng lúc không? Có thì multi-label.
Vì sao các phương án khác sai
- A — đảo ngược hai định nghĩa; đây là phương án nhiễu chính.
- B — nói multi-class không cần dữ liệu có nhãn; sai, cả hai đều là học có giám sát.
- D — gán multi-class cho ảnh và multi-label cho văn bản; cả hai áp dụng được cho mọi loại dữ liệu.
A company needs to support human reviews and audits for its ML model predictions. The solution should be easy to implement and have the facility to add multiple reviewers.
Which AWS service do you recommend for this use case?
-
A
Amazon SageMaker Ground Truth
-
B
Amazon Augmented AI (A2I)
-
C
Amazon Forecast
-
D
AWS DeepRacer
Xem giải thích
Đáp án
B — Amazon Augmented AI (A2I)
Vì sao đúng
A2I dựng đúng cho việc đề nêu: đưa người vào rà soát và kiểm toán dự đoán của mô hình, dễ triển khai, và thêm được nhiều người rà soát.
Cách hoạt động: bạn khai một luồng công việc con người với điều kiện kích hoạt — thường là độ tin cậy dưới ngưỡng, nhưng cũng có thể là lấy mẫu ngẫu nhiên để kiểm toán định kỳ. Dự đoán nào rơi vào điều kiện đó sẽ được đưa vào hàng chờ cho người xem.
Về yêu cầu "nhiều người rà soát": A2I cho phép cấu hình nhiều người cùng xem một mẫu rồi lấy kết quả theo đồng thuận — cách nâng độ tin cậy khi quyết định quan trọng.
Nó cũng tích hợp sẵn với Rekognition và Textract, và ghép được với mô hình tuỳ chỉnh bất kỳ.
Vì sao các phương án khác sai
- A. SageMaker Ground Truth — cũng có con người, nhưng để gán nhãn dữ liệu huấn luyện, tức là trước khi có mô hình. A2I xen vào lúc mô hình đang phục vụ. Đây là cặp hay bị lẫn nhất.
- C. Amazon Forecast — dự báo chuỗi thời gian.
- D. AWS DeepRacer — nền tảng học về học tăng cường qua xe đua mô hình.
A manufacturing company is developing a machine learning model to optimize its supply chain operations. The data science team needs to prepare the dataset by dividing it into train, test, and validation sets to ensure the model is trained effectively and performs well on unseen data.
Which of the following is the best fit to create train, test, and validation splits on your data for machine learning?
-
A
Amazon SageMaker Clarify
-
B
Amazon SageMaker Feature Store
-
C
Amazon SageMaker Data Wrangler
-
D
Amazon SageMaker Ground Truth
Xem giải thích
Đáp án
C — Amazon SageMaker Data Wrangler
Vì sao đúng
Chia dữ liệu thành tập huấn luyện, kiểm định và kiểm tra là một bước của khâu chuẩn bị dữ liệu, và Data Wrangler có sẵn phép biến đổi đó trong hơn 300 phép biến đổi dựng sẵn.
Nó hỗ trợ nhiều kiểu chia, và việc chọn đúng kiểu quan trọng hơn nhiều người nghĩ:
- Ngẫu nhiên — mặc định, hợp với dữ liệu độc lập.
- Phân tầng (stratified) — giữ nguyên tỷ lệ các lớp trong mỗi tập; bắt buộc khi dữ liệu mất cân bằng.
- Theo thứ tự (ordered) — chia theo thời gian.
Kiểu cuối chính là điều đáng lưu ý cho bài toán chuỗi cung ứng trong đề: dữ liệu có yếu tố thời gian, mà chia ngẫu nhiên sẽ khiến mô hình học từ tương lai để dự đoán quá khứ — kết quả trên tập kiểm tra đẹp một cách giả tạo và sụp đổ khi triển khai thật.
Vì sao các phương án khác sai
- B. Feature Store — lưu và phục vụ đặc trưng đã tính; không chia dữ liệu.
- A. Clarify — phát hiện sai lệch và giải thích dự đoán.
- D. Ground Truth — gán nhãn dữ liệu.