Ngân hàng đề — AWS Certified Data Engineer Associate
Tìm thấy 867 câu.
A media company uses Kinesis Data Streams for real-time data ingestion from various content delivery devices. As the stream data is sent to multiple consumers, they notice significant delays in processing due to throughput limitations. They decide to use a feature that allows each consumer to have its own dedicated throughput, reducing latency and improving scalability. Which feature should they use?
-
A
Shard auto-scaling
-
B
Enhanced fan-out
-
C
Provisioned mode
-
D
Partition keys
Xem giải thích
Đáp án
B — Enhanced fan-out
Vì sao đúng
Nguyên nhân của độ trễ là nhiều consumer chia nhau 2 MB/giây của mỗi shard và phải hỏi liên tục. Enhanced fan-out cấp cho từng consumer một đường riêng 2 MB/giây trên mỗi shard và đẩy dữ liệu sang, nên các ứng dụng không giành băng thông của nhau nữa và độ trễ xuống khoảng 70 mili giây.
Vì sao các phương án khác sai
- A. Tự co giãn shard — tăng tổng thông lượng nhưng các consumer vẫn chia nhau phần của từng shard; trả thêm tiền mà nút thắt vẫn còn.
- C. Chế độ provisioned — cách khai năng lực, không phải cơ chế phân phối cho nhiều bên đọc.
- D. Partition key — quyết định bản ghi rơi vào shard nào, không ảnh hưởng phía đọc.
A financial institution wants to process and analyze transaction data in real time to detect fraudulent activities. The transaction data is generated at a high rate and needs to be processed within milliseconds of being received. The data will be ingested from various sources and analyzed using SQL queries. Which AWS service is most suitable for this requirement?
-
A
Amazon S3 with Athena
-
B
Amazon Kinesis Data Firehose
-
C
Amazon Kinesis Data Analytics (Managed Apache Flink)
-
D
Amazon Redshift with streaming ingestion
Xem giải thích
Đáp án
C — Amazon Managed Service for Apache Flink
Vì sao đúng
Phát hiện gian lận cần tính toán có trạng thái, trên dòng đang chảy: đếm số giao dịch của một thẻ trong vài phút gần nhất, so với thói quen bình thường, rồi cảnh báo trong vòng vài mili giây. Flink giữ được trạng thái theo cửa sổ thời gian và có điểm lưu để khôi phục; bản managed lo phần cụm.
Vì sao các phương án khác sai
- A. S3 kèm Athena — lưu trước rồi mới truy vấn; tới lúc phát hiện thì giao dịch đã xong.
- B. Kinesis Data Firehose — dịch vụ giao nhận, gom lô nên tối thiểu cũng trễ vài chục giây.
- D. Redshift streaming ingestion — đưa dữ liệu vào kho gần thời gian thực rất tốt, nhưng vẫn là truy vấn kho chứ không phải phản ứng theo từng giao dịch.
A company is using Amazon SNS to publish messages to multiple Amazon SQS queues for processing. The company wants to implement a system that ensures failed messages are retried for a certain number of times and then moved to a dead-letter queue (DLQ) if they are not successfully processed. What is the most appropriate configuration to meet this requirement?
-
A
Use Amazon SQS with a redrive policy that moves messages to the DLQ after the specified retry attempts are exhausted.
-
B
Configure Amazon SNS to automatically store undelivered messages in a dead-letter queue.
-
C
Use Amazon EventBridge to monitor message failures and move them to a DLQ for retry.
-
D
Set up an Amazon SNS subscription policy to automatically retry messages and move failed messages to the DLQ.
Xem giải thích
Đáp án
A — Dùng SQS với redrive policy đưa thông điệp sang DLQ sau số lần thử đã đặt
Vì sao đúng
Cơ chế này nằm ở hàng đợi nhận, đúng chỗ việc xử lý thất bại. Mỗi lần consumer nhận rồi không xoá thông điệp, ReceiveCount tăng lên; chạm maxReceiveCount trong redrive policy thì SQS tự chuyển sang dead-letter queue. Nhờ vậy thông điệp hỏng không chặn hàng đợi mãi mà vẫn được giữ lại để xem xét.
Vì sao các phương án khác sai
- B. SNS tự lưu thông điệp không gửi được vào DLQ — SNS có DLQ, nhưng nó chỉ bắt lỗi ở khâu gửi tới đích; ở đây thông điệp đã vào SQS rồi, lỗi nằm ở khâu xử lý.
- C. EventBridge theo dõi rồi chuyển sang DLQ — thêm một dịch vụ để làm việc SQS đã làm sẵn.
- D. Chính sách đăng ký của SNS tự thử lại — SNS có chính sách thử lại khi giao hàng, nhưng không đếm số lần xử lý thất bại phía consumer.
A retail company is implementing an IoT-based system to monitor the temperature of products in its warehouses in real time. The system needs to ingest large volumes of temperature data from multiple sensors and process it in near real-time to ensure the temperature stays within safe limits. The company also needs to store the data for long-term analysis in Amazon S3. Which combination of AWS services should the company use to meet these requirements?
-
A
Use AWS IoT Core for ingestion and Amazon Kinesis Data Analytics for processing and delivery to S3.
-
B
Use Amazon Kinesis Data Firehose for ingestion and processing and store the data in Amazon DynamoDB.
-
C
Use Amazon Kinesis Data Streams for ingestion and Amazon S3 Select to process and store the data.
-
D
Use Amazon Kinesis Data Streams for ingestion and Amazon Kinesis Data Firehose for delivery to S3.
Xem giải thích
Đáp án
D — Kinesis Data Streams để nhận, Kinesis Data Firehose để đưa tới đích
Vì sao đúng
Ghép này tách bạch hai việc: Data Streams nhận lượng lớn dữ liệu cảm biến, giữ lại để đọc lại được và cho nhiều consumer cùng đọc. Firehose đọc từ luồng đó rồi tự gom lô, nén và ghi xuống đích mà không phải viết consumer nào. Đây là khuôn mẫu chuẩn cho dữ liệu IoT.
Vì sao các phương án khác sai
- A. IoT Core kèm Kinesis Data Analytics — IoT Core mạnh cho quản lý thiết bị, nhưng đề chỉ nói tới nhận và chuyển dữ liệu.
- B. Firehose vừa nhận vừa xử lý — Firehose không giữ dữ liệu để đọc lại và không cho nhiều consumer đọc song song.
- C. Streams kèm S3 Select — S3 Select đọc một phần của một đối tượng đã nằm trên S3, không phải công cụ xử lý luồng.
A data engineer is designing a DynamoDB table to store customer reviews for products. Each review has a unique identifier, and the engineer wants to store multiple reviews for the same product. Reviews should be retrieved efficiently based on product ID and sorted by the review date. Which primary key configuration should the engineer choose?
-
A
Partition key only, using the product ID.
-
B
Composite key, using the product ID as the partition key and the review date as the sort key.
-
C
Composite key, using the review date as the partition key and product ID as the sort key.
-
D
Partition key only, using the review date.
Xem giải thích
Đáp án
B — Khoá tổng hợp: product ID làm partition key, review date làm sort key
Vì sao đúng
Yêu cầu là "nhiều đánh giá cho cùng một sản phẩm". Đặt product ID làm partition key thì mọi đánh giá của một sản phẩm nằm chung một phân vùng, lấy hết bằng một lời gọi Query. Review date làm sort key khiến chúng tự sắp theo thời gian, nên lấy các đánh giá mới nhất chỉ là đọc ngược từ cuối, không phải quét rồi sắp lại.
Vì sao các phương án khác sai
- A. Chỉ partition key là product ID — khoá chính phải duy nhất, nên mỗi sản phẩm chỉ giữ được đúng một đánh giá; ghi cái thứ hai là đè mất cái trước.
- C. Đảo hai vai — dữ liệu bị chia theo ngày, nên lấy đánh giá của một sản phẩm phải quét mọi phân vùng.
- D. Chỉ partition key là review date — hai đánh giá cùng ngày sẽ đè nhau, và vẫn không gom được theo sản phẩm.
A developer is using AWS KMS to encrypt sensitive application data. The developer wants to ensure that only specific AWS IAM users and roles have the ability to use the KMS key for encryption and decryption. How can the developer enforce this?
-
A
Use an S3 bucket policy to control access to the KMS key.
-
B
Attach a resource-based policy to the KMS key.
-
C
Set up a VPC endpoint policy for the KMS key.
-
D
Configure AWS Secrets Manager to limit access to the KMS key.
Xem giải thích
Đáp án
B — Gắn chính sách theo tài nguyên vào chính khoá KMS
Vì sao đúng
Mỗi khoá KMS có một key policy — đó là chính sách theo tài nguyên, và với KMS nó là bắt buộc: không có key policy thì không ai dùng được khoá, kể cả tài khoản gốc. Trong đó bạn liệt kê đích danh những người dùng và vai được phép gọi Encrypt và Decrypt. Đây là nơi duy nhất quyết định ai dùng được khoá.
Vì sao các phương án khác sai
- A. Bucket policy của S3 — quản quyền trên bucket, không quản quyền trên khoá.
- C. VPC endpoint policy — giới hạn lời gọi đi qua endpoint đó, là lớp mạng chứ không thay được key policy.
- D. Secrets Manager — nơi cất bí mật; nó dùng KMS chứ không phân quyền cho khoá KMS.
A media company uses Amazon S3 to store and serve large media files (e.g., videos and high-resolution images). The company wants to reduce its data transfer costs when delivering this content to users around the globe. Additionally, they want to limit access to their files to authenticated users only. Which solution will best meet these requirements?
-
A
Use S3 Cross-Region Replication and apply an S3 bucket policy to allow access from specific IP addresses.
-
B
Enable S3 Transfer Acceleration and use pre-signed URLs to restrict access.
-
C
Use CloudFront as a CDN with the S3 bucket as the origin and enable signed URLs for access control.
-
D
Configure S3 Lifecycle Policies to transition files to S3 Glacier when they are not frequently accessed, reducing storage and transfer costs.
Xem giải thích
Đáp án
C — Dùng CloudFront làm CDN với bucket S3 làm origin, và bật signed URL
Vì sao đúng
Hai vế của đề được giải cùng lúc:
- Giảm chi phí truyền dữ liệu — giá truyền ra từ CloudFront rẻ hơn truyền thẳng từ S3, và nội dung được đệm ở điểm biên nên tệp phổ biến gần như không phải lấy lại từ bucket.
- Kiểm soát truy cập — signed URL chỉ cho người có đường dẫn ký hợp lệ và còn hạn tải về. Kết hợp Origin Access Control để khoá bucket lại, không ai đi vòng qua CDN được.
Vì sao các phương án khác sai
- A. Nhân bản liên vùng kèm lọc IP — nhân bản làm tăng chi phí lưu trữ, và lọc theo IP thì rất khó dùng cho người xem đại chúng.
- B. Transfer Acceleration — tăng tốc tải lên từ xa và tính phí thêm; không phải cách phân phối nội dung.
- D. Lifecycle sang Glacier — giảm tiền lưu trữ chứ không giảm tiền truyền, và tệp còn phải khôi phục trước khi xem được.
A data engineer is setting up a secure and well-organized data lake using AWS Lake Formation. They need to automate the ingestion of data from Amazon S3, ensure the data is searchable, and implement fine-grained access control for multiple departments within the organization. Which combination of features in AWS Lake Formation should the engineer use to meet these requirements?
-
A
Lake Formation Blueprints for data cataloging, IAM Roles for access control, and Amazon Redshift Spectrum for querying the data.
-
B
AWS Glue Data Catalog for organizing metadata, Lake Formation Blueprints for data ingestion, and Lake Formation Tag-Based Access Control (TBAC) for managing permissions.
-
C
AWS Glue Crawlers for data cataloging, IAM policies for access control, and AWS Athena for querying the data.
-
D
Amazon S3 for data storage, AWS Resource Access Manager (RAM) for cross-account sharing, and AWS Glue ETL for data transformation.
Xem giải thích
Đáp án
B — Glue Data Catalog cho siêu dữ liệu, Lake Formation Blueprints cho việc nạp dữ liệu
Vì sao đúng
Ba yêu cầu đề nêu khớp đúng ba mảnh của Lake Formation:
- Blueprints dựng sẵn workflow nạp dữ liệu, chọn kiểu nạp một lần hay nạp tăng dần rồi tự sinh job Glue.
- Glue Data Catalog là nơi lưu bảng và lược đồ, nhờ đó dữ liệu tìm kiếm được và Athena hay Redshift Spectrum truy vấn được.
- Phân quyền chi tiết tới mức dòng và cột do chính Lake Formation quản, không phải IAM.
Vì sao các phương án khác sai
- A — dùng Blueprints sai vai (nó nạp dữ liệu chứ không cataloging), và IAM không phân quyền tới mức dòng và cột.
- C — crawler cộng IAM cộng Athena là bộ công cụ hợp lệ nhưng thiếu hẳn phần phân quyền chi tiết mà Lake Formation sinh ra để giải.
- D — S3 và RAM lo lưu trữ và chia sẻ liên tài khoản, không phải cataloging hay nạp dữ liệu.
A data engineer wants to implement Redshift Workload Management (WLM) to prioritize short-running queries over long-running analytical queries. The engineer wants to allocate system resources dynamically based on query complexity and avoid manual configuration of memory and concurrency settings. Which WLM mode should the engineer choose?
-
A
Automatic Workload Management
-
B
Use Amazon Redshift Spectrum for high-priority queries
-
C
Manual Workload Management
-
D
Configure separate clusters for short and long-running queries
Xem giải thích
Đáp án
A — Automatic Workload Management
Vì sao đúng
Automatic WLM để Redshift tự quyết định cấp bao nhiêu bộ nhớ và bao nhiêu khe chạy đồng thời cho mỗi truy vấn, dựa trên độ phức tạp mà nó ước lượng được. Bạn chỉ cần đặt mức ưu tiên cho từng hàng đợi, còn việc chia tài nguyên là động — đúng điều đề yêu cầu. Nhờ vậy truy vấn ngắn không phải xếp hàng sau truy vấn phân tích chạy nhiều phút.
Vì sao các phương án khác sai
- B. Spectrum cho truy vấn ưu tiên cao — Spectrum đọc dữ liệu trên S3, không phải cơ chế phân bổ tài nguyên.
- C. Manual WLM — bạn tự cố định số khe và phần trăm bộ nhớ; đặt sai là truy vấn lớn hết bộ nhớ còn truy vấn nhỏ vẫn chờ. Trái yêu cầu "phân bổ động".
- D. Tách thành hai cụm — nhân đôi chi phí và công vận hành để giải một việc WLM làm được.
A financial services company is using Amazon Redshift and wants to implement a flexible access control model to manage user permissions for different departments. The company wants a hierarchical structure where roles can inherit permissions from other roles to simplify management. Which access control model should the company implement in Amazon Redshift?
-
A
Policy-Based Access Control (PBAC)
-
B
Role-Based Access Control (RBAC)
-
C
Group-based Access Control
-
D
User-based Access Control
Xem giải thích
Đáp án
B — Role-Based Access Control (RBAC)
Vì sao đúng
RBAC của Redshift cho tạo vai, gán quyền cho vai, rồi gán vai cho người dùng. Quan trọng hơn, vai lồng được vào nhau: một vai kế thừa quyền của vai khác, nên dựng được đúng cấu trúc phân cấp mà đề yêu cầu. Thêm người mới chỉ là gán vai, không phải cấp lại từng quyền.
Vì sao các phương án khác sai
- A. Policy-Based Access Control — Redshift không có mô hình mang tên này.
- C. Group-based Access Control — nhóm trong Redshift không lồng nhau được, nên không dựng được cấu trúc phân cấp; đây là cách cũ trước khi có RBAC.
- D. User-based Access Control — cấp quyền thẳng cho từng người, không mở rộng nổi và rất dễ sót khi ai đó đổi phòng ban.