Ngân hàng đề — AWS Certified Data Engineer Associate
Tìm thấy 867 câu.
A media company frequently transfers large multimedia files to its partners using secure transfer protocols like SFTP and needs a solution that integrates with its existing Amazon S3 storage. The company also prefers not to manage file transfer servers. Which AWS service would best meet this requirement?
-
A
AWS Snowcone
-
B
AWS DataSync
-
C
AWS Transfer Family
-
D
AWS Snowball Edge
Xem giải thích
Đáp án
C — AWS Transfer Family
Vì sao đúng
Transfer Family là dịch vụ được quản lý cung cấp đúng các giao thức đề nêu — SFTP, FTPS và FTP — với S3 hoặc EFS làm nơi lưu phía sau. Đối tác vẫn dùng đúng ứng dụng SFTP quen thuộc của họ, còn tệp thì rơi thẳng vào bucket S3 hiện có, không cần chuyển đổi hay đồng bộ gì thêm.
Vì sao các phương án khác sai
- A. Snowcone và D. Snowball Edge — thiết bị vật lý gửi qua đường bưu chính, dùng khi mạng yếu; ở đây là trao đổi tệp thường xuyên qua mạng.
- B. DataSync — đồng bộ dữ liệu giữa nơi lưu này và nơi lưu khác, không phơi ra endpoint SFTP cho đối tác bên ngoài kết nối vào.
A company has set up a data lake using AWS Lake Formation and wants to share specific datasets across multiple AWS accounts securely. What is the recommended AWS service or feature to manage the secure sharing of data between accounts?
-
A
Amazon Redshift Spectrum
-
B
Amazon S3 Access Points
-
C
AWS Glue Data Catalog
-
D
AWS Resource Access Manager (RAM)
Xem giải thích
Đáp án
D — AWS Resource Access Manager (RAM)
Vì sao đúng
Lake Formation dùng AWS RAM làm cơ chế bên dưới để đưa quyền sang tài khoản khác. Khi bạn cấp quyền cho một tài khoản ngoài, Lake Formation tạo lời mời chia sẻ qua RAM; tài khoản kia nhận rồi mới thấy được bảng đó. Nhờ vậy dữ liệu không phải sao chép đi đâu cả, và quyền vẫn do bên sở hữu kiểm soát.
Vì sao các phương án khác sai
- A. Redshift Spectrum — công cụ truy vấn dữ liệu trên S3, không phải cơ chế chia sẻ.
- B. S3 Access Points — quản truy cập ở mức đối tượng S3, nằm dưới tầng bảng và không hiểu quyền theo dòng hay cột của Lake Formation.
- C. Glue Data Catalog — nơi lưu siêu dữ liệu; nó là thứ được chia sẻ, không phải thứ thực hiện việc chia sẻ.
A financial services company is using Amazon Kinesis Data Streams to process high volumes of real-time financial transactions. The team needs to ensure that any errors or missed transactions during data ingestion can be corrected later by reprocessing the data. Which of the following Kinesis Data Streams features will help them reprocess the data to meet this requirement?
-
A
Enhanced fan-out
-
B
Data retention period configuration
-
C
On-demand mode
-
D
Replayability
Xem giải thích
Đáp án
D — Replayability (đọc lại được)
Vì sao đúng
Kinesis Data Streams không xoá bản ghi sau khi consumer đọc — chúng nằm đó tới hết thời hạn lưu trữ. Consumer theo dõi vị trí của mình bằng sequence number, nên khi có lỗi hoặc bỏ sót, bạn đặt con trỏ lùi lại rồi xử lý lại đúng những giao dịch đó. Với dữ liệu tài chính thì đây chính là lưới an toàn.
Vì sao các phương án khác sai
- A. Enhanced fan-out — cho mỗi consumer băng thông riêng; chuyện thông lượng, không phải khôi phục.
- B. Cấu hình thời hạn lưu trữ — quyết định đọc lại được bao xa, tức là điều kiện cho replayability chứ không phải bản thân khả năng đó.
- C. On-demand mode — cách co giãn năng lực, không liên quan.
A data engineer at a media company needs to share encrypted data between two AWS accounts while maintaining the encryption. The encrypted EBS volumes from account A need to be accessible and re-encrypted in account B. Which approach should the engineer take to securely share the encrypted data?
-
A
Use an AWS owned key and copy the volume snapshot to account B.
-
B
Use asymmetric keys in account A and account B to share the volume without re-encryption.
-
C
Use a customer managed key in account A, share the snapshot with account B, and allow re-encryption with account B's key.
-
D
Use AWS managed keys in account A and share the volume directly with account B.
Xem giải thích
Đáp án
C — Dùng customer managed key ở tài khoản A, chia sẻ snapshot cho tài khoản B, và cho phép mã hoá lại
Vì sao đúng
Snapshot mã hoá bằng khoá do AWS quản lý thì không chia sẻ được — đó là giới hạn cứng. Vì vậy phải dùng customer managed key: trong key policy cho tài khoản B quyền dùng khoá, chia sẻ snapshot, rồi tài khoản B chép snapshot đó về và mã hoá lại bằng khoá của chính mình. Từ đó B tự chủ, không còn phụ thuộc khoá của A.
Vì sao các phương án khác sai
- A. AWS owned key — nằm trong tài khoản của AWS, bạn không thấy và không chia sẻ được.
- B. Khoá bất đối xứng để chia sẻ mà không mã hoá lại — EBS dùng khoá đối xứng; mô tả này không đúng cách KMS hoạt động với EBS.
- D. AWS managed key rồi chia sẻ thẳng volume — vướng đúng giới hạn nêu ở trên, và volume thì không chia sẻ được, chỉ snapshot mới chia sẻ được.
A data engineering team is using Amazon Kinesis Data Streams to collect log data from various applications. They want to ensure that they can replay data for up to 7 days in case of an error or need for reprocessing. What feature should the team use to meet this requirement?
-
A
Data Immutability
-
B
Retention Period Configuration
-
C
Kinesis Agent
-
D
Shard Auto Scaling
Xem giải thích
Đáp án
B — Cấu hình thời hạn lưu trữ (Retention Period)
Vì sao đúng
Mặc định Kinesis Data Streams giữ bản ghi 24 giờ. Muốn đọc lại được tới 7 ngày thì phải nâng thời hạn lưu trữ lên 168 giờ — đó đúng là nút chỉnh mà đề đang hỏi. Nâng lên tối đa 365 ngày cũng được, đổi lại là trả thêm tiền cho phần lưu trữ vượt quá 24 giờ.
Vì sao các phương án khác sai
- A. Data Immutability — bản ghi trong Kinesis vốn không sửa được, nhưng đó không phải thứ quyết định giữ được bao lâu.
- C. Kinesis Agent — phần mềm chạy trên máy chủ để đẩy log vào luồng, không liên quan tới việc giữ dữ liệu.
- D. Shard Auto Scaling — điều chỉnh thông lượng, không điều chỉnh thời hạn.
A development team is configuring a DynamoDB table using the provisioned capacity mode. They expect the table to store items with sizes of 6 KB and want to ensure they allocate the correct number of read capacity units (RCUs) for strongly consistent reads. How many RCUs will be required to support reading 10 items per second?
-
A
20 RCUs
-
B
12 RCUs
-
C
10 RCUs
-
D
15 RCUs
Xem giải thích
Đáp án
A — 20 RCU
Vì sao đúng
Cách tính đọc trong DynamoDB đi theo hai bước:
- Làm tròn cỡ mục lên bội số của 4 KB. Mục 6 KB tính thành 8 KB.
- Một RCU cho một lần đọc nhất quán mạnh trên 4 KB, hoặc hai lần đọc nhất quán cuối cùng trên 4 KB.
Vậy mỗi lần đọc nhất quán mạnh một mục 6 KB tốn 2 RCU. Với mười lần đọc mỗi giây thì cần 2 × 10 = 20 RCU.
Vì sao các phương án khác sai
- C. 10 RCU — quên mất bước làm tròn lên 8 KB, tính như thể mỗi lần đọc chỉ tốn 1 RCU.
- B. 12 RCU và D. 15 RCU — không ra từ công thức nào; RCU luôn là số nguyên nhân với số lần đọc mỗi giây.
Nhớ nhanh
Đọc nhất quán mạnh: ceil(cỡ mục / 4KB) × số lần đọc/giây. Đọc nhất quán cuối cùng thì chia đôi.
A company is building a real-time data processing application that collects sensor data from IoT devices. The data needs to be processed immediately and stored in a time-series database for later analysis. The company also wants to keep operational overhead to a minimum and reduce infrastructure management as much as possible. The following requirements must be met:
-
The incoming data stream from the IoT devices should be processed in real-time.
-
Data needs to be transformed into a standardized JSON format.
-
The transformed data should be stored in an Amazon Timestream database.
-
The solution should be scalable to accommodate spikes in data volume and should only use compute resources when necessary to minimize costs.
Which solution meets these requirements?
-
A
Use an Amazon Kinesis Data Firehose to stream the data from the IoT devices, transform it with an Amazon EMR cluster, and write the output to Amazon Timestream.
-
B
Set up an Amazon Kinesis Data Streams to ingest the data from IoT devices, and AWS Lambda to process each data record and store it in Amazon Timestream.
-
C
Use AWS Lambda to process the incoming data, transform it to JSON format, and store the data in Amazon Timestream. Trigger Lambda functions using Amazon API Gateway for each incoming request from IoT devices.
-
D
Use an Amazon SQS queue to collect the incoming data. Launch EC2 instances in an Auto Scaling group to pull messages from SQS, process the data, and store it in Amazon Timestream.
Xem giải thích
Đáp án
B — Kinesis Data Streams nhận dữ liệu, AWS Lambda xử lý
Vì sao đúng
Đề cần xử lý ngay lập tức rồi ghi vào CSDL chuỗi thời gian. Data Streams nhận dữ liệu cảm biến với độ trễ rất thấp và giữ lại để đọc lại được khi hỏng. Lambda gắn thẳng vào luồng bằng event source mapping nên chạy ngay khi có bản ghi, xử lý rồi ghi sang Amazon Timestream — không máy chủ nào phải trông coi và tự co giãn theo số shard.
Vì sao các phương án khác sai
- A. Firehose — gom lô trước khi giao, nên tối thiểu cũng trễ vài chục giây; trái yêu cầu "xử lý ngay".
- C. Lambda nhận thẳng từ thiết bị — thiếu tầng đệm, nên khi thiết bị bắn dồn dập thì không có chỗ chứa và dữ liệu mất; cũng không đọc lại được khi lỗi.
- D. SQS với EC2 trong Auto Scaling group — chạy được nhưng phải vận hành máy, và SQS không cho nhiều consumer cùng đọc một thông điệp như luồng Kinesis.
A developer is designing a serverless application using AWS Lambda to process messages from an Amazon SQS queue. The messages are generated by various parts of the system and must be processed asynchronously. To ensure that important notifications are sent immediately, the developer also wants to trigger notifications to users via Amazon SNS when specific messages are processed. How should the developer configure the system to meet these requirements?
-
A
Use Amazon SNS to send messages to the SQS queue, and configure Lambda to process the messages and publish notifications to a secondary SNS topic.
-
B
Use Amazon SNS to trigger Lambda functions directly and configure the Lambda function to push the messages to an SQS queue for processing.
-
C
Create two separate Lambda functions: one to poll the SQS queue and process messages, and another to poll Amazon SNS for notifications and process them separately.
-
D
Configure AWS Lambda to poll the SQS queue, process the messages, and then publish relevant notifications directly to SNS.
Xem giải thích
Đáp án
D — Cho Lambda tự lấy thông điệp từ SQS, xử lý, rồi phát tiếp sang SNS
Vì sao đúng
Lambda gắn với SQS bằng event source mapping: dịch vụ tự lấy thông điệp theo lô và gọi hàm, tự xoá khi xử lý xong, tự trả lại hàng đợi khi hỏng. Bạn không viết vòng lặp lấy thông điệp nào. Sau khi xử lý, hàm phát kết quả sang SNS để nhiều bên đăng ký cùng nhận — đúng thứ tự "hàng đợi để xử lý, chủ đề để phân phát".
Vì sao các phương án khác sai
- A. SNS gửi vào SQS rồi Lambda xử lý — đảo thứ tự; đề nói thông điệp đã nằm trong SQS.
- B. SNS gọi thẳng Lambda — bỏ mất hàng đợi, nên mất luôn khả năng thử lại và đệm khi tải cao.
- C. Hai hàm riêng, một hàm tự poll hàng đợi — tự viết lại đúng thứ event source mapping đã làm sẵn, và hàm poll phải chạy liên tục nên tốn tiền vô ích.
A company is using Amazon Kinesis Data Streams to collect and process real-time streaming data from IoT devices. The data needs to be processed by a Lambda function to perform analytics and generate alerts when specific conditions are met. What is the best way to ensure that the Lambda function processes the data with minimal delay and handles failures efficiently?
-
A
Use Amazon Kinesis Analytics to process the data and trigger the Lambda function after each analytics query completes.
-
B
Configure the Lambda function to poll the Kinesis Data Stream and process batches of records in real-time.
-
C
Set up a Lambda event source mapping to invoke the function whenever new data arrives in the Kinesis Data Stream, and configure a dead-letter queue (DLQ) for error handling.
-
D
Enable Kinesis Data Firehose to deliver data to Amazon S3, then trigger the Lambda function to process data from S3.
Xem giải thích
Đáp án
C — Khai event source mapping để Lambda được gọi khi có dữ liệu mới trong luồng
Vì sao đúng
Event source mapping là cách chính thức nối Lambda với Kinesis: dịch vụ Lambda tự đọc shard, gom bản ghi thành lô rồi gọi hàm, và tự lưu vị trí đã xử lý. Nó cũng tự tăng số bản sao chạy song song theo số shard. Bạn chỉ viết phần xử lý, không viết phần đọc luồng.
Vì sao các phương án khác sai
- A. Kinesis Analytics rồi mới gọi Lambda — thêm một dịch vụ vào giữa mà đề không cần, và tăng độ trễ.
- B. Lambda tự poll luồng — hàm phải chạy liên tục để hỏi, tốn tiền và phải tự quản lý vị trí đọc; đúng thứ event source mapping làm hộ.
- D. Qua Firehose xuống S3 rồi mới gọi Lambda — Firehose gom lô nên trễ vài chục giây, không còn là xử lý thời gian thực.
A company is deciding between Amazon ECS and Amazon EKS to run its containerized applications. They are concerned about the complexity of managing the control plane and Kubernetes upgrades but still want a managed solution with deep AWS integration. They need a service that requires minimal operational overhead. Which service is best suited to meet the company's needs?
-
A
Amazon ECS, because it provides the flexibility of Kubernetes without the need to manage the underlying infrastructure.
-
B
Amazon ECS, because it is deeply integrated with AWS services and abstracts the complexity of managing the control plane.
-
C
Amazon EKS, because it provides a fully managed Kubernetes control plane with automatic upgrades.
-
D
Amazon EKS, because it requires less configuration and offers native support for containers without managing the control plane.
Xem giải thích
Đáp án
B — Amazon ECS, vì nó gắn chặt với các dịch vụ AWS và giấu đi phần phức tạp
Vì sao đúng
Nỗi lo của công ty là phải quản lý control plane và nâng cấp Kubernetes. ECS không có control plane nào để bạn quản: AWS lo hết và không tính tiền riêng phần đó, cũng không có chu kỳ nâng cấp phiên bản Kubernetes nào phải theo. Nó nối sẵn với IAM, ALB, CloudWatch và VPC theo cách quen thuộc, nên nhóm không cần học thêm hệ khái niệm mới.
Vì sao các phương án khác sai
- A. ECS vì cho sự linh hoạt của Kubernetes — sai lý do: ECS không phải Kubernetes và không có API của Kubernetes.
- C. EKS có control plane được quản lý — đúng là được quản lý, nhưng bạn vẫn phải quyết định và thực hiện nâng cấp phiên bản, đúng thứ đề muốn tránh.
- D. EKS ít cấu hình hơn — ngược lại; EKS đòi hiểu Kubernetes nên cấu hình nhiều hơn ECS.