Ngân hàng đề — AWS Certified Data Engineer Associate

Tìm thấy 867 câu.

Câu 171 Data Store Management

A company is building an e-commerce application using DynamoDB. Each item in the inventory has different attributes, and the system must quickly retrieve product data by a unique identifier. Which feature of DynamoDB is primarily responsible for ensuring efficient access to each unique item?

  1. A

    Composite Key

  2. B

    Partition Key

  3. C

    Secondary Index

  4. D

    Sort Key

Xem giải thích

Đáp án

B — Partition Key

Vì sao đúng

DynamoDB băm giá trị partition key để quyết định dữ liệu nằm ở phân vùng nào. Khi bạn tra cứu bằng đúng khoá đó, dịch vụ đi thẳng tới phân vùng chứa nó — thời gian không đổi dù bảng lớn tới đâu. Đó chính là "lấy nhanh theo một định danh duy nhất" mà đề mô tả.

Vì sao các phương án khác sai

  • A. Composite Key — là cặp partition key cộng sort key, dùng khi cần nhiều mục cùng chung một khoá phân vùng; ở đây định danh đã duy nhất rồi.
  • C. Secondary Index — mở thêm đường tra cứu theo thuộc tính khác, tốn thêm dung lượng và ghi; không cần khi đã tra bằng khoá chính.
  • D. Sort Key — sắp thứ tự trong một phân vùng, không quyết định tìm ra phân vùng nào.
Câu 172 Data Ingestion and Transformation

A data engineer is tasked with setting up an Amazon Kinesis Data Stream that will be consumed by multiple applications simultaneously. Due to the high throughput required by each consumer, the engineer needs a solution that avoids bottlenecks. What feature should be implemented to ensure each consumer has dedicated throughput?

  1. A

    Enhanced Fan-Out

  2. B

    Shard Scaling

  3. C

    Kinesis Data Firehose

  4. D

    Partition Key Algorithm

Xem giải thích

Đáp án

A — Enhanced Fan-Out

Vì sao đúng

Mặc định, mọi consumer chia nhau 2 MB/giây của mỗi shard, nên càng nhiều ứng dụng đọc thì mỗi bên càng chậm. Enhanced fan-out cấp cho từng consumer một đường riêng 2 MB/giây mỗi shard, và đẩy dữ liệu sang thay vì bắt chúng hỏi liên tục — nên độ trễ xuống còn khoảng 70 mili giây và các consumer không giành băng thông của nhau nữa.

Vì sao các phương án khác sai

  • B. Tăng số shard — nâng tổng thông lượng nhưng các consumer vẫn chia nhau phần của mỗi shard; thêm tiền mà nút thắt vẫn còn.
  • C. Kinesis Data Firehose — dịch vụ giao nhận tới S3 hay Redshift, không phải cách cho nhiều ứng dụng cùng đọc một luồng.
  • D. Thuật toán partition key — quyết định bản ghi rơi vào shard nào, không liên quan tới băng thông phía đọc.
Câu 173 Data Operations and Support

A data engineering team is using Amazon DynamoDB to store user profiles and needs to enable DynamoDB Streams to track real-time changes in the table. The team is primarily interested in auditing the data, including viewing both the previous and new states of items that are modified. Which stream option should the team select to capture both the old and new versions of the modified items?

  1. A

    Keys only

  2. B

    Old image

  3. C

    New and old images

  4. D

    New image

Xem giải thích

Đáp án

C — New and old images

Vì sao đúng

StreamViewType quyết định mỗi bản ghi trong stream mang theo gì. Chọn NEW_AND_OLD_IMAGES thì mỗi thay đổi kèm cả trạng thái trước và sau. Muốn kiểm toán thì phải có đủ hai: chỉ có bản mới thì không biết đã đổi từ giá trị nào, mà đó thường là thứ người kiểm toán hỏi đầu tiên.

Vì sao các phương án khác sai

  • A. Keys only — chỉ có khoá chính, biết mục nào đổi chứ không biết đổi cái gì.
  • B. Old image — chỉ trạng thái trước, thiếu giá trị mới.
  • D. New image — chỉ trạng thái sau, thiếu giá trị cũ.

Nhớ nhanh

Kiểm toán cần "trước và sau" thì chỉ một lựa chọn cho cả hai.

Câu 174 Data Operations and Support

A company is using Amazon Kinesis Data Streams to ingest large volumes of sensor data from IoT devices. They need to ensure that if errors occur during ingestion, the data can be reprocessed to maintain consistency. Which feature of Kinesis Data Streams is most suitable to handle this requirement?

  1. A

    Backfilling

  2. B

    Partitioning

  3. C

    Idempotent operations

  4. D

    Replayability

Xem giải thích

Đáp án

D — Replayability (đọc lại được)

Vì sao đúng

Kinesis Data Streams giữ lại bản ghi trong khoảng lưu trữ đã đặt — mặc định 24 giờ, kéo lên tới 365 ngày. Consumer đọc bằng con trỏ vị trí, nên khi xử lý hỏng bạn đặt con trỏ về trước rồi đọc lại đúng những bản ghi đó. Chính vì dữ liệu chưa bị xoá sau khi đọc mà việc xử lý lại mới khả thi.

Vì sao các phương án khác sai

  • A. Backfilling — nạp bù dữ liệu quá khứ vào hệ thống, không phải tính năng của Streams.
  • B. Partitioning — phân bổ bản ghi qua các shard, chuyện thông lượng chứ không phải khôi phục.
  • C. Idempotent operations — giúp xử lý lại không gây tác dụng phụ, nhưng đó là việc bạn phải tự viết ở phía consumer, không phải thứ Streams cung cấp.
Câu 175 Data Security and Governance

A company wants to ensure that any unauthorized changes made to their IAM policies are automatically detected and notified. They also want to store a history of these changes for audit purposes. The solution should provide continuous monitoring and alert the security team in case of policy violations. Which combination of AWS services will meet these requirements?

  1. A

    AWS CloudWatch for tracking policy changes, AWS CloudTrail for continuous monitoring, and Amazon SES for notifications.

  2. B

    AWS Config for tracking policy changes, AWS CloudTrail for continuous monitoring, and Amazon SNS for notifications.

  3. C

    AWS CloudTrail for tracking policy changes, AWS Config for continuous monitoring, and Amazon SNS for notifications.

  4. D

    AWS CloudTrail for tracking policy changes, AWS Config for continuous monitoring, and AWS Lambda for notifications.

Xem giải thích

Đáp án

C — CloudTrail ghi thay đổi, Config giám sát liên tục, SNS gửi thông báo

Vì sao đúng

Ba dịch vụ, ba vai rõ ràng:

  • CloudTrail ghi lại lời gọi API, tức là ai đã sửa chính sách IAM, lúc nào, từ đâu.
  • AWS Config theo dõi trạng thái cấu hình theo thời gian và tự đánh giá theo quy tắc, nên phát hiện được thay đổi lệch chuẩn ngay khi nó xảy ra. Đây cũng là chỗ lưu lịch sử.
  • SNS bắn thông báo tới người trực.

Vì sao các phương án khác sai

  • A — đảo vai CloudWatch và CloudTrail; CloudWatch là chỉ số và log, không phải nơi ghi thay đổi cấu hình. SES là gửi email marketing, không phải kênh cảnh báo vận hành.
  • B — đảo vai Config và CloudTrail so với đáp án đúng.
  • D — Lambda chạy được việc gì đó nhưng bản thân nó không phải kênh thông báo; vẫn phải gọi SNS hoặc SES ở cuối.
Câu 176 Data Security and Governance

A company uses the AWS Well-Architected Tool to review its workloads and identify improvements. After performing a review, the company receives a recommendation to improve its security posture by implementing least-privilege access for its IAM policies. Which feature of AWS IAM can the company use to analyze and validate their IAM policies to ensure they are following least-privilege best practices?

  1. A

    IAM Policy Simulator

  2. B

    AWS IAM Access Analyzer

  3. C

    AWS Trusted Advisor

  4. D

    AWS Systems Manager Parameter Store

Xem giải thích

Đáp án

B — AWS IAM Access Analyzer

Vì sao đúng

Access Analyzer đọc lịch sử hoạt động trong CloudTrail rồi sinh ra chính sách chỉ gồm những quyền thực sự được dùng — đó đúng là cách đi tới quyền tối thiểu mà không phải đoán. Nó còn chỉ ra tài nguyên đang bị chia sẻ ra ngoài tài khoản và các quyền cấp mà chẳng ai dùng.

Vì sao các phương án khác sai

  • A. IAM Policy Simulator — kiểm thử một chính sách có sẵn cho phép hay từ chối hành động nào; nó không sinh ra chính sách gọn hơn.
  • C. Trusted Advisor — khuyến nghị chung về chi phí, hiệu năng, bảo mật, không đi sâu tới mức viết lại chính sách.
  • D. Parameter Store — nơi cất tham số và bí mật, không liên quan tới phân quyền.
Câu 177 Data Store Management

A company needs to transfer 100 petabytes of archival data from an on-premise data center to AWS. The company has limited bandwidth and needs a solution that ensures data integrity and security during transit. Which AWS service should the company use?

  1. A

    AWS Snowball Edge - Storage Optimized

  2. B

    AWS Transfer Family

  3. C

    AWS Snowmobile

  4. D

    AWS DataSync

Xem giải thích

Đáp án

C — AWS Snowmobile

Vì sao đúng

Snowmobile là container 45 foot kéo bằng xe tải, chở tới 100 petabyte một chuyến — đúng quy mô đề nêu. Dữ liệu được mã hoá bằng khoá KMS của bạn, xe có định vị, giám sát và hộ tống, nên vẫn thoả yêu cầu an toàn và toàn vẹn khi vận chuyển.

Vì sao các phương án khác sai

  • A. Snowball Edge Storage Optimized — mỗi thiết bị vài chục terabyte; muốn 100 PB thì cần hàng nghìn chiếc, không thực tế.
  • B. Transfer Family — SFTP/FTPS qua Internet, mà băng thông chính là thứ đang thiếu.
  • D. DataSync — cũng chuyển qua mạng; với 100 PB trên đường truyền hẹp thì mất nhiều năm.
Câu 178 Data Store Management

A company is experiencing unpredictable traffic to its DynamoDB table. The team is unsure about how much traffic they will receive but needs to ensure consistent performance and avoid throttling. What is the most appropriate DynamoDB capacity mode for their use case?

  1. A

    Provisioned capacity mode with reserved capacity

  2. B

    Provisioned capacity mode with auto-scaling enabled

  3. C

    On-demand capacity mode

  4. D

    Provisioned capacity mode with overprovisioning

Xem giải thích

Đáp án

C — On-demand capacity mode

Vì sao đúng

Ở chế độ on-demand, DynamoDB tự nhận lưu lượng thật và cấp phát theo, không cần ai khai trước bao nhiêu đơn vị đọc ghi. Đó đúng là tình huống "không đoán được sẽ có bao nhiêu lượt". Bạn trả tiền theo từng yêu cầu, và không bị chặn chỉ vì đã khai thiếu.

Vì sao các phương án khác sai

  • A. Provisioned kèm reserved capacity — rẻ hơn nếu tải ổn định và đoán được; cam kết trước đúng thứ đề nói là không đoán nổi.
  • B. Provisioned kèm auto-scaling — có co giãn nhưng phản ứng sau vài phút; một cú tăng đột ngột vẫn bị chặn trong lúc chờ nâng.
  • D. Provisioned rồi khai dư ra — tránh bị chặn bằng cách trả tiền cho phần không dùng, và vẫn hỏng nếu đỉnh vượt quá mức đã đoán.
Câu 179 Data Store Management

You are managing an OpenSearch domain that stores customer information. The domain is configured with a cluster containing multiple nodes. To ensure high availability and improve read performance, which type of shard should be configured in addition to primary shards?

  1. A

    Hot shards

  2. B

    Secondary shards

  3. C

    Cold shards

  4. D

    Replica shards

Xem giải thích

Đáp án

D — Replica shards

Vì sao đúng

Replica là bản sao của primary shard, luôn nằm trên node khác. Nhờ vậy nó phục vụ hai việc cùng lúc: mất một node thì dữ liệu vẫn còn ở node khác (tính sẵn sàng), và truy vấn đọc được chia đều cho cả primary lẫn replica (hiệu năng đọc). Đúng hai điều đề yêu cầu.

Vì sao các phương án khác sai

  • A. Hot shards và C. Cold shards — "hot" và "cold" là tầng lưu trữ theo độ mới của dữ liệu, không phải loại shard, và cold phải gắn lại mới truy vấn được.
  • B. Secondary shards — OpenSearch không có khái niệm này; chỉ có primary và replica.
Câu 180 Data Ingestion and Transformation

A healthcare company is developing a serverless ETL pipeline to process medical records in compliance with healthcare regulations. The pipeline needs to perform the following steps:

  • Data arrives in CSV format and is stored in an Amazon S3 bucket.

  • AWS Lambda should automatically trigger when new files are uploaded. Lambda should transform the data into a standard JSON format and send it to Amazon Kinesis Data Streams for real-time processing.

  • Processed data should be stored in Amazon DynamoDB for fast querying by the downstream applications.

  • The solution should handle sudden increases in incoming data without manual intervention.

Which solution will meet the requirements while maintaining a cost-effective, fully managed, and scalable architecture?

  1. A

    Use an Amazon S3 Event Notification to trigger an AWS Lambda function upon new file uploads. The Lambda function will transform the CSV into JSON and send the data to Amazon Kinesis Data Streams for processing. Process the stream data in a Kinesis-enabled EC2 instance, and write the results to Amazon DynamoDB.

  2. B

    Use an Amazon S3 Event Notification to trigger an AWS Lambda function upon new file uploads. The Lambda function will transform the data into JSON and push it to Amazon Kinesis Data Streams. Another AWS Lambda function will consume from the Kinesis stream and write the processed data to Amazon DynamoDB.

  3. C

    Use an Amazon S3 Event Notification to trigger an AWS Lambda function upon file uploads. The Lambda function will transform the CSV to JSON and store the output directly into Amazon DynamoDB.

  4. D

    Use an Amazon S3 Event Notification to trigger an AWS Lambda function. The Lambda function will process the CSV files, store them in Amazon S3 Glacier, and then update Amazon DynamoDB with references to the processed data.

Xem giải thích

Đáp án

B — S3 Event Notification gọi Lambda chuyển sang JSON và đẩy vào Kinesis, rồi một Lambda thứ hai đọc luồng và ghi vào DynamoDB

Vì sao đúng

Đề đòi hoàn toàn không máy chủ, tự co giãn, và chịu được lượng dữ liệu tăng đột ngột. Phương án B giữ đúng ba điều đó ở mọi mắt xích: S3 báo sự kiện, Lambda biến đổi, Kinesis làm lớp đệm hấp thụ cú tăng bất ngờ, rồi Lambda thứ hai tiêu thụ và ghi xuống DynamoDB. Không có máy nào phải trông, và số bản sao Lambda tự tăng theo số shard.

Vì sao các phương án khác sai

  • A. Xử lý luồng bằng EC2 — phá vỡ kiến trúc không máy chủ: phải tự vá máy, tự co giãn, và trả tiền cả lúc không có dữ liệu.
  • C. Ghi thẳng vào DynamoDB, bỏ Kinesis — mất lớp đệm, nên khi tệp đổ về dồn dập thì Lambda ghi vượt năng lực bảng và bị chặn; cũng mất luôn khả năng đọc lại khi lỗi.
  • D. Đẩy vào S3 Glacier — Glacier là kho lưu trữ nguội, lấy ra mất vài phút tới vài giờ; hoàn toàn trái với yêu cầu xử lý thời gian thực.