Ngân hàng đề — AWS Certified Data Engineer Associate

Tìm thấy 867 câu.

Câu 541 Domain 4: Data Security and Governance

A company uses Amazon S3 as its data lake solution, where it stores all of its data including personally identifiable information (PII). This data is used by multiple teams and user groups. As a data engineer, you have been tasked to ensure that user teams and groups can access only the PII that they require.

How will you implement a solution for this requirement with the LEAST operational effort?

  1. A

    Use Amazon QuickSight to restrict access to a dataset by configuring row-level security (RLS) on it based on the PII needs of each team. To do this, you create a query or file that has one column named UserName or GroupNameand then add one column to the query or file for each field that you want to grant or restrict access to

  2. B

    Use Amazon S3 Access Points to create unique access control policies for each access point to easily control access to shared datasets. Create different Access Points to different user groups with different PII access requirements

  3. C

    Set up AWS Lake Formation and create data filters based on the access permissions needed to each user group. Grant the data filter permissions to different IAM roles. Assign the IAM roles to users based on PII access needs. Use Athena to query the data

  4. D

    Create IAM roles that have different levels of granular access for different PII requirements. Assign the IAM roles to IAM groups. Use an identity-based policy to row and column level access to the IAM groups

Xem giải thích

Đáp án

C — Dùng AWS Lake Formation, tạo data filter theo nhu cầu của từng nhóm, gán quyền cho các IAM role

Vì sao đúng

Đề đòi phân quyền tới mức thông tin cá nhân cụ thể (PII) cho nhiều nhóm người dùng, với công sức ít nhất.

Lake Formation data filter làm đúng điều đó: bạn định nghĩa bộ lọc gồm danh sách cột được phép và biểu thức lọc dòng, rồi gán cho từng IAM role.

Ví dụ: nhóm phân tích thấy được tuoi và khu_vuc nhưng không thấy so_cmnd và email; nhóm chăm sóc khách hàng thì ngược lại.

Lợi thế lớn nhất: quyền khai một lần ở Lake Formation và mọi dịch vụ phân tích của AWS đều tôn trọng — Athena, Redshift Spectrum, EMR, Glue.

Vì sao các phương án khác sai

  • B. Dùng S3 Access Point — phân quyền ở mức đối tượng và tiền tố, không lọc được cột hay dòng bên trong tệp. Đây là phương án nhiễu chính.
  • D. Dùng IAM role với chính sách dựa trên danh tính để phân quyền dòng và cột — IAM không có khái niệm cột hay dòng; nó phân quyền ở mức tài nguyên (bucket, tiền tố, bảng).
  • A. Dùng row-level security của QuickSight — chỉ áp trong QuickSight; người dùng truy cập dữ liệu qua Athena hay EMR vẫn thấy hết. Đây là biện pháp ở sai tầng.
Câu 542 Design High-Performing Architectures

An analytics company wants to improve the performance of its big data processing workflows running on Amazon Elastic File System (Amazon EFS). Which of the following performance modes should be used for Amazon EFS to address this requirement?

  1. A

    Max I/O

  2. B

    Bursting Throughput

  3. C

    Provisioned Throughput

  4. D

    General Purpose

Xem giải thích

Đáp án

A — Max I/O

Vì sao đúng

EFS có hai chế độ hiệu năng, và chúng đánh đổi ngược nhau:

General Purpose Max I/O
Độ trễ mỗi thao tác Thấp nhất Cao hơn một chút
Tổng thông lượng Có trần Cao hơn nhiều, gần như không giới hạn
Hợp với Ứng dụng web, CMS, thư mục người dùng Xử lý dữ liệu lớn, phân tích, media

Workload big data có đặc điểm: hàng trăm tới hàng nghìn tiến trình đọc ghi song song, và điều quan trọng là tổng thông lượng chứ không phải độ trễ của từng thao tác đơn lẻ. Max I/O được thiết kế đúng cho hình dạng đó.

Vì sao các phương án khác sai

  • D. General Purpose — chế độ mặc định, tối ưu độ trễ; nó chạm trần thông lượng khi có quá nhiều client song song. Đây là phương án nhiễu chính.
  • B. Bursting Throughput và C. Provisioned Throughput — cả hai không phải performance mode mà là throughput mode, một trục cấu hình khác. Chúng quyết định lượng thông lượng bạn được cấp, không quyết định kiến trúc xử lý siêu dữ liệu.

Ghi nhớ hai trục cấu hình của EFS

Trục Lựa chọn
Performance mode General Purpose, Max I/O
Throughput mode Bursting, Provisioned, Elastic
Câu 543 Domain 4: Data Security and Governance

A financial services company has developed its flagship application on AWS Cloud with data security requirements such that the encryption key must be stored in a custom application running on-premises. The company wants to offload the data storage as well as the encryption process to Amazon S3 but continue to use the existing encryption key.

Which of the following Amazon S3 encryption options allows the company to leverage Amazon S3 for storing data with given constraints?

  1. A

    Server-Side Encryption with Amazon S3 managed keys (SSE-S3)

  2. B

    Server-Side Encryption with AWS Key Management Service (AWS KMS) keys (SSE-KMS)

  3. C

    Client-Side Encryption with data encryption is done on the client-side before sending it to Amazon S3

  4. D

    Server-Side Encryption with Customer-Provided Keys (SSE-C)

Xem giải thích

Đáp án

D — Server-Side Encryption with Customer-Provided Keys (SSE-C)

Vì sao đúng

Đề đặt hai ràng buộc tưởng như mâu thuẫn:

  • Khoá mã hoá phải nằm ở ứng dụng tại chỗ — không được đưa vào AWS để lưu.
  • Việc mã hoá phải do S3 thực hiện — công ty muốn đẩy cả việc lưu trữ lẫn xử lý mã hoá sang AWS.

SSE-C giải đúng chỗ đó: bạn gửi khoá kèm theo từng yêu cầu (trong header HTTPS), S3 dùng nó để mã hoá hoặc giải mã, rồi xoá khoá khỏi bộ nhớ ngay sau khi xử lý xong. AWS không lưu khoá ở đâu cả.

Ứng dụng tại chỗ (giữ khoá)  --gửi dữ liệu + khoá qua HTTPS-->  S3 mã hoá rồi lưu
                                                                  (khoá bị xoá khỏi bộ nhớ)

Hệ quả cần nhớ: mất khoá là mất dữ liệu vĩnh viễn, vì AWS không có bản sao nào.

Vì sao các phương án khác sai

  • C. Client-Side Encryption — khoá đúng là ở phía bạn, nhưng việc mã hoá cũng do bạn làm; đề nói rõ muốn đẩy việc mã hoá sang S3. Đây là phương án nhiễu chính.
  • B. SSE-KMS — khoá được lưu trong AWS KMS, vi phạm ràng buộc "khoá phải ở ứng dụng tại chỗ".
  • A. SSE-S3 — AWS quản lý toàn bộ khoá; càng không đáp ứng.
Câu 544 Domain 3: Data Operations and Support

A financial services firm is modernizing its message queuing system by migrating from self-managed message-oriented middleware systems to Amazon SQS. The firm is using SQS to migrate several applications to the cloud to ensure high availability and cost efficiency while simplifying administrative complexity and overhead. The data engineering team at the firm expects a peak rate of about 2,400 transactions per second to be processed via SQS. The messages must be processed in the order they are received.

Which of the following options can be used to implement this system most cost-effectively?

  1. A

    Use Amazon SQS standard queue to process the messages

  2. B

    Use Amazon SQS FIFO queue in batch mode of 12 transactions per operation to process the transactions at the peak rate

  3. C

    Use Amazon SQS FIFO queue in batch mode of 4 transactions per operation to process the transactions at the peak rate

  4. D

    Use Amazon SQS FIFO queue in batch mode of 8 transactions per operation to process the transactions at the peak rate

Xem giải thích

Đáp án

D — Dùng SQS FIFO queue ở chế độ gộp lô 8 giao dịch mỗi thao tác

Vì sao đúng

Đây là câu tính toán, dựa trên giới hạn thông lượng của FIFO queue:

FIFO queue xử lý 300 thao tác API mỗi giây cho mỗi hành động (gửi, nhận, xoá). Khi gộp lô, mỗi thao tác mang được tới 10 thông điệp, nên trần là 3.000 thông điệp/giây.

Đề cần 2.400 giao dịch mỗi giây:

Số thông điệp mỗi lô cần thiết = 2.400 ÷ 300 = 8

Vậy gộp 8 thông điệp mỗi thao tác là vừa đủ. Đề cũng nói rõ thông điệp phải được xử lý theo đúng thứ tự, nên bắt buộc dùng FIFO chứ không dùng standard queue.

Vì sao các phương án khác sai

  • C. Gộp lô 4 giao dịch — chỉ đạt 300 × 4 = 1.200 giao dịch/giây, không đủ cho mức đỉnh 2.400.
  • B. Gộp lô 12 giao dịch — vượt giới hạn: mỗi thao tác chỉ mang được tối đa 10 thông điệp. Đây là phương án nhiễu chính vì nó "đủ dùng" về mặt số học nhưng bất khả thi về mặt kỹ thuật.
  • A. Dùng standard queue — thông lượng gần như không giới hạn, nhưng không bảo đảm thứ tự; vi phạm yêu cầu rõ ràng của đề.
Câu 545 Chọn nhiều đáp án Domain 1: Data Ingestion and Transformation

The data engineering team at a company wants to create a daily big data analysis job leveraging Spark for analyzing online/offline sales and customer loyalty data to create customized reports on a client-by-client basis. The big data analysis job needs to read the data from Amazon S3 and output it back to Amazon S3.

Which technology do you recommend to run the Big Data analysis job? (Select two)

  1. A

    AWS Glue

  2. B

    Amazon Redshift

  3. C

    AWS Batch

  4. D

    Amazon Athena

  5. E

    Amazon EMR

Xem giải thích

Đáp án

A và E — AWS Glue và Amazon EMR

Vì sao đúng

Đề đòi chạy Spark để phân tích, đọc từ S3 và ghi lại S3. Hai dịch vụ này đều chạy Spark, khác nhau ở mức quản lý:

AWS Glue Amazon EMR
Loại Serverless Cụm bạn quản lý
Cấp phát Không có gì Chọn loại và số node
Kiểm soát Ít hơn Cao — tuỳ chỉnh Spark, cài thư viện, dùng Spot
Hợp với Job ETL theo lịch Workload phức tạp, cần tinh chỉnh sâu

Với công việc chạy hằng ngày như trong đề, Glue thường là lựa chọn tiện hơn; EMR đáng chọn khi cần kiểm soát cấu hình Spark hoặc muốn dùng Spot Instance để giảm chi phí.

Vì sao các phương án khác sai

  • D. Amazon Athena — truy vấn bằng SQL trên S3; nó không chạy mã Spark của bạn. (Athena có hỗ trợ Spark qua workgroup riêng, nhưng đó là tính năng khác và không phải cách dùng chính.) Đây là phương án nhiễu chính.
  • B. Amazon Redshift — kho dữ liệu; đòi nạp dữ liệu vào cụm và truy vấn bằng SQL, không chạy Spark.
  • C. AWS Batch — chạy công việc theo lô trong container; nó là nền tính toán chung, không phải nền tảng Spark có sẵn.
Câu 546 Chọn nhiều đáp án Domain 3: Data Operations and Support

A company runs a real-time data processing application that uses Kinesis Client Library (KCL) to help consume and process data from the real-time data streams. The development team has raised a query on the viability of using the same DynamoDB table for different KCL applications.

Which of the following are correct statements for KCL while consuming Kinesis Data Streams? (Select two)

  1. A

    Multiple KCL applications can share a DynamoDB table if Amazon Amazon Simple Storage Service (Amazon S3) is configured to save transit data and metadata

  2. B

    You can only use DynamoDB for checkpointing KCL

  3. C

    Amazon Relational Database Service (Amazon RDS) can also be used for checkpointing KCL

  4. D

    Multiple KCL applications can share a DynamoDB table

  5. E

    Each KCL application must use its own DynamoDB table

Xem giải thích

Đáp án

B và E — chỉ dùng được DynamoDB để lưu điểm kiểm tra (checkpoint), và mỗi ứng dụng KCL phải có bảng DynamoDB riêng

Vì sao đúng

Kinesis Client Library dùng một bảng DynamoDB để lưu trạng thái của ứng dụng tiêu thụ:

Cột trong bảng Ghi gì
Shard ID Mỗi shard một dòng
Checkpoint Vị trí đã xử lý tới đâu trong shard
Lease owner Worker nào đang giữ shard đó
Lease counter Dùng để phát hiện worker chết
  • B. Chỉ dùng được DynamoDB — KCL không hỗ trợ kho lưu trạng thái nào khác; điều này cố định trong thư viện.
  • E. Mỗi ứng dụng KCL phải có bảng riêng — vì tên bảng được đặt theo tên ứng dụng, và mỗi ứng dụng có vị trí checkpoint riêng trên cùng một luồng. Dùng chung bảng nghĩa là hai ứng dụng ghi đè checkpoint của nhau — mỗi bên sẽ bỏ sót hoặc xử lý lại dữ liệu.

Vì sao các phương án khác sai

  • D. Nhiều ứng dụng KCL dùng chung một bảng DynamoDB — mâu thuẫn trực tiếp với E, và gây đúng lỗi vừa mô tả.
  • A. Dùng chung bảng được nếu cấu hình S3 để lưu dữ liệu và siêu dữ liệu trung gian — bịa; KCL không có cơ chế nào như vậy.
  • C. Dùng được Amazon RDS để checkpoint — sai, và mâu thuẫn với B.
Câu 547 Design Secure Architectures

A company has multiple Amazon EC2 instances operating in a private subnet which is part of a custom VPC. These instances are running an image processing application that needs to access images stored on Amazon S3. Once each image is processed, the status of the corresponding record needs to be marked as completed in an Amazon DynamoDB table.

How would you go about providing private access to these AWS resources which are not part of this custom VPC?

  1. A

    Create a separate gateway endpoint for Amazon S3 and Amazon DynamoDB each. Add two new target entries for these two gateway endpoints in the route table of the custom VPC

  2. B

    Create a gateway endpoint for Amazon DynamoDB and add it as a target in the route table of the custom VPC. Create an Origin Access Control (OAC) for Amazon S3 and then connect to the S3 service using the private IP address

  3. C

    Create a separate interface endpoint for Amazon S3 and Amazon DynamoDB each. Then connect to these services by adding these as targets in the route table of the custom VPC

  4. D

    Create a gateway endpoint for Amazon S3 and add it as a target in the route table of the custom VPC. Create an interface endpoint for Amazon DynamoDB and then add it as a target in the route table of the custom VPC

Xem giải thích

Đáp án

A — Tạo gateway endpoint riêng cho S3 và cho DynamoDB, rồi thêm hai mục tương ứng vào bảng định tuyến của VPC

Vì sao đúng

Đây là chi tiết cần nhớ chính xác: chỉ có đúng hai dịch vụ hỗ trợ gateway endpoint — Amazon S3 và DynamoDB. Và đề cần đúng hai dịch vụ đó.

Gateway endpoint hoạt động bằng cách thêm một tuyến vào bảng định tuyến của VPC, trỏ dải địa chỉ của dịch vụ tới endpoint. Nhờ vậy instance ở private subnet gọi được S3 và DynamoDB hoàn toàn trong mạng riêng của AWS — không cần NAT gateway, không ra Internet.

Về chi phí, đây cũng là lựa chọn tốt nhất: gateway endpoint hoàn toàn miễn phí, cả phí giờ lẫn phí dữ liệu.

Vì sao các phương án khác sai

  • D. Gateway endpoint cho S3 và interface endpoint cho DynamoDB, cả hai thêm vào bảng định tuyến — sai ở hai chỗ: DynamoDB có gateway endpoint (không cần dùng interface), và quan trọng hơn, interface endpoint không thêm vào bảng định tuyến — nó tạo một network interface có địa chỉ IP riêng. Đây là phương án nhiễu chính.
  • C. Interface endpoint cho cả hai, thêm vào bảng định tuyến — sai cùng lý do về cơ chế, và đắt hơn vì interface endpoint tính phí.
  • B. Origin Access Control cho S3 — OAC là cơ chế của CloudFront, không liên quan tới truy cập từ VPC.
Câu 548 Domain 1: Data Ingestion and Transformation

A company is looking to develop real-time analytics capabilities and plans to utilize Amazon Kinesis Data Streams and Amazon Redshift to handle streaming data at rates of several gigabytes per second. The company aims to achieve near real-time insights using the existing business intelligence (BI) and analytics tools.

What solution would fulfill these requirements with minimal operational overhead?

  1. A

    Set up Amazon Redshift streaming ingestion by configuring an external schema that maps to the streaming data source in Amazon Kinesis Data Streams. Create a materialized view that references the external schema. Configure the materialized view to auto-refresh

  2. B

    Set up streaming data ingestion in Amazon Kinesis Data Streams and create materialized views directly on top of the stream by using SQL queries. Configure the materialized view to auto-refresh

  3. C

    Set up streaming data ingestion in Amazon Kinesis Data Firehose, write the delivery streams data into Amazon S3 and load it into the Redshift cluster using the COPY command on a real-time basis

  4. D

    Set up streaming data ingestion in Amazon Kinesis Data Streams, stage the streams data into Amazon S3 and load it into the Redshift cluster using the COPY command on a real-time basis

Xem giải thích

Đáp án

A — Cấu hình Redshift streaming ingestion: tạo external schema trỏ tới Kinesis Data Streams, rồi tạo materialized view tham chiếu schema đó

Vì sao đúng

Redshift streaming ingestion là tính năng cho phép Redshift đọc thẳng từ Kinesis Data Streams, không qua S3. Đây là điểm quyết định cho tiêu chí "ít công vận hành nhất":

Kinesis Data Streams  ──────────▶  Materialized view trong Redshift  ──▶  công cụ BI
                    (đọc trực tiếp, không có bước trung gian)

So với cách cũ (Kinesis → S3 → COPY vào Redshift), nó bỏ được: bucket trung gian, lịch chạy lệnh COPY, việc dọn tệp cũ, và độ trễ của cả chuỗi đó.

Materialized view tự làm mới, và vì dữ liệu nằm trong Redshift nên công cụ BI hiện có kết nối như bình thường — đúng yêu cầu của đề.

Nó cũng chịu được mức vài gigabyte mỗi giây mà đề nêu.

Vì sao các phương án khác sai

  • D và C. Stage dữ liệu qua S3 rồi COPY vào Redshift — cách làm truyền thống; thêm một chặng, thêm độ trễ, và thêm việc phải quản lý. D là phương án nhiễu chính vì nó đúng về mặt khả thi.
  • B. Tạo materialized view trực tiếp trên luồng Kinesis bằng SQL — Kinesis Data Streams không có khái niệm materialized view; nó là dịch vụ luồng, không phải cơ sở dữ liệu.
Câu 549 Chọn nhiều đáp án Domain 4: Data Security and Governance

During a code review it was discovered that the credentials to access an Amazon Redshift cluster were hard-coded into an AWS Glue job script. As a data engineer, you have been tasked with remediating the security vulnerability in the script and suggesting a way to securely access the needed credentials by the AWS Glue job.

Which options would you recommend for this remediation task? (Select two)

  1. A

    Create an IAM role with necessary permissions to access the Secrets Manager and attach the role to the Redshift cluster

  2. B

    Create an IAM role with necessary permissions to access the Secrets Manager and attach the role to the AWS Glue job

  3. C

    Store the credentials in the AWS Glue job parameters that will be accessed dynamically when the job is started

  4. D

    Store the credentials in AWS Secrets Manager

  5. E

    Create a configuration file on Amazon S3 and access the file using the AWS Glue job

Xem giải thích

Đáp án

B và D — lưu thông tin đăng nhập trong AWS Secrets Manager, và tạo IAM role gắn cho AWS Glue job để đọc bí mật đó

Vì sao đúng

Hai bước này ghép thành cách xử lý chuẩn cho bí mật trong quy trình dữ liệu:

  • D. Lưu trong Secrets Manager — bí mật được mã hoá bằng KMS, phân quyền bằng IAM, ghi lại mọi lần truy cập qua CloudTrail, và xoay vòng tự động được (Secrets Manager tích hợp sẵn với Redshift để đổi mật khẩu theo lịch).
  • *B. IAM role gắn cho Glue job — chi tiết quan trọng nằm ở chỗ gắn cho ai: chính Glue job là bên gọi GetSecretValue, nên role phải gắn vào nó.

Kết quả: không còn thông tin đăng nhập nào trong mã, và xoay vòng mật khẩu không phải sửa script.

Vì sao các phương án khác sai

  • *A. Gắn IAM role vào cụm Redshift — sai bên: cụm Redshift là bên nhận kết nối, nó không cần đọc bí mật; Glue job mới là bên cần. Đây là phương án nhiễu chính, và nó chỉ khác đáp án đúng ở một danh từ.
  • C. Lưu thông tin đăng nhập trong tham số của Glue job — tham số job nhìn thấy được trong Console, trong API và trong nhật ký chạy job; chỉ đổi chỗ giấu chứ không giải quyết vấn đề.
  • E. Tạo tệp cấu hình trên S3 — mật khẩu nằm ở dạng rõ trong một tệp; ai đọc được bucket là đọc được mật khẩu.
Câu 550 Domain 3: Data Operations and Support

A legacy application is built using a tightly-coupled monolithic architecture. Due to a sharp increase in the number of users, the application performance has degraded. The company now wants to decouple the architecture and adopt AWS microservices architecture. Some of these microservices need to handle fast-running processes whereas other microservices need to handle slower processes.

Which of these options would you identify as the right way of connecting these microservices?

  1. A

    Configure Amazon Simple Queue Service (Amazon SQS) queue to decouple microservices running faster processes from the microservices running slower ones

  2. B

    Use Amazon Simple Notification Service (Amazon SNS) to decouple microservices running faster processes from the microservices running slower ones

  3. C

    Add Amazon EventBridge to decouple the complex architecture

  4. D

    Configure Amazon Kinesis Data Streams to decouple microservices running faster processes from the microservices running slower ones

Xem giải thích

Đáp án

A — Dùng Amazon SQS để tách rời microservice chạy nhanh khỏi microservice chạy chậm

Vì sao đúng

Chi tiết quyết định trong đề: một số microservice xử lý nhanh, số khác xử lý chậm. Đó chính là tình huống hàng đợi sinh ra để giải.

SQS làm bộ đệm giữa hai bên: dịch vụ nhanh đẩy thông điệp vào hàng đợi rồi đi tiếp ngay, không phải chờ dịch vụ chậm xử lý xong. Dịch vụ chậm lấy thông điệp ra theo tốc độ của mình.

Ba lợi ích trực tiếp:

  • Không bị chặn — bên nhanh không bị bên chậm kéo lại.
  • Chịu được đợt tăng đột biến — thông điệp xếp hàng thay vì làm sập bên nhận.
  • Cách ly lỗi — bên chậm chết tạm thời thì thông điệp vẫn nằm chờ (tới 14 ngày).

Vì sao các phương án khác sai

  • B. Amazon SNS — mô hình xuất bản và đăng ký: nó đẩy thông điệp đi ngay và không lưu lại. Bên nhận đang chậm hoặc đang chết thì thông điệp mất. Đây là phương án nhiễu chính, và điểm phân biệt chính là khả năng đệm.
  • D. Kinesis Data Streams — dựng cho luồng dữ liệu khối lượng lớn cần đọc lại được; dùng làm bộ đệm giữa hai microservice là phức tạp và tốn kém hơn cần thiết.
  • C. Amazon EventBridge — bus sự kiện định tuyến theo luật; nó tốt cho kiến trúc hướng sự kiện nhưng cũng không đệm như hàng đợi.