Ngân hàng đề — AWS Certified Data Engineer Associate

Tìm thấy 867 câu.

Câu 201 Data Security and Governance

A financial services company uses Amazon Kinesis Data Streams to capture and store streaming stock market data. They are concerned about data durability and want to ensure that if an Availability Zone (AZ) goes down, their data stream can still be processed. Which feature of Kinesis Data Streams ensures the data’s durability?

  1. A

    Data is replicated across multiple shards in a single AZ.

  2. B

    Data is stored on durable EBS volumes within the stream.

  3. C

    Data is replicated across multiple Availability Zones.

  4. D

    Data is automatically stored in Amazon S3 for backup.

Xem giải thích

Đáp án

C — Dữ liệu được nhân bản qua nhiều vùng sẵn sàng

Vì sao đúng

Mỗi bản ghi đưa vào Kinesis Data Streams được ghi đồng bộ sang ba vùng sẵn sàng trong cùng một khu vực trước khi dịch vụ báo nhận thành công. Nhờ vậy mất trọn một AZ thì luồng vẫn đọc và ghi bình thường — đúng điều đề lo lắng, và bạn không phải cấu hình gì thêm.

Vì sao các phương án khác sai

  • A. Nhân bản qua nhiều shard trong một AZ — shard là đơn vị chia thông lượng, không phải bản sao; và nằm trong một AZ thì mất AZ là mất hết.
  • B. Lưu trên EBS trong luồng — Kinesis không phơi ra bất kỳ ổ đĩa nào, đây là mô tả sai.
  • D. Tự sao lưu vào S3 — không tự động; muốn xuống S3 thì phải dựng Firehose hoặc consumer riêng.
Câu 202 Data Operations and Support

A company is using AWS Glue for ETL operations and wants to automate the deployment and configuration of their AWS Glue jobs using infrastructure as code. They also need to trigger AWS Glue jobs from an S3 event using AWS Lambda. Which AWS service or tool would best help them achieve these requirements?

  1. A

    AWS CodeDeploy

  2. B

    AWS Elastic Beanstalk

  3. C

    AWS CloudFormation

  4. D

    AWS SAM (Serverless Application Model)

Xem giải thích

Đáp án

D — AWS SAM (Serverless Application Model)

Vì sao đúng

SAM là phần mở rộng của CloudFormation dành riêng cho ứng dụng không máy chủ. Cùng một hạ tầng, mô tả bằng SAM ngắn hơn hẳn: khai một AWS::Serverless::Function là có luôn hàm Lambda, vai IAM và trình kích hoạt từ sự kiện S3 — chính là thứ đề cần. SAM CLI còn cho chạy thử tại máy trước khi triển khai.

Vì sao các phương án khác sai

  • A. CodeDeploy — lo việc đưa bản mới ra sao (từng bước, xanh–lam), không phải khai báo hạ tầng.
  • B. Elastic Beanstalk — nền tảng cho ứng dụng web chạy trên máy chủ, không dựng cho Lambda và Glue.
  • C. CloudFormation — làm được, và SAM chạy trên chính nó. Ở đây SAM là câu trả lời sát hơn vì đề nói tới Lambda kích hoạt bởi sự kiện S3, đúng phần SAM viết gọn nhất.
Câu 203 Chọn nhiều đáp án Data Security and Governance

A healthcare company wants to build a serverless system that automatically processes patient records as they are uploaded to an Amazon S3 bucket. After processing, the Lambda function should store the results in an Amazon RDS database. The company also needs to ensure the processed data is auditable to meet regulatory compliance. Which combination of steps should the company implement to meet these requirements? (Choose TWO.)

  1. A

    Use AWS Key Management Service (KMS) to encrypt the processed data before storing it in Amazon RDS.

  2. B

    Store the processed data in Amazon DynamoDB instead of Amazon RDS for automatic scaling.

  3. C

    Set up AWS CloudTrail to log API activity for all Lambda function invocations and database interactions.

  4. D

    Use Amazon S3 Transfer Acceleration to ensure secure and fast uploads of patient records.

  5. E

    Configure Amazon S3 to trigger the Lambda function whenever new patient records are uploaded.

Xem giải thích

Đáp án

C và E

Vì sao đúng

  • E. Cho S3 kích hoạt Lambda khi có hồ sơ mới — đây là mắt xích làm cho cả hệ thống thành "tự động, không máy chủ". Không có nó thì chẳng có gì gọi hàm xử lý.
  • C. Bật CloudTrail ghi lại lời gọi API — ngành y tế đòi dấu vết kiểm toán: ai gọi hàm nào, lúc nào, và hàm đó đụng tới CSDL ra sao. CloudTrail là nơi duy nhất trong danh sách cho việc đó.

Vì sao các phương án khác sai

  • A. Dùng KMS mã hoá trước khi ghi vào RDS — mã hoá là việc nên làm, nhưng RDS đã có mã hoá khi lưu sẵn; tự mã hoá thêm ở tầng ứng dụng không phải điều đề hỏi.
  • B. Đổi sang DynamoDB — thay đổi kiến trúc mà đề không yêu cầu.
  • D. S3 Transfer Acceleration — tăng tốc tải lên từ xa, không liên quan tới xử lý tự động hay kiểm toán.
Câu 204 Data Security and Governance

A company wants to copy an encrypted Amazon EBS volume snapshot from one AWS region to another. The volume is encrypted using a customer managed key. What must the data engineer do to ensure the snapshot remains encrypted in the destination region?

  1. A

    Re-encrypt the snapshot using the default AWS managed key in the target region.

  2. B

    Disable encryption during the snapshot copy process, then re-enable it in the target region.

  3. C

    Use a customer managed key in the destination region to re-encrypt the snapshot.

  4. D

    Use the same key from the source region to encrypt the snapshot in the target region.

Xem giải thích

Đáp án

C — Dùng một customer managed key ở vùng đích để mã hoá lại snapshot

Vì sao đúng

Khoá KMS gắn với một vùng duy nhất, không dùng được ở vùng khác. Vì vậy khi chép snapshot đã mã hoá sang vùng mới, thao tác chép bắt buộc phải chỉ ra một khoá của vùng đích; AWS giải mã bằng khoá nguồn rồi mã hoá lại bằng khoá đích ngay trong quá trình chép. Bạn không phải làm thủ công bước nào, chỉ cần khai đúng khoá.

Vì sao các phương án khác sai

  • A. Dùng khoá mặc định của AWS ở vùng đích — chạy được về mặt kỹ thuật nhưng mất quyền kiểm soát khoá; đề nói rõ đang dùng khoá do khách hàng quản lý.
  • B. Tắt mã hoá rồi bật lại — không thể: snapshot đã mã hoá không giải mã ngược ra được, và làm vậy là để lộ dữ liệu.
  • D. Dùng chính khoá của vùng nguồn — không hợp lệ, khoá không vượt ra khỏi vùng của nó.
Câu 205 Data Ingestion and Transformation

A data engineer is preparing customer transaction data stored in an Amazon S3 bucket for analysis. The data contains a column with both city names and ZIP codes combined into one field, separated by a comma. The engineer wants to split this column into two separate fields using AWS Glue DataBrew. Which of the following transformations in DataBrew should the engineer use to accomplish this task?

  1. A

    Split Column

  2. B

    Join Datasets

  3. C

    Nest to Map

  4. D

    Unpivot

Xem giải thích

Đáp án

A — Split Column

Vì sao đúng

Cột hiện chứa hai giá trị ghép lại bằng dấu phẩy. Split Column của DataBrew tách theo ký tự phân cách và sinh ra các cột mới, giữ nguyên cột gốc để đối chiếu. Đúng một bước, không phải viết mã.

Vì sao các phương án khác sai

  • B. Join Datasets — ghép hai bộ dữ liệu lại với nhau, ngược hướng với việc cần làm.
  • C. Nest to Map — gom nhiều cột thành một cấu trúc lồng nhau, càng gộp thêm chứ không tách ra.
  • D. Unpivot — xoay cột thành dòng; đổi hình dạng bảng chứ không tách nội dung trong một ô.
Câu 206 Data Store Management

A data engineer is using Amazon QuickSight to visualize data stored in Amazon S3. They want to ensure fast performance by caching the data in memory for quicker access when users query large datasets. Which feature of QuickSight will enable this capability?

  1. A

    SPICE

  2. B

    Dashboards

  3. C

    Amazon Athena

  4. D

    VPC Peering

Xem giải thích

Đáp án

A — SPICE

Vì sao đúng

SPICE là bộ máy tính toán trong bộ nhớ của QuickSight. Dữ liệu được nạp sẵn vào đó nên biểu đồ trả lời trong vài giây kể cả với bộ dữ liệu lớn, và không gọi xuống nguồn ở mỗi thao tác — nhờ vậy vừa nhanh vừa không đội chi phí truy vấn. Dữ liệu được làm mới theo lịch hoặc theo yêu cầu.

Vì sao các phương án khác sai

  • B. Dashboards — nơi hiển thị kết quả, không phải cơ chế tăng tốc.
  • C. Amazon Athena — nguồn dữ liệu; nếu truy vấn thẳng qua nó thì mỗi thao tác là một lần quét S3, đúng thứ SPICE giúp tránh.
  • D. VPC Peering — nối mạng riêng, không liên quan tới tốc độ hiển thị.
Câu 207 Data Ingestion and Transformation

A data engineer needs to develop, train, and deploy a machine learning model using SageMaker. The engineer wants to use TensorFlow as the framework and needs a development environment that allows for interactive data exploration and visualization. Which of the following SageMaker components should the data engineer use?

  1. A

    SageMaker Studio with Jupyter notebooks for model development

  2. B

    SageMaker Feature Store for managing input data and predictions

  3. C

    SageMaker Debugger to analyze and debug the training process

  4. D

    SageMaker Autopilot for automated model tuning and deployment

Xem giải thích

Đáp án

A — SageMaker Studio với Jupyter notebook

Vì sao đúng

Đề cần một môi trường phát triển để khám phá dữ liệu và vẽ biểu đồ tương tác, rồi từ đó huấn luyện và triển khai. Studio đúng là thứ đó: notebook chạy trong trình duyệt, đổi loại máy tính toán mà không mất phiên làm việc, và có sẵn container TensorFlow do AWS dựng nên không phải tự cài.

Vì sao các phương án khác sai

  • B. Feature Store — kho đặc trưng dùng chung giữa huấn luyện và suy luận; hữu ích nhưng không phải môi trường phát triển.
  • C. Debugger — bắt lỗi trong lúc huấn luyện, dùng sau khi đã có mã.
  • D. Autopilot — tự chọn mô hình và siêu tham số giúp bạn, trái với yêu cầu tự dùng TensorFlow và tự khám phá dữ liệu.
Câu 208 Data Operations and Support

A data engineer is tasked with troubleshooting performance issues in a custom application running on an Amazon EC2 instance. The engineer wants to monitor key performance metrics such as CPU utilization and disk I/O activity, set alarms for when the instance’s CPU exceeds 80%, and log all API activity that affects the instance. Which combination of AWS services should the engineer use to meet these requirements?

  1. A

    AWS Config for tracking performance metrics, AWS CloudWatch for setting alarms, and AWS CloudTrail for logging API activity.

  2. B

    AWS CloudWatch for tracking performance metrics and setting alarms, and AWS CloudTrail for logging API activity.

  3. C

    AWS CloudTrail for tracking performance metrics and setting alarms, and AWS CloudWatch for logging API activity.

  4. D

    AWS CloudTrail for monitoring API activity, AWS CloudWatch for tracking performance metrics, and AWS Config for setting alarms.

Xem giải thích

Đáp án

B — CloudWatch cho chỉ số và cảnh báo, CloudTrail cho nhật ký lời gọi API

Vì sao đúng

Phân vai đúng như thiết kế của AWS: CloudWatch thu chỉ số như CPU và I/O đĩa rồi đặt cảnh báo khi vượt ngưỡng — cả hai việc đề nêu đều nằm trong đó. CloudTrail ghi lại lời gọi API, tức là ai đã đụng vào máy, phần bổ sung cho việc truy nguyên.

Lưu ý thực tế: bộ nhớ và dung lượng đĩa không có sẵn trong chỉ số mặc định của EC2, phải cài CloudWatch agent mới thu được.

Vì sao các phương án khác sai

  • A — Config theo dõi cấu hình tài nguyên, không thu chỉ số hiệu năng.
  • C — đảo ngược vai của hai dịch vụ.
  • D — đưa thêm Config vào một bài toán thuần hiệu năng, không cần thiết.
Câu 209 Data Security and Governance

A company needs to securely store and manage sensitive customer information in Amazon S3. They are required to meet strict data privacy regulations, ensuring that the data is encrypted both at rest and in transit. Additionally, they want to ensure that only specific applications from their internal network can access this data. Which combination of features should they use to achieve this?

  1. A

    Enable S3 server-side encryption with customer-provided keys (SSE-C) and configure cross-region replication to a secure secondary bucket.

  2. B

    Enable S3 server-side encryption with AWS KMS keys (SSE-KMS) and configure a bucket policy allowing access only through a VPC endpoint.

  3. C

    Enable S3 server-side encryption (SSE-S3) and configure VPC endpoint policies for Amazon S3.

  4. D

    Enable S3 server-side encryption with customer-provided keys (SSE-C) and configure a bucket policy restricting access to specific IP ranges.

Xem giải thích

Đáp án

B — Bật SSE-KMS và đặt bucket policy chỉ cho phép truy cập hợp lệ

Vì sao đúng

SSE-KMS mã hoá dữ liệu khi lưu bằng khoá KMS, và mọi lần dùng khoá đều vào CloudTrail nên kiểm toán được. Phần "chỉ người được phép mới truy cập" do bucket policy lo. Muốn chặt cả phần đường truyền thì thêm điều kiện aws:SecureTransport để từ chối mọi yêu cầu không dùng HTTPS.

Vì sao các phương án khác sai

  • A. SSE-C kèm nhân bản liên vùng — với SSE-C bạn phải gửi khoá theo từng yêu cầu và tự bảo quản khoá; AWS không giữ hộ, nên vận hành rất nặng và dễ mất dữ liệu.
  • C. SSE-S3 kèm VPC endpoint policy — SSE-S3 dùng khoá AWS quản lý, không cho bạn kiểm soát và kiểm toán việc dùng khoá.
  • D. SSE-C kèm bucket policy — vẫn vướng đúng vấn đề quản lý khoá của SSE-C.
Câu 210 Data Operations and Support

A gaming company is using Amazon MemoryDB for Redis to manage real-time game session data, leaderboards, and player stats. They require high availability, data persistence, and in-memory performance to ensure low-latency responses during game play. However, they are concerned about data loss in case of node failure. Which feature of Amazon MemoryDB ensures that data remains available and consistent, even in the event of a node failure?

  1. A

    Manual backup and restore procedures

  2. B

    Redis's eviction policies for managing memory

  3. C

    Multi-AZ replication with automatic failover

  4. D

    DynamoDB Streams for capturing real-time data changes

Xem giải thích

Đáp án

C — Nhân bản Multi-AZ có tự chuyển đổi khi hỏng

Vì sao đúng

MemoryDB ghi mọi thay đổi vào một nhật ký giao dịch phân tán qua nhiều AZ trước khi báo thành công — đó là lý do nó bền vững chứ không chỉ là bộ nhớ đệm như Redis thường. Cộng thêm replica ở AZ khác và tự chuyển đổi khi node chính hỏng, bạn có đủ ba thứ đề đòi: sẵn sàng cao, dữ liệu không mất, và độ trễ vẫn ở mức bộ nhớ.

Vì sao các phương án khác sai

  • A. Sao lưu và khôi phục bằng tay — mất dữ liệu giữa hai lần sao lưu, và thời gian ngừng tính bằng phút; ván game đã hỏng từ lâu.
  • B. Chính sách loại bỏ của Redis — quyết định vứt gì khi hết bộ nhớ, ngược hẳn với yêu cầu giữ dữ liệu.
  • D. DynamoDB Streams — thuộc dịch vụ khác, không liên quan tới MemoryDB.