Ngân hàng đề — AWS Certified Data Engineer Associate

Tìm thấy 867 câu.

Câu 151 Data Store Management

A Redshift cluster administrator is tasked with sharing live data from a production Redshift cluster to another Redshift cluster in a different AWS account. The data should remain in the original cluster and the consuming account should bear the compute cost of querying the data. Which Redshift feature would best meet these requirements?

  1. A

    Redshift Data API

  2. B

    Redshift Spectrum

  3. C

    Redshift Data Sharing

  4. D

    Redshift Replication

Xem giải thích

Đáp án

C — Redshift Data Sharing

Vì sao đúng

Data Sharing cho phép cụm sản xuất chia sẻ dữ liệu sống sang cụm khác, kể cả khác tài khoản AWS, mà không sao chép và không di chuyển dữ liệu. Cụm tiêu thụ đọc thẳng từ nơi lưu gốc và tự trả chi phí tính toán cho truy vấn của mình — khớp đúng cả ba điều kiện đề bài đặt ra.

Vì sao các phương án khác sai

  • A. Redshift Data API — chỉ là cách gọi truy vấn qua HTTP không cần giữ kết nối, không liên quan tới việc chia sẻ dữ liệu giữa hai cụm.
  • B. Redshift Spectrum — truy vấn dữ liệu nằm trên S3, không phải dữ liệu trong cụm khác.
  • D. Redshift Replication — nhân bản là tạo thêm một bản sao, trái với yêu cầu "dữ liệu phải nằm nguyên ở cụm gốc".

Nhớ nhanh

Thấy "live data", "không sao chép", "bên tiêu thụ trả tiền tính toán" → Data Sharing.

Câu 152 Data Operations and Support

An AWS data engineer is tasked with backing up EBS volumes regularly to protect against data loss. These backups must be efficient, cost-effective, and able to be restored quickly in another availability zone or region. What should the engineer do to meet these requirements?

  1. A

    Detach the EBS volumes and copy them to another region manually using EC2 AMIs for redundancy.

  2. B

    Use AWS Lambda to automatically create new EBS volumes in another region based on the current EBS volume data.

  3. C

    Create Amazon S3 backups of the EBS volumes using S3 Transfer Acceleration for faster data transfer.

  4. D

    Configure EBS Snapshots to perform block-level backups of the volumes, and store them in Amazon S3 with cross-region replication.

Xem giải thích

Đáp án

D — Dùng EBS Snapshot, lưu trên S3 và bật sao chép liên vùng

Vì sao đúng

EBS Snapshot sao lưu ở mức khối và mang tính tăng dần: chỉ những khối thay đổi kể từ lần chụp trước mới bị tính tiền, nên vừa nhanh vừa rẻ. Snapshot lưu trên S3 do AWS quản lý và khôi phục được thành volume mới ở bất kỳ AZ nào; sao chép snapshot sang vùng khác thì khôi phục được ở vùng đó. Đây là cơ chế AWS thiết kế sẵn cho đúng bài toán này.

Vì sao các phương án khác sai

  • A. Tháo volume rồi chép tay — phải dừng dịch vụ, làm thủ công, không thể "định kỳ".
  • B. Lambda tự tạo volume ở vùng khác — tự dựng lại thứ đã có sẵn, và Lambda có trần thời gian chạy 15 phút nên không kham nổi volume lớn.
  • C. Sao lưu vào S3 qua Transfer Acceleration — Transfer Acceleration chỉ tăng tốc đường truyền tới S3, không phải cơ chế sao lưu; vẫn phải tự viết phần đọc volume.

Nhớ nhanh

Sao lưu EBS thì mặc định nghĩ tới Snapshot: tăng dần, rẻ, khôi phục sang AZ hoặc vùng khác.

Câu 153 Chọn nhiều đáp án Data Ingestion and Transformation

A data engineering team at an e-commerce company needs to build a data pipeline to ingest and transform data from various sources for reporting and analysis. The raw data is stored in Amazon S3 as JSON files. The company wants to transform the data into a columnar format to optimize query performance. After the transformation, the data should be stored back in S3 and queried using Amazon Athena for reporting purposes.
The company also wants to automate schema discovery and ensure that the pipeline is cost-effective, scalable, and easily maintainable. Which TWO of the following strategies should the team implement to meet these requirements? (Choose Two)

  1. A

    Manually create an Amazon Athena table with the schema for the JSON data and run SQL queries to perform data transformation into Parquet format.

  2. B

    Set up an Amazon EMR cluster to run a Spark job that reads data from S3, converts it to Parquet, and writes it back to S3. Use AWS Glue Data Catalog to maintain the schema for Athena.

  3. C

    Use an AWS Glue ETL job to transform the JSON data into Apache Parquet format and store it in Amazon S3 for efficient querying with Athena.

  4. D

    Use AWS Lambda to read the JSON files from S3, transform them into Parquet format, and write the transformed data back into a new S3 bucket.

  5. E

    Configure an AWS Glue crawler to automatically infer the schema from the JSON files and update the AWS Glue Data Catalog with the correct schema.

Xem giải thích

Đáp án

C và E — AWS Glue ETL job chuyển JSON sang Parquet, cộng Glue crawler suy ra lược đồ

Vì sao đúng

Hai phương án này ghép thành đúng một đường ống Glue hoàn chỉnh:

  • Crawler (E) quét tệp JSON trên S3, tự suy ra lược đồ và ghi vào Glue Data Catalog. Không có bước này thì Athena chẳng biết bảng có những cột gì.
  • ETL job (C) đọc theo lược đồ đó, đổi sang Parquet — định dạng cột, nén tốt, và Athena chỉ đọc đúng cột cần nên vừa nhanh hơn vừa rẻ hơn (Athena tính tiền theo lượng dữ liệu quét).

Cả hai đều không máy chủ, đúng yêu cầu vận hành tối thiểu.

Vì sao các phương án khác sai

  • A. Tự khai bảng Athena rồi chuyển bằng SQL — làm tay, không tự động hoá được.
  • B. Cụm EMR chạy Spark — làm được nhưng phải quản lý cụm, trái yêu cầu "ít vận hành".
  • D. Lambda đổi định dạng — trần 15 phút và trần bộ nhớ khiến nó gãy khi tệp lớn dần.

Nhớ nhanh

Crawler lo lược đồ, ETL job lo biến đổi. Hỏi "JSON sang Parquet, ít vận hành" → Glue.

Câu 154 Data Store Management

A company is using IoT devices to generate streaming data that it needs to deliver to both Amazon S3 and Amazon Redshift for storage and further analysis. Which service is the most efficient way to capture, transform, and load this streaming data into the required destinations?

  1. A

    Amazon Managed Service for Apache Flink

  2. B

    Amazon Kinesis Data Streams

  3. C

    AWS Lambda

  4. D

    Amazon Kinesis Data Firehose

Xem giải thích

Đáp án

D — Amazon Kinesis Data Firehose

Vì sao đúng

Firehose là dịch vụ giao nhận được quản lý hoàn toàn: nhận luồng vào, biến đổi được bằng Lambda ngay trên đường đi, rồi tự ghi xuống S3 và Redshift — cả hai đều là đích đến có sẵn, không phải viết consumer nào. Nó tự gom lô, tự nén, tự thử lại, và tự co giãn theo lưu lượng.

Vì sao các phương án khác sai

  • A. Managed Service for Apache Flink — mạnh cho phân tích phức tạp theo cửa sổ thời gian, nhưng đề chỉ cần chuyển dữ liệu tới đích, dùng nó là thừa và đắt.
  • B. Kinesis Data Streams — chỉ là ống chứa; muốn xuống S3 hay Redshift thì vẫn phải tự viết và tự vận hành consumer.
  • C. AWS Lambda — tự viết toàn bộ phần gom lô, thử lại, ghi đích; đúng thứ Firehose đã làm sẵn.

Nhớ nhanh

Streams là ống, Firehose là ống có sẵn đầu ra. Đề nói "load vào S3 và Redshift" → Firehose.

Câu 155 Data Ingestion and Transformation

A company operating in a remote mining site with very limited internet connectivity needs to transfer large amounts of data to AWS for processing. Additionally, they require edge computing capabilities to process data locally before transferring it to AWS. Which AWS service would be the most appropriate for this scenario?

  1. A

    AWS Snowmobile

  2. B

    AWS DataSync

  3. C

    AWS Snowball Edge - Compute Optimized

  4. D

    AWS Snowcone

Xem giải thích

Đáp án

C — AWS Snowball Edge Compute Optimized

Vì sao đúng

Đề đặt ra hai yêu cầu cùng lúc: chuyển khối lượng lớn dữ liệu khi đường truyền rất yếu, và xử lý ngay tại chỗ trước khi gửi đi. Snowball Edge Compute Optimized là bản có nhiều vCPU và bộ nhớ, chạy được EC2 và Lambda ngay trên thiết bị — đó là phần "điện toán biên". Dữ liệu chuyển bằng cách gửi thiết bị đi, không phụ thuộc Internet.

Vì sao các phương án khác sai

  • A. Snowmobile — xe container cho quy mô hàng chục petabyte, quá lớn cho một mỏ, và không có năng lực điện toán biên.
  • B. DataSync — chuyển dữ liệu qua mạng, mà mạng chính là thứ đang thiếu.
  • D. Snowcone — nhỏ gọn, chỉ vài terabyte và năng lực tính toán rất hạn chế.

Nhớ nhanh

Mạng yếu + cần tính toán tại chỗ → Snowball Edge Compute Optimized.

Câu 156 Data Ingestion and Transformation

A data engineer is implementing a streaming data ingestion solution using Amazon Kinesis Data Streams. The goal is to ensure that if a failure occurs during the ingestion process, the system can resume from where it left off, without reprocessing already ingested data. Which approach should the engineer take to meet this requirement?

  1. A

    Enable Amazon Kinesis Data Firehose to store all streaming data in Amazon S3 for later analysis.

  2. B

    Use AWS Lambda with stateless ingestion to process new records as they arrive.

  3. C

    Implement stateful data ingestion by tracking the sequence number of the last processed record.

  4. D

    Use stateless data ingestion to reprocess all data from the beginning after a failure.

Xem giải thích

Đáp án

C — Nạp dữ liệu có trạng thái, ghi nhớ sequence number của bản ghi cuối đã xử lý

Vì sao đúng

Mỗi bản ghi trong Kinesis Data Streams có một sequence number tăng dần trong phạm vi shard. Lưu lại số của bản ghi cuối cùng xử lý xong (đây gọi là checkpoint) thì sau khi gặp sự cố, consumer đọc tiếp đúng từ vị trí đó thay vì quay về đầu. Thư viện KCL làm sẵn việc này và lưu checkpoint trong một bảng DynamoDB.

Vì sao các phương án khác sai

  • A. Firehose lưu hết vào S3 — đổi đích đến chứ không giải quyết chuyện tiếp tục dở dang.
  • B. Lambda không trạng thái — không nhớ đã xử lý tới đâu, đúng thứ đề muốn tránh.
  • D. Xử lý lại từ đầu — chính là kịch bản đề yêu cầu không được xảy ra.

Nhớ nhanh

Muốn "tiếp tục từ chỗ dừng" thì phải lưu checkpoint. Không lưu trạng thái thì không có chỗ nào để tiếp tục.

Câu 157 Data Store Management

A financial services company needs to implement a graph database to model relationships between various entities such as customers, accounts, and transactions. The company requires a managed graph database service that supports both property graphs and RDF (Resource Description Framework) data models, with the ability to scale and handle complex queries. Which AWS service should the company choose to meet these requirements?

  1. A

    Amazon Redshift

  2. B

    Amazon DynamoDB

  3. C

    Amazon RDS for PostgreSQL

  4. D

    Amazon Neptune

Xem giải thích

Đáp án

D — Amazon Neptune

Vì sao đúng

Neptune là CSDL đồ thị được quản lý của AWS, và điểm khiến nó khớp tuyệt đối với đề bài là nó hỗ trợ cả hai mô hình: property graph (truy vấn bằng Gremlin hoặc openCypher) và RDF (truy vấn bằng SPARQL). Mô hình quan hệ giữa khách hàng – tài khoản – giao dịch là bài toán đồ thị kinh điển, hay dùng để phát hiện gian lận.

Vì sao các phương án khác sai

  • A. Redshift — kho dữ liệu phân tích theo cột, không có khái niệm đi theo cạnh đồ thị.
  • B. DynamoDB — CSDL khoá–giá trị; muốn duyệt quan hệ nhiều bậc phải tự ghép ở tầng ứng dụng, rất tốn.
  • C. RDS for PostgreSQL — biểu diễn quan hệ được, nhưng truy vấn nhiều bậc phải viết JOIN đệ quy và chậm dần theo độ sâu; hơn nữa không hỗ trợ RDF.

Nhớ nhanh

Đề nhắc RDF hoặc SPARQL thì gần như chắc chắn là Neptune.

Câu 158 Chọn nhiều đáp án Data Security and Governance

A data engineer is tasked with restricting access to certain sensitive columns in a table for specific users and ensuring that only authorized users can view rows based on their assigned warehouse ID. The company also wants to apply dynamic data masking to hide sensitive personal information. Which features should the data engineer use to implement this requirement in Amazon Redshift? (Choose TWO.)

  1. A

    Column-level security to grant select privileges only to specific columns.

  2. B

    Row-level security to restrict access to rows based on conditions like warehouse ID.

  3. C

    Dynamic data masking to hide sensitive information, such as email addresses.

  4. D

    AWS Glue to automate the masking of sensitive data.

  5. E

    VPC peering to control access to the Redshift cluster from other AWS accounts.

Xem giải thích

Đáp án

A và C — column-level security, và dynamic data masking

Vì sao đúng

  • A. Column-level security — cấp quyền SELECT tới từng cột, nên người dùng thường không đọc được cột nhạy cảm mà vẫn truy vấn được phần còn lại của bảng.
  • C. Dynamic data masking — che giá trị ngay lúc trả kết quả (ví dụ chỉ hiện vài ký tự cuối của email) mà không đổi dữ liệu gốc, và che khác nhau tuỳ vai người truy vấn.

Một điểm cần nói thẳng

Đề nêu ba yêu cầu — hạn chế theo cột, hạn chế theo dòng theo warehouse ID, và che dữ liệu — nhưng lại bảo chọn hai. Yêu cầu về dòng ứng với row-level security (phương án B), một tính năng có thật của Redshift. Đây là chỗ đề tự mâu thuẫn, không phải bạn đọc sót. Khi đi thi thật, ba yêu cầu đó là ba tính năng riêng biệt.

Vì sao hai phương án còn lại sai

  • D. AWS Glue — công cụ ETL, biến đổi dữ liệu lúc nạp chứ không phải cơ chế phân quyền của Redshift, và không phản ứng theo danh tính người đang truy vấn.
  • E. VPC peering — kiểm soát đường mạng tới cụm, không biết gì về cột, dòng hay người dùng.
Câu 159 Data Ingestion and Transformation

A data engineering team needs to set up a fully managed search and analytics solution on AWS for analyzing and visualizing application log data in real-time. They also require the ability to store, search, and retrieve customer data with minimal configuration. Which AWS service should the team use?

  1. A

    Amazon Redshift

  2. B

    Amazon Kinesis Data Analytics

  3. C

    AWS Glue

  4. D

    Amazon OpenSearch Service

Xem giải thích

Đáp án

D — Amazon OpenSearch Service

Vì sao đúng

OpenSearch Service là dịch vụ tìm kiếm và phân tích được quản lý, dựng cho đúng việc nhận log, đánh chỉ mục và truy vấn gần thời gian thực. Nó đi kèm OpenSearch Dashboards nên phần trực quan hoá có sẵn, không phải dựng thêm gì. Việc "lưu, tìm và lấy dữ liệu khách hàng với cấu hình tối thiểu" cũng là thế mạnh của nó.

Vì sao các phương án khác sai

  • A. Redshift — kho dữ liệu cho phân tích theo lô; nạp dữ liệu theo lô nên không đạt "thời gian thực", và tìm kiếm toàn văn không phải việc của nó.
  • B. Kinesis Data Analytics — xử lý luồng đang chảy, không lưu trữ để tìm kiếm về sau.
  • C. AWS Glue — ETL và catalog, hoàn toàn không có phần tìm kiếm hay bảng điều khiển.

Nhớ nhanh

Đề có đủ ba chữ "log", "tìm kiếm", "trực quan hoá" → OpenSearch.

Câu 160 Data Ingestion and Transformation

A company runs a real-time stock trading application where every millisecond of latency matters. The application ingests trades from an external feed, processes them, and updates the stock prices. The trading data is continuously ingested into Amazon Kinesis Data Streams, and the company needs to ensure low-latency processing of each record. The data is processed and then stored in Amazon RDS for real-time querying. The company wants to minimize operational complexity while ensuring that the system scales automatically with data volumes.

Which architecture should be used to meet these requirements?

  1. A

    Use an Amazon EC2 instance in an Auto Scaling group to read from Kinesis Data Streams, process the records, and write the output to Amazon RDS.

  2. B

    Use AWS Lambda to process each record from Kinesis Data Streams and update Amazon RDS in real time.

  3. C

    Use AWS Glue streaming jobs to consume the Kinesis Data Streams and write the data to Amazon RDS.

  4. D

    Use an Amazon Kinesis Data Firehose to transform the data and store it directly into Amazon RDS for querying.

Xem giải thích

Đáp án

B — Dùng AWS Lambda xử lý từng bản ghi từ Kinesis Data Streams rồi cập nhật RDS

Vì sao đúng

Lambda gắn thẳng vào Kinesis bằng event source mapping: có bản ghi là được gọi ngay, độ trễ tính bằng mili giây. Có thể đặt kích thước lô nhỏ và MaximumBatchingWindow bằng 0 để không chờ gom lô. Số bản sao Lambda chạy song song co giãn theo số shard, nên khối lượng tăng vẫn theo kịp mà không phải quản lý máy chủ nào.

Vì sao các phương án khác sai

  • A. EC2 trong Auto Scaling group — làm được nhưng phải tự vận hành máy, tự lo checkpoint, và co giãn theo phút chứ không theo giây.
  • C. Glue streaming — xử lý theo micro-batch, độ trễ tính bằng giây; ứng dụng giao dịch chứng khoán không chịu được.
  • D. Firehose ghi thẳng vào RDS — Firehose không nhận RDS làm đích, và bản chất nó gom lô nên tối thiểu cũng đã trễ vài chục giây.

Nhớ nhanh

"Từng mili giây đều quan trọng" thì loại ngay mọi thứ gom lô.