Ngân hàng đề — AWS Certified Data Engineer Associate

Tìm thấy 867 câu.

Câu 221 Chọn nhiều đáp án Data Store Management

A data engineer needs to optimize the performance and cost of SQL queries run in Amazon Athena on large datasets stored in Amazon S3. The engineer is exploring partitioning and data formats to minimize the amount of data scanned. Which combination of strategies will BEST optimize query performance and cost? (Choose TWO.)

  1. A

    Enable Amazon Athena result set caching to reduce repeated query costs.

  2. B

    Store the data in CSV format to simplify access.

  3. C

    Use a columnar format like Parquet to reduce the data scanned during queries.

  4. D

    Apply partitioning to the data based on frequently queried columns such as date or region.

  5. E

    Manually set partitions in the AWS Glue Data Catalog for each new dataset added to S3.

Xem giải thích

Đáp án

C và D — dùng định dạng cột Parquet, và phân vùng theo cột hay lọc

Vì sao đúng

Athena tính cả tiền lẫn thời gian theo lượng dữ liệu quét, nên mọi tối ưu đều quy về việc đọc ít byte hơn:

  • D. Phân vùng theo ngày hoặc khu vực cho phép Athena bỏ qua hẳn những thư mục không khớp điều kiện. Đây là đòn giảm mạnh nhất, thường là hàng chục lần.
  • C. Parquet lưu theo cột nên chỉ đọc đúng cột trong câu SELECT, lại nén tốt vì dữ liệu cùng cột thì cùng kiểu.

Hai thứ này nhân với nhau chứ không thay thế nhau.

Vì sao các phương án khác sai

  • A. Bộ đệm kết quả — có giúp cho truy vấn lặp lại y hệt, nhưng không giảm gì cho truy vấn mới; đề hỏi về phân vùng và định dạng.
  • B. Lưu dạng CSV — CSV là định dạng dòng, không nén, buộc quét toàn bộ; ngược hẳn mục tiêu.
  • E. Khai phân vùng bằng tay cho mỗi bộ dữ liệu mới — làm được nhưng không mở rộng nổi; dùng crawler hoặc MSCK REPAIR TABLE cho việc đó.
Câu 222 Data Ingestion and Transformation

A healthcare company needs to collect and process sensitive patient data at remote locations with limited or no internet connectivity. They also require local computing to run machine learning models directly on-site for real-time data analysis before sending the processed data to AWS. Which device in the AWS Snow Family would be most suitable for this use case?

  1. A

    AWS DataSync

  2. B

    AWS Snowball Edge - Compute Optimized

  3. C

    AWS Snowcone

  4. D

    AWS Snowmobile

Xem giải thích

Đáp án

B — AWS Snowball Edge Compute Optimized

Vì sao đúng

Đề có hai ràng buộc đi cùng nhau: nơi đặt máy gần như không có Internet, và phải chạy được mô hình học máy ngay tại chỗ. Bản Compute Optimized có nhiều vCPU, có tuỳ chọn GPU, và chạy được EC2 lẫn Lambda trên chính thiết bị. Dữ liệu bệnh nhân được mã hoá và chuyển đi bằng cách gửi thiết bị chứ không qua mạng.

Vì sao các phương án khác sai

  • A. DataSync — chuyển dữ liệu qua mạng, mà mạng chính là thứ không có.
  • C. Snowcone — nhỏ gọn, chỉ vài terabyte và năng lực tính toán rất hạn chế; không kham nổi mô hình học máy.
  • D. Snowmobile — xe container cho quy mô hàng chục petabyte, và không có phần điện toán biên.
Câu 223 Data Store Management

A data engineering team is working with a MongoDB-compatible workload and needs a fully managed database solution on AWS that can handle complex queries and large amounts of semi-structured data. They also require automatic backup, patching, and scaling features to minimize maintenance overhead. Which AWS service would best meet these requirements?

  1. A

    Amazon DocumentDB

  2. B

    Amazon DynamoDB

  3. C

    Amazon RDS

  4. D

    Amazon ElastiCache for Redis

Xem giải thích

Đáp án

A — Amazon DocumentDB

Vì sao đúng

DocumentDB được thiết kế tương thích với MongoDB: ứng dụng và driver MongoDB có sẵn kết nối thẳng vào mà gần như không phải sửa mã. Nó lưu tài liệu JSON nên hợp với dữ liệu bán cấu trúc, hỗ trợ truy vấn phức tạp kèm chỉ mục, và là dịch vụ được quản lý nên không phải tự vá hay tự sao lưu.

Vì sao các phương án khác sai

  • B. DynamoDB — cũng là NoSQL nhưng không tương thích MongoDB; truy vấn phức tạp phải thiết kế lại quanh khoá chính và chỉ mục phụ.
  • C. Amazon RDS — CSDL quan hệ, cần lược đồ cố định.
  • D. ElastiCache for Redis — kho khoá–giá trị trong bộ nhớ, dùng làm bộ đệm chứ không phải nơi lưu chính.
Câu 224 Data Ingestion and Transformation

A data engineer needs to build and train a machine learning model using TensorFlow and deploy it for real-time inference with minimal infrastructure management. The engineer wants to take advantage of a fully managed environment to automatically scale resources during model training. Which AWS service should the engineer use?

  1. A

    AWS Lambda

  2. B

    Amazon EC2

  3. C

    Amazon EMR

  4. D

    Amazon SageMaker

Xem giải thích

Đáp án

D — Amazon SageMaker

Vì sao đúng

SageMaker gói trọn cả vòng đời mà đề nêu: có sẵn container TensorFlow do AWS dựng, huấn luyện trên cụm máy tự cấp phát rồi tự trả lại, và triển khai thành endpoint suy luận thời gian thực chỉ bằng một lời gọi. Endpoint tự trải qua nhiều vùng sẵn sàng và tự co giãn — đúng nghĩa "ít phải quản lý hạ tầng".

Vì sao các phương án khác sai

  • A. AWS Lambda — trần bộ nhớ và trần thời gian 15 phút; suy luận nhẹ thì được, huấn luyện thì không.
  • B. Amazon EC2 — làm được tất cả nhưng bạn phải tự cài, tự vá, tự co giãn.
  • C. Amazon EMR — cụm Hadoop và Spark cho xử lý dữ liệu lớn, không phải nền tảng phục vụ mô hình.
Câu 225 Data Ingestion and Transformation

A company is building a serverless image processing application. They want to trigger an AWS Lambda function automatically whenever a new image is uploaded to a specific Amazon S3 bucket. The Lambda function will process the image and store the result back into the S3 bucket. How should the company configure the S3 bucket to trigger the Lambda function?

  1. A

    Enable versioning on the S3 bucket to automatically trigger Lambda upon object creation.

  2. B

    Set up an S3 bucket lifecycle rule to invoke the Lambda function on object upload.

  3. C

    Use S3 Event Notifications to trigger the Lambda function when an s3:ObjectCreated event occurs.

  4. D

    Attach an S3 bucket policy to invoke the Lambda function on object creation.

Xem giải thích

Đáp án

C — Dùng S3 Event Notifications với sự kiện s3:ObjectCreated

Vì sao đúng

Đây là cơ chế S3 dựng sẵn để báo cho dịch vụ khác khi có đối tượng mới. Khai một notification trỏ tới hàm Lambda, chọn loại sự kiện s3:ObjectCreated:*, lọc thêm theo tiền tố hoặc đuôi tệp nếu chỉ muốn ảnh. S3 tự thêm quyền gọi hàm. Không có thành phần trung gian nào.

Vì sao các phương án khác sai

  • A. Bật versioning — giữ nhiều phiên bản của đối tượng, tự nó không gọi ai cả.
  • B. Lifecycle rule — chuyển tầng lưu trữ hoặc xoá theo tuổi đối tượng, không phải cơ chế kích hoạt khi tải lên.
  • D. Bucket policy — quyết định ai được phép làm gì với bucket, không kích hoạt hành động nào.
Câu 226 Chọn nhiều đáp án Data Security and Governance

A data team needs to create dashboards that allow business users to explore real-time data in QuickSight. They also need to control access so that only users in certain departments can view sensitive financial data for their specific department. Which combination of features should they use to meet these requirements? (Choose TWO)

  1. A

    Data refresh scheduling

  2. B

    Row-level security

  3. C

    SPICE for in-memory data access

  4. D

    Column-level security

  5. E

    Cross-account VPC Peering

Xem giải thích

Đáp án

B và D — row-level security và column-level security

Vì sao đúng

Đề cần chặn theo người xem chứ không phải chặn cả bảng:

  • B. Row-level security gắn quy tắc lọc theo người đăng nhập, nên mỗi phòng ban chỉ thấy những dòng thuộc về mình mà vẫn dùng chung một bảng điều khiển.
  • D. Column-level security ẩn hẳn những cột nhạy cảm khỏi người không có quyền, kể cả khi họ mở bộ dữ liệu ra xem.

Kết hợp lại thì một bảng điều khiển phục vụ được nhiều phòng ban mà không phải nhân bản ra nhiều bản.

Vì sao các phương án khác sai

  • A. Lịch làm mới dữ liệu — chuyện dữ liệu mới tới đâu, không phải phân quyền.
  • C. SPICE — bộ đệm trong bộ nhớ giúp nhanh hơn; không quyết định ai thấy gì.
  • E. VPC Peering — nối mạng giữa các VPC, không biết gì về người dùng QuickSight.
Câu 227 Data Ingestion and Transformation

A data engineer is working with customer feedback data in an Amazon S3 bucket that contains several quality issues such as missing values, inconsistent date formats, and outliers in numerical fields. The engineer needs to clean the data and ensure it is ready for analysis, but prefers to use a visual, code-free tool to complete the task. Which AWS Glue service is best suited for this use case?

  1. A

    AWS Glue Crawler

  2. B

    AWS Glue DataBrew

  3. C

    AWS Glue ETL Jobs

  4. D

    AWS Glue Studio

Xem giải thích

Đáp án

B — AWS Glue DataBrew

Vì sao đúng

DataBrew mở bộ dữ liệu lên là hiện ngay hồ sơ chất lượng: bao nhiêu phần trăm ô trống ở mỗi cột, phân bố giá trị, và những điểm nằm ngoài khoảng thường gặp. Ba vấn đề đề nêu — thiếu giá trị, ngày không thống nhất, giá trị dị thường — đều có phép biến đổi dựng sẵn, chọn bằng chuột và xem trước kết quả trước khi áp.

Vì sao các phương án khác sai

  • A. Glue Crawler — chỉ suy ra lược đồ và cập nhật catalog, không đánh giá hay sửa chất lượng.
  • C. Glue ETL Jobs — làm được nhưng phải viết mã Spark, và không có phần xem hồ sơ dữ liệu.
  • D. Glue Studio — giao diện kéo thả để dựng job ETL, thiên về luồng xử lý chứ không phải khám phá và làm sạch dữ liệu.
Câu 228 Data Ingestion and Transformation

A company wants to use AWS OpenSearch for real-time log analytics and has a requirement to frequently search and index the logs while ensuring high performance. They also want to use cost-effective storage for data that is no longer frequently queried but may still require access. Which storage tier combination should the company choose to meet its requirements?

  1. A

    Cold storage for real-time log data and ultra warm storage for historical log data

  2. B

    Hot storage for real-time log data and cold storage for historical log data

  3. C

    Hot storage for real-time log data and ultra warm storage for historical log data

  4. D

    Ultra warm storage for real-time log data and cold storage for historical log data

Xem giải thích

Đáp án

C — Hot cho log thời gian thực, UltraWarm cho log lịch sử

Vì sao đúng

Log mới vẫn đang được ghi vào và tra cứu liên tục nên phải nằm ở hot, nơi có SSD cục bộ. Log cũ chuyển sang UltraWarm: dữ liệu nằm trên S3, dùng bộ đệm để truy vấn, rẻ hơn hot khoảng một bậc độ lớn mà vẫn tìm kiếm được ngay không phải thao tác gì.

Vì sao các phương án khác sai

  • A và D — đặt tầng chậm cho dữ liệu thời gian thực, ngược hẳn cách log được dùng.
  • B. Hot rồi cold — cold rẻ nhất nhưng phải gắn lại mới truy vấn được, nên nhảy thẳng từ hot sang cold là bỏ mất tầng ở giữa vốn sinh ra cho đúng bài toán này.
Câu 229 Data Store Management

A data analyst needs to query an Amazon Redshift cluster with unpredictable workloads. To optimize cost and performance, the company is considering between a provisioned cluster and Amazon Redshift Serverless. The workload involves intermittent spikes in demand, with periods of low activity in between. Which deployment option is more suitable in this scenario?

  1. A

    Provisioned cluster with on-demand pricing

  2. B

    Amazon Redshift Serverless

  3. C

    On-premises data warehouse with Amazon S3 for storage

  4. D

    Dedicated host with reserved instance pricing

Xem giải thích

Đáp án

B — Amazon Redshift Serverless

Vì sao đúng

Từ khoá của đề là tải không đoán trước được. Serverless tự cấp phát năng lực theo từng truy vấn và tính tiền theo giây thực chạy; không ai truy vấn thì gần như không tốn. Bạn chỉ đặt trần RPU để khỏi vượt ngân sách, không phải chọn loại node hay số node.

Vì sao các phương án khác sai

  • A. Cụm provisioned trả theo giờ — trả tiền cả lúc không ai dùng, và vẫn phải đoán trước kích thước cụm.
  • C. Kho dữ liệu tại chỗ — trái hẳn hướng đề bài, và không co giãn được.
  • D. Dedicated host với giá reserved — cam kết dài hạn là lựa chọn tệ nhất khi tải thất thường.
Câu 230 Data Ingestion and Transformation

A retail company is using Amazon Redshift as their data warehouse for analytical queries. They have large volumes of transactional data being generated by their online store and stored in Amazon S3. They want to efficiently load this data into Amazon Redshift for daily batch processing. The company requires a solution that automates data transformation, improves query performance, and reduces operational overhead. Which of the following solutions will best meet the company's requirements?

  1. A

    Use Amazon Redshift Spectrum to query the data directly in S3 and create materialized views for frequently queried data.

  2. B

    Use the Redshift Data API to stream data from S3 into Redshift and trigger transformations using Lambda functions.

  3. C

    Use Amazon EMR to process and transform the data in S3, then copy the results into Amazon Redshift using the COPY command.

  4. D

    Use AWS Glue to transform data in S3 and load it directly into Redshift using AWS Glue ETL jobs.

Xem giải thích

Đáp án

D — Dùng AWS Glue biến đổi dữ liệu trên S3 rồi nạp thẳng vào Redshift

Vì sao đúng

Đây là đường ống ETL tiêu chuẩn và không có máy chủ nào phải trông: Glue đọc dữ liệu thô trên S3, biến đổi bằng Spark, rồi ghi vào Redshift qua connector dựng sẵn. Có bookmark để lần chạy sau chỉ xử lý dữ liệu mới, và tự co giãn theo khối lượng.

Vì sao các phương án khác sai

  • A. Spectrum kèm materialized view — truy vấn tại chỗ trên S3, không phải nạp dữ liệu vào kho như đề mô tả.
  • B. Data API để đưa dữ liệu từ S3 vào — Data API là cách gửi câu truy vấn qua HTTP, không phải công cụ nạp dữ liệu.
  • C. EMR rồi copy sang — làm được nhưng phải dựng và vận hành cụm, nặng hơn hẳn Glue cho cùng một việc.