Ngân hàng đề — AWS Certified Data Engineer Associate

Tìm thấy 867 câu.

Câu 561 Domain 1: Data Ingestion and Transformation

A digital media company needs to manage uploads of around 1 terabyte each from an application being used by a partner company.

How will you handle the upload of these files to Amazon S3?

  1. A

    Use multi-part upload feature of Amazon S3

  2. B

    Use AWS Direct Connect to provide extra bandwidth

  3. C

    Use Amazon S3 Versioning

  4. D

    Use AWS Snowball Edge Storage Optimized device

Xem giải thích

Đáp án

A — Dùng tính năng multipart upload của Amazon S3

Vì sao đúng

Với tệp 1 TB, multipart upload không chỉ là lựa chọn tốt mà là bắt buộc:

Một thao tác PUT đơn lẻ chỉ tải lên được tối đa 5 GB. Muốn vượt mức đó phải dùng multipart upload, và trần của nó là 5 TB cho một đối tượng.

Multipart upload chia tệp thành nhiều phần rồi tải lên song song, mang lại ba lợi ích:

  • Nhanh hơn nhờ dùng hết băng thông sẵn có.
  • Thử lại từng phần — một phần lỗi thì chỉ tải lại phần đó, không phải làm lại từ đầu 1 TB.
  • Tạm dừng và tiếp tục được.

AWS khuyến nghị dùng multipart cho mọi tệp trên 100 MB.

Vì sao các phương án khác sai

  • D. Dùng Snowball Edge — thiết bị vật lý; hợp cho việc chuyển hàng chục tới hàng trăm TB một lần khi băng thông hạn chế. Với các tệp 1 TB tải lên liên tục từ ứng dụng đối tác, gửi thiết bị qua đường bưu điện là bất khả thi. Đây là phương án nhiễu chính.
  • B. Dùng Direct Connect để có thêm băng thông — băng thông không phải vấn đề ở đây, và Direct Connect mất hàng tuần tới hàng tháng để lắp đặt.
  • C. Dùng S3 Versioning — giữ nhiều phiên bản của đối tượng; không liên quan tới việc tải lên.
Câu 562 Domain 4: Data Security and Governance

A US-based healthcare startup manages an interactive diagnostic tool for COVID-19 related assessments. The users are required to capture their personal health records via this tool. As this is sensitive health information, the backup of the user data must be kept encrypted in Amazon Simple Storage Service (Amazon S3). The startup does not want to provide its own encryption keys but still wants to maintain an audit trail on the usage of the encryption key.

What do you recommend?

  1. A

    Use server-side encryption with customer-provided keys (SSE-C) to encrypt the user data on Amazon S3

  2. B

    Use client-side encryption with client-provided keys and then upload the encrypted user data to Amazon S3

  3. C

    Use server-side encryption with AWS Key Management Service keys (SSE-KMS) to encrypt the user data on Amazon S3

  4. D

    Use server-side encryption with Amazon S3 managed keys (SSE-S3) to encrypt the user data on Amazon S3

Xem giải thích

Đáp án

C — Server-side encryption với khoá của AWS KMS (SSE-KMS)

Vì sao đúng

Đề nêu hai ràng buộc, và chúng cùng nhau chỉ về đúng một lựa chọn:

  • Không muốn tự cung cấp khoá — loại bỏ SSE-C và client-side encryption.
  • Muốn có nhật ký kiểm toán về việc sử dụng khoá — đây là chỗ quyết định.

SSE-KMS là hình thức duy nhất ghi lại mọi lần khoá được dùng vào CloudTrail. Mỗi thao tác mã hoá hoặc giải mã sinh ra một bản ghi Decrypt hoặc GenerateDataKey, kèm ai gọi, lúc nào, cho đối tượng nào.

Với dữ liệu sức khoẻ, nhật ký đó thường là yêu cầu bắt buộc của quy định chứ không phải tính năng cho vui.

Vì sao các phương án khác sai

  • D. SSE-S3 — AWS quản lý khoá và hoàn toàn trong suốt với bạn; không có nhật ký nào về việc dùng khoá. Đây là phương án nhiễu chính vì nó cũng thoả điều kiện "không phải cung cấp khoá".
  • A. SSE-C — bạn phải tự cung cấp khoá trong mỗi yêu cầu; vi phạm ràng buộc đầu tiên.
  • B. Client-side encryption với khoá của bạn — cũng đòi bạn quản lý khoá.

Ghi nhớ bốn hình thức

Ai giữ khoá Nhật ký dùng khoá
SSE-S3 AWS Không
SSE-KMS AWS KMS, bạn kiểm soát Có (CloudTrail)
SSE-C Bạn, gửi kèm mỗi yêu cầu Không
Client-side Bạn Không (AWS không thấy gì)
Câu 563 Domain 3: Data Operations and Support

A company has developed Athena SQL queries for Extract, Transform, and Load (ETL) tasks by using Create Table As Select (CTAS). The company now needs to replace SQL with Apache Spark for its new analytics solution.

Which configuration changes are needed to begin using Apache Spark on Amazon Athena ?

  1. A

    Create a Spark-enabled Athena workgroup

  2. B

    Activate Apache Spark in the underlying Amazon Athena Engine version

  3. C

    Update Athena query settings to enable Apache Spark

  4. D

    Use Athena Query Editor to access Apache Spark from Athena

Xem giải thích

Đáp án

*A — Tạo một Athena workgroup có bật Spark

Vì sao đúng

Athena hỗ trợ hai bộ máy, và chúng tách biệt ở mức workgroup:

Bộ máy Dùng cho
Athena SQL (Trino) Truy vấn SQL, CTAS, UNLOAD
Athena cho Apache Spark Chạy mã PySpark trong notebook

Muốn dùng Spark, bạn tạo một workgroup mới với engine là Apache Spark. Đây là thao tác duy nhất cần làm — sau đó bạn viết PySpark trong notebook ngay trong Athena, và tài nguyên tính toán được cấp phát tự động theo yêu cầu.

Điểm quan trọng cần nhớ: không thể đổi engine của một workgroup đã có. Workgroup dùng SQL vẫn tiếp tục dùng SQL; Spark phải nằm ở workgroup riêng.

Vì sao các phương án khác sai

  • B. Kích hoạt Apache Spark trong phiên bản engine hiện tại của Athena — không có thao tác này; engine version (v2, v3) chỉ áp cho phần SQL. Đây là phương án nhiễu chính.
  • C. Cập nhật query settings của Athena để bật Spark — query settings quản lý vị trí lưu kết quả và mã hoá, không đổi được engine.
  • D. Dùng Query Editor để truy cập Spark — Query Editor là nơi bạn viết SQL; notebook Spark là giao diện khác, và nó chỉ xuất hiện sau khi đã có workgroup Spark.
Câu 564 Domain 4: Data Security and Governance

A company wants to store business-critical data on Amazon Elastic Block Store (Amazon EBS) volumes which provide persistent storage independent of Amazon EC2 instances. During a test run, the data engineering team found that on terminating an Amazon EC2 instance, the attached Amazon EBS volume was also lost, which was contrary to their assumptions.

How would you explain this issue?

  1. A

    The Amazon EBS volumes were not backed up on Amazon S3 storage, resulting in the loss of volume

  2. B

    On termination of an Amazon EC2 instance, all the attached Amazon EBS volumes are always terminated

  3. C

    The Amazon EBS volume was configured as the root volume of Amazon EC2 instance. On termination of the instance, the default behavior is to also terminate the attached root volume

  4. D

    The Amazon EBS volumes were not backed up on Amazon EFS file system storage, resulting in the loss of volume

Xem giải thích

Đáp án

*C — Volume đó được cấu hình làm root volume của instance, và hành vi mặc định là xoá root volume khi instance kết thúc

Vì sao đúng

EBS volume có một thuộc tính tên DeleteOnTermination, và giá trị mặc định của nó khác nhau tuỳ vai trò của volume:

Loại volume DeleteOnTermination mặc định
Root volume (ổ khởi động) true — bị xoá cùng instance
Volume phụ (gắn thêm) false — tồn tại độc lập

Đội kỹ thuật trong đề đã giả định đúng nguyên tắc chung (EBS tồn tại độc lập với instance), nhưng vấp phải ngoại lệ ở root volume.

Cách sửa có hai hướng:

  • Đặt DeleteOnTermination = false cho root volume — làm được cả lúc khởi chạy lẫn sau đó qua CLI.
  • Đặt dữ liệu quan trọng lên volume phụ thay vì để trên ổ khởi động — đây mới là cách làm đúng về mặt thiết kế.

Vì sao các phương án khác sai

  • B. Mọi EBS volume gắn vào đều luôn bị xoá khi instance kết thúc — sai; volume phụ không bị xoá theo mặc định. Đây là phương án nhiễu chính, và nó chỉ khác đáp án đúng ở chỗ bỏ mất phân biệt root và phụ.
  • A và D. Volume bị mất vì chưa sao lưu lên S3 hoặc EFS — sai về nhân quả: sao lưu không ngăn được việc xoá; nó chỉ giúp khôi phục sau khi đã mất.
Câu 565 Domain 4: Data Security and Governance

A consulting firm uses Amazon Athena to analyze data in Amazon S3 using SQL. A rapid expansion plan has resulted in the company doubling its data engineers in a year resulting in high usage costs for Athena. Preliminary investigation suggests that most of the day-to-day queries run for only a few seconds fetching limited data. The firm wants to define different thresholds on hourly or daily aggregates on data scanned by the queries.

As an AWS Certified Data Engineer Associate, how will you configure a solution for this requirement?

  1. A

    Configure multiple per-workgroup limits by utilizing the workgroup-wide data usage control limit on Athena

  2. B

    Configure a single per-workgroup limit by configuring all the mentioned thresholds into a single limit configuration

  3. C

    Configure multiple per-query limits by utilizing the per-query cost control limit feature on Athena

  4. D

    Configure a single per-query limit by configuring all the mentioned thresholds into a single limit configuration

Xem giải thích

Đáp án

A — Cấu hình nhiều giới hạn theo workgroup, dùng tính năng workgroup-wide data usage control của Athena

Vì sao đúng

Athena có hai loại giới hạn chi phí, và chi tiết trong đề chỉ đích danh một loại:

Per-query limit Workgroup-wide data usage control
Áp cho Một truy vấn đơn lẻ Tổng lượng dữ liệu quét của cả workgroup
Khung thời gian Không có Theo giờ hoặc theo ngày
Số giới hạn khai được Một cho mỗi workgroup Nhiều
Hành động khi vượt Huỷ truy vấn Gửi cảnh báo qua SNS, hoặc chạy hành động tuỳ chỉnh

Đề nói rõ công ty muốn đặt nhiều ngưỡng khác nhau trên tổng lượng dữ liệu quét theo giờ hoặc theo ngày — cả ba chi tiết (nhiều, tổng hợp, theo khung thời gian) đều chỉ về loại thứ hai.

Chi tiết "phần lớn truy vấn hằng ngày chỉ chạy vài giây và quét ít dữ liệu" cũng củng cố: vấn đề không nằm ở một truy vấn cá biệt mà ở tổng mức tiêu thụ.

Vì sao các phương án khác sai

  • C. Nhiều per-query limit — mỗi workgroup chỉ khai được một per-query limit, và nó không có khái niệm khung thời gian. Đây là phương án nhiễu chính.
  • B và D. Gộp mọi ngưỡng vào một cấu hình giới hạn duy nhất — đề nói rõ cần nhiều ngưỡng khác nhau, nên gộp làm một là mất đúng thứ cần.
Câu 566 Domain 4: Data Security and Governance

The data engineering team at a company is working on the Disaster Recovery (DR) plans for a Redshift cluster deployed in the us-east-1 Region. The existing cluster is encrypted via AWS KMS and the team wants to copy the Redshift snapshots to another Region to meet the DR requirements.

Which of the following solutions would you suggest to address the given use-case?

  1. A

    Create a snapshot copy grant in the destination Region for a KMS key in the destination Region. Configure Redshift cross-Region replication in the source Region

  2. B

    Create a snapshot copy grant in the destination Region for a KMS key in the destination Region. Configure Redshift cross-Region snapshots in the source Region

  3. C

    Create an IAM role in the destination Region with access to the KMS key in the source Region. Create a snapshot copy grant in the destination Region for this KMS key in the source Region. Configure Redshift cross-Region snapshots in the source Region

  4. D

    Create a snapshot copy grant in the source Region for a KMS key in the source Region. Configure Redshift cross-Region snapshots in the destination Region

Xem giải thích

Đáp án

B — Tạo snapshot copy grant ở Region đích cho một KMS key ở Region đích, rồi cấu hình cross-Region snapshot ở Region nguồn

Vì sao đúng

Vấn đề gốc: KMS key mang tính Region. Snapshot được mã hoá bằng khoá ở us-east-1 không giải mã được ở Region khác, vì khoá đó không tồn tại ở đó.

AWS giải bằng cơ chế snapshot copy grant, và thứ tự các bước rất cụ thể:

1. Tạo (hoặc chọn) một KMS key Ở REGION ĐÍCH
2. Tạo snapshot copy grant Ở REGION ĐÍCH, cho phép Redshift dùng khoá đó
3. Ở REGION NGUỒN, bật cross-Region snapshot và trỏ tới grant vừa tạo

Khi sao chép, Redshift giải mã bằng khoá nguồn rồi mã hoá lại bằng khoá đích. Nhờ vậy snapshot ở Region đích tự đứng được, không phụ thuộc vào khoá của Region nguồn.

Cần lưu ý thuật ngữ: cơ chế này gọi là cross-Region snapshot, không phải "cross-Region replication" — Redshift không có tính năng tên như vậy.

Vì sao các phương án khác sai

  • A. Cấu hình "cross-Region replication" — sai tên tính năng; Redshift dùng cross-Region snapshot. Đây là phương án nhiễu chính vì mọi phần khác đều đúng.
  • *C. Tạo grant cho KMS key ở Region nguồn — sai chiều: grant phải trỏ tới khoá ở đích.
  • D. Tạo grant ở Region nguồn và cấu hình snapshot ở Region đích — đảo ngược cả hai vế.
Câu 567 Chọn nhiều đáp án Domain 1: Data Ingestion and Transformation

A company stores its data in a single Amazon S3 bucket that is updated daily. An AWS Glue job processes this data which is consumed by Amazon QuickSight to generate an interactive dashboard. Of late, the dashboard queries have been getting slower and an initial inspection has revealed that AWS Glue jobs are running longer than expected.

As a data engineer, which of the following actions will you take to improve the performance of the AWS Glue job? (Select two)

  1. A

    Partition the data in the S3 bucket based on year, month, and day

  2. B

    Setup AWS Glue Streaming to efficiently handle streaming data in near real-time

  3. C

    Check the IAM permissions on the service role created for the AWS Glue job

  4. D

    Cross-job data access could be the reason for slow-running queries. Use a separate AWS Glue Spark cluster

  5. E

    Configure larger Glue job workers by changing the instance type of the workers

Xem giải thích

Đáp án

A và E — phân vùng dữ liệu trên S3 theo năm, tháng, ngày; và tăng cỡ worker của Glue job

Vì sao đúng

Hai biện pháp này đánh vào hai nguyên nhân khác nhau khiến Glue job chạy chậm:

  • A. Phân vùng dữ liệu — đây là biện pháp có tác động lớn nhất. Đề nói dữ liệu được cập nhật hằng ngày vào một bucket duy nhất; không phân vùng thì mỗi lần chạy job phải quét lại toàn bộ lịch sử. Phân vùng theo year/month/day cho phép job (và cả QuickSight qua Athena) chỉ đọc đúng phần cần thiết:

    s3://bucket/du-lieu/year=2026/month=08/day=27/
    
  • E. Dùng worker lớn hơn — Glue job chạy trên Spark; worker mạnh hơn (G.2X thay vì G.1X) cho nhiều bộ nhớ và CPU hơn mỗi node, giúp xử lý phần dữ liệu lớn mà không bị tràn ra đĩa.

Vì sao các phương án khác sai

  • B. Thiết lập AWS Glue Streaming — dùng cho dữ liệu luồng thời gian thực; đề nói dữ liệu cập nhật hằng ngày theo lô, nên đây là công cụ sai bài toán.
  • C. Kiểm tra quyền IAM trên service role của job — quyền sai thì job chạy lỗi, không phải chạy chậm. Đây là phương án nhiễu vì nghe như một bước chẩn đoán hợp lý.
  • D. Truy cập dữ liệu chéo giữa các job gây chậm, nên dùng cụm Spark riêng — Glue vốn đã cấp tài nguyên riêng cho mỗi job; không có chuyện các job dùng chung cụm và tranh chấp nhau.
Câu 568 Domain 1: Data Ingestion and Transformation

A financial services company bills its clients based on per unit of clickstream data provided to the clients. As the company operates in a regulated industry, it needs to have the same ordered clickstream data available for auditing within a window of 7 days.

Which of the following AWS services provides the ability to run the billing process and auditing process on the given clickstream data in the same order?

  1. A

    Amazon Kinesis Data Analytics

  2. B

    Amazon Simple Queue Service (SQS)

  3. C

    Amazon Kinesis Data Streams

  4. D

    Amazon Kinesis Data Firehose

Xem giải thích

Đáp án

C — Amazon Kinesis Data Streams

Vì sao đúng

Đề đặt ba yêu cầu, và chỉ Kinesis Data Streams thoả cả ba:

  • Thứ tự được bảo đảm — thứ tự giữ nguyên trong mỗi shard, theo partition key.
  • Hai quy trình đọc cùng một dữ liệu, độc lập nhau — quy trình tính tiền và quy trình kiểm toán. Kinesis cho nhiều consumer đọc song song cùng một luồng, mỗi bên giữ vị trí riêng.
  • Giữ dữ liệu 7 ngày — thời gian lưu mặc định của Kinesis đúng là 24 giờ, mở rộng tới 7 ngày (và tối đa 365 ngày với chế độ lưu dài hạn).

Vế thứ hai là chỗ quyết định: quy trình kiểm toán phải đọc đúng dữ liệu, đúng thứ tự mà quy trình tính tiền đã dùng — không phải một bản sao khác.

Vì sao các phương án khác sai

  • B. Amazon SQS — thông điệp bị xoá sau khi xử lý, và không đọc lại được. Hai quy trình đọc cùng một hàng đợi sẽ giành nhau thông điệp, mỗi bên chỉ nhận được một phần. Đây là phương án nhiễu chính.
  • D. Kinesis Data Firehose — không lưu dữ liệu để đọc lại; nó chỉ chuyển tiếp tới đích (S3, Redshift, OpenSearch).
  • A. Kinesis Data Analytics — xử lý dữ liệu luồng, không phải nơi lưu trữ luồng.
Câu 569 Domain 4: Data Security and Governance

A data engineer at an IT company just upgraded an Amazon EC2 instance type from t2.nano (0.5G of RAM, 1 vCPU) to u-12tb1.metal (12.3 TB of RAM, 448 vCPUs). How would you categorize this upgrade?

  1. A

    This is a scale up example of vertical scaling

  2. B

    This is an example of high availability

  3. C

    This is a scale up example of horizontal scaling

  4. D

    This is a scale out example of vertical scaling

Xem giải thích

Đáp án

A — Đây là ví dụ scale up của vertical scaling (mở rộng theo chiều dọc)

Vì sao đúng

Việc nâng cấp trong đề — từ t2.nano (0,5 GB RAM, 1 vCPU) lên u-12tb1.metal (12,3 TB RAM, 448 vCPU) — là làm một máy mạnh hơn, không phải thêm máy.

Chiều dọc (vertical) Chiều ngang (horizontal)
Cách làm Máy to hơn Thêm máy
Tăng gọi là Scale up Scale out
Giảm gọi là Scale down Scale in
Số lượng máy Vẫn là một Nhiều
Chịu lỗi ❌ Vẫn một điểm hỏng ✅

Ví dụ này cũng cho thấy giới hạn của mở rộng theo chiều dọc: u-12tb1.metal gần như là instance lớn nhất mà AWS có: đã tới đó thì không còn chỗ để lớn thêm. Còn scale out thì gần như không có trần.

Và dù to đến đâu, nó vẫn là một máy — hỏng là mất tất cả. Đó là lý do AWS khuyến nghị scale out cho hệ thống cần sẵn sàng cao.

Vì sao các phương án khác sai

  • C. Scale up của horizontal scaling và D. Scale out của vertical scaling — cả hai ghép nhầm cặp thuật ngữ: "up/down" đi với dọc, "out/in" đi với ngang.
  • B. Ví dụ về tính sẵn sàng cao — ngược lại; một máy to là một điểm hỏng duy nhất.
Câu 570 Domain 2: Data Store Management

A media company is evaluating the possibility of moving its IT infrastructure to the AWS Cloud. The company needs at least 10 terabytes of storage with the maximum possible I/O performance for processing certain video files on its servers. The company also needs close to 450 terabytes of very durable storage for storing media content and almost double of it, i.e. 900 terabytes for archival of legacy data.

Which set of services will you recommend to meet these requirements?

  1. A

    Amazon EC2 instance store for maximum performance, Amazon S3 for durable data storage, and Amazon S3 Glacier Deep Archive for archival storage

  2. B

    Amazon EBS for maximum performance, Amazon S3 for durable data storage, and Amazon S3 Glacier Deep Archive for archival storage

  3. C

    Amazon S3 standard storage for maximum performance, Amazon S3 Intelligent-Tiering for intelligent, durable storage, and Amazon S3 Glacier Deep Archive for archival storage

  4. D

    Amazon EC2 instance store for maximum performance, AWS DataSync for durable data storage and Amazon S3 Glacier Deep Archive for archival storage

Xem giải thích

Đáp án

A — Instance store cho hiệu năng tối đa, S3 cho lưu trữ bền vững, S3 Glacier Deep Archive cho lưu trữ dài hạn

Vì sao đúng

Đề nêu ba nhu cầu khác nhau, và mỗi nhu cầu có một lựa chọn tối ưu riêng:

Nhu cầu Lựa chọn Vì sao
10 TB, hiệu năng I/O tối đa Instance store Ổ NVMe gắn trực tiếp vào máy chủ vật lý — độ trễ thấp nhất, IOPS cao nhất
450 TB, rất bền Amazon S3 Độ bền 99,999999999%, dung lượng không giới hạn
900 TB, lưu trữ dài hạn S3 Glacier Deep Archive Rẻ nhất cho dữ liệu gần như không đụng tới

Instance store là lựa chọn đúng ở tầng đầu vì đề nói rõ "hiệu năng I/O tối đa" — và dữ liệu ở đó là tệp video đang xử lý, tức là dữ liệu trung gian tạo lại được. Nhược điểm lớn nhất của instance store (mất dữ liệu khi instance dừng) vì thế không thành vấn đề.

Vì sao các phương án khác sai

  • B. Dùng EBS cho hiệu năng tối đa — EBS bền vững và cũng nhanh, nhưng đi qua mạng nên độ trễ cao hơn instance store. Khi đề nói "tối đa" thì instance store thắng. Đây là phương án nhiễu chính.
  • C. Dùng S3 Standard cho hiệu năng tối đa — S3 truy cập qua API HTTP, độ trễ hàng chục mili giây; không thể so với ổ gắn trực tiếp.
  • D. Dùng AWS DataSync cho lưu trữ bền vững — DataSync là công cụ di chuyển dữ liệu, không phải nơi lưu trữ.