Ngân hàng đề — AWS Certified Data Engineer Associate

Tìm thấy 867 câu.

Câu 161 Data Store Management

A data engineer at a retail company needs to run complex queries on large datasets stored in Amazon Redshift. These queries often involve aggregating data from specific columns rather than all columns in a table. The engineer is looking for a way to optimize query performance. Which of the following Amazon Redshift features will provide the best optimization for the engineer's use case?

  1. A

    Row-based storage with high SSD IOPS

  2. B

    Horizontal partitioning to split data across multiple nodes

  3. C

    Multi-AZ replication for faster data access

  4. D

    Columnar storage for minimizing I/O operations

Xem giải thích

Đáp án

D — Lưu trữ theo cột để giảm thao tác I/O

Vì sao đúng

Redshift lưu theo cột: giá trị của cùng một cột nằm liền nhau trên đĩa. Khi truy vấn chỉ tổng hợp vài cột trong bảng rộng, engine chỉ đọc đúng những khối của các cột đó và bỏ qua phần còn lại — lượng I/O giảm theo tỷ lệ số cột dùng trên tổng số cột. Thêm nữa, dữ liệu cùng cột thì cùng kiểu và hay lặp giá trị nên nén rất tốt, càng đọc ít byte hơn.

Vì sao các phương án khác sai

  • A. Lưu theo dòng với SSD IOPS cao — theo dòng thì đọc một cột vẫn phải kéo cả dòng lên; ổ nhanh chỉ làm việc lãng phí đó diễn ra nhanh hơn.
  • B. Phân mảnh ngang — Redshift đã tự phân tán dữ liệu qua các node bằng distribution key; đây không phải điều đề đang hỏi.
  • C. Nhân bản Multi-AZ — phục vụ tính sẵn sàng, không làm truy vấn nhanh hơn.

Nhớ nhanh

Tổng hợp vài cột trên bảng rộng chính là bài toán mà lưu trữ theo cột sinh ra để giải.

Câu 162 Chọn nhiều đáp án Data Operations and Support

A data scientist is using Amazon SageMaker to train a machine learning model. The dataset is stored in Amazon S3, and the scientist is using one of SageMaker's built-in algorithms. Which steps should the data scientist take to prepare and configure the training job? (Choose THREE.)

  1. A

    Define the hyperparameters to optimize the training algorithm.

  2. B

    Configure the output path to specify where SageMaker should store the trained model.

  3. C

    Deploy the trained model to an Amazon EC2 instance for inference.

  4. D

    Enable Amazon SageMaker Studio to automatically transform the data into RecordIO format.

  5. E

    Specify the S3 location of the training data as a training channel.

  6. F

    Set the IAM role that SageMaker can assume to access resources on behalf of the user.

Xem giải thích

Đáp án chuẩn

A, E và F — đặt siêu tham số, khai vị trí dữ liệu huấn luyện trên S3, và gán vai IAM

Vì sao ba phương án này đúng

  • A. Siêu tham số — thuật toán dựng sẵn của SageMaker cần được khai các giá trị như số vòng lặp hay tốc độ học; đây là phần quyết định chất lượng mô hình.
  • E. Kênh dữ liệu huấn luyện — SageMaker nhận dữ liệu qua khái niệm channel, mỗi kênh trỏ tới một vị trí S3. Không khai thì job không có gì để học.
  • F. Vai IAM — SageMaker chạy dưới một vai do bạn cấp để đọc S3 và ghi log; thiếu vai thì job hỏng ngay ở bước xin quyền.

Một điểm cần nói thẳng

Phương án B (khai đường dẫn đầu ra) trên thực tế cũng bắt buộc — không có nó thì mô hình đã huấn luyện xong chẳng biết lưu vào đâu. Đề yêu cầu chọn đúng ba nên nguồn bỏ B ra, nhưng đừng học theo hướng "B không cần".

Vì sao hai phương án còn lại sai

  • C. Triển khai lên EC2 để suy luận — đó là việc sau khi huấn luyện xong, không thuộc phần cấu hình job.
  • D. Studio tự đổi dữ liệu sang RecordIO — không có chuyện tự động đó; muốn dùng RecordIO thì phải tự chuyển trước.
Câu 163 Data Store Management

A data engineering team is building a data lake on Amazon S3 to store large volumes of raw data generated by IoT devices. They need to optimize the cost of storage without compromising on the accessibility of the data, as some datasets need frequent access while others are rarely accessed. Which combination of storage classes should they use to achieve this?

  1. A

    S3 Intelligent-Tiering for frequently accessed data and S3 Glacier for rarely accessed data.

  2. B

    S3 Standard for frequently accessed data and S3 Intelligent-Tiering for rarely accessed data.

  3. C

    S3 Standard for frequently accessed data and S3 Glacier Deep Archive for rarely accessed data.

  4. D

    S3 Intelligent-Tiering for frequently accessed data and S3 One Zone-IA for rarely accessed data.

Xem giải thích

Đáp án

A — S3 Intelligent-Tiering cho dữ liệu hay dùng, S3 Glacier cho dữ liệu hiếm khi dùng

Vì sao đúng

Đề nói rõ có hai nhóm dữ liệu và không được hy sinh khả năng truy cập:

  • Intelligent-Tiering hợp với nhóm "hay dùng" vì kiểu truy cập của dữ liệu IoT khó đoán. Nó tự chuyển tầng theo thực tế sử dụng, không tính phí lấy ra, và không làm chậm việc đọc.
  • Glacier hợp với nhóm "hiếm khi dùng", rẻ hơn nhiều mà vẫn lấy ra được trong vài phút nếu chọn chế độ nhanh.

Vì sao các phương án khác sai

  • B — đảo ngược vai trò: Intelligent-Tiering cho dữ liệu hiếm dùng là trả thêm phí theo dõi mà chẳng được gì.
  • C. Glacier Deep Archive — rẻ nhất nhưng thời gian lấy ra tính bằng giờ, phạm vào điều kiện "không hy sinh khả năng truy cập".
  • D. One Zone-IA — chỉ nằm trong một vùng sẵn sàng; mất AZ đó là mất dữ liệu.

Nhớ nhanh

Kiểu truy cập khó đoán → Intelligent-Tiering. Chắc chắn ít đụng tới → Glacier.

Câu 164 Chọn nhiều đáp án Data Operations and Support

A data scientist has developed a machine learning model using SageMaker and now needs to train the model on a large dataset. The training must be scalable, and the model needs to be deployed with high availability for making predictions. What are TWO key SageMaker features that address these requirements? (Choose Two)

  1. A

    SageMaker Debugger for optimizing hyperparameters

  2. B

    Offline store for low-latency real-time predictions

  3. C

    SageMaker Experiments to track model lineage

  4. D

    Managed deployment of models with high availability

  5. E

    Automatic scaling of training resources based on data volume

Xem giải thích

Đáp án

D và E — Triển khai mô hình có tính sẵn sàng cao, và tự co giãn tài nguyên huấn luyện

Vì sao hai phương án này đúng

Đề đặt đúng hai yêu cầu và mỗi phương án trả lời một:

  • E ứng với "huấn luyện phải mở rộng được": SageMaker cấp phát và thu hồi máy huấn luyện theo khối lượng dữ liệu, chạy xong là trả máy nên không tốn tiền lúc rảnh.
  • D ứng với "triển khai có tính sẵn sàng cao": endpoint của SageMaker trải các bản sao qua nhiều vùng sẵn sàng và tự thay thế bản sao hỏng.

Vì sao các phương án khác sai

  • A. Debugger — bắt lỗi trong quá trình huấn luyện (gradient biến mất, quá khớp), không phải công cụ tối ưu siêu tham số; việc đó là của Automatic Model Tuning.
  • B. Offline store — phần lưu trữ theo lô của Feature Store, dùng để huấn luyện; muốn suy luận độ trễ thấp thì phải dùng online store.
  • C. Experiments — theo dõi và so sánh các lần chạy, hữu ích nhưng không liên quan tới quy mô hay tính sẵn sàng.
Câu 165 Data Security and Governance

A data engineer is tasked with ensuring the encryption of sensitive customer data stored in Amazon S3 using AWS KMS. The company requires regular audits to track who accesses the encryption keys and when they are used. Which type of key should the data engineer choose to meet this requirement?

  1. A

    AWS managed key

  2. B

    Symmetric key

  3. C

    Customer managed key

  4. D

    AWS owned key

Xem giải thích

Đáp án

C — Customer managed key (khoá do khách hàng quản lý)

Vì sao đúng

Yêu cầu mấu chốt là kiểm toán được ai dùng khoá và dùng lúc nào. Với customer managed key, bạn sở hữu khoá trong tài khoản của mình: tự viết key policy, tự bật xoay vòng khoá, và mọi lần gọi Encrypt/Decrypt đều được ghi vào CloudTrail kèm danh tính người gọi. Đó chính là dấu vết mà bên kiểm toán cần.

Vì sao các phương án khác sai

  • A. AWS managed key — CloudTrail có ghi lại, nhưng bạn không sửa được key policy và không kiểm soát vòng đời khoá, nên khó đáp ứng yêu cầu kiểm toán chặt.
  • B. Symmetric key — nói về loại thuật toán (đối xứng hay bất đối xứng), không phải về quyền quản lý; customer managed key cũng thường là khoá đối xứng.
  • D. AWS owned key — nằm trong tài khoản của AWS, dùng chung nhiều khách hàng, không hiện trong tài khoản bạn và không kiểm toán được.

Nhớ nhanh

Đề nhắc tới kiểm toán, xoay vòng khoá hay key policy → customer managed key.

Câu 166 Data Ingestion and Transformation

A company uses IoT devices that send temperature readings in real time. The company wants to perform real-time analytics on the data and react to anomalies immediately. Which combination of AWS services should they use for data ingestion and real-time analysis?

  1. A

    Amazon Kinesis Firehose and Amazon Redshift

  2. B

    Amazon Kinesis Data Streams and AWS Lambda

  3. C

    Amazon Kinesis Data Streams and Managed Apache Flink (formerly Kinesis Data Analytics)

  4. D

    Amazon Kinesis Data Streams and Amazon Kinesis Data Firehose

Xem giải thích

Đáp án

C — Kinesis Data Streams cộng Managed Service for Apache Flink

Vì sao đúng

Đề cần hai việc riêng biệt và mỗi thành phần lo một việc:

  • Data Streams nhận dữ liệu cảm biến theo thời gian thực, giữ lại tới 365 ngày và cho nhiều consumer cùng đọc.
  • Managed Apache Flink chạy phân tích trên dòng đang chảy: tính trung bình trượt theo cửa sổ thời gian, so ngưỡng, phát hiện bất thường và bắn cảnh báo ngay. Đây là thứ phân biệt "phân tích thời gian thực" với "lưu rồi phân tích sau".

Vì sao các phương án khác sai

  • A. Firehose và Redshift — cả hai đều theo lô; tới lúc dữ liệu vào tới Redshift thì bất thường đã xảy ra từ lâu.
  • B. Data Streams và Lambda — Lambda phản ứng theo từng bản ghi, khó tính toán theo cửa sổ thời gian trượt vì bản thân nó không giữ trạng thái.
  • D. Data Streams và Firehose — chỉ là chuyển dữ liệu xuống nơi lưu, không có phần phân tích.

Nhớ nhanh

"Phân tích thời gian thực theo cửa sổ" → Flink. "Chỉ chuyển tới đích" → Firehose.

Câu 167 Data Operations and Support

A startup is using Amazon Kinesis Data Streams to capture website clickstream data for customer behavior analysis. The company expects spikes in traffic during sales events and wants to ensure the system scales dynamically with demand without manual intervention. Which of the following configurations should they use to achieve this?

  1. A

    Use Kinesis Data Streams with the provisioned mode and manually add shards during traffic spikes.

  2. B

    Use Kinesis Data Streams with enhanced fan-out to increase the processing rate for high throughput.

  3. C

    Use Kinesis Data Streams in on-demand mode to automatically scale based on throughput.

  4. D

    Use Amazon Kinesis Data Firehose to automatically adjust to spikes in traffic.

Xem giải thích

Đáp án

C — Dùng Kinesis Data Streams ở chế độ on-demand

Vì sao đúng

Ở chế độ on-demand, Kinesis tự điều chỉnh số shard theo lưu lượng thật, xử lý được mức tăng gấp đôi so với đỉnh của 30 ngày trước mà không cần ai can thiệp. Bạn trả tiền theo lượng dữ liệu thực chảy qua. Với một startup không đoán được đợt bán hàng đông tới đâu, đây đúng là thứ đề bài mô tả: co giãn theo nhu cầu, không thao tác tay.

Vì sao các phương án khác sai

  • A. Provisioned rồi thêm shard bằng tay — chính là "can thiệp thủ công" mà đề loại trừ, và người ta thường phát hiện thiếu shard sau khi đã mất dữ liệu.
  • B. Enhanced fan-out — cho bên đọc băng thông riêng 2 MB/giây mỗi shard; nó giải quyết phía tiêu thụ chứ không mở rộng năng lực nhận vào.
  • D. Firehose tự điều chỉnh — Firehose co giãn thật, nhưng nó là dịch vụ giao nhận và chỉ giữ dữ liệu trong bộ đệm ngắn, không thay được vai trò lưu luồng của Data Streams.

Nhớ nhanh

"Tự co giãn, không can thiệp tay" trong Kinesis → on-demand mode.

Câu 168 Data Operations and Support

A company wants to develop an ETL pipeline with AWS Glue to process data from multiple sources such as S3 and Amazon Redshift. The pipeline needs to scale automatically and run at minimal cost. How should the company configure the Glue job to achieve these goals?

  1. A

    Use Amazon EC2 instances with a custom Python script to run the ETL jobs and manually manage scaling.

  2. B

    Set up the AWS Glue job with a fixed number of 10 Data Processing Units (DPUs) for all jobs to ensure consistent processing.

  3. C

    Use Glue’s auto-scaling feature to dynamically adjust the number of DPUs based on the data volume.

  4. D

    Allocate the maximum number of DPUs available to ensure faster job completion regardless of data size.

Xem giải thích

Đáp án

C — Bật auto-scaling của Glue để tự điều chỉnh số DPU theo khối lượng dữ liệu

Vì sao đúng

Auto-scaling của AWS Glue theo dõi công việc trong lúc job chạy và cấp thêm hoặc thu bớt worker ngay giữa chừng. Bạn chỉ khai số DPU tối đa, còn Glue dùng bao nhiêu thì tính tiền bấy nhiêu theo giây. Điều đó thoả cả hai yêu cầu cùng lúc: mở rộng tự động khi dữ liệu nhiều, và không trả tiền cho phần dư khi dữ liệu ít.

Vì sao các phương án khác sai

  • A. EC2 với script Python tự quản lý — vứt bỏ toàn bộ phần không máy chủ của Glue và ôm lấy việc vận hành; đề yêu cầu ngược lại.
  • B. Cố định 10 DPU cho mọi job — job nhỏ trả thừa, job lớn chạy chậm. Cố định là sai với dữ liệu thay đổi.
  • D. Cấp tối đa DPU cho mọi job — nhanh nhất nhưng đắt nhất, phạm thẳng vào yêu cầu "chi phí tối thiểu".

Nhớ nhanh

Glue mà đề nói "tự co giãn và rẻ" thì gần như luôn là auto-scaling, không phải số DPU cố định.

Câu 169 Data Store Management

A company frequently runs a complex query on Redshift that aggregates data from several tables. The query takes a long time to execute due to the complexity of the operations. The company wants to improve the query performance without altering the underlying data. Which feature should the company use?

  1. A

    Create a materialized view for the query.

  2. B

    Use Redshift to create indexes on the query's result set.

  3. C

    Create a Federated Query that references the external data sources.

  4. D

    Use Redshift Spectrum to store the aggregated data in S3.

Xem giải thích

Đáp án

A — Tạo materialized view cho truy vấn đó

Vì sao đúng

Materialized view tính trước rồi lưu lại kết quả của truy vấn tổng hợp. Lần chạy sau Redshift đọc thẳng kết quả đã lưu thay vì gộp lại từ đầu qua nhiều bảng. Bảng gốc không phải đổi gì — đúng điều kiện "không thay đổi dữ liệu bên dưới". Có thể làm mới định kỳ, hoặc bật tự động làm mới khi bảng nguồn đổi.

Vì sao các phương án khác sai

  • B. Tạo chỉ mục trên tập kết quả — Redshift không có chỉ mục kiểu CSDL giao dịch; nó dùng sort key và zone map thay thế.
  • C. Federated Query — để truy vấn CSDL bên ngoài như RDS, không liên quan tới tốc độ của truy vấn nội bộ.
  • D. Redshift Spectrum — đọc dữ liệu nằm trên S3; đưa dữ liệu ra ngoài thường làm chậm thêm chứ không nhanh hơn.
Câu 170 Data Operations and Support

A company wants to use Amazon Elastic Kubernetes Service (EKS) to run a highly dynamic workload where compute resources should automatically scale up or down based on application demand. Which node type should the company choose for their workload?

  1. A

    Self-Managed Nodes

  2. B

    AWS Fargate

  3. C

    Carpenter

  4. D

    Amazon EKS Managed Node Groups

Xem giải thích

Đáp án

C — Karpenter (nguồn viết nhầm thành "Carpenter")

Vì sao đúng

Karpenter là bộ tự cấp phát node cho Kubernetes do AWS phát triển. Khác với cách co giãn theo nhóm cố định, nó nhìn thẳng vào các pod đang chờ chỗ rồi chọn loại máy vừa vặn nhất và khởi tạo trong vài chục giây; khi tải giảm thì gom pod lại và thu hồi node trống. Với tải lên xuống thất thường thì đây là thứ phản ứng nhanh nhất và ít lãng phí nhất.

Vì sao các phương án khác sai

  • A. Self-Managed Nodes — bạn tự tạo, tự vá, tự co giãn; ngược hẳn yêu cầu tự động.
  • B. AWS Fargate — chạy được pod không cần node, nhưng bị giới hạn về loại tài nguyên và đắt hơn khi tải lớn và liên tục.
  • D. Managed Node Groups — có tự co giãn, nhưng theo nhóm máy cùng một loại đã định sẵn nên chậm và kém khớp hơn Karpenter.