Ngân hàng đề — AWS Certified Data Engineer Associate
Tìm thấy 867 câu.
A company stores large amounts of semi-structured data, such as CSV and Parquet files, in an Amazon S3 bucket. They want to run interactive SQL queries on this data for quick ad hoc analysis without managing any infrastructure. Which AWS service is the best fit for this requirement?
-
A
Amazon Athena
-
B
Amazon Redshift
-
C
AWS Glue
-
D
Amazon RDS
Xem giải thích
Đáp án
A — Amazon Athena
Vì sao đúng
Athena chạy SQL thẳng trên tệp nằm ở S3, không có máy chủ nào để dựng hay trông coi. Nó đọc được cả CSV lẫn Parquet, tính tiền theo lượng dữ liệu quét, và không chạy thì không tốn — rất hợp với phân tích tuỳ hứng, thỉnh thoảng mới dùng.
Vì sao các phương án khác sai
- B. Redshift — mạnh cho phân tích lặp lại hằng ngày, nhưng phải dựng cụm và nạp dữ liệu vào; quá nặng cho vài truy vấn khám phá.
- C. AWS Glue — ETL và catalog. Nó chuẩn bị dữ liệu cho Athena chứ bản thân không phải công cụ truy vấn tương tác.
- D. Amazon RDS — CSDL quan hệ cho ứng dụng giao dịch; muốn dùng thì phải nạp dữ liệu vào trước, trái yêu cầu "không quản lý hạ tầng".
A startup uses DynamoDB to store customer orders and requires the ability to track real-time changes to the order data. They want to capture only the modified data and send it to an Amazon Redshift cluster for analytics processing. The system must handle frequent updates to large volumes of data efficiently. Which solution best meets these requirements?
-
A
Enable DynamoDB Streams with the "New and Old Image" option. Use AWS Lambda to trigger an ETL process that writes the updated data to Amazon S3. Use Amazon Redshift Spectrum to query the data in S3.
-
B
Enable DynamoDB Streams with the "New Image" option. Use AWS Lambda to process the stream and send the modified data to an Amazon Kinesis Data Firehose that loads the data into Amazon Redshift.
-
C
Enable DynamoDB Streams with the "Keys Only" option. Use AWS Lambda to process only the primary key changes and update an Amazon S3 data lake. Load the data from S3 into Amazon Redshift using AWS Glue.
-
D
Enable DynamoDB Streams with the "New and Old Image" option. Use AWS Glue to run batch ETL jobs that extract the updated data directly from the stream and load it into Amazon Redshift.
Xem giải thích
Đáp án
B — Bật DynamoDB Streams kiểu "New Image", dùng Lambda đẩy sang Redshift
Vì sao đúng
Đề nói rõ chỉ cần phần dữ liệu đã thay đổi và hệ thống phải chạy gần thời gian thực. NEW_IMAGE mang đúng trạng thái mới sau mỗi lần ghi — không thừa bản cũ, nên bản ghi nhỏ và rẻ hơn. Lambda gắn thẳng vào stream nên chạy ngay khi có thay đổi.
Vì sao các phương án khác sai
- A. New and Old Image — đủ dùng nhưng mang thừa trạng thái cũ mà bài toán phân tích này không cần.
- C. Keys Only — chỉ có khoá chính, phải quay lại đọc bảng cho từng mục; thêm một vòng gọi và thêm chi phí đọc.
- D. Glue theo lô — Glue chạy theo mẻ, không đạt "gần thời gian thực".
A company is processing customer data using AWS Glue and needs to comply with privacy regulations, such as GDPR, by protecting sensitive information such as social security numbers and credit card details. Which AWS Glue transformation should they use to identify and manage this sensitive information?
-
A
Use the "Find Matches" transformation to locate sensitive information in the dataset.
-
B
Use the "Join" transformation to combine datasets and remove sensitive data manually.
-
C
Use the "Aggregate" transformation to summarize the sensitive data.
-
D
Use the "Detect PII" transformation to automatically identify and manage personally identifiable information.
Xem giải thích
Đáp án
D — Dùng phép biến đổi "Detect PII"
Vì sao đúng
Detect PII của AWS Glue quét dữ liệu và tự nhận ra các loại thông tin cá nhân như số bảo hiểm xã hội, số thẻ tín dụng hay email, rồi cho bạn chọn cách xử lý: che, băm, hoặc đánh dấu lại để rà sau. Đây là công cụ dựng sẵn đúng cho nghĩa vụ kiểu GDPR mà đề nêu.
Vì sao các phương án khác sai
- A. Find Matches — dùng học máy để tìm bản ghi trùng lặp, không phải để nhận diện dữ liệu nhạy cảm.
- B. Join — ghép hai tập dữ liệu; "gỡ bằng tay" thì không mở rộng được và chắc chắn sẽ sót.
- C. Aggregate — tổng hợp số liệu; gộp nhóm nhỏ vẫn có thể suy ngược ra cá nhân.
A company wants to use the Amazon Redshift Data API to access data from its Redshift cluster for a web-based application. The application retrieves user data intermittently and displays it on the UI. Which feature of the Data API is especially helpful for this use case?
-
A
Persistent connections for long-running queries.
-
B
Asynchronous query processing.
-
C
Automatic data replication across regions for high availability.
-
D
Support for synchronous query execution.
Xem giải thích
Đáp án
B — Xử lý truy vấn bất đồng bộ
Vì sao đúng
Redshift Data API nhận truy vấn qua HTTP rồi trả về ngay một mã định danh, không giữ kết nối nào. Ứng dụng web hỏi lại sau để lấy kết quả. Nhờ vậy không cần quản lý pool kết nối, không lo hết kết nối khi nhiều người dùng cùng vào, và không có kết nối nào nằm không giữa hai lần truy vấn thưa thớt — đúng kiểu dùng mà đề mô tả.
Vì sao các phương án khác sai
- A. Kết nối giữ lâu — chính thứ Data API sinh ra để tránh.
- C. Tự nhân bản liên vùng — Data API không làm việc đó; đây là chuyện của snapshot.
- D. Chạy đồng bộ — có gọi kiểu chờ kết quả, nhưng đó không phải điểm mạnh cho ứng dụng web truy vấn thưa.
An enterprise is using Amazon Redshift to store and analyze confidential business data. The company needs to track who is accessing the data and what actions they are performing in the cluster. They also need to ensure that the cluster meets corporate security policies, including encryption and network isolation. Additionally, the company wants to retain query logs and audit access for at least 7 years for compliance reasons. Which combination of features and services will best satisfy the company’s security and compliance requirements? (Choose two.)
-
A
Use AWS Key Management Service (KMS) to enable encryption at rest for Redshift.
-
B
Use Amazon Redshift Spectrum to store audit logs in Amazon S3 for long-term retention.
-
C
Use AWS CloudTrail to log API calls and monitor who accessed the Redshift cluster.
-
D
Enable Amazon CloudWatch to capture audit logs and retain them for 7 years.
-
E
Enable Amazon Redshift Enhanced VPC Routing to enforce network isolation.
Xem giải thích
Đáp án
A và C — KMS mã hoá khi lưu, CloudTrail ghi lời gọi API
Vì sao đúng
- C. CloudTrail trả lời trực tiếp câu hỏi "ai truy cập và làm gì": mọi lời gọi API tới cụm đều được ghi kèm danh tính, thời điểm và địa chỉ nguồn.
- A. KMS đáp ứng phần "đạt chuẩn nội bộ": mã hoá khi lưu là yêu cầu gần như luôn có trong mọi bộ tiêu chuẩn, và dùng khoá của chính bạn thì kiểm soát được vòng đời khoá.
Vì sao các phương án khác sai
- B. Redshift Spectrum — công cụ truy vấn dữ liệu trên S3, không phải nơi lưu nhật ký kiểm toán.
- D. CloudWatch giữ 7 năm — CloudWatch Logs giữ được lâu, nhưng nhật ký kiểm toán của Redshift thì đổ về S3; hơn nữa đề không nêu thời hạn cụ thể nào.
- E. Enhanced VPC Routing — ép lưu lượng đi qua VPC của bạn, tốt cho cô lập mạng nhưng không ghi lại ai đã làm gì.
A company is building a multi-account data lake using AWS Lake Formation. They want to securely share databases across AWS accounts and control data access at the row and column level. What combination of Lake Formation features should the company use to achieve this?
-
A
Lake Formation Tag-Based Access Control (TBAC) for access control, AWS Resource Access Manager (RAM) for cross-account sharing, and Lake Formation Data Filters for row and column-level security.
-
B
AWS Glue Crawlers for automated cataloging, AWS Glue DataBrew for data preparation, and Amazon Redshift Spectrum for analytics.
-
C
Amazon S3 for data storage, AWS KMS for encryption, and Amazon Athena for querying the data.
-
D
AWS Glue Data Catalog for organizing data, AWS IAM for access control, and AWS Glue ETL jobs for data transformations.
Xem giải thích
Đáp án
A — Tag-Based Access Control của Lake Formation, cộng AWS RAM để chia sẻ liên tài khoản
Vì sao đúng
Đề có hai yêu cầu và phương án này trả lời cả hai:
- TBAC gắn nhãn lên cơ sở dữ liệu, bảng và từng cột, rồi cấp quyền theo nhãn. Nhờ vậy phân quyền tới mức dòng và cột mà không phải viết lại chính sách mỗi khi thêm bảng.
- AWS RAM là cơ chế chia sẻ tài nguyên giữa các tài khoản; Lake Formation dùng nó để đưa quyền sang tài khoản khác một cách có kiểm soát.
Vì sao các phương án khác sai
- B — crawler, DataBrew và Spectrum lo cataloging, chuẩn bị và truy vấn dữ liệu, không cái nào là cơ chế phân quyền.
- C — S3, KMS và Athena cho lưu trữ, mã hoá và truy vấn; không có phần chia sẻ liên tài khoản.
- D — IAM cấp quyền tới mức tài nguyên, nhưng không phân quyền theo dòng và cột như Lake Formation.
A data engineer is implementing DynamoDB Accelerator (DAX) to reduce read latency for an application querying a DynamoDB table. The engineer is concerned about performance under high read loads and is considering using retry logic for handling throttling exceptions. Which TWO of the following statements are TRUE about DAX and throttling behavior? (Choose two.)
-
A
DAX may throttle requests if the traffic exceeds the configured throughput capacity.
-
B
DAX directly updates the DynamoDB table without updating its cache, ensuring consistency.
-
C
DAX caches frequently accessed data, reducing the need to query DynamoDB directly.
-
D
If the throughput capacity is exceeded, DAX will automatically retry failed requests without throttling.
-
E
DAX clusters consist of multiple nodes, where one node acts as the primary for cache updates.
Xem giải thích
Đáp án
A và C
Vì sao đúng
- C. DAX lưu đệm dữ liệu hay đọc — đó là lý do nó tồn tại. Trúng đệm thì trả lời trong vài micro giây và không phải gọi xuống DynamoDB, nên vừa nhanh hơn vừa đỡ tốn đơn vị đọc.
- A. DAX vẫn có thể chặn yêu cầu — cụm DAX có năng lực hữu hạn theo loại và số node. Vượt ngưỡng thì nó trả lỗi chặn, nên phía ứng dụng vẫn phải có logic thử lại kèm giãn cách.
Vì sao các phương án khác sai
- B. DAX ghi thẳng xuống bảng mà không cập nhật đệm — sai chiều: DAX dùng cơ chế ghi xuyên qua, ghi xong thì cập nhật luôn bộ đệm.
- D. Vượt ngưỡng thì DAX tự thử lại, không chặn — sai; nó chặn, và việc thử lại là của ứng dụng hoặc SDK.
- E. Một node chính lo cập nhật đệm — cụm DAX có node chính cho ghi thật, nhưng câu này mô tả sai vai trò và không phải điều cần biết khi lo chuyện bị chặn.
A financial institution needs to process data streams with very low latency and multiple concurrent consumer applications. Which feature of Amazon Kinesis Data Streams should they enable to avoid bottlenecks and ensure scalable, low-latency data delivery?
-
A
Enhanced fan-out
-
B
Auto-scaling with provisioned mode Correct
-
C
Data stream replication
-
D
Manual shard scaling
Xem giải thích
Đáp án
A — Enhanced fan-out
Vì sao đúng
Không bật enhanced fan-out thì mọi consumer chia nhau 2 MB/giây mỗi shard và phải hỏi liên tục, nên càng thêm ứng dụng đọc thì độ trễ càng tăng. Enhanced fan-out cấp cho mỗi consumer một đường riêng 2 MB/giây trên mỗi shard và đẩy dữ liệu sang, kéo độ trễ xuống khoảng 70 mili giây — đúng yêu cầu "độ trễ rất thấp, nhiều ứng dụng cùng đọc".
Vì sao các phương án khác sai
- B. Co giãn ở chế độ provisioned — tăng tổng thông lượng nhưng các consumer vẫn giành nhau phần của từng shard.
- C. Nhân bản luồng dữ liệu — Kinesis đã tự nhân bản qua nhiều AZ; đó là chuyện bền vững, không phải độ trễ.
- D. Tự thêm shard bằng tay — vẫn là chia sẻ băng thông, cộng thêm việc vận hành.
A company is running several Amazon EC2 instances that require durable, high-performance block storage for databases and application data. The company needs to ensure that the data remains available even if the EC2 instances are stopped or terminated. They also want to optimize for cost and ensure data is protected from hardware failures. Which combination of services and storage options should the company use?
-
A
Use Amazon EBS Cold HDD volumes attached to EC2 instances with no snapshots for cost savings.
-
B
Use Amazon EFS for application data and EC2 instance storage for temporary data.
-
C
Use Amazon EBS General Purpose SSD volumes attached to EC2 instances with snapshots for backups.
-
D
Use Amazon S3 for all application and database data storage, and EC2 instance storage for temporary data.
Xem giải thích
Đáp án
C — Dùng EBS General Purpose SSD gắn vào EC2, kèm snapshot để sao lưu
Vì sao đúng
EBS là ổ khối có vòng đời độc lập với máy: dừng hay huỷ instance thì volume vẫn còn và gắn sang máy khác được. gp3 hoặc gp2 cho hiệu năng ổn định đủ dùng cho CSDL, còn snapshot lo phần khôi phục khi hỏng — cộng lại là đúng yêu cầu "bền, nhanh, và còn dữ liệu sau khi máy dừng".
Vì sao các phương án khác sai
- A. Cold HDD, không snapshot — Cold HDD là ổ đĩa quay cho dữ liệu ít đụng tới, quá chậm cho CSDL; bỏ snapshot là bỏ luôn đường khôi phục.
- B. EFS cộng ổ tạm của instance — ổ tạm mất sạch khi máy dừng, đúng thứ đề cấm.
- D. Để hết trên S3 — S3 là kho đối tượng, không gắn thành ổ khối cho CSDL được.
A data engineer is tasked with preparing a dataset for machine learning using AWS Glue DataBrew. The dataset contains several inconsistencies, including missing values, combined fields, and some redundant columns. The data engineer wants to visually inspect and transform the dataset without writing code and ensure that transformations are automated to run on a regular schedule. Which of the following approaches would best address these requirements?
-
A
Create an Amazon EMR cluster to run Apache Spark jobs for data cleansing and scheduling.
-
B
Use Amazon Redshift to load the dataset, run SQL queries to clean the data, and schedule tasks using Amazon EventBridge.
-
C
Write custom Python scripts in AWS Lambda to process the dataset and store it in an Amazon S3 bucket.
-
D
Use AWS Glue DataBrew to visually inspect the dataset, create a transformation recipe, and schedule a job to execute it regularly.
Xem giải thích
Đáp án
D — Dùng AWS Glue DataBrew: xem trực quan, tạo công thức biến đổi, rồi hẹn giờ chạy
Vì sao đúng
DataBrew dựng cho đúng người không muốn viết mã: mở bộ dữ liệu lên là thấy ngay phân bố giá trị và chỗ thiếu, chọn trong hơn 250 phép biến đổi có sẵn để tách cột, điền giá trị thiếu hay bỏ cột thừa. Các bước được ghi thành công thức dùng lại được, và tạo job hẹn giờ để chạy lại khi có dữ liệu mới.
Vì sao các phương án khác sai
- A. Cụm EMR chạy Spark — làm được nhưng phải viết mã và vận hành cụm, trái yêu cầu "trực quan".
- B. Nạp vào Redshift rồi làm sạch bằng SQL — thêm một chặng nạp dữ liệu, và vẫn phải viết SQL.
- C. Script Python trong Lambda — tự viết toàn bộ, cộng trần 15 phút cho dữ liệu lớn dần.