Ngân hàng đề — AWS Certified Data Engineer Associate
Tìm thấy 867 câu.
A company is using a fleet of Amazon EC2 instances to ingest Internet-of-Things (IoT) data from various data sources. The data is in JSON format and ingestion rates can be as high as 1 MB/s. When an EC2 instance is restarted, the in-flight data is lost. The data engineering team at the company wants to store as well as query the ingested data in near-real-time.
Which of the following solutions provides near-real-time data querying that is scalable with minimal data loss?
-
A
Capture data in Amazon Kinesis Data Firehose with Amazon Redshift as the destination. Use Amazon Redshift to query the data
-
B
Capture data in an Amazon EBS volume and then publish this data to Amazon ElastiCache for Redis. Subscribe to the Redis channel to query the data
-
C
Capture data in Amazon Kinesis Data Streams. Use Amazon Kinesis Data Analytics to query and analyze this streaming data in real-time
-
D
Capture data in an Amazon EC2 instance store and then publish this data to Amazon Kinesis Data Firehose with Amazon S3 as the destination. Use Amazon Athena to query the data
Xem giải thích
Đáp án
A — Thu dữ liệu bằng Kinesis Data Firehose với đích là Amazon Redshift, rồi truy vấn trên Redshift
Vì sao đúng
Đề nêu ba yêu cầu, và kiến trúc này phủ cả ba:
- Mất dữ liệu tối thiểu — đây là vấn đề gốc: hiện tại dữ liệu nằm trong bộ nhớ của EC2 và mất khi máy khởi động lại. Firehose nhận và đệm dữ liệu ngay, tự thử lại khi ghi lỗi, nên không phụ thuộc vào tình trạng của máy nào.
- Co giãn được — Firehose tự co giãn, không phải khai shard hay instance.
- Truy vấn gần thời gian thực — Redshift cho phép chạy SQL trên dữ liệu vừa nạp.
Firehose có tích hợp sẵn với Redshift làm đích (qua bước trung gian trên S3 rồi COPY tự động), nên không phải viết mã kết dính nào.
Vì sao các phương án khác sai
- C. Kinesis Data Streams kèm Kinesis Data Analytics — Data Analytics phân tích luồng đang chảy, nó không lưu trữ dữ liệu để truy vấn lại sau. Đề đòi lưu trữ và truy vấn. Đây là phương án nhiễu chính.
- D. Ghi vào instance store rồi đẩy sang Firehose — instance store là lưu trữ tạm, mất dữ liệu khi instance dừng; nó giữ nguyên đúng vấn đề mà đề đang muốn giải.
- B. Ghi vào EBS rồi đẩy sang ElastiCache for Redis — Redis là cache trong bộ nhớ, không phải nơi lưu trữ bền vững cho dữ liệu phân tích.
A healthcare company uses an Amazon Redshift database cluster to store sensitive user data. The regulatory guidelines mandate logging so that any database authentication attempts as well as the connections/disconnections are recorded. Also, the logs must include a record of each query executed against the database along with the database user who executed that query.
Which of the following options represents the best solution for these requirements?
-
A
Enable audit trail for Amazon Redshift on Amazon CloudTrail
-
B
Enable audit metrics on Amazon CloudWatch
-
C
Enable audit logging for Amazon Redshift
-
D
Enable and download audit reports from AWS Config
Xem giải thích
Đáp án
C — Bật audit logging của Amazon Redshift
Vì sao đúng
Đề liệt kê ba loại thông tin cần ghi, và Redshift audit logging sinh ra đúng ba loại nhật ký tương ứng:
| Loại nhật ký | Ghi gì |
|---|---|
| Connection log | Các lần kết nối và ngắt kết nối |
| User log | Thay đổi về định nghĩa người dùng |
| User activity log | Từng câu truy vấn đã chạy, kèm người dùng đã chạy nó |
Loại thứ ba là chỗ quyết định — nó là nhật ký duy nhất trong hệ sinh thái AWS ghi lại nội dung truy vấn SQL cùng danh tính người thực hiện.
Nhật ký được ghi vào S3 hoặc CloudWatch Logs, và giữ lâu tuỳ bạn cấu hình.
Lưu ý khi triển khai: user activity log phải bật riêng bằng cách đặt tham số enable_user_activity_logging = true trong parameter group — bật audit logging thôi thì chưa có nó.
Vì sao các phương án khác sai
-
A. Bật audit trail cho Redshift trên CloudTrail — CloudTrail ghi lời gọi API tới dịch vụ Redshift (tạo cụm, sửa cấu hình, chụp snapshot); nó không thấy được câu SQL chạy bên trong cơ sở dữ liệu. Đây là phương án nhiễu chính, và đó là ranh giới rất đáng nhớ:
CloudTrail Redshift audit logging Ghi Thao tác quản lý cụm Truy vấn bên trong cơ sở dữ liệu -
B. Bật audit metrics trên CloudWatch — CloudWatch lưu chỉ số dạng số, không lưu nội dung truy vấn.
-
D. Tải audit report từ AWS Config — Config theo dõi cấu hình tài nguyên, không phải hoạt động bên trong cơ sở dữ liệu.
A news network uses Amazon Simple Storage Service (Amazon S3) to aggregate the raw video footage from its reporting teams across the US. The news network has recently expanded into new geographies in Europe and Asia. The technical teams at the overseas branch offices have reported huge delays in uploading large video files to the destination Amazon S3 bucket.
Which of the following are the MOST cost-effective options to improve the file upload speed into Amazon S3 (Select two)
-
A
Use AWS Global Accelerator for faster file uploads into the destination Amazon S3 bucket
-
B
Use Amazon S3 Transfer Acceleration (Amazon S3TA) to enable faster file uploads into the destination S3 bucket
-
C
Use multipart uploads for faster file uploads into the destination Amazon S3 bucket
-
D
Create multiple AWS Direct Connect connections between the AWS Cloud and branch offices in Europe and Asia. Use the direct connect connections for faster file uploads into Amazon S3
-
E
Create multiple AWS Site-to-Site VPN connections between the AWS Cloud and branch offices in Europe and Asia. Use these VPN connections for faster file uploads into Amazon S3
Xem giải thích
Đáp án
B và C — dùng S3 Transfer Acceleration và dùng multipart upload
Vì sao đúng
Vấn đề là tải tệp video lớn từ châu Âu và châu Á lên bucket đặt ở Mỹ. Hai biện pháp này giải hai mặt khác nhau và kết hợp được với nhau:
- B. S3 Transfer Acceleration — dữ liệu đi vào edge location gần nhất rồi chạy phần lớn quãng đường trên mạng xương sống của AWS thay vì Internet công cộng. Càng xa càng hiệu quả, đúng tình huống chi nhánh ở châu Âu và châu Á.
- C. Multipart upload — chia tệp thành nhiều phần tải song song, và thử lại từng phần khi lỗi thay vì làm lại cả tệp. Với video lớn, đây là biện pháp bắt buộc (tệp trên 5 GB phải dùng multipart).
Cả hai đều không đòi hạ tầng mới, nên đáp ứng tiêu chí "tiết kiệm nhất".
Vì sao các phương án khác sai
- A. Dùng AWS Global Accelerator — nó tăng tốc lưu lượng tới ứng dụng ở tầng 4 (ELB, EC2), không hỗ trợ S3 làm endpoint. Đây là phương án nhiễu chính vì nó cũng dùng mạng biên của AWS.
- D. Dựng nhiều kết nối Direct Connect tới các chi nhánh — cho băng thông ổn định nhưng đắt và mất hàng tuần tới hàng tháng để lắp đặt; ngược hẳn tiêu chí tiết kiệm.
- E. Dựng nhiều kết nối Site-to-Site VPN — chạy qua chính đường Internet đang chậm, nên không cải thiện gì.
A niche social media application allows users to connect with sports athletes. As a data engineer, you've designed the architecture of the application to be fully serverless using Amazon API Gateway and AWS Lambda. The backend uses an Amazon DynamoDB table. Some of the star athletes using the application are highly popular, and therefore Amazon DynamoDB has increased the read capacity units (RCUs). Still, the application is experiencing a hot partition problem.
What can you do to improve the performance of Amazon DynamoDB and eliminate the hot partition problem without a lot of application refactoring?
-
A
Use Amazon DynamoDB Global Tables
-
B
Use Amazon DynamoDB Streams
-
C
Use Amazon DynamoDB DAX
-
D
Use Amazon ElastiCache
Xem giải thích
Đáp án
C — Dùng Amazon DynamoDB DAX
Vì sao đúng
Vấn đề trong đề là hot partition: một số vận động viên nổi tiếng bị đọc nhiều gấp bội, dồn tải lên đúng partition chứa họ. Tăng RCU không giải quyết được vì hạn mức bị chia theo partition — partition nóng vẫn bị nghẽn trong khi các partition khác nhàn rỗi.
DAX giải đúng chỗ đó: nó là lớp cache trong bộ nhớ đặt trước DynamoDB, nên các lượt đọc lặp lại cho cùng một mục được phục vụ từ cache và không chạm tới bảng.
Hai lý do nó phù hợp với ràng buộc "không phải viết lại nhiều mã":
- Tương thích API với DynamoDB — đổi endpoint trong SDK là xong, không phải viết logic cache.
- Vận động viên càng nổi tiếng thì tỷ lệ trúng cache càng cao, nên nó tự nhắm đúng vào phần nóng nhất.
Vì sao các phương án khác sai
- D. Dùng Amazon ElastiCache — cũng là cache trong bộ nhớ và cũng giải được vấn đề, nhưng bạn phải tự viết toàn bộ logic cache trong ứng dụng: kiểm tra cache trước, ghi vào cache sau, xử lý việc làm mới và vô hiệu hoá. Đề nói rõ không muốn refactor nhiều. Đây là phương án nhiễu chính.
- A. Dùng DynamoDB Global Tables — nhân bản bảng sang Region khác; nó giải bài toán địa lý và khôi phục thảm hoạ, không giải bài toán hot partition trong một Region.
- B. Dùng DynamoDB Streams — ghi lại luồng thay đổi của bảng để xử lý phía sau; không liên quan tới hiệu năng đọc.
An investment firm uses AWS Cloud for its IT infrastructure. The firm runs several investment-related risk-simulation applications and develops complex algorithms to simulate multiple scenarios to build a financial roadmap for its customers. The firm stores customers' financial data on Amazon S3. The data engineering team needs to implement an archival solution based on Amazon S3 Glacier to enforce regulatory and compliance controls on data access.
Which of the following solutions would you suggest for this use case?
-
A
Use S3 Glacier vault to store the sensitive archived data and then use a vault lock policy to enforce compliance controls
-
B
Use S3 Glacier to store the sensitive archived data and then use an S3 lifecycle policy to enforce compliance controls
-
C
Use S3 Glacier vault to store the sensitive archived data and then use an S3 Access Control List to enforce compliance controls
-
D
Use S3 Glacier to store the sensitive archived data and then use an S3 Access Control List to enforce compliance controls
Xem giải thích
Đáp án
*A — Dùng S3 Glacier vault để lưu dữ liệu nhạy cảm, rồi áp vault lock policy
Vì sao đúng
Với ngành dịch vụ tài chính, yêu cầu tuân thủ về lưu trữ dữ liệu khách hàng thường là bất biến — dữ liệu không được sửa hay xoá trong một khoảng thời gian quy định, kể cả bởi quản trị viên.
Vault Lock là cơ chế duy nhất trong danh sách cung cấp mức bảo đảm đó. Sau khi hoàn tất khoá, chính sách trở nên không thể thay đổi hay huỷ bỏ, kể cả bởi tài khoản gốc.
Quy trình hai bước có chủ đích:
1. Khởi tạo lock → chính sách "in-progress", có 24 giờ để kiểm thử kỹ
2. Hoàn tất lock → VĨNH VIỄN — đây là lý do phải có bước kiểm thử trước
Ví dụ chính sách điển hình cho ngành tài chính: cấm xoá bản ghi trong 7 năm (WORM).
Vì sao các phương án khác sai
- *B. Dùng Glacier kèm S3 lifecycle policy — lifecycle policy quản lý vòng đời lưu trữ (chuyển tầng, xoá theo tuổi); nó không kiểm soát truy cập và sửa được bất cứ lúc nào. Đây là phương án nhiễu chính.
- C và *D. Dùng Access Control List — ACL là cơ chế phân quyền cũ và thô, chỉ khai được vài quyền cơ bản, và cũng sửa được tự do nên không đạt yêu cầu bất biến.
A company uses an Amazon DynamoDB table in provisioned capacity mode to store data for an application that experiences predictable demand. Activity spikes sharply every Monday morning, while weekends see very low usage. The company needs a solution that ensures consistent application performance during these peak periods in a cost-effective manner.
What is the best solution to meet these requirements?
-
A
Update the capacity mode from provisioned to on-demand so that the table's capacity automatically adjusts to the traffic variations
-
B
Add Global Secondary Index as well as Local Secondary Index to the DynamoDB table to ensure maximum performance
-
C
Implement AWS Application Auto Scaling to adjust provisioned capacity to meet the maximum demand seen in the last 12 months
-
D
Implement AWS Application Auto Scaling to adjust provisioned capacity according to usage patterns. Set higher capacity during anticipated peak times and reduce it during periods of low activity
Xem giải thích
Đáp án
D — Dùng Application Auto Scaling điều chỉnh năng lực đã cấp phát theo mẫu sử dụng: đặt cao vào giờ cao điểm dự kiến và giảm xuống lúc thấp điểm
Vì sao đúng
Chi tiết quyết định trong đề: nhu cầu đoán trước được — tăng vọt sáng thứ Hai, rất thấp vào cuối tuần.
Application Auto Scaling cho DynamoDB hỗ trợ scheduled scaling: bạn khai trước lịch tăng giảm năng lực. Nhờ vậy năng lực đã sẵn sàng trước khi tải tới, thay vì phản ứng sau khi đã bị nghẽn.
Đây là điểm quan trọng: co giãn phản ứng (theo chỉ số) luôn có độ trễ — nó chỉ hành động sau khi tải đã tăng, và trong lúc chờ thì yêu cầu bị throttle. Với đợt tăng dốc như sáng thứ Hai, độ trễ đó là vấn đề thật.
Kết hợp cả hai (scheduled cho phần đoán trước + target tracking cho phần dao động) là cách làm tốt nhất trong thực tế.
Vì sao các phương án khác sai
- A. Chuyển sang chế độ on-demand — bảo đảm hiệu năng và không phải quản lý gì, nhưng đắt hơn đáng kể khi tải đoán trước được. On-demand đáng dùng khi tải không đoán được. Đây là phương án nhiễu chính.
- C. Auto Scaling đặt theo mức đỉnh cao nhất trong 12 tháng qua — nghĩa là trả tiền cho mức đỉnh suốt cả tuần, kể cả cuối tuần gần như không ai dùng; ngược hẳn tiêu chí tiết kiệm.
- B. Thêm Global Secondary Index và Local Secondary Index — chỉ mục dùng để truy vấn theo thuộc tính khác, không liên quan tới năng lực; GSI còn tiêu thụ năng lực riêng, làm chi phí tăng thêm.
A company has established an ETL (extract, transform, and load) data pipeline using AWS Glue. A data engineer is tasked with crawling a table from Microsoft SQL Server and must manage the pipeline to extract, transform, and load the crawled data into an Amazon S3 bucket.
Which AWS service or feature would facilitate these tasks most cost-effectively?
-
A
AWS Glue DataBrew
-
B
AWS Glue workflows
-
C
AWS Glue Studio
-
D
AWS Step Functions
Xem giải thích
Đáp án
B — AWS Glue workflows
Vì sao đúng
Đề mô tả một quy trình hoàn toàn nằm trong Glue:
Crawler (quét bảng SQL Server, ghi lược đồ vào Data Catalog)
▼
Glue ETL job (trích, biến đổi)
▼
Ghi kết quả vào bucket S3
Glue workflow là công cụ điều phối dựng sẵn trong Glue cho đúng chuỗi crawler và job như vậy. Nó quản lý thứ tự, phụ thuộc giữa các bước, và cho theo dõi toàn bộ luồng như một đơn vị.
Về chi phí — tiêu chí của đề — nó thắng vì bản thân workflow không tính phí; bạn chỉ trả cho crawler và job chạy thật.
Vì sao các phương án khác sai
- D. AWS Step Functions — điều phối được và mạnh hơn nhiều (gọi được cả dịch vụ ngoài Glue), nhưng ở đây mọi bước đều nằm trong Glue, nên thêm một dịch vụ nữa là thừa và tính phí theo số bước chuyển trạng thái. Đây là phương án nhiễu chính.
- C. AWS Glue Studio — giao diện trực quan để soạn ETL job; nó là nơi bạn viết job, không phải nơi điều phối chúng.
- A. AWS Glue DataBrew — công cụ làm sạch và chuẩn hoá dữ liệu bằng giao diện; nó không quản lý crawler hay điều phối quy trình.
An IT company is revamping its ETL process and wants to transfer data from Amazon S3 to an Amazon Redshift cluster. The company wants to load the data in bulk onto Amazon Redshift using the best possible high-performance solution.
As an AWS Certified Data Engineer Associate, which of the following steps would you recommend for this requirement? (Select two)
-
A
When loading multiple files into a single table, use a single S3DistCp command
-
B
When loading multiple files into a single table, use multiple COPY commands
-
C
Leverage temporary staging tables during the data loading process
-
D
Use Amazon Redshift Spectrum to upload data from multiple files in Amazon S3 into a single Amazon Redshift table
-
E
When loading multiple files into a single table, use a single COPY command
Xem giải thích
Đáp án
C và E — dùng bảng tạm (staging table) trong quá trình nạp, và dùng một câu COPY duy nhất khi nạp nhiều tệp vào một bảng
Vì sao đúng
- E. Một câu
COPYduy nhất — đây là khuyến nghị quan trọng nhất về hiệu năng nạp dữ liệu vào Redshift. Một câuCOPYtrỏ tới tiền tố chứa nhiều tệp sẽ được chia đều cho tất cả các slice trong cụm và nạp song song. Chia thành nhiều câuCOPYthì chúng chạy tuần tự, và mỗi câu chỉ dùng được một phần năng lực. - C. Dùng bảng tạm — nạp vào bảng tạm rồi mới ghép vào bảng chính. Cách này cho phép thực hiện upsert (
MERGE) đúng cách, giữ bảng chính luôn ở trạng thái nhất quán, và cô lập lỗi nạp khỏi dữ liệu đang phục vụ.
Vì sao các phương án khác sai
- B. Dùng nhiều câu
COPYkhi nạp nhiều tệp vào một bảng — mâu thuẫn trực tiếp với E, và là phản thực hành mà tài liệu Redshift cảnh báo rõ. Đây là phương án nhiễu chính. - D. Dùng Redshift Spectrum để nạp dữ liệu từ S3 vào bảng Redshift — hiểu sai vai trò của Spectrum: nó truy vấn dữ liệu nằm nguyên trên S3, không nạp dữ liệu vào bảng.
- A. Dùng một câu
S3DistCp— S3DistCp là công cụ sao chép dữ liệu trong hệ sinh thái EMR; nó không nạp dữ liệu vào Redshift.
An IT company has recently migrated to AWS and the data engineering team is configuring security groups for the two-tier application with public web servers and private database servers. The team wants to understand the allowed configuration options for an inbound rule for a security group.
Which of the following would you identify as an INVALID option for setting up such a configuration?
-
A
You can use a range of IP addresses in CIDR block notation as the custom source for the inbound rule
-
B
You can use an Internet Gateway ID as the custom source for the inbound rule
-
C
You can use a security group as the custom source for the inbound rule
-
D
You can use an IP address as the custom source for the inbound rule
Xem giải thích
Đáp án
B — Dùng Internet Gateway ID làm nguồn tuỳ chỉnh cho luật vào — đây là lựa chọn KHÔNG hợp lệ
Vì sao đây là câu trả lời
Đề hỏi tìm cấu hình không hợp lệ, và nguồn của một luật security group chỉ nhận được bốn loại giá trị:
| Loại nguồn hợp lệ | Ví dụ |
|---|---|
| Một địa chỉ IP | 203.0.113.5/32 |
| Dải IP dạng CIDR | 10.0.0.0/16 |
| Một security group khác | sg-0a1b2c3d |
| Prefix list | pl-12345678 (dùng cho dịch vụ AWS) |
Internet Gateway không nằm trong danh sách, và điều đó hợp lý về mặt kiến trúc: internet gateway là thành phần định tuyến, nó không phải nguồn gốc của lưu lượng. Gói tin đi qua nó vẫn mang địa chỉ IP nguồn thật của người gửi — và đó mới là thứ security group đánh giá.
Vì sao các phương án khác đều hợp lệ
- A. Dải IP dạng CIDR — cách khai phổ biến nhất.
- D. Một địa chỉ IP — thực chất là CIDR với mặt nạ
/32. - C. Một security group khác — đây là cách khai tốt nhất cho kiến trúc hai tầng như trong đề: security group của tầng cơ sở dữ liệu khai nguồn là security group của tầng web. Ưu điểm là nó tự thích ứng — máy web mới thêm vào tự được phép, không phải sửa luật.
A company runs an analytics workload with heavy reads and writes through the workload lifecycle. The data analytics team at the company is interested in using Amazon S3 as the data lake to support this workload. The team has hired you to advise them on the S3 data consistency model.
Which of the following statements would you identify as correct?
-
A
Amazon S3 is strongly consistent for all GET and PUT operations and eventually consistent for LIST operations
-
B
Amazon S3 is strongly consistent for all GET operations and eventually consistent for PUT and LIST operations
-
C
Amazon S3 is strongly consistent for all GET, PUT and LIST operations and eventually consistent for operations that need metadata information
-
D
Amazon S3 is strongly consistent for all GET, PUT and LIST operations
Xem giải thích
Đáp án
D — Amazon S3 nhất quán mạnh (strongly consistent) cho tất cả thao tác GET, PUT và LIST
Vì sao đúng
Đây là điểm mà rất nhiều tài liệu cũ ghi sai, nên đáng nhớ mốc thay đổi:
Từ tháng 12 năm 2020, Amazon S3 cung cấp nhất quán mạnh (strong read-after-write consistency) cho mọi thao tác GET, PUT, LIST, cùng các thao tác trên siêu dữ liệu như ACL và tag.
Nghĩa là: ghi một đối tượng xong thì lượt đọc ngay sau đó luôn thấy phiên bản mới nhất. Không có cửa sổ chờ, không có khả năng đọc trúng dữ liệu cũ.
Ba điều đáng chú ý:
- Tính năng này tự động, miễn phí, và không phải bật gì.
- Không ảnh hưởng tới hiệu năng hay giá.
- Nó rất quan trọng với workload phân tích: một job ETL ghi tệp xong thì job kế tiếp chắc chắn đọc được — trước năm 2020, các đường ống dữ liệu phải tự cài cơ chế chờ và thử lại để tránh chuyện này.
Vì sao các phương án khác sai
Cả ba đều mô tả mô hình cũ trước năm 2020, khi S3 chỉ nhất quán mạnh cho ghi đối tượng mới còn LIST và ghi đè thì nhất quán cuối cùng:
- A — nói LIST là nhất quán cuối cùng.
- B — nói PUT và LIST là nhất quán cuối cùng.
- C — nói các thao tác siêu dữ liệu là nhất quán cuối cùng; cũng sai, siêu dữ liệu cũng nhất quán mạnh.