Ngân hàng đề — AWS Certified Data Engineer Associate

Tìm thấy 867 câu.

Câu 191 Data Operations and Support

A media company is using Amazon Redshift to store and analyze large volumes of log data from their web application. They ingest hundreds of gigabytes of data daily into the Redshift cluster, but they are experiencing performance degradation in their queries due to the growing data volume. The company needs a cost-effective solution to manage storage growth while maintaining high query performance. Which of the following solutions should the data engineer implement to optimize storage and improve query performance?

  1. A

    Use the Amazon Redshift COPY command to load the log data into separate tables, partitioned by date.

  2. B

    Upgrade the Amazon Redshift cluster to use RA3 instances with managed storage and offload older data to Amazon S3 using the UNLOAD command.

  3. C

    Enable Amazon Redshift Concurrency Scaling to automatically add more compute capacity as the query volume increases.

  4. D

    Use Redshift Spectrum to offload old log data to S3 and query it from there when needed.

Xem giải thích

Đáp án

B — Nâng cụm lên RA3 có managed storage và đẩy dữ liệu cũ sang S3

Vì sao đúng

Nút thắt ở đây là dung lượng gắn chặt với số node. RA3 tách tính toán khỏi lưu trữ: dữ liệu nóng nằm trên bộ đệm SSD cục bộ, phần còn lại tự chuyển xuống S3 do Redshift quản lý, và bạn chọn số node theo nhu cầu tính toán chứ không theo dung lượng. Nhờ vậy nạp thêm hàng trăm gigabyte mỗi ngày mà truy vấn không chậm đi.

Vì sao các phương án khác sai

  • A. COPY vào bảng tách theo ngày — giúp được chút ít nhưng không chạm tới nguyên nhân là cụm đã hết chỗ.
  • C. Concurrency Scaling — thêm năng lực khi nhiều truy vấn cùng lúc; ở đây vấn đề là khối lượng dữ liệu, không phải số truy vấn đồng thời.
  • D. Spectrum đẩy log cũ ra S3 — có đỡ, nhưng phải tự quản lý việc chuyển và phân vùng; RA3 làm sẵn việc đó.
Câu 192 Data Store Management

A company uses OpenSearch for indexing and querying application logs. The company is optimizing costs by storing older logs in a lower-cost storage tier while keeping the most recent logs readily accessible. Which combination of storage tiers is the most cost-effective solution?

  1. A

    Hot storage for recent logs, cold storage for older logs

  2. B

    Cold storage for recent logs, ultra-warm storage for older logs

  3. C

    Ultra-warm storage for recent logs, cold storage for older logs

  4. D

    Hot storage for recent logs, ultra-warm storage for older logs

Xem giải thích

Đáp án

D — Hot cho log mới, UltraWarm cho log cũ

Vì sao đúng

UltraWarm lưu dữ liệu trên S3 và dùng bộ đệm để truy vấn, rẻ hơn hot khoảng một bậc độ lớn mà vẫn tìm kiếm được ngay không cần thao tác gì. Log mới thì để trên hot vì còn ghi vào liên tục và hay được tra. Đó là cặp đúng cho yêu cầu "rẻ hơn nhưng vẫn đọc được".

Vì sao các phương án khác sai

  • A. Hot rồi cold — cold rẻ nhất nhưng phải gắn lại mới truy vấn được; nhảy thẳng từ hot sang cold là bỏ mất tầng ở giữa.
  • B và C — đều đặt tầng chậm cho dữ liệu mới và tầng nhanh cho dữ liệu cũ, ngược hoàn toàn với cách người ta thật sự dùng log.
Câu 193 Data Store Management

A company is experiencing rapid growth in its dataset and wants to store the most frequently accessed data on high-performance SSDs, while moving infrequently accessed data to a more cost-effective long-term storage solution. Which Amazon Redshift feature should the company use to manage storage for both hot and cold data?

  1. A

    S3 Lifecycle Management

  2. B

    Auto-scaling compute nodes

  3. C

    DC2 nodes with local SSD storage

  4. D

    Managed Storage with RA3 nodes

Xem giải thích

Đáp án

D — Managed Storage với node RA3

Vì sao đúng

RA3 kèm managed storage tự phân tầng: khối dữ liệu hay đụng tới nằm trên SSD cục bộ của node, phần nguội tự chuyển xuống S3 và kéo về khi cần. Việc phân tầng do Redshift lo, bạn không phải chuyển tay hay đổi truy vấn. Đúng mô tả "dữ liệu nóng trên SSD, dữ liệu nguội xuống nơi rẻ hơn".

Vì sao các phương án khác sai

  • A. S3 Lifecycle — chuyển tầng cho đối tượng trên S3, không biết gì về bảng Redshift.
  • B. Tự co giãn node tính toán — thêm sức tính, không giải quyết chuyện phân tầng lưu trữ.
  • C. DC2 với SSD cục bộ — nhanh nhưng dung lượng gắn cứng với số node; muốn thêm chỗ thì phải mua thêm cả CPU không dùng tới.
Câu 194 Data Ingestion and Transformation

A company is using AWS Lake Formation to set up a secure data lake. They need to ensure that data from both Amazon S3 and on-premise databases is ingested, cataloged, and secured within the lake. What key AWS Lake Formation feature should be used to automate the ingestion and cataloging process?

  1. A

    AWS Resource Access Manager (RAM)

  2. B

    AWS Lake Formation LF-Tags

  3. C

    Amazon EMR

  4. D

    AWS Lake Formation Blueprints

Xem giải thích

Đáp án

D — AWS Lake Formation Blueprints

Vì sao đúng

Blueprint là khuôn dựng sẵn cho việc nạp dữ liệu vào hồ: chỉ tới nguồn, chọn kiểu nạp một lần hay nạp tăng dần, thì Lake Formation tự sinh ra workflow Glue lo cả phần đọc, ghi vào S3 và cập nhật catalog. Có khuôn cho cả CSDL tại chỗ lẫn log trên S3 — đúng hai nguồn đề nêu.

Vì sao các phương án khác sai

  • A. AWS RAM — chia sẻ tài nguyên giữa các tài khoản, không phải cơ chế nạp dữ liệu.
  • B. LF-Tags — nhãn dùng để phân quyền, đứng sau bước nạp chứ không thực hiện việc nạp.
  • C. Amazon EMR — cụm xử lý dữ liệu lớn; làm được nhưng phải tự viết và tự vận hành, không phải tính năng của Lake Formation.
Câu 195 Data Operations and Support

A company wants to streamline patch management and automate operational tasks like running scripts, collecting inventory, and applying security patches on their EC2 instances across multiple AWS Regions. Which AWS service should the company use to manage this with minimal operational overhead?

  1. A

    AWS Systems Manager

  2. B

    AWS CloudFormation

  3. C

    Amazon CloudWatch

  4. D

    AWS Trusted Advisor

Xem giải thích

Đáp án

A — AWS Systems Manager

Vì sao đúng

Systems Manager gom đúng ba việc đề nêu vào một chỗ: Patch Manager vá theo lịch và theo chuẩn tuân thủ, Run Command chạy script trên nhiều máy mà không cần SSH, Inventory thu thập danh mục phần mềm đã cài. Nó làm việc qua agent nên áp được cho nhiều tài khoản và nhiều vùng cùng lúc.

Vì sao các phương án khác sai

  • B. CloudFormation — dựng hạ tầng từ mã; nó tạo ra máy chứ không vận hành máy sau đó.
  • C. CloudWatch — chỉ số, log và cảnh báo; nó cho biết có chuyện gì chứ không tự làm gì trên máy.
  • D. Trusted Advisor — đưa khuyến nghị, không thực thi.
Câu 196 Data Security and Governance

A company is using AWS Config to track changes to their resources and ensure compliance. They also want to integrate Amazon CloudTrail to investigate unauthorized access attempts. How do AWS Config and CloudTrail complement each other in this scenario?

  1. A

    AWS Config automatically reverts any unauthorized changes, while CloudTrail blocks the API calls that trigger non-compliant changes.

  2. B

    AWS Config and CloudTrail both monitor API calls, with Config focusing on network-related calls and CloudTrail focusing on compute-related calls.

  3. C

    AWS Config tracks changes in resource configurations, while CloudTrail logs API calls, providing insights into who made the changes.

  4. D

    AWS Config logs all API calls made to AWS resources, and CloudTrail monitors compliance against security best practices.

Xem giải thích

Đáp án

C — Config theo dõi thay đổi cấu hình, CloudTrail ghi lời gọi API

Vì sao đúng

Hai dịch vụ trả lời hai câu hỏi khác nhau và bổ sung cho nhau:

  • AWS Config trả lời "cấu hình đã đổi thành gì, và có còn đúng chuẩn không" — nó chụp trạng thái tài nguyên theo thời gian nên so được trước và sau.
  • CloudTrail trả lời "ai đã gọi lời gọi nào, lúc nào, từ đâu" — đó là phần truy ra người thực hiện, thứ cần khi điều tra truy cập trái phép.

Ghép lại: Config chỉ ra cái gì đã đổi, CloudTrail chỉ ra ai đã đổi.

Vì sao các phương án khác sai

  • A — không dịch vụ nào tự hoàn nguyên thay đổi hay chặn lời gọi API; muốn vậy phải tự viết bước khắc phục.
  • B — cả hai không cùng giám sát lời gọi API, và Config không phân loại theo "liên quan tới mạng".
  • D — đảo ngược vai trò của hai dịch vụ.
Câu 197 Data Store Management

A data engineer needs to optimize the performance of SQL queries run via Amazon Athena on a large S3 data lake. The data is partitioned by month and region. How can the engineer reduce query time and cost most effectively?

  1. A

    Increase the number of queries to speed up partition selection.

  2. B

    Store the data in a single large file for faster scanning.

  3. C

    Disable query result reuse to ensure each query scans the latest data.

  4. D

    Use partition pruning to eliminate irrelevant partitions during query execution.

Xem giải thích

Đáp án

D — Dùng partition pruning để loại bỏ phân vùng không liên quan

Vì sao đúng

Athena tính tiền và tính thời gian theo lượng dữ liệu quét. Dữ liệu đã phân vùng theo tháng và khu vực, nên khi truy vấn có điều kiện trên đúng hai cột đó, Athena chỉ đọc những thư mục khớp và bỏ qua phần còn lại. Đây là cách giảm cả thời gian lẫn chi phí cùng lúc, và gần như luôn là việc đáng làm đầu tiên.

Vì sao các phương án khác sai

  • A. Chạy nhiều truy vấn hơn — quét nhiều hơn thì tốn hơn, không nhanh hơn.
  • B. Gộp thành một tệp lớn — mất khả năng đọc song song và mất luôn phân vùng; chậm hơn hẳn.
  • C. Tắt dùng lại kết quả — bỏ đi một cơ chế miễn phí giúp truy vấn lặp lại trả về tức thì.
Câu 198 Data Operations and Support

A company uses Amazon QuickSight to create dashboards for business users who are not technically proficient. The company wants users to query data by asking questions in natural language and receive visual answers. Which Amazon QuickSight feature should the company use to meet this requirement?

  1. A

    Dashboards

  2. B

    SPICE

  3. C

    AWS Glue

  4. D

    QuickSight Q

Xem giải thích

Đáp án

D — QuickSight Q

Vì sao đúng

Q cho người dùng gõ câu hỏi bằng ngôn ngữ thường rồi tự dựng biểu đồ trả lời. Nó dựa trên một "topic" mà người quản trị chuẩn bị: đặt tên thân thiện cho các trường, khai từ đồng nghĩa, chỉ rõ đâu là số đo đâu là chiều. Đúng thứ đề cần cho người dùng không rành kỹ thuật.

Vì sao các phương án khác sai

  • A. Dashboards — báo cáo dựng sẵn; người xem chỉ lọc trong khuôn có sẵn chứ không hỏi câu mới được.
  • B. SPICE — bộ nhớ đệm trong RAM giúp truy vấn nhanh; đó là chuyện tốc độ, không phải giao diện hỏi.
  • C. AWS Glue — ETL, nằm ngoài QuickSight.
Câu 199 Data Ingestion and Transformation

A retail company is collecting real-time purchase data from its e-commerce platform using Amazon Kinesis. The company wants to ingest and analyze this streaming data in real-time for fraud detection purposes. Which service would best fulfill the requirement for real-time analytics on this data stream?

  1. A

    Amazon Kinesis Producer Library (KPL)

  2. B

    Amazon Kinesis Data Firehose

  3. C

    Amazon Managed Service for Apache Flink

  4. D

    Amazon Kinesis Data Streams

Xem giải thích

Đáp án

C — Amazon Managed Service for Apache Flink

Vì sao đúng

Phát hiện gian lận cần tính toán trên dòng đang chảy: đếm số giao dịch của một thẻ trong năm phút gần nhất, so với thói quen thường ngày, và bắn cảnh báo ngay. Flink giữ được trạng thái theo cửa sổ thời gian nên làm được đúng việc đó; bản managed lo phần cụm và điểm lưu trạng thái.

Vì sao các phương án khác sai

  • A. Kinesis Producer Library — thư viện để đẩy dữ liệu vào luồng, không phân tích gì.
  • B. Kinesis Data Firehose — chuyển dữ liệu tới S3 hay Redshift; tới lúc phân tích được thì giao dịch gian lận đã trôi qua.
  • D. Kinesis Data Streams — là cái ống chứa dữ liệu. Đề nói rõ công ty đang dùng Kinesis rồi, thứ còn thiếu là phần phân tích.
Câu 200 Data Ingestion and Transformation

A company is considering using DynamoDB for a real-time analytics application with rapidly growing data. The data will be diverse, with no consistent schema. The company needs a database that can automatically scale and maintain high availability. Why is DynamoDB a suitable choice for this use case?

  1. A

    DynamoDB requires manual scaling and cannot handle schema-less data, making it unsuitable for diverse data types.

  2. B

    DynamoDB provides a fixed schema, ensuring data consistency across all records.

  3. C

    DynamoDB is a NoSQL database that automatically scales horizontally, handles schema-less data, and offers high availability through data replication across multiple availability zones.

  4. D

    DynamoDB supports SQL queries and complex joins, which will be helpful for analyzing the data.

Xem giải thích

Đáp án

C — DynamoDB là CSDL NoSQL, tự mở rộng theo chiều ngang, chịu được dữ liệu không lược đồ cố định và có tính sẵn sàng cao

Vì sao đúng

Ba yêu cầu của đề khớp đúng ba đặc tính của DynamoDB. Mỗi mục chỉ bắt buộc có khoá chính, còn lại mỗi mục một kiểu — đó là "không lược đồ cố định". Dữ liệu được chia qua nhiều phân vùng nên lớn thêm chỉ là thêm phân vùng. Và mọi lần ghi đều được nhân bản qua ba vùng sẵn sàng.

Vì sao các phương án khác sai

  • A — sai thẳng: DynamoDB co giãn tự động ở chế độ on-demand và xử lý tốt dữ liệu không đồng nhất.
  • B — sai: nó không có lược đồ cố định, đó chính là điểm khác biệt so với CSDL quan hệ.
  • D — sai: không có JOIN, và ngôn ngữ PartiQL chỉ giống SQL về cú pháp chứ không làm phép ghép bảng phức tạp.