Ngân hàng đề — AWS Certified Data Engineer Associate

Tìm thấy 867 câu.

Câu 231 Data Security and Governance

A company wants to monitor and analyze API activity within their AWS environment to detect unauthorized access attempts. They also want to ensure compliance with security policies by keeping track of configuration changes to resources over time. The company has enabled AWS CloudTrail to log all API activity. Which additional service should they configure to ensure they are also tracking configuration changes to AWS resources?

  1. A

    Amazon CloudWatch

  2. B

    AWS Trusted Advisor

  3. C

    Amazon GuardDuty

  4. D

    AWS Config

Xem giải thích

Đáp án

D — AWS Config

Vì sao đúng

Đề có hai vế và vế quyết định là theo dõi để chứng minh tuân thủ. Config chụp lại trạng thái cấu hình của từng tài nguyên theo thời gian, tự đánh giá theo các quy tắc bạn đặt, và giữ dòng thời gian thay đổi — đó chính là bằng chứng khi bị kiểm toán. Trong bốn phương án, chỉ nó làm việc này.

Vì sao các phương án khác sai

  • A. CloudWatch — chỉ số và log vận hành, không theo dõi cấu hình.
  • B. Trusted Advisor — khuyến nghị chung, không phải hệ thống ghi nhận tuân thủ liên tục.
  • C. GuardDuty — phát hiện mối đe doạ dựa trên hành vi bất thường, hữu ích nhưng không giữ lịch sử cấu hình.

Ghi chú

Nếu chỉ cần nhật ký thô của mọi lời gọi API thì công cụ đúng là CloudTrail — nó không nằm trong bốn phương án ở đây, và trên thực tế Config dựa vào chính CloudTrail để biết có gì đổi.

Câu 232 Data Operations and Support

An e-commerce company wants to build a real-time analytics dashboard using AWS OpenSearch to monitor customer behavior and sales trends. The dashboard should provide visualizations and live updates using stored OpenSearch data. Which tool should the company use to achieve this?

  1. A

    AWS Glue DataBrew

  2. B

    AWS CloudWatch

  3. C

    Amazon QuickSight

  4. D

    OpenSearch Dashboards

Xem giải thích

Đáp án

D — OpenSearch Dashboards

Vì sao đúng

Dashboards là công cụ trực quan hoá đi kèm sẵn trong mỗi domain OpenSearch, không phải cài hay nối gì thêm. Nó truy vấn thẳng chỉ mục nên biểu đồ cập nhật theo dữ liệu vừa được đánh chỉ mục — đúng nghĩa "cập nhật trực tiếp" mà đề cần.

Vì sao các phương án khác sai

  • A. Glue DataBrew — làm sạch và chuẩn bị dữ liệu, không vẽ bảng điều khiển.
  • B. CloudWatch — bảng điều khiển cho chỉ số hạ tầng, không đọc chỉ mục OpenSearch.
  • C. QuickSight — công cụ BI tổng quát, nối được tới OpenSearch nhưng thêm một tầng nữa và thường làm việc trên dữ liệu đã nạp vào SPICE, nên không "trực tiếp" bằng.
Câu 233 Data Ingestion and Transformation

A data engineer at a retail company needs to clean and transform a large dataset containing product sales data before performing analytics. The transformations required are non-technical and need to be completed quickly by business analysts who are not proficient in writing code. Additionally, the data must be profiled for anomalies such as missing values and outliers. Which AWS Glue service should the company use to meet these requirements?

  1. A

    AWS Glue ETL Jobs

  2. B

    AWS Glue Crawlers

  3. C

    AWS Glue DataBrew

  4. D

    Amazon Athena

Xem giải thích

Đáp án

C — AWS Glue DataBrew

Vì sao đúng

Điều kiện quyết định trong đề là các phép biến đổi không mang tính kỹ thuật và người làm không viết mã. DataBrew cho chọn trong hơn 250 phép biến đổi bằng chuột, xem trước kết quả trên mẫu dữ liệu trước khi áp, và lưu các bước thành công thức chạy lại được khi có dữ liệu mới.

Vì sao các phương án khác sai

  • A. Glue ETL Jobs — phải viết Spark bằng Python hoặc Scala.
  • B. Glue Crawlers — chỉ suy ra lược đồ, không biến đổi gì.
  • D. Amazon Athena — truy vấn bằng SQL; vẫn là viết mã, và không lưu thành quy trình làm sạch chạy lại được.
Câu 234 Chọn nhiều đáp án Data Ingestion and Transformation

A company is using AWS Glue DataBrew to clean and structure data from an Amazon S3 bucket before loading it into an Amazon Redshift data warehouse for analysis. The data contains combined fields such as city and zip code in a single column. The company also wants to automate this process on a daily schedule. Which steps should the data engineer take to meet these requirements? (Choose TWO.)

  1. A

    Create a DataBrew job to execute the transformation recipe and schedule it to run daily.

  2. B

    Write a SQL query in Amazon Redshift to process the data after loading it into the warehouse.

  3. C

    Manually write a Python script to split the column and upload it to S3 for DataBrew to process.

  4. D

    Use Amazon Athena to query the data and manually split the city and zip code in the query.

  5. E

    Use DataBrew’s "Split Column by Delimiter" transformation to separate the city and zip code.

Xem giải thích

Đáp án

A và E

Vì sao đúng

Hai phương án này là hai nửa của cùng một lời giải trong DataBrew:

  • E. "Split Column by Delimiter" tách trường ghép sẵn thành các cột riêng, đúng một bước và không phải viết mã.
  • A. Tạo job chạy công thức và hẹn giờ hằng ngày biến việc làm một lần thành quy trình lặp lại — không có bước này thì mỗi ngày lại phải ngồi làm tay.

Vì sao các phương án khác sai

  • B. Viết SQL trong Redshift sau khi nạp — đưa dữ liệu bẩn vào kho rồi mới dọn, ngược thứ tự.
  • C. Viết script Python tách rồi tải lên — chính là thứ DataBrew sinh ra để khỏi phải làm.
  • D. Tách bằng tay trong truy vấn Athena — mỗi lần truy vấn lại tách lại, và không sửa được dữ liệu nguồn.
Câu 235 Data Store Management

A data engineering team wants to query large amounts of structured and unstructured data stored in Amazon S3 without loading it into Amazon Redshift. The team needs to run SQL queries on this data and join it with existing Redshift tables. Which approach will meet these requirements?

  1. A

    Use AWS Glue to load the S3 data into Redshift for querying.

  2. B

    Use Amazon Athena to run SQL queries directly on the S3 data and join the results in Redshift.

  3. C

    Create a Federated Query to reference the S3 data.

  4. D

    Use Redshift Spectrum to define external tables on the S3 data.

Xem giải thích

Đáp án

D — Dùng Redshift Spectrum khai external table trên dữ liệu S3

Vì sao đúng

Spectrum cho Redshift đọc thẳng tệp trên S3 qua bảng ngoài, không cần nạp vào cụm, và ghép được với bảng nội bộ trong cùng một câu truy vấn. Phần quét dữ liệu chạy trên tầng tính toán riêng của Spectrum nên không chiếm tài nguyên của cụm.

Vì sao các phương án khác sai

  • A. Glue nạp vào Redshift — chính là "nạp vào Redshift", thứ đề nói không muốn.
  • B. Athena rồi ghép kết quả trong Redshift — hai hệ thống rời nhau, phải tự chuyển kết quả qua lại; không ghép trực tiếp được.
  • C. Federated Query — dành cho CSDL quan hệ bên ngoài như RDS PostgreSQL, không dùng cho tệp trên S3.
Câu 236 Chọn nhiều đáp án Data Store Management

A company is using Amazon EBS volumes to store critical application data for EC2 instances. They need to ensure high availability, durability, and efficient data management across different regions for disaster recovery. Which TWO actions should the company implement to meet these requirements? (Choose Two)

  1. A

    Increase the volume size to enhance performance and availability across regions.

  2. B

    Take incremental snapshots of EBS volumes to S3 for durability and backup.

  3. C

    Enable multi-attach to allow a single EBS volume to be mounted on multiple instances in different regions.

  4. D

    Enable EBS encryption to enhance security for cross-region data transfers.

  5. E

    Use EBS snapshots to copy volumes to other regions for disaster recovery.

Xem giải thích

Đáp án

B và E — chụp snapshot tăng dần, và chép snapshot sang vùng khác

Vì sao đúng

  • B. Snapshot tăng dần — chỉ những khối thay đổi kể từ lần chụp trước mới bị tính tiền, và snapshot nằm trên S3 do AWS quản lý nên bền hơn hẳn volume đơn lẻ.
  • E. Chép snapshot sang vùng khác — EBS và snapshot vốn bó trong một vùng; muốn khôi phục được khi mất cả vùng thì phải chủ động chép sang vùng thứ hai.

Hai việc này ghép thành đúng một kế hoạch khôi phục thảm hoạ.

Vì sao các phương án khác sai

  • A. Tăng dung lượng volume — không liên quan gì tới độ bền hay khả năng dùng ở vùng khác.
  • C. Multi-attach qua nhiều vùng — multi-attach chỉ hoạt động trong cùng một vùng sẵn sàng, không bao giờ xuyên vùng.
  • D. Bật mã hoá EBS — cần cho bảo mật nhưng không làm dữ liệu bền hơn hay sẵn sàng hơn.
Câu 237 Data Store Management

A data engineer is designing an AWS OpenSearch domain for a financial company that handles petabytes of data across different departments. To optimize both performance and fault tolerance, which combination of components should the engineer implement in OpenSearch?

  1. A

    Multiple data nodes with primary and replica shards

  2. B

    Multiple master nodes and no data nodes

  3. C

    A single data node with no replica shards

  4. D

    A single master node with multiple replica shards

Xem giải thích

Đáp án

A — Nhiều data node, có cả primary shard và replica shard

Vì sao đúng

Với dữ liệu cỡ petabyte thì phải có nhiều data node để chia cả dung lượng lẫn tải truy vấn. Primary shard rải dữ liệu qua các node đó; replica đặt bản sao trên node khác nên vừa chịu được mất node (chống lỗi) vừa gánh thêm truy vấn đọc (hiệu năng). Đúng hai mục tiêu đề nêu.

Vì sao các phương án khác sai

  • B. Nhiều master node, không có data node — master chỉ quản lý trạng thái cụm; không có data node thì chẳng có chỗ nào chứa dữ liệu.
  • C. Một data node, không replica — mất node đó là mất tất cả, và không mở rộng nổi tới petabyte.
  • D. Một master node với nhiều replica — một master là một điểm hỏng duy nhất; thực tế nên có ba master node chuyên trách.
Câu 238 Data Security and Governance

A company is setting up Amazon QuickSight for their business intelligence needs. They need to ensure that QuickSight can access their on-premises database securely, as the database cannot be moved to the cloud due to compliance regulations. Which solution will allow QuickSight to access the on-premises data without transferring it to AWS?

  1. A

    AWS Direct Connect

  2. B

    QuickSight Q

  3. C

    Amazon Athena

  4. D

    VPC Peering

Xem giải thích

Đáp án

A — AWS Direct Connect

Vì sao đúng

Đề yêu cầu QuickSight nối tới CSDL tại chỗ một cách an toàn, và CSDL đó không được chuyển lên đám mây. Direct Connect dựng đường truyền riêng giữa trung tâm dữ liệu của bạn và AWS — lưu lượng không đi qua Internet công cộng, băng thông ổn định và độ trễ đều.

Vì sao các phương án khác sai

  • B. QuickSight Q — tính năng hỏi bằng ngôn ngữ thường, không liên quan tới kết nối mạng.
  • C. Amazon Athena — truy vấn dữ liệu trên S3, không nối tới CSDL tại chỗ.
  • D. VPC Peering — nối hai VPC trong AWS với nhau; mạng tại chỗ không phải VPC nên không peering được.
Câu 239 Data Operations and Support

A company is using Amazon EC2 instances to run a high-performance analytics application that requires low-latency access to data. The application processes large datasets and needs high throughput during batch jobs but does not require persistent storage after the EC2 instances are terminated. The company wants to minimize costs while ensuring optimal performance. Which storage solution should they choose?

  1. A

    Amazon EBS Provisioned IOPS (io2) volumes.

  2. B

    Amazon S3 Standard with S3 Transfer Acceleration.

  3. C

    Amazon EBS General Purpose SSD (gp3) volumes.

  4. D

    EC2 Instance Store.

Xem giải thích

Đáp án

D — EC2 Instance Store

Vì sao đúng

Instance store là ổ NVMe gắn thẳng vào máy vật lý đang chạy instance, không đi qua mạng như EBS. Vì vậy nó cho độ trễ thấp nhất và thông lượng cao nhất trong các lựa chọn — đúng thứ ứng dụng phân tích hiệu năng cao cần khi xử lý bộ dữ liệu lớn.

Đánh đổi phải biết: dữ liệu mất khi instance dừng hoặc bị huỷ, nên chỉ dùng cho dữ liệu tạm, bộ đệm hoặc phần tính toán trung gian — dữ liệu cần giữ vẫn phải nằm ở EBS hoặc S3.

Vì sao các phương án khác sai

  • A. io2 — nhanh và bền, nhưng vẫn là ổ nối qua mạng nên độ trễ cao hơn ổ cục bộ.
  • B. S3 kèm Transfer Acceleration — kho đối tượng, độ trễ tính bằng mili giây, không phải ổ khối cho tính toán nóng.
  • C. gp3 — cân bằng và rẻ, nhưng thông lượng thấp hơn instance store rõ rệt.
Câu 240 Data Security and Governance

An e-commerce platform uses Amazon MemoryDB for Redis to store session data and shopping cart information for users. The company must ensure that the data is both highly available and encrypted. They are also concerned about minimizing any potential data loss in the event of a failure. Which of the following configurations should the company implement to meet these requirements?

  1. A

    Use Redis replication and manually back up the data to an Amazon S3 bucket.

  2. B

    Configure Redis clustering with encryption enabled at the node level.

  3. C

    Enable Multi-AZ and use Redis persistence (RDB or AOF) for regular snapshots.

  4. D

    Enable Multi-AZ with automatic failover and configure encryption at rest using AWS KMS.

Xem giải thích

Đáp án

D — Bật Multi-AZ có tự chuyển đổi khi hỏng, và mã hoá khi lưu bằng AWS KMS

Vì sao đúng

Đề đặt đúng hai yêu cầu và phương án này trả lời cả hai bằng tính năng dựng sẵn: Multi-AZ đặt replica ở vùng sẵn sàng khác và tự đưa nó lên thay khi node chính hỏng; KMS lo phần mã hoá khi lưu với khoá bạn kiểm soát được. MemoryDB còn ghi vào nhật ký giao dịch phân tán qua nhiều AZ nên dữ liệu phiên và giỏ hàng không mất khi có sự cố.

Vì sao các phương án khác sai

  • A. Nhân bản Redis rồi sao lưu tay lên S3 — thủ công, và mất dữ liệu giữa hai lần sao lưu.
  • B. Clustering với mã hoá ở mức node — clustering chia dữ liệu chứ tự nó không cho tính sẵn sàng, và "mã hoá ở mức node" không phải cách MemoryDB cấu hình.
  • C. Multi-AZ với RDB hoặc AOF — đó là cơ chế lưu bền của Redis tự quản; MemoryDB đã có nhật ký giao dịch riêng, và phương án này thiếu hẳn phần mã hoá.