Ngân hàng đề — AWS Certified Data Engineer Associate

Tìm thấy 867 câu.

Câu 281 Data Store Management

Which of the following is a key difference between DynamoDB and a traditional relational database, such as Amazon RDS, when it comes to handling large-scale traffic and dynamically changing data?

  1. A

    Both DynamoDB and RDS can perform SQL-like joins and aggregations on the data.

  2. B

    DynamoDB scales horizontally by distributing data across multiple nodes, while RDS scales vertically by upgrading the existing server.

  3. C

    RDS supports schema-less data, while DynamoDB requires a fixed schema.

  4. D

    DynamoDB requires vertical scaling, while RDS can scale horizontally.

Xem giải thích

Đáp án

B — DynamoDB mở rộng theo chiều ngang bằng cách chia dữ liệu qua nhiều node, còn RDS mở rộng theo chiều dọc

Vì sao đúng

Đây là khác biệt gốc rễ giữa hai loại. DynamoDB băm khoá phân vùng để rải dữ liệu qua nhiều phân vùng; muốn chịu tải gấp mười thì thêm phân vùng, và việc đó tự động. RDS chủ yếu tăng sức bằng cách nâng cấu hình máy — thêm CPU và RAM cho instance — nên luôn có trần là cỡ máy lớn nhất còn bán. Read replica đỡ được phần đọc, nhưng phần ghi vẫn dồn về một máy chính.

Vì sao các phương án khác sai

  • A. Cả hai đều làm được JOIN và tổng hợp như SQL — sai; DynamoDB không có JOIN.
  • C. RDS không cần lược đồ còn DynamoDB cần lược đồ cố định — ngược hoàn toàn.
  • D. DynamoDB mở rộng dọc còn RDS mở rộng ngang — cũng ngược hoàn toàn.
Câu 282 Data Security and Governance

A company is using the AWS Well-Architected Tool to evaluate its cloud architecture. They need to ensure their environment follows security best practices, including managing and rotating credentials. The company also requires a solution to automatically rotate database credentials without causing application downtime. Which AWS services should the company use to meet these requirements?

  1. A

    AWS IAM for managing user access and credentials, and AWS Secrets Manager for automatically rotating database credentials.

  2. B

    AWS Well-Architected Tool for evaluating security best practices, and AWS Key Management Service (KMS) for rotating database credentials.

  3. C

    AWS Systems Manager Parameter Store for storing and rotating credentials, and AWS IAM for rotating database credentials.

  4. D

    AWS CloudTrail for auditing access and credential management, and AWS Systems Manager Automation for rotating database credentials.

Xem giải thích

Đáp án

A — IAM quản lý người dùng và quyền, Secrets Manager tự xoay vòng thông tin đăng nhập

Vì sao đúng

Đề có hai vế và mỗi dịch vụ lo một vế. IAM quản ai là ai và được làm gì. Secrets Manager là dịch vụ duy nhất trong danh sách tự xoay vòng thông tin đăng nhập theo lịch — với CSDL như RDS thì nó tự đổi mật khẩu ở cả hai đầu bằng một hàm Lambda dựng sẵn, nên ứng dụng không bao giờ cầm mật khẩu cũ.

Vì sao các phương án khác sai

  • B. Well-Architected Tool — công cụ đánh giá kiến trúc, không quản lý gì cả.
  • C. Parameter Store — cất được tham số và chuỗi bí mật, nhưng không tự xoay vòng; muốn xoay thì phải tự viết.
  • D. CloudTrail — ghi lại việc đã xảy ra, không quản lý hay xoay vòng thông tin đăng nhập.
Câu 283 Data Store Management

A company is using OpenSearch to store customer orders and product data. They want to ensure that even if a node in the OpenSearch cluster fails, no data is lost, and the search functionality remains operational. Which configuration should they implement to meet these requirements?

  1. A

    Use a single node with replica shards enabled.

  2. B

    Configure multiple nodes with only primary shards.

  3. C

    Store all data in cold storage for redundancy.

  4. D

    Configure multiple nodes with primary and replica shards.

Xem giải thích

Đáp án

D — Nhiều node, có cả primary shard và replica shard

Vì sao đúng

Đề đòi hai thứ: mất một node thì không mất dữ liệu, và tìm kiếm vẫn chạy. Replica là bản sao đầy đủ của primary và luôn nằm trên node khác, nên khi node chứa primary hỏng, OpenSearch đưa replica lên thay ngay và cụm tiếp tục phục vụ. Phải có nhiều node thì replica mới có chỗ đặt tách khỏi primary.

Vì sao các phương án khác sai

  • A. Một node có bật replica — OpenSearch không đặt replica cùng node với primary của nó, nên trên cụm một node thì replica luôn ở trạng thái chưa gán, cụm báo vàng.
  • B. Nhiều node chỉ có primary — mất node là mất luôn phần dữ liệu nằm trên đó.
  • C. Để hết ở cold storage — cold là tầng lưu trữ giá rẻ, phải gắn lại mới truy vấn được, và tự nó không phải cơ chế dự phòng.
Câu 284 Data Ingestion and Transformation

A data engineer is building a real-time fraud detection system using streaming data. The system needs to ensure data integrity and handle re-ingestion of erroneous or incomplete data. Which combination of Kinesis features would BEST support this use case?

  1. A

    Kinesis Firehose with Auto Scaling and Enhanced Fan Out

  2. B

    Kinesis Data Streams with On-Demand Mode and Data Encryption

  3. C

    Managed Apache Flink for real-time analytics and Kinesis Firehose for data delivery

  4. D

    Kinesis Data Streams with Backfilling, Idempotent Operations, and Checkpointing

Xem giải thích

Đáp án

D — Kinesis Data Streams với đọc lại dữ liệu, thao tác bất biến khi lặp, và điểm kiểm tra

Vì sao đúng

Đề nêu hai yêu cầu: toàn vẹn dữ liệu và nạp lại được dữ liệu sai hoặc thiếu. Ba cơ chế trong phương án D ghép lại thành đúng câu trả lời:

  • Checkpoint ghi nhớ đã xử lý tới bản ghi nào, nên sau sự cố đọc tiếp đúng chỗ.
  • Đọc lại được vì Kinesis giữ bản ghi tới hết thời hạn lưu trữ, đưa con trỏ lùi lại là xử lý lại.
  • Thao tác bất biến khi lặp đảm bảo xử lý lại cùng một bản ghi không tạo ra kết quả trùng — không có nó thì việc đọc lại sẽ đếm gian lận hai lần.

Vì sao các phương án khác sai

  • A. Firehose — không giữ dữ liệu để đọc lại, nên mất hẳn khả năng nạp lại.
  • B. On-demand mode kèm mã hoá — chuyện co giãn và bảo mật, không phải toàn vẹn khi lỗi.
  • C. Flink cộng Firehose — mạnh cho phân tích, nhưng đề hỏi về cơ chế bảo đảm dữ liệu.
Câu 285 Chọn nhiều đáp án Data Store Management

An e-commerce company needs to optimize cost and performance for its EC2 instances that are running I/O-intensive database workloads on Amazon EBS. Which TWO actions should the company take to meet this goal? (Choose Two)

  1. A

    Use Provisioned IOPS SSD (io1) volumes for high and consistent I/O performance.

  2. B

    Use General Purpose SSD (GP2) volumes for consistent performance.

  3. C

    Use Magnetic (standard) volumes for cost-effective performance on database workloads.

  4. D

    Upgrade existing GP2 volumes to GP3 to independently manage IOPS and throughput for cost optimization.

  5. E

    Enable Elastic File System (EFS) instead of EBS to improve database performance.

Xem giải thích

Đáp án

A và D — io1 cho IOPS cao và ổn định, và nâng gp2 lên gp3

Vì sao đúng

  • A. io1 (Provisioned IOPS) cho phép khai thẳng số IOPS cần và cam kết giữ mức đó, đúng thứ khối lượng CSDL nặng I/O đòi hỏi.
  • D. Nâng gp2 lên gp3 là đòn tiết kiệm rõ nhất: gp3 rẻ hơn gp2 khoảng 20% mỗi GB, và cho khai IOPS và thông lượng độc lập với dung lượng. Với gp2 muốn thêm IOPS thì phải mua thêm dung lượng không dùng tới.

Hai phương án này ghép thành đúng cặp "hiệu năng và chi phí" mà đề hỏi.

Vì sao các phương án khác sai

  • B. gp2 cho hiệu năng ổn định — gp2 chạy theo cơ chế tích luỹ tín dụng nên không ổn định dưới tải kéo dài; đây chính là thứ gp3 sinh ra để thay.
  • C. Ổ từ (standard) — thế hệ cũ, IOPS rất thấp, không dùng cho CSDL.
  • E. Thay EBS bằng EFS — hệ tệp chia sẻ qua mạng, độ trễ cao hơn, không hợp cho CSDL.
Câu 286 Chọn nhiều đáp án Data Ingestion and Transformation

A company is using DynamoDB with provisioned capacity mode for a predictable workload. They want to minimize costs and ensure optimal performance during occasional traffic fluctuations. Which TWO features should the company implement? (Choose TWO)

  1. A

    Use reserved capacity for read/write operations.

  2. B

    Enable strongly consistent reads to ensure data accuracy.

  3. C

    Switch to on-demand capacity mode to handle traffic fluctuations.

  4. D

    Implement auto-scaling to dynamically adjust read/write capacity.

  5. E

    Enable DynamoDB Accelerator (DAX) for faster reads.

Xem giải thích

Đáp án

A và D — mua reserved capacity, và bật auto-scaling

Vì sao đúng

Đề nói rõ tải đoán trước được, chỉ thỉnh thoảng dao động. Cặp này khớp đúng hình dạng đó:

  • A. Reserved capacity — cam kết trước phần nền cố định để đổi lấy giá rẻ hơn nhiều so với trả theo giờ. Chỉ đáng làm khi tải ổn định, mà ở đây đúng vậy.
  • D. Auto-scaling — lo phần dao động thỉnh thoảng, tự nâng rồi tự hạ nên không phải khai dư.

Vì sao các phương án khác sai

  • C. Chuyển sang on-demand — hợp khi không đoán được tải; ở đây tải đoán được nên on-demand đắt hơn hẳn provisioned có reserved.
  • B. Bật đọc nhất quán mạnh — tăng độ chính xác nhưng tốn gấp đôi đơn vị đọc, đi ngược mục tiêu giảm chi phí.
  • E. Bật DAX — làm đọc nhanh hơn nhưng thêm một cụm phải trả tiền; đề không than phiền về độ trễ.
Câu 287 Data Security and Governance

A financial institution is using Amazon S3 to store sensitive customer data, including personally identifiable information (PII). The institution wants to automatically identify and classify sensitive data to ensure compliance with data protection regulations such as GDPR. Which AWS service should the institution use to meet these requirements?

  1. A

    Amazon Macie

  2. B

    AWS Shield

  3. C

    AWS WAF

  4. D

    AWS Config

Xem giải thích

Đáp án

A — Amazon Macie

Vì sao đúng

Macie là dịch vụ dựng riêng cho việc này: nó dùng học máy và các bộ nhận dạng có sẵn để quét bucket S3, tự phát hiện và phân loại dữ liệu nhạy cảm như số bảo hiểm xã hội, số thẻ tín dụng hay hộ chiếu, rồi báo cáo bucket nào chứa gì. Nó cũng cảnh báo khi bucket bị đặt công khai hoặc mất mã hoá.

Vì sao các phương án khác sai

  • B. AWS Shield — chống tấn công từ chối dịch vụ.
  • C. AWS WAF — tường lửa cho ứng dụng web, lọc yêu cầu HTTP độc hại.
  • D. AWS Config — theo dõi cấu hình tài nguyên và tuân thủ; nó biết bucket có được mã hoá hay không, nhưng không nhìn vào nội dung để phân loại dữ liệu.
Câu 288 Data Security and Governance

A company wants to improve security by granting developers the ability to perform specific actions on Amazon EC2 instances only during business hours. They also want the ability to track who made specific changes to the EC2 instances and automate patch management for these instances. Which combination of services should the company use to meet these requirements?

  1. A

    Use IAM policies with predefined schedule conditions, AWS Config for logging changes, and Amazon EC2 Auto Scaling for patch automation.

  2. B

    Use IAM policies with tag-based restrictions, AWS CloudTrail for logging changes, and AWS Systems Manager Patch Manager for automating patch management.

  3. C

    Use IAM roles with time-based restrictions for access control, AWS CloudTrail for logging changes, and AWS Systems Manager Patch Manager for automating patch management.

  4. D

    Use AWS Systems Manager Session Manager for access control, AWS Systems Manager Patch Manager for patching, and AWS CloudWatch for logging changes.

Xem giải thích

Đáp án

C — Dùng IAM role kèm điều kiện theo thời gian, và CloudTrail để ghi lại

Vì sao đúng

Chính sách IAM hỗ trợ khối Condition với các toán tử ngày giờ như DateGreaterThan và DateLessThan trên aws:CurrentTime. Nhờ vậy quyền thao tác trên EC2 chỉ có hiệu lực trong khung giờ làm việc, và việc chặn xảy ra ở tầng phân quyền chứ không dựa vào ai đó nhớ tắt bật. CloudTrail lo vế thứ hai của đề: ghi lại ai đã làm gì và lúc nào.

Vì sao các phương án khác sai

  • A. Điều kiện lịch dựng sẵn cộng Config để ghi log — IAM không có khái niệm "lịch dựng sẵn", và Config theo dõi cấu hình chứ không ghi lời gọi API.
  • B. Hạn chế theo thẻ (tag) — kiểm soát được tài nguyên nào nhưng không kiểm soát lúc nào.
  • D. Session Manager kèm Patch Manager — quản phiên truy cập và vá lỗi, không phải cơ chế giới hạn quyền theo giờ.
Câu 289 Data Operations and Support

A data engineer needs to run SQL queries against an Amazon Redshift cluster from a serverless AWS Lambda function. The function will retrieve results asynchronously and must avoid managing a persistent database connection. Which method should the engineer use to achieve this?

  1. A

    Use AWS Glue to extract data from Redshift and deliver it to the Lambda function.

  2. B

    Use the Redshift Data API to submit the SQL queries and retrieve the results asynchronously.

  3. C

    Use a JDBC driver to connect to the Redshift cluster.

  4. D

    Use Redshift Spectrum to query data directly from an S3 bucket and load it into Lambda.

Xem giải thích

Đáp án

B — Dùng Redshift Data API để gửi truy vấn và lấy kết quả bất đồng bộ

Vì sao đúng

Data API nhận truy vấn qua HTTP rồi trả về ngay một mã định danh, không giữ kết nối nào. Hàm Lambda gửi truy vấn xong là kết thúc, không phải nằm chờ nên không tốn thời gian chạy. Xác thực bằng IAM hoặc Secrets Manager nên không phải nhúng mật khẩu vào hàm. Đúng cả hai điều kiện đề nêu.

Vì sao các phương án khác sai

  • A. Glue trích dữ liệu rồi đưa cho Lambda — thêm một dịch vụ và một chặng, trong khi đề chỉ cần chạy truy vấn.
  • C. Driver JDBC — Lambda co giãn theo số lời gọi, mỗi bản sao mở một kết nối nên rất dễ làm cạn số kết nối của cụm; lại phải giữ hàm chạy trong lúc chờ.
  • D. Spectrum truy vấn S3 — đọc dữ liệu trên S3, không phải cách gọi truy vấn tới cụm.
Câu 290 Data Security and Governance

A healthcare company needs to monitor its Amazon S3 buckets for sensitive health data and generate alerts if this data is accessed in unusual patterns that might indicate a data breach. Which feature of Amazon Macie should the company leverage to meet these requirements?

  1. A

    Anomaly detection

  2. B

    Pre-built classifiers for sensitive data

  3. C

    CloudTrail log analysis

  4. D

    Real-time DDoS protection

Xem giải thích

Đáp án

A — Phát hiện bất thường (anomaly detection)

Vì sao đúng

Đề không hỏi "dữ liệu nhạy cảm nằm ở đâu" mà hỏi cách nhận ra kiểu truy cập lạ có thể là dấu hiệu bị xâm nhập. Đó là việc của cơ chế phát hiện bất thường: nó dựng đường cơ sở cho hành vi bình thường rồi cảnh báo khi có sai lệch — ví dụ một danh tính bỗng tải xuống lượng dữ liệu lớn bất thường, hoặc truy cập vào giờ chưa từng có.

Vì sao các phương án khác sai

  • B. Bộ nhận dạng dữ liệu nhạy cảm dựng sẵn — trả lời câu hỏi "dữ liệu nhạy cảm nằm ở đâu", là bước trước đó chứ không phải phát hiện xâm nhập.
  • C. Phân tích log CloudTrail — là nguồn dữ liệu cho việc phát hiện, nhưng bản thân đọc log thô thì không tự nhận ra bất thường.
  • D. Chống DDoS thời gian thực — bảo vệ khỏi tấn công làm quá tải, không liên quan tới rò rỉ dữ liệu.