Ngân hàng đề — AWS Certified Data Engineer Associate

Tìm thấy 867 câu.

Câu 331 Data Ingestion and Transformation

A media streaming company is using Amazon Kinesis Data Streams to capture real-time video viewing statistics. The company's engineering team needs to control how the streaming data is processed across multiple shards for efficient parallel processing. They decide to use a partition key for this purpose. What role does the partition key play in Kinesis Data Streams?

  1. A

    It controls how data records are distributed across shards for parallel processing.

  2. B

    It defines the retention period for each data record in the stream.

  3. C

    It encrypts data in transit within the Kinesis Data Stream.

  4. D

    It determines the order in which data is processed within a shard.

Xem giải thích

Đáp án

A — Partition key quyết định bản ghi được chia vào shard nào để xử lý song song

Vì sao đúng

Kinesis băm partition key rồi ánh xạ giá trị băm vào dải khoá của các shard. Vì vậy partition key quyết định hai điều: mức độ trải đều dữ liệu (chọn khoá phân tán tốt như ID người dùng thì tải đều; chọn khoá ít giá trị thì sinh shard nóng), và việc các bản ghi cùng khoá luôn vào cùng một shard, nhờ đó giữ được thứ tự cho từng khoá.

Vì sao các phương án khác sai

  • B. Định nghĩa thời hạn lưu trữ — đó là thiết lập riêng ở mức luồng, không liên quan tới khoá.
  • C. Mã hoá dữ liệu trên đường truyền — do TLS và mã hoá phía máy chủ lo.
  • D. Quyết định thứ tự xử lý trong một shard — thứ tự trong shard vốn đã theo trình tự ghi vào; partition key quyết định vào shard nào, không quyết định thứ tự bên trong.
Câu 332 Data Ingestion and Transformation

A retail company wants to use Amazon SageMaker for a machine learning project involving both real-time recommendations and batch processing. The company needs to store features with low-latency access for real-time predictions and less frequently accessed features for batch inference. Which Amazon SageMaker capability should they use?

  1. A

    SageMaker Feature Store with an online store for real-time features and offline store for batch features.

  2. B

    SageMaker Data Wrangler with real-time streaming mode.

  3. C

    SageMaker Experiments with low-latency data tracking.

  4. D

    SageMaker Debugger with multi-level storage.

Xem giải thích

Đáp án

A — SageMaker Feature Store: online store cho đặc trưng thời gian thực, offline store cho xử lý theo lô

Vì sao đúng

Feature Store có sẵn hai kho cho đúng hai nhu cầu đề nêu. Online store giữ giá trị mới nhất của từng thực thể và trả về trong vài mili giây theo khoá — dùng cho gợi ý thời gian thực. Offline store giữ toàn bộ lịch sử trên S3 — dùng cho huấn luyện và dự đoán theo lô. Cả hai lấy từ cùng một định nghĩa đặc trưng, nên không có chuyện đặc trưng lúc huấn luyện khác lúc chạy thật.

Vì sao các phương án khác sai

  • B. Data Wrangler — công cụ chuẩn bị dữ liệu, không phải nơi lưu và phục vụ đặc trưng.
  • C. Experiments — theo dõi các lần huấn luyện.
  • D. Debugger — bắt lỗi trong lúc huấn luyện. Cả ba đều không phải kho đặc trưng.
Câu 333 Data Security and Governance

An e-commerce company is migrating its workloads to AWS and needs to ensure that customer data stored in S3 is protected by encryption. The company wants to have full control over the encryption keys and must audit key usage for compliance purposes. Additionally, the company requires keys to be automatically rotated every year. Which combination of AWS KMS features will meet the company’s requirements?

  1. A

    AWS owned keys with automatic rotation enabled

  2. B

    Customer managed keys with automatic rotation enabled

  3. C

    AWS managed keys with automatic rotation enabled

  4. D

    Asymmetric keys with manual rotation

Xem giải thích

Đáp án

B — Customer managed key có bật tự xoay vòng

Vì sao đúng

Đề đòi toàn quyền kiểm soát khoá, và chỉ customer managed key cho điều đó: bạn tự viết key policy quyết định ai dùng được khoá, bật hoặc tắt khoá, lên lịch xoá, và bật xoay vòng tự động hằng năm. Mọi lần dùng khoá đều vào CloudTrail nên kiểm toán được.

Vì sao các phương án khác sai

  • A. AWS owned key — nằm trong tài khoản của AWS, dùng chung nhiều khách hàng; bạn không thấy và không kiểm soát được gì.
  • C. AWS managed key — hiện trong tài khoản bạn nhưng không sửa được key policy và không điều khiển được vòng đời.
  • D. Khoá bất đối xứng xoay vòng tay — mã hoá S3 phía máy chủ dùng khoá đối xứng; hơn nữa KMS không tự xoay vòng khoá bất đối xứng, nên đây là lựa chọn vừa sai kỹ thuật vừa nặng vận hành.
Câu 334 Data Operations and Support

A team is building a data pipeline to ingest large volumes of log data from multiple servers. The system must guarantee data replayability in case of failure and ensure that log data can be efficiently reprocessed. What is the MOST cost-effective approach using AWS services to meet this requirement?

  1. A

    Use Amazon MQ for ingesting data and manually reprocessing failed records

  2. B

    Use Kinesis Data Streams with multiple shards and the Kinesis Client Library for replayability

  3. C

    Use DynamoDB Streams for capturing logs and replaying failed data

  4. D

    Use Kinesis Firehose with backup configuration in S3 to reprocess failed data

Xem giải thích

Đáp án

B — Kinesis Data Streams với nhiều shard, dùng Kinesis Client Library

Vì sao đúng

Hai yêu cầu của đề khớp đúng hai đặc điểm của cặp này. Đọc lại được: Kinesis giữ bản ghi tới hết thời hạn lưu trữ nên đưa con trỏ lùi lại là xử lý lại được. KCL lo phần khó của consumer: chia shard cho các máy, tự lưu checkpoint vào DynamoDB, và tự chia lại khi thêm bớt máy. Nhiều shard cho phép mở rộng thông lượng theo lượng log.

Vì sao các phương án khác sai

  • A. Amazon MQ rồi xử lý lại bằng tay — hàng đợi thông điệp truyền thống, và "bằng tay" thì không mở rộng được.
  • C. DynamoDB Streams — bắt thay đổi của một bảng DynamoDB, không phải nơi nhận log từ nhiều máy chủ.
  • D. Firehose kèm sao lưu vào S3 — Firehose không cho đọc lại từ vị trí cũ; muốn xử lý lại phải tự đọc tệp trên S3, mất hẳn mô hình luồng.
Câu 335 Data Security and Governance

A data engineer is configuring a real-time fraud detection pipeline using Kinesis Data Streams. The system must handle a massive volume of transactional data and minimize the risk of losing data in the event of failures. Which feature of Kinesis Data Streams ensures the durability and availability of the ingested data across multiple Availability Zones?

  1. A

    Provisioned mode

  2. B

    Data replication

  3. C

    Shard auto-scaling

  4. D

    Partition key hashing

Xem giải thích

Đáp án

B — Nhân bản dữ liệu (data replication)

Vì sao đúng

Câu hỏi là làm sao giảm rủi ro mất dữ liệu. Kinesis Data Streams ghi đồng bộ mỗi bản ghi sang ba vùng sẵn sàng trong khu vực trước khi báo nhận thành công. Nhờ vậy hỏng một AZ thì dữ liệu vẫn còn nguyên và luồng vẫn phục vụ được — đây là cơ chế bảo vệ dữ liệu, không phải cơ chế tăng tốc.

Vì sao các phương án khác sai

  • A. Provisioned mode — cách khai năng lực, quyết định thông lượng chứ không quyết định độ bền.
  • C. Tự co giãn shard — giúp không bị chặn khi tải tăng; liên quan tới thông lượng, không phải mất dữ liệu do sự cố hạ tầng.
  • D. Băm partition key — quyết định bản ghi vào shard nào, không liên quan tới độ bền.
Câu 336 Data Security and Governance

A security analyst is reviewing the authentication options available in OpenSearch to ensure secure access to their cluster. Which of the following is NOT a supported authentication mechanism in OpenSearch?

  1. A

    Active Directory integration for external authentication

  2. B

    SAML integration for external authentication

  3. C

    Native authentication using roles and users

  4. D

    OAuth2 integration for external authentication

Xem giải thích

Đáp án

D — Tích hợp OAuth2 (đây là phương án không được hỗ trợ)

Vì sao đúng

Đề hỏi ngược — tìm cái không có. OpenSearch Service hỗ trợ xác thực nội bộ bằng người dùng và vai, SAML để nối tới nhà cung cấp danh tính doanh nghiệp, và qua đó tích hợp được Active Directory. OpenSearch không có tích hợp OAuth2 như một cơ chế xác thực riêng cho domain.

Vì sao các phương án khác sai (nghĩa là chúng đều được hỗ trợ)

  • A. Active Directory — nối được, thường thông qua SAML.
  • B. SAML — cơ chế chính thức để dùng danh tính từ hệ thống bên ngoài.
  • C. Xác thực nội bộ bằng vai và người dùng — cơ chế mặc định của security plugin.

Nhớ nhanh

Câu hỏi dạng "cái nào KHÔNG phải" rất dễ trả lời ngược. Đọc kỹ chữ NOT trước khi chọn.

Câu 337 Data Store Management

A company wants to collect logs from its cloud-based applications and deliver them to Amazon S3 and Amazon Redshift for storage and analysis. The solution should be fully managed with minimal setup and allow for near real-time data transformation. Which service best meets these requirements?

  1. A

    Amazon EC2 with a custom data ingestion application

  2. B

    Amazon Kinesis Data Analytics

  3. C

    Amazon Kinesis Data Firehose

  4. D

    Amazon Kinesis Data Streams

Xem giải thích

Đáp án

C — Amazon Kinesis Data Firehose

Vì sao đúng

Firehose là dịch vụ giao nhận được quản lý hoàn toàn: nhận log vào, biến đổi được bằng Lambda ngay trên đường đi, rồi tự ghi xuống cả S3 lẫn Redshift — hai đích đề nêu đều có sẵn, không phải viết consumer nào. Nó tự gom lô, tự nén, tự thử lại và tự co giãn. Đúng yêu cầu "được quản lý hoàn toàn, tối thiểu vận hành".

Vì sao các phương án khác sai

  • A. EC2 với ứng dụng tự viết — ngược hẳn yêu cầu.
  • B. Kinesis Data Analytics — phân tích luồng, không phải công cụ giao nhận tới nơi lưu trữ.
  • D. Kinesis Data Streams — chỉ là ống chứa; muốn xuống S3 và Redshift vẫn phải tự viết và tự vận hành consumer.
Câu 338 Data Security and Governance

A company using Amazon SageMaker needs to ensure that only authorized users can access certain machine learning models and notebooks. They also want to restrict access to specific resources based on user roles within the organization. Which combination of SageMaker features can achieve this?

  1. A

    Amazon VPC and SageMaker Autopilot

  2. B

    AWS IAM Roles and Resource-Based Policies

  3. C

    SageMaker Experiments and Fine-Grained Access Control

  4. D

    AWS Secrets Manager and SageMaker Feature Store

Xem giải thích

Đáp án

B — IAM Role kết hợp chính sách theo tài nguyên

Vì sao đúng

Phân quyền trong SageMaker đứng trên hai chân. IAM role và chính sách theo danh tính quyết định người dùng hay dịch vụ được gọi hành động nào. Chính sách theo tài nguyên gắn trực tiếp lên tài nguyên — cộng với điều kiện theo thẻ (tag) — cho phép giới hạn tới từng mô hình hay từng notebook cụ thể, đúng yêu cầu "hạn chế tới tài nguyên nhất định".

Vì sao các phương án khác sai

  • A. VPC cộng Autopilot — VPC là cô lập mạng, Autopilot là tự dựng mô hình; không cái nào phân quyền.
  • C. Experiments cộng kiểm soát chi tiết — Experiments chỉ theo dõi các lần chạy.
  • D. Secrets Manager cộng Feature Store — cất bí mật và lưu đặc trưng, không phải cơ chế phân quyền.
Câu 339 Data Store Management

A data engineer is responsible for optimizing query performance and costs for a company that stores log data in Amazon S3. The log data is currently stored in JSON format, and Athena is used to query the logs for analytics. The engineer has been asked to improve query performance and reduce the amount of data scanned by Athena. Which approach should the data engineer take to achieve this goal?

  1. A

    Partition the JSON files by date and run queries on specific partitions.

  2. B

    Compress the JSON files using Gzip and query them directly in Athena.

  3. C

    Convert the JSON files to Apache Parquet format and query the Parquet files in Athena.

  4. D

    Convert the JSON files to CSV format and query the CSV files in Athena.

Xem giải thích

Đáp án

C — Đổi JSON sang Apache Parquet rồi truy vấn trên tệp Parquet

Vì sao đúng

Athena tính cả tiền lẫn thời gian theo lượng dữ liệu quét. Parquet là định dạng cột nên Athena chỉ đọc đúng những cột trong câu SELECT, và dữ liệu cùng cột thì cùng kiểu nên nén rất tốt. Với log JSON, đổi sang Parquet thường giảm lượng quét vài lần tới hàng chục lần — đòn mạnh nhất trong bốn phương án.

Vì sao các phương án khác sai

  • A. Phân vùng tệp JSON theo ngày — đúng hướng và nên làm, nhưng vẫn phải đọc trọn từng dòng JSON trong phân vùng được chọn. Trên thực tế người ta làm cả hai; nếu chỉ chọn một thì đổi định dạng cho lợi ích lớn hơn.
  • B. Nén Gzip — giảm dung lượng lưu trữ, nhưng tệp Gzip không tách được để đọc song song, và Athena vẫn phải giải nén toàn bộ dòng.
  • D. Đổi sang CSV — vẫn là định dạng dòng, không nén; gần như không cải thiện gì.
Câu 340 Data Operations and Support

A media company wants to process large volumes of real-time data from its streaming platform and store the processed data in an S3-based data lake. The company needs a cost-effective and scalable ETL solution that can run Spark jobs and automatically scale based on the amount of data being processed. The team also requires the ability to adjust the compute resources for the ETL jobs to optimize costs. Which AWS service and configuration should they choose?

  1. A

    Amazon EMR with manually provisioned Spark clusters

  2. B

    AWS Glue Crawler to process data and adjust compute resources automatically

  3. C

    AWS Lambda with Python shell scripts to process the data

  4. D

    AWS Glue with the ability to configure Data Processing Units (DPUs) for Spark jobs

Xem giải thích

Đáp án

D — AWS Glue với khả năng khai số DPU cho job Spark

Vì sao đúng

Glue chạy Spark không cần cụm: bạn khai số DPU (hoặc bật auto-scaling), Glue tự cấp phát, chạy xong tự trả lại, tính tiền theo giây. Đó là cân bằng đúng cho yêu cầu "hiệu quả về chi phí và co giãn được" — vừa xử lý được khối lượng lớn, vừa không trả tiền lúc rảnh.

Vì sao các phương án khác sai

  • A. EMR với cụm khai bằng tay — mạnh nhưng phải dựng và trông cụm, và trả tiền cả lúc không chạy job nào.
  • B. Glue Crawler để xử lý dữ liệu — hiểu sai vai trò: crawler chỉ suy ra lược đồ, nó không xử lý dữ liệu.
  • C. Lambda với script Python shell — trần 15 phút và trần bộ nhớ; không kham nổi "khối lượng lớn theo thời gian thực".