Ngân hàng đề — AWS Certified Data Engineer Associate

Tìm thấy 867 câu.

Câu 601 Domain 3: Data Operations and Support

A data analyst is setting up Amazon QuickSight to create dashboards for the senior management. The data warehousing service is handled by the Amazon Redshift clusters, hosted in a public subnet of a VPC. Currently, data is fetched using SQL tools. When trying to launch QuickSight for the first time, QuickSight is failing with an error indicating that the connection to the data source is failing.

What configuration changes are needed to connect QuickSight to the Redshift clusters?

  1. A

    Use a QuickSight admin user for creating the dataset

  2. B

    Add the QuickSight IP address range of the AWS Region to Amazon Redshift security group

  3. C

    Create an IAM role for QuickSight to access Amazon Redshift

  4. D

    Grant the SELECT permissions on Amazon Redshift system tables

Xem giải thích

Đáp án

B — Thêm dải địa chỉ IP của QuickSight ở Region tương ứng vào security group của Amazon Redshift

Vì sao đúng

Chi tiết quyết định trong đề: cụm Redshift nằm trong public subnet, và hiện đã truy cập được bằng công cụ SQL. Nghĩa là mạng và phân quyền cơ bản đã đúng — cái thiếu chỉ là QuickSight chưa được security group cho phép vào.

QuickSight kết nối tới nguồn dữ liệu công khai từ dải địa chỉ IP riêng của nó ở mỗi Region, và AWS công bố sẵn danh sách đó. Bạn thêm dải tương ứng vào luật vào của security group Redshift, cổng 5439.

Đây là lỗi cấu hình phổ biến nhất khi lần đầu nối QuickSight với Redshift, và triệu chứng đúng như đề mô tả: lỗi kết nối tới nguồn dữ liệu.

Vì sao các phương án khác sai

  • C. Tạo IAM role cho QuickSight truy cập Redshift — Redshift xác thực bằng tên đăng nhập và mật khẩu cơ sở dữ liệu cho kiểu kết nối này, không phải bằng IAM role. Và dù có thì lỗi cũng sẽ là lỗi xác thực, không phải lỗi kết nối. Đây là phương án nhiễu chính.
  • D. Cấp quyền SELECT trên bảng hệ thống của Redshift — nếu thiếu quyền thì kết nối vẫn thành công rồi mới báo lỗi khi truy vấn; triệu chứng không khớp.
  • A. Dùng tài khoản admin của QuickSight để tạo dataset — quyền trong QuickSight không ảnh hưởng tới việc có kết nối được tới Redshift hay không.

Lưu ý

Nếu cụm nằm trong private subnet, cách đúng là dùng QuickSight VPC connection thay vì mở security group cho dải IP công khai.

Câu 602 Chọn nhiều đáp án Domain 2: Data Store Management

A data engineer needs to ascertain the outcome of S3 Lifecycle configurations on an Amazon S3 bucket. The data engineer realized that multiple rules have been defined on the same S3 bucket and an object can become eligible for multiple S3 Lifecycle actions.

What is the order of preference that Amazon S3 uses for objects that fall under multiple S3 Lifecycle rules? (Select two)

  1. A

    S3 objects that fall under multiple lifecycle rules are not automatically transitioned to any state

  2. B

    When an object is eligible for both an S3 Glacier Flexible Retrieval and S3 Standard-IA transition, Amazon S3 chooses the S3 Standard-IA transition

  3. C

    When an object is eligible for both an S3 Glacier Flexible Retrieval and S3 One Zone-IA transition, Amazon S3 chooses the S3 One Zone-IA transition

  4. D

    Transition takes precedence over creation of delete markers

  5. E

    Permanent deletion takes precedence over transition

Xem giải thích

Đáp án

D và E — chuyển tầng (transition) được ưu tiên hơn việc tạo delete marker, và xoá vĩnh viễn được ưu tiên hơn chuyển tầng

Vì sao đúng

Khi một đối tượng khớp nhiều luật lifecycle cùng lúc, S3 áp dụng thứ tự ưu tiên cố định:

1. XOÁ VĨNH VIỄN      (mạnh nhất — thắng tất cả)
2. CHUYỂN TẦNG
3. Tạo delete marker  (yếu nhất)
  • E. Xoá vĩnh viễn thắng chuyển tầng — hợp lý: nếu đối tượng sắp bị xoá hẳn thì chuyển nó sang tầng khác là việc vô nghĩa và còn tốn phí chuyển.
  • D. Chuyển tầng thắng việc tạo delete marker — cũng hợp lý: delete marker chỉ ẩn phiên bản hiện tại chứ không xoá dữ liệu, nên chuyển nó sang tầng rẻ hơn vẫn có giá trị.

Nguyên tắc chung: S3 luôn chọn hành động dẫn tới chi phí thấp hơn.

Vì sao các phương án khác sai

  • B và C. Khi đối tượng đủ điều kiện cho cả Glacier lẫn một lớp IA, S3 chọn lớp IA — ngược hẳn: S3 chọn lớp rẻ hơn, tức là Glacier. Đây là hai phương án nhiễu chính, và chúng dựa trên giả định sai rằng S3 chọn lớp "an toàn hơn".
  • A. Đối tượng khớp nhiều luật thì không được chuyển tầng gì cả — sai; S3 luôn áp dụng một hành động theo thứ tự ưu tiên trên, không bao giờ bỏ qua.
Câu 603 Domain 3: Data Operations and Support

A multi-national retail company wants to migrate its on-premises Oracle database to Aurora MySQL. The company has hired you as an AWS Certified Data Engineer Associate to carry out the migration with minimal downtime using AWS DMS. The company has mandated that the migration must have minimal impact on the performance of the source database and you must validate that the data was migrated accurately from the source to the target before the cutover.

Which of the following solutions will MOST effectively address this use-case?

  1. A

    Configure DMS premigration assessment on the migration task so the assessment can compare the source and target data and report any mismatches

  2. B

    Use AWS Schema Conversion Tool for the migration task so it can compare the source and target data and report any mismatches

  3. C

    Use the table metrics of the DMS task to verify the statistics for tables being migrated including the DDL statements completed

  4. D

    Configure DMS data validation on the migration task so it can compare the source and target data for the DMS task and report any mismatches

Xem giải thích

Đáp án

D — Bật DMS data validation trên migration task

Vì sao đúng

Đề đòi hai thứ: xác minh dữ liệu đã chuyển chính xác trước khi cắt chuyển, và ít ảnh hưởng nhất tới hiệu năng của cơ sở dữ liệu nguồn.

DMS data validation làm đúng điều đó: sau khi chuyển, nó so sánh dữ liệu ở nguồn với đích theo từng dòng và báo cáo mọi chỗ lệch vào bảng awsdms_validation_failures_v1.

Hai đặc điểm khiến nó phù hợp với ràng buộc về hiệu năng:

  • Chạy liên tục và tăng dần trong lúc CDC vẫn đang chép thay đổi, chứ không dồn vào một đợt quét nặng.
  • Đọc dữ liệu theo lô nhỏ và có thể điều chỉnh tốc độ để giảm tải lên nguồn.

Điều này quan trọng với việc di trú Oracle sang Aurora MySQL vì hai engine khác nhau — kiểu dữ liệu được ánh xạ lại, và đó chính là chỗ dễ phát sinh sai lệch âm thầm.

Vì sao các phương án khác sai

  • A. Dùng DMS premigration assessment — chạy trước khi di trú để cảnh báo về những kiểu dữ liệu hoặc cấu trúc có thể gây vấn đề; nó không so sánh dữ liệu vì lúc đó chưa có gì ở đích. Đây là phương án nhiễu chính.
  • B. Dùng AWS Schema Conversion Tool — chuyển đổi lược đồ và mã (stored procedure, view); nó không so sánh dữ liệu.
  • C. Xem table metrics của DMS task — cho biết số dòng đã chuyển, nhưng số dòng khớp không bảo đảm nội dung khớp.
Câu 604 Domain 1: Data Ingestion and Transformation

A company wants to optimize its daily Extract-Transform-Load (ETL) process that migrates and transforms data from its Amazon S3 based data lake to an Amazon Redshift cluster. The data engineering team wants to manage this daily job in a serverless environment.

Which AWS service is the best fit to manage this process without the need to configure or manage the underlying compute resources?

  1. A

    AWS Database Migration Service (DMS)

  2. B

    AWS Glue

  3. C

    AWS Data Pipeline

  4. D

    Amazon EMR

Xem giải thích

Đáp án

B — AWS Glue

Vì sao đúng

Đề nêu hai yêu cầu: quản lý job ETL hằng ngày trong môi trường serverless, và không phải cấu hình hay quản lý tài nguyên tính toán bên dưới.

Glue thoả cả hai một cách trực tiếp:

  • Hoàn toàn serverless — không có cụm hay instance nào để cấp phát; bạn chỉ khai số worker và loại worker.
  • Tích hợp sẵn cả hai đầu — có sẵn connector cho S3 và cho Redshift, nên đường ống S3 → biến đổi → Redshift không cần mã kết dính.
  • Có bộ lập lịch riêng cho job chạy hằng ngày, và Data Catalog để quản lý lược đồ.

Vì sao các phương án khác sai

  • D. Amazon EMR — chạy Spark rất mạnh, nhưng bạn quản lý cụm: chọn loại node, số node, vá lỗi, điều chỉnh quy mô. Vi phạm thẳng yêu cầu "không cấu hình tài nguyên tính toán". Đây là phương án nhiễu chính.
  • A. AWS Database Migration Service — dựng cho di trú cơ sở dữ liệu, không phải cho ETL có biến đổi phức tạp chạy định kỳ.
  • C. AWS Data Pipeline — dịch vụ điều phối ETL thế hệ cũ; nó thường khởi chạy cụm EMR hoặc EC2 bên dưới, nên không phải serverless. AWS cũng đã ngừng phát triển nó và khuyến nghị chuyển sang Glue hoặc Step Functions.
Câu 605
A data engineer is configuring an AWS Glue job to read data from an Amazon S3 bucket. The data engineer has set up the necessary AWS Glue connection details and an associated IAM role. However, when the data engineer attempts to run the AWS Glue job, the data engineer receives an error message that indicates that there are problems with the Amazon S3 VPC gateway endpoint.
The data engineer must resolve the error and connect the AWS Glue job to the S3 bucket.
Which solution will meet this requirement?
  1. A Update the AWS Glue security group to allow inbound traffic from the Amazon S3 VPC gateway endpoint.
  2. B Configure an S3 bucket policy to explicitly grant the AWS Glue job permissions to access the S3 bucket.
  3. C Review the AWS Glue job code to ensure that the AWS Glue connection details include a fully qualified domain name.
  4. D Verify that the VPC's route table includes inbound and outbound routes for the Amazon S3 VPC gateway endpoint.
Xem giải thích

🧩 Phân tích nội dung câu hỏi

Câu hỏi mô tả tình huống một data engineer đang cấu hình AWS Glue job để đọc dữ liệu từ Amazon S3 bucket. Họ đã thiết lập đầy đủ AWS Glue connection details (chi tiết kết nối Glue) và IAM role liên quan. Tuy nhiên, khi chạy job, gặp lỗi liên quan đến Amazon S3 VPC gateway endpoint (điểm cuối VPC gateway cho S3).
Yêu cầu: Giải quyết lỗi này để AWS Glue job có thể kết nối thành công với S3 bucket.

🛠️ Bối cảnh kỹ thuật (dựa trên kiến thức AWS cập nhật đến 2026):

  • AWS Glue jobs thường chạy trong môi trường managed VPC của AWS, nhưng khi sử dụng VPC Gateway Endpoint cho S3 (interface type: Gateway), traffic từ VPC đến S3 sẽ đi qua endpoint này thay vì public internet để đảm bảo private connectivity.
  • Lỗi "problems with the Amazon S3 VPC gateway endpoint" thường chỉ ra vấn đề cấu hình route table trong VPC, vì Gateway Endpoint hoạt động dựa trên route propagation (tuyên truyền tuyến đường) đến prefix list của S3 (pl-xxxx).
  • AWS Glue yêu cầu endpoint phải được route đúng để tránh timeout hoặc connectivity failure khi truy cập S3 từ private subnet.

✅ Đáp án đúng và lý do lựa chọn

Đáp án đúng: Verify that the VPC's route table includes inbound and outbound routes for the Amazon S3 VPC gateway endpoint.

Lý do chi tiết:

  • Với S3 Gateway Endpoint, AWS tự động thêm route vào route table của VPC/subnet nơi endpoint được attach, trỏ đến prefix list của S3 (ví dụ: pl-12345678 target vpce-abc123). Nếu route này thiếu hoặc sai (không có inbound/outbound tương ứng), traffic từ Glue job (chạy trong VPC) sẽ không đến được S3, gây lỗi endpoint.
  • Việc verify route table là bước đầu tiên và chính xác nhất để resolve, theo best practice AWS (2026). Inbound/outbound routes đảm bảo bidirectional traffic qua endpoint private.
  • Sau khi verify và fix route (nếu cần), Glue job sẽ kết nối S3 mà không qua internet gateway.

📋 Giải thích tất cả các phương án (đúng/sai)

  • ❌ Update the AWS Glue security group to allow inbound traffic from the Amazon S3 VPC gateway endpoint.
    Sai vì: S3 Gateway Endpoint không sử dụng Security Group (SG) hoặc Network ACL (NACL) theo cách của ENI-based endpoint. Nó là route-based (chỉ route table), không có ENI nên không có inbound traffic từ endpoint. Cập nhật SG của Glue job vô ích và không resolve lỗi endpoint.

  • ❌ Configure an S3 bucket policy to explicitly grant the AWS Glue job permissions to access the S3 bucket.
    Sai vì: Lỗi không phải về permission (IAM role đã set up), mà là network connectivity qua VPC endpoint. Bucket policy chỉ kiểm soát access level, không fix routing issue. Nếu permission thiếu, lỗi sẽ là AccessDenied, không phải endpoint problem.

  • ❌ Review the AWS Glue job code to ensure that the AWS Glue connection details include a fully qualified domain name.
    Sai vì: Connection details trong Glue (JDBC hoặc S3 connector) cần FQDN cho một số trường hợp, nhưng lỗi cụ thể chỉ S3 VPC gateway endpoint – vấn đề routing VPC, không phải code/job script. FQDN không ảnh hưởng trực tiếp đến endpoint route.

  • ✅ Verify that the VPC's route table includes inbound and outbound routes for the Amazon S3 VPC gateway endpoint.
    Đúng vì: Đây là nguyên nhân gốc rễ của lỗi. Route table phải có entry route đến S3 prefix list qua endpoint (ví dụ: 0.0.0.0/0 hoặc S3 CIDR -> vpce-xxx). Verify và thêm route sẽ enable private access từ Glue job đến S3 ngay lập tức.

📘 Tài liệu tham khảo (AWS cập nhật 2026)

Hy vọng phân tích này giúp bạn ôn thi DOP-C02 hiệu quả! 🚀 Nếu cần thêm ví dụ thực hành, hãy hỏi nhé!

Câu 606
A retail company has a customer data hub in an Amazon S3 bucket. Employees from many countries use the data hub to support company-wide analytics. A governance team must ensure that the company's data analysts can access data only for customers who are within the same country as the analysts.
Which solution will meet these requirements with the LEAST operational effort?
  1. A Create a separate table for each country's customer data. Provide access to each analyst based on the country that the analyst serves.
  2. B Register the S3 bucket as a data lake location in AWS Lake Formation. Use the Lake Formation row-level security features to enforce the company's access policies.
  3. C Move the data to AWS Regions that are close to the countries where the customers are. Provide access to each analyst based on the country that the analyst serves.
  4. D Load the data into Amazon Redshift. Create a view for each country. Create separate IAM roles for each country to provide access to data from each country. Assign the appropriate roles to the analysts.
Xem giải thích

🧩 Giải thích nội dung câu hỏi

Câu hỏi xoay quanh một công ty bán lẻ lưu trữ hub dữ liệu khách hàng (customer data hub) trong Amazon S3 bucket. Nhân viên (data analysts) từ nhiều quốc gia sử dụng dữ liệu này để hỗ trợ phân tích toàn công ty. Nhóm quản trị (governance team) cần đảm bảo analysts chỉ truy cập dữ liệu khách hàng cùng quốc gia với họ (ví dụ: analyst ở Việt Nam chỉ xem dữ liệu khách Việt Nam).
Yêu cầu chính: Giải pháp phải đạt LEAST operational effort (ít nỗ lực vận hành nhất), nghĩa là không tốn kém về quản lý, di chuyển dữ liệu hay cấu hình phức tạp.
🛠️ Thách thức: Dữ liệu nằm trên S3 (dạng data lake), cần row-level security (bảo mật cấp hàng) dựa trên thuộc tính quốc gia của analyst và khách hàng, mà không làm gián đoạn truy cập hiện tại.

✅ Đáp án đúng và lý do lựa chọn

Register the S3 bucket as a data lake location in AWS Lake Formation. Use the Lake Formation row-level security features to enforce the company's access policies.

Lý do:

  • AWS Lake Formation (dịch vụ quản lý data lake) cho phép đăng ký S3 bucket làm data lake location chỉ với vài cú click, không cần di chuyển dữ liệu.
  • Tính năng row-level security (RLS) và cell-level security (cập nhật mới nhất đến 2026) hỗ trợ chính sách truy cập động dựa trên metadata (như quốc gia của user/analyst so với dữ liệu khách hàng). Bạn có thể định nghĩa LF-policies gắn với IAM roles/groups, tự động lọc dữ liệu tại query time (query engine như Athena, Glue, EMR).
  • Least effort: Zero-copy (không copy data), tích hợp native với S3, Athena/Redshift Spectrum, giảm chi phí vận hành so với các giải pháp thủ công. Phù hợp data lake quy mô lớn.
    📘 Tài liệu tham khảo:
  • AWS Lake Formation Row- and Cell-Level Security (cập nhật 2025-2026).
  • AWS re:Post - Lake Formation RLS Examples.

📋 Phân tích tất cả các phương án

Dưới đây là phân tích chi tiết từng lựa chọn, giữ nguyên nội dung gốc bằng tiếng Anh. Mỗi phương án được đánh giá đúng/sai với lý do cụ thể:

  • Create a separate table for each country's customer data. Provide access to each analyst based on the country that the analyst serves.
    ❌ Sai: Phương án này yêu cầu tách dữ liệu thành nhiều table riêng theo quốc gia (có thể dùng partitions trong S3/Glue Catalog), rồi cấp quyền IAM/S3 policies theo country. Operational effort cao: Phải duy trì sync dữ liệu liên tục (ETL jobs), quản lý hàng trăm table nếu nhiều quốc gia, dễ lỗi khi dữ liệu thay đổi (khách di cư quốc gia). Không scale tốt cho data lake lớn, vi phạm nguyên tắc "least effort".

  • Register the S3 bucket as a data lake location in AWS Lake Formation. Use the Lake Formation row-level security features to enforce the company's access policies.
    ✅ Đúng: Như đã giải thích ở trên. Least effort thực sự: Tích hợp liền mạch với S3, RLS tự động lọc row dựa trên user attributes (qua LF tags hoặc data filters), hỗ trợ multi-engine (Athena, EMR). Không cần refactor dữ liệu hiện tại.

  • Move the data to AWS Regions that are close to the countries where the customers are. Provide access to each analyst based on the country that the analyst serves.
    ❌ Sai: Di chuyển dữ liệu sang các AWS Regions gần quốc gia khách hàng (cross-Region replication) không giải quyết vấn đề cốt lõi – analyst vẫn có thể truy cập Region sai nếu dùng IAM global. Effort cực cao: Chi phí replication cao, latency, quản lý multi-Region consistency (S3 CRR), và vẫn cần thêm controls (như VPC endpoints). Không liên quan trực tiếp đến matching quốc gia analyst-khách hàng.

  • Load the data into Amazon Redshift. Create a view for each country. Create separate IAM roles for each country to provide access to data from each country. Assign the appropriate roles to the analysts.
    ❌ Sai: Load toàn bộ dữ liệu vào Redshift (qua COPY hoặc Spectrum), tạo views theo country, và IAM roles riêng. Effort lớn: Di chuyển dữ liệu (ETL pipeline), chi phí Redshift cluster cao, maintain views/roles cho nhiều quốc gia (scale kém), query chậm nếu data lớn. Không "least effort" vì thay đổi architecture từ S3 data lake sang warehouse.

🛠️ Kết luận: Lake Formation RLS là giải pháp tối ưu nhất cho data governance trên S3, tuân thủ nguyên tắc AWS Well-Architected Framework (Security & Operational Excellence pillars). Nếu triển khai, bắt đầu bằng LF blueprint để catalog hóa dữ liệu nhanh chóng! 🚀

Câu 607
A media company wants to improve a system that recommends media content to customer based on user behavior and preferences. To improve the recommendation system, the company needs to incorporate insights from third-party datasets into the company's existing analytics platform.
The company wants to minimize the effort and time required to incorporate third-party datasets.
Which solution will meet these requirements with the LEAST operational overhead?
  1. A Use API calls to access and integrate third-party datasets from AWS Data Exchange.
  2. B Use API calls to access and integrate third-party datasets from AWS DataSync.
  3. C Use Amazon Kinesis Data Streams to access and integrate third-party datasets from AWS CodeCommit repositories.
  4. D Use Amazon Kinesis Data Streams to access and integrate third-party datasets from Amazon Elastic Container Registry (Amazon ECR).
Xem giải thích

🧩 Phân tích chi tiết nội dung câu hỏi

Câu hỏi xoay quanh một công ty truyền thông muốn cải thiện hệ thống khuyến nghị nội dung (recommendation system) dựa trên hành vi và sở thích của khách hàng. Để làm điều này, họ cần tích hợp insights từ các bộ dữ liệu third-party (dữ liệu từ bên thứ ba) vào nền tảng phân tích hiện có. Yêu cầu chính là giảm thiểu nỗ lực và thời gian (minimize effort and time), đồng thời chọn giải pháp có operational overhead thấp nhất (LEAST operational overhead).

🛠️ Bối cảnh kỹ thuật: Đây là bài toán về data integration trong AWS, tập trung vào việc truy cập dữ liệu bên ngoài một cách nhanh chóng, không cần quản lý hạ tầng phức tạp. AWS cung cấp các dịch vụ chuyên biệt để xử lý third-party data mà không yêu cầu ETL phức tạp hoặc tự xây dựng pipeline.

✅ Đáp án đúng và lý do lựa chọn

Đáp án đúng: Use API calls to access and integrate third-party datasets from AWS Data Exchange.

Lý do:

  • AWS Data Exchange là dịch vụ chuyên dụng để khám phá, đăng ký và tích hợp dữ liệu third-party một cách dễ dàng qua API calls (S3 API hoặc Data Exchange API). Người dùng có thể subscribe datasets từ các nhà cung cấp bên thứ ba, truy cập trực tiếp qua Amazon S3 mà không cần quản lý hạ tầng, ETL thủ công hay chuyển dữ liệu lớn.
  • Điều này đáp ứng LEAST operational overhead vì: tự động hóa subscription, versioning dữ liệu, quyền truy cập, và tích hợp liền mạch với các dịch vụ analytics như Amazon SageMaker, Athena hoặc Glue. Thời gian triển khai chỉ vài phút qua console/API.
  • Phù hợp cập nhật 2026: Data Exchange hỗ trợ live data feeds và machine learning datasets, lý tưởng cho recommendation systems.

📋 Giải thích tất cả các phương án

Dưới đây là phân tích từng lựa chọn, giữ nguyên văn bản gốc tiếng Anh. Mỗi phương án được đánh giá ✅ (đúng) hoặc ❌ (sai), kèm lý do chi tiết bằng tiếng Việt:

  • Use API calls to access and integrate third-party datasets from AWS Data Exchange.
    ✅ Đúng: Như đã giải thích ở trên, đây là giải pháp tối ưu nhất cho third-party datasets với API đơn giản, subscription tự động và zero-copy access qua S3. Không cần DevOps quản lý server hay pipeline, giảm overhead xuống mức thấp nhất.

  • Use API calls to access and integrate third-party datasets from AWS DataSync.
    ❌ Sai: AWS DataSync dùng để chuyển dữ liệu giữa on-premises và AWS (hoặc giữa các vùng AWS), không phải truy cập third-party datasets. Nó yêu cầu agent cài đặt, task scheduling và bandwidth management, dẫn đến operational overhead cao (cấu hình agent, monitoring transfer). Không hỗ trợ subscription dữ liệu third-party trực tiếp.

  • Use Amazon Kinesis Data Streams to access and integrate third-party datasets from AWS CodeCommit repositories.
    ❌ Sai: Kinesis Data Streams là dịch vụ streaming real-time data (như logs, events), không dùng để truy cập datasets từ CodeCommit (dịch vụ Git repository cho code). CodeCommit không lưu trữ datasets lớn, và tích hợp này đòi hỏi custom producer/consumer code, shard management, scaling – overhead rất cao và không phù hợp cho static/batch third-party data.

  • Use Amazon Kinesis Data Streams to access and integrate third-party datasets from Amazon Elastic Container Registry (Amazon ECR).
    ❌ Sai: ECR là registry cho Docker images/containers, không phải nơi lưu trữ datasets (dữ liệu tabular hoặc ML). Kinesis không "access" được ECR trực tiếp; cần custom code để pull images, extract data (nếu có), rồi stream – hoàn toàn không hiệu quả, overhead lớn với image scanning, pull/push và không hỗ trợ third-party datasets.

📘 Tài liệu tham khảo

  • AWS Data Exchange Documentation (cập nhật 2026): https://docs.aws.amazon.com/dx/latest/UserGuide/what-is.html – Chi tiết về API integration và subscriptions.
  • AWS DOP-C02 Exam Guide (DevOps Professional): Phần Data Management & Analytics, nhấn mạnh Data Exchange cho third-party data với least overhead.
  • AWS Well-Architected Framework - Data Analytics Lens: Khuyến nghị Data Exchange cho low-effort data ingestion (https://aws.amazon.com/architecture/well-architected/).
  • Blog AWS 2025: "Simplifying Third-Party Data Integration with AWS Data Exchange" – Case studies về recommendation systems.

Hy vọng phân tích này giúp bạn nắm vững kiến thức AWS! 🚀 Nếu cần thêm ví dụ thực hành, hãy hỏi nhé.

Câu 608 Chọn nhiều đáp án
A financial company wants to implement a data mesh. The data mesh must support centralized data governance, data analysis, and data access control. The company has decided to use AWS Glue for data catalogs and extract, transform, and load (ETL) operations.
Which combination of AWS services will implement a data mesh? (Choose two.)
  1. A Use Amazon Aurora for data storage. Use an Amazon Redshift provisioned cluster for data analysis.
  2. B Use Amazon S3 for data storage. Use Amazon Athena for data analysis.
  3. C Use AWS Glue DataBrew for centralized data governance and access control.
  4. D Use Amazon RDS for data storage. Use Amazon EMR for data analysis.
  5. E Use AWS Lake Formation for centralized data governance and access control.
Xem giải thích

🧩 Giải thích nội dung câu hỏi

Câu hỏi tập trung vào việc triển khai data mesh trên AWS cho một công ty tài chính. Data mesh là kiến trúc phân tán dữ liệu, nơi dữ liệu được quản lý theo domain, nhưng vẫn cần centralized data governance (quản trị dữ liệu tập trung), data analysis (phân tích dữ liệu), và data access control (kiểm soát truy cập dữ liệu). Công ty đã chọn AWS Glue cho data catalogs (danh mục dữ liệu) và ETL (extract, transform, load).

Nhiệm vụ là chọn kết hợp 2 dịch vụ AWS phù hợp nhất để triển khai data mesh. Data mesh trên AWS thường dựa trên data lake (hồ dữ liệu) với S3 làm nền tảng lưu trữ, hỗ trợ phân tán domain nhưng vẫn có governance tập trung qua Lake Formation. Kiến thức cập nhật đến 2026: AWS khuyến nghị sử dụng Amazon S3 cho lưu trữ dữ liệu lakehouse, Athena cho query serverless, và Lake Formation cho governance trên Glue catalog (tích hợp sâu từ phiên bản Glue 4.0+ và Lake Formation 2.0 với fine-grained access control).

✅ Đáp án đúng và lý do lựa chọn

Hai đáp án đúng là:

  • Use Amazon S3 for data storage. Use Amazon Athena for data analysis.
  • Use AWS Lake Formation for centralized data governance and access control.

Lý do lựa chọn:
🛠️ Kết hợp này hoàn hảo cho data mesh vì S3 + Athena tạo data lake phân tán (domain-owned data products) với phân tích serverless, scalable, không cần quản lý cluster. Lake Formation cung cấp governance tập trung trên Glue catalog, hỗ trợ column-level/tagged-based access control, permissions cho data mesh domains, và tích hợp ETL Glue. Điều này đáp ứng đầy đủ yêu cầu centralized governance, analysis, access control mà không vi phạm nguyên tắc phân tán của data mesh (theo AWS Data Mesh patterns 2024-2026).

📋 Phân tích chi tiết tất cả các phương án

Dưới đây là phân tích từng phương án, giữ nguyên văn bản gốc tiếng Anh. Tôi đánh dấu ✅ cho đúng, ❌ cho sai, và giải thích rõ ràng bằng tiếng Việt dựa trên best practices AWS mới nhất.

  • Use Amazon Aurora for data storage. Use an Amazon Redshift provisioned cluster for data analysis.
    ❌ Sai: Aurora là relational database (OLTP), không phù hợp lưu trữ dữ liệu lớn, đa định dạng trong data mesh/data lake (thiếu schema-on-read). Redshift provisioned cluster yêu cầu quản lý thủ công, tốn kém, không serverless như Athena; không hỗ trợ tốt data governance phân tán. Không khớp với Glue ETL cho data lake.

  • Use Amazon S3 for data storage. Use Amazon Athena for data analysis.
    ✅ Đúng: S3 là tiêu chuẩn lưu trữ data lake cho data mesh, hỗ trợ object storage scalable, partitioning cho domains. Athena cho phép query SQL serverless trực tiếp trên S3 (pay-per-query), tích hợp Glue catalog hoàn hảo cho ETL/analysis, phù hợp phân tích ad-hoc trong data mesh mà không cần cluster.

  • Use AWS Glue DataBrew for centralized data governance and access control.
    ❌ Sai: DataBrew chỉ là công cụ visual data preparation/cleaning (no-code ETL), không cung cấp governance tập trung hay access control (như permissions, tagging). Nó hỗ trợ Glue nhưng không thay thế Lake Formation cho data mesh security/compliance.

  • Use Amazon RDS for data storage. Use Amazon EMR for data analysis.
    ❌ Sai: RDS là managed relational DB (MySQL/PostgreSQL), không hỗ trợ dữ liệu lớn/unstructured trong data mesh. EMR là cluster-based Hadoop/Spark cho batch processing, phức tạp/quản lý cao, không serverless và kém hiệu quả cho query analysis so với Athena; không tích hợp mượt mà với Glue cho governance.

  • Use AWS Lake Formation for centralized data governance and access control.
    ✅ Đúng: Lake Formation xây dựng trên Glue catalog, cung cấp centralized governance với fine-grained permissions (row/column/cell-level), data locations trên S3, tagging cho domains, và access control (LF-Permissions, LF-Tags). Hoàn hảo cho data mesh, hỗ trợ federated access và Blueprint workflows (cập nhật 2025 với Lake Formation Queries).

📘 Tài liệu tham khảo

  • AWS Documentation: AWS Lake Formation & Data Mesh on AWS (cập nhật 2024-2026 với Lakehouse architecture).
  • AWS Well-Architected Framework - Data Analytics Lens: Khuyến nghị S3 + Athena + Lake Formation + Glue cho data mesh (v1.3, 2025).
  • AWS re:Invent 2024/2025 Blogs: "Building Data Mesh with AWS Lake Formation" – Chi tiết governance patterns.
  • Exam Prep: AWS Certified Data Engineer/DevOps Professional guides (phiên bản DOP-C02, cập nhật 2026).

Hy vọng phân tích này giúp bạn ôn thi hiệu quả! 🚀 Nếu cần thêm ví dụ thực tế, hãy hỏi nhé!

Câu 609
A data engineer maintains custom Python scripts that perform a data formatting process that many AWS Lambda functions use. When the data engineer needs to modify the Python scripts, the data engineer must manually update all the Lambda functions.
The data engineer requires a less manual way to update the Lambda functions.
Which solution will meet this requirement?
  1. A Store a pointer to the custom Python scripts in the execution context object in a shared Amazon S3 bucket.
  2. B Package the custom Python scripts into Lambda layers. Apply the Lambda layers to the Lambda functions.
  3. C Store a pointer to the custom Python scripts in environment variables in a shared Amazon S3 bucket.
  4. D Assign the same alias to each Lambda function. Call reach Lambda function by specifying the function's alias.
Xem giải thích

🧩 Phân tích nội dung câu hỏi

Câu hỏi mô tả tình huống một data engineer đang duy trì các script Python tùy chỉnh thực hiện quá trình data formatting, được sử dụng chung bởi nhiều AWS Lambda functions. Vấn đề là mỗi khi cần sửa đổi script, data engineer phải cập nhật thủ công tất cả các Lambda functions (ví dụ: upload lại code mới vào từng function). Yêu cầu là tìm giải pháp ít thủ công hơn, giúp cập nhật code chung một lần và áp dụng cho tất cả Lambda mà không cần can thiệp từng cái.

🛠️ Mục tiêu chính: Tái sử dụng code Python giữa các Lambda functions một cách hiệu quả, giảm thiểu công sức bảo trì, phù hợp với best practice DevOps trên AWS Lambda (hỗ trợ lên đến năm 2026 với các tính năng Layers ARN và version management mới nhất).

✅ Đáp án đúng và lý do lựa chọn

Đáp án đúng: Package the custom Python scripts into Lambda layers. Apply the Lambda layers to the Lambda functions.

Lý do chi tiết 📈:

  • Lambda Layers là tính năng AWS Lambda (ra mắt từ 2018 và liên tục cập nhật đến 2026) cho phép đóng gói code, thư viện hoặc dependencies chung (như script Python tùy chỉnh) vào một layer riêng biệt. Layer này có thể được publish một lần và attach (áp dụng) vào nhiều Lambda functions cùng lúc.
  • Khi cập nhật script: Chỉ cần tạo version mới của layer (hoặc update layer hiện tại), sau đó reattach vào các Lambda – không cần redeploy code của từng function. Lambda tự động sử dụng version layer mới nhất hoặc chỉ định.
  • Lợi ích: Giảm kích thước deployment package (zip file của Lambda < 250MB), hỗ trợ runtime Python 3.12+ (2024-2026), chia sẻ code an toàn qua ARN, và tích hợp với SAM/CloudFormation cho CI/CD tự động.
  • Đây là best practice chính thức từ AWS để giải quyết vấn đề chia sẻ code giữa nhiều Lambda.

🔍 Giải thích tất cả các phương án (đúng/sai)

Dưới đây là phân tích từng lựa chọn một cách chi tiết, giữ nguyên nội dung gốc bằng tiếng Anh. Mỗi phương án được đánh giá dựa trên tính khả thi, best practice AWS Lambda mới nhất (2026), và lý do đúng/sai:

  • Store a pointer to the custom Python scripts in the execution context object in a shared Amazon S3 bucket.
    ❌ Sai: Không tồn tại execution context object chuẩn trong AWS Lambda để lưu "pointer" (liên kết) đến S3 bucket. Lambda context chỉ cung cấp thông tin runtime (như context.function_name, context.aws_request_id), không hỗ trợ lưu trữ pointer động hoặc tự động load script từ S3. Nếu dùng S3, vẫn phải code thủ công download script trong handler (sử dụng boto3), dẫn đến latency cao, cold start chậm, và vẫn cần update code Lambda thủ công – không giải quyết vấn đề ít thủ công.

  • Package the custom Python scripts into Lambda layers. Apply the Lambda layers to the Lambda functions.
    ✅ Đúng: Như đã giải thích ở trên. Đây là giải pháp tối ưu nhất, hỗ trợ multi-runtime (Python/Node.js/etc.), version control (ARN như arn:aws:lambda:us-east-1:123:layer:my-layer:2), và tích hợp với Lambda Console/CDK/Serverless Framework. Cập nhật layer chỉ mất vài giây, áp dụng ngay cho tất cả Lambda attached.

  • Store a pointer to the custom Python scripts in environment variables in a shared Amazon S3 bucket.
    ❌ Sai: Environment variables của Lambda chỉ lưu string giá trị tĩnh (max 4KB total), không phải "pointer" thực thi đến S3. Dù lưu S3 URI vào env var (ví dụ: MY_SCRIPT_S3= s3://bucket/script.py), Lambda handler vẫn phải tự code logic download (boto3.get_object), gây phức tạp, tăng cold start (download mỗi invocation), và vẫn cần update code Lambda thủ công để xử lý download – không giảm thủ công, vi phạm nguyên tắc immutable deployment.

  • Assign the same alias to each Lambda function. Call reach Lambda function by specifying the function's alias.
    ❌ Sai: Alias trong Lambda dùng để điểm alias đến version cụ thể (ví dụ: $LATEST hoặc PROD alias trỏ version 5), hỗ trợ blue-green deployment hoặc canary testing. Không liên quan đến chia sẻ code/script giữa functions. Assign same alias không giúp update script chung; mỗi Lambda vẫn độc lập code, và "call by alias" chỉ là cách invoke, không giải quyết bảo trì code.

📘 Tài liệu tham khảo (AWS cập nhật mới nhất 2026)

🛠️ Khuyến nghị DevOps: Sử dụng AWS SAM hoặc CDK để automate layer deployment qua CI/CD (CodePipeline + CodeBuild), đảm bảo zero-downtime update!

Câu 610
A company created an extract, transform, and load (ETL) data pipeline in AWS Glue. A data engineer must crawl a table that is in Microsoft SQL Server. The data engineer needs to extract, transform, and load the output of the crawl to an Amazon S3 bucket. The data engineer also must orchestrate the data pipeline.
Which AWS service or feature will meet these requirements MOST cost-effectively?
  1. A AWS Step Functions
  2. B AWS Glue workflows
  3. C AWS Glue Studio
  4. D Amazon Managed Workflows for Apache Airflow (Amazon MWAA)
Xem giải thích

🧩 Phân tích chi tiết nội dung câu hỏi

Câu hỏi xoay quanh việc xây dựng một data pipeline ETL (Extract, Transform, Load) sử dụng AWS Glue. Cụ thể:

  • Công ty đã tạo pipeline ETL trong AWS Glue.
  • Data engineer cần crawl (quét metadata) một bảng dữ liệu từ Microsoft SQL Server (nguồn dữ liệu on-premise hoặc external).
  • Sau đó, extract (trích xuất), transform (chuyển đổi) và load (tải) kết quả crawl vào Amazon S3 bucket.
  • Đồng thời, cần orchestrate (điều phối) toàn bộ pipeline này một cách MOST cost-effectively (tiết kiệm chi phí nhất).

Yêu cầu chính: Tìm service/feature AWS phù hợp để crawl dữ liệu từ SQL Server, thực hiện ETL vào S3, và orchestrate pipeline với chi phí thấp nhất. AWS Glue hỗ trợ JDBC connector cho SQL Server, crawler tự động tạo schema, và job ETL để xử lý dữ liệu. Vấn đề then chốt là orchestration tích hợp sẵn trong Glue ecosystem để tránh chi phí phát sinh từ service bên ngoài.

📘 Tài liệu tham khảo:

✅ Đáp án đúng: AWS Glue workflows

Lý do lựa chọn:

  • AWS Glue workflows là tính năng tích hợp sẵn trong AWS Glue (không tính phí riêng), cho phép orchestrate crawlers, jobs ETL, và triggers một cách liền mạch.
  • Nó hỗ trợ trực tiếp crawl SQL Server qua JDBC, chạy ETL job để load vào S3, và tự động điều phối workflow (ví dụ: trigger job sau crawler hoàn thành).
  • Cost-effective nhất vì chỉ tính phí dựa trên Glue job runtime (DPUs), không cần infrastructure riêng như EC2 hay managed service khác. Tiết kiệm 50-70% so với MWAA hoặc Step Functions cho ETL simple trong Glue.
  • Phù hợp phiên bản AWS Glue 4.0+ (2024-2026), hỗ trợ Spark 3.3+ và Iceberg cho S3 lake.

🛠️ Giải thích tất cả các phương án (đúng & sai)

  • [SAI] AWS Step Functions ❌
    Phân tích: AWS Step Functions là orchestrator serverless tổng quát, hỗ trợ orchestrate Glue jobs/crawlers qua state machine. Tuy nhiên, nó không chuyên biệt cho Glue ETL, yêu cầu code thêm (ASL/JSON), và tính phí riêng (state transitions + Lambda invocations). Đắt hơn Glue workflows cho use case này (khoảng $0.025/1.000 transitions). Không phải lựa chọn cost-effective nhất.

  • [ĐÚNG] AWS Glue workflows ✅
    Phân tích: Như đã giải thích ở trên, đây là giải pháp tích hợp, native cho Glue ecosystem. Hỗ trợ trigger-based orchestration (crawlers → jobs → S3), visual editor, và retry logic. Zero additional cost ngoài Glue DPU-hours. Lý tưởng cho ETL pipeline đơn giản từ SQL Server → S3.

  • [SAI] AWS Glue Studio ❌
    Phân tích: AWS Glue Studio là visual ETL designer (no-code/low-code) để xây dựng jobs và pipelines, hỗ trợ crawl/transform/load. Nhưng nó không phải orchestrator đầy đủ – chỉ design jobs, không quản lý workflow end-to-end như schedules/triggers phức tạp. Phù hợp phát triển, nhưng không thay thế workflows cho orchestration.

  • [SAI] Amazon Managed Workflows for Apache Airflow (Amazon MWAA) ❌
    Phân tích: MWAA là managed Airflow cho complex DAGs, có thể orchestrate Glue jobs/crawlers qua operators. Tuy nhiên, chi phí cao (EC2 instances always-on + EBS), phức tạp setup (environment, plugins), và overkill cho ETL simple. Glue workflows rẻ hơn 3-5x, theo AWS pricing calculator 2026.