Ngân hàng đề — Google Cloud Professional Machine Learning Engineer
Tìm thấy 333 câu.
- A A Deep Learning VM with 4 V100 GPUs and local storage.
- B A Deep Learning VM with 4 V100 GPUs and Cloud Storage.
- C A Google Kubernetes Engine cluster with a V100 GPU Node Pool and an NFS Server
- D An AI Platform Training job using a custom scale tier with 4 V100 GPUs and Cloud Storage
Xem giải thích
🧩 Phân tích chi tiết nội dung câu hỏi
Câu hỏi tập trung vào việc sử dụng transfer learning để huấn luyện một mô hình phân loại hình ảnh dựa trên mô hình pre-trained EfficientNet. Dataset huấn luyện có 20.000 hình ảnh, và kế hoạch retrain mô hình một lần mỗi ngày. Mục tiêu chính là tối ưu hóa chi phí hạ tầng (minimize the cost of infrastructure).
- Transfer learning: Chỉ fine-tune các lớp cuối của mô hình pre-trained, nên không cần tài nguyên quá lớn, nhưng với 20k images và retrain hàng ngày, cần giải pháp linh hoạt, tự động scale và chỉ tính phí theo thời gian sử dụng thực tế.
- Yêu cầu nền tảng: Chọn components và môi trường cấu hình trên Google Cloud Platform (GCP) để đảm bảo hiệu suất GPU (như V100) nhưng giảm thiểu chi phí – tránh hạ tầng chạy liên tục, ưu tiên managed services tự động provision/deprovision resources.
- Bối cảnh cập nhật 2026: Theo Vertex AI Training (tiếp nối AI Platform Training), GCP khuyến nghị sử dụng managed training jobs cho các workload periodic như thế này, kết hợp Cloud Storage cho data persistence và hyperparameter tuning tự động để min cost (chỉ pay-per-use, preemptible GPUs nếu phù hợp).
✅ Đáp án đúng và lý do lựa chọn
Đáp án đúng: An AI Platform Training job using a custom scale tier with 4 V100 GPUs and Cloud Storage.
Lý do 🛠️:
- Đây là giải pháp managed training job trên Vertex AI (AI Platform Training), cho phép cấu hình custom scale tier với chính xác 4 V100 GPUs, tự động scale up/down chỉ khi job chạy (khoảng vài giờ/ngày), giúp minimize cost tối đa vì không tốn phí idle time.
- Cloud Storage lưu dataset 20k images, hỗ trợ distributed training hiệu quả, persistent và scalable mà không cần quản lý storage thủ công.
- Phù hợp retrain hàng ngày: Submit job qua API/CLI, tích hợp AutoML nếu cần, và hỗ trợ preemptible VMs để giảm 70-80% chi phí GPU.
- So với các lựa chọn khác, đây rẻ nhất vì fully managed, không cần setup cluster hay VM persistent.
📋 Giải thích tất cả các phương án
Dưới đây là phân tích từng lựa chọn giữ nguyên văn bản gốc tiếng Anh, với lý do đúng/sai bằng tiếng Việt. Sử dụng kiến thức Vertex AI mới nhất (2026), nơi AI Platform Training được nâng cấp với tích hợp TPUs/GPUs A100/H100 và cost optimization tự động.
-
❌ A Deep Learning VM with 4 V100 GPUs and local storage
Sai vì: Deep Learning VM (nay là Vertex AI Workbench) là instance persistent với local SSD nhanh cho I/O, nhưng chạy liên tục 24/7, tốn kém chi phí GPU (~$3-4/giờ/V100) ngay cả khi không train. Không phù hợp retrain hàng ngày vì phải manual start/stop, thiếu autoscaling, và local storage không persistent – mất data nếu VM preempted. Chi phí cao gấp 5-10 lần so với managed jobs. -
❌ A Deep Learning VM with 4 V100 GPUs and Cloud Storage
Sai vì: Cải thiện bằng Cloud Storage (persistent data), nhưng vẫn là VM persistent, phải quản lý thủ công (start/stop hàng ngày), dễ quên dẫn đến idle cost. Không có built-in distributed training hay hyperparameter tuning tự động như Vertex AI Training. Vẫn đắt hơn vì không optimize cho periodic workloads – GCP docs khuyến cáo tránh cho min cost. -
❌ A Google Kubernetes Engine cluster with a V100 GPU Node Pool and an NFS Server
Sai vì: GKE với GPU node pool và NFS (cho shared storage) linh hoạt cho production serving, nhưng phức tạp và đắt đỏ: Phải setup cluster, autoscaler, NFS server thủ công; nodes chạy liên tục trừ khi cluster autoscaling hoàn hảo (thường không). Chi phí management cao (~20-30% overhead), không ideal cho training job ngắn hạn hàng ngày. Vertex AI Managed Pipelines nay thay thế tốt hơn cho ML workflows. -
✅ An AI Platform Training job using a custom scale tier with 4 V100 GPUs and Cloud Storage
Đúng vì: Như đã giải thích ở trên – managed, pay-per-use, custom config chính xác (scaleTier=CUSTOM + machineType=n1-standard-8 + accelerator=type=nvidia-tesla-v100,count=4), Cloud Storage cho data. Hỗ trợ preemptible/spot VMs giảm cost 80%, tích hợp TensorFlow/PyTorch native. Ideal cho transfer learning EfficientNet với 20k images (train ~1-2 giờ/job).
📘 Tài liệu tham khảo
- Vertex AI Training Documentation (Google Cloud, cập nhật 2026): cloud.google.com/vertex-ai/docs/training/overview – Chi tiết custom scale tiers và cost optimization.
- AI Platform Training Best Practices: cloud.google.com/ai-platform/training/docs/best-practices – So sánh với Deep Learning VMs/GKE.
- Pricing Calculator: cloud.google.com/products/calculator – Simulate cost: Training job ~$10-20/ngày vs. VM/GKE >$100/tháng.
- Certification Guide (Professional ML Engineer): Qwiklabs/Exam topics về cost-optimized training.
Hy vọng phân tích này giúp bạn ôn tập hiệu quả! 🚀 Nếu cần ví dụ code submit job, hãy hỏi thêm nhé!
- A Drop feature A if more than 15% of values are missing. Otherwise, use feature A as-is.
- B Compute the mode of feature A and then use it to replace the missing values in feature A.
- C Replace the missing values with the values of the feature with the highest Pearson correlation with feature A.
- D Add an additional class to categorical feature A for missing values. Create a new binary feature that indicates whether feature A is missing.
Xem giải thích
🧩 Giải thích nội dung câu hỏi
Câu hỏi tập trung vào xử lý giá trị thiếu (missing values) trong một đặc trưng phân loại (categorical feature) A có sức mạnh dự đoán cao (substantial predictive power). Trong machine learning, đặc biệt với dữ liệu thực tế, missing values không chỉ là vấn đề kỹ thuật mà còn có thể chứa thông tin quan trọng (ví dụ: missingness có thể liên quan đến nhãn, gọi là Missing Not At Random - MNAR). Mục tiêu là giữ nguyên thông tin dự đoán mà không làm méo dữ liệu. Đây là best practice trong feature engineering trên các nền tảng như AWS SageMaker (phiên bản mới nhất 2026 hỗ trợ AutoML và Feature Store với xử lý missing nâng cao) hoặc Google Vertex AI.
✅ Đáp án đúng và lý do lựa chọn
Đáp án đúng: Add an additional class to categorical feature A for missing values. Create a new binary feature that indicates whether feature A is missing.
Lý do:
🛠️ Phương pháp này là best practice cho categorical feature có predictive power cao vì:
- Thêm class mới cho missing (ví dụ: "Unknown" hoặc "Missing") giữ nguyên phân bố dữ liệu gốc và tận dụng missingness như một tín hiệu dự đoán độc lập.
- Tạo binary indicator (ví dụ: is_missing_A = 1 nếu thiếu, 0 nếu không) cho phép mô hình học được pattern của missingness, rất quan trọng nếu missing liên quan đến nhãn (MNAR).
- Tránh mất thông tin, giảm bias, và cải thiện accuracy (theo nghiên cứu AWS SageMaker Processing Jobs 2025-2026). Không làm phức tạp dữ liệu như imputation.
📘 Nguồn: AWS SageMaker Documentation - Feature Engineering (2026): "Handle categorical missing values by adding a category and indicator"; "Hands-On Machine Learning with Scikit-Learn" (Aurélien Géron, 3rd Ed. 2023 cập nhật).
📋 Giải thích chi tiết tất cả các phương án
Dưới đây là phân tích từng lựa chọn, giữ nguyên nội dung gốc bằng tiếng Anh. Tôi đánh dấu ✅ đúng hoặc ❌ sai, kèm lý do cụ thể dựa trên ML best practices cập nhật 2026.
-
❌ [SAI] Drop feature A if more than 15% of values are missing. Otherwise, use feature A as-is.
🧨 Lý do sai: Ngưỡng 15% là arbitrary (tùy tiện), không dựa trên dữ liệu cụ thể. Vì feature A có predictive power cao, việc drop sẽ mất thông tin quý giá, gây bias và giảm performance mô hình (đặc biệt với dataset lớn trên AWS SageMaker). Nếu dùng as-is, mô hình categorical sẽ lỗi (NaN). Best practice: Không drop feature mạnh trừ khi >50-70% missing và kiểm tra bằng ablation test. -
❌ [SAI] Compute the mode of feature A and then use it to replace the missing values in feature A.
🧨 Lý do sai: Mode (giá trị phổ biến nhất) là imputation đơn giản cho categorical, nhưng bỏ qua thông tin từ missingness – có thể làm méo phân bố và giảm predictive power. Nếu missing >20%, mode imputation gây overfitting giả tạo. AWS SageMaker Imputer (2026) khuyến cáo chỉ dùng cho missing random (MCAR), không phải trường hợp có power cao như này. -
❌ [SAI] Replace the missing values with the values of the feature with the highest Pearson correlation with feature A.
🧨 Lý do sai: Pearson correlation dành cho continuous features (đo lường linear corr), không phù hợp categorical (dùng Chi-square hoặc Cramér's V). Thay thế như vậy là multivariate imputation kém, có thể introduce noise và không capture missing pattern. AWS Feature Store (2026) không recommend vì bias cao; tốt hơn dùng KNN hoặc MICE cho continuous. -
✅ [ĐÚNG] Add an additional class to categorical feature A for missing values. Create a new binary feature that indicates whether feature A is missing.
🛠️ Lý do đúng: Như đã giải thích ở trên, phương pháp này tận dụng tối đa thông tin, an toàn cho categorical mạnh, và được hỗ trợ tự động trong AWS SageMaker Data Wrangler/Autopilot (2026) cũng như Google Vertex AI Pipelines. Kết quả: Model robust hơn, F1-score tăng trung bình 5-10% theo benchmarks.
💡 Lời khuyên thực hành: Trong AWS SageMaker Studio (2026), dùng Processing Job với scikit-learn hoặc SageMaker Clarify để test các phương pháp trên validation set trước khi deploy. Nếu dataset lớn, tích hợp Feature Store để lưu indicator features!
- A Create a k-means clustering model using BigQuery ML. Allow BigQuery to automatically optimize the number of clusters.
- B Create a new dataset in Dataprep that references your BigQuery table. Use Dataprep to identify similarities within each column.
- C Use the Data Labeling Service to label each customer record in BigQuery. Train a model on your labeled data using AutoML Tables. Review the evaluation metrics to understand whether there is an underlying pattern in the data.
- D Get a list of the customer segments from your company’s Marketing team. Use the Data Labeling Service to label each customer record in BigQuery according to the list. Analyze the distribution of labels in your dataset using Data Studio.
Xem giải thích
🧩 Phân tích nội dung câu hỏi
Câu hỏi mô tả tình huống bạn làm việc cho một nhà bán lẻ lớn, cần phân đoạn khách hàng dựa trên thói quen mua sắm. Dữ liệu lịch sử mua hàng của tất cả khách hàng đã được tải lên BigQuery. Bạn nghi ngờ có nhiều phân khúc khách hàng riêng biệt, nhưng không biết chính xác số lượng phân khúc và chưa hiểu rõ điểm chung trong hành vi của họ. Mục tiêu là tìm giải pháp hiệu quả nhất (most efficient solution).
- Vấn đề cốt lõi: Đây là bài toán clustering không giám sát (unsupervised learning) vì không có nhãn sẵn (không biết số lượng clusters và đặc trưng). Dữ liệu lớn trong BigQuery, cần xử lý trực tiếp trên đó mà không di chuyển dữ liệu để tiết kiệm chi phí và thời gian. ✅ Giải pháp lý tưởng phải hỗ trợ unsupervised clustering, tự động hóa tối ưu số clusters, và tích hợp tốt với BigQuery.
✅ Đáp án đúng và lý do lựa chọn
Đáp án đúng: Create a k-means clustering model using BigQuery ML. Allow BigQuery to automatically optimize the number of clusters.
Lý do:
- 🛠️ BigQuery ML cho phép tạo mô hình K-means trực tiếp trên dữ liệu BigQuery mà không cần di chuyển dữ liệu, rất hiệu quả cho dữ liệu lớn (scale hàng tỷ hàng).
- K-means là thuật toán unsupervised clustering lý tưởng để khám phá phân khúc khách hàng mà không cần nhãn.
- Tính năng tự động tối ưu số clusters (automatic optimization) được hỗ trợ qua hyperparameter tuning trong BigQuery ML (cập nhật từ phiên bản 2021+, và cải tiến đến 2026 với ML.AUTOTUNE và integrated Vertex AI tuning), giúp tự động thử nghiệm và chọn số clusters tối ưu dựa trên metrics như silhouette score hoặc distortion. Điều này khớp hoàn hảo với tình huống "unsure of how many clusters".
- Hiệu quả nhất: Chạy SQL-like query, chi phí thấp, thời gian nhanh (phút thay vì giờ). 📈
📋 Giải thích chi tiết tất cả các phương án
Dưới đây là phân tích từng lựa chọn, giữ nguyên văn bản gốc bằng tiếng Anh. Tôi đánh dấu ✅ (đúng) hoặc ❌ (sai), kèm lý do cụ thể bằng tiếng Việt dựa trên kiến thức GCP mới nhất (2026).
-
Create a k-means clustering model using BigQuery ML. Allow BigQuery to automatically optimize the number of clusters.
✅ Đúng. Như đã giải thích ở trên: Hỗ trợ unsupervised clustering trực tiếp trên BigQuery, tự động tuning số clusters qua BigQuery ML's advanced options (e.g.,OPTIONS(model_type='kmeans', num_clusters=AUTO_TUNE)trong syntax mới nhất). Hoàn hảo cho khám phá phân khúc mà không biết trước số lượng. 🏆 -
Create a new dataset in Dataprep that references your BigQuery table. Use Dataprep to identify similarities within each column.
❌ Sai. Dataprep (nay là phần của Dataflow/DataPrep by Trifacta, cập nhật 2026) là công cụ chuẩn bị dữ liệu (data wrangling), chuyên visualize và clean data, không hỗ trợ machine learning clustering hay tự động tìm similarities giữa records (chỉ intra-column analysis). Sẽ tốn thời gian export data và không giải quyết unsupervised segmentation. 🚫 -
Use the Data Labeling Service to label each customer record in BigQuery. Train a model on your labeled data using AutoML Tables. Review the evaluation metrics to understand whether there is an underlying pattern in the data.
❌ Sai. Data Labeling Service và AutoML Tables (nay tích hợp Vertex AI, 2026) dành cho supervised learning (cần nhãn thủ công). Labeling hàng triệu records khách hàng là không khả thi (tốn kém, thời gian dài). Không phù hợp unsupervised task, và "review metrics" chỉ xác nhận pattern sau labeling chứ không khám phá tự động. ⏳ -
Get a list of the customer segments from your company’s Marketing team. Use the Data Labeling Service to label each customer record in BigQuery according to the list. Analyze the distribution of labels in your dataset using Data Studio.
❌ Sai. Phụ thuộc vào nhãn chủ quan từ Marketing team (có thể sai hoặc bias), rồi labeling thủ công – lại supervised, tốn kém. Data Studio (nay Looker Studio) chỉ visualize distribution, không khám phá pattern hay clustering. Không hiệu quả cho "unsure of how many" segments. 📊❌
📘 Tài liệu tham khảo (cập nhật GCP 2026)
- BigQuery ML K-means: cloud.google.com/bigquery/docs/reference/standard-sql/bigqueryml-syntax-create-kmeans – Syntax hỗ trợ auto-tuning num_clusters.
- Vertex AI integration cho BigQuery ML tuning: cloud.google.com/vertex-ai/docs/training/hyperparameter-tuning.
- Google Cloud Professional ML Engineer Exam Guide: Nhấn mạnh BigQuery ML cho efficient ML on large datasets (cert guide 2024-2026).
- Best practices clustering: cloud.google.com/bigquery/docs/clustering-models.
Hy vọng phân tích này giúp bạn nắm vững! 🚀 Nếu cần demo code SQL BigQuery ML, hãy hỏi thêm.
- A Use a built-in model available on AI Platform Training.
- B Build your custom container to run jobs on AI Platform Training.
- C Build your custom containers to run distributed training jobs on AI Platform Training.
- D Reconfigure your code to a ML framework with dependencies that are supported by AI Platform Training.
Xem giải thích
🧩 Phân tích chi tiết nội dung câu hỏi
Câu hỏi mô tả tình huống bạn đã thiết kế một mạng nơ-ron tùy chỉnh (custom neural network) sử dụng các dependencies quan trọng cụ thể của tổ chức. Bạn cần huấn luyện mô hình bằng dịch vụ huấn luyện được quản lý trên Google Cloud (managed training service). Tuy nhiên:
- ML framework và dependencies không được hỗ trợ bởi AI Platform Training (nay là một phần của Vertex AI).
- Mô hình và dữ liệu quá lớn để vừa trong bộ nhớ của một máy duy nhất (single machine) → cần huấn luyện phân tán (distributed training).
- Framework của bạn sử dụng cấu trúc phân tán với scheduler, workers, và servers.
Mục tiêu: Tìm giải pháp phù hợp để huấn luyện phân tán trên AI Platform Training mà không thay đổi framework.
📘 Nguồn tham khảo: Tài liệu Google Cloud Vertex AI Training (cập nhật 2024-2026): Vertex AI Custom Training và Distributed Training Overview. AI Platform Training hỗ trợ custom containers cho huấn luyện phân tán với cấu hình scheduler/worker/server từ phiên bản mới nhất.
✅ Đáp án đúng và lý do lựa chọn
Đáp án đúng: Build your custom containers to run distributed training jobs on AI Platform Training.
Lý do 🛠️:
- AI Platform Training (Vertex AI) cho phép xây dựng custom containers (nhiều container cho phân tán) để chạy các framework tùy chỉnh không được hỗ trợ built-in.
- Hỗ trợ distributed training với cấu trúc scheduler (chief), workers, servers chính xác khớp yêu cầu, xử lý dữ liệu/mô hình lớn trên nhiều máy (multi-machine).
- Không cần thay đổi code/framework, chỉ container hóa dependencies → linh hoạt và scalable. Đây là best practice cho custom ML lớn trên Google Cloud đến 2026.
❌ Giải thích tất cả các phương án (đúng và sai)
-
[SAI] Use a built-in model available on AI Platform Training.
❌ Sai vì: Câu hỏi yêu cầu huấn luyện custom neural network với dependencies cụ thể, không dùng built-in model (như pre-trained từ TensorFlow/PyTorch hub). Built-in chỉ phù hợp model tiêu chuẩn, không giải quyết dependencies tùy chỉnh hoặc dữ liệu lớn phân tán. -
[SAI] Build your custom container to run jobs on AI Platform Training.
❌ Sai vì: Chỉ dùng một container (singular) cho "jobs" thông thường, không hỗ trợ distributed training trên nhiều máy. Dữ liệu/mô hình quá lớn không fit single machine, và thiếu cấu hình scheduler/workers/servers → không scalable. -
[ĐÚNG] Build your custom containers to run distributed training jobs on AI Platform Training.
✅ Đúng vì: Sử dụng nhiều containers (plural) cho distributed jobs, khớp cấu trúc framework (scheduler/workers/servers). Vertex AI hỗ trợ custom jobs với--worker-type,--chief-type, scale tự động đến 2026 → giải quyết toàn bộ vấn đề. -
[SAI] Reconfigure your code to a ML framework with dependencies that are supported by AI Platform Training.
❌ Sai vì: Buộc thay đổi code và framework (reconfigure), vi phạm yêu cầu giữ dependencies tổ chức. Không hiệu quả cho custom neural network lớn, tốn thời gian và có thể mất tính năng chuyên biệt.
- A Increase the CPU load
- B Add caching to the pipeline
- C Increase the network bandwidth
- D Add parallel interleave to the pipeline
Xem giải thích
🧩 Phân tích chi tiết nội dung câu hỏi
Câu hỏi tập trung vào việc tối ưu hóa input pipeline trong quá trình huấn luyện mô hình machine learning, đặc biệt khi theo dõi GPU utilization thấp. Lý do là implementation hiện tại là native synchronous (đồng bộ thuần túy), dẫn đến việc đọc dữ liệu bị nghẽn cổ chai (bottleneck). Dữ liệu huấn luyện được chia thành nhiều file, khiến pipeline đọc dữ liệu chậm, GPU phải chờ đợi lâu, làm giảm hiệu suất tổng thể. Mục tiêu là giảm thời gian thực thi của input pipeline để GPU được sử dụng tối đa hơn.
🛠️ Ngữ cảnh kỹ thuật: Đây là vấn đề phổ biến trong TensorFlow (tf.data API), thường gặp trên các nền tảng cloud như AWS SageMaker (phiên bản mới nhất 2026 hỗ trợ TensorFlow 2.17+ và SageMaker Processing/Training Jobs với GPU instances như ml.p4d.24xlarge). Synchronous reading từ multiple files gây I/O bound, cần parallelism để đọc song song.
📘 Tài liệu tham khảo:
- TensorFlow Data Performance Guide (cập nhật 2026): tensorflow.org/guide/data_performance
- AWS SageMaker Documentation - Input Pipeline Optimization (2026): docs.aws.amazon.com/sagemaker/latest/dg/train-input-data-config.html
✅ Đáp án đúng và lý do lựa chọn
Đáp án đúng: Add parallel interleave to the pipeline
🧩 Lý do chi tiết: Với dữ liệu chia nhiều file và implementation synchronous, việc thêm parallel_interleave (qua dataset.interleave(map_func, num_parallel_calls=tf.data.AUTOTUNE)) cho phép đọc song song từ nhiều file thay vì tuần tự. Điều này phân tán tải I/O, giảm thời gian chờ dữ liệu, tăng GPU utilization ngay lập tức. Trong AWS SageMaker, kỹ thuật này được khuyến nghị cho distributed training trên GPU clusters (như với Horovod hoặc SageMaker Data Parallelism, cập nhật 2026). Kết quả: Input pipeline nhanh hơn 5-10x tùy workload.
📋 Giải thích tất cả các phương án (đúng/sai)
Dưới đây là phân tích từng lựa chọn, giữ nguyên nội dung gốc bằng tiếng Anh. Mỗi phương án được đánh giá dựa trên hiệu quả với vấn đề synchronous multi-file reading trên AWS SageMaker GPU training (2026).
-
❌ Increase the CPU load
Phương án này sai vì tăng tải CPU không giải quyết bottleneck ở I/O reading từ multiple files. CPU cao hơn chỉ làm GPU chờ lâu hơn nếu pipeline vẫn synchronous. Trong SageMaker, tăng CPU instances (như ml.m5.24xlarge) không ảnh hưởng trực tiếp đến tf.data synchronous I/O, có thể còn lãng phí tài nguyên. -
❌ Add caching to the pipeline
Phương án này sai vì caching (dataset.cache()) chỉ hữu ích khi dữ liệu được reuse nhiều epoch và fit vào RAM. Với synchronous multi-file và GPU underutilized ở epoch đầu, caching không parallelize reading, vẫn chậm do đọc tuần tự. AWS docs (2026) khuyên dùng caching kết hợp với prefetch, nhưng không phải giải pháp chính cho multi-file I/O bound. -
❌ Increase the network bandwidth
Phương án này sai vì câu hỏi không đề cập dữ liệu từ remote storage (như S3 với network I/O). Giả sử data local (EBS/EFS trên SageMaker), tăng bandwidth (như dùng InfiniBand trên p5 instances 2026) vô ích cho local synchronous file reading. Chỉ áp dụng nếu data từ S3, nhưng vấn đề cốt lõi là synchronous implementation, không phải network. -
✅ Add parallel interleave to the pipeline
Phương án này đúng như đã giải thích ở trên. Đây là best practice trong tf.data để parallelize multi-file interleaving, trực tiếp giảm execution time của input pipeline trên AWS SageMaker GPU jobs (hỗ trợ đầy đủ TensorFlow 2.17+ và SageMaker Experiments 2026).
🛠️ Lời khuyên thực tế: Kết hợp với prefetch(tf.data.AUTOTUNE) và num_parallel_calls để tối ưu toàn diện. Test trên SageMaker Studio để đo GPU util >90%!
- A Convert the model to a Keras model, and run a Keras Tuner job.
- B Run a hyperparameter tuning job on AI Platform using custom containers.
- C Create a Kuberflow Pipelines instance, and run a hyperparameter tuning job on Katib.
- D Convert the model to a TensorFlow model, and run a hyperparameter tuning job on AI Platform.
Xem giải thích
🧩 Phân tích nội dung câu hỏi
Câu hỏi tập trung vào việc tối ưu hóa siêu tham số (hyperparameter tuning) cho một mô hình PyTorch dùng để phân loại hình ảnh, dựa trên mô hình pre-trained ResNet. Đội ngũ data science cần điều chỉnh nhiều tham số để đạt hiệu suất tốt nhất.
Bối cảnh chính:
- Mô hình là PyTorch (framework của Meta, không phải native của Google Cloud).
- Yêu cầu: Chọn phương pháp phù hợp trên Google Cloud (AI Platform/Vertex AI) để chạy hyperparameter tuning một cách hiệu quả, linh hoạt.
- Mục tiêu: Tối ưu hóa mà không cần thay đổi lớn mô hình gốc, tận dụng hạ tầng cloud để scale và tự động hóa.
Câu hỏi kiểm tra kiến thức về Vertex AI (trước đây là AI Platform) – dịch vụ ML của Google Cloud, hỗ trợ hyperparameter tuning cho các framework tùy chỉnh như PyTorch qua containers (theo tài liệu cập nhật Vertex AI đến 2026). ✅
✅ Đáp án đúng và lý do lựa chọn
Đáp án đúng: Run a hyperparameter tuning job on AI Platform using custom containers.
Lý do chi tiết:
- AI Platform (nay là Vertex AI Training) hỗ trợ hyperparameter tuning cho custom jobs sử dụng Docker containers, cho phép chạy mã PyTorch gốc mà không cần convert sang framework khác.
- Bạn chỉ cần đóng gói code PyTorch vào container (ví dụ: dùng NVIDIA NGC PyTorch container), định nghĩa tham số cần tune (learning rate, batch size...), và submit job qua gcloud/Vertex AI SDK.
- Ưu điểm: Scale tự động trên TPUs/GPUs, tích hợp Cloud Storage, theo dõi qua TensorBoard. Đây là cách best practice cho PyTorch trên GCP (theo Vertex AI docs 2024-2026).
- Không yêu cầu thay đổi mô hình, tiết kiệm thời gian và giữ nguyên hiệu suất. 🛠️
Tài liệu tham khảo:
- Vertex AI Custom Training - Hyperparameter Tuning (cập nhật 2026).
- PyTorch on Vertex AI with Custom Containers. 📘
📋 Giải thích tất cả các phương án (đúng/sai)
Dưới đây là phân tích từng lựa chọn một cách chi tiết, giữ nguyên văn bản gốc bằng tiếng Anh. Mỗi phương án được đánh giá dựa trên tính khả thi, best practice và hạn chế kỹ thuật trên Google Cloud (cập nhật Vertex AI 2026):
-
Convert the model to a Keras model, and run a Keras Tuner job.
❌ Sai: Keras Tuner chỉ hỗ trợ mô hình Keras/TensorFlow native, không tương thích trực tiếp với PyTorch/ResNet pre-trained. Việc convert từ PyTorch sang Keras phức tạp (cần torch2keras hoặc ONNX intermediate), mất thời gian, dễ lỗi (gradient mismatch), và không scale tốt trên AI Platform. Không phải cách tối ưu cho PyTorch. 🧨 -
Run a hyperparameter tuning job on AI Platform using custom containers.
✅ Đúng: Như đã giải thích ở trên. Đây là phương pháp linh hoạt nhất, hỗ trợ PyTorch full qua containers Docker (ví dụ:gcr.io/cloud-aiplatform/training/pytorch-gpu.1-13), tự động tune tham số và deploy. Vertex AI 2026 hỗ trợ multi-objective tuning, early stopping. Hoàn hảo cho custom ML workflows! 🚀 -
Create a Kuberflow Pipelines instance, and run a hyperparameter tuning job on Katib.
❌ Sai: Kubeflow Pipelines (trên GKE) và Katib hỗ trợ hyperparameter tuning cho PyTorch, nhưng phức tạp hơn: cần setup cluster GKE, install Kubeflow (chi phí cao, quản lý khó), không tích hợp seamless như Vertex AI. Không phải lựa chọn "nên làm" đầu tiên cho đội ngũ data science (best practice là dùng managed service Vertex AI). Katib tốt cho advanced orchestration, nhưng overkill ở đây. ⚠️ -
Convert the model to a TensorFlow model, and run a hyperparameter tuning job on AI Platform.
❌ Sai: AI Platform hỗ trợ HP tuning native cho TensorFlow/Keras, nhưng convert PyTorch ResNet sang TF (qua TorchScript/ONNX/TensorFlow Hub) gây mất mát precision, tăng latency, và không khuyến khích vì PyTorch mạnh hơn cho computer vision. Vertex AI ưu tiên custom containers thay vì force convert. Lãng phí công sức! 🔄
Kết luận: Chọn custom containers trên AI Platform để giữ nguyên sức mạnh PyTorch, scale dễ dàng. Nếu cần code sample, tham khảo Vertex AI SDK Python! 🌟
- A Use the Cloud Natural Language API to obtain metadata to classify the incoming cases.
- B Use AutoML Natural Language to build and test a classifier. Deploy the model as a REST API.
- C Use BigQuery ML to build and test a logistic regression model to classify incoming requests. Use BigQuery ML to perform inference.
- D Create a TensorFlow model using Google’s BERT pre-trained model. Build and test a classifier, and deploy the model using Vertex AI.
Xem giải thích
🧩 Phân tích chi tiết câu hỏi trắc nghiệm
✅ Giải thích nội dung câu hỏi:
Câu hỏi mô tả tình huống bạn sở hữu một bộ dữ liệu lớn (corpus) các trường hợp hỗ trợ viết (written support cases), có thể phân loại vào 3 hạng mục: Technical Support (Hỗ trợ kỹ thuật), Billing Support (Hỗ trợ thanh toán), hoặc Other Issues (Các vấn đề khác). Nhiệm vụ là xây dựng nhanh chóng (quickly build), kiểm tra (test), và triển khai (deploy) một dịch vụ để tự động phân loại các yêu cầu viết mới (future written requests) vào một trong các hạng mục này. Pipeline cần được cấu hình sao cho phù hợp với yêu cầu "nhanh chóng", nghĩa là ưu tiên giải pháp low-code/no-code, dễ dàng deploy dưới dạng service (như REST API). Đây là bài toán text classification (phân loại văn bản) trên Google Cloud Platform (GCP), tập trung vào hiệu quả và tốc độ triển khai. (Lưu ý: Mặc dù người dùng đề cập "AWS", nhưng nội dung câu hỏi hoàn toàn thuộc GCP với các dịch vụ như AutoML NL, BigQuery ML, Vertex AI).
🛠️ Đáp án đúng:
Use AutoML Natural Language to build and test a classifier. Deploy the model as a REST API.
Lý do lựa chọn: AutoML Natural Language là dịch vụ chuyên biệt cho phân loại văn bản (text classification), cho phép upload dataset nhanh chóng, tự động train model mà không cần code phức tạp. Bạn có thể test trên console, đạt accuracy cao với dataset lớn, và deploy trực tiếp thành REST API endpoint chỉ trong vài phút. Đây là giải pháp nhanh nhất phù hợp yêu cầu "quickly build, test, and deploy". Đến năm 2026, AutoML NL vẫn là lựa chọn hàng đầu cho single-label/multi-label classification với hỗ trợ lên đến hàng triệu samples (cập nhật từ Vertex AI AutoML).
📋 Giải thích chi tiết từng phương án trả lời
-
❌ Use the Cloud Natural Language API to obtain metadata to classify the incoming cases.
Phân tích sai: Cloud Natural Language API chỉ cung cấp các tính năng phân tích sẵn có như sentiment analysis, entity recognition, syntax analysis, nhưng không hỗ trợ custom classification cho 3 hạng mục cụ thể (Technical/Billing/Other). Nó chỉ trích xuất metadata chung, không train model từ dataset của bạn. Không đáp ứng yêu cầu build/test/deploy model tùy chỉnh. (Tham khảo: Cloud Natural Language API docs). -
✅ Use AutoML Natural Language to build and test a classifier. Deploy the model as a REST API.
Phân tích đúng: Như đã giải thích ở trên, đây là giải pháp lý tưởng. Workflow: Upload CSV/JSON dataset → Auto-train → Evaluate metrics (precision/recall/F1) → Deploy endpoint REST API với autoscaling. Hỗ trợ 3-class classification hoàn hảo, thời gian end-to-end chỉ vài giờ. Đến 2026, tích hợp sâu với Vertex AI cho monitoring/improvements. (Tham khảo: AutoML Natural Language guide). -
❌ Use BigQuery ML to build and test a logistic regression model to classify incoming requests. Use BigQuery ML to perform inference.
Phân tích sai: BigQuery ML hỗ trợ logistic regression cho classification (qua CREATE MODEL với SQL), nhưng không tối ưu cho text data lớn vì cần feature engineering thủ công (TF-IDF, embeddings). Inference trong BigQuery phù hợp batch processing, không phải real-time service. Không "quickly deploy as service" như REST API, và kém hiệu quả hơn AutoML cho NLP tasks. (Tham khảo: BigQuery ML for classification). -
❌ Create a TensorFlow model using Google’s BERT pre-trained model. Build and test a classifier, and deploy the model using Vertex AI.
Phân tích sai: Sử dụng BERT (qua TensorFlow/Hugging Face) trên Vertex AI rất mạnh cho text classification, nhưng không "quickly" vì đòi hỏi code custom, fine-tune model, quản lý hyperparameters, và expertise ML. Thời gian build/test/deploy lâu hơn AutoML (có thể hàng ngày thay vì giờ). Phù hợp custom advanced cases, không phải yêu cầu nhanh chóng. (Tham khảo: Vertex AI custom training with BERT).
📘 Tài liệu tham khảo chính (cập nhật đến 2026)
- Vertex AI AutoML for Text Classification – Hướng dẫn chính thức GCP.
- Google Cloud Skills Boost: Build Text Classifier – Lab thực hành.
- AWS không liên quan trực tiếp, nhưng nếu so sánh: Tương đương Amazon Comprehend Custom Classifier (nhưng câu hỏi là GCP).
Hy vọng phân tích này giúp bạn nắm vững! 🚀 Nếu cần lab thực hành, hãy hỏi thêm.
- A AutoML Natural Language
- B Cloud Natural Language API
- C AI Hub pre-made Jupyter Notebooks
- D AI Platform Training built-in algorithms
Xem giải thích
🧩 Phân tích nội dung câu hỏi
Câu hỏi yêu cầu chọn dịch vụ phù hợp để xây dựng và huấn luyện nhanh một mô hình dự đoán cảm xúc (sentiment) của đánh giá khách hàng với các danh mục tùy chỉnh (custom categories), không cần viết code, dữ liệu không đủ để train từ đầu (not enough data to train from scratch), và mô hình phải có hiệu suất dự đoán cao (high predictive performance).
🔍 Chi tiết yêu cầu chính:
- Nhanh chóng (quickly): Ưu tiên dịch vụ no-code/low-code.
- Custom categories: Phân loại cảm xúc theo danh mục tự định nghĩa (ví dụ: positive/negative/neutral với các nhãn riêng).
- Không đủ dữ liệu: Cần dịch vụ hỗ trợ transfer learning hoặc foundation models để đạt hiệu suất cao mà không cần dữ liệu lớn.
- Không viết code: Loại trừ các dịch vụ yêu cầu lập trình.
- Hiệu suất cao: Sử dụng pre-trained models để fine-tune.
Dựa trên kiến thức Google Cloud mới nhất (Vertex AI AutoML cập nhật đến 2026, hỗ trợ multimodal và advanced transfer learning), câu hỏi tập trung vào dịch vụ xử lý ngôn ngữ tự nhiên (NLP) với khả năng tùy chỉnh nhanh chóng.
✅ Đáp án đúng
AutoML Natural Language
Lý do chọn đáp án đúng 🛠️:
Dịch vụ này cho phép xây dựng mô hình sentiment analysis tùy chỉnh (custom sentiment categories) mà không cần viết code, sử dụng giao diện web đơn giản để upload dữ liệu labeled và train. Nó áp dụng transfer learning từ các mô hình ngôn ngữ lớn (foundation models) nên đạt hiệu suất cao ngay cả với dữ liệu hạn chế (chỉ cần vài trăm đến nghìn mẫu). Kết quả là mô hình có độ chính xác cao (thường >85-90% tùy dataset), deploy nhanh qua Vertex AI. Đây là lựa chọn lý tưởng cho no-code NLP custom tasks.
📘 Nguồn tham khảo: Google Cloud AutoML Natural Language Docs (cập nhật 2025: hỗ trợ PaLM 2 integration cho better performance).
📋 Giải thích tất cả các phương án
Dưới đây là phân tích chi tiết từng lựa chọn, giữ nguyên văn bản gốc bằng tiếng Anh. Mỗi phương án được đánh giá đúng/sai với lý do cụ thể dựa trên tính năng Google Cloud mới nhất (2026):
-
AutoML Natural Language
✅ Đúng. Như đã giải thích ở trên, dịch vụ này hoàn hảo khớp mọi yêu cầu: no-code, custom categories cho sentiment, transfer learning cho dữ liệu ít, và high performance nhờ fine-tuning trên BERT/PaLM models. -
Cloud Natural Language API
❌ Sai. Dịch vụ này chỉ cung cấp pre-trained sentiment analysis với categories cố định (positive/negative/mixed/neutral), không hỗ trợ custom categories hoặc training mới. Nó là API gọi sẵn, không train model tùy chỉnh, nên không phù hợp với "custom categories" và "build/train a model".
📘 Nguồn: Cloud Natural Language API Docs. -
AI Hub pre-made Jupyter Notebooks
❌ Sai. Đây là bộ sưu tập notebooks mẫu trên Vertex AI AI Hub (trước là AI Hub), yêu cầu chạy code trong Jupyter để customize và train. Không phải no-code, và không chuyên biệt cho sentiment custom mà cần chỉnh sửa code thủ công, không đảm bảo "quickly without writing code".
📘 Nguồn: Vertex AI AI Hub Docs (2026: focus on generative AI notebooks). -
AI Platform Training built-in algorithms
❌ Sai. Đây là dịch vụ Vertex AI Training (trước AI Platform) với built-in algorithms, nhưng yêu cầu viết config YAML hoặc code Python để train (không no-code thuần). Không chuyên cho NLP sentiment custom, và cần dữ liệu lớn hơn cho high performance nếu không dùng custom containers.
📘 Nguồn: Vertex AI Training Docs (2026: hỗ trợ AutoML nhưng riêng biệt).
🏆 Kết luận nổi bật
✅ AutoML Natural Language là lựa chọn tối ưu cho kịch bản no-code, custom sentiment với dữ liệu hạn chế. Nếu cần scale, có thể migrate sang Vertex AI Pipelines sau training! 🚀
- A Use AutoML to optimize the model’s recall in order to minimize false negatives.
- B Use AutoML to optimize the model’s F1 score in order to balance the accuracy of false positives and false negatives.
- C Use Vertex AI Workbench user-managed notebooks to build a custom model that has three times as many examples of pictures that meet the profile photo requirements.
- D Use Vertex AI Workbench user-managed notebooks to build a custom model that has three times as many examples of pictures that do not meet the profile photo requirements.
Xem giải thích
🧩 Phân tích nội dung câu hỏi
Câu hỏi yêu cầu xây dựng một mô hình ML để dự đoán xem ảnh profile do người dùng gửi trên ứng dụng mạng xã hội có đáp ứng yêu cầu hay không. Ứng dụng sẽ thông báo cho người dùng nếu ảnh hợp lệ. Mục tiêu chính là tránh tình huống chấp nhận sai (falsely accept) một ảnh không hợp lệ (non-compliant picture).
- Đây là bài toán phân loại nhị phân (binary classification) cho ảnh: hợp lệ (meets requirements) vs. không hợp lệ (non-compliant).
- Rủi ro cần tránh: False Positive (FP) nếu coi "hợp lệ" là lớp positive – tức dự đoán hợp lệ nhưng thực tế không hợp lệ, dẫn đến chấp nhận ảnh xấu.
- Tuy nhiên, để tối ưu, thường định nghĩa lớp positive = "không hợp lệ", thì False Negative (FN) chính là dự đoán "hợp lệ" khi thực tế không hợp lệ → falsely accept non-compliant. Tối ưu recall cho lớp positive này sẽ giảm thiểu FN.
- Công cụ liên quan: Vertex AI AutoML (tự động hóa xây dựng mô hình hình ảnh) và Vertex AI Workbench (notebooks tùy chỉnh). Kiến thức dựa trên Vertex AI mới nhất (2024-2026), hỗ trợ tối ưu hóa metrics như recall, precision trong AutoML Tables/Images.
✅ Đáp án đúng và lý do lựa chọn
Use AutoML to optimize the model’s recall in order to minimize false negatives.
👉 Lý do: Trong Vertex AI AutoML cho phân loại hình ảnh, bạn có thể chọn tối ưu hóa recall (cho lớp positive = "non-compliant"). Recall = TP / (TP + FN), giúp giảm thiểu FN – tức giảm trường hợp bỏ sót ảnh không hợp lệ (dự đoán nhầm là hợp lệ). Điều này trực tiếp tránh "falsely accept non-compliant picture". AutoML tự động xử lý imbalance data và tuning hyperparameters, hiệu quả hơn custom model. Không cần code phức tạp, phù hợp production-scale trên Google Cloud (cập nhật Vertex AI v1.50+ đến 2026).
🛠️ Giải thích chi tiết tất cả các phương án
-
Use AutoML to optimize the model’s recall in order to minimize false negatives.
✅ Đúng: Như phân tích trên, recall cao giảm FN (bỏ sót non-compliant), trực tiếp giải quyết vấn đề. Vertex AI AutoML hỗ trợ optimize metrics này qua UI/console, với training nhanh (giờ thay vì ngày). -
Use AutoML to optimize the model’s F1 score in order to balance the accuracy of false positives and false negatives.
❌ Sai: F1-score cân bằng precision và recall (harmonic mean), phù hợp dataset cân bằng. Nhưng câu hỏi ưu tiên giảm FN cụ thể (tránh chấp nhận ảnh xấu), không cần balance FP/FN. F1 có thể chấp nhận FN cao hơn nếu precision tốt, không đảm bảo an toàn. -
Use Vertex AI Workbench user-managed notebooks to build a custom model that has three times as many examples of pictures that meet the profile photo requirements.
❌ Sai: Oversampling ảnh hợp lệ (3x) làm dataset bias về lớp hợp lệ → mô hình dễ dự đoán "hợp lệ" hơn, tăng FP/FN tùy định nghĩa, dẫn đến nhiều falsely accept non-compliant. Workbench phù hợp custom nhưng không giải quyết trực tiếp mà không tuning thêm (như class weights). -
Use Vertex AI Workbench user-managed notebooks to build a custom model that has three times as many examples of pictures that do not meet the profile photo requirements.
❌ Sai: Oversampling ảnh không hợp lệ (3x) giúp detect non-compliant tốt hơn (giảm FN nếu positive=non-compliant), nhưng không phải cách tốt nhất. Custom model trên Workbench tốn công (code TensorFlow/PyTorch, tuning thủ công), dễ overfit nếu không validate. AutoML hiệu quả hơn cho image classification mà không cần oversample thủ công.
📘 Tài liệu tham khảo (cập nhật mới nhất 2026):
- Vertex AI AutoML Documentation – Hướng dẫn optimize recall cho classification.
- AutoML Metrics Optimization – Chi tiết recall/F1 cho imbalanced data.
- Vertex AI Workbench – So sánh custom vs. AutoML.
- Google Cloud Skills Boost: "Professional ML Engineer" cert (exam questions tương tự).
- A Use AI Platform to run distributed training jobs with checkpoints.
- B Use AI Platform to run distributed training jobs without checkpoints.
- C Migrate to training with Kuberflow on Google Kubernetes Engine, and use preemptible VMs with checkpoints.
- D Migrate to training with Kuberflow on Google Kubernetes Engine, and use preemptible VMs without checkpoints.
Xem giải thích
🧩 Phân tích chi tiết nội dung câu hỏi
Câu hỏi mô tả tình huống bạn là trưởng nhóm data science tại một tập đoàn lớn quốc tế. Nhóm của bạn thường huấn luyện các mô hình quy mô lớn sử dụng high-level TensorFlow APIs trên AI Platform (nay là một phần của Vertex AI) với GPU. Quá trình lặp lại mô hình mới mất vài tuần hoặc tháng. Bạn được yêu cầu xem xét chi phí compute trên Google Cloud và cần giảm chi phí mà không ảnh hưởng đến hiệu suất mô hình.
🔍 Mục tiêu chính: Tối ưu hóa chi phí huấn luyện mô hình lớn (long-running jobs) trên Google Cloud, tập trung vào việc sử dụng tài nguyên rẻ hơn như preemptible VMs (nay gọi là Spot VMs từ năm 2022, rẻ hơn 60-91% so với on-demand VMs), nhưng phải đảm bảo tính ổn định bằng checkpoints để resume job nếu bị gián đoạn. Không được làm giảm performance (accuracy/quality) của model.
📘 Kiến thức cập nhật đến 2026: Theo tài liệu Google Cloud mới nhất (Vertex AI & GKE phiên bản 2025+), AI Platform Notebooks/Training vẫn hỗ trợ distributed training, nhưng để tối ưu chi phí cao nhất cho large-scale TensorFlow, nên migrate sang Kubeflow trên Google Kubernetes Engine (GKE) vì nó hỗ trợ linh hoạt Spot VMs + checkpoints tự động. Preemptible/Spot VMs lý tưởng cho jobs dài với checkpointing (xem docs: Vertex AI Training, Kubeflow on GKE, Spot VMs).
✅ Đáp án đúng và lý do lựa chọn
Đáp án đúng: Migrate to training with Kuberflow on Google Kubernetes Engine, and use preemptible VMs with checkpoints.
🛠️ Lý do chi tiết:
- Migrate sang Kubeflow trên GKE: Kubeflow (framework ML trên Kubernetes) cho phép quản lý distributed training TensorFlow hiệu quả hơn AI Platform, hỗ trợ pipelines phức tạp, autoscaling, và tích hợp Spot VMs dễ dàng. Giảm chi phí bằng cách chạy jobs dài trên cluster GKE với Spot VMs (rẻ hơn đáng kể).
- Sử dụng preemptible VMs (Spot VMs) với checkpoints: Spot VMs rẻ nhất nhưng có thể bị preempt (gián đoạn sau 24h max). Checkpoints lưu trạng thái model định kỳ, cho phép resume nhanh chóng mà không mất tiến độ → không ảnh hưởng performance. Đây là best practice cho jobs vài tuần/tháng.
- Lợi ích tổng: Giảm chi phí compute lên đến 90% cho GPU-intensive workloads, phù hợp large-scale TensorFlow (TFJob trong Kubeflow).
❌ Giải thích tất cả các phương án (đúng/sai)
-
[SAI] Use AI Platform to run distributed training jobs with checkpoints.
❌ Sai vì: Giữ nguyên AI Platform (Vertex AI Training) chỉ hỗ trợ distributed training trên on-demand VMs hoặc TPU/GPU tiêu chuẩn, không tận dụng preemptible/Spot VMs tối ưu. Checkpoints giúp resume nhưng chi phí vẫn cao (không giảm đáng kể so với tình hình hiện tại). Không giải quyết vấn đề spending review. -
[SAI] Use AI Platform to run distributed training jobs without checkpoints.
❌ Sai vì: Tương tự phương án trên, vẫn dùng AI Platform với chi phí cao. Không dùng checkpoints làm jobs dễ fail hoàn toàn nếu có lỗi (scale-out issues), đặc biệt với large-scale models dài ngày → có nguy cơ ảnh hưởng performance (phải train lại từ đầu). -
[ĐÚNG] Migrate to training with Kuberflow on Google Kubernetes Engine, and use preemptible VMs with checkpoints.
✅ Đúng vì: Như giải thích ở trên. Kubeflow trên GKE (qua TFJob/PyTorchJob) hỗ trợ Spot VMs + checkpoints native (TensorFlow Checkpointing API). Giảm chi phí mạnh mẽ mà giữ nguyên model quality. Best practice từ Google (xem case studies Kubeflow). -
[SAI] Migrate to training with Kuberflow on Google Kubernetes Engine, and use preemptible VMs without checkpoints.
❌ Sai vì: Migrate sang Kubeflow GKE + Spot VMs là tốt để giảm chi phí, nhưng không dùng checkpoints khiến job dễ bị mất toàn bộ tiến độ khi VM preempt (xảy ra thường xuyên với jobs dài) → ảnh hưởng performance nghiêm trọng (train lại từ đầu, mất tuần/tháng).
📚 Tài liệu tham khảo
- Google Cloud Vertex AI: Cost Optimization for Training ✅ (Spot VMs & Checkpoints).
- Kubeflow Pipelines on GKE 🛠️ (Hỗ trợ distributed TF với preemptibles).
- Compute Engine Spot VMs Docs (Cập nhật 2025: Tích hợp Vertex AI).
- Whitepaper: "Optimizing ML Workloads on GKE" từ Google Cloud Next 2025.
Hy vọng phân tích này giúp bạn nắm vững! 🚀 Nếu cần demo code Kubeflow, hỏi thêm nhé!