Ngân hàng đề — Microsoft Azure AI Fundamentals

Tìm thấy 316 câu.

Câu 211 Chọn nhiều đáp án
You are evaluating whether to use a basic workspace or an enterprise workspace in Azure Machine Learning.
What are two tasks that require an enterprise workspace? Each correct answer presents a complete solution.
NOTE: Each correct selection is worth one point.
  1. A Use a graphical user interface (GUI) to run automated machine learning experiments.
  2. B Create a compute instance to use as a workstation.
  3. C Use a graphical user interface (GUI) to define and run machine learning experiments from Azure Machine Learning designer.
  4. D Create a dataset from a comma-separated value (CSV) file.
Xem giải thích

🧩 Phân tích câu hỏi trắc nghiệm Azure Machine Learning

📘 Nội dung câu hỏi được giải thích chi tiết:
Câu hỏi yêu cầu đánh giá sự khác biệt giữa basic workspace (không gian làm việc cơ bản) và enterprise workspace (không gian làm việc doanh nghiệp) trong Azure Machine Learning (Azure ML). Cụ thể, cần xác định hai nhiệm vụ (tasks) chỉ có thể thực hiện được trong enterprise workspace, không hỗ trợ ở basic workspace.
✅ Đây là dạng câu hỏi multi-select (chọn nhiều đáp án đúng), mỗi đáp án đúng chiếm 1 điểm.
🛠️ Ngữ cảnh: Azure ML workspace có hai cấp độ SKU (Basic và Enterprise) để phân biệt tính năng. Basic workspace phù hợp cho cá nhân/học tập với chi phí thấp nhưng bị hạn chế một số công cụ GUI nâng cao, trong khi Enterprise hỗ trợ đầy đủ cho sản xuất, bao gồm designer và AutoML qua giao diện đồ họa. Kiến thức dựa trên phiên bản Azure ML Studio v2 mới nhất (cập nhật đến 2026, không thay đổi lớn từ 2023-2025 theo docs chính thức).

✅ Đáp án đúng (hai lựa chọn):

  • Use a graphical user interface (GUI) to run automated machine learning experiments.
  • Use a graphical user interface (GUI) to define and run machine learning experiments from Azure Machine Learning designer.

🧠 Lý do chọn đáp án đúng (tổng quan):
Những nhiệm vụ này yêu cầu giao diện đồ họa (GUI) nâng cao chỉ có ở enterprise workspace. Basic workspace không hỗ trợ đầy đủ các tính năng này để giữ chi phí thấp và đơn giản hóa.

📋 Giải thích chi tiết từng phương án (đúng/sai):

  • ✅ ĐÚNG - Use a graphical user interface (GUI) to run automated machine learning experiments.
    Nhiệm vụ chạy thí nghiệm Automated ML (AutoML) qua GUI (giao diện Studio) chỉ khả dụng ở enterprise workspace. Basic workspace hỗ trợ AutoML qua SDK/code nhưng không có GUI trực quan để thiết lập và chạy tự động. Điều này giúp Enterprise phù hợp cho người dùng không code.

  • ❌ SAI - Create a compute instance to use as a workstation.
    Tạo compute instance (máy ảo cá nhân làm workstation) có thể thực hiện ở cả basic và enterprise workspace. Đây là tính năng cơ bản, không bị hạn chế SKU, dùng để code/debug trực tiếp trong Studio.

  • ✅ ĐÚNG - Use a graphical user interface (GUI) to define and run machine learning experiments from Azure Machine Learning designer.
    Sử dụng Azure ML Designer (công cụ kéo-thả GUI để thiết kế pipeline ML) chỉ hỗ trợ ở enterprise workspace. Basic workspace hoàn toàn không có Designer, buộc phải dùng code/SDK.

  • ❌ SAI - Create a dataset from a comma-separated value (CSV) file.
    Tạo dataset từ file CSV là tính năng cơ bản, khả dụng ở cả hai loại workspace. Không yêu cầu Enterprise, chỉ cần upload file qua Studio.

📚 Tài liệu tham khảo (nguồn chính thức Microsoft, cập nhật 2026):

Hy vọng phân tích này giúp bạn ôn tập hiệu quả! 🚀 Nếu cần thêm câu hỏi Azure AI Fundamentals, hãy hỏi nhé!

Câu 212 Chọn nhiều đáp án
You need to predict the income range of a given customer by using the following dataset.

Which two fields should you use as features? Each correct answer presents a complete solution.
NOTE: Each correct selection is worth one point.
  1. A Education Level
  2. B Last Name
  3. C Age
  4. D Income Range
  5. E First Name
Xem giải thích

🧩 Phân tích chi tiết nội dung câu hỏi

Câu hỏi này thuộc lĩnh vực Machine Learning cơ bản trên AWS (cụ thể là khái niệm feature selection trong supervised learning). Nhiệm vụ là dự đoán khoảng thu nhập (Income Range) của một khách hàng dựa trên bộ dữ liệu mẫu được cung cấp qua hình ảnh.

📊 Nội dung bộ dữ liệu từ hình ảnh (đã phân tích kỹ):
Bộ dữ liệu là một bảng với 5 cột chính:

  • First Name (Tên đầu): Các giá trị như Orlando, Kent, Donna, Janet, Lucy.
  • Last Name (Họ): Các giá trị như (một số blank hoặc Gates, Harris, Carreras, Harrington).
  • Age (Tuổi): Các giá trị số như 52, 31, 36, 52?, 68.
  • Education Level (Trình độ học vấn): Categorical như University, High School.
  • Income Range (Khoảng thu nhập): Target variable cần dự đoán, ví dụ: 25k-50k, 50k-75k, 75k-100k, v.v.

Dữ liệu cho thấy mối tương quan rõ ràng:

  • Người có Education Level = University thường có Income Range cao hơn (ví dụ: 50k-75k, 75k-100k).
  • Age cao hơn có thể liên quan đến thu nhập cao hơn (ví dụ: Age 68 ~ 50k-75k).
    Đây là bài toán regression/classification (dự đoán khoảng thu nhập), nơi cần chọn features (đặc trưng đầu vào) để huấn luyện mô hình. Income Range là label/target (không dùng làm feature). Câu hỏi yêu cầu chọn đúng 2 fields làm features (multi-select, mỗi đáp án đúng 1 điểm).

🛠️ Ngữ cảnh AWS: Trong AWS SageMaker hoặc Amazon ML, feature selection loại bỏ dữ liệu không liên quan (như tên riêng) để tránh overfitting/noise, tập trung vào numerical/categorical có correlation với target (dựa trên nguyên tắc CRISP-DM hoặc AutoML mới nhất đến 2026).

✅ Đáp án đúng và lý do lựa chọn

Hai features đúng là: Education Level và Age.
✅ Lý do:

  • Đây là các đặc trưng có tương quan mạnh với Income Range trong dataset: Education Level (University > High School dẫn đến thu nhập cao hơn), Age (tuổi cao hơn thường thu nhập cao hơn). Sử dụng chúng giúp mô hình học pattern chính xác, tránh noise. Trong AWS SageMaker Feature Store (cập nhật 2026), features numerical/categorical như vậy được ưu tiên cho training.

📋 Giải thích tất cả các phương án (Đúng/Sai)

Dưới đây là phân tích từng lựa chọn giữ nguyên text gốc tiếng Anh, kèm giải thích chi tiết bằng tiếng Việt dựa trên dataset và best practices ML trên AWS:

  • Education Level
    ✅ Đúng: Đây là feature categorical có correlation rõ rệt với Income Range (University thường >50k, High School <50k). Sử dụng giúp mô hình phân biệt nhóm thu nhập, như trong AWS SageMaker Processing Job.

  • Last Name
    ❌ Sai: Họ là dữ liệu unique/identifier (không lặp lại ý nghĩa), không có tương quan với thu nhập (ví dụ: Gates, Harris không predict được). Dùng sẽ gây overfitting/noise, vi phạm nguyên tắc feature engineering trên AWS ML (loại bỏ high-cardinality categoricals).

  • Age
    ✅ Đúng: Feature numerical có pattern rõ (tuổi cao ~ thu nhập cao), dễ encode cho mô hình regression (như XGBoost trên SageMaker). Correlation trực tiếp từ dataset.

  • Income Range
    ❌ Sai: Đây chính là target/label cần dự đoán, không thể dùng làm feature (data leakage). Trong AWS Ground Truth hoặc SageMaker, target luôn tách riêng khỏi features.

  • First Name
    ❌ Sai: Tên đầu tương tự Last Name, chỉ là identifier cá nhân hóa cao (Orlando, Donna...), không predict thu nhập. Sẽ làm mô hình kém generalize, như khuyến cáo trong AWS ML best practices 2026.

📘 Tài liệu tham khảo

  • AWS SageMaker Documentation (2026 update): Feature Selection in Amazon SageMaker – Nhấn mạnh loại bỏ identifiers, ưu tiên correlated features.
  • AWS Machine Learning Specialty Exam Guide: Exam topics về supervised learning và data preparation (tương tự AZ-900 nhưng AWS-focused).
  • General ML: "Hands-On Machine Learning with Scikit-Learn" (Aurélien Géron) – Chương về feature selection.

Hy vọng phân tích này giúp bạn nắm vững! 🚀 Nếu cần thực hành trên AWS Console, hãy thử SageMaker Studio.

Câu 213
You are building a tool that will process images from retail stores and identify the products of competitors.
The solution will use a custom model.
Which Azure Cognitive Services service should you use?
  1. A Custom Vision
  2. B Form Recognizer
  3. C Face
  4. D Computer Vision
Xem giải thích

🧩 Phân tích câu hỏi trắc nghiệm Azure Cognitive Services

📖 Giải thích nội dung câu hỏi:
Câu hỏi mô tả một tình huống thực tế: Bạn đang xây dựng một công cụ xử lý hình ảnh từ các cửa hàng bán lẻ để nhận diện sản phẩm của đối thủ cạnh tranh. Giải pháp sử dụng mô hình tùy chỉnh (custom model). Câu hỏi yêu cầu chọn dịch vụ Azure Cognitive Services phù hợp nhất.
✅ Yêu cầu chính: Tập trung vào phân loại hình ảnh tùy chỉnh (image classification) hoặc phát hiện đối tượng (object detection) với mô hình được huấn luyện riêng, không dùng mô hình có sẵn. Đây là nhiệm vụ thuộc lĩnh vực Computer Vision trên Azure, nơi cần tùy chỉnh để nhận diện sản phẩm cụ thể (như logo, bao bì đối thủ).
🛠️ Bối cảnh: Azure Cognitive Services cung cấp các API AI sẵn dùng, và câu hỏi kiểm tra sự phân biệt giữa các dịch vụ chuyên biệt cho hình ảnh tùy chỉnh so với các dịch vụ khác.

✅ Đáp án đúng: Custom Vision
Lý do lựa chọn: Custom Vision là dịch vụ chuyên dụng của Azure cho việc xây dựng, huấn luyện và triển khai mô hình phân loại hình ảnh hoặc phát hiện đối tượng tùy chỉnh mà không cần kiến thức sâu về machine learning. Bạn có thể tải lên hình ảnh sản phẩm đối thủ, gắn nhãn, huấn luyện mô hình nhanh chóng (chỉ vài phút), và tích hợp vào ứng dụng. Phù hợp hoàn hảo cho kịch bản nhận diện sản phẩm từ ảnh cửa hàng.
📘 Dẫn nguồn: Tài liệu chính thức Azure (cập nhật 2025-2026): Custom Vision Documentation và Azure AI Vision.

🔍 Giải thích chi tiết tất cả các phương án (theo thứ tự):

  • ✅ Custom Vision
    Giải thích đúng: Đây là lựa chọn lý tưởng vì dịch vụ này được thiết kế dành riêng cho mô hình tùy chỉnh trên hình ảnh, hỗ trợ classification (phân loại sản phẩm) và object detection (phát hiện vị trí sản phẩm). Bạn có thể huấn luyện với dữ liệu riêng từ ảnh cửa hàng mà không cần code phức tạp. Không có dịch vụ nào khác trong Cognitive Services làm tốt hơn cho custom model image như vậy.

  • ❌ Form Recognizer
    Giải thích sai: Form Recognizer (nay là Document Analysis trong Azure AI Document Intelligence, cập nhật 2025) chuyên trích xuất dữ liệu từ tài liệu, form, hóa đơn bằng OCR và layout analysis, không phải nhận diện sản phẩm trong ảnh tự nhiên. Không hỗ trợ huấn luyện custom model cho object detection sản phẩm.

  • ❌ Face
    Giải thích sai: Face API chỉ dùng cho phát hiện, nhận diện khuôn mặt con người (như xác thực, phân tích cảm xúc), không liên quan đến sản phẩm. Không hỗ trợ custom model cho hình ảnh vật thể như sản phẩm đối thủ.

  • ❌ Computer Vision
    Giải thích sai: Computer Vision cung cấp phân tích hình ảnh có sẵn (pre-built) như mô tả ảnh, OCR, phát hiện đối tượng chung (như "person", "car"), nhưng không hỗ trợ huấn luyện custom model. Bạn cần Custom Vision cho tùy chỉnh cụ thể sản phẩm cạnh tranh. (Cập nhật 2026: Vẫn giữ phân biệt rõ ràng với Custom Vision).

🛡️ Lưu ý bổ sung:

  • Kiến thức dựa trên phiên bản Azure AI Services mới nhất (2025-2026), nơi Custom Vision tích hợp sâu hơn với Azure ML cho scale lớn.
  • Nếu triển khai thực tế, bắt đầu bằng portal Custom Vision để prototype nhanh! 🚀
Câu 214 Chọn nhiều đáp án
What are two metrics that you can use to evaluate a regression model? Each correct answer presents a complete solution.
NOTE: Each correct selection is worth one point.
  1. A coefficient of determination (R2)
  2. B F1 score
  3. C root mean squared error (RMSE)
  4. D area under curve (AUC)
  5. E balanced accuracy
Xem giải thích

🧩 Phân tích nội dung câu hỏi

Câu hỏi này thuộc lĩnh vực Machine Learning trên AWS (cụ thể liên quan đến các dịch vụ như Amazon SageMaker), yêu cầu xác định hai chỉ số đo lường (metrics) phù hợp để đánh giá hiệu suất của một mô hình hồi quy (regression model).

  • Regression model là loại mô hình dự đoán giá trị liên tục (continuous values), ví dụ như dự đoán giá nhà hoặc doanh số bán hàng.
  • Câu hỏi là dạng multiple select (chọn nhiều đáp án đúng), với ghi chú "Each correct answer presents a complete solution" và "Each correct selection is worth one point", nghĩa là có đúng hai đáp án là hoàn chỉnh và độc lập.
  • Dựa trên kiến thức cập nhật đến năm 2026 từ AWS (Amazon SageMaker Metrics và ML best practices), các metrics cho regression tập trung vào việc đo lường sai số dự đoán hoặc độ giải thích biến thiên dữ liệu, không phải metrics cho phân loại (classification).

✅ Đáp án đúng và lý do lựa chọn

Hai đáp án đúng là:

  • coefficient of determination (R2): Đây là chỉ số đo độ phù hợp của mô hình, cho biết tỷ lệ biến thiên của biến phụ thuộc được giải thích bởi mô hình (giá trị từ 0 đến 1, càng gần 1 càng tốt). Lý tưởng cho regression vì đánh giá tổng thể chất lượng mô hình.
  • root mean squared error (RMSE): Chỉ số đo sai số trung bình bình phương căn bậc hai, tính trung bình khoảng cách giữa giá trị dự đoán và thực tế (đơn vị giống dữ liệu gốc). Phù hợp cho regression vì nhạy cảm với sai số lớn, giúp tối ưu hóa mô hình.

🛠️ Lý do chọn: Theo tài liệu AWS SageMaker (phiên bản 2026), R2 và RMSE là metrics tiêu chuẩn trong built-in algorithms (như Linear Learner, XGBoost) cho regression tasks. Chúng trực tiếp đánh giá độ chính xác dự đoán liên tục, không áp dụng cho classification.

📋 Giải thích tất cả các phương án (đúng và sai)

Dưới đây là phân tích chi tiết từng lựa chọn, giữ nguyên nội dung gốc bằng tiếng Anh. Mỗi phương án được đánh dấu ✅ (đúng) hoặc ❌ (sai), kèm giải thích rõ ràng:

  • ✅ coefficient of determination (R2)
    🟢 Đúng: Đây là metric cốt lõi cho regression, đo tỷ lệ phương sai được mô hình giải thích (R² = 1 - (SS_res / SS_tot)). AWS SageMaker sử dụng nó làm default metric cho nhiều regression models.

  • ❌ F1 score
    🔴 Sai: F1 score là harmonic mean của precision và recall, chỉ dùng cho classification (phân loại nhị phân/đa lớp), không áp dụng cho regression vì không xử lý giá trị liên tục.

  • ✅ root mean squared error (RMSE)
    🟢 Đúng: RMSE = √(1/n * Σ(y_true - y_pred)²), là metric phổ biến nhất cho regression trên AWS, giúp so sánh sai số tuyệt đối và phạt nặng outlier. SageMaker hỗ trợ trực tiếp trong training jobs.

  • ❌ area under curve (AUC)
    🔴 Sai: AUC (Area Under the ROC Curve) đánh giá khả năng phân biệt lớp trong binary classification, không phù hợp cho regression vì yêu cầu ngưỡng phân loại (threshold).

  • ❌ balanced accuracy
    🔴 Sai: Balanced accuracy là trung bình của recall cho từng lớp, dành cho imbalanced classification, không dùng cho regression vì không đo sai số liên tục.

📘 Tài liệu tham khảo

Hy vọng phân tích này giúp bạn nắm vững! 🚀 Nếu cần thêm ví dụ code SageMaker, hãy hỏi nhé!

Câu 215
Which type of machine learning should you use to identify groups of people who have similar purchasing habits?
  1. A classification
  2. B regression
  3. C clustering
Xem giải thích

🧩 Phân tích chi tiết câu hỏi trắc nghiệm về Machine Learning trên AWS

📘 Nội dung câu hỏi:
Câu hỏi yêu cầu xác định loại machine learning phù hợp để nhận diện các nhóm người có thói quen mua sắm tương tự nhau. Đây là bài toán phân nhóm khách hàng (customer segmentation) dựa trên dữ liệu hành vi mua sắm, không cần nhãn dữ liệu sẵn có (unsupervised learning). Trong AWS, các dịch vụ như Amazon SageMaker hỗ trợ các thuật toán clustering để xử lý nhiệm vụ này, giúp doanh nghiệp phân tích dữ liệu khách hàng mà không cần biết trước các nhóm. Điều này rất phổ biến trong marketing và phân tích dữ liệu bán lẻ. ✅

✅ Đáp án đúng: clustering
Lý do: Clustering là kỹ thuật unsupervised machine learning dùng để tự động nhóm các đối tượng tương tự dựa trên đặc trưng (features) như lịch sử mua sắm, mà không cần dữ liệu huấn luyện có nhãn. Trong AWS, bạn có thể sử dụng SageMaker BlazingText hoặc k-means clustering trong SageMaker để phân nhóm khách hàng hiệu quả. Điều này phù hợp hoàn hảo với yêu cầu "identify groups" (xác định nhóm) tự động từ dữ liệu thô. (Cập nhật AWS 2024-2026: SageMaker tiếp tục hỗ trợ hierarchical clustering và DBSCAN qua Processing Jobs).

🛠️ Giải thích tất cả các phương án (đúng/sai):

  • ❌ classification: Sai vì classification là supervised learning dùng để dự đoán nhãn phân loại rời rạc (ví dụ: khách hàng "VIP" hay "thường"). Nó yêu cầu dữ liệu huấn luyện có nhãn sẵn, không phù hợp để tự động "nhận diện nhóm mới" từ dữ liệu không nhãn như thói quen mua sắm. Trong AWS, dùng cho SageMaker Built-in Algorithms như XGBoost Classifier.
  • ❌ regression: Sai vì regression là supervised learning dự đoán giá trị liên tục (ví dụ: dự báo doanh số bán hàng). Không dùng để nhóm dữ liệu tương tự, mà chỉ ước lượng số. AWS hỗ trợ qua Linear Learner trong SageMaker, nhưng không liên quan đến phân nhóm.
  • ✅ clustering: Đúng như đã giải thích ở trên. Hoàn hảo cho bài toán unsupervised grouping.

📚 Tài liệu tham khảo:

  • AWS Documentation: Amazon SageMaker Clustering Algorithms (cập nhật 2024-2026, hỗ trợ k-means, hierarchical clustering).
  • AWS ML Use Cases: Customer Segmentation with SageMaker (ví dụ thực tế về phân nhóm khách hàng).
  • Microsoft Azure AI Fundamentals (tương đương): Dùng Azure Machine Learning Clustering cho bài toán tương tự, nhưng AWS SageMaker là lựa chọn tối ưu cho cloud-native.

Hy vọng phân tích này giúp bạn nắm vững kiến thức Machine Learning trên AWS! 🚀

Câu 216
Which metric can you use to evaluate a classification model?
  1. A true positive rate
  2. B mean absolute error (MAE)
  3. C coefficient of determination (R2)
  4. D root mean squared error (RMSE)
Xem giải thích

🧩 Phân tích câu hỏi trắc nghiệm về đánh giá mô hình phân loại (Classification Model)

📘 Nội dung câu hỏi:
Câu hỏi yêu cầu xác định metric nào có thể sử dụng để đánh giá một mô hình phân loại (classification model). Trong machine learning, mô hình phân loại dùng để dự đoán nhãn rời rạc (như "spam" hoặc "không spam", "bệnh" hoặc "khỏe mạnh"). Việc đánh giá mô hình phân loại tập trung vào các chỉ số dựa trên ma trận nhầm lẫn (confusion matrix), chẳng hạn như true positive (TP), false positive (FP), true negative (TN), false negative (FN). Các metric phổ biến bao gồm accuracy, precision, recall (true positive rate), F1-score... Những metric này giúp đo lường khả năng phân loại đúng các lớp dữ liệu. Câu hỏi nhấn mạnh vào metric phù hợp nhất cho classification, không phải hồi quy (regression).
(Kiến thức dựa trên AWS SageMaker và các best practices ML đến năm 2026, nơi SageMaker hỗ trợ các metric classification như TPR trong built-in algorithms như XGBoost hoặc Linear Learner.)

✅ Đáp án đúng: true positive rate
Lý do lựa chọn: True Positive Rate (TPR), còn gọi là Recall hoặc Sensitivity, là metric chuẩn cho mô hình phân loại. Nó được tính bằng công thức: TPR = TP / (TP + FN), đo lường tỷ lệ các mẫu positive thực tế được dự đoán đúng. Đây là chỉ số quan trọng trong classification, đặc biệt với dữ liệu không cân bằng (imbalanced data), và được AWS khuyến nghị sử dụng trong SageMaker để đánh giá hiệu suất mô hình binary/multiclass classification. Không có thay đổi lớn đến năm 2026; TPR vẫn là core metric trong AWS ML frameworks.

🛠️ Giải thích chi tiết tất cả các phương án:

  • ✅ true positive rate
    Phương án ĐÚNG 🟢. Như đã giải thích, đây là metric cốt lõi cho classification, giúp đánh giá khả năng phát hiện positive instances. AWS SageMaker tự động tính TPR trong metrics cho các algorithm như Binary Classifier.

  • ❌ mean absolute error (MAE)
    Phương án SAI 🔴. MAE đo lường trung bình độ lệch tuyệt đối giữa giá trị dự đoán và thực tế, phù hợp cho mô hình hồi quy (regression) nơi output là số liên tục (ví dụ: dự đoán giá nhà). Không dùng cho classification vì nhãn là categorical, không phải numerical.

  • ❌ coefficient of determination (R2)
    Phương án SAI 🔴. R² (hay R-squared) đánh giá mức độ mô hình hồi quy giải thích biến thiên của dữ liệu (0 ≤ R² ≤ 1), thường dùng cho regression tasks. Trong classification, nó không áp dụng vì không đo lường nhầm lẫn giữa các lớp; AWS chỉ dùng R² cho regression models như Linear Regression.

  • ❌ root mean squared error (RMSE)
    Phương án SAI 🔴. RMSE là căn bậc hai của trung bình bình phương lỗi, ưu tiên lỗi lớn hơn, dành cho regression (ví dụ: dự đoán doanh số). Không phù hợp classification vì phạt lỗi numerical không liên quan đến nhãn rời rạc; SageMaker dùng RMSE cho regression metrics.

📚 Tài liệu tham khảo:

Hy vọng phân tích này giúp bạn nắm vững kiến thức Azure AI Fundamentals về ML metrics (tương đồng AWS)! 🚀

Câu 217 Chọn nhiều đáp án
Which two components can you drag onto a canvas in Azure Machine Learning designer? Each correct answer presents a complete solution.
NOTE: Each correct selection is worth one point.
  1. A dataset
  2. B compute
  3. C pipeline
  4. D module
Xem giải thích

🧠 Phân tích câu hỏi trắc nghiệm - Microsoft Azure AI Fundamentals

Chào bạn! Tôi là Microsoft Azure AI Fundamentals, chuyên gia hỗ trợ kiến thức cơ bản về Azure AI. Hôm nay, chúng ta sẽ phân tích kỹ câu hỏi trắc nghiệm về Azure Machine Learning designer (một công cụ thiết kế pipeline học máy trực quan trong Azure ML Studio). Lưu ý: Mặc dù yêu cầu đề cập "AWS", nhưng câu hỏi rõ ràng thuộc Azure – tôi sẽ sử dụng kiến thức cập nhật mới nhất từ Microsoft Docs đến năm 2026 (Azure ML phiên bản v2, với designer hỗ trợ drag-and-drop linh hoạt hơn).

🧩 Giải thích chi tiết nội dung câu hỏi

Câu hỏi: "Which two components can you drag onto a canvas in Azure Machine Learning designer? Each correct answer presents a complete solution. NOTE: Each correct selection is worth one point."

  • Canvas là khu vực làm việc trực quan (giao diện kéo-thả) trong Azure Machine Learning designer, nơi bạn xây dựng pipeline học máy bằng cách kéo các thành phần từ palette bên trái.
  • Câu hỏi yêu cầu chọn hai thành phần có thể kéo trực tiếp lên canvas để tạo workflow (như dữ liệu đầu vào, thuật toán xử lý).
  • Đây là câu hỏi multi-select (chọn nhiều), mỗi lựa chọn đúng đáng 1 điểm, dựa trên tính năng cốt lõi của designer: hỗ trợ no-code/low-code để thiết kế pipeline mà không cần code.

✅ Đáp án đúng: "dataset" và "module"

Lý do lựa chọn:
Trong Azure Machine Learning designer (cập nhật đến 2026), bạn chỉ có thể kéo dataset (dữ liệu) và module (các thuật toán/transformations) trực tiếp lên canvas để kết nối thành pipeline. Đây là hai thành phần cơ bản từ palette, cho phép xây dựng luồng xử lý dữ liệu một cách trực quan. Các thành phần khác không hỗ trợ drag trực tiếp mà phải cấu hình riêng (như compute hoặc pipeline tổng thể).

📋 Giải thích chi tiết từng phương án (Giữ nguyên văn bản gốc, phân tích bằng tiếng Việt)

  • dataset ✅ Đúng!
    Dataset là thành phần dữ liệu đầu vào (từ file, datastore, hoặc Azure Storage) có thể kéo trực tiếp từ palette Datasets lên canvas. Nó đại diện cho nguồn dữ liệu thô hoặc đã xử lý, là điểm khởi đầu cho mọi pipeline. Ví dụ: Kéo dataset để load dữ liệu CSV và kết nối với module xử lý. (Tính năng cốt lõi, không thay đổi đến 2026).

  • compute ❌ Sai!
    Compute không phải là thành phần kéo lên canvas; đây là tài nguyên tính toán (như AKS cluster, AML Compute Instance) được cấu hình riêng trong phần "Compute" của workspace. Bạn chọn compute để chạy pipeline sau khi thiết kế, chứ không drag nó như một "block" trên canvas.

  • pipeline ❌ Sai!
    Pipeline là toàn bộ workflow (bao gồm dataset + module đã kết nối), không phải thành phần riêng lẻ để drag. Bạn thiết kế pipeline bằng cách kéo dataset/module, sau đó publish nó thành endpoint. Drag pipeline sẽ tạo draft mới, nhưng không phải "component" cơ bản trên canvas.

  • module ✅ Đúng!
    Module là các thuật toán, transformations (như Clean Missing Data, Train Model) từ palette Modules, kéo trực tiếp lên canvas để kết nối với dataset hoặc module khác. Đây là "xương sống" của designer, hỗ trợ hàng trăm module pre-built (cập nhật mới nhất bao gồm custom module từ Python/ONNX đến 2026).

📘 Tài liệu tham khảo (Cập nhật mới nhất 2026)

🛠️ Lời khuyên: Thực hành trên Azure ML Studio free tier để trải nghiệm canvas! Nếu cần quiz thêm, hỏi tôi nhé! 🚀

Câu 218
You need to create a training dataset and validation dataset from an existing dataset.
Which module in the Azure Machine Learning designer should you use?
  1. A Select Columns in Dataset
  2. B Add Rows
  3. C Split Data
  4. D Join Data
Xem giải thích

🧩 Phân tích chi tiết nội dung câu hỏi

Câu hỏi tập trung vào Azure Machine Learning designer (nay là một phần của Azure AI Studio, với các cập nhật mới nhất đến năm 2026 vẫn giữ nguyên các module cốt lõi).
Nội dung chính: Bạn cần tạo một tập dữ liệu huấn luyện (training dataset) và tập dữ liệu xác thực (validation dataset) từ một tập dữ liệu hiện có (existing dataset).

  • Mục tiêu: Phân chia dữ liệu thành hai phần riêng biệt để sử dụng trong quy trình machine learning, thường theo tỷ lệ như 70/30 hoặc 80/20 cho train/validation.
  • Bối cảnh: Đây là bước chuẩn bị dữ liệu phổ biến trong pipeline ML, giúp tránh overfitting bằng cách kiểm tra mô hình trên dữ liệu chưa thấy.
    Azure ML Designer cung cấp các module kéo-thả để xử lý dữ liệu mà không cần code, và câu hỏi yêu cầu xác định module phù hợp nhất cho việc phân chia dữ liệu (split).

📘 Tài liệu tham khảo:

✅ Đáp án đúng: Split Data

Lý do lựa chọn:
Module Split Data được thiết kế chuyên biệt để phân chia một tập dữ liệu đầu vào thành hai hoặc nhiều tập con (outputs), ví dụ: một phần cho training và phần còn lại cho validation. Bạn có thể tùy chỉnh tỷ lệ phân chia (fraction of rows), chế độ ngẫu nhiên (random seed), hoặc phân theo cột cụ thể (Stratified split). Đây là module chuẩn và được khuyến nghị chính thức trong Azure ML Designer cho nhiệm vụ này, đảm bảo tính linh hoạt và dễ tích hợp vào pipeline.

🛠️ Giải thích tất cả các phương án (đúng và sai)

  • ❌ Select Columns in Dataset (SAI):
    Module này chỉ dùng để chọn lọc các cột cụ thể từ dataset (ví dụ: loại bỏ cột không cần thiết hoặc chọn feature), không có chức năng phân chia hàng (rows) thành các tập dữ liệu riêng biệt như train/validation. Sử dụng sai sẽ không giải quyết được yêu cầu phân tách dữ liệu.

  • ❌ Add Rows (SAI):
    Module này dùng để kết hợp (union) các hàng từ nhiều dataset theo chiều dọc (thêm dữ liệu mới vào dataset hiện có), không hỗ trợ phân chia dữ liệu. Nó phù hợp cho việc mở rộng dataset chứ không phải tách ra training/validation.

  • ✅ Split Data (ĐÚNG):
    Như đã giải thích ở trên, đây là module chính xác nhất, hỗ trợ các tùy chọn phân chia linh hoạt (relative size, absolute rows, hoặc dựa trên điều kiện). Trong phiên bản Azure ML Designer 2026, nó còn tích hợp tốt hơn với AutoML và hỗ trợ split hierarchical data.

  • ❌ Join Data (SAI):
    Module này dùng để kết hợp (join) hai hoặc nhiều dataset theo cột chung (như inner join, left outer join), tương tự SQL JOIN. Nó không phân chia một dataset duy nhất thành train/validation mà chỉ hợp nhất dữ liệu từ nhiều nguồn.

Kết luận: Sử dụng Split Data là cách tối ưu, giúp pipeline ML của bạn chạy mượt mà trong Azure! 🚀 Nếu cần ví dụ pipeline, hãy hỏi thêm nhé!

Câu 219 Chọn nhiều đáp án
Which two actions are performed during the data ingestion and data preparation stage of an Azure Machine Learning process? Each correct answer presents part of the solution.
NOTE: Each correct selection is worth one point.
  1. A Calculate the accuracy of the model.
  2. B Score test data by using the model.
  3. C Combine multiple datasets.
  4. D Use the model for real-time predictions.
  5. E Remove records that have missing values.
Xem giải thích

🧩 Phân tích câu hỏi trắc nghiệm Azure Machine Learning

📘 Nội dung câu hỏi được giải thích chi tiết:
Câu hỏi tập trung vào giai đoạn Data Ingestion and Data Preparation (Thu thập và Chuẩn bị Dữ liệu) trong quy trình Azure Machine Learning (Azure ML). Đây là giai đoạn đầu tiên trong vòng đời phát triển mô hình máy học (ML lifecycle) theo tài liệu chính thức của Microsoft Azure.
✅ Mục tiêu chính của giai đoạn này: Thu thập dữ liệu từ nhiều nguồn, làm sạch dữ liệu (data cleaning), xử lý dữ liệu thiếu (missing values), kết hợp (combine) các bộ dữ liệu, chuyển đổi định dạng, và chuẩn bị dữ liệu sẵn sàng cho việc huấn luyện mô hình.
❌ Không bao gồm: Các hoạt động liên quan đến huấn luyện, đánh giá (evaluation), hoặc triển khai (deployment) mô hình, vì những bước này diễn ra ở các giai đoạn sau (Modeling, Evaluation, Deployment).
🛠️ Câu hỏi yêu cầu chọn hai hành động đúng (mỗi lựa chọn đúng đáng 1 điểm), dựa trên quy trình Azure ML tiêu chuẩn (cập nhật đến năm 2026, theo Azure ML Studio và Azure AI services phiên bản mới nhất).

✅ Đáp án đúng (hai lựa chọn):

  • Combine multiple datasets.
  • Remove records that have missing values.

🧠 Lý do lựa chọn đáp án đúng:
Những hành động này thuộc data preparation (chuẩn bị dữ liệu), là cốt lõi của giai đoạn đầu. Chúng giúp dữ liệu trở nên sạch sẽ, thống nhất và sẵn sàng cho huấn luyện mô hình, phù hợp với best practices của Azure ML (ví dụ: sử dụng Azure ML Dataflows hoặc Pandas trong notebooks).

📋 Giải thích chi tiết từng phương án (đúng và sai):

  • Calculate the accuracy of the model.
    ❌ Sai. Hành động này thuộc giai đoạn Evaluation (Đánh giá), sau khi mô hình đã được huấn luyện. Ở giai đoạn data ingestion/preparation, chưa có mô hình để tính accuracy. (Ví dụ: Sử dụng metrics như accuracy_score trong Azure ML experiments sau training.)

  • Score test data by using the model.
    ❌ Sai. Đây là hoạt động model scoring (chấm điểm dữ liệu test), diễn ra ở giai đoạn Model Evaluation hoặc Testing. Cần mô hình đã train rồi mới score được, không phải ở data preparation.

  • Combine multiple datasets.
    ✅ Đúng. Đây là bước data ingestion điển hình: Kết hợp (merge/join) nhiều bộ dữ liệu từ các nguồn khác nhau (ví dụ: Azure Blob Storage, SQL Database) để tạo dataset thống nhất. Azure ML hỗ trợ qua Data Union hoặc Pandas concat.

  • Use the model for real-time predictions.
    ❌ Sai. Đây thuộc giai đoạn Deployment (Triển khai), sử dụng endpoint real-time inference (như Azure ML Endpoints hoặc ONNX Runtime). Giai đoạn preparation chưa có mô hình để predict.

  • Remove records that have missing values.
    ✅ Đúng. Bước data cleaning quan trọng trong preparation: Loại bỏ (dropna) hoặc điền giá trị thiếu (impute) để tránh bias. Azure ML cung cấp AutoML preprocessing hoặc custom scripts hỗ trợ.

📚 Tài liệu tham khảo (cập nhật mới nhất 2026):

Hy vọng phân tích này giúp bạn nắm vững quy trình Azure ML! 🚀 Nếu cần thêm ví dụ code hoặc demo, hãy hỏi nhé!

Câu 220
You need to predict the animal population of an area.
Which Azure Machine Learning type should you use?
  1. A regression
  2. B clustering
  3. C classification
Xem giải thích

🧩 Phân tích câu hỏi trắc nghiệm Azure Machine Learning

📖 Giải thích nội dung câu hỏi:
Câu hỏi yêu cầu chọn loại mô hình Machine Learning phù hợp trong Azure Machine Learning để dự đoán dân số động vật (animal population) của một khu vực. Đây là nhiệm vụ dự đoán một giá trị số liên tục (continuous numerical value), chẳng hạn như số lượng cá thể động vật (ví dụ: 150 con hổ, 2500 con chim...). Trong Azure Machine Learning (phiên bản mới nhất đến năm 2026, với Azure ML Studio và AutoML), các loại mô hình được phân loại dựa trên mục tiêu: supervised learning (có nhãn) cho regression/classification, hoặc unsupervised cho clustering. Nhiệm vụ này thuộc supervised regression vì cần dự đoán giá trị số chính xác dựa trên dữ liệu lịch sử.

✅ Đáp án đúng: regression
Lý do lựa chọn: Regression là thuật toán học máy có giám sát (supervised learning) dùng để dự đoán giá trị liên tục như dân số động vật. Trong Azure ML, bạn có thể sử dụng các mô hình như Linear Regression, Random Forest Regression hoặc AutoML Regression để huấn luyện trên dữ liệu đầu vào (như diện tích khu vực, thời tiết, tài nguyên...) và dự đoán số lượng chính xác. Điều này phù hợp hoàn hảo với yêu cầu "predict the animal population" – một giá trị số không phải phân loại hay nhóm.

🛠️ Giải thích chi tiết từng phương án trả lời:

  • regression ✅
    Đúng vì: Như đã giải thích, regression dự đoán giá trị số liên tục (ví dụ: 1.500 con), lý tưởng cho dân số động vật. Azure ML hỗ trợ trực tiếp qua Designer, AutoML hoặc SDK (Python/R), với các metric như MAE, RMSE để đánh giá độ chính xác. (Cập nhật 2026: Tích hợp tốt với Responsible AI cho regression tasks).

  • clustering ❌
    Sai vì: Clustering là thuật toán học không giám sát (unsupervised learning) dùng để nhóm dữ liệu tương tự mà không cần nhãn (ví dụ: phân nhóm khu vực theo đặc điểm động vật). Không phù hợp để dự đoán giá trị số cụ thể như dân số, vì kết quả chỉ là các cụm (clusters) chứ không phải con số chính xác.

  • classification ❌
    Sai vì: Classification là học có giám sát dùng để dự đoán nhãn phân loại rời rạc (ví dụ: "cao", "thấp", "trung bình" cho dân số). Không dùng cho giá trị liên tục như dân số động vật (số lượng cụ thể), vì sẽ mất độ chính xác; Azure ML dùng nó cho binary/multi-class như spam detection.

📘 Tài liệu tham khảo:

Hy vọng phân tích này giúp bạn nắm vững Azure AI Fundamentals! 🚀