Ngân hàng đề — Microsoft Azure AI Fundamentals

Tìm thấy 316 câu.

Câu 201
You run a charity event that involves posting photos of people wearing sunglasses on Twitter.
You need to ensure that you only retweet photos that meet the following requirements:
✑ Include one or more faces.
✑ Contain at least one person wearing sunglasses.
What should you use to analyze the images?
  1. A the Verify operation in the Face service
  2. B the Detect operation in the Face service
  3. C the Describe Image operation in the Computer Vision service
  4. D the Analyze Image operation in the Computer Vision service
Xem giải thích

🧩 Phân tích chi tiết nội dung câu hỏi

Câu hỏi mô tả một tình huống thực tế: Bạn đang tổ chức sự kiện từ thiện, đăng ảnh mọi người đeo kính râm lên Twitter (nay là X). Yêu cầu chính là chỉ retweet những ảnh có ít nhất một khuôn mặt (one or more faces) và có ít nhất một người đeo kính râm (at least one person wearing sunglasses).
📌 Mục tiêu: Sử dụng dịch vụ AI để phân tích hình ảnh (analyze the images) nhằm kiểm tra tự động hai điều kiện trên, giúp lọc nội dung phù hợp trước khi retweet.
🛠️ Đây là bài toán về nhận diện khuôn mặt và thuộc tính (face detection & attributes) trong Azure Cognitive Services (cụ thể là Face API và Computer Vision API). Không liên quan trực tiếp đến AWS (có thể là nhầm lẫn chủ đề), mà tập trung vào các API phân tích hình ảnh của Microsoft Azure. Kiến thức dựa trên phiên bản mới nhất Azure AI Vision & Face API v4.0 (cập nhật đến 2026, hỗ trợ detect accessories như sunglasses).

✅ Đáp án đúng: the Detect operation in the Face service

Lý do chọn đáp án này (bằng tiếng Việt):
🧠 Detect operation trong Face service (nay là Azure AI Face) là công cụ lý tưởng vì:

  • Nó phát hiện tất cả khuôn mặt trong ảnh (detect faces) và trả về tọa độ, cùng thuộc tính chi tiết như accessories (bao gồm sunglasses: true/false).
  • Hoàn hảo khớp yêu cầu: Kiểm tra số lượng khuôn mặt ≥1 và ít nhất một khuôn mặt có sunglasses.
  • Hiệu suất cao, hỗ trợ batch processing cho nhiều ảnh từ Twitter.
    📘 Nguồn tham khảo: Azure AI Face - Detect API & Face Attributes (v4.0, cập nhật 2025).

📋 Giải thích tất cả các phương án (giữ nguyên tiếng Anh, phân tích bằng tiếng Việt)

  • ❌ the Verify operation in the Face service
    Sai vì: Verify dùng để so sánh hai khuôn mặt (1:1 matching) nhằm xác thực danh tính (identity verification), không detect nhiều khuôn mặt hay thuộc tính như sunglasses. Không phù hợp lọc ảnh hàng loạt từ Twitter.
    🛠️ Nguồn: Face Verify API.

  • ✅ the Detect operation in the Face service
    Đúng vì: Như giải thích trên, detect khuôn mặt + thuộc tính sunglasses chính xác, hỗ trợ returnRecognizedFaces=false để chỉ cần attributes. Lý tưởng cho automation.
    🛠️ Nguồn: Face Detect API.

  • ❌ the Describe Image operation in the Computer Vision service
    Sai vì: Describe Image chỉ mô tả tổng quát ảnh bằng caption (e.g., "a group of people wearing sunglasses"), không chi tiết detect khuôn mặt riêng lẻ hay xác định chính xác "ít nhất một người đeo kính". Độ chính xác thấp cho yêu cầu cụ thể.
    🛠️ Nguồn: Computer Vision Describe (v4.0).

  • ❌ the Analyze Image operation in the Computer Vision service
    Sai vì: Analyze Image hỗ trợ tags, objects, brands, adult content, nhưng không detect accessories như sunglasses trên khuôn mặt cụ thể. Nó có thể tag "sunglasses" như object chung, nhưng không liên kết với khuôn mặt (không đảm bảo "person wearing"). Face service chuyên sâu hơn.
    🛠️ Nguồn: Computer Vision Analyze (v4.0, 2025 updates).

Kết luận 🎯: Sử dụng Detect in Face service là lựa chọn tối ưu, tích hợp dễ với Twitter API qua Azure Functions. Nếu triển khai, thêm code mẫu: detection_model='detection_03' & returnFaceAttributes=['Accessories'].

Câu 202
When you design an AI system to assess whether loans should be approved, the factors used to make the decision should be explainable.
This is an example of which Microsoft guiding principle for responsible AI?
  1. A transparency
  2. B inclusiveness
  3. C fairness
  4. D privacy and security
Xem giải thích

🧩 Phân tích nội dung câu hỏi

Câu hỏi tập trung vào nguyên tắc hướng dẫn của Microsoft cho AI có trách nhiệm (Responsible AI). Cụ thể, khi thiết kế một hệ thống AI để đánh giá việc phê duyệt khoản vay, các yếu tố quyết định phải có thể giải thích được (explainable). Điều này nhấn mạnh nhu cầu minh bạch trong quá trình ra quyết định của AI, giúp người dùng hiểu rõ lý do đằng sau kết quả (ví dụ: tại sao một khoản vay được phê duyệt hoặc từ chối).
📘 Mục đích: Kiểm tra kiến thức về các nguyên tắc Responsible AI của Microsoft, nơi tính minh bạch giúp xây dựng lòng tin và tránh "hộp đen" (black box) trong AI. Kiến thức dựa trên tài liệu chính thức của Microsoft cập nhật đến năm 2026 (không thay đổi lớn từ phiên bản 2023-2025).

✅ Đáp án đúng và lý do lựa chọn

Đáp án đúng: transparency
🛠️ Lý do: Nguyên tắc Transparency của Microsoft yêu cầu các hệ thống AI phải dễ hiểu và có thể giải thích được các quyết định của chúng. Trong ví dụ phê duyệt khoản vay, việc làm rõ các yếu tố (như thu nhập, lịch sử tín dụng) chính là minh họa trực tiếp cho nguyên tắc này, giúp người dùng kiểm tra và tin tưởng vào AI.
📘 Nguồn tham khảo: Microsoft Responsible AI Principles và Azure AI Fundamentals documentation.

📋 Giải thích chi tiết tất cả các phương án

Dưới đây là phân tích từng lựa chọn, giữ nguyên văn bản gốc bằng tiếng Anh. Mỗi phương án được đánh giá đúng/sai dựa trên định nghĩa chính thức từ Microsoft Responsible AI (6 nguyên tắc cốt lõi: Fairness, Reliability & Safety, Privacy & Security, Inclusiveness, Transparency, Accountability).

  • transparency
    ✅ Đúng: Đây chính là nguyên tắc yêu cầu AI phải "transparent" – tức là các quyết định và yếu tố đầu vào phải có thể giải thích rõ ràng cho người dùng cuối. Ví dụ khoản vay phù hợp hoàn hảo vì cần explainability để tránh thiên kiến ẩn và xây dựng lòng tin.

  • inclusiveness
    ❌ Sai: Nguyên tắc Inclusiveness tập trung vào việc AI phải phục vụ mọi người một cách công bằng, đa dạng (bao gồm các nhóm thiểu số, văn hóa khác nhau), không phân biệt đối xử. Nó không liên quan trực tiếp đến việc giải thích yếu tố quyết định, mà nhấn mạnh tính tiếp cận và đại diện.

  • fairness
    ❌ Sai: Fairness nhằm đảm bảo AI không thiên kiến (bias) đối với các nhóm cá nhân hoặc xã hội, phân phối lợi ích/lợi nhuận công bằng. Mặc dù explainability hỗ trợ fairness (bằng cách phát hiện bias), nhưng câu hỏi cụ thể nhấn mạnh "explainable factors" chứ không phải công bằng hóa kết quả.

  • privacy and security
    ❌ Sai: Nguyên tắc Privacy and Security bảo vệ dữ liệu cá nhân, ngăn chặn rò rỉ thông tin và đảm bảo an toàn hệ thống. Ví dụ khoản vay có thể liên quan dữ liệu nhạy cảm, nhưng câu hỏi không đề cập bảo mật mà chỉ tập trung vào tính giải thích của các yếu tố quyết định.

Câu 203 Chọn nhiều đáp án
You are building an AI-based app.
You need to ensure that the app uses the principles for responsible AI.
Which two principles should you follow? Each correct answer presents part of the solution.
NOTE: Each correct selection is worth one point.
  1. A Implement an Agile software development methodology
  2. B Implement a process of AI model validation as part of the software review process
  3. C Establish a risk governance committee that includes members of the legal team, members of the risk management team, and a privacy officer
  4. D Prevent the disclosure of the use of AI-based algorithms for automated decision making
Xem giải thích

🧠 Phân tích Câu Hỏi Trắc Nghiệm - Microsoft Azure AI Fundamentals (AI-900)

Chào bạn! Tôi là Microsoft Azure AI Fundamentals 📘, chuyên gia hỗ trợ học tập về các nguyên tắc AI có trách nhiệm (Responsible AI) trên nền tảng Azure. Dưới đây là phân tích chi tiết, rõ ràng theo yêu cầu của bạn. Tôi sử dụng kiến thức cập nhật mới nhất từ Microsoft (phiên bản Azure AI đến năm 2026), dựa trên 6 nguyên tắc Responsible AI chính: Fairness (Công bằng), Reliability & Safety (Độ tin cậy & An toàn), Privacy & Security (Quyền riêng tư & Bảo mật), Inclusiveness (Bao hàm), Transparency (Minh bạch), và Accountability (Trách nhiệm). Lưu ý: Mặc dù bạn đề cập "liên quan đến AWS", câu hỏi này thuộc chương trình Azure AI Fundamentals của Microsoft, không phải AWS (AWS có Responsible AI khác biệt, như AWS Responsible AI guidelines 2024-2026).

🧩 1. Giải thích Nội dung Câu Hỏi Một Cách Chi Tiết

Câu hỏi tập trung vào việc xây dựng ứng dụng AI (AI-based app) và đảm bảo tuân thủ các nguyên tắc Responsible AI của Microsoft.

  • Mục tiêu: Chọn hai nguyên tắc (principles) đúng để áp dụng, mỗi lựa chọn đúng chiếm 1 điểm.
  • Bối cảnh: Responsible AI nhấn mạnh việc xây dựng AI an toàn, công bằng, minh bạch và có trách nhiệm, tránh rủi ro như bias (thiên vị), lỗi mô hình, vi phạm quyền riêng tư.
  • Yêu cầu chọn nhiều đáp án: Đây là dạng multi-select (chọn 2/4), phổ biến trong kỳ thi AI-900.
  • Tầm quan trọng: Trong Azure, các nguyên tắc này được tích hợp vào Azure AI services (như Azure Machine Learning, Cognitive Services) qua công cụ như Responsible AI Dashboard (cập nhật 2025 với Fairlearn và InterpretML tích hợp sâu hơn).

✅ 2. Đáp Án Đúng Và Lý Do Lựa Chọn

Hai đáp án đúng là:

  • Implement a process of AI model validation as part of the software review process ✅ (Nguyên tắc Reliability & Safety).
  • Establish a risk governance committee that includes members of the legal team, members of the risk management team, and a privacy officer ✅ (Nguyên tắc Accountability).

Lý do lựa chọn:

  • Những nguyên tắc này trực tiếp từ Microsoft Responsible AI Standard (cập nhật 2026), đảm bảo kiểm chứng mô hình AI (validation để tránh lỗi, bias) và quản trị rủi ro (committee đa bên để giám sát pháp lý, rủi ro, quyền riêng tư). Chúng là bước bắt buộc trong lifecycle phát triển AI trên Azure, giúp app an toàn và có trách nhiệm. Chọn sai sẽ không khớp với guidelines chính thức.

🛠️ 3. Giải Thích Tất Cả Các Phương Án (Đúng Và Sai)

Dưới đây là phân tích từng phương án một, giữ nguyên văn bản gốc tiếng Anh. Tôi đánh dấu ✅ (đúng) hoặc ❌ (sai), kèm giải thích chi tiết bằng tiếng Việt dựa trên Responsible AI principles.

  • Implement an Agile software development methodology
    ❌ Sai. Agile là phương pháp phát triển phần mềm linh hoạt (như Scrum/Kanban), nhưng không phải nguyên tắc Responsible AI cụ thể. Nó hỗ trợ phát triển nhanh nhưng không đảm bảo validation mô hình AI hay quản trị rủi ro. Microsoft khuyến nghị kết hợp Agile với Responsible AI, chứ không coi Agile là "principle" chính (xem Azure DevOps guidelines 2026).

  • Implement a process of AI model validation as part of the software review process
    ✅ Đúng. Đây là nguyên tắc Reliability & Safety, yêu cầu kiểm chứng mô hình AI (testing accuracy, robustness, fairness) trong quy trình review phần mềm. Trên Azure, dùng Model Interpretability và Fairness checks (qua Azure ML Studio, cập nhật 2025 với automated validation pipelines). Thiếu bước này có thể dẫn đến AI lỗi, như hallucination ở LLM.

  • Establish a risk governance committee that includes members of the legal team, members of the risk management team, and a privacy officer
    ✅ Đúng. Đây là nguyên tắc Accountability, yêu cầu thành lập ủy ban quản trị rủi ro đa ngành (legal, risk, privacy) để giám sát toàn bộ AI lifecycle. Microsoft yêu cầu điều này trong AI Governance Framework (cập nhật 2026, tích hợp Azure Purview cho compliance). Giúp phát hiện rủi ro sớm, tuân thủ GDPR/EU AI Act.

  • Prevent the disclosure of the use of AI-based algorithms for automated decision making
    ❌ Sai. Điều này vi phạm nguyên tắc Transparency – Microsoft yêu cầu công khai (disclose) việc sử dụng AI trong quyết định tự động (ví dụ: watermarking ở Azure OpenAI). "Prevent disclosure" là hành vi che giấu, trái với guidelines (xem Azure AI Content Safety 2026).

📚 4. Tài Liệu Tham Khảo (Nguồn Chính Thức)

  • Microsoft Learn - Azure AI Fundamentals (AI-900): Responsible AI principles (cập nhật 2026).
  • Microsoft Responsible AI Standard: What is Responsible AI? – Chi tiết 6 principles.
  • Azure Machine Learning Documentation: Model validation & governance (phiên bản 2026 với AI Risk Manager tool mới).
  • Kỳ thi AI-900 Practice: Các câu tương tự trên Microsoft Learn exam sandbox.

Hy vọng phân tích này giúp bạn ôn thi hiệu quả! Nếu cần thêm câu hỏi hoặc ví dụ thực hành trên Azure Portal, hãy hỏi nhé 🚀.

Câu 204
You have the Predicted vs. True chart shown in the following exhibit.

Which type of model is the chart used to evaluate?
  1. A classification
  2. B regression
  3. C clustering
Xem giải thích

🧩 Phân tích nội dung câu hỏi

Câu hỏi trình bày một biểu đồ có tiêu đề "Predicted vs. True", đây là biểu đồ scatter plot (biểu đồ phân tán) so sánh giá trị dự đoán (Predicted Value) trên trục dọc với giá trị thực tế (True Value) trên trục ngang.

📊 Mô tả chi tiết hình ảnh biểu đồ (dựa trên phiên bản mới nhất AWS SageMaker và các công cụ ML đến 2026):

  • Trục ngang (True Value): Phạm vi từ khoảng -130 đến 825, với các nhãn như -130.09, 7.72, 13.53, ..., 825. Phía dưới là histogram (biểu đồ cột tần suất) hiển thị phân bố dữ liệu True Value theo bin (5k, 10k, 15k, v.v.), cho thấy dữ liệu tập trung ở giá trị thấp và có phân bố lệch phải.
  • Trục dọc (Predicted Value): Phạm vi từ 0 đến 80.
  • Đường lý tưởng (Ideal - đường chấm đen ****): Đại diện cho đường hoàn hảo y = x (dự đoán bằng thực tế).
  • Đường trung bình dự đoán (Average Predicted Value - đường xanh dương): Theo sát đường ideal, cho thấy mô hình dự đoán trung bình khá tốt.
  • Các điểm dữ liệu (đen với viền xanh): Tạo thành đường xu hướng gần với đường ideal, chứng tỏ mối tương quan tuyến tính mạnh giữa dự đoán và thực tế.

🛠️ Mục đích biểu đồ: Đây là công cụ đánh giá hiệu suất mô hình học máy, cụ thể dùng để kiểm tra độ chính xác của dự đoán liên tục (continuous values). Biểu đồ này phổ biến trong AWS SageMaker Model Monitor hoặc Amazon SageMaker Clarify (cập nhật phiên bản 2026 hỗ trợ tích hợp tự động với biểu đồ này cho regression metrics như MAE, RMSE).

✅ Đáp án đúng: regression

Lý do chọn:

  • Biểu đồ Predicted vs. True là tiêu chuẩn vàng để đánh giá mô hình regression (hồi quy), nơi output là giá trị số liên tục (như giá nhà, doanh số). Các điểm dữ liệu nằm gần đường ideal (y=x) cho thấy mô hình dự đoán chính xác cao. Trong AWS SageMaker (phiên bản mới nhất 2026), biểu đồ này được dùng trực tiếp trong regression evaluation để tính metrics như R² score, Mean Absolute Error (MAE). Histogram bên dưới giúp phát hiện bias trong phân bố dữ liệu.

📋 Giải thích tất cả các phương án

  • ❌ classification:
    Phương án này sai vì mô hình classification (phân loại) xử lý nhãn rời rạc (categorical labels như "cat/dog", "spam/not spam"), không phải giá trị liên tục. Biểu đồ đánh giá classification thường là confusion matrix, ROC-AUC curve, hoặc precision-recall curve – không phải scatter plot Predicted vs. True với giá trị số thực tế. Trong AWS SageMaker, classification dùng metrics binary/multiclass riêng biệt.

  • ✅ regression:
    Phương án này đúng như đã giải thích ở trên. Biểu đồ khớp hoàn hảo với regression evaluation, nơi so sánh predicted continuous values vs. true continuous values. AWS cập nhật 2026 hỗ trợ tự động generate biểu đồ này trong SageMaker Studio.

  • ❌ clustering:
    Phương án này sai vì clustering (phân cụm) là unsupervised learning không có "predicted vs. true" (không có nhãn thực tế để so sánh). Đánh giá clustering dùng silhouette score, elbow method, hoặc ** Davies-Bouldin index** với biểu đồ như scatter plot clusters hoặc dendrogram. Biểu đồ này có "True Value" rõ ràng, không phù hợp clustering.

📘 Tài liệu tham khảo

Hy vọng phân tích này giúp bạn nắm vững kiến thức AWS ML! 🚀

Câu 205
Which type of machine learning should you use to predict the number of gift cards that will be sold next month?
  1. A classification
  2. B regression
  3. C clustering
Xem giải thích

🧠 Phân tích câu hỏi trắc nghiệm về Machine Learning trên AWS

🧩 Nội dung câu hỏi:
Câu hỏi yêu cầu xác định loại machine learning phù hợp để dự đoán số lượng thẻ quà tặng (gift cards) sẽ được bán trong tháng tới. Đây là một bài toán dự báo giá trị số liên tục (continuous value), cụ thể là một con số cụ thể như 1000, 1500 thẻ, v.v. Trong machine learning trên AWS (như sử dụng Amazon SageMaker hoặc AWS ML services), việc chọn loại thuật toán đúng giúp mô hình học dữ liệu lịch sử bán hàng để dự đoán tương lai chính xác. Kiến thức này dựa trên các khái niệm cơ bản của ML, cập nhật đến phiên bản AWS ML mới nhất năm 2026, nơi regression vẫn là lựa chọn tiêu chuẩn cho dự đoán số lượng (theo AWS SageMaker documentation).

✅ Đáp án đúng: regression
Lý do: Regression được sử dụng để dự đoán giá trị số liên tục (như số lượng thẻ bán ra), dựa trên dữ liệu huấn luyện có nhãn (supervised learning). Trong AWS, bạn có thể dùng Amazon SageMaker Built-in Algorithms (như Linear Learner hoặc XGBoost) để xây dựng mô hình regression dự báo doanh số. Điều này phù hợp hoàn hảo vì đầu ra là một con số cụ thể, không phải nhãn phân loại.

📋 Giải thích chi tiết từng phương án (giữ nguyên văn bản gốc):

  • ❌ classification
    Phương án này sai vì classification dùng để phân loại dữ liệu vào các nhóm rời rạc (như "bán nhiều" hay "bán ít"), không dự đoán giá trị số chính xác. Trong AWS SageMaker, classification phù hợp cho binary/multi-class (ví dụ: dự đoán khách hàng có mua hay không), nhưng ở đây cần số lượng cụ thể nên không đúng.

  • ✅ regression
    Phương án này đúng vì regression chuyên dự đoán giá trị số liên tục, lý tưởng cho bài toán dự báo doanh số như số thẻ gift cards. AWS hỗ trợ mạnh mẽ qua SageMaker (algorithms như XGBoost Regression), giúp mô hình học từ dữ liệu thời gian bán hàng để đưa ra dự đoán số lượng chính xác, giảm lỗi RMSE (Root Mean Square Error).

  • ❌ clustering
    Phương án này sai vì clustering là thuật toán không giám sát (unsupervised), dùng để nhóm dữ liệu tương đồng mà không cần nhãn dự đoán. Trong AWS (như SageMaker K-Means), nó phù hợp phân tích nhóm khách hàng, nhưng không dự đoán số lượng tương lai – thiếu yếu tố dự báo có nhãn.

📘 Tài liệu tham khảo:

Hy vọng phân tích này giúp bạn nắm vững! 🚀 Nếu cần ví dụ code SageMaker, hãy hỏi thêm nhé!

Câu 206
You have a dataset that contains information about taxi journeys that occurred during a given period.
You need to train a model to predict the fare of a taxi journey.
What should you use as a feature?
  1. A the number of taxi journeys in the dataset
  2. B the trip distance of individual taxi journeys
  3. C the fare of individual taxi journeys
  4. D the trip ID of individual taxi journeys
Xem giải thích

🧩 Phân tích câu hỏi trắc nghiệm: Dự đoán giá cước taxi

📘 Nội dung câu hỏi được giải thích chi tiết:
Câu hỏi này thuộc lĩnh vực Machine Learning (ML) cơ bản, thường xuất hiện trong các chứng chỉ như AWS Certified Machine Learning – Specialty (phiên bản mới nhất 2023-2026, MLS-C02). Bạn sở hữu một bộ dữ liệu (dataset) chứa thông tin về các chuyến đi taxi trong một khoảng thời gian nhất định. Nhiệm vụ là huấn luyện (train) một mô hình ML để dự đoán giá cước (fare) của một chuyến taxi. Câu hỏi yêu cầu xác định đặc trưng (feature) phù hợp nhất để sử dụng trong mô hình.

Trong ML, feature là các thuộc tính đầu vào (input) của dữ liệu giúp mô hình học và dự đoán output (ở đây là fare). Feature phải liên quan trực tiếp đến output, có tính dự đoán cao, và tránh các yếu tố không liên quan hoặc gây nhiễu (noise). Dataset taxi thường bao gồm các cột như khoảng cách chuyến đi (distance), thời gian, ID chuyến, giá cước thực tế, v.v. Mục tiêu là chọn feature giúp mô hình học mối quan hệ giữa input và fare một cách chính xác.

(Kiến thức cập nhật: Theo tài liệu AWS ML mới nhất 2026, feature engineering là bước quan trọng trong SageMaker hoặc Amazon ML services, nhấn mạnh sử dụng numerical features liên quan như distance để tránh overfitting – tham khảo: AWS SageMaker Documentation - Feature Engineering và AWS ML Specialty Exam Guide MLS-C02).

✅ Đáp án đúng: the trip distance of individual taxi journeys
Lý do chọn đáp án này: Khoảng cách chuyến đi (trip distance) là feature rất liên quan trực tiếp đến giá cước taxi, vì giá thường tính theo km hoặc dặm di chuyển (ví dụ: fare = base + distance * rate). Đây là numerical feature mạnh mẽ, giúp mô hình học pattern tuyến tính hoặc phi tuyến tính chính xác. Trong thực tế AWS SageMaker, feature này thường được sử dụng trong regression models (như XGBoost hoặc Linear Learner) để dự đoán fare với độ chính xác cao (R² > 0.8).

🛠️ Giải thích tất cả các phương án (đúng/sai):

  • ❌ the number of taxi journeys in the dataset
    Phương án này sai vì số lượng chuyến taxi trong dataset chỉ là metadata tổng quát (aggregate statistic), không phải feature của từng chuyến riêng lẻ. Nó không cung cấp thông tin dự đoán cho một chuyến cụ thể, dẫn đến underfitting hoặc mô hình không học được gì hữu ích.

  • ✅ the trip distance of individual taxi journeys
    Phương án này đúng như đã giải thích ở trên: Feature numerical, per-instance (cho từng chuyến), có correlation cao với target (fare), phù hợp cho feature engineering trong AWS ML pipelines.

  • ❌ the fare of individual taxi journeys
    Phương án này sai vì giá cước (fare) chính là target variable (output) cần dự đoán, không phải input feature. Sử dụng nó sẽ gây data leakage (rò rỉ dữ liệu), làm mô hình đạt accuracy 100% giả tạo trên training nhưng thất bại trên test data thực tế – vi phạm nguyên tắc supervised learning.

  • ❌ the trip ID of individual taxi journeys
    Phương án này sai vì ID chuyến đi chỉ là identifier duy nhất (categorical/non-informative), không mang giá trị dự đoán. Nó giống như nhãn serial number, gây high cardinality (nhiều giá trị unique) dẫn đến overfitting hoặc memory issues trong mô hình AWS như SageMaker.

📚 Tài liệu tham khảo chính:

Hy vọng phân tích này giúp bạn nắm vững khái niệm! 🚀 Nếu cần thêm ví dụ code SageMaker, hãy hỏi nhé!

Câu 207
You need to predict the sea level in meters for the next 10 years.
Which type of machine learning should you use?
  1. A classification
  2. B regression
  3. C clustering
Xem giải thích

🧠 Phân tích câu hỏi trắc nghiệm: Machine Learning cho dự đoán mực nước biển

Chào bạn! Tôi là Microsoft Azure AI Fundamentals, chuyên gia hỗ trợ kiến thức nền tảng về AI và Machine Learning. Hôm nay, chúng ta sẽ phân tích sâu câu hỏi liên quan đến loại Machine Learning phù hợp cho nhiệm vụ dự đoán mực nước biển (sea level) theo mét trong 10 năm tới. Chủ đề này mang tính cơ bản trong ML, áp dụng chung cho các nền tảng như AWS SageMaker (phiên bản mới nhất 2026 vẫn giữ nguyên nguyên tắc cốt lõi). Hãy cùng khám phá nhé! 🌊📈

🧩 Giải thích nội dung câu hỏi một cách chi tiết

Câu hỏi yêu cầu chọn loại Machine Learning (ML) phù hợp để dự đoán giá trị mực nước biển theo đơn vị mét (meters) cho 10 năm tiếp theo.

  • Đây là nhiệm vụ dự báo liên tục (continuous prediction) dựa trên dữ liệu thời gian (time-series data), ví dụ: dữ liệu lịch sử mực nước biển, yếu tố khí hậu như nhiệt độ, băng tan...
  • ML được chia thành các loại chính: supervised learning (có nhãn), unsupervised (không nhãn), và cụ thể hơn là classification, regression, clustering.
  • Mục tiêu là dự đoán giá trị số chính xác (như 2.5 mét, 3.1 mét...), không phải phân loại nhóm hay nhóm cụm. Điều này đòi hỏi mô hình học từ dữ liệu đầu vào để ước lượng số liên tục (continuous numerical value). 🛠️

✅ Đáp án đúng: regression

Lý do lựa chọn:
Regression là loại ML supervised learning chuyên dùng để dự đoán giá trị số liên tục (continuous output), như mực nước biển theo mét. Trong AWS SageMaker (cập nhật 2026), bạn có thể dùng các thuật toán như Linear Learner, XGBoost Regression, hoặc DeepAR cho time-series forecasting. Ví dụ: Đầu vào là dữ liệu quá khứ (năm, nhiệt độ), đầu ra là giá trị mét dự đoán – hoàn hảo khớp! 📈✨

📋 Giải thích tất cả các phương án (đúng và sai)

Dưới đây là phân tích chi tiết từng lựa chọn. Tôi giữ nguyên văn bản gốc bằng tiếng Anh, chỉ giải thích bằng tiếng Việt với emoji nổi bật:

  • ✅ regression
    Đúng 100%! Phương án này phù hợp vì regression dự đoán giá trị số liên tục (như mét nước biển), sử dụng hàm mất mát như MSE (Mean Squared Error). Trong thực tế AWS, nó được dùng rộng rãi cho forecasting, ví dụ dự báo doanh thu hoặc môi trường. Siêu chính xác cho câu hỏi! 🌟

  • ❌ classification
    Sai hoàn toàn! Classification dùng để phân loại vào các nhóm rời rạc (categorical labels), như "cao/thấp" hoặc "an toàn/nguy hiểm". Không phù hợp dự đoán số mét chính xác (continuous), vì output phải là class label, không phải số thập phân. Trong AWS, dùng cho Binary/Multi-class như XGBoost Classifier. ❌🚫

  • ❌ clustering
    Sai triệt để! Clustering là unsupervised learning để nhóm dữ liệu tương tự mà không cần nhãn (như K-Means nhóm khu vực nước biển cao). Không dự đoán tương lai hay giá trị cụ thể, chỉ phân nhóm dữ liệu hiện tại. AWS dùng cho phân tích dữ liệu khám phá, không forecasting. ❌🌀

📘 Tài liệu tham khảo (cập nhật mới nhất đến 2026)

Hy vọng phân tích này giúp bạn nắm vững! Có câu hỏi nào khác về Azure AI hoặc AWS ML không? 🚀💡

Câu 208 Chọn nhiều đáp án
You use Azure Machine Learning designer to publish an inference pipeline.
Which two parameters should you use to access the web service? Each correct answer presents part of the solution.
NOTE: Each correct selection is worth one point.
  1. A the model name
  2. B the training endpoint
  3. C the authentication key
  4. D the REST endpoint
Xem giải thích

🧠 Phân tích câu hỏi trắc nghiệm Azure Machine Learning Designer

Chào bạn! Tôi là Microsoft Azure AI Fundamentals, chuyên gia hỗ trợ học tập về các nền tảng Azure AI. Hôm nay, chúng ta sẽ phân tích chi tiết câu hỏi trắc nghiệm liên quan đến Azure Machine Learning designer (không phải AWS như bạn đề cập, có thể là nhầm lẫn nhỏ 😊). Câu hỏi tập trung vào việc truy cập web service sau khi publish một inference pipeline. Hãy cùng khám phá nhé! 📘

1. 📖 Giải thích nội dung câu hỏi một cách chi tiết

🛠️ Nội dung chính: Câu hỏi hỏi về hai tham số (parameters) cần thiết để truy cập (access) web service được tạo ra từ việc publish một inference pipeline bằng Azure Machine Learning designer.

  • Inference pipeline: Đây là pipeline dùng để dự đoán (inference) trên dữ liệu mới, khác với training pipeline.
  • Publish: Khi bạn kéo-thả các module trong designer và publish, Azure tự động triển khai thành web service (endpoint REST API) để gọi inference từ bên ngoài (như ứng dụng web, mobile).
  • Yêu cầu chọn 2 đáp án đúng, mỗi đáp án đúng chiếm 1 điểm.
  • Mục tiêu: Hiểu cách integrate web service vào ứng dụng thực tế bằng cách sử dụng đúng credentials và URL để gọi API an toàn.
    ✅ Phiên bản cập nhật: Theo tài liệu Azure ML mới nhất (2024-2026), quy trình này không thay đổi lớn; vẫn dựa trên Real-time endpoint với REST API (xem Azure ML v2 endpoints).

2. ✅ Đáp án đúng và lý do lựa chọn

Hai đáp án đúng là:

  • the authentication key
  • the REST endpoint

Lý do lựa chọn 🧩:
Khi publish inference pipeline trong Azure ML designer, bạn nhận được REST endpoint (URL để gọi API) và authentication key (khóa xác thực Primary/Secondary để bảo mật). Hai tham số này là bắt buộc để gửi HTTP POST request truy cập web service. Không có chúng, bạn không thể gọi inference được! Ví dụ: Sử dụng Python requests hoặc Swagger UI để test.
📘 Dẫn nguồn: Azure ML Documentation - Consume endpoints (cập nhật 2025).

3. 🔍 Giải thích tất cả các phương án (đúng và sai)

Dưới đây là phân tích từng lựa chọn một, giữ nguyên văn bản gốc bằng tiếng Anh. Tôi dùng ✅ cho đúng, ❌ cho sai, kèm giải thích chi tiết bằng tiếng Việt:

  • ❌ the model name
    Sai vì: Tên model chỉ dùng để identifies model bên trong workspace (như đăng ký model), không phải tham số truy cập web service. Bạn không cần model name khi gọi REST API; endpoint đã encapsulate toàn bộ pipeline bao gồm model.

  • ❌ the training endpoint
    Sai vì: Training endpoint dùng cho training pipeline (huấn luyện mô hình), không phải inference. Sau publish inference pipeline, bạn có inference endpoint riêng (real-time hoặc batch), không liên quan đến training endpoint.

  • ✅ the authentication key
    Đúng vì: Đây là khóa xác thực (API key Primary/Secondary) bắt buộc trong header HTTP request (ví dụ: Authorization: Bearer <key>). Nó đảm bảo bảo mật, ngăn chặn truy cập trái phép. Bạn lấy key từ Azure portal > Endpoints > Consume.

  • ✅ the REST endpoint
    Đúng vì: Đây là URL chính (ví dụ: https://<endpoint>.inference.ml.azure.com/score) để gửi dữ liệu input và nhận output inference. Là điểm truy cập duy nhất cho web service, hỗ trợ Swagger UI test ngay lập tức.

4. 💡 Lời khuyên học tập & cập nhật

  • 🧪 Thực hành: Tạo trial Azure ML studio, build inference pipeline đơn giản (như classification), publish và test bằng Postman.
  • 🚀 Kiến thức nâng cao (2026): Với Azure ML v2, hỗ trợ managed online endpoints với key/token auth, tích hợp AKS cho scale lớn. Không còn dùng "classic" designer nhiều.
  • 📚 Tài liệu tham khảo thêm:
    1. Publish designer pipelines (Azure Docs 2025).
    2. Sample code consume endpoint.

Hy vọng phân tích này giúp bạn nắm vững! Có câu hỏi nào khác về Azure AI không? 😄

Câu 209
A medical research project uses a large anonymized dataset of brain scan images that are categorized into predefined brain haemorrhage types.
You need to use machine learning to support early detection of the different brain haemorrhage types in the images before the images are reviewed by a person.
This is an example of which type of machine learning?
  1. A clustering
  2. B regression
  3. C classification
Xem giải thích

🧠 Phân tích câu hỏi trắc nghiệm về Machine Learning (liên quan AWS SageMaker và các dịch vụ ML)

📖 Giải thích nội dung câu hỏi một cách chi tiết và rõ ràng:
Câu hỏi mô tả một dự án nghiên cứu y tế sử dụng bộ dữ liệu lớn (large anonymized dataset) gồm các hình ảnh quét não (brain scan images), đã được phân loại sẵn thành các loại xuất huyết não định trước (predefined brain haemorrhage types). Mục tiêu là áp dụng machine learning (ML) để phát hiện sớm (early detection) các loại xuất huyết não khác nhau trong hình ảnh trước khi con người xem xét. Đây là tình huống điển hình trong y tế, nơi ML giúp tự động hóa phân loại hình ảnh để hỗ trợ bác sĩ.
🛠️ Trong ngữ cảnh AWS, điều này thường được thực hiện qua Amazon SageMaker (dịch vụ ML toàn diện, cập nhật phiên bản mới nhất 2026 với hỗ trợ mô hình đa phương thức và AutoML), nơi bạn có thể huấn luyện mô hình trên dữ liệu hình ảnh để dự đoán nhãn (labels) cụ thể. Câu hỏi tập trung vào loại ML phù hợp nhất cho nhiệm vụ phân loại các loại xuất huyết não (categorical prediction từ hình ảnh).

✅ Đáp án đúng và lý do lựa chọn:
Đáp án đúng: classification
🧩 Lý do: Đây là nhiệm vụ classification (phân loại) vì dữ liệu đầu vào là hình ảnh, và mục tiêu là gán nhãn rõ ràng, rời rạc (predefined categories như loại xuất huyết não cụ thể, ví dụ: subdural, epidural...). ML classification học từ dữ liệu đã gắn nhãn (supervised learning) để dự đoán lớp (class) cho dữ liệu mới. Trong AWS SageMaker (phiên bản 2026), bạn dùng built-in algorithms như Image Classification hoặc BlazingText để xử lý hình ảnh y tế chính xác cao, hỗ trợ early detection.

🔍 Giải thích tất cả các phương án (đúng và sai):

  • clustering ❌
    Phương án này sai vì clustering là kỹ thuật unsupervised learning (không giám sát), dùng để nhóm dữ liệu tương tự mà không cần nhãn sẵn (ví dụ: K-Means trong SageMaker để khám phá pattern ẩn). Ở đây, dữ liệu đã có nhãn định trước (predefined types), và mục tiêu là phân loại cụ thể, không phải khám phá nhóm mới. Không phù hợp cho early detection với categories đã biết.

  • regression ❌
    Phương án này sai vì regression dùng để dự đoán giá trị liên tục (continuous values, như dự báo số lượng xuất huyết hoặc kích thước). Nhiệm vụ ở đây là phân loại rời rạc (categorical labels như loại haemorrhage), không phải số học. Trong SageMaker 2026, regression algorithms (như XGBoost) chỉ áp dụng cho output số, không phải hình ảnh phân loại.

  • classification ✅
    Phương án này đúng như đã giải thích ở trên. Đây là supervised classification với dữ liệu hình ảnh đã gắn nhãn, lý tưởng cho computer vision tasks trong y tế. SageMaker hỗ trợ JumpStart models (cập nhật 2026 với fine-tuning trên datasets y tế lớn).

📘 Tài liệu tham khảo (cập nhật đến 2026):

  • AWS SageMaker Documentation: Amazon SageMaker Image Classification – Hướng dẫn phân loại hình ảnh y tế.
  • AWS Machine Learning Blog: "Medical Imaging with SageMaker" (2025 update).
  • Microsoft Azure AI Fundamentals (tương đương): Azure ML Classification – Khái niệm chung, nhưng ưu tiên AWS cho câu hỏi.
    🛠️ Lời khuyên: Sử dụng SageMaker Canvas (no-code ML) cho dự án y tế nhanh chóng!
Câu 210
When training a model, why should you randomly split the rows into separate subsets?
  1. A to train the model twice to attain better accuracy
  2. B to train multiple models simultaneously to attain better performance
  3. C to test the model by using data that was not used to train the model
Xem giải thích

🧩 Phân tích nội dung câu hỏi

Câu hỏi tập trung vào quy trình huấn luyện mô hình máy học (machine learning), cụ thể là lý do tại sao cần ngẫu nhiên chia các hàng dữ liệu (rows) thành các tập con riêng biệt.
📘 Chi tiết câu hỏi: Trong machine learning trên AWS (như Amazon SageMaker hoặc AWS ML services), việc chia dữ liệu ngẫu nhiên thành các tập con (thường là train set và test set, hoặc train/validation/test) là bước quan trọng để đảm bảo mô hình học được từ dữ liệu đa dạng, tránh overfitting (học thuộc lòng dữ liệu train) và đánh giá chính xác hiệu suất trên dữ liệu mới. Việc "randomly split rows" giúp phân bố ngẫu nhiên các đặc trưng, tránh bias từ thứ tự dữ liệu gốc. Đây là best practice tiêu chuẩn trong AWS ML workflows, áp dụng đến phiên bản SageMaker mới nhất (2026), hỗ trợ automated splitting qua SDK như Boto3 hoặc SageMaker Data Wrangler.
🛠️ Mục đích chính: Kiểm tra hiểu biết về train-test split để đánh giá generalization của mô hình.

✅ Đáp án đúng và lý do lựa chọn

Đáp án đúng: to test the model by using data that was not used to train the model
Lý do: Việc chia ngẫu nhiên dữ liệu thành các tập con (train set và test set) cho phép sử dụng test set – dữ liệu chưa từng được dùng để huấn luyện – để kiểm tra hiệu suất thực tế của mô hình. Điều này giúp đánh giá khả năng tổng quát hóa (generalization) trên dữ liệu mới, tránh overfitting. Trong AWS SageMaker, bạn có thể chỉ định train_test_split với random_state để tái lập kết quả, đảm bảo test set độc lập hoàn toàn. Đây là nguyên tắc cốt lõi của ML pipeline, được nhấn mạnh trong AWS ML Specialty certification (cập nhật 2026).

📋 Giải thích tất cả các phương án

  • ❌ to train the model twice to attain better accuracy
    Sai vì: Phương án này nhầm lẫn với việc train lại mô hình (re-training), nhưng split rows không nhằm train hai lần để tăng accuracy. Train hai lần trên cùng dữ liệu có thể gây overfitting, không giải quyết vấn đề đánh giá. Trong AWS, train nhiều lần dùng hyperparameter tuning (như SageMaker Hyperparameter Optimization), không liên quan split random rows.

  • ❌ to train multiple models simultaneously to attain better performance
    Sai vì: Đây gợi ý ensemble methods (như bagging/boosting trong XGBoost trên SageMaker), nhưng split rows đơn giản không dùng để train nhiều mô hình đồng thời. Thay vào đó, multiple models dùng kỹ thuật như cross-validation hoặc distributed training (SageMaker Managed Spot Training). Split cơ bản chỉ để tách train/test, không phải parallel models.

  • ✅ to test the model by using data that was not used to train the model
    Đúng vì: Như đã giải thích ở trên, đây là lý do cốt lõi của train-test split. Test set độc lập giúp đo lường metrics như accuracy, precision trên dữ liệu unseen, đảm bảo mô hình thực tế deployable trên AWS (ví dụ: SageMaker endpoints).

📚 Tài liệu tham khảo

  • AWS SageMaker Documentation: Prepare Data for Training a Model (cập nhật 2026, phần Train-Test Split).
  • AWS ML Best Practices: Avoiding Overfitting with Train-Test Split – Whitepaper "Machine Learning on AWS" (2025 edition).
  • AWS Certification: AWS Certified Machine Learning – Specialty Exam Guide (2026), Objective 1.2: Data Preparation.
    🧑‍💻 Lời khuyên: Thực hành trên SageMaker Studio với sklearn.model_selection.train_test_split(random_state=42) để nắm vững!