Ngân hàng đề — Microsoft Azure AI Fundamentals

Tìm thấy 316 câu.

Câu 101 Responsible AI

What is the meaning of transparency in AI solutions?

  1. A

    Keeping the inner workings of AI solutions secret from humans to maintain their competitiveness

  2. B

    Creating AI solutions that can adapt to new situations without needing human intervention

  3. C

    Making AI solutions easily understandable and interpretable to humans

  4. D

    Creating AI solutions that can perform tasks with high precision and accuracy

Xem giải thích

Đáp án

C — Làm cho giải pháp AI DỄ HIỂU và DIỄN GIẢI ĐƯỢC đối với con người.

Vì sao đúng

⚠ Transparency (minh bạch) hướng tới NGƯỜI DÙNG và người liên quan: | Nội dung | Chi tiết | |---|---| | ⚠ Người dùng biết mình đang tương tác với AI | | | ⚠ Biết hệ thống dùng dữ liệu gì | | | ⚠ Hiểu được VÌ SAO có kết quả đó | | | ⚠ Biết giới hạn và mức độ tin cậy | | | ⚠ Công bố mô hình dùng cho mục đích gì | ⚠ Transparency Note |

⚠ Hộp đen
   ⚠ "Hồ sơ của bạn bị từ chối"
        ↓ ⚠ minh bạch
⚠ "Bị từ chối chủ yếu vì
   ⚠ tỉ lệ nợ trên thu nhập cao
   ⚠ và lịch sử tín dụng ngắn"

Vì sao các phương án khác sai

  • A (giữ bí mật cách hoạt động để cạnh tranh) — ⚠ NGƯỢC hoàn toàn với minh bạch.

  • B (tự thích nghi không cần con người) — ⚠ nói về tự động hoá, không phải minh bạch.

  • D (thực hiện tác vụ với độ chính xác cao) — ⚠ thuộc RELIABILITY.

Ghi nhớ

⚠ Ghi nhớ về chất lượng câu hỏi: ⚠ câu này ⚠ gần trùng #17970 ở đợt trước — ⚠ cùng khoá "minh bạch", ⚠ khác nhau ở chỗ #17970 hỏi qua tình huống còn câu này hỏi định nghĩa.

⚠ Sáu nguyên tắc — bảng đối chiếu nhanh: | Nguyên tắc | Câu hỏi cốt lõi | |---|---| | ⚠ Fairness | ⚠ có nhóm nào bị thiệt không | | ⚠ Reliability & Safety | ⚠ có chạy đúng và ổn định không | | ⚠ Privacy & Security | ⚠ dữ liệu có được bảo vệ không | | ⚠ Inclusiveness | ⚠ mọi người dùng được không | | ⚠ Transparency | ⚠ người ta có HIỂU nó không | | ⚠ Accountability | ⚠ ai chịu trách nhiệm |

Từ khoá nhận diện:

"dễ hiểu, giải thích được, người dùng biết" → ⚠ Transparency "ai gánh hậu quả, kiểm toán" → ⚠ Accountability "giữ bí mật thuật toán" → ⚠ luôn là phương án SAI

⚠ Việc cụ thể để minh bạch Việc
⚠ Nói rõ đây là bot, không phải người
⚠ Hiện điểm tin cậy cho người dùng
⚠ Nêu đặc trưng nào ảnh hưởng nhiều nhất ⚠ feature importance
⚠ Công bố giới hạn: dùng được và KHÔNG dùng được cho gì
⚠ Trích dẫn nguồn khi mô hình trả lời ⚠ quan trọng với RAG
⚠ Đánh đổi của minh bạch Đánh đổi
⚠ Mô hình dễ giải thích thường kém chính xác hơn ⚠ cây quyết định so với mạng sâu
⚠ Giải thích quá kỹ có thể lộ cách lách hệ thống
⚠ Giải thích quá kỹ thuật thì người dùng không hiểu
⚠ Cân bằng ⚠ giải thích ĐỦ để người dùng hành động được

Ba việc kiểm chứng: | Việc | Cách | |---|---| | Người dùng có biết đang nói chuyện với AI không | | | Có giải thích được một quyết định cụ thể không | | | Đã công bố giới hạn của hệ thống chưa | |

Và thước đo thực tế nhất cho minh bạch, thay vì đếm số trang tài liệu: người bị từ chối có hiểu cần thay đổi điều gì để lần sau được chấp nhận không?

Câu 102 NLP workloads

Which of the following is a capability of the Azure Language Service in regards to natural language processing (NLP) workloads?

  1. A

    Provide API access to pre-trained machine learning models for text analytics.

  2. B

    Provide real-time translation for spoken conversations.

  3. C

    Conduct sentiment analysis on images using computer vision algorithms.

  4. D

    Use unsupervised machine learning to generate new natural language text.

Xem giải thích

Đáp án

A — Cung cấp truy cập API tới các mô hình học máy HUẤN LUYỆN SẴN cho phân tích văn bản.

Vì sao đúng

⚠ Đó chính là bản chất của Azure AI Language:

⚠ Gửi văn bản qua REST API
        ↓
⚠ Mô hình huấn luyện sẵn xử lý
        ↓
⚠ Trả về kết quả có cấu trúc
   ⚠ KHÔNG cần huấn luyện gì
Tính năng dựng sẵn Nội dung
⚠ Sentiment analysis
⚠ Key phrase extraction
⚠ NER và entity linking
⚠ Language detection
⚠ PII detection
⚠ Summarization
⚠ Text Analytics for Health

Vì sao các phương án khác sai

  • B (dịch thời gian thực cho hội thoại NÓI) — ⚠ thuộc AI Speech (Speech Translation), ⚠ không phải AI Language.

  • C (phân tích cảm xúc trên ẢNH bằng thuật toán thị giác) — ⚠ lẫn hai lĩnh vực; ⚠ AI Language chỉ xử lý ⚠ văn bản.

  • D (dùng học KHÔNG GIÁM SÁT để SINH văn bản mới) — ⚠ thuộc generative AI / Azure OpenAI, ⚠ và mô tả kỹ thuật cũng sai.

Ghi nhớ

⚠ Ba dịch vụ ngôn ngữ — ranh giới phải rõ: | Dịch vụ | Đầu vào | Việc | |---|---|---| | ⚠ AI Language | ⚠ VĂN BẢN | ⚠ phân tích, hiểu, tóm tắt | | ⚠ AI Speech | ⚠ ÂM THANH | ⚠ STT, TTS, dịch nói | | ⚠ AI Translator | ⚠ VĂN BẢN | ⚠ dịch giữa các ngôn ngữ |

Từ khoá nhận diện:

"phân tích văn bản, cảm xúc, thực thể" → ⚠ AI Language "giọng nói, phiên âm, đọc thành tiếng" → ⚠ AI Speech "dịch ngôn ngữ" → ⚠ AI Translator "SINH văn bản mới" → ⚠ Azure OpenAI

⚠ Dựng sẵn và tuỳ chỉnh trong AI Language Loại
⚠ Dựng sẵn: gọi là dùng ⚠ sentiment, key phrase, NER, PII
⚠ Tuỳ chỉnh: phải huấn luyện ⚠ Custom NER, Custom text classification, CLU
⚠ Chọn dựng sẵn khi ⚠ nhu cầu phổ thông, cần nhanh
⚠ Chọn tuỳ chỉnh khi ⚠ thuật ngữ hoặc nhãn riêng của tổ chức
⚠ PII detection — tính năng hay bị quên Nội dung
⚠ Tìm thông tin cá nhân trong văn bản ⚠ tên, số điện thoại, thẻ, địa chỉ
⚠ Trả về vị trí để CHE ĐI
⚠ Có chế độ riêng cho dữ liệu y tế
⚠ Dùng để ⚠ làm sạch dữ liệu trước khi đưa vào mô hình hoặc log

Ba việc kiểm chứng: | Việc | Cách | |---|---| | Đầu vào là văn bản, âm thanh hay ảnh | ⚠ quyết định dịch vụ | | Tính năng dựng sẵn đã đủ chưa | | | Có cần che thông tin cá nhân trước không | |

Và cách nhanh nhất để chọn đúng dịch vụ AI ngôn ngữ trong phòng thi: nhìn vào loại dữ liệu ĐẦU VÀO trước, rồi mới nhìn tới việc cần làm. Văn bản, âm thanh hay ảnh — ba nhánh đó gần như không giao nhau.

Câu 103 Common machine learning types

With regards to classification machine learning scenarios, which of the following statements is true?

  1. A

    Classification is used to reduce the amount of data for analysis.

  2. B

    In multiclass classification, each class label is assigned a probability value.

  3. C

    In classification, the model predicts a continuous output value.

  4. D

    In binary classification, there are only two possible output values.

Xem giải thích

Đáp án

D — Trong phân loại NHỊ PHÂN, chỉ có HAI giá trị đầu ra khả dĩ.

Vì sao đúng

⚠ Định nghĩa thẳng: binary = hai lớp:

⚠ Binary classification
   ⚠ Spam / Không spam
   ⚠ Gian lận / Hợp lệ
   ⚠ Có bệnh / Không bệnh
        ↓
⚠ ĐÚNG HAI khả năng
Loại phân loại Số lớp
⚠ Binary ⚠ 2
⚠ Multiclass ⚠ từ 3 trở lên, chọn MỘT
⚠ Multilabel ⚠ gán NHIỀU nhãn cùng lúc

Vì sao các phương án khác sai

  • C (mô hình dự đoán giá trị LIÊN TỤC) — ⚠ đó là HỒI QUY, không phải phân loại.

  • A (phân loại để GIẢM lượng dữ liệu) — ⚠ SAI: ⚠ giảm chiều dữ liệu là ⚠ dimensionality reduction.

  • B (trong multiclass, mỗi nhãn được gán một giá trị XÁC SUẤT) — ⚠ xem mục chất lượng câu hỏi.

Ghi nhớ

⚠ Ghi nhớ về chất lượng câu hỏi: ⚠ câu này có ⚠ hai phương án đúng.

Phương án Nội dung Thực tế
⚠ B ⚠ multiclass gán xác suất cho từng lớp ⚠ ĐÚNG — softmax trả xác suất mỗi lớp, tổng bằng 1
⚠ D (khoá) ⚠ binary có hai giá trị đầu ra ⚠ ĐÚNG — định nghĩa
⚠ Vì sao bộ đề chọn D ⚠ D là định nghĩa nền tảng, B là chi tiết kỹ thuật
⚠ Giữ nguyên khoá ⚠ D theo bộ đề gốc
⚠ Mẹo thi ⚠ khi hai phương án cùng đúng, chọn cái NỀN TẢNG hơn

⚠ Chỉ số cho từng loại phân loại: | Chỉ số | Ý nghĩa | |---|---| | ⚠ Accuracy | ⚠ tỉ lệ đúng — chỉ tin khi dữ liệu cân bằng | | ⚠ Precision | ⚠ dự đoán dương, bao nhiêu đúng | | ⚠ Recall | ⚠ thực tế dương, bắt được bao nhiêu | | ⚠ F1 | ⚠ trung bình điều hoà hai cái trên | | ⚠ Confusion matrix | ⚠ bảng đúng-sai chi tiết | | ⚠ ROC / AUC | ⚠ đánh giá qua mọi ngưỡng |

Từ khoá nhận diện:

"có / không, đúng / sai" → ⚠ binary classification "chọn một trong nhiều loại" → ⚠ multiclass "gán nhiều nhãn cùng lúc" → ⚠ multilabel "giá trị số bất kỳ" → ⚠ regression

⚠ Ngưỡng quyết định — điều hay bị quên Điểm
⚠ Mô hình trả XÁC SUẤT, không trả nhãn
⚠ Ngưỡng 0,5 chỉ là MẶC ĐỊNH
⚠ Hạ ngưỡng → recall tăng, precision giảm
⚠ Nâng ngưỡng → ngược lại
⚠ Nghĩa là ⚠ đổi ngưỡng đổi hành vi mà KHÔNG cần huấn luyện lại

Ba việc kiểm chứng: | Việc | Cách | |---|---| | Dữ liệu có cân bằng giữa các lớp không | ⚠ quyết định chỉ số | | Bỏ sót hay báo nhầm tốn kém hơn | ⚠ quyết định ngưỡng | | Có nhìn confusion matrix chưa | |

Và cách chỉnh mô hình phân loại rẻ nhất mà nhiều người bỏ qua, trước khi nghĩ tới huấn luyện lại: thay đổi ngưỡng quyết định. Cùng một mô hình có thể chuyển từ thận trọng sang nhạy chỉ bằng một con số.

Câu 104 Responsible AI

Which of the following is NOT a principle for ensuring inclusiveness in an AI solution?

  1. A

    Prioritize the needs and outcomes of a specific demographic group

  2. B

    Avoid perpetuating or amplifying biases in the data or algorithms

  3. C

    Use diverse and representative data sets

  4. D

    Ensure transparency and explainability of the AI solution

Xem giải thích

Đáp án

A — Ưu tiên nhu cầu và kết quả của MỘT NHÓM NHÂN KHẨU CỤ THỂ.

Vì sao đúng

⚠ Đây là câu PHỦ ĐỊNH — tìm điều KHÔNG phải nguyên tắc của tính bao trùm.

⚠ Inclusiveness là phục vụ MỌI người, ⚠ nên ưu tiên riêng một nhóm ⚠ đi ngược lại chính nó.

⚠ Bao trùm
   ⚠ mọi năng lực thể chất
   ⚠ mọi ngôn ngữ, vùng miền
   ⚠ mọi lứa tuổi
   ⚠ mọi mức thu nhập, mọi thiết bị
        ↓
⚠ KHÔNG ai bị bỏ lại
Ba phương án kia ĐỀU LÀ nguyên tắc đúng Nguyên tắc
⚠ B — tránh khuếch đại thiên lệch
⚠ C — dùng dữ liệu đa dạng, đại diện
⚠ D — minh bạch và giải thích được

Vì sao các phương án khác sai

  • B, C, D — ⚠ đều là thực hành đúng, nên không phải đáp án của câu phủ định.

Ghi nhớ

⚠ Ghi nhớ về chất lượng câu hỏi: ⚠ phương án D thực chất thuộc ⚠ Transparency, ⚠ nhưng vẫn là ⚠ thực hành đúng nên không phải đáp án; ⚠ đối chiếu ⚠ #17963 ở đợt trước cùng chủ đề bao trùm.

⚠ Inclusiveness — nội dung phải thuộc: | Nội dung | Chi tiết | |---|---| | ⚠ Dùng được với người khuyết tật | ⚠ khiếm thị, khiếm thính, vận động | | ⚠ Hoạt động với nhiều giọng, nhiều ngôn ngữ | | | ⚠ Không giả định thiết bị hay đường truyền mạnh | | | ⚠ Dữ liệu huấn luyện đa dạng | | | ⚠ Có người thuộc nhóm liên quan tham gia thiết kế | |

Từ khoá nhận diện:

"khuyết tật, người lớn tuổi, mọi người dùng được" → ⚠ Inclusiveness "nhóm nào bị mô hình đối xử tệ hơn" → ⚠ Fairness "ưu tiên một nhóm cụ thể" → ⚠ luôn là phương án SAI ở câu bao trùm

⚠ Inclusiveness và Fairness — ranh giới Ranh giới
⚠ Inclusiveness: có DÙNG ĐƯỢC không ⚠ khả năng tiếp cận
⚠ Fairness: dùng được rồi thì KẾT QUẢ có công bằng không
⚠ Ví dụ ⚠ giọng vùng miền không nhận được → inclusiveness
⚠ Ví dụ ⚠ duyệt vay thấp hơn cho một nhóm → fairness
⚠ Cả hai ⚠ cùng bắt nguồn từ dữ liệu thiếu đại diện
⚠ Cách kiểm tra tính bao trùm Cách
⚠ Đo hiệu năng RIÊNG cho từng nhóm người dùng ⚠ không chỉ nhìn số trung bình
⚠ Kiểm thử với công nghệ hỗ trợ ⚠ trình đọc màn hình
⚠ Thử với giọng và phương ngữ khác nhau
⚠ Mời người dùng thật thuộc nhóm ít đại diện thử

Ba việc kiểm chứng: | Việc | Cách | |---|---| | Có chữ NOT trong đề không | | | Đã đo hiệu năng theo từng nhóm chưa | ⚠ số trung bình che giấu bất bình đẳng | | Có ai thuộc nhóm liên quan tham gia thiết kế không | |

Và con số duy nhất che giấu vấn đề bao trùm hiệu quả nhất: độ chính xác trung bình. Một mô hình đạt 95% tổng thể vẫn có thể chỉ đạt 60% với một nhóm người dùng cụ thể, và bạn sẽ không bao giờ thấy điều đó nếu không tách nhóm ra đo.

Câu 105 NLP workloads

Which of the following is not a common use case for Sentiment Analysis?

  1. A

    Medical Diagnosis

  2. B

    Market Research

  3. C

    Social Media Monitoring

  4. D

    Customer Feedback Analysis

Xem giải thích

Đáp án

A — Chẩn đoán y khoa (Medical Diagnosis).

Vì sao đúng

⚠ Đây là câu PHỦ ĐỊNH — tìm ứng dụng KHÔNG thuộc phân tích cảm xúc.

⚠ Sentiment analysis đo THÁI ĐỘ trong văn bản — ⚠ tích cực, tiêu cực, trung tính. ⚠ Chẩn đoán bệnh cần ⚠ dữ liệu lâm sàng, hình ảnh y tế, xét nghiệm — ⚠ không phải thái độ.

⚠ Sentiment = "người viết CẢM THẤY thế nào"
⚠ Chẩn đoán = "bệnh nhân BỊ GÌ"
        ↓
⚠ Hai bài toán khác hẳn nhau
Ba phương án kia đều ĐÚNG Ứng dụng
⚠ B — Nghiên cứu thị trường ⚠ đo phản ứng với sản phẩm
⚠ C — Theo dõi mạng xã hội ⚠ theo dõi dư luận về thương hiệu
⚠ D — Phân tích phản hồi khách hàng ⚠ ứng dụng kinh điển nhất

Vì sao các phương án khác sai

  • B, C, D — ⚠ đều là ứng dụng thật của phân tích cảm xúc.

Ghi nhớ

⚠ Ứng dụng sentiment analysis — bảng phải thuộc: | Ứng dụng | Nội dung | |---|---| | ⚠ Phản hồi khách hàng | ⚠ đánh giá, khảo sát, phiếu hỗ trợ | | ⚠ Theo dõi mạng xã hội | ⚠ danh tiếng thương hiệu | | ⚠ Nghiên cứu thị trường | ⚠ so sánh với đối thủ | | ⚠ Ưu tiên phiếu hỗ trợ | ⚠ khách rất bực xử lý trước | | ⚠ Phản hồi nhân viên | | | ⚠ KHÔNG dùng cho | ⚠ chẩn đoán y khoa, dự báo số liệu, nhận dạng ảnh |

Từ khoá nhận diện:

"khách khen hay chê" → ⚠ sentiment analysis "chủ đề chính họ nói gì" → ⚠ key phrase extraction "triệu chứng, thuốc trong hồ sơ bệnh án" → ⚠ Text Analytics for Health "chẩn đoán bệnh" → ⚠ KHÔNG phải NLP thuần tuý

⚠ Text Analytics for Health — đừng nhầm Phân biệt
⚠ CÓ tồn tại và xử lý văn bản y tế
⚠ Nhưng nó TRÍCH THỰC THỂ y khoa ⚠ triệu chứng, thuốc, liều lượng
⚠ KHÔNG đưa ra chẩn đoán ⚠ điểm mấu chốt
⚠ Quyết định lâm sàng ⚠ luôn thuộc về bác sĩ
⚠ Giới hạn của phân tích cảm xúc Giới hạn
⚠ Mỉa mai, châm biếm rất khó bắt
⚠ Phủ định nhiều tầng dễ sai
⚠ Câu vừa khen vừa chê ra trung tính ⚠ mất thông tin
⚠ Khắc phục ⚠ dùng opinion mining tách theo TỪNG KHÍA CẠNH

Ba việc kiểm chứng: | Việc | Cách | |---|---| | Đề có chữ NOT hay KHÔNG không | | | Bài toán này thật sự đo THÁI ĐỘ hay đo SỰ KIỆN | | | Có cần tách theo khía cạnh không | ⚠ opinion mining |

Và giới hạn khiến điểm cảm xúc tổng thể ít hữu ích hơn vẻ ngoài của nó: một đánh giá khen dịch vụ nhưng chê giá tiền thường ra "trung tính", và bạn mất cả hai thông tin quan trọng. Opinion mining tách theo khía cạnh mới giữ được chúng.

Câu 106 Common machine learning types

Which of the following statements is true about regression machine learning scenarios?

  1. A

    Regression is only used for predicting categorical variables.

  2. B

    Regression is used for predicting continuous variables.

  3. C

    Regression is not used for predicting any type of variable.

  4. D

    Regression is used for predicting both categorical and continuous variables.

Xem giải thích

Đáp án

B — Hồi quy dùng để dự đoán biến LIÊN TỤC.

Vì sao đúng

⚠ Hồi quy trả về một CON SỐ trên thang liên tục:

⚠ Đặc trưng vào
   ⚠ diện tích, số phòng, vị trí
        ↓ ⚠ mô hình hồi quy
⚠ 3,42 tỷ đồng
        ↓
⚠ Giá trị SỐ, không phải nhãn
Ví dụ hồi quy Đầu ra
⚠ Giá nhà ⚠ số tiền
⚠ Nhiệt độ ngày mai ⚠ độ C
⚠ Doanh số tháng tới ⚠ số đơn
⚠ Thời gian giao hàng ⚠ số phút

Vì sao các phương án khác sai

  • A (chỉ dự đoán biến PHÂN LOẠI) — ⚠ NGƯỢC: ⚠ đó là phân loại.

  • D (dự đoán CẢ hai loại) — ⚠ SAI: ⚠ hồi quy chỉ cho biến liên tục; ⚠ biến phân loại thuộc classification.

  • C (không dùng để dự đoán loại biến nào) — ⚠ vô nghĩa.

Ghi nhớ

⚠ Ghi nhớ về chất lượng câu hỏi: ⚠ câu này ⚠ gần trùng #17984 ở đợt trước.

Câu Hỏi gì Khoá
⚠ #17984 ⚠ bài toán dự đoán doanh số thuộc loại nào ⚠ regression
⚠ #18020 (câu này) ⚠ mệnh đề nào đúng về regression ⚠ dự đoán biến liên tục
⚠ Cùng nguyên lý ⚠ không mâu thuẫn

⚠ Bốn bài toán ML — phân biệt bằng ĐẦU RA: | Bài toán | Đầu ra | |---|---| | ⚠ Regression | ⚠ SỐ liên tục | | ⚠ Classification | ⚠ NHÃN rời rạc | | ⚠ Clustering | ⚠ nhóm, KHÔNG có nhãn trước | | ⚠ Forecasting | ⚠ số liên tục THEO THỜI GIAN |

Từ khoá nhận diện:

"bao nhiêu, giá bao nhiêu, mất bao lâu" → ⚠ regression "loại nào, có hay không" → ⚠ classification "nhóm khách hàng giống nhau" → ⚠ clustering "tháng sau, quý sau" → ⚠ forecasting

⚠ Chỉ số đánh giá hồi quy Chỉ số
⚠ MAE ⚠ sai số tuyệt đối trung bình — dễ hiểu nhất
⚠ MSE / RMSE ⚠ phạt NẶNG sai số lớn
⚠ R² ⚠ giải thích được bao nhiêu phần biến thiên, 0 đến 1
⚠ Chọn MAE khi ⚠ muốn con số dễ giải thích cho người nghiệp vụ
⚠ Chọn RMSE khi ⚠ sai lệch lớn gây hậu quả nghiêm trọng
⚠ Ranh giới mờ đáng nhớ Ranh giới
⚠ Biến liên tục có thể CHIA KHOẢNG thành nhãn ⚠ rẻ / vừa / đắt
⚠ Khi đó bài toán chuyển thành phân loại
⚠ Đánh đổi ⚠ mất độ chi tiết nhưng dễ dùng và dễ giải thích
⚠ Quyết định theo ⚠ người dùng cần con số hay cần một quyết định

Ba việc kiểm chứng: | Việc | Cách | |---|---| | Đầu ra cần là số hay là nhãn | | | Sai số bao nhiêu là chấp nhận được | ⚠ định trước khi huấn luyện | | Có yếu tố thời gian không | ⚠ nếu có thì là forecasting |

Và câu hỏi cần trả lời trước khi bắt tay vào một mô hình hồi quy, quan trọng hơn việc chọn thuật toán: sai lệch bao nhiêu thì vẫn dùng được? Không có con số đó thì không có cách nào biết mô hình đã đủ tốt hay chưa.

Câu 107 NLP workloads

What is one of the capabilities of the Translator service within Azure for natural language processing (NLP) workloads?

  1. A

    Only supports translation for European languages

  2. B

    Translations generated are always 100% accurate

  3. C

    Requires a Machine Learning Engineer to train models before use

  4. D

    Can generate audio translations in addition to text translations

Xem giải thích

Đáp án

D — Có thể tạo bản dịch dạng ÂM THANH bên cạnh bản dịch văn bản.

Vì sao đúng

⚠ Nền tảng dịch của Azure ghép được với Speech để ra âm thanh:

⚠ Lời nói vào
        ↓ ⚠ Speech-to-text
⚠ Văn bản gốc
        ↓ ⚠ Translator
⚠ Văn bản đích
        ↓ ⚠ Text-to-speech
⚠ ÂM THANH ngôn ngữ đích

⚠ Speech Translation trong Azure AI Speech làm trọn chuỗi này — ⚠ nói tiếng Việt, nghe ra tiếng Anh.

Vì sao các phương án khác sai

  • A (chỉ hỗ trợ ngôn ngữ châu Âu) — ⚠ SAI: ⚠ hơn 100 ngôn ngữ, gồm tiếng Việt, Nhật, Ả Rập, Hindi.

  • B (bản dịch luôn chính xác 100%) — ⚠ KHÔNG BAO GIỜ đúng: ⚠ mọi hệ dịch máy đều có lỗi; ⚠ mệnh đề tuyệt đối như vậy trong đề thi ⚠ gần như luôn là phương án sai.

  • C (cần kỹ sư ML huấn luyện mô hình trước khi dùng) — ⚠ SAI: ⚠ Translator dùng được ngay; ⚠ huấn luyện chỉ cần khi muốn ⚠ Custom Translator.

Ghi nhớ

⚠ Chuỗi dịch nói — ba dịch vụ ghép lại: | Bước | Dịch vụ | |---|---| | ⚠ Âm thanh → văn bản | ⚠ AI Speech (STT) | | ⚠ Dịch văn bản | ⚠ AI Translator | | ⚠ Văn bản → âm thanh | ⚠ AI Speech (TTS) | | ⚠ Gói sẵn | ⚠ Speech Translation làm cả ba |

Từ khoá nhận diện:

"nói tiếng này, nghe ra tiếng kia" → ⚠ Speech Translation "dịch văn bản thuần" → ⚠ Translator "dịch tệp giữ định dạng" → ⚠ Document Translation "luôn chính xác 100%" → ⚠ phương án sai

⚠ Mệnh đề tuyệt đối trong đề thi Dấu hiệu
⚠ "luôn luôn", "100%", "không bao giờ sai" ⚠ hầu như luôn SAI
⚠ "chỉ hỗ trợ..." ⚠ thường SAI vì dịch vụ đám mây rất rộng
⚠ "không cần con người can thiệp" ⚠ thường SAI
⚠ Mẹo ⚠ loại các phương án tuyệt đối trước, thu hẹp lựa chọn nhanh
⚠ Ứng dụng dịch nói thực tế Ứng dụng
⚠ Phụ đề trực tiếp trong cuộc họp
⚠ Tổng đài đa ngôn ngữ
⚠ Hướng dẫn viên du lịch, bảo tàng
⚠ Hỗ trợ người khiếm thính bằng phụ đề ⚠ gắn với inclusiveness
⚠ Lưu ý ⚠ độ trễ tích luỹ qua ba bước, cần thiết kế cho phù hợp

Ba việc kiểm chứng: | Việc | Cách | |---|---| | Cần đầu ra văn bản hay âm thanh | | | Ngôn ngữ đích có giọng đọc phù hợp không | | | Độ trễ chấp nhận được là bao nhiêu | |

Và mẹo loại phương án nhanh nhất trong phòng thi, dùng được cả khi bạn không chắc về dịch vụ: gạch ngay mọi phương án chứa "luôn luôn", "100%" hay "chỉ". Dịch vụ đám mây hiếm khi tuyệt đối theo cả hai chiều.

Câu 108 Responsible AI

What is "data minimization" meant in the context of privacy considerations in AI solutions?

  1. A

    Collecting as much data as possible to improve the accuracy of machine learning models

  2. B

    Collecting the minimum amount of data necessary for an AI solution to function effectively

  3. C

    Encrypting all collected data to protect it from unauthorized access

  4. D

    Transferring large volumes of data to a cloud-based AI solution

Xem giải thích

Đáp án

B — Chỉ thu thập LƯỢNG DỮ LIỆU TỐI THIỂU cần thiết để giải pháp AI hoạt động hiệu quả.

Vì sao đúng

⚠ Data minimization là nguyên tắc nền của quyền riêng tư: | Nguyên tắc | Nội dung | |---|---| | ⚠ Chỉ thu thứ THỰC SỰ cần | | | ⚠ Chỉ giữ trong THỜI GIAN cần | | | ⚠ Chỉ dùng cho MỤC ĐÍCH đã công bố | | | ⚠ Xoá khi hết cần | |

⚠ Dữ liệu không thu thập
        ↓
⚠ KHÔNG THỂ bị rò rỉ
⚠ KHÔNG THỂ bị lạm dụng
⚠ KHÔNG cần bảo vệ
        ↓
⚠ Cách bảo vệ rẻ và chắc chắn nhất

Vì sao các phương án khác sai

  • A (thu càng nhiều càng tốt để mô hình chính xác hơn) — ⚠ NGƯỢC hoàn toàn; ⚠ đây là ⚠ quán tính cũ mà nguyên tắc này ra đời để sửa.

  • C (mã hoá toàn bộ dữ liệu) — ⚠ là biện pháp BẢO VỆ, ⚠ không phải giảm thiểu thu thập; ⚠ hai việc bổ sung nhau chứ không thay nhau.

  • D (chuyển khối lượng lớn dữ liệu lên đám mây) — ⚠ không liên quan, thậm chí đi ngược.

Ghi nhớ

⚠ Ghi nhớ về chất lượng câu hỏi: ⚠ câu này ⚠ cùng nhóm Privacy với #17979 ở đợt trước — ⚠ #17979 hỏi về bảo vệ dữ liệu y tế, ⚠ câu này hỏi định nghĩa nguyên tắc; ⚠ không mâu thuẫn.

⚠ Privacy & Security — việc cụ thể: | Việc | Nội dung | |---|---| | ⚠ Data minimization | ⚠ thu ít nhất có thể — đề này | | ⚠ Ẩn danh / giả danh | ⚠ bỏ hoặc thay thông tin định danh | | ⚠ Mã hoá khi truyền và khi lưu | | | ⚠ Kiểm soát truy cập theo vai trò | | | ⚠ Chính sách lưu giữ và xoá | | | ⚠ Có cơ sở pháp lý và sự đồng ý | |

Từ khoá nhận diện:

"thu ít nhất có thể" → ⚠ data minimization "mã hoá, phân quyền" → ⚠ biện pháp bảo vệ "bỏ tên, số CCCD khỏi dữ liệu" → ⚠ ẩn danh, PII detection "thu càng nhiều càng tốt" → ⚠ luôn là phương án SAI

⚠ Vì sao ít dữ liệu lại tốt hơn Lý do
⚠ Bề mặt rủi ro nhỏ hơn
⚠ Tuân thủ GDPR và luật dữ liệu dễ hơn
⚠ Chi phí lưu trữ và bảo vệ thấp hơn
⚠ Dữ liệu thừa còn làm mô hình NHIỄU
⚠ Ngộ nhận ⚠ "thêm cột nào cũng có ích" — thường không đúng
⚠ Ẩn danh và giả danh — phân biệt Phân biệt
⚠ Ẩn danh: KHÔNG khôi phục lại được danh tính
⚠ Giả danh: thay bằng mã, có bảng tra riêng ⚠ vẫn là dữ liệu cá nhân theo luật
⚠ Sai lầm hay gặp ⚠ tưởng bỏ tên là đã ẩn danh
⚠ Thực tế ⚠ vài trường kết hợp lại vẫn định danh được một người

Ba việc kiểm chứng: | Việc | Cách | |---|---| | Trường dữ liệu này có thật sự cần không | ⚠ hỏi cho từng cột | | Giữ bao lâu và ai xoá | | | Bỏ tên rồi có còn suy ra được người không | |

Và ngộ nhận phổ biến nhất về ẩn danh dữ liệu, khiến nhiều tập dữ liệu "đã ẩn danh" vẫn định danh được: bỏ tên không đủ. Ngày sinh, mã bưu chính và giới tính cộng lại thường đủ để chỉ ra một người cụ thể.

Câu 109 AI Vision

Which of the following is a feature of object detection solutions?

  1. A

    Object localization

  2. B

    Image segmentation

  3. C

    Image recognition

  4. D

    Object classification

Xem giải thích

Đáp án

A — Định vị đối tượng (Object localization).

Vì sao đúng

⚠ Localization là điều PHÂN BIỆT phát hiện đối tượng với phân loại ảnh:

⚠ Phân loại ảnh
   ⚠ "Ảnh này có mèo" ⚠ KHÔNG biết ở đâu

⚠ Phát hiện đối tượng
   ⚠ "Mèo tại (x=120, y=80, w=200, h=180)"
   ⚠ "Chó tại (x=400, y=95, w=180, h=210)"
        ↓
⚠ Vừa biết LÀ GÌ vừa biết Ở ĐÂU

⚠ Bounding box chính là kết quả của localization.

Vì sao các phương án khác sai

  • B (Image segmentation) — ⚠ bài toán KHÁC: ⚠ gán nhãn cho ⚠ từng pixel, ⚠ chi tiết hơn hộp bao; ⚠ Custom Vision ⚠ không làm segmentation.

  • C (Image recognition) — ⚠ thuật ngữ chung chung, ⚠ không phải đặc trưng riêng của phát hiện đối tượng.

  • D (Object classification) — ⚠ xem mục chất lượng câu hỏi.

Ghi nhớ

⚠ Ghi nhớ về chất lượng câu hỏi: ⚠ phương án D không hoàn toàn sai.

Phương án Thực tế
⚠ D — object classification ⚠ phát hiện đối tượng CÓ phân loại từng vật tìm được
⚠ A (khoá) ⚠ localization là phần RIÊNG CÓ, phân biệt nó với phân loại ảnh
⚠ Vì sao chọn A ⚠ đề hỏi tính năng ĐẶC TRƯNG, mà phân loại thì bài toán khác cũng có
⚠ Giữ nguyên khoá ⚠ A theo bộ đề gốc
⚠ Mẹo ⚠ hỏi "cái nào chỉ bài toán NÀY mới có"

⚠ Bốn bài toán thị giác xếp theo mức chi tiết: | Bài toán | Đầu ra | Chi tiết | |---|---|---| | ⚠ Image classification | ⚠ một nhãn cho cả ảnh | ⚠ thấp nhất | | ⚠ Object detection | ⚠ nhãn + hộp bao | ⚠ trung bình | | ⚠ Semantic segmentation | ⚠ nhãn cho từng pixel | ⚠ cao | | ⚠ Instance segmentation | ⚠ tách từng cá thể theo pixel | ⚠ cao nhất |

Từ khoá nhận diện:

"ở ĐÂU trong ảnh, bao nhiêu cái" → ⚠ object detection "ảnh này là gì" → ⚠ image classification "đường viền chính xác từng pixel" → ⚠ segmentation "đếm số vật trong ảnh" → ⚠ object detection

⚠ Gán nhãn cho phát hiện đối tượng Điểm
⚠ Phải vẽ HỘP quanh từng vật, không chỉ gắn tag
⚠ Tốn công hơn nhiều so với phân loại
⚠ Custom Vision có công cụ vẽ hộp trên trình duyệt
⚠ Có gợi ý hộp sau vài chục ảnh đầu ⚠ smart labeler
⚠ Chỉ số riêng ⚠ mAP dựa trên độ chồng lấn IoU
⚠ IoU — chỉ số nền của phát hiện đối tượng Nội dung
⚠ Đo độ chồng lấn giữa hộp dự đoán và hộp thật
⚠ Thường lấy ngưỡng 0,5 để tính là đúng
⚠ Nghĩa là ⚠ hộp lệch nhiều vẫn bị tính SAI dù nhãn đúng

Ba việc kiểm chứng: | Việc | Cách | |---|---| | Có cần biết vị trí không | ⚠ quyết định detection hay classification | | Có cần đường viền chính xác không | ⚠ thì phải segmentation, ngoài Custom Vision | | Đã tính chi phí vẽ hộp cho toàn bộ ảnh chưa | |

Và điều đội dự án thường phát hiện muộn khi chuyển từ phân loại ảnh sang phát hiện đối tượng: công gán nhãn tăng lên nhiều lần, vì mỗi ảnh giờ cần vẽ hộp quanh từng vật thay vì chọn một nhãn.

Câu 110 Common machine learning types

Which of the following examples best illustrates a regression scenario in machine learning?

  1. A

    Grouping similar customers based on their purchase history

  2. B

    Identifying anomalies in financial transactions

  3. C

    Predicting the class label of an image

  4. D

    Forecasting the price of a stock

Xem giải thích

Đáp án

D — Dự báo giá cổ phiếu (Forecasting the price of a stock).

Vì sao đúng

⚠ Giá cổ phiếu là giá trị SỐ LIÊN TỤC — đó là hồi quy:

⚠ Đặc trưng
   ⚠ giá lịch sử, khối lượng, chỉ số ngành
        ↓
⚠ 78.450 đồng
        ↓
⚠ Con số trên thang liên tục → hồi quy

Vì sao các phương án khác sai

  • C (dự đoán NHÃN LỚP của một ảnh) — ⚠ phân loại: ⚠ đầu ra là nhãn rời rạc.

  • A (nhóm khách hàng giống nhau theo lịch sử mua) — ⚠ gom cụm, ⚠ học không giám sát, không có nhãn.

  • B (tìm giao dịch tài chính bất thường) — ⚠ phát hiện bất thường.

Ghi nhớ

⚠ Ghi nhớ về chất lượng câu hỏi: ⚠ câu này ⚠ gần trùng #18020 trong cùng đợt và #17984.

Câu Hỏi gì Khoá
⚠ #18020 ⚠ mệnh đề đúng về hồi quy ⚠ dự đoán biến liên tục
⚠ #18024 (câu này) ⚠ ví dụ nào là hồi quy ⚠ dự báo giá cổ phiếu
⚠ Cùng nguyên lý ⚠ một hỏi định nghĩa, một hỏi ví dụ
⚠ Lưu ý ⚠ giá cổ phiếu theo thời gian đúng ra là FORECASTING, một dạng hồi quy có yếu tố thời gian

⚠ Bảng nhận dạng bài toán từ đề bài: | Đề nói | Bài toán | |---|---| | ⚠ "dự báo giá, doanh thu, nhiệt độ" | ⚠ regression | | ⚠ "phân loại, có phải là..." | ⚠ classification | | ⚠ "nhóm khách giống nhau" | ⚠ clustering | | ⚠ "giao dịch bất thường" | ⚠ anomaly detection | | ⚠ "gợi ý sản phẩm" | ⚠ recommendation |

Từ khoá nhận diện:

"bao nhiêu tiền, bao nhiêu đơn vị" → ⚠ regression "thuộc nhóm nào trong các nhóm đã biết" → ⚠ classification "tự tìm nhóm, chưa biết trước" → ⚠ clustering "khác thường so với bình thường" → ⚠ anomaly detection

⚠ Forecasting — sắc thái quan trọng Sắc thái
⚠ Là hồi quy nhưng dữ liệu có THỨ TỰ THỜI GIAN
⚠ KHÔNG được chia tập ngẫu nhiên ⚠ sai lầm nghiêm trọng
⚠ Phải chia theo mốc thời gian ⚠ quá khứ huấn luyện, tương lai kiểm
⚠ Cần đặc trưng theo mùa vụ, xu hướng
⚠ AutoML ⚠ có chế độ time-series forecasting riêng
⚠ Vì sao dự báo giá cổ phiếu là ví dụ khó Lý do
⚠ Thị trường gần với ngẫu nhiên
⚠ Chịu tác động sự kiện ngoài dữ liệu
⚠ Mô hình đúng trên lịch sử vẫn có thể vô dụng
⚠ Trong đề thi ⚠ chỉ cần nhận ra ĐẦU RA là số → hồi quy

Ba việc kiểm chứng: | Việc | Cách | |---|---| | Đầu ra là số hay nhãn | | | Dữ liệu có thứ tự thời gian không | ⚠ quyết định cách chia tập | | Có chia tập ngẫu nhiên trên dữ liệu thời gian không | ⚠ lỗi hay gặp |

Và sai lầm âm thầm nhất khi làm bài toán dự báo, cho ra kết quả đẹp đến mức đáng ngờ: chia tập ngẫu nhiên trên dữ liệu chuỗi thời gian. Mô hình được nhìn thấy tương lai trong lúc học, và mọi chỉ số đều rực rỡ cho tới ngày triển khai.