Ngân hàng đề — Microsoft Azure AI Fundamentals

Tìm thấy 316 câu.

Câu 71
A retail company wants to automatically categorize product images uploaded to their online store. They need to assign each image to one of the following categories: Electronics, Clothing, Furniture, or Toys. Which Azure AI Vision capability should they implement?
  1. A Face detection to identify people in product demonstration images
  2. B Object detection to identify and locate multiple products within each image
  3. C Image classification to assign each image to a single product category
  4. D Optical character recognition (OCR) to read product labels in the images
Xem giải thích

Đáp án

C — Image classification để gán mỗi ảnh vào MỘT danh mục sản phẩm.

Ghi nhớ về chất lượng câu hỏi

⚠ Câu này GẦN TRÙNG với #17941 ở lô trước.

Câu Danh mục
⚠ #17941 (lô 161) ⚠ bear, deer, wolf, empty, other wildlife — năm nhãn
⚠ #17985 (câu này) ⚠ Electronics, Clothing, Furniture, Toys — bốn nhãn
⚠ Cùng khoá ⚠ image classification
⚠ Cùng lý do ⚠ mỗi ảnh MỘT nhãn, không cần vị trí hay số lượng

Vì sao đúng

⚠ Đề nói rõ: gán mỗi ảnh vào MỘT trong bốn danh mục.

⚠ Ảnh sản phẩm
        ↓ ⚠ Image classification
⚠ MỘT nhãn: "Clothing"
        ↓
⚠ Đủ để sắp xếp catalog

⚠ Không cần biết sản phẩm nằm ở đâu trong ảnh, không cần đếm → ⚠ classification là đủ.

Vì sao các phương án khác sai

  • B (object detection để nhận và định vị nhiều sản phẩm) — ⚠ THỪA: ⚠ đề chỉ cần một nhãn; ⚠ object detection đòi gán nhãn bounding box — tốn công hơn nhiều lần.

  • D (OCR đọc nhãn sản phẩm) — ⚠ đọc chữ: ⚠ có thể bổ trợ, không phân loại ảnh.

  • A (face detection tìm người trong ảnh minh hoạ) — ⚠ lạc đề.

Ghi nhớ

⚠ Classification so với Object detection — chi phí gán nhãn: | Loại | Gán nhãn | Công sức | |---|---|---| | ⚠ Classification | ⚠ chọn một nhãn cho ảnh | ⚠ vài giây mỗi ảnh | | ⚠ Object detection | ⚠ vẽ hộp quanh từng đối tượng | ⚠ vài phút mỗi ảnh | | ⚠ Với hàng nghìn ảnh | ⚠ khác biệt là hàng trăm giờ công | | ⚠ Nguyên tắc | ⚠ chọn loại ĐƠN GIẢN NHẤT đáp ứng yêu cầu |

Từ khoá nhận diện:

"gán MỘT danh mục cho ảnh" → ⚠ image classification "đếm, định vị" → ⚠ object detection "đọc chữ" → ⚠ OCR "nhãn riêng của công ty" → ⚠ Custom Vision

⚠ Dựng sẵn hay Custom Vision cho bốn danh mục này Cân nhắc
⚠ Image Analysis dựng sẵn CÓ tag "clothing", "furniture"
⚠ Nhưng tag dựng sẵn trả về NHIỀU nhãn, không ép về bốn
⚠ Custom Vision cho đúng bốn danh mục mong muốn
⚠ Thực tế ⚠ thử dựng sẵn trước; nếu cần đúng bốn nhãn thì Custom Vision
⚠ Multiclass so với Multilabel — chọn khi tạo project Chọn
⚠ Multiclass ⚠ mỗi ảnh MỘT nhãn — đề này
⚠ Multilabel ⚠ một ảnh nhiều nhãn
⚠ Khi nào cần multilabel ⚠ ảnh có cả quần áo lẫn phụ kiện chẳng hạn
⚠ KHÔNG đổi được ⚠ sau khi tạo project
⚠ Yêu cầu dữ liệu cho Custom Vision Yêu cầu
⚠ Tối thiểu 15 ảnh mỗi nhãn ⚠ 50+ cho kết quả tốt
⚠ Cân bằng số ảnh giữa các nhãn
⚠ Đa dạng góc chụp, nền, ánh sáng
⚠ Giống ảnh thực tế người dùng sẽ tải lên
⚠ Sai lầm ⚠ huấn luyện bằng ảnh studio, dùng với ảnh khách chụp

Ba việc kiểm chứng: | Việc | Cách | |---|---| | Có ảnh nào thuộc nhiều danh mục không | ⚠ thì cần multilabel | | Tag dựng sẵn có đủ không | ⚠ thử trước khi huấn luyện riêng | | Ảnh huấn luyện có giống ảnh thật không | |

Và câu hỏi nên đặt trước mỗi dự án thị giác máy tính: bài toán đơn giản nhất nào đáp ứng được yêu cầu?. Chọn object detection khi classification đã đủ nghĩa là tự nhân đôi khối lượng gán nhãn mà không thu được gì thêm.

Câu 72
A marketing team wants to create personalized email campaigns for thousands of customers. They need to generate unique email content that matches each customer's interests and previous purchase history while maintaining the company's brand voice. Which AI solution would be most appropriate for this scenario?
  1. A Use a computer vision model to analyze customer profile images and generate email content based on visual preferences.
  2. B Use a generative AI model to create customized email text based on customer data and brand guidelines.
  3. C Use a classification model to categorize customers into groups and send the same email to each group.
  4. D Use a regression model to predict customer spending and adjust email frequency accordingly.
Xem giải thích

Đáp án

B — Dùng mô hình AI sinh ngữ để tạo nội dung email tuỳ chỉnh dựa trên dữ liệu khách hàng và hướng dẫn thương hiệu.

Ghi nhớ về chất lượng câu hỏi

⚠ Câu này GẦN TRÙNG với #17931 ở lô trước.

Câu Diễn đạt
⚠ #17931 (lô 161) ⚠ "email cá nhân hoá theo lịch sử mua, giữ giọng thương hiệu"
⚠ #17986 (câu này) ⚠ cùng kịch bản, phương án viết chi tiết hơn
⚠ Cùng khoá ⚠ Generative AI

Vì sao đúng

⚠ Ba yêu cầu, chỉ AI sinh ngữ đáp ứng được cả ba: | Yêu cầu | Nội dung | |---|---| | ⚠ Nội dung ĐỘC ĐÁO cho từng khách | ⚠ sinh mới mỗi lần | | ⚠ Dựa trên lịch sử mua và sở thích | ⚠ đưa vào prompt | | ⚠ Giữ giọng điệu thương hiệu | ⚠ system message + ví dụ mẫu |

Vì sao các phương án khác sai

  • C (phân loại khách thành nhóm rồi gửi CÙNG một email cho mỗi nhóm) — ⚠ KHÔNG cá nhân hoá thật: ⚠ đề đòi nội dung độc đáo cho TỪNG người; ⚠ đây là cách làm cũ, tốt hơn không có gì nhưng không đáp ứng yêu cầu.

  • D (mô hình hồi quy dự đoán chi tiêu để điều chỉnh tần suất email) — ⚠ điều chỉnh TẦN SUẤT, không tạo NỘI DUNG.

  • A (mô hình thị giác phân tích ảnh hồ sơ khách) — ⚠ vừa lạc đề vừa có vấn đề về quyền riêng tư.

Ghi nhớ

⚠ Ba mức cá nhân hoá email — bảng phải thuộc: | Mức | Cách làm | |---|---| | ⚠ Không cá nhân hoá | ⚠ một email cho tất cả | | ⚠ Phân khúc | ⚠ chia nhóm, mỗi nhóm một email — phương án C | | ⚠ Cá nhân hoá thật | ⚠ AI sinh nội dung riêng cho từng người — đề này | | ⚠ Chi phí tăng dần | ⚠ và hiệu quả cũng tăng dần |

Từ khoá nhận diện:

"nội dung độc đáo cho từng người" → ⚠ Generative AI "chia nhóm rồi gửi chung" → ⚠ phân khúc — không phải cá nhân hoá thật "dự đoán chi tiêu" → ⚠ regression

⚠ Kiến trúc thực tế cho cá nhân hoá email Kiến trúc
⚠ 1. Lấy dữ liệu khách từ CDP hoặc kho dữ liệu
⚠ 2. Mô hình gợi ý chọn sản phẩm phù hợp ⚠ không phải sinh ngữ
⚠ 3. AI sinh ngữ viết nội dung quanh sản phẩm đó
⚠ 4. Kiểm duyệt và kiểm tra mẫu
⚠ 5. Gửi và đo tỉ lệ mở, tỉ lệ click
⚠ Lưu ý ⚠ AI sinh ngữ viết CÂU, mô hình gợi ý chọn SẢN PHẨM — hai việc khác nhau
⚠ Giữ giọng thương hiệu — cách hiệu quả nhất Cách
⚠ Few-shot: đưa 3-5 email mẫu đã duyệt ⚠ hiệu quả nhất
⚠ System message mô tả giọng điệu
⚠ Danh sách từ NÊN và KHÔNG NÊN dùng
⚠ Temperature vừa phải
⚠ Với quy mô rất lớn ⚠ cân nhắc fine-tune trên email cũ của công ty
⚠ Rủi ro nhân lên theo quy mô Rủi ro
⚠ Một prompt sai → hàng nghìn email sai
⚠ Bịa khuyến mãi không tồn tại
⚠ Xưng hô sai, dùng dữ liệu nhầm người
⚠ Bắt buộc ⚠ kiểm tra mẫu ngẫu nhiên TRƯỚC mỗi chiến dịch
⚠ Và ⚠ gửi thử cho nội bộ trước khi gửi ra ngoài

Ba việc kiểm chứng: | Việc | Cách | |---|---| | Có gửi thử nội bộ trước không | | | Nội dung có bịa khuyến mãi không | | | Có đo hiệu quả bằng A/B test không | ⚠ so với email phân khúc thông thường |

Và cách duy nhất biết cá nhân hoá bằng AI có đáng tiền hay không: A/B test với email phân khúc thông thường. Rất nhiều dự án cá nhân hoá tốn kém mà không bao giờ chứng minh được mình hơn cách làm cũ.

Câu 73
A retail company wants to analyze their customer purchase data to identify groups of customers with similar buying patterns. They have historical transaction data but no predefined customer categories. The marketing team wants to create targeted campaigns for each group discovered. Which type of machine learning should they use?
  1. A Classification
  2. B Clustering
  3. C Regression
  4. D Anomaly detection
Xem giải thích

Đáp án

B — Clustering (phân cụm).

Ghi nhớ về chất lượng câu hỏi

⚠ Câu này GẦN TRÙNG với #17924 ở lô trước.

Câu Diễn đạt
⚠ #17924 (lô 161) ⚠ "không có danh mục định sẵn, muốn hệ thống tự tìm nhóm tự nhiên"
⚠ #17987 (câu này) ⚠ "có dữ liệu giao dịch nhưng KHÔNG có danh mục khách định sẵn"
⚠ Cùng khoá ⚠ clustering

Vì sao đúng

⚠ Cụm từ quyết định: "KHÔNG có danh mục định sẵn".

⚠ Không có NHÃN
        ↓
⚠ Học KHÔNG giám sát
        ↓
⚠ Clustering — máy tự tìm nhóm
        ↓
⚠ Marketing thiết kế chiến dịch riêng cho mỗi nhóm

Vì sao các phương án khác sai

  • A (classification) — ⚠ cần NHÃN có sẵn: ⚠ đề nói rõ không có.

  • C (regression) — ⚠ dự đoán con số.

  • D (anomaly detection) — ⚠ tìm khách hàng bất thường: ⚠ là bài toán khác.

Ghi nhớ

⚠ Phân biệt clustering và classification — bảng phải thuộc: | Tiêu chí | ⚠ Clustering | ⚠ Classification | |---|---|---| | ⚠ Có nhãn sẵn | ⚠ KHÔNG | ⚠ CÓ | | ⚠ Loại học | ⚠ không giám sát | ⚠ có giám sát | | ⚠ Kết quả | ⚠ nhóm chưa có tên | ⚠ nhãn đã biết | | ⚠ Cần người diễn giải | ⚠ CÓ — đặt tên cho từng cụm | ⚠ không |

Từ khoá nhận diện:

"không có danh mục sẵn, tự tìm nhóm" → ⚠ clustering "phân vào các loại đã biết" → ⚠ classification "dự đoán số" → ⚠ regression "phân khúc khách hàng" → ⚠ gần như luôn là clustering

⚠ RFM — phương pháp phân khúc kinh điển Ba chiều
⚠ Recency ⚠ mua gần đây nhất khi nào
⚠ Frequency ⚠ mua thường xuyên tới đâu
⚠ Monetary ⚠ chi tiêu bao nhiêu
⚠ Ba chiều này ⚠ thường là đặc trưng đầu vào tốt nhất cho clustering khách hàng
⚠ Có thể phân khúc ⚠ bằng luật RFM đơn giản, không cần học máy
⚠ Bước quan trọng nhất SAU khi phân cụm Bước
⚠ DIỄN GIẢI từng cụm thành chân dung khách hàng
⚠ Máy trả về "cụm 0, 1, 2"
⚠ Người biến thành "khách trung thành", "khách săn sale"
⚠ Không có bước này ⚠ kết quả phân cụm không dùng được vào việc gì
⚠ Lỗi kỹ thuật phổ biến Lỗi
⚠ Quên CHUẨN HOÁ đặc trưng ⚠ cột doanh thu hàng triệu nuốt cột số lần mua hàng chục
⚠ Để giá trị ngoại lai làm lệch cụm
⚠ Chọn số cụm tuỳ tiện ⚠ dùng elbow method hoặc silhouette
⚠ Lỗi số một ⚠ không chuẩn hoá

Ba việc kiểm chứng: | Việc | Cách | |---|---| | Đặc trưng đã chuẩn hoá chưa | | | Mỗi cụm có đặt tên và mô tả được không | | | Số cụm có hợp lý về nghiệp vụ không | ⚠ 20 cụm thì marketing không làm nổi 20 chiến dịch |

Và ràng buộc thực tế thường bị bỏ qua khi chọn số cụm: đội marketing chạy được bao nhiêu chiến dịch khác nhau. Một kết quả phân cụm tối ưu về mặt toán học với mười lăm nhóm sẽ không bao giờ được triển khai.

Câu 74
A retail company has collected thousands of customer reviews from their e-commerce website. The marketing manager wants to quickly understand overall customer satisfaction and identify which products are receiving negative feedback. Which Azure AI service feature would be most appropriate for this scenario?
  1. A Key phrase extraction
  2. B Named entity recognition
  3. C Language detection
  4. D Sentiment analysis
Xem giải thích

Đáp án

D — Sentiment analysis.

Ghi nhớ về chất lượng câu hỏi

⚠ Đây là câu THỨ NĂM về sentiment analysis trong hai lô.

Câu Bối cảnh
⚠ #17923, #17938, #17940 (lô 161) ⚠ đánh giá sản phẩm, email hỗ trợ
⚠ #17962 (lô 162) ⚠ đánh giá đa ngôn ngữ
⚠ #17988 (câu này) ⚠ mức hài lòng chung và sản phẩm nào bị chê
⚠ Cùng khoá ⚠ sentiment analysis

Vì sao đúng

⚠ Đề cần hai thứ, cả hai đều từ sentiment: | Cần | Sentiment analysis | |---|---| | ⚠ Mức hài lòng CHUNG | ⚠ tổng hợp điểm cảm xúc mọi đánh giá | | ⚠ Sản phẩm nào bị phản hồi TIÊU CỰC | ⚠ lọc đánh giá negative theo sản phẩm |

Vì sao các phương án khác sai

  • A (key phrase extraction) — ⚠ cho biết chủ đề, không cho biết thái độ.

  • B (named entity recognition) — ⚠ trích tên sản phẩm: ⚠ hữu ích để nhóm theo sản phẩm, ⚠ nhưng không đánh giá hài lòng.

  • C (language detection) — ⚠ chỉ nhận diện ngôn ngữ.

Ghi nhớ

⚠ Ghép nhiều tính năng cho phân tích phản hồi hoàn chỉnh: | Tính năng | Đóng góp | |---|---| | ⚠ Sentiment analysis | ⚠ hài lòng hay không — đề này | | ⚠ Opinion mining | ⚠ hài lòng về KHÍA CẠNH nào | | ⚠ NER | ⚠ sản phẩm nào được nhắc | | ⚠ Key phrase | ⚠ chủ đề chung | | ⚠ Ghép lại | ⚠ "sản phẩm X bị chê về ĐÓNG GÓI, 340 lượt" |

Từ khoá nhận diện:

"mức hài lòng, tích cực tiêu cực" → ⚠ sentiment analysis "chủ đề được bàn" → ⚠ key phrase extraction "tên sản phẩm cụ thể" → ⚠ NER "khen gì chê gì" → ⚠ opinion mining

⚠ Cấp độ phân tích của sentiment Cấp độ
⚠ Mức TÀI LIỆU ⚠ cảm xúc chung của cả đánh giá
⚠ Mức CÂU ⚠ từng câu một
⚠ Mức KHÍA CẠNH (opinion mining) ⚠ gắn cảm xúc với đối tượng cụ thể
⚠ Đánh giá dài ⚠ mức tài liệu che mất chi tiết — nên dùng mức câu hoặc khía cạnh
⚠ Từ dữ liệu tới hành động Bước
⚠ Tổng hợp điểm cảm xúc theo SẢN PHẨM
⚠ Xếp hạng sản phẩm bị chê nhiều nhất
⚠ Với mỗi sản phẩm, xem chê về KHÍA CẠNH gì
⚠ Đặt cảnh báo khi tỉ lệ tiêu cực TĂNG ĐỘT BIẾN
⚠ Cảnh báo tăng đột biến ⚠ có giá trị hơn báo cáo hằng tháng
⚠ Hạn chế cần biết Hạn chế
⚠ Mỉa mai rất khó nhận
⚠ Đánh giá ngắn thiếu ngữ cảnh
⚠ Người dùng cho 5 sao nhưng viết lời chê ⚠ hoặc ngược lại
⚠ Nên ⚠ so sánh điểm cảm xúc với số sao — chênh lệch là tín hiệu đáng xem

Ba việc kiểm chứng: | Việc | Cách | |---|---| | Điểm cảm xúc có khớp với số sao không | ⚠ lệch nhiều là dấu hiệu cần xem lại | | Có cảnh báo khi tiêu cực tăng đột biến không | | | Có phân tích tới mức khía cạnh không | |

Và một phép kiểm tra chéo đơn giản mà hiệu quả cho hệ thống phân tích cảm xúc: đối chiếu điểm cảm xúc với số sao khách chấm. Những đánh giá lệch nhiều giữa hai con số thường là những đánh giá đáng đọc nhất.

Câu 75
A customer service company wants to analyze thousands of customer feedback emails to automatically identify the main topics discussed, such as pricing complaints, product quality issues, or delivery problems, without having to manually label training data. Which Azure AI Language feature should they use?
  1. A Custom text classification
  2. B Sentiment analysis
  3. C Key phrase extraction
  4. D Entity recognition
Xem giải thích

Đáp án

C — Key phrase extraction.

Ghi nhớ về chất lượng câu hỏi

⚠ Câu này và #17957 trong CÙNG LÔ có khoá KHÁC NHAU cho bài toán nhìn qua rất giống.

Câu Yêu cầu then chốt Khoá
⚠ #17957 ⚠ định tuyến vào BA loại ĐỊNH SẴN ⚠ text classification
⚠ #17989 (câu này) ⚠ KHÔNG phải gán nhãn dữ liệu huấn luyện ⚠ key phrase extraction
⚠ Chữ quyết định ⚠ "without manually labeling training data"

Vì sao đúng

⚠ Cụm "không cần gán nhãn thủ công" loại bỏ mọi phương án cần huấn luyện:

⚠ Custom text classification
   ⚠ CẦN dữ liệu đã gán nhãn
        ↓ ⚠ đề loại trừ

⚠ Key phrase extraction
   ⚠ mô hình DỰNG SẴN, dùng ngay
   ⚠ tự trích cụm từ nổi bật
        ↓
⚠ "giá quá cao", "hàng lỗi", "giao chậm"
        ↓
⚠ Tổng hợp → ⚠ thấy chủ đề chính

Vì sao các phương án khác sai

  • A (custom text classification) — ⚠ cho kết quả GỌN GÀNG hơn nhưng CẦN gán nhãn: ⚠ chính là điều đề loại trừ.

  • B (sentiment analysis) — ⚠ cho thái độ, không cho chủ đề.

  • D (entity recognition) — ⚠ trích tên riêng: ⚠ "pricing complaints" không phải một thực thể có tên.

Ghi nhớ

⚠ Cần nhãn hay không — bảng phải thuộc: | Tính năng | Cần dữ liệu gán nhãn | |---|---| | ⚠ Key phrase extraction | ⚠ KHÔNG — dựng sẵn | | ⚠ Sentiment analysis | ⚠ KHÔNG — dựng sẵn | | ⚠ NER dựng sẵn | ⚠ KHÔNG | | ⚠ Custom text classification | ⚠ CÓ | | ⚠ Custom NER | ⚠ CÓ | | ⚠ Đề nhấn "không gán nhãn" | ⚠ chỉ còn nhóm dựng sẵn |

Từ khoá nhận diện:

"không cần gán nhãn" → ⚠ tính năng dựng sẵn "phân vào N loại định sẵn" → ⚠ classification (cần nhãn) "tự khám phá chủ đề" → ⚠ key phrase hoặc topic modeling

⚠ Đánh đổi giữa hai cách Đánh đổi
⚠ Key phrase: dùng ngay, kết quả PHÂN MẢNH ⚠ cần hậu xử lý gom nhóm
⚠ Custom classification: gọn gàng, đúng nhãn mong muốn ⚠ tốn công gán nhãn
⚠ Chiến lược thực tế ⚠ dùng key phrase để KHÁM PHÁ chủ đề trước, rồi mới định nghĩa nhãn và huấn luyện
⚠ Đó là ⚠ cách tự nhiên: khám phá rồi mới chuẩn hoá
⚠ Gom nhóm cụm từ khoá — cách làm Cách
⚠ Từ điển đồng nghĩa thủ công ⚠ đơn giản, hiệu quả với miền hẹp
⚠ Embedding + clustering ⚠ tự động hơn
⚠ Dùng mô hình ngôn ngữ để gán chủ đề ⚠ linh hoạt nhất
⚠ Với ba nhóm như đề nêu ⚠ từ điển thủ công là đủ và nhanh nhất
⚠ Lộ trình trưởng thành của phân tích phản hồi Lộ trình
⚠ 1. Key phrase để xem khách nói gì
⚠ 2. Xác định 5-10 chủ đề chính
⚠ 3. Gán nhãn vài trăm mẫu
⚠ 4. Huấn luyện custom classification
⚠ 5. Tự động phân loại toàn bộ
⚠ Đề này ⚠ đang ở bước 1

Ba việc kiểm chứng: | Việc | Cách | |---|---| | Kết quả có quá phân mảnh không | | | Có kế hoạch chuyển sang custom classification không | | | Ai sẽ đọc và diễn giải danh sách cụm từ | |

Và cách dùng đúng nhất của trích xuất cụm từ khoá: coi nó là bước KHÁM PHÁ, không phải bước cuối. Nó cho bạn biết nên định nghĩa những nhãn nào, và sau đó một mô hình phân loại mới cho ra báo cáo gọn gàng.

Câu 76
A retail company wants to implement an AI solution to analyze customer behavior in their stores. They need to count the number of customers entering different sections, estimate the age range of customers viewing specific products, and detect if customers appear happy or frustrated. Which Azure AI service feature would best support all of these requirements?
  1. A Azure AI Video Indexer with brand detection
  2. B Azure AI Custom Vision with a custom object detection model
  3. C Azure AI Computer Vision with optical character recognition (OCR)
  4. D Azure AI Face API with detection and analysis capabilities
Xem giải thích

Đáp án

D — Azure AI Face API với khả năng phát hiện và phân tích.

Ghi nhớ về chất lượng câu hỏi

⚠ Các thuộc tính đề yêu cầu đã bị Microsoft GỠ BỎ.

Thuộc tính đề cần Trạng thái
⚠ Ước lượng khoảng TUỔI ⚠ ĐÃ GỠ từ 2022
⚠ Phát hiện vui hay bực bội (CẢM XÚC) ⚠ ĐÃ GỠ
⚠ Đếm số người vào từng khu vực ⚠ vẫn làm được — nhưng object detection hợp hơn

⚠ KHÔNG sửa khoá — ⚠ vào thời điểm đề soạn, Face API là câu trả lời đúng.

⚠ Đây là câu THỨ TƯ về cùng chủ đề trong hai lô (#17929, #17936, #17964, #17990).

Vì sao đúng (theo bối cảnh đề)

⚠ Trong bốn phương án, chỉ Face API xử lý được khuôn mặt: | Phương án | Năng lực | |---|---| | ⚠ Face API detection + analysis | ⚠ phát hiện mặt, trả thuộc tính | | ⚠ Video Indexer brand detection | ⚠ nhận diện THƯƠNG HIỆU trong video | | ⚠ Custom Vision object detection | ⚠ đếm được người, nhưng KHÔNG cho tuổi hay cảm xúc | | ⚠ Computer Vision OCR | ⚠ đọc chữ |

Vì sao các phương án khác sai

  • B (Custom Vision object detection) — ⚠ đếm được người nhưng KHÔNG cho thuộc tính: ⚠ đề cần cả tuổi và cảm xúc.

  • A (Video Indexer brand detection) — ⚠ nhận diện logo và thương hiệu.

  • C (Computer Vision OCR) — ⚠ đọc chữ.

Ghi nhớ

⚠ Vì sao Microsoft gỡ các thuộc tính này | Lý do: | Lý do | Nội dung | |---|---| | ⚠ Ước lượng tuổi và giới tính THIÊN LỆCH theo chủng tộc | | | ⚠ Suy đoán cảm xúc từ khuôn mặt THIẾU CƠ SỞ KHOA HỌC | ⚠ biểu cảm không phản ánh cảm xúc thật một cách nhất quán | | ⚠ Nguy cơ dùng để phân biệt đối xử | | | ⚠ Điều đáng suy nghĩ | ⚠ một hãng lớn tự gỡ bỏ tính năng đang bán được |

Từ khoá nhận diện:

"tuổi, cảm xúc từ khuôn mặt" → ⚠ Face analysis — nhưng đã bị gỡ "đếm người" → ⚠ object detection — ít xâm phạm hơn "nhận ra khách quen" → ⚠ face identification — cần đăng ký quyền dùng "nhận diện thương hiệu trong video" → ⚠ Video Indexer brand detection

⚠ Vì sao suy đoán cảm xúc từ khuôn mặt gây tranh cãi Lý do
⚠ Biểu cảm khác nhau theo VĂN HOÁ
⚠ Cùng biểu cảm có thể mang nghĩa khác nhau
⚠ Nhiều người không biểu lộ cảm xúc ra mặt
⚠ Nghiên cứu tâm lý học hiện đại bác bỏ giả định này
⚠ Kết luận ⚠ "AI đọc được cảm xúc" là tuyên bố vượt quá bằng chứng khoa học
⚠ Thay thế cho ca dùng phân tích khách hàng Thay thế
⚠ Đếm người bằng object detection ⚠ không cần khuôn mặt
⚠ Phân tích luồng di chuyển, heatmap
⚠ Thời gian dừng lại tại mỗi khu vực
⚠ Khảo sát và chương trình khách hàng thân thiết ⚠ có đồng thuận, dữ liệu đáng tin hơn
⚠ Với mục tiêu marketing ⚠ các cách này hợp pháp hơn và chính xác hơn

Ba việc kiểm chứng: | Việc | Cách | |---|---| | Tính năng cần dùng còn tồn tại không | ⚠ kiểm tra tài liệu hiện hành | | Có cách nào không cần khuôn mặt không | | | Luật địa phương về sinh trắc học nói gì | |

Và bài học đáng giá nhất từ nhóm câu hỏi này, lặp lại bốn lần trong hai lô: một tính năng có trong tài liệu thi không có nghĩa là nó còn tồn tại, hay nên được dùng. Kiểm tra lại trước khi đưa vào thiết kế thật.

Câu 77
A retail company wants to predict customer purchasing behavior based on historical sales data. The data science team has limited machine learning expertise and needs to quickly build and deploy a model. They have a labeled dataset with customer demographics, past purchases, and purchase outcomes. Which capability of automated machine learning (AutoML) in Azure Machine Learning would be MOST beneficial for this scenario?
  1. A AutoML can only work with pre-processed data and requires manual selection of algorithms from a predefined list.
  2. B AutoML requires users to write custom Python code to define the model architecture before training can begin.
  3. C AutoML eliminates the need for any labeled training data by generating synthetic labels automatically.
  4. D AutoML can automatically handle feature engineering, algorithm selection, and hyperparameter tuning without requiring deep machine learning expertise.
Xem giải thích

Đáp án

D — AutoML có thể TỰ ĐỘNG xử lý kỹ thuật đặc trưng, chọn thuật toán và dò siêu tham số mà không đòi hỏi chuyên môn học máy sâu.

Ghi nhớ về chất lượng câu hỏi

⚠ Câu này GẦN TRÙNG với #17949 ở lô trước.

Câu Bối cảnh
⚠ #17949 (lô 161) ⚠ dự đoán số tiền mua hàng, đội ít kinh nghiệm ML
⚠ #17991 (câu này) ⚠ dự đoán hành vi mua, đội ít kinh nghiệm ML
⚠ Cùng khoá ⚠ AutoML tự thử thuật toán và siêu tham số

Vì sao đúng

⚠ AutoML tự động hoá BA việc tốn công nhất: | Việc | AutoML làm | |---|---| | ⚠ Featurization | ⚠ chuẩn hoá, mã hoá, xử lý thiếu, tạo đặc trưng | | ⚠ Chọn thuật toán | ⚠ thử nhiều loại, xếp hạng | | ⚠ Dò siêu tham số | ⚠ tìm bộ tham số tốt nhất |

⚠ Bạn đưa: dữ liệu có nhãn + cột mục tiêu
        ↓
⚠ AutoML thử hàng chục tổ hợp
        ↓
⚠ Trả về mô hình tốt nhất + MÃ NGUỒN của nó

Vì sao các phương án khác sai

  • A (chỉ làm việc với dữ liệu đã tiền xử lý, phải tự chọn thuật toán) — ⚠ NGƯỢC LẠI: ⚠ AutoML tự tiền xử lý và tự chọn thuật toán.

  • B (phải viết mã Python định nghĩa kiến trúc trước khi huấn luyện) — ⚠ sai: ⚠ AutoML dùng được hoàn toàn qua giao diện.

  • C (không cần dữ liệu có nhãn, tự sinh nhãn) — ⚠ SAI NGHIÊM TRỌNG: ⚠ AutoML là học CÓ GIÁM SÁT, ⚠ bắt buộc có nhãn.

Ghi nhớ

⚠ AutoML — làm và KHÔNG làm: | Làm | Không làm | |---|---| | ⚠ Featurization tự động | ⚠ sinh nhãn | | ⚠ Thử nhiều thuật toán | ⚠ hiểu nghiệp vụ | | ⚠ Dò siêu tham số | ⚠ phát hiện rò rỉ dữ liệu | | ⚠ Xếp hạng và giải thích mô hình | ⚠ quyết định ngưỡng triển khai | | ⚠ Sinh mã của mô hình tốt nhất | ⚠ thay thế dữ liệu chất lượng |

Từ khoá nhận diện:

"ít kinh nghiệm ML, cần nhanh" → ⚠ AutoML "không cần nhãn" → ⚠ SAI — AutoML cần nhãn "kéo thả" → ⚠ Designer "toàn quyền kiểm soát" → ⚠ custom training bằng SDK

⚠ Featurization tự động gồm gì Gồm
⚠ Xử lý giá trị thiếu
⚠ Mã hoá biến phân loại ⚠ one-hot, target encoding
⚠ Chuẩn hoá thang đo
⚠ Xử lý đặc trưng thời gian
⚠ Loại bỏ đặc trưng vô ích ⚠ cột chỉ có một giá trị
⚠ Xem được ⚠ AutoML cho biết nó đã làm gì
⚠ Giá trị lớn nhất của AutoML Giá trị
⚠ BASELINE nhanh ⚠ biết mức tốt nhất dễ đạt được
⚠ Tiết kiệm hàng tuần thử nghiệm
⚠ Sinh mã để học và tuỳ biến tiếp
⚠ Dùng đúng ⚠ điểm KHỞI ĐẦU, không phải điểm kết thúc
⚠ Nếu AutoML đạt 92% ⚠ mô hình tự viết mất ba tuần cần hơn thế mới đáng
⚠ Cảnh báo với AutoML Cảnh báo
⚠ Kết quả QUÁ ĐẸP thường là rò rỉ dữ liệu
⚠ AutoML vui vẻ dùng cột chứa thông tin tương lai
⚠ Không tự loại cột định danh ⚠ phải tự bỏ CustomerID
⚠ Bắt buộc ⚠ xem lại đặc trưng quan trọng nhất có hợp lý không

Ba việc kiểm chứng: | Việc | Cách | |---|---| | Đã bỏ cột định danh chưa | | | Kết quả có đẹp bất thường không | ⚠ kiểm tra rò rỉ | | Đặc trưng quan trọng nhất có hợp lý về nghiệp vụ không | |

Và việc mà AutoML không bao giờ làm thay bạn, dù nó tự động hoá mọi thứ khác: nhận ra rằng một cột trong dữ liệu không nên có mặt ở đó. Nó sẽ dùng cột đó và cho bạn một con số rất đẹp.

Câu 78
A healthcare company is developing a patient appointment system that allows patients to call and schedule appointments using natural language. The system needs to understand spoken requests like "I need to see a cardiologist next Tuesday at 3 PM" and respond verbally with available time slots. Which Azure AI Speech service capability should be implemented to enable this functionality?
  1. A Speech-to-text only, then use a separate text analysis service
  2. B Both speech-to-text and text-to-speech capabilities
  3. C Text-to-speech only with pre-recorded appointment confirmations
  4. D Speaker recognition to identify the patient
Xem giải thích

Đáp án

B — Cả speech-to-text lẫn text-to-speech.

Vì sao đúng

⚠ Hệ thống đặt lịch qua điện thoại cần HAI chiều: | Chiều | Dịch vụ | |---|---| | ⚠ Bệnh nhân NÓI yêu cầu | ⚠ speech-to-text | | ⚠ Hệ thống TRẢ LỜI bằng giọng nói | ⚠ text-to-speech |

⚠ "Tôi cần khám tim mạch thứ Ba tuần sau lúc 3 giờ"
        ↓ ⚠ Speech-to-text
⚠ Văn bản
        ↓ ⚠ CLU hiểu ý định và trích thực thể
⚠ Intent: BookAppointment
⚠ Entity: chuyên khoa=tim mạch, thời gian=thứ Ba 15:00
        ↓ ⚠ tra lịch
⚠ "Còn hai khung giờ: 15:00 và 16:30"
        ↓ ⚠ Text-to-speech
⚠ Bệnh nhân NGHE

Vì sao các phương án khác sai

  • A (chỉ speech-to-text rồi dùng dịch vụ phân tích văn bản riêng) — ⚠ thiếu chiều TRẢ LỜI: ⚠ đề nói rõ hệ thống phải đáp lại bằng lời.

  • C (chỉ text-to-speech với xác nhận thu âm sẵn) — ⚠ thiếu chiều NGHE: ⚠ và thu âm sẵn không đáp ứng được câu trả lời động.

  • D (speaker recognition để nhận diện bệnh nhân) — ⚠ xác thực danh tính: ⚠ có thể là tính năng bổ sung, ⚠ không phải năng lực cốt lõi.

Ghi nhớ

⚠ Kiến trúc trợ lý thoại đầy đủ — bảng phải thuộc: | Thành phần | Việc | |---|---| | ⚠ Speech-to-text | ⚠ nghe | | ⚠ CLU (hoặc LUIS cũ) | ⚠ hiểu ý định và trích thực thể | | ⚠ Logic nghiệp vụ | ⚠ tra lịch, đặt chỗ | | ⚠ Text-to-speech | ⚠ nói | | ⚠ Bốn thành phần | ⚠ thiếu một là hệ thống không hoạt động |

Từ khoá nhận diện:

"nghe VÀ nói" → ⚠ cả speech-to-text và text-to-speech "hiểu ý định người dùng" → ⚠ CLU / LUIS "xác thực bằng giọng" → ⚠ speaker recognition "phiên dịch" → ⚠ speech translation

⚠ Thách thức của trợ lý thoại y tế Thách thức
⚠ Nhận diện thuật ngữ y khoa ⚠ cần Custom Speech
⚠ Hiểu diễn đạt thời gian tự nhiên ⚠ "thứ Ba tuần sau", "đầu tháng tới"
⚠ Người cao tuổi nói chậm ⚠ cần tăng thời gian chờ
⚠ Tiếng ồn nền qua điện thoại
⚠ LUÔN cần đường chuyển sang người thật
⚠ Trích thực thể thời gian — khó hơn tưởng Khó
⚠ "thứ Ba tuần sau" phụ thuộc hôm nay là ngày nào
⚠ "3 giờ" là 3 sáng hay 3 chiều
⚠ CLU có thực thể DateTime dựng sẵn xử lý được phần lớn
⚠ Vẫn nên ⚠ XÁC NHẬN LẠI với người dùng trước khi đặt lịch
⚠ Nguyên tắc thiết kế hội thoại thoại Nguyên tắc
⚠ XÁC NHẬN thông tin quan trọng trước khi thực hiện
⚠ Cho phép nói lại, sửa lại
⚠ Câu trả lời NGẮN — người nghe không nhớ được danh sách dài
⚠ Đường thoát sang người thật ở MỌI bước
⚠ Với y tế ⚠ đường thoát là bắt buộc, không phải tuỳ chọn

Ba việc kiểm chứng: | Việc | Cách | |---|---| | Có xác nhận lại trước khi đặt lịch không | | | Người cao tuổi dùng được không | ⚠ thử với nhóm này | | Có đường chuyển sang người thật không | |

Và nguyên tắc thiết kế quan trọng nhất cho mọi hệ thống thoại tự động trong y tế: luôn có một phím bấm để gặp người thật. Không có nó, hệ thống sẽ trở thành rào cản thay vì tiện ích cho đúng những người cần giúp đỡ nhất.

Câu 79
Your company is developing a chatbot that needs to understand the context of user queries and generate appropriate responses. The development team is evaluating different neural network architectures and wants to use one that can process all words in a sentence simultaneously while understanding the relationships between words regardless of their position in the text. Which feature of the Transformer architecture makes it most suitable for this requirement?
  1. A Pooling layers that reduce the dimensionality of text representations
  2. B Self-attention mechanism that weighs the importance of different words in relation to each other
  3. C Recurrent connections that process one word at a time in sequence
  4. D Convolutional layers that extract features from sequential data
Xem giải thích

Đáp án

B — Cơ chế self-attention, cân nhắc mức độ quan trọng của các từ trong quan hệ với nhau.

Ghi nhớ về chất lượng câu hỏi

⚠ Câu này bổ sung cho #17925 ở lô trước.

Câu Hỏi gì
⚠ #17925 (lô 161) ⚠ ĐẶC ĐIỂM nào của Transformer phù hợp → xử lý song song
⚠ #17993 (câu này) ⚠ CƠ CHẾ nào cho phép xử lý song song → self-attention
⚠ Bổ sung nhau ⚠ một câu hỏi kết quả, một câu hỏi cơ chế

Vì sao đúng

⚠ Self-attention là trái tim của Transformer:

⚠ Câu: "Con mèo đuổi con chuột vì nó đói"
        ↓ ⚠ self-attention
⚠ Khi xử lý từ "nó", mô hình tính
   ⚠ mức liên quan với MỌI từ khác
        ↓
⚠ "nó" ← liên quan mạnh với "mèo"
        ↓
⚠ Hiểu đúng đại từ chỉ ai
Đặc điểm Nội dung
⚠ Mỗi từ "nhìn" mọi từ khác ⚠ cùng lúc, không tuần tự
⚠ Tính trọng số liên quan ⚠ attention weights
⚠ Song song hoá được trên GPU ⚠ hệ quả quan trọng nhất

Vì sao các phương án khác sai

  • C (kết nối hồi quy xử lý từng từ theo thứ tự) — ⚠ mô tả RNN/LSTM: ⚠ chính là thứ Transformer thay thế.

  • D (lớp tích chập trích đặc trưng từ dữ liệu tuần tự) — ⚠ mô tả CNN.

  • A (lớp pooling giảm chiều biểu diễn văn bản) — ⚠ pooling là thành phần phụ trợ, không phải cơ chế cốt lõi của Transformer.

Ghi nhớ

⚠ Ba kiến trúc mạng nơ-ron — bảng phải thuộc: | Kiến trúc | Cơ chế cốt lõi | Dùng cho | |---|---|---| | ⚠ CNN | ⚠ tích chập (convolution) | ⚠ ảnh | | ⚠ RNN / LSTM | ⚠ hồi quy, xử lý tuần tự | ⚠ chuỗi — nay ít dùng cho NLP | | ⚠ Transformer | ⚠ self-attention | ⚠ ngôn ngữ, và ngày càng nhiều lĩnh vực khác |

Từ khoá nhận diện:

"attention, cân trọng số giữa các từ" → ⚠ Transformer "xử lý tuần tự, ghi nhớ trạng thái" → ⚠ RNN/LSTM "tích chập, bộ lọc" → ⚠ CNN "xử lý song song toàn câu" → ⚠ Transformer

⚠ Vì sao self-attention là bước đột phá Lý do
⚠ Song song hoá được ⚠ huấn luyện nhanh hơn hàng chục lần
⚠ Nắm quan hệ giữa từ XA NHAU ⚠ RNN quên dần theo khoảng cách
⚠ Mở đường cho mô hình cực lớn
⚠ Nhờ đó ⚠ mô hình ngôn ngữ tăng quy mô hàng nghìn lần trong vài năm
⚠ Multi-head attention Khái niệm
⚠ Nhiều "đầu" attention chạy SONG SONG
⚠ Mỗi đầu học một loại quan hệ khác nhau ⚠ ngữ pháp, ngữ nghĩa, đại từ
⚠ Ghép kết quả lại
⚠ Ví như ⚠ nhiều người cùng đọc một câu, mỗi người chú ý một khía cạnh
⚠ Hạn chế của self-attention Hạn chế
⚠ Chi phí tăng theo BÌNH PHƯƠNG độ dài câu
⚠ Câu 2.000 từ tốn gấp 4 lần câu 1.000 từ
⚠ Giới hạn cửa sổ ngữ cảnh
⚠ Nghiên cứu hiện nay ⚠ tìm cách làm attention rẻ hơn cho ngữ cảnh dài

Ba việc kiểm chứng: | Việc | Cách | |---|---| | Cửa sổ ngữ cảnh của mô hình là bao nhiêu | | | Chi phí có tăng nhanh với văn bản dài không | ⚠ có, theo bình phương | | Có cần chia nhỏ tài liệu dài không | |

Và hệ quả thực tế của việc chi phí attention tăng theo bình phương: gửi một tài liệu dài vào prompt tốn hơn nhiều so với cảm giác trực quan. Đó cũng là lý do RAG chia nhỏ tài liệu thay vì đưa nguyên vẹn.

Câu 80
Your company has trained a machine learning model in Azure Machine Learning to predict customer churn. The data science team has tested multiple versions of the model and wants to make version 3 available to the production application while keeping previous versions accessible for comparison. What should you use to accomplish this?
  1. A Export the model file and upload it directly to Azure Blob Storage
  2. B Create a new workspace for each model version
  3. C Register the model in Azure Machine Learning and deploy version 3 to an endpoint
  4. D Create a new compute instance for each model version
Xem giải thích

Đáp án

C — Đăng ký mô hình trong Azure Machine Learning và triển khai phiên bản 3 lên một endpoint.

Ghi nhớ về chất lượng câu hỏi

⚠ Câu này GẦN TRÙNG với #17934 ở lô trước.

Câu Diễn đạt
⚠ #17934 (lô 161) ⚠ theo dõi phiên bản nào tốt nhất, đổi nhanh khi có sự cố
⚠ #17994 (câu này) ⚠ đưa phiên bản 3 lên sản xuất, giữ các phiên bản cũ để so sánh
⚠ Cùng khoá ⚠ model registry + endpoint

Vì sao đúng

⚠ Model registry giải đúng hai yêu cầu: | Yêu cầu | Registry | |---|---| | ⚠ Đưa phiên bản 3 lên sản xuất | ⚠ deploy version 3 tới endpoint | | ⚠ Giữ các phiên bản cũ để so sánh | ⚠ mọi phiên bản vẫn nằm trong registry |

⚠ Registry: churn-model
   ├── :1 — accuracy 0.82
   ├── :2 — accuracy 0.85
   └── :3 — accuracy 0.87 ← ⚠ triển khai
        ↓
⚠ Endpoint trỏ tới :3
⚠ Phiên bản 1 và 2 VẪN CÒN để so sánh
⚠ Đổi lại chỉ mất vài phút

Vì sao các phương án khác sai

  • A (xuất file mô hình và tải lên Blob Storage) — ⚠ mất hết metadata và lineage: ⚠ không biết mô hình huấn luyện từ dữ liệu nào; ⚠ triển khai thủ công dễ sai.

  • B (tạo workspace riêng cho từng phiên bản) — ⚠ cực kỳ cồng kềnh: ⚠ mất khả năng so sánh, ⚠ chi phí quản trị lớn.

  • D (tạo compute instance riêng cho từng phiên bản) — ⚠ nhầm khái niệm hoàn toàn: ⚠ compute instance là máy phát triển, ⚠ không phải nơi lưu mô hình.

Ghi nhớ

⚠ Model registry lưu gì — bảng phải thuộc: | Thông tin | Nội dung | |---|---| | ⚠ File mô hình | | | ⚠ Số phiên bản tự tăng | | | ⚠ Chỉ số hiệu năng | | | ⚠ Lineage | ⚠ dữ liệu nào, mã nào, thí nghiệm nào tạo ra | | ⚠ Môi trường chạy | ⚠ thư viện và phiên bản | | ⚠ Thẻ và mô tả | |

Từ khoá nhận diện:

"quản phiên bản mô hình, so sánh, quay lui" → ⚠ model registry "chép file thủ công" → ⚠ luôn là phương án sai "workspace riêng cho mỗi phiên bản" → ⚠ cồng kềnh, sai "compute instance" → ⚠ máy phát triển, không liên quan

⚠ Triển khai an toàn với managed endpoint Cách
⚠ Một endpoint, nhiều deployment
⚠ Chia lưu lượng theo phần trăm ⚠ 90% bản cũ, 10% bản mới
⚠ Theo dõi chỉ số của bản mới
⚠ Tăng dần hoặc rút về ngay
⚠ Đây là ⚠ canary deployment — giảm rủi ro đáng kể
⚠ Vì sao lineage quan trọng hơn ta tưởng Lý do
⚠ Sáu tháng sau: "mô hình này huấn luyện bằng dữ liệu nào?"
⚠ Kiểm toán đòi chứng minh nguồn gốc
⚠ Điều tra khi mô hình hoạt động sai
⚠ Dựng lại được kết quả
⚠ Không có lineage ⚠ mô hình thành hộp đen không ai dám sửa
⚠ Sau khi triển khai — vẫn còn việc Việc
⚠ Theo dõi data drift
⚠ Theo dõi chỉ số nghiệp vụ ⚠ quan trọng nhất
⚠ Lên lịch huấn luyện lại
⚠ Đặt tiêu chí khi nào cần quay lui

Ba việc kiểm chứng: | Việc | Cách | |---|---| | Quay lui một phiên bản mất bao lâu | ⚠ nên tính bằng phút | | Có biết mô hình đang chạy huấn luyện từ dữ liệu nào không | | | Có dùng canary deployment không | |

Và phép thử mức trưởng thành MLOps của một tổ chức, chỉ cần một câu hỏi: quay lui về phiên bản mô hình trước mất bao lâu?. Nếu câu trả lời là "phải huấn luyện lại", quy trình đó chưa sẵn sàng cho sản xuất.